현재 직접 지원되는 경로
Steam change notes는 대화 장면·Memory Book·world event 이미지를 Player2 only로 표시하고 NPC TTS도 Player2 지원을 명시합니다.[44] Player2 공식 API에는 image generation, TTS, streaming TTS, STT와 Joule 오류가 문서화돼 있습니다.[48]
| 기능 | 내장 경로 | 기본 상태 | 사용량 |
|---|---|---|---|
| 대화 장면 이미지 | Player2 | 꺼짐 | image generation Joules |
| Memory Book 삽화 | Player2 | 수동 선택 | image generation Joules |
| 세계 사건 이미지 | Player2 | 꺼짐 | image generation Joules |
| NPC 대사 TTS | Player2 | 선택 | text·voice별 Joules |
| 음성 입력/STT | Player2 | 선택 | speech-to-text Joules |
정확한 Joule 단가는 model·operation·정책에 따라 바뀝니다. 고정 호출 비용으로 단정하지 않습니다.
세 종류의 이미지 생성
대화 장면
MCM의 Prompt Settings → Dialogue Scene Images. 일반 Talk가 아니라 Talk (with scene image)에서 마지막 대화, 장소, 시간대, 계절을 바탕으로 생성합니다.
Memory Book
기억의 scene description과 등장인물 참조가 저장됩니다. Generate illustration로 필요한 기억만 수동 생성하거나 기존 그림을 재생성할 수 있습니다.
World Events
Dynamic Events 설정에서 별도로 켭니다. 호출량이 늘 수 있어 기본은 꺼짐입니다.
등장인물 참조
Memory image는 언급된 인물 최대 4명의 in-game portrait·appearance를 참조한다고 change notes가 안내합니다.
Player2의 POST /image/generate는 prompt, height, width를 받아 base64 image를 반환하고 인증 401·Joule 부족 402·content filter 403을 구분합니다.[48]
NPC 외형, 마지막 대화, 장소, 시간대, 계절이 prompt에 포함될 수 있습니다. 민감한 custom world data나 실명 기반 캐릭터가 있으면 image generation을 끄세요.
NPC 대사 TTS
AI Influence는 일반 NPC 대화·initiative·ambient conversation에서 음성 생성을 기다린 뒤 “NPC ready” 알림을 표시합니다.[44]
- NPC별 voice: Content Editor에서 캐릭터의 voice 정보를 확인합니다.
- Ambient TTS: 별도 toggle이며 끄면 진행 중 session의 추가 생성·재생도 중단됩니다.
- Full/stream: Player2 API는
/tts/speak와/tts/stream을 제공합니다. - Custom Inworld voice: Player2 문서상 active Patron subscription이 필요합니다.[48]
확인한 Player2 기본 voice_language 목록에는 ko_KR가 표시되지 않았습니다. 한국어 발음·숫자·고유명사를 짧게 시험하고 만족스럽지 않으면 text-only로 사용하세요.
음성 입력과 STT
change notes는 voice input이 group conversation 참가자를 자동 선택한다고 설명합니다. Player2 STT는 microphone audio를 WebSocket으로 전송해 text로 바꾸며 Joules를 소비합니다.[44][48]
- Windows microphone permission과 실제 input device를 확인합니다.
- 주변 대화가 섞일 수 있으므로 사용 중에만 microphone을 활성화합니다.
- 변환된 문장을 화면에서 확인한 뒤 전송합니다.
GPT·Grok 등 개인 구독 활용 판정
| 구독 | 소비자 앱 | 공식 CLI·구독 기능 | AI Influence 내장 media | 안전한 판정 |
|---|---|---|---|---|
| Claude Pro/Max | Voice mode·image 이해 | Claude Code text; 사진·삽화 생성은 미지원 | 직접 연결 없음 | image/TTS 불가 |
| ChatGPT Plus/Pro | image·Voice 포함 | Codex $imagegen은 구독량으로 공식 지원 | Player2 protocol 아님; TTS CLI 없음 | 수동 image만 공식 |
| Google AI plan | Gemini image·Live | Gemini CLI headless는 text/JSON 출력 | 공개 bridge는 text-only | 직접 사용 불가 |
| SuperGrok | image/video·voice 기능 | Grok Build는 coding agent | Player2 protocol 아님; TTS route 없음 | proxy image는 고위험 |
| Player2 | 자체 app/API | AI Influence가 직접 지원 | image·TTS·STT | 바로 사용 가능 |
Claude
Anthropic은 Claude가 업로드된 이미지를 분석할 수 있지만 사진·삽화를 직접 생성하지는 않는다고 설명합니다.[57] Voice mode는 Claude 앱 기능이며 Claude Code bridge에는 audio file을 반환하는 TTS route가 없습니다.[58]
ChatGPT·Codex
Plus에는 Voice와 image generation이 포함되지만 API usage는 별도입니다.[49] 예외적으로 Codex의 공식 $imagegen은 gpt-image-2로 이미지를 만들고 일반 Codex 구독 한도에서 차감됩니다.[52] 사람이 Codex에서 이미지를 만든 뒤 수동으로 쓰는 것은 공식 기능이지만, 이를 게임용 endpoint로 자동 재노출하는 것은 공식 통합이 아닙니다. Voice도 desktop app의 duplex 대화 기능이지 Player2식 TTS 파일 API가 아닙니다.[53]
Gemini
Gemini Apps의 image·Live와 Gemini CLI OAuth는 별개 표면입니다.[59][60] 공식 Gemini API에는 image generation과 TTS가 있지만 Developer API quota·billing 경로이며 개인 Google AI plan을 AI Influence endpoint로 바꾸지 않습니다.[61][62]
Grok
Grok plan에는 image/video creation과 Grok Build 자격이 표시되지만 xAI Developer API는 별도 prepaid/invoiced billing입니다.[64][68] xAI API 자체에는 image generation과 TTS가 있습니다.[65][66] 개인 plan 혜택이 일반 developer API credit이라는 뜻은 아닙니다.
최신 CLIProxyAPI에 image route가 있는데 왜 바로 못 쓰나
검토한 CLIProxyAPI source는 POST /v1/images/generations와 gpt-image-1.5, gpt-image-2, grok-imagine-image* routing을 구현합니다.[13] 그러나 AI Influence 내장 media가 요구하는 형식과 다릅니다.
| 계층 | 이미지 경로 | 응답 | TTS |
|---|---|---|---|
| Player2 / AI Influence 내장 | /v1/image/generate | {"image":"base64"} | /v1/tts/speak, /v1/tts/stream |
| CLIProxyAPI | /v1/images/generations | data[].b64_json 또는 URL | Player2 TTS route 없음 |
| GameMaster 현재판 | 구현 없음 | chat completion 중심 | 구현 없음 |
Codex/xAI OAuth token을 내부 backend에 replay하는 제3자 proxy는 공식 Images API 통합이 아니며 Player2 호환 adapter도 없습니다. protocol adapter를 새로 만들면 이미지 변환은 가능하지만, 구독을 제3자 game backend로 쓰는 정책·계정 위험 때문에 설치 절차로 권장하지 않습니다. 공식 개발자 Images/TTS API를 사용하면 별도 과금이지만 계약과 endpoint가 명확합니다.[24]
비용·latency·저장
| 항목 | 증가 원인 | 통제 방법 |
|---|---|---|
| Joules/API 비용 | 이미지, 긴 TTS, STT | 사용량 전후 비교, 기능 하나씩 활성화 |
| 응답 시간 | text + image + TTS 대기 | 일반 Talk 사용, 하나씩 꺼서 비교 |
| disk | Memory Book 삽화·audio/cache | campaign data 점검·backup |
| privacy | 대화·인물 외형·microphone 전송 | 필요할 때만 켜고 공유 전 [REDACTED] |
| content filter | 폭력·성적·민감 prompt | 403이면 우회하지 말고 설명 완화 |
권장 활성화 순서
Text-only baseline
Player2 대화 10회와 save/load를 먼저 확인합니다.
TTS 한 문장
한 NPC·짧은 한국어 문장으로 voice, output device, Joule 차감을 확인합니다.
대화 장면 한 번
일반 Talk와 Talk (with scene image)의 latency·비용·품질을 비교합니다.
Memory Book 수동 생성
자동 생성보다 필요한 기억만 만듭니다.
World event·ambient TTS
자동 호출 기능은 마지막에 켭니다.
빠른 문제 해결
| 증상 | 확인 |
|---|---|
| 이미지가 안 생김 | Player2 backend/app, image toggle, Talk (with scene image), Joules, 403 |
| TTS 무음 | TTS toggle, Windows output device·volume, voice ID, Joules, 한국어 voice |
| NPC ready가 늦음 | image/TTS를 하나씩 꺼서 원인 분리 |
| 402 | Joules 부족. 계정 회전 대신 app balance 확인 |
| 429 | ambient/자동 image를 끄고 retry 간격 확보 |
| 개인 구독 proxy image는 되는데 게임에 안 나옴 | OpenAI형 route와 Player2 route가 다름. 현재 직접 호환이 아님 |