04 · Image & voice

이미지 생성과 음성

대화 장면·Memory Book·세계 사건 이미지를 만들고 NPC 대사를 음성으로 듣는 기능입니다. 소비자 앱 기능과 게임에서 호출 가능한 endpoint를 분리해 판정합니다.

공식 문서·현재 source 기준 2026-08-22 KST

현재 직접 지원되는 경로

AI Influence 6.0.2 내장 미디어 기능은 Player2 경로입니다

Steam change notes는 대화 장면·Memory Book·world event 이미지를 Player2 only로 표시하고 NPC TTS도 Player2 지원을 명시합니다.[44] Player2 공식 API에는 image generation, TTS, streaming TTS, STT와 Joule 오류가 문서화돼 있습니다.[48]

기능내장 경로기본 상태사용량
대화 장면 이미지Player2꺼짐image generation Joules
Memory Book 삽화Player2수동 선택image generation Joules
세계 사건 이미지Player2꺼짐image generation Joules
NPC 대사 TTSPlayer2선택text·voice별 Joules
음성 입력/STTPlayer2선택speech-to-text Joules

정확한 Joule 단가는 model·operation·정책에 따라 바뀝니다. 고정 호출 비용으로 단정하지 않습니다.

Player2 only

세 종류의 이미지 생성

대화 장면

MCM의 Prompt Settings → Dialogue Scene Images. 일반 Talk가 아니라 Talk (with scene image)에서 마지막 대화, 장소, 시간대, 계절을 바탕으로 생성합니다.

Memory Book

기억의 scene description과 등장인물 참조가 저장됩니다. Generate illustration로 필요한 기억만 수동 생성하거나 기존 그림을 재생성할 수 있습니다.

World Events

Dynamic Events 설정에서 별도로 켭니다. 호출량이 늘 수 있어 기본은 꺼짐입니다.

등장인물 참조

Memory image는 언급된 인물 최대 4명의 in-game portrait·appearance를 참조한다고 change notes가 안내합니다.

Player2의 POST /image/generateprompt, height, width를 받아 base64 image를 반환하고 인증 401·Joule 부족 402·content filter 403을 구분합니다.[48]

장면 정보가 cloud로 전송됩니다

NPC 외형, 마지막 대화, 장소, 시간대, 계절이 prompt에 포함될 수 있습니다. 민감한 custom world data나 실명 기반 캐릭터가 있으면 image generation을 끄세요.

Player2

NPC 대사 TTS

AI Influence는 일반 NPC 대화·initiative·ambient conversation에서 음성 생성을 기다린 뒤 “NPC ready” 알림을 표시합니다.[44]

  • NPC별 voice: Content Editor에서 캐릭터의 voice 정보를 확인합니다.
  • Ambient TTS: 별도 toggle이며 끄면 진행 중 session의 추가 생성·재생도 중단됩니다.
  • Full/stream: Player2 API는 /tts/speak/tts/stream을 제공합니다.
  • Custom Inworld voice: Player2 문서상 active Patron subscription이 필요합니다.[48]
한국어 음질은 한 문장으로 먼저 시험

확인한 Player2 기본 voice_language 목록에는 ko_KR가 표시되지 않았습니다. 한국어 발음·숫자·고유명사를 짧게 시험하고 만족스럽지 않으면 text-only로 사용하세요.

음성 입력과 STT

change notes는 voice input이 group conversation 참가자를 자동 선택한다고 설명합니다. Player2 STT는 microphone audio를 WebSocket으로 전송해 text로 바꾸며 Joules를 소비합니다.[44][48]

  • Windows microphone permission과 실제 input device를 확인합니다.
  • 주변 대화가 섞일 수 있으므로 사용 중에만 microphone을 활성화합니다.
  • 변환된 문장을 화면에서 확인한 뒤 전송합니다.

GPT·Grok 등 개인 구독 활용 판정

구독소비자 앱공식 CLI·구독 기능AI Influence 내장 media안전한 판정
Claude Pro/MaxVoice mode·image 이해Claude Code text; 사진·삽화 생성은 미지원직접 연결 없음image/TTS 불가
ChatGPT Plus/Proimage·Voice 포함Codex $imagegen은 구독량으로 공식 지원Player2 protocol 아님; TTS CLI 없음수동 image만 공식
Google AI planGemini image·LiveGemini CLI headless는 text/JSON 출력공개 bridge는 text-only직접 사용 불가
SuperGrokimage/video·voice 기능Grok Build는 coding agentPlayer2 protocol 아님; TTS route 없음proxy image는 고위험
Player2자체 app/APIAI Influence가 직접 지원image·TTS·STT바로 사용 가능

Claude

Anthropic은 Claude가 업로드된 이미지를 분석할 수 있지만 사진·삽화를 직접 생성하지는 않는다고 설명합니다.[57] Voice mode는 Claude 앱 기능이며 Claude Code bridge에는 audio file을 반환하는 TTS route가 없습니다.[58]

ChatGPT·Codex

Plus에는 Voice와 image generation이 포함되지만 API usage는 별도입니다.[49] 예외적으로 Codex의 공식 $imagegengpt-image-2로 이미지를 만들고 일반 Codex 구독 한도에서 차감됩니다.[52] 사람이 Codex에서 이미지를 만든 뒤 수동으로 쓰는 것은 공식 기능이지만, 이를 게임용 endpoint로 자동 재노출하는 것은 공식 통합이 아닙니다. Voice도 desktop app의 duplex 대화 기능이지 Player2식 TTS 파일 API가 아닙니다.[53]

Gemini

Gemini Apps의 image·Live와 Gemini CLI OAuth는 별개 표면입니다.[59][60] 공식 Gemini API에는 image generation과 TTS가 있지만 Developer API quota·billing 경로이며 개인 Google AI plan을 AI Influence endpoint로 바꾸지 않습니다.[61][62]

Grok

Grok plan에는 image/video creation과 Grok Build 자격이 표시되지만 xAI Developer API는 별도 prepaid/invoiced billing입니다.[64][68] xAI API 자체에는 image generation과 TTS가 있습니다.[65][66] 개인 plan 혜택이 일반 developer API credit이라는 뜻은 아닙니다.

최신 CLIProxyAPI에 image route가 있는데 왜 바로 못 쓰나

검토한 CLIProxyAPI source는 POST /v1/images/generationsgpt-image-1.5, gpt-image-2, grok-imagine-image* routing을 구현합니다.[13] 그러나 AI Influence 내장 media가 요구하는 형식과 다릅니다.

계층이미지 경로응답TTS
Player2 / AI Influence 내장/v1/image/generate{"image":"base64"}/v1/tts/speak, /v1/tts/stream
CLIProxyAPI/v1/images/generationsdata[].b64_json 또는 URLPlayer2 TTS route 없음
GameMaster 현재판구현 없음chat completion 중심구현 없음
기술 데모와 권장 경로를 구분

Codex/xAI OAuth token을 내부 backend에 replay하는 제3자 proxy는 공식 Images API 통합이 아니며 Player2 호환 adapter도 없습니다. protocol adapter를 새로 만들면 이미지 변환은 가능하지만, 구독을 제3자 game backend로 쓰는 정책·계정 위험 때문에 설치 절차로 권장하지 않습니다. 공식 개발자 Images/TTS API를 사용하면 별도 과금이지만 계약과 endpoint가 명확합니다.[24]

비용·latency·저장

항목증가 원인통제 방법
Joules/API 비용이미지, 긴 TTS, STT사용량 전후 비교, 기능 하나씩 활성화
응답 시간text + image + TTS 대기일반 Talk 사용, 하나씩 꺼서 비교
diskMemory Book 삽화·audio/cachecampaign data 점검·backup
privacy대화·인물 외형·microphone 전송필요할 때만 켜고 공유 전 [REDACTED]
content filter폭력·성적·민감 prompt403이면 우회하지 말고 설명 완화

권장 활성화 순서

Text-only baseline

Player2 대화 10회와 save/load를 먼저 확인합니다.

TTS 한 문장

한 NPC·짧은 한국어 문장으로 voice, output device, Joule 차감을 확인합니다.

대화 장면 한 번

일반 Talk와 Talk (with scene image)의 latency·비용·품질을 비교합니다.

Memory Book 수동 생성

자동 생성보다 필요한 기억만 만듭니다.

World event·ambient TTS

자동 호출 기능은 마지막에 켭니다.

빠른 문제 해결

증상확인
이미지가 안 생김Player2 backend/app, image toggle, Talk (with scene image), Joules, 403
TTS 무음TTS toggle, Windows output device·volume, voice ID, Joules, 한국어 voice
NPC ready가 늦음image/TTS를 하나씩 꺼서 원인 분리
402Joules 부족. 계정 회전 대신 app balance 확인
429ambient/자동 image를 끄고 retry 간격 확보
개인 구독 proxy image는 되는데 게임에 안 나옴OpenAI형 route와 Player2 route가 다름. 현재 직접 호환이 아님