본문으로 건너뛰기

음성 복제 Streaming API

음성 복제 Streaming API는 참조 음성, 참조 음성의 정확한 transcript와 합성할 텍스트를 하나의 multipart request로 받아 audio binary stream을 반환합니다.

API 한눈에 보기

항목
Base URLhttps://api.kitschlabs.com
인증xi-api-key: <API_KEY>
MethodPOST
Endpoint/v1/voice-cloning/text-to-speech/stream
Content-Typemultipart/form-data
기본 출력mp3_44100_128 (audio/mpeg)
추가 출력wav_24000 (audio/wav)

음성을 생성하려면?

참조 음성과 reference_text가 정확히 일치해야 합니다.

curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech/stream?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=This is the text to synthesize." \
--form "reference_text=This is the exact reference transcript." \
--form "reference_audio=@reference.wav" \
--form "language_code=en" \
--output speech.wav

어떤 필드를 보내나요?

필드위치타입필수설명
textformstring합성할 텍스트
reference_textformstring참조 음성에서 실제로 말한 정확한 transcript
reference_audioformfileWAV, MP3, FLAC 또는 OGG 파일
language_codeformstring아니요en, ko, ja, zh 중 하나
instructformstring아니요말하기 방식에 대한 자연어 지시
output_formatquerystring아니요mp3_44100_128 또는 wav_24000

참조 음성은 최대 25 MiB, 20초까지 지원합니다. reference_text에는 timestamp, 화자명, 자막 기호나 번역을 넣지 말고 실제로 들리는 발화만 적으세요.

성공하면 선택한 output_format의 audio binary response를 반환합니다. 필수 값, 참조 음성과 오류 처리 기준은 음성 복제 API를 참고하세요.