본문으로 건너뛰기

음성 복제 Streaming API

음성 복제 Streaming API는 참조 음성과 합성할 텍스트를 하나의 multipart request로 받아 audio binary stream을 반환합니다. 참조 음성의 transcript는 선택 사항입니다.

API 한눈에 보기​

항목값
Base URLhttps://api.kitschlabs.com
인증xi-api-key: <API_KEY>
MethodPOST
Endpoint/v1/voice-cloning/text-to-speech/stream
Content-Typemultipart/form-data
기본 출력mp3_44100_128 (audio/mpeg)
추가 출력wav_24000 (audio/wav)

음성을 생성하려면?​

reference_text를 제공한다면 참조 음성과 정확히 일치해야 합니다. 생략하거나 공백으로 보내면 서비스가 참조 음성을 자동으로 전사합니다.

curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech/stream?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=This is the text to synthesize." \
--form "reference_text=This is the exact reference transcript." \
--form "reference_audio=@reference.wav" \
--form "language_code=en" \
--output speech.wav

어떤 필드를 보내나요?​

필드위치타입필수설명
textformstring예합성할 텍스트
reference_textformstring아니요참조 음성의 정확한 transcript. 생략하면 자동 전사
reference_audioformfile예WAV, MP3, FLAC 또는 OGG 파일
language_codeformstring아니요en, ko, ja, zh 중 하나
instructformstring아니요말하기 방식에 대한 자연어 지시
output_formatquerystring아니요mp3_44100_128 또는 wav_24000

참조 음성은 최대 25 MiB, 20초까지 지원합니다. reference_text를 제공할 때는 timestamp, 화자명, 자막 기호나 번역을 넣지 말고 실제로 들리는 발화만 적으세요.

성공하면 선택한 output_format의 audio binary response를 반환합니다. 필수 값, 참조 음성과 오류 처리 기준은 음성 복제 API를 참고하세요.