음성 복제 Streaming API
음성 복제 Streaming API는 참조 음성, 참조 음성의 정확한 transcript와 합성할 텍스트를 하나의 multipart request로 받아 audio binary stream을 반환합니다.
API 한눈에 보기
| 항목 | 값 |
|---|---|
| Base URL | https://api.kitschlabs.com |
| 인증 | xi-api-key: <API_KEY> |
| Method | POST |
| Endpoint | /v1/voice-cloning/text-to-speech/stream |
| Content-Type | multipart/form-data |
| 기본 출력 | mp3_44100_128 (audio/mpeg) |
| 추가 출력 | wav_24000 (audio/wav) |
음성을 생성하려면?
참조 음성과 reference_text가 정확히 일치해야 합니다.
curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech/stream?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=This is the text to synthesize." \
--form "reference_text=This is the exact reference transcript." \
--form "reference_audio=@reference.wav" \
--form "language_code=en" \
--output speech.wav
어떤 필드를 보내나요?
| 필드 | 위치 | 타입 | 필수 | 설명 |
|---|---|---|---|---|
text | form | string | 예 | 합성할 텍스트 |
reference_text | form | string | 예 | 참조 음성에서 실제로 말한 정확한 transcript |
reference_audio | form | file | 예 | WAV, MP3, FLAC 또는 OGG 파일 |
language_code | form | string | 아니요 | en, ko, ja, zh 중 하나 |
instruct | form | string | 아니요 | 말하기 방식에 대한 자연어 지시 |
output_format | query | string | 아니요 | mp3_44100_128 또는 wav_24000 |
참조 음성은 최대 25 MiB, 20초까지 지원합니다. reference_text에는 timestamp,
화자명, 자막 기호나 번역을 넣지 말고 실제로 들리는 발화만 적으세요.
성공하면 선택한 output_format의 audio binary response를 반환합니다. 필수 값,
참조 음성과 오류 처리 기준은 음성 복제 API를
참고하세요.