音声クローニングStreaming API
音声クローニングStreaming APIは、参照音声、その正確な文字起こし、合成する テキストを1回のmultipart requestで受け取り、audio binary streamを返します。
API概要
| 項目 | 値 |
|---|---|
| Base URL | https://api.kitschlabs.com |
| 認証 | xi-api-key: <API_KEY> |
| Method | POST |
| Endpoint | /v1/voice-cloning/text-to-speech/stream |
| Content-Type | multipart/form-data |
| デフォルト出力 | mp3_44100_128 (audio/mpeg) |
| 追加出力 | wav_24000 (audio/wav) |
音声を生成するには?
参照音声とreference_textは正確に一致する必要があります。
curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech/stream?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=これは合成するテキストです。" \
--form "reference_text=これは参照音声の正確な文字起こしです。" \
--form "reference_audio=@reference.wav" \
--form "language_code=ja" \
--output speech.wav
どのフィールドを送信しますか?
| フィールド | 位置 | 型 | 必須 | 説明 |
|---|---|---|---|---|
text | form | string | はい | 合成するテキスト |
reference_text | form | string | はい | 参照音声で実際に話されている正確な文字起こし |
reference_audio | form | file | はい | WAV、MP3、FLAC、OGGファイル |
language_code | form | string | いいえ | en、ko、ja、zhのいずれか |
instruct | form | string | いいえ | 話し方に関する自然言語の指示 |
output_format | query | string | いいえ | mp3_44100_128またはwav_24000 |
参照音声は最大25 MiB、20秒まで対応します。reference_textにはtimestamp、
話者名、字幕記号、翻訳を含めず、実際に聞こえる発話だけを記述してください。
成功すると、選択したoutput_formatのaudio binary responseを返します。必須値、
参照音声、エラー処理の基準は音声クローニングAPIを
参照してください。