メインコンテンツまでスキップ

音声クローニングStreaming API

音声クローニングStreaming APIは、参照音声、その正確な文字起こし、合成する テキストを1回のmultipart requestで受け取り、audio binary streamを返します。

API概要

項目
Base URLhttps://api.kitschlabs.com
認証xi-api-key: <API_KEY>
MethodPOST
Endpoint/v1/voice-cloning/text-to-speech/stream
Content-Typemultipart/form-data
デフォルト出力mp3_44100_128 (audio/mpeg)
追加出力wav_24000 (audio/wav)

音声を生成するには?

参照音声とreference_textは正確に一致する必要があります。

curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech/stream?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=これは合成するテキストです。" \
--form "reference_text=これは参照音声の正確な文字起こしです。" \
--form "reference_audio=@reference.wav" \
--form "language_code=ja" \
--output speech.wav

どのフィールドを送信しますか?

フィールド位置必須説明
textformstringはい合成するテキスト
reference_textformstringはい参照音声で実際に話されている正確な文字起こし
reference_audioformfileはいWAV、MP3、FLAC、OGGファイル
language_codeformstringいいえenkojazhのいずれか
instructformstringいいえ話し方に関する自然言語の指示
output_formatquerystringいいえmp3_44100_128またはwav_24000

参照音声は最大25 MiB、20秒まで対応します。reference_textにはtimestamp、 話者名、字幕記号、翻訳を含めず、実際に聞こえる発話だけを記述してください。

成功すると、選択したoutput_formatのaudio binary responseを返します。必須値、 参照音声、エラー処理の基準は音声クローニングAPIを 参照してください。