メインコンテンツまでスキップ

音声クローニングStreaming API

音声クローニングStreaming APIは、参照音声と合成するテキストを1回のmultipart requestで受け取り、audio binary streamを返します。参照音声の文字起こしは任意です。

API概要​

項目値
Base URLhttps://api.kitschlabs.com
認証xi-api-key: <API_KEY>
MethodPOST
Endpoint/v1/voice-cloning/text-to-speech/stream
Content-Typemultipart/form-data
デフォルト出力mp3_44100_128 (audio/mpeg)
追加出力wav_24000 (audio/wav)

音声を生成するには?​

reference_textを指定する場合は、参照音声と正確に一致する必要があります。 省略するか空白にすると、サービスが参照音声を自動的に文字起こしします。

curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech/stream?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=これは合成するテキストです。" \
--form "reference_text=これは参照音声の正確な文字起こしです。" \
--form "reference_audio=@reference.wav" \
--form "language_code=ja" \
--output speech.wav

どのフィールドを送信しますか?​

フィールド位置型必須説明
textformstringはい合成するテキスト
reference_textformstringいいえ参照音声の正確な文字起こし。省略時は自動文字起こし
reference_audioformfileはいWAV、MP3、FLAC、OGGファイル
language_codeformstringいいえen、ko、ja、zhのいずれか
instructformstringいいえ話し方に関する自然言語の指示
output_formatquerystringいいえmp3_44100_128またはwav_24000

参照音声は最大25 MiB、20秒まで対応します。reference_textを指定する場合は、 timestamp、話者名、字幕記号、翻訳を含めず、実際に聞こえる発話だけを記述してください。

成功すると、選択したoutput_formatのaudio binary responseを返します。必須値、 参照音声、エラー処理の基準は音声クローニングAPIを 参照してください。