メインコンテンツまでスキップ

音声クローニングAPI

音声クローニングAPIは、参照音声、参照音声の正確な文字起こし、合成するテキストを 1回のmultipart requestで受け取り、音声を返します。

API概要

項目
Base URLhttps://api.kitschlabs.com
認証xi-api-key: <API_KEY>
MethodPOST
Endpoint/v1/voice-cloning/text-to-speech
Content-Typemultipart/form-data
デフォルト出力mp3_44100_128 (audio/mpeg)
追加出力wav_24000 (audio/wav)

どのように認証しますか?

発行されたAPIキーをxi-api-keyヘッダーに送信します。実際のキーはサーバーの 環境変数またはシークレット管理サービスに保存し、ブラウザ、アプリのバンドル、 ログに残さないでください。

xi-api-key: <API_KEY>

音声を生成するには?

参照音声とreference_textは正確に一致する必要があります。以下の例では、 参照ファイルと合成する文章を1回のリクエストで送信します。

curl --request POST \
"https://api.kitschlabs.com/v1/voice-cloning/text-to-speech?output_format=wav_24000" \
--header "xi-api-key: <API_KEY>" \
--form "text=これは合成するテキストです。" \
--form "reference_text=これは参照音声の正確な文字起こしです。" \
--form "reference_audio=@reference.wav" \
--form "language_code=ja" \
--output speech.wav

どのフィールドを送信しますか?

フィールド位置必須説明
textformstringはい合成するテキスト
reference_textformstringはい参照音声で実際に話されている正確な文字起こし
reference_audioformfileはいWAV、MP3、FLAC、OGGファイル
language_codeformstringいいえenkojazhのいずれか
instructformstringいいえ話し方に関する自然言語の指示
speedformnumberいいえ発話速度。0.25から4
output_formatquerystringいいえmp3_44100_128またはwav_24000

参照音声は最大25 MiB、20秒まで対応します。reference_textにはtimestamp、 話者名、字幕記号、翻訳を含めず、実際に聞こえる発話だけを記述してください。

参照音声はどのように準備しますか?

  • 1人が話すクリアなspeech-only clipを使用します。
  • 音楽、反響、背景の会話、強いnoiseを避けます。
  • clipの先頭や末尾で発話を切らないようにします。
  • 必要な発音とトーンが明確に含まれる部分を選びます。
  • 自分の音声、または明示的に使用許可を得た音声のみを使用します。
使用する権利のある音声のみを利用してください

同意なく他人の音声を複製したり、なりすまし、欺瞞、権利侵害を目的として 利用したりしないでください。

レスポンスとエラー

成功すると、選択したoutput_formatのaudio binaryを返します。レスポンスを ファイルに保存し、x-kitsch-request-idを運用ログに残してください。

ステータス意味推奨対応
400·422必須値、文字起こし、ファイル形式のエラーリクエスト値と参照音声を修正
401APIキーがない、または無効キーとxi-api-keyヘッダーを確認
402利用可能なcreditが不足請求の状態を確認
413参照音声のサイズ超過25 MiB以下にして再送信
429アカウントのリクエスト上限を超過Retry-Afterに従いbackoffを適用
5xx一時的なサーバーエラーrequest IDを記録し、回数を制限して再試行