Skip to main content
このドキュメントは英語の原文から自動翻訳されています。表現に不自然な箇所がある場合があります。正確な内容は英語の原文もあわせてご確認ください。
create_speech はテキストを完成したオーディオファイルに変換します。生成されたオーディオ全体がレスポンスボディに含まれて返されるため、そのまま保存または再生できます。 合成中のオーディオチャンクをストリーミングで受信したい場合(たとえば生成完了前に再生を開始したい場合)は、Stream speech をご利用ください。

基本的な使い方

リクエストフィールド

完全なスキーマについては Create speech (API リファレンス) をご覧ください。

出力フォーマット

output_format を省略すると、API はデフォルトで wav を使用します。同じオプションは Stream speech にも適用され、チャンクは指定されたフォーマットのバイナリで返されます。

レスポンス

デフォルトでは、API はレスポンスボディに バイナリオーディオ を返します。レスポンスには以下の 2 つの便利なヘッダーが付与されます。

include_phonemes=true の場合

音素タイムスタンプを有効にすると、レスポンスは JSON に切り替わり、Base64 エンコードされたオーディオペイロードと音素配列が並んで返されます。
完全な構造については Pronunciation and phonemes を参照してください。

結果の保存

ヒント

  • スタイルは重要です。 ボイスごとにデフォルトスタイルが異なる場合があります。style を明示的に指定するか、起動時に一度 Get voice を呼び出してボイスのデフォルトを取得してください。
  • 生成前に見積もりましょう。 predict_duration はクレジットを消費せずに想定されるオーディオ長を返します — UI ヒントやコスト試算に有用です。
  • 長いテキスト。 raw API は text を 300 文字までに制限しています。Python と TypeScript の SDK は自動で分割・生成・結合します — Long text を参照してください。
  • 空または極端に短い入力 は不自然な結果を生むことがあります。少なくとも完結した短い文を入力するようにしてください。

関連項目

モデルを選ぶ

高速モデルと高品質モデルから TTS モデルを選びます。

長いテキスト

300 文字を超えるテキストからオーディオを生成します。

Voice settings

ピッチ、抑揚、速度を調整します。

API リファレンス

リクエストとレスポンスの完全なスキーマ。