Gemini TTS API
話者ごとに音声、アクセント、話し方、話速を設定できる、複数話者の会話音声向けGemini TTS APIにアクセスできます。
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-tts",
"text": "落ち着いたイギリス人のホストと快活なアメリカ人ゲストによる、2人の話者のポッドキャスト導入音声を生成してください。"
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";
const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
model: "gemini-3.1-flash-tts",
text: "落ち着いたイギリス人のホストと快活なアメリカ人ゲストによる、2人の話者のポッドキャスト導入音声を生成してください。",
});
require "runapi/gemini_tts"
client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
model: "gemini-3.1-flash-tts",
text: "落ち着いたイギリス人のホストと快活なアメリカ人ゲストによる、2人の話者のポッドキャスト導入音声を生成してください。"
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
Gemini TTSは、話者ごとに個別の音声設定を維持しながら、順番に並べた会話を音声に変換します。リクエストでは、シーン、会話全体の表現を指定するコンテキスト、サンプリング温度も設定できます。
- 品質とレイテンシ目標に合わせたモデルバリアント
- 統合 API key
- Model skill に docs、schema、セットアップメモを同梱
- 失敗した生成は課金されません
バリアント
アプリ開発用に Gemini TTS skill をインストール
モデル docs、schema、料金メモ、セットアップ手順をコード作業環境に読み込みます。
# Install the model skill for app development workflows
npx skills add runapi-ai/gemini-tts -g
Install the Gemini TTS skill for this app: 1. Add runapi-ai/gemini-tts with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
この model skill で構築する方法
モデルを選ぶ
出力タイプ、品質基準、レイテンシ目標に合うモデルとバリアントを選びます。
一度だけ認証
対応するすべてのモデルに RunAPI key を使います。
skill をインストール
機能実装の前に model skill をコード作業環境へ追加します。
出力を受け取る
task ID でポーリングするか、生成完了時の callback を処理します。
Gemini TTS の位置づけ
Gemini TTSはRunAPIのGoogleモデルカタログに含まれ、Gemini 2.5 Pro TTSとGemini 3.1 Flash TTSを共通のAPI、SDK、CLIインターフェースから利用できます。
RunAPI 経由で Gemini TTS を使う理由
1つの API key
モデルやプロバイダーをまたいで同じ認証情報を使えます。
Skill-ready
model skill に schema、セットアップメモ、料金コンテキスト、モデル ID が含まれます。
予測しやすい請求
呼び出し前に従量料金を確認できます。
よくある質問
どのGemini TTSモデルを利用できますか?
RunAPIは、同じテキスト読み上げエンドポイントとリクエスト形式でGemini 2.5 Pro TTSとGemini 3.1 Flash TTSに対応しています。
複数の話者を設定するにはどうすればよいですか?
一意のSpeaker N識別子を使って参加者ごとに話者設定を追加し、会話の各発話をいずれかの識別子に割り当てます。
話者ごとに何を調整できますか?
話者ごとに音声、アクセント、話し方、話速を設定でき、音声表現をさらに指定するオプションのオーディオプロファイルも追加できます。
シーンとサンプルコンテキストはリクエストにどう影響しますか?
シーンは収録環境を表し、サンプルコンテキストは会話全体のトーンと話し方の指針を設定します。
生成が完了した音声はどのように返されますか?
完了後にタスクを照会するか、コールバックを受信します。レスポンスのaudiosリストには、生成されたファイルのURLが含まれます。
このモデルはどう呼び出しますか?
model skill をインストールし、RunAPI key とセットアップメモに従ってください。
失敗した生成は課金されますか?
失敗した生成は課金されません
アプリケーションから呼び出せますか?
はい。コード作業環境に model skill をインストールし、モデル機能を追加するときに利用してください。