It looks like you may prefer a different language. Switch anytime.

Audio & Music Google

Gemini TTS API

RunAPIのモデルスキル、統合認証、従量課金制の料金でGemini TTS APIを利用できます。

runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "落ち着いたイギリス人のホストと快活なアメリカ人ゲストによる、2人の話者のポッドキャスト導入音声を生成してください。"
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "落ち着いたイギリス人のホストと快活なアメリカ人ゲストによる、2人の話者のポッドキャスト導入音声を生成してください。",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "落ち着いたイギリス人のホストと快活なアメリカ人ゲストによる、2人の話者のポッドキャスト導入音声を生成してください。"
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
概要

Gemini TTS について

Gemini TTSは、話者ごとに個別の音声設定を維持しながら、順番に並べた会話を音声に変換します。リクエストでは、シーン、会話全体の表現を指定するコンテキスト、サンプリング温度も設定できます。

プロバイダー
Google
モダリティ
Audio & Music

バリアント

バリアント 請求 料金
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens 見る →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens 見る →
料金

Gemini TTS の料金

Endpoint 解像度 価格
text_to_speech Input $1.40 / 1M tokens | Output $28.00 / 1M tokens

gemini-2.5-pro-tts の料金を表示しています。他のバリアントはそれぞれの endpoint 料金が適用されます。

エージェント連携

エージェントから Gemini TTS を実行

仕組み

Gemini TTS を始める

  1. モデルを選ぶ

    出力タイプ、品質基準、レイテンシ目標に合うモデルとバリアントを選びます。

  2. 一度だけ認証

    対応するすべてのモデルに RunAPI key を使います。

  3. skill をインストール

    機能実装の前に model skill をコード作業環境へ追加します。

  4. 出力を受け取る

    task ID でポーリングするか、生成完了時の callback を処理します。

背景

Gemini TTS の位置づけ

Gemini TTSはRunAPIのGoogleモデルカタログに含まれ、Gemini 2.5 Pro TTSとGemini 3.1 Flash TTSを共通のAPI、SDK、CLIインターフェースから利用できます。

プロバイダー
Google
すべて見る →
モダリティ
Audio & Music
モデルを見る →

RunAPI 経由で Gemini TTS を使う理由

1つの API key

モデルやプロバイダーをまたいで同じ認証情報を使えます。

Skill-ready

model skill に schema、セットアップメモ、料金コンテキスト、モデル ID が含まれます。

予測しやすい請求

呼び出し前に従量料金を確認できます。

Gemini TTS に関するよくある質問

どのGemini TTSモデルを利用できますか?

RunAPIは、同じテキスト読み上げエンドポイントとリクエスト形式でGemini 2.5 Pro TTSとGemini 3.1 Flash TTSに対応しています。

複数の話者を設定するにはどうすればよいですか?

一意のSpeaker N識別子を使って参加者ごとに話者設定を追加し、会話の各発話をいずれかの識別子に割り当てます。

話者ごとに何を調整できますか?

話者ごとに音声、アクセント、話し方、話速を設定でき、音声表現をさらに指定するオプションのオーディオプロファイルも追加できます。

シーンとサンプルコンテキストはリクエストにどう影響しますか?

シーンは収録環境を表し、サンプルコンテキストは会話全体のトーンと話し方の指針を設定します。

生成が完了した音声はどのように返されますか?

完了後にタスクを照会するか、コールバックを受信します。レスポンスのaudiosリストには、生成されたファイルのURLが含まれます。

このモデルはどう呼び出しますか?

model skill をインストールし、RunAPI key とセットアップメモに従ってください。

類似モデル

Gemini TTS に近いモデル

Gemini TTS で構築を開始。