It looks like you may prefer a different language. Switch anytime.

Audio & Music Google

Gemini TTS API

透過 RunAPI 使用 Gemini TTS API,包含 model skill、統一驗證與按用量計費。

runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "生成一段雙講者 podcast 開場,由語氣沉穩嘅英國主持同充滿活力嘅美國嘉賓對談。"
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "生成一段雙講者 podcast 開場,由語氣沉穩嘅英國主持同充滿活力嘅美國嘉賓對談。",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "生成一段雙講者 podcast 開場,由語氣沉穩嘅英國主持同充滿活力嘅美國嘉賓對談。"
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
OVERVIEW

關於 Gemini TTS

Gemini TTS 會按順序將對話轉成語音,並為每位講者保留獨立聲線設定。request 亦可設定場景、整體演繹 context 同 sampling temperature。

供應商
Google
模式
Audio & Music

比較所有 API 變體

變體 計費 定價
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens 查看 →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens 查看 →
PRICING

Gemini TTS 定價

Endpoint 解析度 時長 價格
text_to_speech Input $1.40 / 1M tokens | Output $28.00 / 1M tokens

以下為 gemini-2.5-pro-tts 的定價。其他變體保留各自的 endpoint 定價。

Agent 整合

透過 Agent 執行 Gemini TTS

運作方式

開始使用 Gemini TTS

  1. 選擇模型

    挑選符合輸出類型、品質門檻與延遲目標的模型與變體。

  2. 設定

    設定 RunAPI key,並在 coding workspace 安裝 model skill。

  3. 開發

    使用 skill 指引,在你的 app 內加入模型功能。

  4. 接收

    透過 task ID 查詢、在支援時串流,或處理 webhook callback。

CONTEXT

Gemini TTS API 是甚麼?

Gemini TTS 係 RunAPI Google 目錄嘅一部分,透過一致嘅 API、SDK 同 CLI 介面提供 Gemini 2.5 Pro TTS 同 Gemini 3.1 Flash TTS。

供應商
Google
查看全部 →
模式
Audio & Music
瀏覽模型 →

為何透過 RunAPI 使用 Gemini TTS API

一個驗證,對應所有 provider

一組 RunAPI key 即可解鎖整個 catalog。無需分開帳戶,亦無需為每個整合輪換密鑰。

統一定價與計費

按次以 USD 收費,每月結算。失敗的生成不會收費。

內含 schema 的 skill

型別化 schema 與 setup 備註打包在 model skill 內,讓實作從正確契約開始。

Gemini TTS 常見問題

Gemini TTS 有邊啲 model?

RunAPI 透過相同文字轉語音 endpoint 同 request shape 支援 Gemini 2.5 Pro TTS 同 Gemini 3.1 Flash TTS。

點樣設定多位講者?

為每位參與者加入講者設定,使用唯一嘅 Speaker N identifier,再將每個對話輪次指派畀其中一個 identifier。

每位講者有咩可以控制?

每位講者都可以設定聲線、口音、演繹風格同語速,亦可加入 audio profile 提供額外聲線指引。

scene 同 sample context 會點樣影響 request?

scene 描述錄音環境;sample context 就設定成段對話嘅整體語調同演繹指引。

完成嘅音訊結果會點樣回傳?

任務完成後查詢 task 或接收 callback;response 嘅 audios list 會包含生成檔案 URL。

我應該先用邊個版本?

先選最平而且符合你質素要求的版本。大多數團隊會先用快速版本,之後再升級到 pro 用於正式生產。

相似模型

如果你鍾意 Gemini TTS API,可以試吓呢些

開始用 Gemini TTS API 開發。