Audio & Music · Google

Gemini TTS API

Acesso à API do Gemini TTS para diálogos com vários locutores e vozes, sotaques, estilos de fala e ritmo configuráveis.

Operacional · 2 variants · a partir de $0.0014
runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "Gere a abertura de um podcast com dois locutores, usando um apresentador britânico de voz calma e um convidado americano enérgico."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "Gere a abertura de um podcast com dois locutores, usando um apresentador britânico de voz calma e um convidado americano enérgico.",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "Gere a abertura de um podcast com dois locutores, usando um apresentador britânico de voz calma e um convidado americano enérgico."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
VISÃO GERAL

Gemini TTS transforma um diálogo ordenado em fala e preserva uma configuração de voz distinta para cada locutor. As requisições também podem definir a cena, o contexto geral de interpretação e a temperatura de amostragem.

  • Variantes para diferentes metas de qualidade e latência
  • API key unificada
  • O model skill inclui documentação, schemas e notas de setup
  • Gerações com falha não são cobradas
VARIANTES

Variantes

Variant Billing Pricing
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Ver →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Ver →
MODELS

Instale o skill Gemini TTS para desenvolver apps

Carregue documentação do modelo, schemas, notas de preço e etapas de setup no seu workspace de código.

# Install the model skill for app development workflows
npx skills add runapi-ai/gemini-tts -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the Gemini TTS skill for this app:

1. Add runapi-ai/gemini-tts with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
COMO FUNCIONA

Como construir com este model skill

01

Escolha o modelo

Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.

02

Autentique uma vez

Use sua chave RunAPI para todos os modelos compatíveis.

03

Instale o skill

Adicione o model skill ao workspace de código antes de implementar a funcionalidade.

04

Receba a saída

Consulte por task ID ou trate o callback quando a geração terminar.

CONTEXTO

Onde Gemini TTS se encaixa

Gemini TTS faz parte do catálogo do Google no RunAPI e disponibiliza Gemini 2.5 Pro TTS e Gemini 3.1 Flash TTS em uma interface consistente para API, SDK e CLI.

Provider
Google
Modality
Audio & Music
POR QUE RUNAPI

Por que usar Gemini TTS pela RunAPI

Uma API key

Use as mesmas credenciais entre modelos e provedores.

Pronto para skills

O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.

Cobrança previsível

O preço por uso fica visível antes da chamada.

FAQ

Perguntas frequentes

Quais modelos Gemini TTS estão disponíveis?

O RunAPI oferece Gemini 2.5 Pro TTS e Gemini 3.1 Flash TTS pelo mesmo endpoint de text-to-speech e com o mesmo formato de requisição.

Como configuro vários locutores?

Adicione uma configuração de locutor para cada participante com um identificador Speaker N exclusivo e associe cada fala do diálogo a um desses identificadores.

O que posso controlar para cada locutor?

Cada locutor tem voz, sotaque, estilo de fala e ritmo, além de um perfil de áudio opcional para instruções de voz adicionais.

Como a cena e o contexto da amostra afetam a requisição?

A cena descreve o ambiente de gravação, enquanto o contexto da amostra define o tom geral e as orientações de interpretação do diálogo.

Como recebo os resultados de áudio concluídos?

Consulte a tarefa ou aguarde o callback após a conclusão. A resposta contém a lista `audios`, que inclui a URL do arquivo gerado.

Como chamo este modelo?

Instale o model skill e siga as notas de setup com sua chave RunAPI.

Gerações com falha custam dinheiro?

Gerações com falha não são cobradas

Posso chamar a partir da minha aplicação?

Sim. Instale o model skill no workspace de código e use durante a implementação da funcionalidade.

COMEÇAR

Comece a construir com Gemini TTS.