Audio & Music · Google

Gemini TTS API

Acceso a la API de Gemini TTS para diálogos con múltiples hablantes y voces, acentos, estilos de interpretación y ritmo configurables.

Operativo · 2 variants · desde $0.0014
runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico.",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
RESUMEN

Gemini TTS convierte una secuencia de diálogo en voz y mantiene una configuración de voz independiente para cada hablante. Las solicitudes también permiten definir la escena, el contexto general de la interpretación y la temperatura de muestreo.

  • Variantes para distintos objetivos de calidad y latencia
  • API key unificada
  • El model skill incluye documentación, schemas y notas de setup
  • Las generaciones fallidas no se cobran
VARIANTES

Variantes

Variant Billing Pricing
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Ver →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Ver →
MODELS

Instala el skill de Gemini TTS para desarrollar apps

Carga documentación del modelo, schemas, notas de precios y pasos de setup en tu workspace de código.

# Install the model skill for app development workflows
npx skills add runapi-ai/gemini-tts -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the Gemini TTS skill for this app:

1. Add runapi-ai/gemini-tts with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
CÓMO FUNCIONA

Cómo construir con este model skill

01

Elige el modelo

Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.

02

Autentica una vez

Usa tu clave RunAPI para todos los modelos compatibles.

03

Instala el skill

Añade el model skill a tu workspace de código antes de implementar la función.

04

Recibe la salida

Consulta por task ID o procesa el callback cuando termine la generación.

CONTEXTO

Dónde encaja Gemini TTS

Gemini TTS forma parte del catálogo de Google en RunAPI y ofrece Gemini 2.5 Pro TTS y Gemini 3.1 Flash TTS mediante una interfaz coherente en la API, los SDK y la CLI.

Provider
Google
Modality
Audio & Music
POR QUÉ RUNAPI

Por qué usar Gemini TTS mediante RunAPI

Una API key

Usa las mismas credenciales entre modelos y proveedores.

Listo para skills

El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.

Facturación predecible

El precio por uso es visible antes de llamar.

FAQ

Preguntas frecuentes

¿Qué modelos de Gemini TTS están disponibles?

RunAPI admite Gemini 2.5 Pro TTS y Gemini 3.1 Flash TTS mediante el mismo endpoint de texto a voz y el mismo formato de solicitud.

¿Cómo configuro varios hablantes?

Añade una configuración para cada participante con un identificador Speaker N único y asigna después cada turno del diálogo a uno de esos identificadores.

¿Qué puedo controlar para cada hablante?

Cada hablante puede tener su propia voz, acento, estilo de interpretación y ritmo, además de un perfil de audio opcional para dar indicaciones adicionales sobre la voz.

¿Cómo afectan la escena y el contexto de muestra a la solicitud?

La escena describe el entorno de grabación, mientras que el contexto de muestra define el tono general y las pautas de interpretación del diálogo.

¿Cómo se devuelven los resultados de audio una vez completados?

Consulta la tarea o recibe su callback cuando finalice; la respuesta contiene una lista llamada `audios` con la URL del archivo generado.

¿Cómo llamo a este modelo?

Instala el model skill y sigue sus notas de setup con tu clave RunAPI.

¿Las generaciones fallidas cuestan dinero?

Las generaciones fallidas no se cobran

¿Puedo llamarlo desde mi aplicación?

Sí. Instala el model skill en tu workspace de código y úsalo mientras añades la función del modelo.

EMPEZAR

Empieza a construir con Gemini TTS.