It looks like you may prefer a different language. Switch anytime.

Audio & Music Google

Gemini TTS API

Accede a la API de Gemini TTS a través de RunAPI con una habilidad de modelo, autenticación unificada y precios de pago por uso.

runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico.",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
RESUMEN

Acerca de Gemini TTS

Gemini TTS convierte una secuencia de diálogo en voz y mantiene una configuración de voz independiente para cada hablante. Las solicitudes también permiten definir la escena, el contexto general de la interpretación y la temperatura de muestreo.

Proveedor
Google
Modalidad
Audio & Music

Variantes

Variante Facturación Precios
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Ver →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Ver →
PRECIOS

Precios de Gemini TTS

Endpoint Resolución Duración Precio
text_to_speech Input $1.40 / 1M tokens | Output $28.00 / 1M tokens

Precios mostrados para gemini-2.5-pro-tts. Otras variantes mantienen sus propios precios por endpoint.

Integración de agentes

Ejecuta Gemini TTS desde un agente

CÓMO FUNCIONA

Empieza con Gemini TTS

  1. Elige el modelo

    Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.

  2. Autentica una vez

    Usa tu clave RunAPI para todos los modelos compatibles.

  3. Instala el skill

    Añade el model skill a tu workspace de código antes de implementar la función.

  4. Recibe la salida

    Consulta por task ID o procesa el callback cuando termine la generación.

CONTEXTO

Dónde encaja Gemini TTS

Gemini TTS forma parte del catálogo de Google en RunAPI y ofrece Gemini 2.5 Pro TTS y Gemini 3.1 Flash TTS mediante una interfaz coherente en la API, los SDK y la CLI.

Proveedor
Google
Ver todo →
Modalidad
Audio & Music
Explorar modelos →

Por qué usar Gemini TTS mediante RunAPI

Una API key

Usa las mismas credenciales entre modelos y proveedores.

Listo para skills

El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.

Facturación predecible

El precio por uso es visible antes de llamar.

Preguntas sobre Gemini TTS

¿Qué modelos de Gemini TTS están disponibles?

RunAPI admite Gemini 2.5 Pro TTS y Gemini 3.1 Flash TTS mediante el mismo endpoint de texto a voz y el mismo formato de solicitud.

¿Cómo configuro varios hablantes?

Añade una configuración para cada participante con un identificador Speaker N único y asigna después cada turno del diálogo a uno de esos identificadores.

¿Qué puedo controlar para cada hablante?

Cada hablante puede tener su propia voz, acento, estilo de interpretación y ritmo, además de un perfil de audio opcional para dar indicaciones adicionales sobre la voz.

¿Cómo afectan la escena y el contexto de muestra a la solicitud?

La escena describe el entorno de grabación, mientras que el contexto de muestra define el tono general y las pautas de interpretación del diálogo.

¿Cómo se devuelven los resultados de audio una vez completados?

Consulta la tarea o recibe su callback cuando finalice; la respuesta contiene una lista llamada `audios` con la URL del archivo generado.

¿Cómo llamo a este modelo?

Instala el model skill y sigue sus notas de setup con tu clave RunAPI.

MODELOS SIMILARES

Modelos similares a Gemini TTS

Empieza a construir con Gemini TTS.