Una API key
Usa las mismas credenciales entre modelos y proveedores.
It looks like you may prefer a different language. Switch anytime.
Accede a la API de Gemini TTS a través de RunAPI con una habilidad de modelo, autenticación unificada y precios de pago por uso.
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-tts",
"text": "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";
const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
model: "gemini-3.1-flash-tts",
text: "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico.",
});
require "runapi/gemini_tts"
client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
model: "gemini-3.1-flash-tts",
text: "Genera una introducción de podcast para dos hablantes, con un presentador británico de tono tranquilo y un invitado estadounidense enérgico."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
Gemini TTS convierte una secuencia de diálogo en voz y mantiene una configuración de voz independiente para cada hablante. Las solicitudes también permiten definir la escena, el contexto general de la interpretación y la temperatura de muestreo.
| Endpoint | Resolución | Duración | Precio | |
|---|---|---|---|---|
| text_to_speech | — | — | Input $1.40 / 1M tokens | Output $28.00 / 1M tokens |
Precios mostrados para gemini-2.5-pro-tts. Otras variantes mantienen sus propios precios por endpoint.
Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.
Usa tu clave RunAPI para todos los modelos compatibles.
Añade el model skill a tu workspace de código antes de implementar la función.
Consulta por task ID o procesa el callback cuando termine la generación.
Gemini TTS forma parte del catálogo de Google en RunAPI y ofrece Gemini 2.5 Pro TTS y Gemini 3.1 Flash TTS mediante una interfaz coherente en la API, los SDK y la CLI.
Usa las mismas credenciales entre modelos y proveedores.
El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.
El precio por uso es visible antes de llamar.
RunAPI admite Gemini 2.5 Pro TTS y Gemini 3.1 Flash TTS mediante el mismo endpoint de texto a voz y el mismo formato de solicitud.
Añade una configuración para cada participante con un identificador Speaker N único y asigna después cada turno del diálogo a uno de esos identificadores.
Cada hablante puede tener su propia voz, acento, estilo de interpretación y ritmo, además de un perfil de audio opcional para dar indicaciones adicionales sobre la voz.
La escena describe el entorno de grabación, mientras que el contexto de muestra define el tono general y las pautas de interpretación del diálogo.
Consulta la tarea o recibe su callback cuando finalice; la respuesta contiene una lista llamada `audios` con la URL del archivo generado.
Instala el model skill y sigue sus notas de setup con tu clave RunAPI.