Gemini TTS API
Accès à l’API Gemini TTS pour les dialogues multi-locuteurs, avec voix, accents, styles d’interprétation et rythmes configurables.
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-tts",
"text": "Créez l’introduction d’un podcast à deux voix, avec un animateur britannique posé et une invitée américaine énergique."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";
const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
model: "gemini-3.1-flash-tts",
text: "Créez l’introduction d’un podcast à deux voix, avec un animateur britannique posé et une invitée américaine énergique.",
});
require "runapi/gemini_tts"
client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
model: "gemini-3.1-flash-tts",
text: "Créez l’introduction d’un podcast à deux voix, avec un animateur britannique posé et une invitée américaine énergique."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
Gemini TTS convertit un dialogue ordonné en audio tout en conservant une configuration vocale propre à chaque locuteur. La requête peut aussi définir la scène, le contexte général d’interprétation et la température d’échantillonnage.
- Variantes de modèle pour différents objectifs de qualité et de latence
- API key unifiée
- Le model skill inclut docs, schémas et notes de setup
- Les générations échouées ne sont pas facturées
Variantes
Installez le skill Gemini TTS pour développer des apps
Chargez les docs du modèle, les schémas, les notes de tarifs et les étapes de setup dans votre workspace de code.
# Install the model skill for app development workflows
npx skills add runapi-ai/gemini-tts -g
Install the Gemini TTS skill for this app: 1. Add runapi-ai/gemini-tts with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
Construire avec ce model skill
Choisir le modèle
Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.
S'authentifier une fois
Utilisez votre clé RunAPI pour tous les modèles pris en charge.
Installer le skill
Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.
Recevoir la sortie
Interrogez par task ID ou traitez le callback quand la génération se termine.
Où utiliser Gemini TTS
Gemini TTS fait partie du catalogue Google de RunAPI et donne accès à Gemini 2.5 Pro TTS et Gemini 3.1 Flash TTS via des interfaces cohérentes dans l’API, les SDK et la CLI.
Pourquoi utiliser Gemini TTS via RunAPI
Une API key
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Prêt pour les skills
Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.
Facturation prévisible
Les tarifs à l'usage sont visibles avant l'appel.
Questions fréquentes
À quels modèles Gemini TTS puis-je accéder ?
RunAPI prend en charge Gemini 2.5 Pro TTS et Gemini 3.1 Flash TTS via le même endpoint de synthèse vocale et le même format de requête.
Comment configurer plusieurs locuteurs ?
Ajoutez une configuration pour chaque participant avec un identifiant `Speaker N` unique, puis associez chaque réplique du dialogue à l’un de ces identifiants.
Quels réglages sont disponibles pour chaque locuteur ?
Chaque locuteur dispose d’une voix, d’un accent, d’un style d’interprétation et d’un rythme, auxquels peut s’ajouter un profil audio pour affiner la direction vocale.
À quoi servent la scène et l’exemple de contexte ?
La scène décrit l’environnement d’enregistrement, tandis que l’exemple de contexte fixe le ton général et guide l’interprétation du dialogue.
Comment les résultats audio sont-ils renvoyés une fois la tâche terminée ?
Interrogez la tâche ou recevez son callback à la fin du traitement ; la réponse contient une liste `audios` avec l’URL du fichier généré.
Comment appeler ce modèle ?
Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.
Les générations échouées coûtent-elles quelque chose ?
Les générations échouées ne sont pas facturées
Puis-je l'appeler depuis mon application ?
Oui. Installez le model skill dans votre workspace de code et utilisez-le pendant l'ajout de la fonctionnalité.