Audio & Music · Google

Gemini TTS API

Accès à l’API Gemini TTS pour les dialogues multi-locuteurs, avec voix, accents, styles d’interprétation et rythmes configurables.

Opérationnel · 2 variants · à partir de $0.0014
runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "Créez l’introduction d’un podcast à deux voix, avec un animateur britannique posé et une invitée américaine énergique."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "Créez l’introduction d’un podcast à deux voix, avec un animateur britannique posé et une invitée américaine énergique.",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "Créez l’introduction d’un podcast à deux voix, avec un animateur britannique posé et une invitée américaine énergique."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
APERÇU

Gemini TTS convertit un dialogue ordonné en audio tout en conservant une configuration vocale propre à chaque locuteur. La requête peut aussi définir la scène, le contexte général d’interprétation et la température d’échantillonnage.

  • Variantes de modèle pour différents objectifs de qualité et de latence
  • API key unifiée
  • Le model skill inclut docs, schémas et notes de setup
  • Les générations échouées ne sont pas facturées
VARIANTES

Variantes

Variant Billing Pricing
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Voir →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Voir →
MODELS

Installez le skill Gemini TTS pour développer des apps

Chargez les docs du modèle, les schémas, les notes de tarifs et les étapes de setup dans votre workspace de code.

# Install the model skill for app development workflows
npx skills add runapi-ai/gemini-tts -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the Gemini TTS skill for this app:

1. Add runapi-ai/gemini-tts with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
FONCTIONNEMENT

Construire avec ce model skill

01

Choisir le modèle

Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.

02

S'authentifier une fois

Utilisez votre clé RunAPI pour tous les modèles pris en charge.

03

Installer le skill

Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.

04

Recevoir la sortie

Interrogez par task ID ou traitez le callback quand la génération se termine.

CONTEXTE

Où utiliser Gemini TTS

Gemini TTS fait partie du catalogue Google de RunAPI et donne accès à Gemini 2.5 Pro TTS et Gemini 3.1 Flash TTS via des interfaces cohérentes dans l’API, les SDK et la CLI.

Provider
Google
Modality
Audio & Music
POURQUOI RUNAPI

Pourquoi utiliser Gemini TTS via RunAPI

Une API key

Utilisez les mêmes identifiants pour les modèles et les fournisseurs.

Prêt pour les skills

Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.

Facturation prévisible

Les tarifs à l'usage sont visibles avant l'appel.

FAQ

Questions fréquentes

À quels modèles Gemini TTS puis-je accéder ?

RunAPI prend en charge Gemini 2.5 Pro TTS et Gemini 3.1 Flash TTS via le même endpoint de synthèse vocale et le même format de requête.

Comment configurer plusieurs locuteurs ?

Ajoutez une configuration pour chaque participant avec un identifiant `Speaker N` unique, puis associez chaque réplique du dialogue à l’un de ces identifiants.

Quels réglages sont disponibles pour chaque locuteur ?

Chaque locuteur dispose d’une voix, d’un accent, d’un style d’interprétation et d’un rythme, auxquels peut s’ajouter un profil audio pour affiner la direction vocale.

À quoi servent la scène et l’exemple de contexte ?

La scène décrit l’environnement d’enregistrement, tandis que l’exemple de contexte fixe le ton général et guide l’interprétation du dialogue.

Comment les résultats audio sont-ils renvoyés une fois la tâche terminée ?

Interrogez la tâche ou recevez son callback à la fin du traitement ; la réponse contient une liste `audios` avec l’URL du fichier généré.

Comment appeler ce modèle ?

Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.

Les générations échouées coûtent-elles quelque chose ?

Les générations échouées ne sont pas facturées

Puis-je l'appeler depuis mon application ?

Oui. Installez le model skill dans votre workspace de code et utilisez-le pendant l'ajout de la fonctionnalité.

COMMENCER

Commencez à construire avec Gemini TTS.