It looks like you may prefer a different language. Switch anytime.

Audio & Music Google

Gemini TTS API

Usa l'API Gemini TTS tramite RunAPI con model skill, autenticazione unificata e prezzi pay-as-you-go.

runapi.ai
curl -X POST https://runapi.ai/api/v1/gemini_tts/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.1-flash-tts",
  "text": "Genera l'introduzione di un podcast a due voci, con un conduttore britannico dal tono pacato e un ospite americano energico."
}'
import { GeminiTtsClient } from "@runapi.ai/gemini-tts";

const client = new GeminiTtsClient();
const result = await client.textToSpeech.run({
    model: "gemini-3.1-flash-tts",
    text: "Genera l'introduzione di un podcast a due voci, con un conduttore britannico dal tono pacato e un ospite americano energico.",
});
require "runapi/gemini_tts"

client = RunApi::GeminiTts::Client.new
result = client.text_to_speech.run(
    model: "gemini-3.1-flash-tts",
    text: "Genera l'introduzione di un podcast a due voci, con un conduttore britannico dal tono pacato e un ospite americano energico."
)
npx skills add runapi-ai/gemini-tts -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/gemini-tts v1
OVERVIEW

Informazioni su Gemini TTS

Gemini TTS trasforma un dialogo ordinato in audio, mantenendo una configurazione vocale distinta per ogni relatore. Le richieste possono inoltre definire la scena, il contesto interpretativo generale e la temperatura di campionamento.

Provider
Google
Modalità
Audio & Music

Confronta tutte le varianti API

Variante Fatturazione Prezzo
gemini-2.5-pro-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Visualizza →
gemini-3.1-flash-tts 1K tokens Input $1.40 / 1M tokens | Output $28.00 / 1M tokens Visualizza →
PRICING

Prezzi Gemini TTS

Endpoint Risoluzione Durata Prezzo
text_to_speech Input $1.40 / 1M tokens | Output $28.00 / 1M tokens

Prezzi mostrati per gemini-2.5-pro-tts. Le altre varianti mantengono i propri prezzi per endpoint.

Integrazione agenti

Esegui Gemini TTS da un agente

COME FUNZIONA

Inizia con Gemini TTS

  1. Scegli il modello

    Seleziona modello e variante adatti al tipo di output, al livello qualità e alla latenza target.

  2. Configura

    Imposta la tua chiave RunAPI e installa il model skill nel workspace di codice.

  3. Implementa

    Usa le istruzioni dello skill per aggiungere la feature modello dentro la tua applicazione.

  4. Ricevi

    Interroga per task ID, usa streaming dove supportato o gestisci il callback webhook.

CONTEXT

Che cos'è l'API Gemini TTS?

Gemini TTS fa parte del catalogo Google disponibile su RunAPI e rende accessibili Gemini 2.5 Pro TTS e Gemini 3.1 Flash TTS tramite interfacce API, SDK e CLI coerenti.

Provider
Google
Vedi tutto →
Modalità
Audio & Music
Sfoglia i modelli →

Perché usare l'API Gemini TTS tramite RunAPI

Un’unica autenticazione, tutti i provider

Una sola chiave RunAPI sblocca l’intero catalogo. Niente account separati, niente rotazione delle chiavi per integrazione.

Prezzi e billing unificati

Prezzi per chiamata in USD, fatturati mensilmente. Le generazioni fallite non vengono addebitate.

Skill con schema

Schema tipizzati e note di setup sono inclusi nel model skill, così l'implementazione parte dal contratto corretto.

Domande su Gemini TTS

Quali modelli Gemini TTS sono disponibili?

RunAPI supporta Gemini 2.5 Pro TTS e Gemini 3.1 Flash TTS tramite lo stesso endpoint di sintesi vocale e lo stesso formato di richiesta.

Come configuro più relatori?

Aggiungi una configurazione per ogni partecipante usando un identificatore univoco nel formato Speaker N, quindi assegna ogni battuta del dialogo a uno di questi identificatori.

Cosa posso controllare per ogni relatore?

Ogni relatore può avere voce, accento, stile di interpretazione e ritmo propri, oltre a un profilo audio facoltativo per ulteriori indicazioni vocali.

In che modo la scena e il contesto interpretativo influiscono sulla richiesta?

La scena descrive l'ambiente di registrazione, mentre il contesto interpretativo definisce il tono generale e le indicazioni per l'interpretazione del dialogo.

Come vengono restituiti i risultati audio completati?

Interroga il task o ricevi il callback al completamento; la risposta contiene l'elenco `audios` con l'URL del file generato.

Da quale variante dovrei iniziare?

Scegli la variante più economica che soddisfa il tuo livello di qualità. La maggior parte dei team inizia con la variante veloce e passa alla pro per la produzione.

MODELLI SIMILI

Se ti piace l'API Gemini TTS, prova questi

Inizia a sviluppare con l'API Gemini TTS.