API de áudio

API de áudio e voz com IA

Texto para fala, clonagem de voz, transcrição e efeitos sonoros com ElevenLabs, Fish Audio, Google e o catálogo público de áudio.

32 modelos de áudio · endpoints públicos de áudio
32
Modelos de áudio
6
Provedores
89
Endpoints públicos
Playground ao vivo
Modelo
Texto
Sua próxima geração de áudio começa aqui. Escolha um modelo público para consultar o preço atual e os detalhes do endpoint.
Voz Voz padrão
Formato mp3
Velocidade 1.0x
Modo text_to_speech

Exemplos

Ouça as Vozes

Aria — Natural

"Every model, every provider, one API key. That's what RunAPI gives you."

Miles — Narration

"Generate video, music, images, and audio from a single integration."

Nova — Conversational

"Switch between providers without changing a single line of code."

Kai — Broadcast

"Production-ready AI infrastructure with built-in failover and monitoring."

Tudo que o endpoint de áudio pode fazer

Text to Speech

Stream natural speech from text with per-request voice and speed control.

Voice Cloning

Build a reusable voice from a short reference sample, then call it by id like any other voice.

Speech to Text

Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.

Text to Sound

Generate foley and sound effects from a description — impacts, ambience, UI cues.

Text to Dialogue

Render multi-speaker conversations with distinct voices and natural turn timing in one call.

Audio models on one key

ElevenLabs/audio-isolation

ElevenLabs

$0.12 / minute

ElevenLabs/sound-effect-v2

ElevenLabs

$0.15 / minute

ElevenLabs/speech-to-text

ElevenLabs

$0.04 / minute

ElevenLabs/text-to-dialogue-v3

ElevenLabs

$0.14 / 1K chars

ElevenLabs/text-to-speech-multilingual-v2

ElevenLabs

$0.12 / 1K chars

ElevenLabs/text-to-speech-turbo-v2.5

ElevenLabs

$0.06 / 1K chars

View all 32 audio models
Início rápido

Sintetizar fala

curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
Como funciona

Quatro passos até sua primeira geração

  1. Obtenha sua chave de API

    Uma chave para todos os modelos de TTS e voz.

  2. Escolha uma voz

    Explore as vozes disponíveis nos modelos de áudio compatíveis.

  3. Envie o texto

    Envie seu texto e a voz escolhida para /api/v1/elevenlabs/text_to_speech.

  4. Obtenha o áudio

    Receba o áudio gerado a partir do resultado da tarefa.

Por que desenvolvedores escolhem a RunAPI

Uma chave, todos os modelos

Pare de alternar entre chaves de API. Uma integração dá acesso a mais de 200 modelos de todos os provedores.

15-25% de economia

Nossos acordos de volume com provedores oferecem preços menores que os diretos, sem margem adicional.

Failover automático

Se um provedor cair, roteamos para a próxima melhor opção. Seu aplicativo continua no ar.

Compatível com OpenAI

Substituição direta do SDK da OpenAI. Altere uma linha de código para acessar qualquer modelo.

Cobrança em tempo real

Pague apenas pelo que usar. Preços por solicitação sem mínimos e custos por modelo e projeto.

Autenticação com chave API

Autentique solicitações à API de áudio com sua chave API RunAPI.

O que as equipes criam com isso

Agentes de voz

Combine TTS em streaming com um LLM e transcrição para criar um loop de voz full duplex com uma única chave.

Localização

Duble vídeos existentes em novos idiomas com uma voz clonada que continua reconhecível.

Notas de reunião

Transcreva com rótulos de locutor e depois resuma pelo endpoint LLM na mesma pipeline.

Acessibilidade

Adicione narração a artigos, documentos e conteúdo no aplicativo sem uma sessão de gravação.

RunAPI vs alternativas

Recurso RunAPI ElevenLabs direto OpenAI TTS
Modelos de voz 32 modelos de áudio 1 provedor 6 vozes
Preços A partir de $0.12 / minute Preço oficial Preço oficial
Streaming em tempo real Sim Sim Não
Cobrança unificada Sim Não Não
Servidor MCP Sim Não Não
Failover de provedor Sim Não Não

Dúvidas sobre a API de áudio

Como o TTS é cobrado?

Por 1.000 caracteres de texto de entrada, à taxa do modelo. A transcrição é cobrada por minuto de áudio.

Posso clonar uma voz?

Sim. Envie uma amostra de referência para criar um voice id e depois passe esse id em qualquer requisição futura.

Streaming é suportado?

O suporte a streaming depende do endpoint selecionado. Consulte o formato de resposta documentado antes de integrar a reprodução.

Quais idiomas são suportados?

Os idiomas suportados variam conforme o modelo. Consulte a documentação do modelo selecionado.

Vocês armazenam áudios ou amostras de voz?

O conteúdo das requisições e respostas pode ser armazenado. Consulte a política de privacidade para detalhes sobre o tratamento dos dados.

Posso obter timestamps por palavra?

O suporte e a precisão dos timestamps dependem do endpoint de transcrição. Consulte os campos de resposta documentados; os rótulos de locutor são um recurso separado.

Dê uma voz ao seu produto

Síntese, clonagem e transcrição com uma única chave. Comece grátis, sem cartão de crédito.

Entre para gerar

Crie uma chave de API para executar solicitações de áudio na sua conta.