API de audio

API de audio y voz con IA

Texto a voz, clonación de voz, transcripción y efectos de sonido con ElevenLabs, Fish Audio, Google y el catálogo público de audio.

32 modelos de audio · endpoints públicos de audio
32
Modelos de audio
6
Proveedores
89
Endpoints públicos
Playground en vivo
Modelo
Texto
Tu próximo audio empieza aquí. Elige un modelo público para consultar su precio actual y los detalles del endpoint.
Voz Voz predeterminada
Formato mp3
Velocidad 1.0x
Modo text_to_speech

Ejemplos

Escucha las voces

Aria — Natural

"Every model, every provider, one API key. That's what RunAPI gives you."

Miles — Narration

"Generate video, music, images, and audio from a single integration."

Nova — Conversational

"Switch between providers without changing a single line of code."

Kai — Broadcast

"Production-ready AI infrastructure with built-in failover and monitoring."

Todo lo que puede hacer el endpoint de audio

Text to Speech

Stream natural speech from text with per-request voice and speed control.

Voice Cloning

Build a reusable voice from a short reference sample, then call it by id like any other voice.

Speech to Text

Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.

Text to Sound

Generate foley and sound effects from a description — impacts, ambience, UI cues.

Text to Dialogue

Render multi-speaker conversations with distinct voices and natural turn timing in one call.

Audio models on one key

ElevenLabs/audio-isolation

ElevenLabs

$0.12 / minute

ElevenLabs/sound-effect-v2

ElevenLabs

$0.15 / minute

ElevenLabs/speech-to-text

ElevenLabs

$0.04 / minute

ElevenLabs/text-to-dialogue-v3

ElevenLabs

$0.14 / 1K chars

ElevenLabs/text-to-speech-multilingual-v2

ElevenLabs

$0.12 / 1K chars

ElevenLabs/text-to-speech-turbo-v2.5

ElevenLabs

$0.06 / 1K chars

View all 32 audio models
Inicio rápido

Sintetizar voz

curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
Cómo funciona

Cuatro pasos para tu primera generación

  1. Obtén tu clave API

    Una clave para todos los modelos de texto a voz y voz.

  2. Elige una voz

    Explora las voces disponibles en los modelos de audio compatibles.

  3. Envía el texto

    Envía el texto y la voz elegida a /api/v1/elevenlabs/text_to_speech.

  4. Obtén el audio

    Recibe el audio generado desde el resultado de la tarea.

Por qué los desarrolladores eligen RunAPI

Una clave, todos los modelos

Deja de gestionar claves de API. Una integración te da acceso a más de 200 modelos de todos los proveedores.

15-25% de ahorro

Nuestros acuerdos de volumen con proveedores ofrecen precios menores que contratar directamente, sin recargos.

Failover automático

Si un proveedor falla, dirigimos la solicitud a la siguiente mejor opción. Tu aplicación sigue activa.

Compatible con OpenAI

Sustitución directa del SDK de OpenAI. Cambia una línea de código para acceder a cualquier modelo.

Facturación en tiempo real

Paga solo por lo que usas. Precios por solicitud sin mínimos y seguimiento por modelo y proyecto.

Autenticación con API key

Autentica las solicitudes a la API de audio con tu API key de RunAPI.

Lo que crean los equipos con ella

Agentes de voz

Combina TTS en streaming con un LLM y transcripción para crear un flujo de voz full duplex con una sola clave.

Localización

Dobla vídeos existentes a nuevos idiomas con una voz clonada que sigue siendo reconocible.

Notas de reuniones

Transcribe con etiquetas de hablantes y resume después mediante el endpoint LLM en el mismo flujo.

Accesibilidad

Añade narración a artículos, documentos y contenido de tu aplicación sin una sesión de grabación.

RunAPI frente a las alternativas

Función RunAPI ElevenLabs directo OpenAI TTS
Modelos de voz 32 modelos de audio 1 proveedor 6 voces
Precios Desde $0.12 / minute Tarifa oficial Tarifa oficial
Streaming en tiempo real No
Facturación unificada No No
Servidor MCP No No
Conmutación entre proveedores No No

Preguntas sobre la API de audio

¿Cómo se factura el TTS?

Por cada 1.000 caracteres de texto de entrada según la tarifa del modelo. La transcripción se factura por minuto de audio.

¿Puedo clonar una voz?

Sí. Sube una muestra de referencia para crear un voice id y luego pásalo en cualquier solicitud posterior.

¿Se admite streaming?

El streaming depende del endpoint seleccionado. Consulta el formato de respuesta documentado antes de integrar la reproducción.

¿Qué idiomas están disponibles?

Los idiomas compatibles varían según el modelo. Consulta la documentación del modelo seleccionado.

¿Almacenan el audio o las muestras de voz?

El contenido de las solicitudes y respuestas puede conservarse. Consulta la política de privacidad para conocer el tratamiento de los datos.

¿Puedo obtener marcas de tiempo a nivel de palabra?

La disponibilidad y precisión de las marcas de tiempo dependen del endpoint de transcripción. Consulta los campos de respuesta documentados; las etiquetas de hablante son una función independiente.

Dale voz a tu producto

Voz, clonación y transcripción con una sola clave. Comienza gratis, sin tarjeta de crédito.

Inicia sesión para generar

Crea una clave API para ejecutar solicitudes de audio desde tu cuenta.