Aria — Natural
"Every model, every provider, one API key. That's what RunAPI gives you."
Texto a voz, clonación de voz, transcripción y efectos de sonido con ElevenLabs, Fish Audio, Google y el catálogo público de audio.
Ejemplos
"Every model, every provider, one API key. That's what RunAPI gives you."
"Generate video, music, images, and audio from a single integration."
"Switch between providers without changing a single line of code."
"Production-ready AI infrastructure with built-in failover and monitoring."
Stream natural speech from text with per-request voice and speed control.
Build a reusable voice from a short reference sample, then call it by id like any other voice.
Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.
Generate foley and sound effects from a description — impacts, ambience, UI cues.
Render multi-speaker conversations with distinct voices and natural turn timing in one call.
ElevenLabs
$0.12 / minute
ElevenLabs
$0.15 / minute
ElevenLabs
$0.04 / minute
ElevenLabs
$0.14 / 1K chars
ElevenLabs
$0.12 / 1K chars
ElevenLabs
$0.06 / 1K chars
curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
Una clave para todos los modelos de texto a voz y voz.
Explora las voces disponibles en los modelos de audio compatibles.
Envía el texto y la voz elegida a /api/v1/elevenlabs/text_to_speech.
Recibe el audio generado desde el resultado de la tarea.
Deja de gestionar claves de API. Una integración te da acceso a más de 200 modelos de todos los proveedores.
Nuestros acuerdos de volumen con proveedores ofrecen precios menores que contratar directamente, sin recargos.
Si un proveedor falla, dirigimos la solicitud a la siguiente mejor opción. Tu aplicación sigue activa.
Sustitución directa del SDK de OpenAI. Cambia una línea de código para acceder a cualquier modelo.
Paga solo por lo que usas. Precios por solicitud sin mínimos y seguimiento por modelo y proyecto.
Autentica las solicitudes a la API de audio con tu API key de RunAPI.
Combina TTS en streaming con un LLM y transcripción para crear un flujo de voz full duplex con una sola clave.
Dobla vídeos existentes a nuevos idiomas con una voz clonada que sigue siendo reconocible.
Transcribe con etiquetas de hablantes y resume después mediante el endpoint LLM en el mismo flujo.
Añade narración a artículos, documentos y contenido de tu aplicación sin una sesión de grabación.
| Función | RunAPI | ElevenLabs directo | OpenAI TTS |
|---|---|---|---|
| Modelos de voz | 32 modelos de audio | 1 proveedor | 6 voces |
| Precios | Desde $0.12 / minute | Tarifa oficial | Tarifa oficial |
| Streaming en tiempo real | Sí | Sí | No |
| Facturación unificada | Sí | No | No |
| Servidor MCP | Sí | No | No |
| Conmutación entre proveedores | Sí | No | No |
Por cada 1.000 caracteres de texto de entrada según la tarifa del modelo. La transcripción se factura por minuto de audio.
Sí. Sube una muestra de referencia para crear un voice id y luego pásalo en cualquier solicitud posterior.
El streaming depende del endpoint seleccionado. Consulta el formato de respuesta documentado antes de integrar la reproducción.
Los idiomas compatibles varían según el modelo. Consulta la documentación del modelo seleccionado.
El contenido de las solicitudes y respuestas puede conservarse. Consulta la política de privacidad para conocer el tratamiento de los datos.
La disponibilidad y precisión de las marcas de tiempo dependen del endpoint de transcripción. Consulta los campos de respuesta documentados; las etiquetas de hablante son una función independiente.
Voz, clonación y transcripción con una sola clave. Comienza gratis, sin tarjeta de crédito.