API audio

API audio et voix IA

Synthèse vocale, clonage de voix, transcription et effets sonores avec ElevenLabs, Fish Audio, Google et le catalogue audio public.

32 modèles audio · points de terminaison audio publics
32
Modèles audio
6
Fournisseurs
89
Points de terminaison publics
Playground en direct
Modèle
Texte
Votre prochain rendu audio commence ici. Choisissez un modèle public pour consulter son prix actuel et les détails du point de terminaison.
Voix Voix par défaut
Format mp3
Vitesse 1.0x
Mode text_to_speech

Exemples

Écoutez les voix

Aria — Natural

"Every model, every provider, one API key. That's what RunAPI gives you."

Miles — Narration

"Generate video, music, images, and audio from a single integration."

Nova — Conversational

"Switch between providers without changing a single line of code."

Kai — Broadcast

"Production-ready AI infrastructure with built-in failover and monitoring."

Tout ce que l'endpoint audio peut faire

Text to Speech

Stream natural speech from text with per-request voice and speed control.

Voice Cloning

Build a reusable voice from a short reference sample, then call it by id like any other voice.

Speech to Text

Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.

Text to Sound

Generate foley and sound effects from a description — impacts, ambience, UI cues.

Text to Dialogue

Render multi-speaker conversations with distinct voices and natural turn timing in one call.

Audio models on one key

ElevenLabs/audio-isolation

ElevenLabs

$0.12 / minute

ElevenLabs/sound-effect-v2

ElevenLabs

$0.15 / minute

ElevenLabs/speech-to-text

ElevenLabs

$0.04 / minute

ElevenLabs/text-to-dialogue-v3

ElevenLabs

$0.14 / 1K chars

ElevenLabs/text-to-speech-multilingual-v2

ElevenLabs

$0.12 / 1K chars

ElevenLabs/text-to-speech-turbo-v2.5

ElevenLabs

$0.06 / 1K chars

View all 32 audio models
Démarrage rapide

Synthétiser la parole

curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
Comment ça marche

Quatre étapes jusqu'à votre première génération

  1. Obtenir votre clé API

    Une clé pour tous les modèles de synthèse vocale et de voix.

  2. Choisir une voix

    Parcourez les voix disponibles dans les modèles audio pris en charge.

  3. Envoyer le texte

    Envoyez votre texte et votre voix à /api/v1/elevenlabs/text_to_speech.

  4. Obtenir l'audio

    Recevez l'audio généré depuis le résultat de la tâche.

Pourquoi les développeurs choisissent RunAPI

Une clé, tous les modèles

Ne jonglez plus entre les clés API. Une intégration donne accès à plus de 200 modèles de tous les fournisseurs.

15-25 % d'économies

Nos accords de volume avec les fournisseurs permettent des prix inférieurs au direct, sans majoration.

Basculement automatique

Si un fournisseur tombe en panne, nous basculons vers la meilleure option suivante. Votre application reste active.

Compatible OpenAI

Remplacement direct du SDK OpenAI. Changez une ligne de code pour accéder à n'importe quel modèle.

Facturation en temps réel

Payez uniquement ce que vous utilisez. Prix par requête sans minimum, avec suivi par modèle et par projet.

Authentification par clé API

Authentifiez les requêtes à l'API audio avec votre clé API RunAPI.

Ce que les équipes créent avec cette API

Agents vocaux

Associez la synthèse vocale en streaming à un LLM et à la transcription pour créer une boucle vocale full duplex avec une seule clé.

Localisation

Doublez une vidéo existante dans de nouvelles langues avec une voix clonée qui reste reconnaissable.

Notes de réunion

Transcrivez avec les noms des intervenants, puis résumez via le point de terminaison LLM dans le même pipeline.

Accessibilité

Ajoutez une narration aux articles, aux documents et au contenu intégré à l'application sans session d'enregistrement.

RunAPI face aux alternatives

Fonctionnalité RunAPI ElevenLabs direct OpenAI TTS
Modèles vocaux 32 modèles audio 1 fournisseur 6 voix
Tarifs À partir de $0.12 / minute Tarif officiel Tarif officiel
Streaming en temps réel Oui Oui Non
Facturation unifiée Oui Non Non
Serveur MCP Oui Non Non
Basculement de fournisseur Oui Non Non

Questions sur l'API audio

Comment la synthèse vocale est-elle facturée ?

Par tranche de 1 000 caractères de texte en entrée au tarif du modèle. La transcription est facturée à la minute d'audio.

Puis-je cloner une voix ?

Oui. Téléversez un échantillon de référence pour créer un voice id, puis transmettez cet identifiant dans toute requête ultérieure.

Le streaming est-il pris en charge ?

La prise en charge du streaming dépend du point de terminaison choisi. Consultez le format de réponse documenté avant d'intégrer la lecture.

Quelles langues sont prises en charge ?

Les langues prises en charge varient selon le modèle. Consultez la documentation du modèle choisi.

Conservez-vous les fichiers audio ou les échantillons vocaux ?

Le contenu des requêtes et des réponses peut être conservé. Consultez la politique de confidentialité pour les détails du traitement des données.

Puis-je obtenir des horodatages au niveau des mots ?

La disponibilité et la précision des horodatages dépendent du point de terminaison de transcription. Consultez les champs de réponse documentés ; les étiquettes de locuteur sont une fonctionnalité distincte.

Donnez une voix à votre produit

Synthèse vocale, clonage et transcription derrière une seule clé. Démarrez gratuitement, sans carte bancaire.

Connectez-vous pour générer

Créez une clé API pour exécuter des requêtes audio avec votre compte.