Audio-API

KI-Audio- und Sprach-API

Text-to-Speech, Stimmenklonen, Transkription und Soundeffekte mit ElevenLabs, Fish Audio, Google und dem öffentlichen Audio-Katalog.

32 Audio-Modelle · öffentliche Audio-Endpunkte
32
Audio-Modelle
6
Anbieter
89
Öffentliche Endpunkte
Playground live
Modell
Text
Dein nächstes Audio beginnt hier. Wähle ein öffentliches Modell, um den aktuellen Preis und die Endpunktdetails zu prüfen.
Stimme Standardstimme
Format mp3
Geschwindigkeit 1.0x
Modus text_to_speech

Beispiele

Die Stimmen hören

Aria — Natural

"Every model, every provider, one API key. That's what RunAPI gives you."

Miles — Narration

"Generate video, music, images, and audio from a single integration."

Nova — Conversational

"Switch between providers without changing a single line of code."

Kai — Broadcast

"Production-ready AI infrastructure with built-in failover and monitoring."

Alles, was der Audio-Endpoint kann

Text to Speech

Stream natural speech from text with per-request voice and speed control.

Voice Cloning

Build a reusable voice from a short reference sample, then call it by id like any other voice.

Speech to Text

Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.

Text to Sound

Generate foley and sound effects from a description — impacts, ambience, UI cues.

Text to Dialogue

Render multi-speaker conversations with distinct voices and natural turn timing in one call.

Audio models on one key

ElevenLabs/audio-isolation

ElevenLabs

$0.12 / minute

ElevenLabs/sound-effect-v2

ElevenLabs

$0.15 / minute

ElevenLabs/speech-to-text

ElevenLabs

$0.04 / minute

ElevenLabs/text-to-dialogue-v3

ElevenLabs

$0.14 / 1K chars

ElevenLabs/text-to-speech-multilingual-v2

ElevenLabs

$0.12 / 1K chars

ElevenLabs/text-to-speech-turbo-v2.5

ElevenLabs

$0.06 / 1K chars

View all 32 audio models
Schnellstart

Sprache synthetisieren

curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
So funktioniert es

In vier Schritten zur ersten Generierung

  1. API-Schlüssel abrufen

    Ein Schlüssel für alle TTS- und Sprachmodelle.

  2. Stimme auswählen

    Verfügbare Stimmen für unterstützte Audiomodelle durchsuchen.

  3. Text senden

    Text und Stimmauswahl an /api/v1/elevenlabs/text_to_speech senden.

  4. Audio erhalten

    Das erzeugte Audio aus dem Aufgabenergebnis erhalten.

Warum Entwickler RunAPI wählen

Ein Schlüssel, alle Modelle

Verwalte nicht länger viele API-Schlüssel. Eine Integration bietet Zugriff auf über 200 Modelle aller Anbieter.

15-25% Kostenersparnis

Unsere Mengenvereinbarungen mit Anbietern ermöglichen niedrigere Preise als beim Direktbezug, ohne Aufschlag.

Automatisches Failover

Wenn ein Anbieter ausfällt, leiten wir an die nächstbeste Option weiter. Deine App bleibt verfügbar.

OpenAI-kompatibel

Direkter Ersatz für das OpenAI SDK. Ändere eine Zeile Code und greife auf jedes Modell zu.

Abrechnung in Echtzeit

Bezahle nur, was du nutzt. Abrechnung pro Anfrage ohne Mindestvolumen, mit Kostenübersicht je Modell und Projekt.

API-Key-Authentifizierung

Authentifiziere Audio-API-Anfragen mit deinem RunAPI-API-Key.

Was Teams damit entwickeln

Sprachagenten

Verbinde Streaming-TTS mit einem LLM und Transkription zu einer vollständig bidirektionalen Sprachschleife mit einem Schlüssel.

Lokalisierung

Vertone vorhandene Videos in neuen Sprachen mit einer geklonten Stimme, die erkennbar bleibt.

Meeting-Notizen

Transkribiere mit Sprecherkennzeichnung und fasse anschließend über den LLM-Endpunkt in derselben Pipeline zusammen.

Barrierefreiheit

Füge Artikeln, Dokumenten und Inhalten in deiner App ohne Aufnahmesitzung eine Sprachspur hinzu.

RunAPI im Vergleich zu Alternativen

Funktion RunAPI ElevenLabs direkt OpenAI TTS
Stimmenmodelle 32 Audiomodelle 1 Anbieter 6 Stimmen
Preise Ab $0.12 / minute Offizieller Preis Offizieller Preis
Echtzeit-Streaming Ja Ja Nein
Einheitliche Abrechnung Ja Nein Nein
MCP-Server Ja Nein Nein
Anbieter-Failover Ja Nein Nein

Fragen zur Audio-API

Wie wird TTS abgerechnet?

Pro 1.000 Zeichen des Eingabetexts zum Modelltarif. Transkription wird pro Audiominute abgerechnet.

Kann ich eine Stimme klonen?

Ja. Lade ein Referenzsample hoch, um eine Voice-ID zu erstellen, und übergib diese ID bei späteren Anfragen.

Wird Streaming unterstützt?

Streaming hängt vom gewählten Endpunkt ab. Prüfe vor der Wiedergabeintegration das dokumentierte Antwortformat.

Welche Sprachen werden unterstützt?

Die unterstützten Sprachen unterscheiden sich je nach Modell. Prüfe die Dokumentation des gewählten Modells.

Werden Audio- oder Stimmsamples gespeichert?

Anfrage- und Antwortinhalte können gespeichert werden. Details zur Datenverarbeitung stehen in der Datenschutzerklärung.

Kann ich Zeitstempel auf Wortebene erhalten?

Unterstützung und Genauigkeit von Zeitstempeln hängen vom Transkriptionsendpunkt ab. Prüfe die dokumentierten Antwortfelder; Sprecherlabels sind eine separate Funktion.

Gib deinem Produkt eine Stimme

Sprache, Klonen und Transkription hinter einem einzigen Schlüssel. Kostenlos starten, keine Kreditkarte erforderlich.

Zum Erstellen anmelden

Erstelle einen API-Schlüssel, um Audioanfragen über dein Konto auszuführen.