API audio

API audio i mowy AI

Synteza mowy, klonowanie głosu, transkrypcja i efekty dźwiękowe z ElevenLabs, Fish Audio, Google oraz publicznym katalogiem audio.

32 modeli audio · publiczne endpointy audio
32
Modele audio
6
Dostawcy
89
Publiczne endpointy
Playground na żywo
Model
Tekst
Zacznij tutaj tworzyć następne audio. Wybierz publiczny model, aby sprawdzić aktualną cenę i szczegóły endpointu.
Głos Głos domyślny
Format mp3
Szybkość 1.0x
Tryb text_to_speech

Przykłady

Posłuchaj głosów

Aria — Natural

"Every model, every provider, one API key. That's what RunAPI gives you."

Miles — Narration

"Generate video, music, images, and audio from a single integration."

Nova — Conversational

"Switch between providers without changing a single line of code."

Kai — Broadcast

"Production-ready AI infrastructure with built-in failover and monitoring."

Wszystko, co potrafi audio endpoint

Text to Speech

Stream natural speech from text with per-request voice and speed control.

Voice Cloning

Build a reusable voice from a short reference sample, then call it by id like any other voice.

Speech to Text

Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.

Text to Sound

Generate foley and sound effects from a description — impacts, ambience, UI cues.

Text to Dialogue

Render multi-speaker conversations with distinct voices and natural turn timing in one call.

Audio models on one key

ElevenLabs/audio-isolation

ElevenLabs

$0.12 / minute

ElevenLabs/sound-effect-v2

ElevenLabs

$0.15 / minute

ElevenLabs/speech-to-text

ElevenLabs

$0.04 / minute

ElevenLabs/text-to-dialogue-v3

ElevenLabs

$0.14 / 1K chars

ElevenLabs/text-to-speech-multilingual-v2

ElevenLabs

$0.12 / 1K chars

ElevenLabs/text-to-speech-turbo-v2.5

ElevenLabs

$0.06 / 1K chars

View all 32 audio models
Szybki start

Syntezuj mowę

curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
Jak to działa

Cztery kroki do pierwszego wygenerowania

  1. Uzyskaj klucz API

    Jeden klucz do wszystkich modeli TTS i głosowych.

  2. Wybierz głos

    Przeglądaj dostępne głosy w obsługiwanych modelach audio.

  3. Wyślij tekst

    Wyślij tekst i wybrany głos do /api/v1/elevenlabs/text_to_speech.

  4. Odbierz audio

    Odbierz wygenerowany dźwięk z wyniku zadania.

Dlaczego deweloperzy wybierają RunAPI

Jeden klucz, wszystkie modele

Nie zarządzaj już wieloma kluczami API. Jedna integracja daje dostęp do ponad 200 modeli wszystkich dostawców.

Oszczędność kosztów 15-25%

Dzięki umowom wolumenowym z dostawcami oferujemy ceny niższe niż zakup bezpośredni, bez narzutu.

Automatyczny failover

Gdy dostawca przestaje działać, kierujemy żądanie do kolejnej najlepszej opcji. Twoja aplikacja działa dalej.

Kompatybilność z OpenAI

Bezpośredni zamiennik OpenAI SDK. Zmień jedną linię kodu, aby uzyskać dostęp do dowolnego modelu.

Rozliczenia w czasie rzeczywistym

Płacisz tylko za wykorzystanie. Ceny za żądanie bez minimów oraz śledzenie kosztów według modelu i projektu.

Uwierzytelnianie kluczem API

Uwierzytelniaj żądania do API audio za pomocą klucza API RunAPI.

Co zespoły budują za pomocą API

Agenci głosowi

Połącz strumieniowe TTS z LLM i transkrypcją, aby zbudować w pełni dwukierunkową pętlę głosową za pomocą jednego klucza.

Lokalizacja

Zdubbinguj istniejący film na nowe języki za pomocą sklonowanego głosu, który pozostaje rozpoznawalny.

Notatki ze spotkań

Wykonuj transkrypcję z etykietami mówców, a następnie podsumowuj ją przez punkt końcowy LLM w tym samym potoku.

Dostępność

Dodaj narrację do artykułów, dokumentów i treści w aplikacji bez sesji nagraniowej.

RunAPI na tle alternatyw

Funkcja RunAPI ElevenLabs bezpośrednio OpenAI TTS
Modele głosowe 32 modeli audio 1 dostawca 6 głosów
Ceny Od $0.12 / minute Stawka oficjalna Stawka oficjalna
Przesyłanie strumieniowe w czasie rzeczywistym Tak Tak Nie
Ujednolicone rozliczenia Tak Nie Nie
Serwer MCP Tak Nie Nie
Przełączanie dostawcy Tak Nie Nie

Pytania dotyczące Audio API

Jak rozliczany jest TTS?

Za każde 1 000 znaków tekstu wejściowego według stawki modelu. Transkrypcja jest rozliczana za minutę nagrania.

Czy mogę sklonować głos?

Tak. Prześlij próbkę referencyjną, aby utworzyć identyfikator głosu, a następnie przekaż go w kolejnych żądaniach.

Czy streaming jest obsługiwany?

Obsługa streamingu zależy od wybranego endpointu. Przed integracją odtwarzania sprawdź udokumentowany format odpowiedzi.

Jakie języki są obsługiwane?

Obsługiwane języki zależą od modelu. Sprawdź dokumentację wybranego modelu.

Czy przechowujecie nagrania audio lub próbki głosów?

Treść żądań i odpowiedzi może być przechowywana. Szczegóły przetwarzania danych znajdziesz w polityce prywatności.

Czy mogę uzyskać znaczniki czasu na poziomie słów?

Obsługa i dokładność znaczników czasu zależą od endpointu transkrypcji. Sprawdź udokumentowane pola odpowiedzi; etykiety mówców to osobna funkcja.

Nadaj swojemu produktowi głos

Synteza mowy, klonowanie i transkrypcja za jednym kluczem. Zacznij za darmo, bez karty kredytowej.

Zaloguj się, aby generować

Utwórz klucz API, aby wykonywać żądania audio ze swojego konta.