Jedno uwierzytelnienie, wszyscy providerzy
Jeden klucz RunAPI odblokowuje cały katalog. Bez osobnych kont i rotacji kluczy dla każdej integracji.
Korzystaj z API OpenAI Transcription przez RunAPI z model skillem, wspólnym uwierzytelnianiem i cennikiem pay-as-you-go.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription zamienia przesłane pliki audio na tekst przez synchroniczny endpoint multipart. Whisper-1 obsługuje napisy i znaczniki czasu, a GPT Transcribe przyjmuje podpowiedzi ze słowami kluczowymi i językami do wielojęzycznych nagrań.
| Endpoint | Rozdzielczość | Czas trwania | Cena | |
|---|---|---|---|---|
| speech_to_text | — | — | $0.02 / minute |
Ceny podane dla gpt-transcribe. Pozostałe warianty mają własne cenniki endpointów.
Wybierz model i wariant pasujące do typu wyjścia, progu jakości i celu opóźnienia.
Ustaw klucz RunAPI i zainstaluj model skill w workspace kodu.
Użyj instrukcji skilla, aby dodać funkcję modelu w swojej aplikacji.
Odpytuj po task ID, streamuj gdy wspierane albo obsłuż callback webhook.
OpenAI Transcription oferuje modele zamiany mowy na tekst do notatek ze spotkań, napisów, przeszukiwalnych multimediów i wielojęzycznych transkrypcji. Oba warianty korzystają ze zgodnej z OpenAI struktury żądania transkrypcji audio.
Jeden klucz RunAPI odblokowuje cały katalog. Bez osobnych kont i rotacji kluczy dla każdej integracji.
Rozliczanie za wywołanie w USD, fakturowane co miesiąc. Nieudane generacje nie są naliczane.
Typowane schematy i notatki setupu są spakowane w model skill, więc implementacja startuje od właściwego kontraktu.
Whisper-1 obsługuje JSON, zwykły tekst, napisy, rozszerzony JSON i wyniki ze znacznikami czasu. GPT Transcribe skupia się na JSON lub zwykłym tekście i przyjmuje podpowiedzi ze słowami kluczowymi oraz wieloma językami.
Endpoint przyjmuje pliki FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV i WebM o rozmiarze do 25 MB.
Whisper-1 może zwracać napisy SRT lub VTT oraz znaczniki czasu na poziomie słów albo segmentów w rozszerzonym JSON. Te tryby wyjściowe nie są dostępne w GPT Transcribe.
Tak. Możesz podać wskazówkę dotyczącą jednego języka lub listę prawdopodobnych języków, a także słowa kluczowe ułatwiające rozpoznanie nazw i terminów branżowych.
Tak. Pomyślne żądanie zwraca bezpośrednio gotową transkrypcję, bez osobnego endpointu do odpytywania o stan zadania.
Wybierz najtańszy wariant, który spełnia Twoje wymagania jakościowe. Większość zespołów zaczyna od szybkiego wariantu, a do produkcji przechodzi na pro.