Une API key
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Utilisez l'API OpenAI Transcription via RunAPI avec une compétence de modèle, une authentification unifiée et une tarification à l'usage.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription convertit les fichiers audio téléversés en texte via un endpoint multipart synchrone. Whisper-1 prend en charge les sous-titres et les horodatages, tandis que GPT Transcribe accepte des indications de mots-clés et de langues pour les enregistrements multilingues.
| Endpoint | Résolution | Durée | Prix | |
|---|---|---|---|---|
| speech_to_text | — | — | $0.02 / minute |
Prix affichés pour gpt-transcribe. Les autres variantes conservent leurs propres tarifs par endpoint.
Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.
Utilisez votre clé RunAPI pour tous les modèles pris en charge.
Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.
Interrogez par task ID ou traitez le callback quand la génération se termine.
OpenAI Transcription propose des modèles de reconnaissance vocale pour les comptes rendus de réunion, les sous-titres, les contenus multimédias consultables par recherche et les transcriptions multilingues. Les deux variantes utilisent le format de requête de transcription audio compatible OpenAI.
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.
Les tarifs à l'usage sont visibles avant l'appel.
Whisper-1 prend en charge JSON, le texte brut, les sous-titres, le JSON détaillé et les sorties horodatées. GPT Transcribe se concentre sur JSON ou le texte brut et accepte des indications de mots-clés et de plusieurs langues.
L’endpoint accepte les fichiers FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV et WebM jusqu’à 25 Mo.
Whisper-1 peut renvoyer des sous-titres SRT ou VTT ainsi que des horodatages par mot ou par segment dans un JSON détaillé. Ces formats de sortie ne sont pas disponibles avec GPT Transcribe.
Oui. Vous pouvez fournir une indication de langue ou une liste de langues probables, ainsi que des mots-clés pour les noms et les termes propres à un domaine.
Oui. Une requête réussie renvoie directement la transcription finale, sans endpoint distinct pour suivre une tâche par polling.
Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.