OpenAI Transcription API
Accès à une API compatible OpenAI pour la transcription audio et la conversion de la parole en texte avec Whisper-1 et GPT Transcribe.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription convertit les fichiers audio téléversés en texte via un endpoint multipart synchrone. Whisper-1 prend en charge les sous-titres et les horodatages, tandis que GPT Transcribe accepte des indications de mots-clés et de langues pour les enregistrements multilingues.
- Variantes de modèle pour différents objectifs de qualité et de latence
- API key unifiée
- Le model skill inclut docs, schémas et notes de setup
- Les générations échouées ne sont pas facturées
Variantes
Installez le skill OpenAI Transcription pour développer des apps
Chargez les docs du modèle, les schémas, les notes de tarifs et les étapes de setup dans votre workspace de code.
# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Install the OpenAI Transcription skill for this app: 1. Add runapi-ai/openai-transcription with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
Construire avec ce model skill
Choisir le modèle
Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.
S'authentifier une fois
Utilisez votre clé RunAPI pour tous les modèles pris en charge.
Installer le skill
Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.
Recevoir la sortie
Interrogez par task ID ou traitez le callback quand la génération se termine.
Où utiliser OpenAI Transcription
OpenAI Transcription propose des modèles de reconnaissance vocale pour les comptes rendus de réunion, les sous-titres, les contenus multimédias consultables par recherche et les transcriptions multilingues. Les deux variantes utilisent le format de requête de transcription audio compatible OpenAI.
Pourquoi utiliser OpenAI Transcription via RunAPI
Une API key
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Prêt pour les skills
Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.
Facturation prévisible
Les tarifs à l'usage sont visibles avant l'appel.
Questions fréquentes
Quelle est la différence entre Whisper-1 et GPT Transcribe ?
Whisper-1 prend en charge JSON, le texte brut, les sous-titres, le JSON détaillé et les sorties horodatées. GPT Transcribe se concentre sur JSON ou le texte brut et accepte des indications de mots-clés et de plusieurs langues.
Quels fichiers audio puis-je transcrire ?
L’endpoint accepte les fichiers FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV et WebM jusqu’à 25 Mo.
L’API peut-elle créer des sous-titres et des horodatages par mot ?
Whisper-1 peut renvoyer des sous-titres SRT ou VTT ainsi que des horodatages par mot ou par segment dans un JSON détaillé. Ces formats de sortie ne sont pas disponibles avec GPT Transcribe.
GPT Transcribe prend-il en charge les enregistrements multilingues ?
Oui. Vous pouvez fournir une indication de langue ou une liste de langues probables, ainsi que des mots-clés pour les noms et les termes propres à un domaine.
La transcription audio est-elle synchrone ?
Oui. Une requête réussie renvoie directement la transcription finale, sans endpoint distinct pour suivre une tâche par polling.
Comment appeler ce modèle ?
Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.
Les générations échouées coûtent-elles quelque chose ?
Les générations échouées ne sont pas facturées
Puis-je l'appeler depuis mon application ?
Oui. Installez le model skill dans votre workspace de code et utilisez-le pendant l'ajout de la fonctionnalité.