Audio & Music · OpenAI

OpenAI Transcription API

Accès à une API compatible OpenAI pour la transcription audio et la conversion de la parole en texte avec Whisper-1 et GPT Transcribe.

Opérationnel · 2 variants · à partir de $0.020
runapi.ai
curl -X POST https://runapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "whisper-1",
  "audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";

const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"

client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/openai-transcription v1
APERÇU

OpenAI Transcription convertit les fichiers audio téléversés en texte via un endpoint multipart synchrone. Whisper-1 prend en charge les sous-titres et les horodatages, tandis que GPT Transcribe accepte des indications de mots-clés et de langues pour les enregistrements multilingues.

  • Variantes de modèle pour différents objectifs de qualité et de latence
  • API key unifiée
  • Le model skill inclut docs, schémas et notes de setup
  • Les générations échouées ne sont pas facturées
VARIANTES

Variantes

Variant Billing Pricing
gpt-transcribe minute $0.020 Voir →
whisper-1 minute $0.020 Voir →
MODELS

Installez le skill OpenAI Transcription pour développer des apps

Chargez les docs du modèle, les schémas, les notes de tarifs et les étapes de setup dans votre workspace de code.

# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the OpenAI Transcription skill for this app:

1. Add runapi-ai/openai-transcription with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
FONCTIONNEMENT

Construire avec ce model skill

01

Choisir le modèle

Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.

02

S'authentifier une fois

Utilisez votre clé RunAPI pour tous les modèles pris en charge.

03

Installer le skill

Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.

04

Recevoir la sortie

Interrogez par task ID ou traitez le callback quand la génération se termine.

CONTEXTE

Où utiliser OpenAI Transcription

OpenAI Transcription propose des modèles de reconnaissance vocale pour les comptes rendus de réunion, les sous-titres, les contenus multimédias consultables par recherche et les transcriptions multilingues. Les deux variantes utilisent le format de requête de transcription audio compatible OpenAI.

Provider
OpenAI
Modality
Audio & Music
POURQUOI RUNAPI

Pourquoi utiliser OpenAI Transcription via RunAPI

Une API key

Utilisez les mêmes identifiants pour les modèles et les fournisseurs.

Prêt pour les skills

Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.

Facturation prévisible

Les tarifs à l'usage sont visibles avant l'appel.

FAQ

Questions fréquentes

Quelle est la différence entre Whisper-1 et GPT Transcribe ?

Whisper-1 prend en charge JSON, le texte brut, les sous-titres, le JSON détaillé et les sorties horodatées. GPT Transcribe se concentre sur JSON ou le texte brut et accepte des indications de mots-clés et de plusieurs langues.

Quels fichiers audio puis-je transcrire ?

L’endpoint accepte les fichiers FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV et WebM jusqu’à 25 Mo.

L’API peut-elle créer des sous-titres et des horodatages par mot ?

Whisper-1 peut renvoyer des sous-titres SRT ou VTT ainsi que des horodatages par mot ou par segment dans un JSON détaillé. Ces formats de sortie ne sont pas disponibles avec GPT Transcribe.

GPT Transcribe prend-il en charge les enregistrements multilingues ?

Oui. Vous pouvez fournir une indication de langue ou une liste de langues probables, ainsi que des mots-clés pour les noms et les termes propres à un domaine.

La transcription audio est-elle synchrone ?

Oui. Une requête réussie renvoie directement la transcription finale, sans endpoint distinct pour suivre une tâche par polling.

Comment appeler ce modèle ?

Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.

Les générations échouées coûtent-elles quelque chose ?

Les générations échouées ne sont pas facturées

Puis-je l'appeler depuis mon application ?

Oui. Installez le model skill dans votre workspace de code et utilisez-le pendant l'ajout de la fonctionnalité.

COMMENCER

Commencez à construire avec OpenAI Transcription.