OpenAI Transcription API
Acceso a una API compatible con OpenAI para transcripción de audio y conversión de voz a texto con Whisper-1 y GPT Transcribe.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription convierte archivos de audio subidos en texto mediante un endpoint multipart síncrono. Whisper-1 admite subtítulos y marcas de tiempo, mientras que GPT Transcribe acepta palabras clave e indicaciones de idioma para audio multilingüe.
- Variantes para distintos objetivos de calidad y latencia
- API key unificada
- El model skill incluye documentación, schemas y notas de setup
- Las generaciones fallidas no se cobran
Variantes
Instala el skill de OpenAI Transcription para desarrollar apps
Carga documentación del modelo, schemas, notas de precios y pasos de setup en tu workspace de código.
# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Install the OpenAI Transcription skill for this app: 1. Add runapi-ai/openai-transcription with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
Cómo construir con este model skill
Elige el modelo
Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.
Autentica una vez
Usa tu clave RunAPI para todos los modelos compatibles.
Instala el skill
Añade el model skill a tu workspace de código antes de implementar la función.
Recibe la salida
Consulta por task ID o procesa el callback cuando termine la generación.
Dónde encaja OpenAI Transcription
OpenAI Transcription ofrece modelos de conversión de voz a texto para actas de reuniones, subtítulos, contenido multimedia indexable y transcripciones multilingües. Ambas variantes usan el formato de solicitud de transcripción de audio compatible con OpenAI.
Por qué usar OpenAI Transcription mediante RunAPI
Una API key
Usa las mismas credenciales entre modelos y proveedores.
Listo para skills
El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.
Facturación predecible
El precio por uso es visible antes de llamar.
Preguntas frecuentes
¿Cuál es la diferencia entre Whisper-1 y GPT Transcribe?
Whisper-1 admite JSON, texto sin formato, subtítulos, JSON detallado y resultados con marcas de tiempo. GPT Transcribe se centra en JSON o texto sin formato y acepta indicaciones de palabras clave y de varios idiomas.
¿Qué archivos de audio puedo transcribir?
El endpoint acepta archivos FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV y WebM de hasta 25 MB.
¿Puede la API crear subtítulos y marcas de tiempo por palabra?
Whisper-1 puede devolver subtítulos SRT o VTT y marcas de tiempo por palabra o segmento mediante JSON detallado. Estos modos de salida no están disponibles con GPT Transcribe.
¿GPT Transcribe admite grabaciones multilingües?
Sí. Puedes proporcionar la indicación de un idioma o una lista de idiomas probables, además de palabras clave para nombres y términos específicos del ámbito.
¿La transcripción de audio es síncrona?
Sí. Una solicitud completada correctamente devuelve directamente la transcripción final, sin un endpoint independiente para consultar el estado de la tarea.
¿Cómo llamo a este modelo?
Instala el model skill y sigue sus notas de setup con tu clave RunAPI.
¿Las generaciones fallidas cuestan dinero?
Las generaciones fallidas no se cobran
¿Puedo llamarlo desde mi aplicación?
Sí. Instala el model skill en tu workspace de código y úsalo mientras añades la función del modelo.