Una API key
Usa las mismas credenciales entre modelos y proveedores.
Accede a la API de OpenAI Transcription a través de RunAPI con una habilidad de modelo, autenticación unificada y precios de pago por uso.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription convierte archivos de audio subidos en texto mediante un endpoint multipart síncrono. Whisper-1 admite subtítulos y marcas de tiempo, mientras que GPT Transcribe acepta palabras clave e indicaciones de idioma para audio multilingüe.
| Endpoint | Resolución | Duración | Precio | |
|---|---|---|---|---|
| speech_to_text | — | — | $0.02 / minute |
Precios mostrados para gpt-transcribe. Otras variantes mantienen sus propios precios por endpoint.
Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.
Usa tu clave RunAPI para todos los modelos compatibles.
Añade el model skill a tu workspace de código antes de implementar la función.
Consulta por task ID o procesa el callback cuando termine la generación.
OpenAI Transcription ofrece modelos de conversión de voz a texto para actas de reuniones, subtítulos, contenido multimedia indexable y transcripciones multilingües. Ambas variantes usan el formato de solicitud de transcripción de audio compatible con OpenAI.
Usa las mismas credenciales entre modelos y proveedores.
El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.
El precio por uso es visible antes de llamar.
Whisper-1 admite JSON, texto sin formato, subtítulos, JSON detallado y resultados con marcas de tiempo. GPT Transcribe se centra en JSON o texto sin formato y acepta indicaciones de palabras clave y de varios idiomas.
El endpoint acepta archivos FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV y WebM de hasta 25 MB.
Whisper-1 puede devolver subtítulos SRT o VTT y marcas de tiempo por palabra o segmento mediante JSON detallado. Estos modos de salida no están disponibles con GPT Transcribe.
Sí. Puedes proporcionar la indicación de un idioma o una lista de idiomas probables, además de palabras clave para nombres y términos específicos del ámbito.
Sí. Una solicitud completada correctamente devuelve directamente la transcripción final, sin un endpoint independiente para consultar el estado de la tarea.
Instala el model skill y sigue sus notas de setup con tu clave RunAPI.