Audio & Music · OpenAI

OpenAI Transcription API

Acceso a una API compatible con OpenAI para transcripción de audio y conversión de voz a texto con Whisper-1 y GPT Transcribe.

Operativo · 2 variants · desde $0.020
runapi.ai
curl -X POST https://runapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "whisper-1",
  "audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";

const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"

client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/openai-transcription v1
RESUMEN

OpenAI Transcription convierte archivos de audio subidos en texto mediante un endpoint multipart síncrono. Whisper-1 admite subtítulos y marcas de tiempo, mientras que GPT Transcribe acepta palabras clave e indicaciones de idioma para audio multilingüe.

  • Variantes para distintos objetivos de calidad y latencia
  • API key unificada
  • El model skill incluye documentación, schemas y notas de setup
  • Las generaciones fallidas no se cobran
VARIANTES

Variantes

Variant Billing Pricing
gpt-transcribe minute $0.020 Ver →
whisper-1 minute $0.020 Ver →
MODELS

Instala el skill de OpenAI Transcription para desarrollar apps

Carga documentación del modelo, schemas, notas de precios y pasos de setup en tu workspace de código.

# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the OpenAI Transcription skill for this app:

1. Add runapi-ai/openai-transcription with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
CÓMO FUNCIONA

Cómo construir con este model skill

01

Elige el modelo

Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.

02

Autentica una vez

Usa tu clave RunAPI para todos los modelos compatibles.

03

Instala el skill

Añade el model skill a tu workspace de código antes de implementar la función.

04

Recibe la salida

Consulta por task ID o procesa el callback cuando termine la generación.

CONTEXTO

Dónde encaja OpenAI Transcription

OpenAI Transcription ofrece modelos de conversión de voz a texto para actas de reuniones, subtítulos, contenido multimedia indexable y transcripciones multilingües. Ambas variantes usan el formato de solicitud de transcripción de audio compatible con OpenAI.

Provider
OpenAI
Modality
Audio & Music
POR QUÉ RUNAPI

Por qué usar OpenAI Transcription mediante RunAPI

Una API key

Usa las mismas credenciales entre modelos y proveedores.

Listo para skills

El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.

Facturación predecible

El precio por uso es visible antes de llamar.

FAQ

Preguntas frecuentes

¿Cuál es la diferencia entre Whisper-1 y GPT Transcribe?

Whisper-1 admite JSON, texto sin formato, subtítulos, JSON detallado y resultados con marcas de tiempo. GPT Transcribe se centra en JSON o texto sin formato y acepta indicaciones de palabras clave y de varios idiomas.

¿Qué archivos de audio puedo transcribir?

El endpoint acepta archivos FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV y WebM de hasta 25 MB.

¿Puede la API crear subtítulos y marcas de tiempo por palabra?

Whisper-1 puede devolver subtítulos SRT o VTT y marcas de tiempo por palabra o segmento mediante JSON detallado. Estos modos de salida no están disponibles con GPT Transcribe.

¿GPT Transcribe admite grabaciones multilingües?

Sí. Puedes proporcionar la indicación de un idioma o una lista de idiomas probables, además de palabras clave para nombres y términos específicos del ámbito.

¿La transcripción de audio es síncrona?

Sí. Una solicitud completada correctamente devuelve directamente la transcripción final, sin un endpoint independiente para consultar el estado de la tarea.

¿Cómo llamo a este modelo?

Instala el model skill y sigue sus notas de setup con tu clave RunAPI.

¿Las generaciones fallidas cuestan dinero?

Las generaciones fallidas no se cobran

¿Puedo llamarlo desde mi aplicación?

Sí. Instala el model skill en tu workspace de código y úsalo mientras añades la función del modelo.

EMPEZAR

Empieza a construir con OpenAI Transcription.