Audio & Music · OpenAI

OpenAI Transcription API

Acesso a uma API compatível com OpenAI para transcrição de áudio e conversão de fala em texto com Whisper-1 e GPT Transcribe.

Operacional · 2 variants · a partir de $0.020
runapi.ai
curl -X POST https://runapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "whisper-1",
  "audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";

const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"

client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/openai-transcription v1
VISÃO GERAL

OpenAI Transcription converte arquivos de áudio enviados em texto por um endpoint multipart síncrono. Whisper-1 oferece legendas e marcações de tempo, enquanto GPT Transcribe aceita dicas de palavras-chave e idiomas para áudios multilíngues.

  • Variantes para diferentes metas de qualidade e latência
  • API key unificada
  • O model skill inclui documentação, schemas e notas de setup
  • Gerações com falha não são cobradas
VARIANTES

Variantes

Variant Billing Pricing
gpt-transcribe minute $0.020 Ver →
whisper-1 minute $0.020 Ver →
MODELS

Instale o skill OpenAI Transcription para desenvolver apps

Carregue documentação do modelo, schemas, notas de preço e etapas de setup no seu workspace de código.

# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the OpenAI Transcription skill for this app:

1. Add runapi-ai/openai-transcription with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
COMO FUNCIONA

Como construir com este model skill

01

Escolha o modelo

Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.

02

Autentique uma vez

Use sua chave RunAPI para todos os modelos compatíveis.

03

Instale o skill

Adicione o model skill ao workspace de código antes de implementar a funcionalidade.

04

Receba a saída

Consulte por task ID ou trate o callback quando a geração terminar.

CONTEXTO

Onde OpenAI Transcription se encaixa

OpenAI Transcription oferece modelos de reconhecimento de voz para atas de reunião, legendas, mídias pesquisáveis e transcrições multilíngues. As duas variantes usam o formato de requisição de transcrição de áudio compatível com OpenAI.

Provider
OpenAI
Modality
Audio & Music
POR QUE RUNAPI

Por que usar OpenAI Transcription pela RunAPI

Uma API key

Use as mesmas credenciais entre modelos e provedores.

Pronto para skills

O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.

Cobrança previsível

O preço por uso fica visível antes da chamada.

FAQ

Perguntas frequentes

Qual é a diferença entre Whisper-1 e GPT Transcribe?

Whisper-1 oferece JSON, texto simples, legendas, JSON detalhado e resultados com marcações de tempo. GPT Transcribe se concentra em JSON ou texto simples e aceita dicas de palavras-chave e de vários idiomas.

Quais arquivos de áudio posso transcrever?

O endpoint aceita arquivos FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV e WebM de até 25 MB.

A API pode criar legendas e marcações de tempo por palavra?

Whisper-1 pode retornar legendas SRT ou VTT e marcações de tempo por palavra ou segmento em JSON detalhado. Esses formatos de saída não estão disponíveis no GPT Transcribe.

GPT Transcribe oferece suporte a gravações multilíngues?

Sim. Você pode fornecer a dica de um idioma ou uma lista de idiomas prováveis, além de palavras-chave para nomes e termos específicos do domínio.

A transcrição de áudio é síncrona?

Sim. Uma requisição bem-sucedida retorna diretamente a transcrição concluída, sem exigir um endpoint separado de polling da tarefa.

Como chamo este modelo?

Instale o model skill e siga as notas de setup com sua chave RunAPI.

Gerações com falha custam dinheiro?

Gerações com falha não são cobradas

Posso chamar a partir da minha aplicação?

Sim. Instale o model skill no workspace de código e use durante a implementação da funcionalidade.

COMEÇAR

Comece a construir com OpenAI Transcription.