Uma API key
Use as mesmas credenciais entre modelos e provedores.
Use a API do OpenAI Transcription via RunAPI com um model skill, autenticação unificada e preços pay-as-you-go.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription converte arquivos de áudio enviados em texto por um endpoint multipart síncrono. Whisper-1 oferece legendas e marcações de tempo, enquanto GPT Transcribe aceita dicas de palavras-chave e idiomas para áudios multilíngues.
| Endpoint | Resolução | Duração | Preço | |
|---|---|---|---|---|
| speech_to_text | — | — | $0.02 / minute |
Preços exibidos para gpt-transcribe. Outras variantes mantêm seus próprios preços por endpoint.
Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.
Use sua chave RunAPI para todos os modelos compatíveis.
Adicione o model skill ao workspace de código antes de implementar a funcionalidade.
Consulte por task ID ou trate o callback quando a geração terminar.
OpenAI Transcription oferece modelos de reconhecimento de voz para atas de reunião, legendas, mídias pesquisáveis e transcrições multilíngues. As duas variantes usam o formato de requisição de transcrição de áudio compatível com OpenAI.
Use as mesmas credenciais entre modelos e provedores.
O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.
O preço por uso fica visível antes da chamada.
Whisper-1 oferece JSON, texto simples, legendas, JSON detalhado e resultados com marcações de tempo. GPT Transcribe se concentra em JSON ou texto simples e aceita dicas de palavras-chave e de vários idiomas.
O endpoint aceita arquivos FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV e WebM de até 25 MB.
Whisper-1 pode retornar legendas SRT ou VTT e marcações de tempo por palavra ou segmento em JSON detalhado. Esses formatos de saída não estão disponíveis no GPT Transcribe.
Sim. Você pode fornecer a dica de um idioma ou uma lista de idiomas prováveis, além de palavras-chave para nomes e termos específicos do domínio.
Sim. Uma requisição bem-sucedida retorna diretamente a transcrição concluída, sem exigir um endpoint separado de polling da tarefa.
Instale o model skill e siga as notas de setup com sua chave RunAPI.