Audio & Music · OpenAI

OpenAI Transcription API

OpenAI 兼容音频转文字 API,支持 Whisper-1 与 GPT Transcribe 语音转文字模型。

运行中 · 2 variants · 起价 $0.020
runapi.ai
curl -X POST https://runapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "whisper-1",
  "audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";

const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"

client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/openai-transcription v1
概览

OpenAI Transcription 通过同步 multipart 端点将上传音频转换为文字。Whisper-1 支持字幕与时间戳输出,GPT Transcribe 支持关键词提示和多语言提示,适合多语言录音转录。

  • 多变体覆盖不同速度/质量层级
  • Model skill 包含文档、schema 和接入说明
  • 适合面向应用的编码工作流
  • 失败的生成不计费
变体

对比全部 API 变体

Variant Billing Pricing
gpt-transcribe minute $0.020 查看 →
whisper-1 minute $0.020 查看 →
技能

为应用开发安装 OpenAI Transcription skill

把模型文档、schema、定价说明和接入步骤加载进代码工作区。

# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the OpenAI Transcription skill for this app:

1. Add runapi-ai/openai-transcription with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
工作流程

四步从 model skill 到首次结果

01

选择模型

根据输出类型、质量要求和延迟目标选择模型与变体。

02

配置

设置 RunAPI key,并在代码工作区安装对应 model skill。

03

调用

按 skill 里的说明,把模型能力接入到你的应用里。

04

接收

按 task ID 轮询、在支持时使用流式,或处理 webhook 回调。

背景

OpenAI Transcription API 是什么?

OpenAI Transcription 面向会议纪要、视频字幕、音频检索与多语言转录场景。两个变体均使用 OpenAI 兼容的音频转文字请求格式。

Provider
OpenAI
Modality
Audio & Music
为何选择 RunAPI

为什么用 RunAPI 调用 OpenAI Transcription API

一把认证,覆盖所有提供方

一把 RunAPI key 解锁整个模型目录。无需为每家提供方单独建账户。

统一的定价与账单

USD 按次定价,按月结算。失败的生成不计费。

Schema 优先的 SDK

Typed schema 和接入说明已打包进 model skill,让实现从正确契约开始。

常见问题

常见问题

Whisper-1 和 GPT Transcribe 有什么区别?

Whisper-1 支持 JSON、纯文本、字幕、详细 JSON 和时间戳输出;GPT Transcribe 侧重 JSON 或纯文本,并支持关键词提示和多语言提示。

可以转录哪些音频文件?

端点接受不超过 25 MB 的 FLAC、MP3、MP4、MPEG、MPGA、M4A、OGG、WAV 和 WebM 文件。

API 能生成字幕和逐词时间戳吗?

Whisper-1 可返回 SRT 或 VTT 字幕,也可通过详细 JSON 返回词级或片段级时间戳;GPT Transcribe 不提供这些输出模式。

GPT Transcribe 支持多语言录音吗?

支持。你可以提供一种语言提示或一组可能出现的语言,也可以用关键词提示人名和专业术语。

音频转文字是同步请求吗?

是。请求成功后会直接返回完整转录结果,无需单独轮询任务状态。

应该从哪个变体开始?

选满足质量要求的最便宜变体。多数团队从 fast 起步,生产时升级到 pro。

有免费额度吗?

新账户每个模型都有免费调用额度,之后按次计费。

支持流式吗?

模型支持流式时,RunAPI 端到端流式。

失败怎么计费?

失败的生成不计费。

输出会缓存吗?

输出按任务 ID 存储在 R2 供回取。输入不缓存。

可以商用吗?

可以——所有变体默认含商用许可,除非模型许可明确限制;有例外会在变体页面注明。

速率限制?

Key 级限流随使用层级伸缩。当前限制见定价页。

在哪里报问题?

在公共 GitHub 仓库提 issue 或邮件联系 support。

立即开始

立即体验 OpenAI Transcription API。