Audio & Music OpenAI

OpenAI Transcription API

通过 RunAPI 使用 OpenAI Transcription API,配套 model skill、统一认证和按需计费。

runapi.ai
curl -X POST https://runapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "whisper-1",
  "audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";

const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"

client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/openai-transcription v1
概览

关于 OpenAI Transcription

OpenAI Transcription 通过同步 multipart 端点将上传音频转换为文字。Whisper-1 支持字幕与时间戳输出,GPT Transcribe 支持关键词提示和多语言提示,适合多语言录音转录。

提供方
OpenAI
模态
Audio & Music

对比全部 API 变体

变体 计费方式 价格
gpt-transcribe minute $0.020 查看 →
whisper-1 minute $0.020 查看 →
定价

OpenAI Transcription 定价

Endpoint 分辨率 时长 价格
speech_to_text $0.02 / minute

当前价格适用于 gpt-transcribe。其他变体保留各自的 endpoint 定价。

Agent 集成

通过 Agent 运行 OpenAI Transcription

工作流程

开始使用 OpenAI Transcription

  1. 选择模型

    根据输出类型、质量要求和延迟目标选择模型与变体。

  2. 配置

    设置 RunAPI key,并在代码工作区安装对应 model skill。

  3. 调用

    按 skill 里的说明,把模型能力接入到你的应用里。

  4. 接收

    按 task ID 轮询、在支持时使用流式,或处理 webhook 回调。

背景

OpenAI Transcription API 是什么?

OpenAI Transcription 面向会议纪要、视频字幕、音频检索与多语言转录场景。两个变体均使用 OpenAI 兼容的音频转文字请求格式。

提供方
OpenAI
查看全部 →
模态
Audio & Music
浏览模型 →

为什么用 RunAPI 调用 OpenAI Transcription API

统一认证,接入所有提供方

一把 RunAPI key 解锁整个模型目录。无需为每家提供方单独建账户。

统一的定价与账单

USD 按次定价,按月结算。失败的生成不计费。

Schema 优先的 SDK

Typed schema 和接入说明已打包进 model skill,让实现从正确契约开始。

OpenAI Transcription 常见问题

Whisper-1 和 GPT Transcribe 有什么区别?

Whisper-1 支持 JSON、纯文本、字幕、详细 JSON 和时间戳输出;GPT Transcribe 侧重 JSON 或纯文本,并支持关键词提示和多语言提示。

可以转录哪些音频文件?

端点接受不超过 25 MB 的 FLAC、MP3、MP4、MPEG、MPGA、M4A、OGG、WAV 和 WebM 文件。

API 能生成字幕和逐词时间戳吗?

Whisper-1 可返回 SRT 或 VTT 字幕,也可通过详细 JSON 返回词级或片段级时间戳;GPT Transcribe 不提供这些输出模式。

GPT Transcribe 支持多语言录音吗?

支持。你可以提供一种语言提示或一组可能出现的语言,也可以用关键词提示人名和专业术语。

音频转文字是同步请求吗?

是。请求成功后会直接返回完整转录结果,无需单独轮询任务状态。

应该从哪个变体开始?

选满足质量要求的最便宜变体。多数团队从 fast 起步,生产时升级到 pro。

相似模型

如果喜欢 OpenAI Transcription API,也可以试试这些

立即体验 OpenAI Transcription API。