Audio & Music OpenAI

OpenAI Transcription API

透過 RunAPI 使用 OpenAI Transcription API,包含 model skill、統一驗證與按用量計費。

runapi.ai
curl -X POST https://runapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "whisper-1",
  "audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";

const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"

client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
    model: "whisper-1",
    audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/openai-transcription v1
OVERVIEW

關於 OpenAI Transcription

OpenAI Transcription 透過同步 multipart 端點,將上傳的音訊檔案轉成文字。Whisper-1 支援字幕與時間戳記輸出;GPT Transcribe 則支援關鍵字和語言提示,適合多語言音訊。

供應商
OpenAI
模態
Audio & Music

比較所有 API 變體

變體 計費方式 定價
gpt-transcribe minute $0.020 查看 →
whisper-1 minute $0.020 查看 →
PRICING

OpenAI Transcription 定價

Endpoint 解析度 時長 價格
speech_to_text $0.02 / minute

顯示 gpt-transcribe 的定價。其他變體保有各自的 endpoint 定價。

Agent 整合

透過 Agent 執行 OpenAI Transcription

運作方式

OpenAI Transcription 快速入門

  1. 選擇模型

    挑選符合輸出類型、品質門檻與延遲目標的模型與變體。

  2. 設定

    設定 RunAPI key,並在 coding workspace 安裝 model skill。

  3. 開發

    使用 skill 指引,在你的 app 內加入模型功能。

  4. 接收

    透過 task ID 查詢、在支援時串流,或處理 webhook callback。

CONTEXT

什麼是 OpenAI Transcription API?

OpenAI Transcription 提供語音轉文字模型,適用於會議記錄、字幕、可搜尋媒體及多語言逐字稿。兩個版本都使用 OpenAI 相容的音訊轉錄請求格式。

供應商
OpenAI
查看全部 →
模態
Audio & Music
瀏覽模型 →

為什麼透過 RunAPI 使用 OpenAI Transcription API

一組驗證,全部供應商通用

一把 RunAPI 金鑰就能開通整個目錄。無需分開註冊帳戶,也不用為每個整合各自輪替金鑰。

統一價格與計費

以美元按次計費,每月結帳。失敗的生成不收費。

內含 schema 的 skill

型別化 schema 與 setup 備註打包在 model skill 內,讓實作從正確契約開始。

OpenAI Transcription 常見問題

Whisper-1 和 GPT Transcribe 有什麼差別?

Whisper-1 支援 JSON、純文字、字幕、詳細 JSON 與時間戳記輸出。GPT Transcribe 專注於 JSON 或純文字輸出,並可接受關鍵字及多語言提示。

可以轉錄哪些音訊檔案?

端點接受 FLAC、MP3、MP4、MPEG、MPGA、M4A、OGG、WAV 和 WebM 格式,上傳檔案大小上限為 25 MB。

API 可以產生字幕和單字時間戳記嗎?

Whisper-1 可回傳 SRT 或 VTT 字幕,也能透過詳細 JSON 提供單字或片段層級的時間戳記。GPT Transcribe 不支援這些輸出模式。

GPT Transcribe 支援多語言錄音嗎?

支援。你可以提供單一語言提示或可能語言的清單,並加入人名和專業術語的關鍵字提示。

音訊轉錄採同步處理嗎?

是。請求成功後會直接回傳完整逐字稿,不需要透過另一個任務端點輪詢。

我應該先從哪個版本開始?

先選擇符合你品質標準中最便宜的版本。大多數團隊會先用快速版本,之後再升級到專業版用於正式上線。

相似模型

如果你喜歡 OpenAI Transcription API,可以試試這些

開始用 OpenAI Transcription API 開發。