1つの API key
モデルやプロバイダーをまたいで同じ認証情報を使えます。
RunAPIのモデルスキル、統合認証、従量課金制の料金でOpenAI Transcription APIを利用できます。
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcriptionは、同期型のマルチパートエンドポイントを通じてアップロードした音声ファイルをテキストに変換します。Whisper-1は字幕とタイムスタンプ出力に対応し、GPT Transcribeは多言語音声向けのキーワードと言語ヒントに対応します。
| Endpoint | 解像度 | 尺 | 価格 | |
|---|---|---|---|---|
| speech_to_text | — | — | $0.02 / minute |
gpt-transcribe の料金を表示しています。他のバリアントはそれぞれの endpoint 料金が適用されます。
出力タイプ、品質基準、レイテンシ目標に合うモデルとバリアントを選びます。
対応するすべてのモデルに RunAPI key を使います。
機能実装の前に model skill をコード作業環境へ追加します。
task ID でポーリングするか、生成完了時の callback を処理します。
モデルやプロバイダーをまたいで同じ認証情報を使えます。
model skill に schema、セットアップメモ、料金コンテキスト、モデル ID が含まれます。
呼び出し前に従量料金を確認できます。
Whisper-1はJSON、プレーンテキスト、字幕、詳細JSON、タイムスタンプ付き出力に対応します。GPT TranscribeはJSONまたはプレーンテキスト出力に特化し、キーワードと複数言語のヒントを指定できます。
FLAC、MP3、MP4、MPEG、MPGA、M4A、OGG、WAV、WebM形式で、最大25 MBのファイルをアップロードできます。
Whisper-1ではSRTまたはVTT字幕を返せるほか、詳細JSONで単語単位またはセグメント単位のタイムスタンプを取得できます。GPT Transcribeでは、これらの出力モードは利用できません。
はい。1つの言語ヒントまたは候補となる複数言語のリストに加えて、固有名詞や専門用語のキーワードヒントを指定できます。
はい。リクエストが成功すると、別のタスクポーリング用エンドポイントを使わずに、完成した文字起こしが直接返されます。
model skill をインストールし、RunAPI key とセットアップメモに従ってください。