OpenAI · Audio & Music

Hermes Agent x OpenAI Transcription

OpenAI Transcriptionは、会議の議事録、字幕、検索可能なメディア、多言語の文字起こしに使える音声認識モデルを提供します。どちらのバリアントもOpenAI互換の音声文字起こしリクエスト形式を使用します。

公開バージョンとエンドポイント

モデル IDバージョンエンドポイント開始価格モデルカタログ
gpt-transcribeキーワードと言語ヒントを使える多言語の音声テキスト変換
/v1/audio/transcriptions
$0.020モデル詳細
whisper-1字幕とタイムスタンプ出力に対応した柔軟な音声文字起こし
/v1/audio/transcriptions
$0.020モデル詳細

設定

ガイドエンドポイント: <endpoint>

<model-id> を選択すると、公開入力契約に基づくリクエストが生成されます。

検証

<model-id> を選択すると検証コマンドが生成されます。

利用手順

  1. 1. モデル ID を選択

    公開モデル ID を選び、エンドポイントと現在の開始価格を確認します。

  2. 2. RunAPI を設定

    エンドポイントを呼び出す前に RUNAPI_API_KEY を設定します。

  3. 3. 結果を検証

    非同期エンドポイントでは、Task が終端状態になるまで同じエンドポイントをポーリングします。

よくある質問

どのモデル ID を使うべきですか?

バージョン表から公開モデル ID を選択してください。各 ID で利用できるエンドポイントが同じ行に表示されます。

このガイドはチャットモデルを設定しますか?

いいえ。この Model Line はここに示すエンドポイント手順を使用し、Agent のチャットモデルとしては扱いません。