It looks like you may prefer a different language. Switch anytime.

OpenAI · Audio & Music

Hermes Agent x OpenAI Transcription

OpenAI Transcription 提供語音轉文字模型,適用於會議記錄、字幕、可搜尋媒體及多語言逐字稿。兩個版本都使用 OpenAI 相容的音訊轉錄請求格式。

2 variants 起價 $0.020 可商用

Prerequisite: npx runapi mcp install

Prompt

Prompt 模型

任務合適時使用 gpt-transcribe:支援關鍵字與語言提示的多語言語音轉文字。

You have access to RunAPI task tools for OpenAI Transcription.

Available OpenAI Transcription models:
- gpt-transcribe: 支援關鍵字與語言提示的多語言語音轉文字
  endpoints: /v1/audio/transcriptions
  request fields: file, model, response_format
- whisper-1: 靈活的音訊轉錄,支援字幕與時間戳記輸出
  endpoints: /v1/audio/transcriptions
  request fields: file, model, response_format

Use the model ID and endpoint that match the user's request.
Example prompt: 將這段訪談錄音轉錄成 JSON,保留錄音中使用的語言,並突顯指定的產品術語。
/v1/audio/transcriptions: Submit the request and verify the synchronous output. POST /v1/audio/transcriptions。確認同步回應符合該端點的 API 參考。

公開版本與端點

模型 ID 端點 起始價格 模型目錄
gpt-transcribe
/v1/audio/transcriptions
$0.020 模型詳情
whisper-1
/v1/audio/transcriptions
$0.020 模型詳情

驗證

輪詢,直到 Task 進入終態

選擇 <model-id> 後產生驗證命令。

設定

指南端點: <endpoint>

選擇 <model-id> 後,依端點的公開輸入契約產生請求。
使用流程

三步開始使用

  1. 選擇模型 ID

    選擇公開模型 ID,並查看其端點與目前起始價格。

  2. 設定 RunAPI

    呼叫端點前設定 RUNAPI_API_KEY。

  3. 驗證結果

    對非同步端點輪詢同一路徑,直到 Task 進入終態。

使用 Hermes Agent + OpenAI Transcription 可以打造什麼

  • 產品示範影片

    根據文字描述產生 5 至 10 秒的產品動畫,適合電商展示與社群廣告。

  • AI 虛擬人內容

    建立口型同步的虛擬人影片,用於訓練教材、客戶支援與行銷內容。

  • 批次影片製作

    排隊產生數百部影片,並透過 webhook 收取結果。

為什麼透過 RunAPI + Hermes Agent 使用 OpenAI Transcription

  • 2 個變體,一個 API 金鑰

    透過一個 RunAPI 連線選擇可用的模型變體,無需變更現有整合。

  • 清楚的用量價格

    送出請求前查看目錄中的目前價格,無需訂閱或最低消費。

  • 自動化工作流程

    透過一致的工作流程提交工作、查詢狀態並收集非同步結果,無需撰寫手動輪詢程式碼。

Hermes Agent + OpenAI Transcription 常見問題

應該使用哪個模型 ID?

從版本表選擇公開模型 ID。每個 ID 可用的端點都列在對應資料列。

本指南會設定聊天模型嗎?

不會。此 Model Line 使用頁面所示的端點流程,不會被描述為 Agent 聊天模型。

開始在 Hermes Agent 中使用 OpenAI Transcription

正在與團隊一起打造?

我們可以協助企業接入、整合與技術問題。

聯絡我們