It looks like you may prefer a different language. Switch anytime.

OpenAI · Audio & Music

OpenClaw x OpenAI Transcription

OpenAI Transcription 面向会议纪要、视频字幕、音频检索与多语言转录场景。两个变体均使用 OpenAI 兼容的音频转文字请求格式。

2 variants 起价 $0.020 可商用

Prerequisite: npx runapi mcp install

Prompt

Prompt 模型

任务匹配时使用 gpt-transcribe:支持关键词和语言提示的多语言语音转文字模型。

You have access to RunAPI task tools for OpenAI Transcription.

Available OpenAI Transcription models:
- gpt-transcribe: 支持关键词和语言提示的多语言语音转文字模型
  endpoints: /v1/audio/transcriptions
  request fields: file, model, response_format
- whisper-1: 支持字幕与时间戳输出的灵活音频转文字模型
  endpoints: /v1/audio/transcriptions
  request fields: file, model, response_format

Use the model ID and endpoint that match the user's request.
Example prompt: 将这段访谈录音转写为 JSON,保留原始语言,并准确识别提供的产品术语。
/v1/audio/transcriptions: Submit the request and verify the synchronous output. POST /v1/audio/transcriptions。确认同步响应符合该端点的 API 参考。

公开版本与端点

模型 ID 端点 起步价格 模型目录
gpt-transcribe
/v1/audio/transcriptions
$0.020 模型详情
whisper-1
/v1/audio/transcriptions
$0.020 模型详情

验证

轮询,直到 Task 进入终态

选择 <model-id> 后生成验证命令。

配置

指南端点: <endpoint>

选择 <model-id> 后,按端点的公开输入契约生成请求。
使用流程

三步开始使用

  1. 选择模型 ID

    选择公开模型 ID,并查看其端点与当前起步价格。

  2. 配置 RunAPI

    调用端点前设置 RUNAPI_API_KEY。

  3. 验证结果

    对于异步端点,轮询同一端点,直到 Task 进入终态。

使用 OpenClaw + OpenAI Transcription 可以构建什么

  • 产品演示视频

    根据文字描述生成 5 至 10 秒的产品动画,适合电商展示和社交广告。

  • AI 数字人内容

    创建带口型同步的数字人视频,用于培训材料、客户支持和营销内容。

  • 批量视频制作

    排队生成数百个视频,并通过 webhook 接收结果。

为什么通过 RunAPI + OpenClaw 使用 OpenAI Transcription

  • 2 个变体,一个 API 密钥

    通过一个 RunAPI 连接选择可用的模型变体,无需更改现有集成。

  • 清晰的用量价格

    发送请求前查看目录中的当前价格,无需订阅或最低消费。

  • 自动化任务流程

    通过一致的任务流程提交任务、查询状态并收集异步结果,无需编写手动轮询代码。

OpenClaw + OpenAI Transcription 常见问题

应该使用哪个模型 ID?

从版本表选择公开模型 ID。每个 ID 可使用的端点均显示在对应行。

本指南会配置聊天模型吗?

不会。该 Model Line 使用页面所示的端点流程,不会被描述为 Agent 聊天模型。

开始在 OpenClaw 中使用 OpenAI Transcription

需要团队接入支持?

我们可以协助团队接入、完成系统集成并解答技术问题。

联系我们