Fish Audio · 音频与音乐

Hermes Agent x Fish Audio

Fish Audio 为表现力对话和可靠的生产语音工作流提供文本转语音模型。RunAPI 会校验每个结果,并返回带音频元数据的托管 MP3 URL。

3 variants 起价 $0.02 / 1K UTF-8 字节 可商用

Prerequisite: npx runapi mcp install

Prompt

Prompt 模型

任务匹配时使用 s1:面向对话与叙事音频的富有表现力的多语言语音。

You have access to RunAPI task tools for Fish Audio.

Available Fish Audio models:
- s1: 面向对话与叙事音频的富有表现力的多语言语音
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2-pro: 适合现有生产工作流的上一代自然、稳定语音模型
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2.1-pro: 推荐用于生产的语音合成模型,支持 83 种语言与自然语言表情控制
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text

Use the model ID and endpoint that match the user's request.
Example prompt: 将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。
/api/v1/fish_audio/text_to_speech: Submit the request and verify the synchronous output. POST /api/v1/fish_audio/text_to_speech。确认同步响应符合该端点的 API 参考。

公开版本与端点

模型 ID 端点 起步价格 模型目录
s1
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8 字节 模型详情
s2-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8 字节 模型详情
s2.1-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8 字节 模型详情

验证

轮询,直到 Task 进入终态

选择 <model-id> 后生成验证命令。

配置

指南端点: <endpoint>

选择 <model-id> 后,按端点的公开输入契约生成请求。

其他操作

这些操作不使用模型 ID。

  • /api/v1/fish_audio/list_voices
  • /api/v1/fish_audio/create_voice
  • /api/v1/fish_audio/get_voice
使用流程

三步开始使用

  1. 选择模型 ID

    选择公开模型 ID,并查看其端点与当前起步价格。

  2. 配置 RunAPI

    调用端点前设置 RUNAPI_API_KEY。

  3. 验证结果

    对于异步端点,轮询同一端点,直到 Task 进入终态。

使用 Hermes Agent + Fish Audio 可以构建什么

  • 配音与旁白

    使用支持语音生成的模型,把脚本转成视频、课程和产品演示所需的语音。

  • 音乐与配乐

    使用支持音乐生成的模型,根据曲风、情绪和节奏的描述制作背景音乐和广告短曲。

  • 转写与音频处理

    使用支持音频输入的模型,转写录音,或清理、转换现有音频。

为什么通过 RunAPI + Hermes Agent 使用 Fish Audio

  • 3 个变体,一个 API 密钥

    通过一个 RunAPI 连接选择可用的模型变体,无需更改现有集成。

  • 清晰的用量价格

    发送请求前查看目录中的当前价格,无需订阅或最低消费。

  • 直接返回结果

    同步调用在同一个响应中返回结果,Agent 无需轮询任务即可直接使用。

Hermes Agent + Fish Audio 常见问题

s1、s2-pro 和 s2.1-pro 有什么区别?

s1 面向富有表现力的语音;s2.1-pro 是推荐的生产模型,支持 83 种语言与自然语言表情控制;s2-pro 仍作为上一代选项提供。

Fish Audio 返回什么音频格式?

默认返回 MP3,也可选择 WAV。RunAPI 响应会准确提供实际格式、MIME 类型与字节大小。

可以用参考样本引导音色吗?

你可以尝试在后续文本转语音请求中使用返回的 RunAPI voice_id,但不保证始终可用。若只需影响当前请求,也可以通过 references 传入 base64 音频及其精确文本。

生成的音频由 RunAPI 托管吗?

是。RunAPI 会在返回托管音频 URL 前校验并存储结果。

需要轮询任务状态吗?

不需要。该端点为同步请求,成功响应会直接返回已完成的音频结果。

应该使用哪个模型 ID?

从版本表选择公开模型 ID。每个 ID 可使用的端点均显示在对应行。

本指南会配置聊天模型吗?

不会。该 Model Line 使用页面所示的端点流程,不会被描述为 Agent 聊天模型。

开始在 Hermes Agent 中使用 Fish Audio

需要团队接入支持?

我们可以协助团队接入、完成系统集成并解答技术问题。

联系我们