Fish Audio API
Fish Audio API 提供富有表现力的多语言与生产级文本转语音,并返回托管 MP3。
curl -X POST https://runapi.ai/api/v1/fish_audio/text_to_speech \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "s1",
"text": "将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。"
}'
import { FishAudioClient } from "@runapi.ai/fish-audio";
const client = new FishAudioClient();
const result = await client.textToSpeech.run({
model: "s1",
text: "将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。",
});
require "runapi/fish_audio"
client = RunApi::FishAudio::Client.new
result = client.text_to_speech.run(
model: "s1",
text: "将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。"
)
npx skills add runapi-ai/fish-audio -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
Fish Audio 通过同步 RunAPI 端点将文本转换为语音。s1 适合富有表现力的语音;s2.1-pro 是推荐用于生产的模型,支持 83 种语言与自然语言表情控制;s2-pro 仍可用于上一代工作流。
- 多变体覆盖不同速度/质量层级
- Model skill 包含文档、schema 和接入说明
- 适合面向应用的编码工作流
- 失败的生成不计费
对比全部 API 变体
Utility endpoints
Shared endpoints for this model line, such as extension, enhancement, or conversion actions.
为应用开发安装 Fish Audio skill
把模型文档、schema、定价说明和接入步骤加载进代码工作区。
# Install the model skill for app development workflows
npx skills add runapi-ai/fish-audio -g
Install the Fish Audio skill for this app: 1. Add runapi-ai/fish-audio with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
四步从 model skill 到首次结果
选择模型
根据输出类型、质量要求和延迟目标选择模型与变体。
配置
设置 RunAPI key,并在代码工作区安装对应 model skill。
调用
按 skill 里的说明,把模型能力接入到你的应用里。
接收
按 task ID 轮询、在支持时使用流式,或处理 webhook 回调。
Fish Audio API 是什么?
Fish Audio 为表现力对话和可靠的生产语音工作流提供文本转语音模型。RunAPI 会校验每个结果,并返回带音频元数据的托管 MP3 URL。
为什么用 RunAPI 调用 Fish Audio API
一把认证,覆盖所有提供方
一把 RunAPI key 解锁整个模型目录。无需为每家提供方单独建账户。
统一的定价与账单
USD 按次定价,按月结算。失败的生成不计费。
Schema 优先的 SDK
Typed schema 和接入说明已打包进 model skill,让实现从正确契约开始。
常见问题
s1、s2-pro 和 s2.1-pro 有什么区别?
s1 面向富有表现力的语音;s2.1-pro 是推荐的生产模型,支持 83 种语言与自然语言表情控制;s2-pro 仍作为上一代选项提供。
Fish Audio 返回什么音频格式?
默认返回 MP3,也可选择 WAV。RunAPI 响应会准确提供实际格式、MIME 类型与字节大小。
可以用参考样本引导音色吗?
你可以尝试在后续文本转语音请求中使用返回的 RunAPI voice_id,但不保证始终可用。若只需影响当前请求,也可以通过 references 传入 base64 音频及其精确文本。
生成的音频由 RunAPI 托管吗?
是。RunAPI 会在返回托管音频 URL 前校验并存储结果。
需要轮询任务状态吗?
不需要。该端点为同步请求,成功响应会直接返回已完成的音频结果。
应该从哪个变体开始?
选满足质量要求的最便宜变体。多数团队从 fast 起步,生产时升级到 pro。
有免费额度吗?
新账户每个模型都有免费调用额度,之后按次计费。
支持流式吗?
模型支持流式时,RunAPI 端到端流式。
失败怎么计费?
失败的生成不计费。
输出会缓存吗?
输出按任务 ID 存储在 R2 供回取。输入不缓存。
可以商用吗?
可以——所有变体默认含商用许可,除非模型许可明确限制;有例外会在变体页面注明。
速率限制?
Key 级限流随使用层级伸缩。当前限制见定价页。
在哪里报问题?
在公共 GitHub 仓库提 issue 或邮件联系 support。