It looks like you may prefer a different language. Switch anytime.

Audio & Music Fish Audio

Fish Audio API

通过 RunAPI 使用 Fish Audio API,配套 model skill、统一认证和按需计费。

runapi.ai
curl -X POST https://runapi.ai/api/v1/fish_audio/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "s1",
  "text": "将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。"
}'
import { FishAudioClient } from "@runapi.ai/fish-audio";

const client = new FishAudioClient();
const result = await client.textToSpeech.run({
    model: "s1",
    text: "将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。",
});
require "runapi/fish_audio"

client = RunApi::FishAudio::Client.new
result = client.text_to_speech.run(
    model: "s1",
    text: "将这段简短纪录片旁白转换为富有表现力、节奏稳定的自然语音。"
)
npx skills add runapi-ai/fish-audio -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/fish-audio v1
概览

关于 Fish Audio

Fish Audio 通过同步 RunAPI 端点将文本转换为语音。s1 适合富有表现力的语音;s2.1-pro 是推荐用于生产的模型,支持 83 种语言与自然语言表情控制;s2-pro 仍可用于上一代工作流。

提供方
Fish Audio
模态
Audio & Music

对比全部 API 变体

变体 计费方式 价格
s1 1K UTF-8 bytes $0.020 查看 →
s2-pro 1K UTF-8 bytes $0.020 查看 →
s2.1-pro 1K UTF-8 bytes $0.020 查看 →
定价

Fish Audio 定价

Endpoint 分辨率 时长 价格
text_to_speech $0.02 / 1K UTF-8 bytes

当前价格适用于 s1。其他变体保留各自的 endpoint 定价。

定价

通用 Endpoint

该系列模型共用的 endpoint,包括扩展、增强或转换等操作。

List voices
Free / request
Create voice
Free / track
Get voice
Free / request
Agent 集成

通过 Agent 运行 Fish Audio

工作流程

开始使用 Fish Audio

  1. 选择模型

    根据输出类型、质量要求和延迟目标选择模型与变体。

  2. 配置

    设置 RunAPI key,并在代码工作区安装对应 model skill。

  3. 调用

    按 skill 里的说明,把模型能力接入到你的应用里。

  4. 接收

    按 task ID 轮询、在支持时使用流式,或处理 webhook 回调。

背景

Fish Audio API 是什么?

Fish Audio 为表现力对话和可靠的生产语音工作流提供文本转语音模型。RunAPI 会校验每个结果,并返回带音频元数据的托管 MP3 URL。

提供方
Fish Audio
查看全部 →
模态
Audio & Music
浏览模型 →

为什么用 RunAPI 调用 Fish Audio API

统一认证,接入所有提供方

一把 RunAPI key 解锁整个模型目录。无需为每家提供方单独建账户。

统一的定价与账单

USD 按次定价,按月结算。失败的生成不计费。

Schema 优先的 SDK

Typed schema 和接入说明已打包进 model skill,让实现从正确契约开始。

Fish Audio 常见问题

s1、s2-pro 和 s2.1-pro 有什么区别?

s1 面向富有表现力的语音;s2.1-pro 是推荐的生产模型,支持 83 种语言与自然语言表情控制;s2-pro 仍作为上一代选项提供。

Fish Audio 返回什么音频格式?

默认返回 MP3,也可选择 WAV。RunAPI 响应会准确提供实际格式、MIME 类型与字节大小。

可以用参考样本引导音色吗?

你可以尝试在后续文本转语音请求中使用返回的 RunAPI voice_id,但不保证始终可用。若只需影响当前请求,也可以通过 references 传入 base64 音频及其精确文本。

生成的音频由 RunAPI 托管吗?

是。RunAPI 会在返回托管音频 URL 前校验并存储结果。

需要轮询任务状态吗?

不需要。该端点为同步请求,成功响应会直接返回已完成的音频结果。

应该从哪个变体开始?

选满足质量要求的最便宜变体。多数团队从 fast 起步,生产时升级到 pro。

相似模型

如果喜欢 Fish Audio API,也可以试试这些

立即体验 Fish Audio API。