Fish Audio API
透過 RunAPI 存取 Fish Audio API,提供富有表現力、支援多語言且適用正式製作的文字轉語音,並輸出代管 MP3。
curl -X POST https://runapi.ai/api/v1/fish_audio/text_to_speech \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "s1",
"text": "將這段簡短的紀錄片旁白轉成自然、富有表現力且節奏一致的語音。"
}'
import { FishAudioClient } from "@runapi.ai/fish-audio";
const client = new FishAudioClient();
const result = await client.textToSpeech.run({
model: "s1",
text: "將這段簡短的紀錄片旁白轉成自然、富有表現力且節奏一致的語音。",
});
require "runapi/fish_audio"
client = RunApi::FishAudio::Client.new
result = client.text_to_speech.run(
model: "s1",
text: "將這段簡短的紀錄片旁白轉成自然、富有表現力且節奏一致的語音。"
)
npx skills add runapi-ai/fish-audio -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
Fish Audio 透過同步 RunAPI 端點將文字轉為語音。s1 適合富有表現力的語音;s2.1-pro 是建議用於正式製作的模型,支援 83 種語言與自然語言表情控制;s2-pro 仍是可用的上一代選項。
- 多種變體可對應不同速度/品質等級
- Model skill 包含文件、schema 與 setup 備註
- 支援 app-focused coding workflows
- 生成失敗不收費
比較所有 API 變體
Utility endpoints
Shared endpoints for this model line, such as extension, enhancement, or conversion actions.
為 app 開發安裝 Fish Audio skill
將模型文件、schema、價格備註與 setup 步驟載入 coding workspace。
# Install the model skill for app development workflows
npx skills add runapi-ai/fish-audio -g
Install the Fish Audio skill for this app: 1. Add runapi-ai/fish-audio with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
從 model skill 到第一次結果,只要四步
選擇模型
挑選符合輸出類型、品質門檻與延遲目標的模型與變體。
設定
設定 RunAPI key,並在 coding workspace 安裝 model skill。
開發
使用 skill 指引,在你的 app 內加入模型功能。
接收
透過 task ID 查詢、在支援時串流,或處理 webhook callback。
什麼是 Fish Audio API?
Fish Audio 提供文字轉語音模型,適用於富有表現力的對話與穩定可靠的正式製作語音工作流程。RunAPI 會驗證每次生成結果,並回傳代管 MP3 URL 與音訊中繼資料。
為什麼透過 RunAPI 使用 Fish Audio API
一組驗證,全部供應商通用
一把 RunAPI 金鑰就能開通整個目錄。無需分開註冊帳戶,也不用為每個整合各自輪替金鑰。
統一價格與計費
以美元按次計費,每月結帳。失敗的生成不收費。
內含 schema 的 skill
型別化 schema 與 setup 備註打包在 model skill 內,讓實作從正確契約開始。
常見問題
s1、s2-pro 和 s2.1-pro 有什麼差別?
s1 適合富有表現力的語音;s2.1-pro 建議用於正式製作,支援 83 種語言與表情控制;s2-pro 仍是可用的上一代選項。
Fish Audio 會回傳哪種音訊格式?
預設回傳 MP3,也可選擇 WAV。RunAPI 回應會準確提供實際格式、MIME 類型與位元組大小。
可以用參考語音樣本引導音色嗎?
你可以嘗試在後續文字轉語音請求中使用回傳的 RunAPI voice_id,但不保證一直可用。若只需影響目前請求,也可以透過 references 傳入 base64 音訊及其逐字文字稿。
生成的音訊由 RunAPI 代管嗎?
是。RunAPI 會先驗證並儲存結果,再回傳代管音訊 URL。
需要輪詢完成狀態嗎?
不需要。此端點採同步處理,請求成功後會直接回傳完整的音訊結果。
我應該先從哪個版本開始?
先選擇符合你品質標準中最便宜的版本。大多數團隊會先用快速版本,之後再升級到專業版用於正式上線。
有免費方案嗎?
新帳戶可在每個模型上免費使用首次呼叫。之後則按次計費。
你們支援串流結果嗎?
只要該功能可用,RunAPI 會提供端到端串流。
失敗的請求如何計費?
生成失敗不會收費。
輸出結果有快取嗎?
生成結果會儲存,並可透過任務 ID 取回。輸入內容不會快取。
可以商業使用嗎?
可以——除非模型授權明確限制,否則每個版本都包含商業使用權;若有例外,會在版本頁面標示。
速率限制怎麼算?
每個金鑰的速率限制會依使用等級而提升。最新限制請參考定價頁面。
如果遇到問題,要去哪裡回報?
請在公開的 GitHub repo 開 issue,或寄信給支援。