Fish Audio · 音声・音楽

OpenClaw x Fish Audio

Fish Audioは、表現力豊かな会話音声と、安定した制作向け音声ワークフローのためのテキスト読み上げモデルを提供します。RunAPIは各結果を検証し、音声メタデータを含む、管理されたMP3 URLを返します。

3 variants から $0.02 / 1K UTF-8バイト 商用利用対応

Prerequisite: npx runapi mcp install

Prompt

プロンプトモデル

タスクに合う場合は s1 を使用してください: 会話やナレーション音声向けの表現力豊かな多言語音声。

You have access to RunAPI task tools for Fish Audio.

Available Fish Audio models:
- s1: 会話やナレーション音声向けの表現力豊かな多言語音声
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2-pro: 既存の制作ワークフロー向けの前世代の自然な音声
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2.1-pro: 83言語と自然言語による表現制御に対応した、制作向け推奨テキスト読み上げモデル
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text

Use the model ID and endpoint that match the user's request.
Example prompt: この短いドキュメンタリーのナレーションを、一定の話速を保った表現力豊かで自然な音声に変換してください。
/api/v1/fish_audio/text_to_speech: Submit the request and verify the synchronous output. POST /api/v1/fish_audio/text_to_speech を実行し、同期レスポンスがエンドポイントの API リファレンスと一致することを確認します。

公開バージョンとエンドポイント

モデル ID エンドポイント 開始価格 モデルカタログ
s1
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8バイト モデル詳細
s2-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8バイト モデル詳細
s2.1-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8バイト モデル詳細

検証

Task が終端状態になるまでポーリングします

<model-id> を選択すると検証コマンドが生成されます。

設定

ガイドエンドポイント: <endpoint>

<model-id> を選択すると、公開入力契約に基づくリクエストが生成されます。

追加操作

これらの操作ではモデル ID を使用しません。

  • /api/v1/fish_audio/list_voices
  • /api/v1/fish_audio/create_voice
  • /api/v1/fish_audio/get_voice
利用手順

3ステップで始める

  1. モデル ID を選択

    公開モデル ID を選び、エンドポイントと現在の開始価格を確認します。

  2. RunAPI を設定

    エンドポイントを呼び出す前に RUNAPI_API_KEY を設定します。

  3. 結果を検証

    非同期エンドポイントでは、Task が終端状態になるまで同じエンドポイントをポーリングします。

OpenClaw + Fish Audio で作れるもの

  • ナレーションと音声読み上げ

    音声を生成できるモデルで、台本を動画、講座、製品デモ用の音声に変換します。

  • 音楽とサウンドトラック

    音楽を生成できるモデルで、ジャンル、雰囲気、テンポの説明から BGM やジングルを作成します。

  • 文字起こしと音声処理

    音声入力に対応したモデルで、録音を文字起こししたり、既存の音声を整えたり変換したりします。

Fish Audio を RunAPI + OpenClaw で使う理由

  • 3 個のバリアントを 1 つの API キーで

    RunAPI の 1 つの接続から利用可能なモデルバリアントを選べるため、連携方法を変える必要がありません。

  • わかりやすい利用料金

    リクエストを送る前にカタログの現在の料金を確認できます。サブスクリプションや最低利用額はありません。

  • 直接のレスポンス

    同期呼び出しは同じレスポンスで結果を返すため、エージェントはタスクをポーリングせずにすぐ結果を使えます。

OpenClaw + Fish Audio に関するよくある質問

s1、s2-pro、s2.1-proの違いは何ですか?

s1は表現力豊かな会話や物語向けです。s2.1-proは83言語と自然言語による表現制御を備えた制作向け推奨モデルで、s2-proも前世代モデルとして引き続き利用できます。

Fish Audioはどの音声形式を返しますか?

デフォルトはMP3で、WAVも選択できます。RunAPIのレスポンスには実際の形式、MIMEタイプ、バイト数が含まれます。

リファレンスサンプルで音声をガイドできますか?

返されたRunAPIのvoice_idを後続のテキスト読み上げリクエストで試用できますが、利用可能性は保証されません。現在のリクエストだけを調整する場合は、referencesでbase64音声と正確な文字起こしを渡します。

生成された音声はRunAPIでホストされますか?

はい。RunAPIは結果を検証して保存した後、管理された音声URLを返します。

完了までポーリングする必要がありますか?

いいえ。このエンドポイントは同期型で、成功レスポンス内に生成済みの音声を直接返します。

どのモデル ID を使うべきですか?

バージョン表から公開モデル ID を選択してください。各 ID で利用できるエンドポイントが同じ行に表示されます。

このガイドはチャットモデルを設定しますか?

いいえ。この Model Line はここに示すエンドポイント手順を使用し、Agent のチャットモデルとしては扱いません。

OpenClawでFish Audioを使い始める

チームで構築していますか?

エンタープライズ導入、連携、技術的なご相談をお手伝いします。

お問い合わせ