公開バージョンとエンドポイント
検証
Task が終端状態になるまでポーリングします
<model-id> を選択すると検証コマンドが生成されます。
設定
ガイドエンドポイント: <endpoint>
<model-id> を選択すると、公開入力契約に基づくリクエストが生成されます。
追加操作
これらの操作ではモデル ID を使用しません。
/api/v1/fish_audio/list_voices/api/v1/fish_audio/create_voice/api/v1/fish_audio/get_voice
3ステップで始める
-
モデル ID を選択
公開モデル ID を選び、エンドポイントと現在の開始価格を確認します。
-
RunAPI を設定
エンドポイントを呼び出す前に RUNAPI_API_KEY を設定します。
-
結果を検証
非同期エンドポイントでは、Task が終端状態になるまで同じエンドポイントをポーリングします。
Hermes Agent + Fish Audio で作れるもの
-
ナレーションと音声読み上げ
音声を生成できるモデルで、台本を動画、講座、製品デモ用の音声に変換します。
-
音楽とサウンドトラック
音楽を生成できるモデルで、ジャンル、雰囲気、テンポの説明から BGM やジングルを作成します。
-
文字起こしと音声処理
音声入力に対応したモデルで、録音を文字起こししたり、既存の音声を整えたり変換したりします。
Fish Audio を RunAPI + Hermes Agent で使う理由
-
3 個のバリアントを 1 つの API キーで
RunAPI の 1 つの接続から利用可能なモデルバリアントを選べるため、連携方法を変える必要がありません。
-
わかりやすい利用料金
リクエストを送る前にカタログの現在の料金を確認できます。サブスクリプションや最低利用額はありません。
-
直接のレスポンス
同期呼び出しは同じレスポンスで結果を返すため、エージェントはタスクをポーリングせずにすぐ結果を使えます。
Hermes Agent + Fish Audio に関するよくある質問
s1、s2-pro、s2.1-proの違いは何ですか?
s1は表現力豊かな会話や物語向けです。s2.1-proは83言語と自然言語による表現制御を備えた制作向け推奨モデルで、s2-proも前世代モデルとして引き続き利用できます。
Fish Audioはどの音声形式を返しますか?
デフォルトはMP3で、WAVも選択できます。RunAPIのレスポンスには実際の形式、MIMEタイプ、バイト数が含まれます。
リファレンスサンプルで音声をガイドできますか?
返されたRunAPIのvoice_idを後続のテキスト読み上げリクエストで試用できますが、利用可能性は保証されません。現在のリクエストだけを調整する場合は、referencesでbase64音声と正確な文字起こしを渡します。
生成された音声はRunAPIでホストされますか?
はい。RunAPIは結果を検証して保存した後、管理された音声URLを返します。
完了までポーリングする必要がありますか?
いいえ。このエンドポイントは同期型で、成功レスポンス内に生成済みの音声を直接返します。
どのモデル ID を使うべきですか?
バージョン表から公開モデル ID を選択してください。各 ID で利用できるエンドポイントが同じ行に表示されます。
このガイドはチャットモデルを設定しますか?
いいえ。この Model Line はここに示すエンドポイント手順を使用し、Agent のチャットモデルとしては扱いません。