Fish Audio · Audio & Musik

Hermes Agent x Fish Audio

Fish Audio bietet Text-to-Speech-Modelle für ausdrucksstarke Dialoge und zuverlässige professionelle Sprach-Workflows. RunAPI validiert jedes Ergebnis und gibt eine von RunAPI bereitgestellte MP3-URL mit Audio-Metadaten zurück.

3 variants ab $0.02 / 1K UTF-8-Bytes Kommerzielle Nutzung unterstützt

Prerequisite: npx runapi mcp install

Prompt

Prompt-Modelle

Verwende s1, wenn es zur Aufgabe passt: Ausdrucksstarke mehrsprachige Sprache für Dialog- und Erzählaudio.

You have access to RunAPI task tools for Fish Audio.

Available Fish Audio models:
- s1: Ausdrucksstarke mehrsprachige Sprache für Dialog- und Erzählaudio
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2-pro: Natürliche Sprache der vorherigen Generation für etablierte Produktions-Workflows
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2.1-pro: Empfohlenes Produktionsmodell mit 83 Sprachen und natürlicher Ausdruckssteuerung
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text

Use the model ID and endpoint that match the user's request.
Example prompt: Wandle diesen kurzen Dokumentartext in ausdrucksstarke, natürliche Sprache mit gleichmäßigem Sprechtempo um.
/api/v1/fish_audio/text_to_speech: Submit the request and verify the synchronous output. Sende POST an /api/v1/fish_audio/text_to_speech. Prüfe, ob die synchrone Antwort der API-Referenz des Endpunkts entspricht.

Öffentliche Versionen und Endpunkte

Modell-ID Endpunkte Startpreis Katalog
s1
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8-Bytes Modelldetails
s2-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8-Bytes Modelldetails
s2.1-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K UTF-8-Bytes Modelldetails

Überprüfen

Frage den Status ab, bis die Task einen Endstatus erreicht

Wähle <model-id>, um Prüfkommandos zu erzeugen.

Konfiguration

Guide-Endpunkt: <endpoint>

Wähle <model-id>, um eine Anfrage mit dem öffentlichen Eingabevertrag des Endpunkts zu erzeugen.

Zusätzliche Operationen

Diese Operationen verwenden keine Modell-ID.

  • /api/v1/fish_audio/list_voices
  • /api/v1/fish_audio/create_voice
  • /api/v1/fish_audio/get_voice
So funktioniert es

In 3 Schritten loslegen

  1. Modell-ID auswählen

    Wähle eine öffentliche Katalog-Modell-ID und prüfe ihren Endpunkt und aktuellen Startpreis.

  2. RunAPI konfigurieren

    Setze RUNAPI_API_KEY, bevor du die Endpunktanfrage sendest.

  3. Ergebnis überprüfen

    Frage bei asynchronen Endpunkten denselben Endpunkt ab, bis die Task einen Endstatus erreicht.

Was du mit Hermes Agent + Fish Audio bauen kannst

  • Voiceover und Sprechertext

    Wandle Skripte mit Modellen, die Sprache erzeugen, in gesprochenes Audio für Videos, Kurse und Produktdemos um.

  • Musik und Soundtracks

    Erstelle mit Modellen, die Musik erzeugen, Hintergrundmusik und Jingles aus einer Beschreibung von Genre, Stimmung und Tempo.

  • Transkription und Audioverarbeitung

    Transkribiere Aufnahmen oder bereinige und verändere vorhandenes Audio mit Modellen, die Audio als Eingabe akzeptieren.

Warum Fish Audio über RunAPI + Hermes Agent nutzen

  • 3 Varianten, ein API-Schlüssel

    Nutze eine RunAPI-Verbindung, um zwischen den verfügbaren Modellvarianten zu wählen, ohne deine Integration zu ändern.

  • Klare Nutzungspreise

    Sieh die aktuellen Katalogpreise vor jeder Anfrage ein, ohne Abonnement oder Mindestumsatz.

  • Direkte Antworten

    Synchrone Aufrufe liefern das Ergebnis in derselben Antwort, sodass dein Agent es sofort nutzen kann, ohne den Task-Status abzufragen.

Fragen zu Hermes Agent + Fish Audio

Was ist der Unterschied zwischen s1, s2-pro und s2.1-pro?

s1 ist auf ausdrucksstarke Dialoge und Erzählungen ausgelegt. s2.1-pro ist das empfohlene Produktionsmodell mit 83 Sprachen und natürlicher Ausdruckssteuerung; s2-pro bleibt als Modell der vorherigen Generation verfügbar.

Welches Audioformat gibt Fish Audio zurück?

Standardmäßig wird MP3 zurückgegeben; WAV kann explizit gewählt werden. Die RunAPI-Antwort enthält korrekte Metadaten zu Format, MIME-Typ und Dateigröße.

Kann ich die Stimme mit einer Referenzprobe steuern?

Du kannst eine zurückgegebene RunAPI voice_id in späteren Text-to-Speech- Anfragen ausprobieren, ihre Verfügbarkeit ist jedoch nicht garantiert. Nur für die aktuelle Anfrage kannst du über references Base64-Audio mit dem exakten Transkript übergeben.

Wird das generierte Audio von RunAPI gehostet?

Ja. RunAPI validiert und speichert das Ergebnis, bevor eine von RunAPI bereitgestellte Audio-URL zurückgegeben wird.

Muss ich den Abschluss per Polling abfragen?

Nein. Der Endpunkt arbeitet synchron und gibt das fertige Audio direkt in der erfolgreichen Antwort zurück.

Welche Modell-ID soll ich verwenden?

Wähle eine öffentliche Modell-ID aus der Versionstabelle. Jede ID stellt die in ihrer Zeile gezeigten Endpunkte bereit.

Konfiguriert diese Anleitung ein Chatmodell?

Nein. Diese Modelllinie verwendet den hier gezeigten Endpunktablauf und wird nicht als Agent-Chatmodell dargestellt.

Fish Audio mit Hermes Agent nutzen

Bauen Sie mit einem Team?

Wir helfen bei Enterprise-Setup, Integrationen und technischen Fragen.

Kontakt aufnehmen