Fish Audio · Audio e musica

Hermes Agent x Fish Audio

Fish Audio offre modelli di sintesi vocale per dialoghi espressivi e workflow vocali di produzione affidabili. RunAPI convalida ogni risultato e restituisce un URL MP3 gestito con i relativi metadati audio.

3 variants da $0.02 / 1K byte UTF-8 Uso commerciale consentito

Prerequisite: npx runapi mcp install

Prompt

Modelli del prompt

Usa s1 quando è adatto all'attività: Voce multilingue espressiva per audio conversazionali e narrativi.

You have access to RunAPI task tools for Fish Audio.

Available Fish Audio models:
- s1: Voce multilingue espressiva per audio conversazionali e narrativi
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2-pro: Voce naturale di generazione precedente per workflow di produzione consolidati
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2.1-pro: Sintesi vocale consigliata per la produzione, 83 lingue e controllo naturale dell’espressione
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text

Use the model ID and endpoint that match the user's request.
Example prompt: Trasforma questa breve narrazione documentaria in una voce espressiva e naturale, mantenendo un ritmo uniforme.
/api/v1/fish_audio/text_to_speech: Submit the request and verify the synchronous output. Invia POST a /api/v1/fish_audio/text_to_speech. Verifica che la risposta sincrona corrisponda al riferimento API dell’endpoint.

Versioni ed endpoint pubblici

ID modello Endpoint Prezzo iniziale Catalogo
s1
/api/v1/fish_audio/text_to_speech
$0.02 / 1K byte UTF-8 Dettagli modello
s2-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K byte UTF-8 Dettagli modello
s2.1-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1K byte UTF-8 Dettagli modello

Verifica

Esegui il polling finché la Task non raggiunge uno stato terminale

Seleziona <model-id> per generare i comandi di verifica.

Configurazione

Endpoint della guida: <endpoint>

Seleziona <model-id> per generare una richiesta con il contratto di input pubblico dell’endpoint.

Operazioni aggiuntive

Queste operazioni non usano un ID modello.

  • /api/v1/fish_audio/list_voices
  • /api/v1/fish_audio/create_voice
  • /api/v1/fish_audio/get_voice
Come funziona

Inizia in 3 passaggi

  1. Scegli un ID modello

    Seleziona un ID pubblico del catalogo e controlla il relativo endpoint e il prezzo iniziale corrente.

  2. Configura RunAPI

    Imposta RUNAPI_API_KEY prima di inviare la richiesta all’endpoint.

  3. Verifica il risultato

    Per gli endpoint asincroni, interroga lo stesso endpoint finché la Task non raggiunge uno stato finale.

Cosa puoi creare con Hermes Agent + Fish Audio

  • Voiceover e narrazione

    Trasforma copioni in audio parlato per video, corsi e demo di prodotto con modelli che generano voce.

  • Musica e colonne sonore

    Crea basi musicali e jingle da una descrizione di genere, atmosfera e tempo con modelli che generano musica.

  • Trascrizione ed elaborazione audio

    Trascrivi registrazioni oppure pulisci e trasforma audio esistente con modelli che accettano audio in ingresso.

Perché usare Fish Audio con RunAPI + Hermes Agent

  • 3 varianti, una chiave API

    Usa una sola connessione RunAPI per scegliere tra le varianti del modello disponibili senza modificare la tua integrazione.

  • Prezzi d'uso chiari

    Visualizza i prezzi attuali del catalogo prima di inviare una richiesta, senza abbonamento o spesa minima.

  • Risposte dirette

    Le chiamate sincrone restituiscono il risultato nella stessa risposta, così il tuo agente può usarlo subito senza interrogare lo stato di un task.

Domande su Hermes Agent + Fish Audio

Qual è la differenza tra s1, s2-pro e s2.1-pro?

s1 è pensato per conversazioni e narrazioni espressive. s2.1-pro è consigliato per la produzione con 83 lingue e controllo dell'espressione; s2-pro resta disponibile come opzione della generazione precedente.

Quale formato audio restituisce Fish Audio?

Il formato predefinito è MP3 ed è possibile scegliere WAV. La risposta RunAPI include formato, tipo MIME e dimensione in byte accurati.

Posso guidare la voce con un campione di riferimento?

Sì. Crea una voce appartenente all'account e usa il relativo voice_id RunAPI nelle richieste di sintesi vocale successive. Per influire solo sulla richiesta corrente, passa l'audio in base64 e la trascrizione esatta tramite references.

L'audio generato è ospitato da RunAPI?

Sì. RunAPI convalida e archivia il risultato prima di restituire un URL audio gestito.

Devo usare il polling fino al completamento?

No. L'endpoint è sincrono e restituisce il risultato audio completato direttamente nella risposta alla richiesta riuscita.

Quale ID modello devo usare?

Scegli un ID pubblico dalla tabella delle versioni. Ogni ID espone gli endpoint mostrati nella sua riga.

Questa guida configura un modello di chat?

No. Questa linea di modelli usa il flusso dell’endpoint mostrato e non viene presentata come modello di chat dell’agente.

Inizia a usare Fish Audio con Hermes Agent

Stai costruendo con un team?

Ti aiutiamo con la configurazione enterprise, le integrazioni e le domande tecniche.

Contattaci