Versiones y endpoints públicos
| ID del modelo | Endpoints | Precio inicial | Catálogo |
|---|---|---|---|
s1
|
/api/v1/fish_audio/text_to_speech
|
$0.02 / 1K bytes UTF-8 | Detalle del modelo |
s2-pro
|
/api/v1/fish_audio/text_to_speech
|
$0.02 / 1K bytes UTF-8 | Detalle del modelo |
s2.1-pro
|
/api/v1/fish_audio/text_to_speech
|
$0.02 / 1K bytes UTF-8 | Detalle del modelo |
Verificar
Consulta hasta que la tarea alcance un estado final
Selecciona <model-id> para generar los comandos de verificación.
Configuración
Endpoint de la guía: <endpoint>
Selecciona <model-id> para generar una solicitud con el contrato de entrada público del endpoint.
Operaciones adicionales
Estas operaciones no usan un ID de modelo.
/api/v1/fish_audio/list_voices/api/v1/fish_audio/create_voice/api/v1/fish_audio/get_voice
Empieza en 3 pasos
-
Elige un ID de modelo
Selecciona un ID público del catálogo y revisa su endpoint y precio inicial actual.
-
Configura RunAPI
Define RUNAPI_API_KEY antes de enviar la solicitud al endpoint.
-
Verifica el resultado
Para endpoints asíncronos, consulta el mismo endpoint hasta que la Task alcance un estado final.
Qué puedes crear con Hermes Agent + Fish Audio
-
Locución y narración
Convierte guiones en audio hablado para vídeos, cursos y demos de producto con modelos que generan voz.
-
Música y bandas sonoras
Crea pistas de fondo y jingles a partir de una descripción de género, ambiente y tempo con modelos que generan música.
-
Transcripción y procesamiento de audio
Transcribe grabaciones o limpia y transforma audio existente con modelos que aceptan audio como entrada.
Por qué usar Fish Audio con RunAPI + Hermes Agent
-
3 variantes, una clave de API
Usa una sola conexión de RunAPI para elegir entre las variantes de modelo disponibles sin cambiar tu integración.
-
Precios de uso claros
Consulta los precios actuales del catálogo antes de enviar una solicitud, sin suscripción ni gasto mínimo.
-
Respuestas directas
Las llamadas síncronas devuelven el resultado en la misma respuesta, así tu agente puede usarlo de inmediato sin consultar el estado de una tarea.
Preguntas sobre Hermes Agent + Fish Audio
¿Cuál es la diferencia entre s1, s2-pro y s2.1-pro?
s1 está orientado a voz expresiva y narrativa. s2.1-pro es el modelo recomendado para producción con 83 idiomas y control de expresión; s2-pro sigue disponible como opción de la generación anterior.
¿Qué formato de audio devuelve Fish Audio?
MP3 es el formato predeterminado y también se puede elegir WAV. La respuesta incluye metadatos precisos de formato, tipo MIME y tamaño en bytes.
¿Puedo guiar la voz con una muestra de referencia?
Puedes intentar usar un voice_id de RunAPI devuelto en solicitudes posteriores de texto a voz, pero no se garantiza su disponibilidad. Para una sola solicitud, envía audio en base64 y su transcripción exacta mediante references.
¿Aloja RunAPI el audio generado?
Sí. RunAPI valida y almacena el resultado antes de devolver una URL de audio gestionada.
¿Tengo que hacer polling hasta que termine?
No. El endpoint es síncrono y devuelve el resultado de audio completo cuando la solicitud se completa correctamente.
¿Qué ID de modelo debo usar?
Elige un ID público en la tabla de versiones. Cada ID expone los endpoints mostrados en su fila.
¿Esta guía configura un modelo de chat?
No. Esta línea de modelos usa el flujo de endpoint mostrado y no se presenta como modelo de chat del agente.