Audio & Music · Fish Audio

Fish Audio API

Acesso à API da Fish Audio para text-to-speech multilíngue, expressivo e pronto para produção, com saída MP3 gerenciada.

Operacional · 3 variants · a partir de $0.0000
runapi.ai
curl -X POST https://runapi.ai/api/v1/fish_audio/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "s1",
  "text": "Transforme esta breve narração de documentário em uma fala expressiva e natural, mantendo um ritmo consistente."
}'
import { FishAudioClient } from "@runapi.ai/fish-audio";

const client = new FishAudioClient();
const result = await client.textToSpeech.run({
    model: "s1",
    text: "Transforme esta breve narração de documentário em uma fala expressiva e natural, mantendo um ritmo consistente.",
});
require "runapi/fish_audio"

client = RunApi::FishAudio::Client.new
result = client.text_to_speech.run(
    model: "s1",
    text: "Transforme esta breve narração de documentário em uma fala expressiva e natural, mantendo um ritmo consistente."
)
npx skills add runapi-ai/fish-audio -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp

# Codex
codex plugin install runapi-mcp@agents

# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
@runapi.ai/fish-audio v1
VISÃO GERAL

Fish Audio converte texto em fala por um endpoint síncrono do RunAPI. Escolha s1 para áudio expressivo ou s2.1-pro como modelo recomendado para produção com 83 idiomas e controle de expressão em linguagem natural. O s2-pro continua disponível para fluxos da geração anterior.

  • Variantes para diferentes metas de qualidade e latência
  • API key unificada
  • O model skill inclui documentação, schemas e notas de setup
  • Gerações com falha não são cobradas
VARIANTES

Variantes

Variant Billing Pricing
s1 1K UTF-8 bytes $0.020 Ver →
s2-pro 1K UTF-8 bytes $0.020 Ver →
s2.1-pro 1K UTF-8 bytes $0.020 Ver →
PREÇOS

Utility endpoints

Shared endpoints for this model line, such as extension, enhancement, or conversion actions.

List voices
Free / request
Create voice
Free / track
Get voice
Free / request
MODELS

Instale o skill Fish Audio para desenvolver apps

Carregue documentação do modelo, schemas, notas de preço e etapas de setup no seu workspace de código.

# Install the model skill for app development workflows
npx skills add runapi-ai/fish-audio -g
Installs docs, schemas, pricing context, and setup notes into your developer workspace.
Or use this setup request in your coding tool:
Install the Fish Audio skill for this app:

1. Add runapi-ai/fish-audio with the skills installer.
2. Load SKILL.md in this workspace.
3. Use its docs, schemas, pricing notes, and setup steps when adding model features.
4. Confirm the install path when done.
COMO FUNCIONA

Como construir com este model skill

01

Escolha o modelo

Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.

02

Autentique uma vez

Use sua chave RunAPI para todos os modelos compatíveis.

03

Instale o skill

Adicione o model skill ao workspace de código antes de implementar a funcionalidade.

04

Receba a saída

Consulte por task ID ou trate o callback quando a geração terminar.

CONTEXTO

Onde Fish Audio se encaixa

Fish Audio oferece modelos de text-to-speech para diálogos expressivos e fluxos confiáveis de produção de voz. O RunAPI valida cada resultado e retorna uma URL de MP3 gerenciada com os metadados do áudio.

Provider
Fish Audio
Modality
Audio & Music
POR QUE RUNAPI

Por que usar Fish Audio pela RunAPI

Uma API key

Use as mesmas credenciais entre modelos e provedores.

Pronto para skills

O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.

Cobrança previsível

O preço por uso fica visível antes da chamada.

FAQ

Perguntas frequentes

Qual é a diferença entre s1, s2-pro e s2.1-pro?

s1 é voltado a falas expressivas. O s2.1-pro é recomendado para produção, com 83 idiomas e controle de expressão; o s2-pro segue disponível como geração anterior.

Qual formato de áudio o Fish Audio retorna?

MP3 é o formato padrão e WAV pode ser selecionado. A resposta do RunAPI inclui formato, tipo MIME e tamanho em bytes corretos.

Posso guiar a voz com uma amostra de referência?

Você pode tentar usar um voice_id retornado pelo RunAPI em solicitações posteriores de texto para voz, mas a disponibilidade não é garantida. Para uma única solicitação, envie o áudio em base64 e a transcrição exata por references.

O áudio gerado fica hospedado no RunAPI?

Sim. O RunAPI valida e armazena o resultado antes de retornar uma URL de áudio gerenciada.

Preciso fazer polling até a conclusão?

Não. O endpoint é síncrono e retorna o áudio concluído na resposta bem-sucedida.

Como chamo este modelo?

Instale o model skill e siga as notas de setup com sua chave RunAPI.

Gerações com falha custam dinheiro?

Gerações com falha não são cobradas

Posso chamar a partir da minha aplicação?

Sim. Instale o model skill no workspace de código e use durante a implementação da funcionalidade.

COMEÇAR

Comece a construir com Fish Audio.