Fish Audio · 오디오 & 음악

OpenClaw x Fish Audio

Fish Audio는 표현력 있는 대화와 안정적인 프로덕션 음성 워크플로에 특화된 텍스트 음성 변환(TTS) 모델을 제공합니다. RunAPI는 결과를 검증한 뒤 오디오 메타데이터와 함께 RunAPI가 관리하는 MP3 URL을 반환합니다.

3 variants 최저 $0.02 / 1,000 UTF-8 바이트 상업적 사용 지원

Prerequisite: npx runapi mcp install

Prompt

프롬프트 모델

작업에 맞는 경우 s1를 사용하세요: 대화형 및 내레이션 오디오를 위한 표현력 있는 다국어 음성.

You have access to RunAPI task tools for Fish Audio.

Available Fish Audio models:
- s1: 대화형 및 내레이션 오디오를 위한 표현력 있는 다국어 음성
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2-pro: 기존 프로덕션 워크플로를 위한 이전 세대의 자연스러운 음성
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text
- s2.1-pro: 83개 언어와 자연어 표현 제어를 지원하는 프로덕션 권장 텍스트 음성 변환 모델
  endpoints: /api/v1/fish_audio/text_to_speech
  request fields: model, text

Use the model ID and endpoint that match the user's request.
Example prompt: 이 짧은 다큐멘터리 내레이션을 일정한 말하기 속도와 자연스럽고 풍부한 감정 표현을 갖춘 음성으로 변환하세요.
/api/v1/fish_audio/text_to_speech: Submit the request and verify the synchronous output. POST /api/v1/fish_audio/text_to_speech를 실행하고 동기 응답이 엔드포인트 API 레퍼런스와 일치하는지 확인합니다.

공개 버전 및 엔드포인트

모델 ID 엔드포인트 시작 가격 모델 카탈로그
s1
/api/v1/fish_audio/text_to_speech
$0.02 / 1,000 UTF-8 바이트 모델 상세
s2-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1,000 UTF-8 바이트 모델 상세
s2.1-pro
/api/v1/fish_audio/text_to_speech
$0.02 / 1,000 UTF-8 바이트 모델 상세

검증

Task가 최종 상태에 도달할 때까지 폴링합니다

<model-id>를 선택하면 검증 명령을 생성합니다.

설정

가이드 엔드포인트: <endpoint>

<model-id>를 선택하면 엔드포인트의 공개 입력 계약에 맞는 요청을 생성합니다.

추가 작업

이 작업들은 모델 ID를 사용하지 않습니다.

  • /api/v1/fish_audio/list_voices
  • /api/v1/fish_audio/create_voice
  • /api/v1/fish_audio/get_voice
사용 절차

3단계로 시작하기

  1. 모델 ID 선택

    공개 모델 ID를 선택하고 엔드포인트와 현재 시작 가격을 확인합니다.

  2. RunAPI 설정

    엔드포인트 요청 전에 RUNAPI_API_KEY를 설정합니다.

  3. 결과 검증

    비동기 엔드포인트는 Task가 최종 상태가 될 때까지 같은 엔드포인트를 폴링합니다.

OpenClaw + Fish Audio로 만들 수 있는 것

  • 보이스오버와 내레이션

    음성을 생성하는 모델로 대본을 영상, 강의, 제품 데모용 음성으로 바꿉니다.

  • 음악과 사운드트랙

    음악을 생성하는 모델로 장르, 분위기, 템포 설명에서 배경 음악과 징글을 만듭니다.

  • 전사와 오디오 처리

    오디오 입력을 받는 모델로 녹음을 텍스트로 전사하거나 기존 오디오를 정리하고 변환합니다.

Fish Audio을(를) RunAPI + OpenClaw로 사용하는 이유

  • 3개 변형 모델, 하나의 API 키

    하나의 RunAPI 연결에서 사용 가능한 모델 변형을 선택할 수 있어 통합 방식을 바꿀 필요가 없습니다.

  • 명확한 사용 요금

    요청을 보내기 전에 현재 카탈로그 요금을 확인하세요. 구독이나 최소 사용 금액이 없습니다.

  • 즉시 응답

    동기 호출은 같은 응답 안에 결과를 반환하므로 에이전트가 작업 상태를 폴링하지 않고 바로 결과를 사용할 수 있습니다.

OpenClaw + Fish Audio 자주 묻는 질문

s1, s2-pro, s2.1-pro의 차이점은 무엇인가요?

s1은 표현력 있는 대화와 내레이션에 적합합니다. s2.1-pro는 83개 언어와 자연어 표현 제어를 지원하는 프로덕션 권장 모델이며, s2-pro도 이전 세대 옵션으로 계속 사용할 수 있습니다.

Fish Audio는 어떤 오디오 형식을 반환하나요?

기본 형식은 MP3이며 WAV도 선택할 수 있습니다. RunAPI 응답에는 실제 형식, MIME 유형, 바이트 크기가 포함됩니다.

참조 샘플로 음성을 유도할 수 있나요?

반환된 RunAPI voice_id를 이후 텍스트 음성 변환 요청에서 사용해 볼 수 있지만 가용성은 보장되지 않습니다. 현재 요청에만 적용하려면 references로 base64 오디오와 정확한 스크립트를 전달하세요.

생성된 오디오는 RunAPI에서 호스팅하나요?

네. RunAPI는 결과를 검증해 저장한 뒤 RunAPI가 관리하는 오디오 URL을 반환합니다.

완료될 때까지 폴링해야 하나요?

아니요. 이 엔드포인트는 동기식이며 요청이 성공하면 완성된 오디오를 바로 반환합니다.

어떤 모델 ID를 사용해야 하나요?

버전 표에서 공개 모델 ID를 선택하세요. 각 ID가 제공하는 엔드포인트는 해당 행에 표시됩니다.

이 가이드는 채팅 모델을 설정하나요?

아니요. 이 Model Line은 여기에 표시된 엔드포인트 절차를 사용하며 Agent 채팅 모델로 제공되지 않습니다.

OpenClaw에서 Fish Audio 사용 시작하기

팀과 함께 구축하고 계신가요?

엔터프라이즈 설정, 통합, 기술 문의를 도와드립니다.

문의하기