音频 API

AI 音频与语音 API

通过公开音频目录使用文本转语音、声音克隆、转写和音效能力。 ElevenLabs, Fish Audio, Google

32 个音频模型 · 个公开音频端点
32
音频模型
6
提供商
89
公开端点
在线试用 实时
模型
文本
从这里开始下一次音频生成。选择公开模型,查看当前价格和端点详情。
声音 默认声音
格式 mp3
速度 1.0x
模式 text_to_speech

示例

聆听声音效果

Aria — Natural

"Every model, every provider, one API key. That's what RunAPI gives you."

Miles — Narration

"Generate video, music, images, and audio from a single integration."

Nova — Conversational

"Switch between providers without changing a single line of code."

Kai — Broadcast

"Production-ready AI infrastructure with built-in failover and monitoring."

audio endpoint 的全部功能

Text to Speech

Stream natural speech from text with per-request voice and speed control.

Voice Cloning

Build a reusable voice from a short reference sample, then call it by id like any other voice.

Speech to Text

Transcribe long-form audio with timestamps, speaker labels, and word-level confidence.

Text to Sound

Generate foley and sound effects from a description — impacts, ambience, UI cues.

Text to Dialogue

Render multi-speaker conversations with distinct voices and natural turn timing in one call.

Audio models on one key

ElevenLabs/audio-isolation

ElevenLabs

$0.12 / minute

ElevenLabs/sound-effect-v2

ElevenLabs

$0.15 / minute

ElevenLabs/speech-to-text

ElevenLabs

$0.04 / minute

ElevenLabs/text-to-dialogue-v3

ElevenLabs

$0.14 / 1K chars

ElevenLabs/text-to-speech-multilingual-v2

ElevenLabs

$0.12 / 1K chars

ElevenLabs/text-to-speech-turbo-v2.5

ElevenLabs

$0.06 / 1K chars

View all 32 audio models
快速开始

合成语音

curl https://runapi.ai/api/v1/elevenlabs/text_to_speech \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"text-to-speech-multilingual-v2","text":"Welcome to RunAPI.","voice":"Adam","language_code":"en"}'
使用方式

生成首个音频的四个步骤

  1. 获取 API 密钥

    一个密钥即可使用所有 TTS 和声音模型。

  2. 选择声音

    浏览受支持音频模型中的可用声音。

  3. 发送文本

    将文本和声音选择发送到 /api/v1/elevenlabs/text_to_speech。

  4. 获取音频

    从任务结果中接收生成的音频。

开发者选择 RunAPI 的理由

一个密钥,全部模型

无需再管理多组 API 密钥。一次集成即可访问所有提供商的 200 多个模型。

节省 15-25% 成本

我们与提供商的批量协议带来低于直接采购的价格,且不额外加价。

自动故障切换

提供商发生故障时,我们会将请求路由到下一个最佳选项,让你的应用持续运行。

兼容 OpenAI

可直接替换 OpenAI SDK。只需修改一行代码即可访问任意模型。

实时计费

只为实际使用付费。按请求计价、没有最低消费,并可按模型和项目追踪成本。

API Key 身份验证

使用你的 RunAPI API key 验证音频 API 请求。

团队用它构建的内容

语音代理

将流式 TTS 与 LLM 和转写结合,用一个密钥构建全双工语音循环。

本地化

用辨识度稳定的克隆声音,将现有视频配音为新的语言。

会议记录

使用说话人标签进行转写,再通过同一流程中的 LLM 端点生成摘要。

无障碍

无需录音,为文章、文档和应用内内容添加旁白。

RunAPI 与替代方案

功能 RunAPI 直接使用 ElevenLabs OpenAI TTS
声音模型 32 个音频模型 1 个提供商 6 个声音
价格 低至 $0.12 / minute 官方价格 官方价格
实时流式传输 支持 支持 不支持
统一计费 支持 不支持 不支持
MCP 服务器 支持 不支持 不支持
提供商故障切换 支持 不支持 不支持

Audio API 常见问题

TTS 如何计费?

按输入文本每 1,000 个字符以模型单价计费。转录按音频分钟数计费。

我可以克隆声音吗?

可以。上传参考音频样本以创建 voice id,之后的请求中传入该 id 即可。

支持流式输出吗?

是否支持流式输出取决于所选端点。集成播放功能前,请查看文档中的响应格式。

支持哪些语言?

支持的语言因模型而异,请查看所选模型文档中的语言说明。

你们会保存音频或声音样本吗?

请求和响应内容可能会被保留。数据处理详情请参阅隐私政策。

能获取词级时间戳吗?

时间戳支持情况及粒度取决于所选转写端点,请查看文档中的响应字段;说话人标签属于单独的能力。

为您的产品赋予声音

通过一个密钥使用语音合成、声音克隆与转录。免费开始,无需信用卡。

登录后生成

创建 API 密钥,通过账户运行音频请求。