LLM API

LLM API — 兼容 OpenAI

通过一个兼容 OpenAI 的 endpoint 访问 Claude、GPT、GeminiDeepSeek 和 Grok。支持 /v1/chat/completions、/v1/messages、/v1/responses。

67 个模型 直接替换 base_url 按 token 付费

67
LLM 模型
15-25%
低于官方价格
2 行代码
迁移方式

操作台

实时
模型
消息
Refactor this handler to stream partial results and return a typed error on timeout.
最大 token 数
integer | null
温度
number | null
流式输出
false
Endpoint
/v1/chat/completions
预估费用
$0.22 / 1M in $0.30 / 1M in $0.41 / 1M in $2.50 / 1M in
示例

多模型对比

Prompt 用一句话解释量子计算

Claude/claude-fable-5

通过 /v1/messages 调用 Claude/claude-fable-5。
使用同一 RunAPI key 和相同的请求格式,对比各模型的输出结果。

Anthropic Input $10.00 / 1M tokens | Output $50.00 / 1M tokens

Claude/claude-fable-5-1

通过 /v1/messages 调用 Claude/claude-fable-5-1。
使用同一 RunAPI key 和相同的请求格式,对比各模型的输出结果。

Anthropic Input $10.00 / 1M tokens | Output $50.00 / 1M tokens

Claude/claude-haiku-4-5-20251001

通过 /v1/messages 调用 Claude/claude-haiku-4-5-20251001。
使用同一 RunAPI key 和相同的请求格式,对比各模型的输出结果。

Anthropic Input $0.60 / 1M tokens | Output $3.00 / 1M tokens

4 种 endpoint 格式,一个 key

Chat completion

各类 SDK 通用的 OpenAI 请求格式。替换 base_url,保留现有请求代码。

Message

适用于系统提示、工具调用和结构化内容块的 Messages API 格式。

Response

适用于多轮 agent 循环、支持服务端会话管理的有状态请求格式。

Embedding

用于检索的向量 embedding,使用同一 RunAPI key 按 token 计费。

一个 key,所有 LLM

Claude/claude-fable-5

Anthropic

$10.00 / 1M in

Claude/claude-fable-5-1

Anthropic

$10.00 / 1M in

Claude/claude-haiku-4-5-20251001

Anthropic

$0.60 / 1M in

Claude/claude-opus-4-1-20250805

Anthropic

$9.00 / 1M in

Claude/claude-opus-4-5-20251101

Anthropic

$3.00 / 1M in

Claude/claude-opus-4-6

Anthropic

$3.00 / 1M in

Claude/claude-opus-4-7

Anthropic

$3.00 / 1M in

Claude/claude-opus-4-8

Anthropic

$3.00 / 1M in

查看全部 67 个 LLM 模型
快速入门

使用 OpenAI 格式调用任意模型

curl https://runapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Explain the difference between concurrency and parallelism."}]}'
使用方式

四步完成首次生成

  1. 获取 API Key

    为你的 RunAPI 账户创建一个 Key。

  2. 使用 OpenAI 格式

    通过文档中的 OpenAI 兼容端点发送请求。

  3. 智能路由

    RunAPI 为你的请求选择受支持的路由。

  4. 流式返回

    在所选端点支持 SSE 时接收流式输出。

开发者选择 RunAPI 的理由

一个 Key,所有模型

无需管理多套 API 密钥。一次接入,即可访问全部 230+ 个模型。

节省 15-25% 成本

我们与服务商的批量协议让我们能够提供低于直接采购的价格,无任何加价。

自动故障转移

若某服务商出现故障,我们将自动路由至次优选项,确保您的应用持续可用。

兼容 OpenAI

OpenAI SDK 的直接替代方案。修改一行代码即可访问任意模型。

实时账单

只为实际用量付费。按请求计费,无最低消费。支持按模型、按项目追踪费用。

数据隐私

隐私政策说明了请求数据和生成内容的处理与保存方式。

团队的典型应用场景

编程 Agent

将规划任务路由至 Opus,将编辑任务交给低价模型,一个 key,一张账单。

RAG 流水线

Embedding 与生成共用同一 endpoint,检索与问答共享同一预算。

内容生成

将同一 prompt 分发至多个模型并保留最佳结果,无需签署五份服务商合同。

多模型对比

只需修改一个字符串,即可对 Claude、GPT 和 Gemini 进行同 prompt A/B 测试。

RunAPI 与其他方案对比

功能 RunAPI OpenRouter 直接调用 API
LLM 模型 66 300+ 1 个提供商
其他模态 视频、图像、音乐、音频 按服务商
定价 低于官方价格 15-25% 市场价 官方费率
原生 Messages API
统一积分
MCP server + CLI

LLM API 常见问题

如何从兼容 OpenAI 的客户端迁移?

将客户端指向 RunAPI 文档中的 base URL,并使用您的 RunAPI key。保持所选 endpoint 支持的请求格式不变。

支持流式输出吗?

当所选模型和 endpoint 在其运行时协议中支持流式响应时,即可使用流式输出。

工具调用可用吗?

在运行时协议中声明了工具支持的模型和 endpoint 格式上,即可使用工具调用。

token 如何计费?

输入和输出费率已在模型目录中列出。费用根据请求上报的 token 用量计算。

应该使用哪个 endpoint?

选择与您现有客户端匹配、且满足请求所需功能的 endpoint 格式。

如果某个路由不可用怎么办?

API 会通过其文档化的响应协议返回请求状态,您的应用可据此进行重试或切换到其他支持的模型。

修改两行代码,保留其余代码

您已在使用的 OpenAI 格式背后有 67 个模型可供调用。免费开始,无需信用卡。