Endpoint 覆盖
提供 1 个公开 endpoint:chat_completion。
Gemini 2.5 Flash-Lite;100 万上下文,默认关闭思考;OpenAI 兼容 Chat Completions
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "分析这段代码库,给出三项性能优化建议,包含优化前后的对比示例。"
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "分析这段代码库,给出三项性能优化建议,包含优化前后的对比示例。"}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "分析这段代码库,给出三项性能优化建议,包含优化前后的对比示例。" }]
});
11 个版本可用
Gemini 2.5 Flash-Lite 是 Google Gemini 2.5 代的 Flash-Lite 档位,面向大批量的分类、信息抽取和其他低延迟任务。它于 2025 年 7 月 22 日正式发布(GA),知识截止时间为 2025 年 1 月。上下文窗口为 1,048,576 token,最多输出 65,536 token。
思考默认关闭,Google 文档中提供了可选的思考模式,用于较难的提示。Google 在该模型上支持函数调用和结构化输出。
Google 的模型接受文本、图像、视频、音频和 PDF 输入。在 RunAPI 上,可通过 OpenAI 兼容的 Chat Completions 端点(/v1/chat/completions)发送文本;RunAPI 对该模型只接受文本输入。Google 建议新项目使用 Gemini 3.5 Flash-Lite,它在 RunAPI 上的模型 ID 为 gemini-3.5-flash-lite。
选择任意模型,几秒内开始生成。
| 提供商 | |
| 模型 ID | gemini-2.5-flash-lite |
| 模态 | 文本 |
| 任务类型 | Synchronous |
| API 端点 | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| 计费单位 | 1K tokens |
| 目录状态 | 运行中 |
免费注册后,在控制台创建用于 gemini-2.5-flash-lite 的 API 密钥。
向 /v1/chat/completions 发送 POST 请求,并传入 gemini-2.5-flash-lite 模型 ID 和参数。
直接从端点读取已完成的 gemini-2.5-flash-lite 响应。
提供 1 个公开 endpoint:chat_completion。
按 1K tokens 计量,无需订阅。
此端点尚未发布请求参数。
基于私有知识库回答客户问题,减少工单量。
起草合同摘要并标记关键条款供律师审阅。
在 CI 中自动生成单元测试、代码审查和重构建议。
该模型暂无已验证的用户反馈。
Google 建议新项目使用 Gemini 3.5 Flash-Lite 或 Gemini 3.8 Flash。如果现有工作负载、提示词集或评测是基于 gemini-2.5-flash-lite 搭建的,就继续用它。两个模型在 RunAPI 上共用同一个 API key。
能。Google 尚未公布它的停用日期,不过 Google 自己的 API 现在只向此前用过 2.5 模型的用户开放访问。在 RunAPI 上,所有账号都可以使用 gemini-2.5-flash-lite。
能。把 OpenAI SDK 指向 https://runapi.ai/v1,使用你的 RunAPI API key,发送 model 为 gemini-2.5-flash-lite 的 Chat Completions 请求。工具使用标准的 OpenAI tools 格式。
默认不会。Google 发布时就关闭了思考,以适应大批量、低延迟的任务,同时在文档中提供可选的思考模式。
传入 quickstart 中显示的模型 ID。
Key 级限流随使用层级伸缩。当前限制见定价页。
可以——变体只是参数,改 model 字段即可。
模型支持流式时,RunAPI 端到端流式。
在公共 GitHub 仓库提 issue 或邮件联系 support。