Cobertura de endpoints
Expõe 1 endpoint(s) público(s): chat_completion.
Gemini 2.5 Flash-Lite; contexto de 1M, thinking desativado por padrão; Chat Completions compatível com OpenAI
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Analise esta base de código e sugira três melhorias de performance com exemplos antes/depois."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Analise esta base de código e sugira três melhorias de performance com exemplos antes/depois."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Analise esta base de código e sugira três melhorias de performance com exemplos antes/depois." }]
});
11 variantes disponíveis
O Gemini 2.5 Flash-Lite é o nível Flash-Lite da geração Gemini 2.5 do Google, voltado para classificação, extração e outros trabalhos de baixa latência em grande volume. Ele ficou disponível de forma geral em 22 de julho de 2025, com data de corte de conhecimento em janeiro de 2025. A janela de contexto é de 1.048.576 tokens e a saída chega a 65.536 tokens.
O thinking vem desativado por padrão, e o Google documenta um modo thinking opcional para prompts mais difíceis. O Google oferece function calling e structured outputs no modelo.
O modelo do Google aceita entrada de texto, imagem, vídeo, áudio e PDF. No RunAPI, envie texto pelo endpoint Chat Completions compatível com OpenAI (/v1/chat/completions); o RunAPI aceita somente entrada de texto para este modelo. O Google recomenda o Gemini 3.5 Flash-Lite para novos projetos, e o RunAPI o oferece como gemini-3.5-flash-lite.
Escolha qualquer modelo e gere em segundos.
| Provedor | |
| ID do modelo | gemini-2.5-flash-lite |
| Modalidade | Texto |
| Tipos de tarefa | Synchronous |
| Endpoint da API | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| Unidade de cobrança | 1K tokens |
| Status do catálogo | Operacional |
Cadastre-se gratuitamente e crie uma chave de API para gemini-2.5-flash-lite no painel.
Envie uma solicitação POST para /v1/chat/completions com o identificador do modelo gemini-2.5-flash-lite e seus parâmetros.
Leia diretamente do endpoint a resposta concluída de gemini-2.5-flash-lite.
Expõe 1 endpoint(s) público(s): chat_completion.
Medido por 1K tokens, sem exigência de assinatura.
Nenhum parâmetro de solicitação foi publicado para este endpoint.
Use LLMs para chat e raciocínio.
Gere e revise trabalho de implementação.
Conecte modelos a tarefas backend.
Feedback verificado de clientes ainda não está disponível para este modelo.
O Google recomenda o Gemini 3.5 Flash-Lite ou o Gemini 3.8 Flash para novos trabalhos. Escolha o gemini-2.5-flash-lite quando uma carga, um conjunto de prompts ou uma avaliação que já existe foi construída sobre ele. Os dois modelos estão no RunAPI com a mesma chave de API.
Sim. O Google não anunciou data de desligamento para ele, embora a própria API do Google agora limite o acesso aos modelos 2.5 a usuários que já os usavam antes. No RunAPI, o gemini-2.5-flash-lite está disponível para todas as contas.
Sim. Aponte o SDK da OpenAI para https://runapi.ai/v1 com sua chave de API do RunAPI e envie requisições Chat Completions com model definido como gemini-2.5-flash-lite. As ferramentas seguem o formato tools padrão da OpenAI.
Não por padrão. O Google o distribui com o thinking desativado, para trabalhos de baixa latência em grande volume, e documenta um modo thinking opcional.
Envie o ID de modelo mostrado no quickstart.
Sim. O preço é medido por chamada ou unidade.
Ajudamos com a configuração empresarial, integrações e dúvidas técnicas.
Fale conosco