Cobertura de endpoints
Expone 1 endpoint(s) público(s): chat_completion.
Gemini 2.5 Flash-Lite; contexto 1M, thinking desactivado por defecto; Chat Completions compatible con OpenAI
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Analiza esta base de código y sugiere tres mejoras de rendimiento con ejemplos antes/después."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Analiza esta base de código y sugiere tres mejoras de rendimiento con ejemplos antes/después."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Analiza esta base de código y sugiere tres mejoras de rendimiento con ejemplos antes/después." }]
});
11 versiones disponibles
Gemini 2.5 Flash-Lite es el nivel Flash-Lite de la generación Gemini 2.5 de Google, pensado para clasificación y extracción de alto volumen y otros trabajos de baja latencia. Llegó a disponibilidad general el 22 de julio de 2025, con fecha de corte de conocimiento en enero de 2025. La ventana de contexto es de 1.048.576 tokens y la salida llega a 65.536 tokens.
El thinking está desactivado por defecto, y Google documenta un modo thinking opcional para prompts más difíciles. Google admite function calling y salidas estructuradas en este modelo.
El modelo de Google acepta entrada de texto, imagen, vídeo, audio y PDF. En RunAPI, envía texto a través del endpoint Chat Completions compatible con OpenAI (/v1/chat/completions); RunAPI solo acepta entrada de texto para este modelo. Google recomienda Gemini 3.5 Flash-Lite para proyectos nuevos, y RunAPI lo ofrece como gemini-3.5-flash-lite.
Elige cualquier modelo y genera en segundos.
| Proveedor | |
| ID del modelo | gemini-2.5-flash-lite |
| Modalidad | Texto |
| Tipos de tarea | Synchronous |
| Endpoint de API | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| Unidad de facturación | 1K tokens |
| Estado del catálogo | Operativo |
Regístrate gratis y crea una clave de API para gemini-2.5-flash-lite desde el panel de control.
Envía una solicitud POST a /v1/chat/completions con el identificador del modelo gemini-2.5-flash-lite y tus parámetros.
Lee directamente la respuesta completada de gemini-2.5-flash-lite desde el endpoint.
Expone 1 endpoint(s) público(s): chat_completion.
Medido por 1K tokens sin requisito de suscripción.
No hay parámetros de solicitud publicados para este endpoint.
Usa LLMs para chat y razonamiento.
Genera y revisa trabajo de implementación.
Conecta modelos a tareas backend.
Los testimonios de clientes verificados aún no están disponibles para este modelo.
Google recomienda Gemini 3.5 Flash-Lite o Gemini 3.8 Flash para trabajo nuevo. Elige gemini-2.5-flash-lite cuando una carga, un conjunto de prompts o una evaluación existentes se construyeron sobre él. Ambos modelos están en RunAPI con la misma API key.
Sí. Google no ha anunciado fecha de retirada, aunque su propia API ahora limita el acceso a los modelos 2.5 a usuarios que ya los usaban. En RunAPI, gemini-2.5-flash-lite está disponible para todas las cuentas.
Sí. Apunta el SDK de OpenAI a https://runapi.ai/v1 con tu API key de RunAPI y envía peticiones Chat Completions con model en gemini-2.5-flash-lite. Las herramientas usan el formato estándar de OpenAI.
No por defecto. Google lo distribuye con el thinking desactivado para trabajo de alto volumen y baja latencia, y documenta un modo thinking opcional.
Pasa el ID de modelo que aparece en el quickstart.
Sí. El precio se mide por llamada o unidad.
Te ayudamos con la configuración empresarial, las integraciones y las preguntas técnicas.
Contacta con nosotros