Endpointdekking
Stelt 1 openbaar(e) endpoint(s) beschikbaar: chat_completion.
Gemini 2.5 Flash-Lite; 1M context, thinking standaard uit; OpenAI-compatibele Chat Completions
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Analyseer deze codebase en stel drie prestatieverbeteringen voor met voor/na-voorbeelden."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Analyseer deze codebase en stel drie prestatieverbeteringen voor met voor/na-voorbeelden."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Analyseer deze codebase en stel drie prestatieverbeteringen voor met voor/na-voorbeelden." }]
});
11 versies beschikbaar
Gemini 2.5 Flash-Lite is de Flash-Lite-tier van de Gemini 2.5-generatie van Google, bedoeld voor classificatie, extractie en ander werk met lage latency in grote volumes. Het werd op 22 juli 2025 algemeen beschikbaar, met een kennisgrens van januari 2025. Het contextvenster is 1.048.576 tokens en de output gaat tot 65.536 tokens.
Thinking staat standaard uit, en Google documenteert een optionele thinking-modus voor lastigere prompts. Google ondersteunt function calling en structured outputs op het model.
Het model van Google accepteert tekst, afbeeldingen, video, audio en pdf als invoer. Stuur op RunAPI tekst via het OpenAI-compatibele Chat Completions-endpoint (/v1/chat/completions); RunAPI accepteert voor dit model alleen tekstinvoer. Google raadt Gemini 3.5 Flash-Lite aan voor nieuwe projecten, en RunAPI biedt dat model aan als gemini-3.5-flash-lite.
Kies een model en genereer binnen enkele seconden.
| Provider | |
| Model-ID | gemini-2.5-flash-lite |
| Modaliteit | Tekst |
| Taaktypen | Synchronous |
| API-eindpunt | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| Factureringseenheid | 1K tokens |
| Catalogusstatus | Operationeel |
Meld je gratis aan en maak vanuit het dashboard een API-sleutel voor gemini-2.5-flash-lite.
Stuur een POST-verzoek naar /v1/chat/completions met de model-ID gemini-2.5-flash-lite en je parameters.
Lees het voltooide gemini-2.5-flash-lite-antwoord rechtstreeks van het endpoint.
Stelt 1 openbaar(e) endpoint(s) beschikbaar: chat_completion.
Gemeten aan de hand van 1K tokens, zonder abonnementsvereiste.
Voor dit endpoint zijn geen requestparameters gepubliceerd.
Beantwoord klantvragen vanuit een privékennisbank en verlaag zo het aantal tickets.
Stel samenvattingen van contracten op en markeer belangrijke clausules voor beoordeling door een jurist.
Genereer automatisch unittests, code reviews en refactoringsuggesties in CI.
Geverifieerde klantfeedback is nog niet beschikbaar voor dit model.
Google raadt Gemini 3.5 Flash-Lite of Gemini 3.8 Flash aan voor nieuw werk. Kies gemini-2.5-flash-lite wanneer een bestaande workload, promptset of evaluatie erop gebouwd is. Beide modellen staan op RunAPI onder dezelfde API-key.
Ja. Google heeft er geen uitfaseringsdatum voor aangekondigd, al geeft de eigen API van Google nu alleen nog toegang tot 2.5-modellen aan gebruikers die ze eerder gebruikten. Op RunAPI is gemini-2.5-flash-lite voor elk account beschikbaar.
Ja. Laat de OpenAI-SDK naar https://runapi.ai/v1 wijzen met je RunAPI-API-key en stuur Chat Completions-requests met model ingesteld op gemini-2.5-flash-lite. Tools gebruiken het standaard OpenAI-toolsformaat.
Standaard niet. Google levert het met thinking uit, voor werk met lage latency in grote volumes, en documenteert een optionele thinking-modus.
Geef de model-ID door die in de quickstart wordt getoond.
Rate limits per key schalen mee met je usage tier. Bekijk de prijzenpagina voor de actuele limieten.
Ja — variant is een flag. Wissel door de modelparameter aan te passen.
Waar streaming beschikbaar is, streamt RunAPI end-to-end.
Open een issue in de publieke GitHub-repo of mail support.
We helpen je met enterprise-inrichting, integraties en technische vragen.
Neem contact op