Endpoint-Abdeckung
Stellt 1 öffentliche(n) Endpoint(s) bereit: chat_completion.
Gemini 2.5 Flash-Lite; 1M Kontext, Thinking standardmäßig aus; OpenAI-kompatible Chat Completions
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Analysiere diese Codebasis und schlage drei Performance-Verbesserungen mit Vorher-Nachher-Beispielen vor."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Analysiere diese Codebasis und schlage drei Performance-Verbesserungen mit Vorher-Nachher-Beispielen vor."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Analysiere diese Codebasis und schlage drei Performance-Verbesserungen mit Vorher-Nachher-Beispielen vor." }]
});
11 Versionen verfügbar
Gemini 2.5 Flash-Lite ist die Flash-Lite-Stufe der Gemini-2.5-Generation von Google, gedacht für Klassifikation und Extraktion in hohem Volumen und andere Aufgaben mit niedriger Latenz. Es ist seit dem 22. Juli 2025 allgemein verfügbar, mit Wissensstand Januar 2025. Das Kontextfenster umfasst 1.048.576 Tokens, die Ausgabe bis zu 65.536 Tokens.
Thinking ist standardmäßig ausgeschaltet; für schwierigere Prompts dokumentiert Google einen optionalen Thinking-Modus. Google unterstützt für das Modell Function Calling und strukturierte Ausgaben.
Googles Modell nimmt Text, Bilder, Video, Audio und PDF an. Bei RunAPI senden Sie Text über den OpenAI-kompatiblen Chat-Completions-Endpunkt (/v1/chat/completions); RunAPI nimmt für dieses Modell nur Texteingabe an. Für neue Projekte empfiehlt Google Gemini 3.5 Flash-Lite, das RunAPI als gemini-3.5-flash-lite anbietet.
Wähle ein Modell und generiere in Sekunden.
| Anbieter | |
| Modell-ID | gemini-2.5-flash-lite |
| Modalität | Text |
| Aufgabentypen | Synchronous |
| API-Endpunkt | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| Abrechnungseinheit | 1K-Token |
| Katalogstatus | Betriebsbereit |
Registriere dich kostenlos und erstelle im Dashboard einen API-Schlüssel für gemini-2.5-flash-lite.
Sende eine POST-Anfrage an /v1/chat/completions mit der Modell-ID gemini-2.5-flash-lite und deinen Parametern.
Lies die fertige gemini-2.5-flash-lite-Antwort direkt vom Endpoint.
Stellt 1 öffentliche(n) Endpoint(s) bereit: chat_completion.
Gemessen nach 1K-Token, ohne Abo-Anforderung.
Für diesen Endpunkt sind keine Anfrageparameter veröffentlicht.
Nutze LLMs für Chat und Reasoning.
Generiere und prüfe Implementierungsarbeit.
Verbinde Modelle mit Backend-Tasks.
Verifiziertes Kundenfeedback ist für dieses Modell noch nicht verfügbar.
Für neue Projekte empfiehlt Google Gemini 3.5 Flash-Lite oder Gemini 3.8 Flash. Wählen Sie gemini-2.5-flash-lite, wenn ein bestehender Workload, ein Prompt-Set oder eine Evaluierung darauf aufbaut. Beide Modelle sind bei RunAPI unter demselben API-Key verfügbar.
Ja. Google hat kein Abschaltdatum angekündigt, beschränkt den Zugriff auf 2.5-Modelle in der eigenen API inzwischen aber auf Nutzer, die sie bereits verwendet haben. Bei RunAPI steht gemini-2.5-flash-lite jedem Konto zur Verfügung.
Ja. Richten Sie das OpenAI SDK mit Ihrem RunAPI-API-Key auf https://runapi.ai/v1 und senden Sie Chat-Completions-Requests mit model auf gemini-2.5-flash-lite. Tools nutzen das Standardformat von OpenAI.
Standardmäßig nicht. Google liefert es für hohes Volumen und niedrige Latenz mit ausgeschaltetem Thinking aus und dokumentiert einen optionalen Thinking-Modus.
Übergib die im Quickstart angezeigte Modell-ID.
Ja. Preise werden pro Aufruf oder Einheit gemessen.
Wir helfen bei Enterprise-Setup, Integrationen und technischen Fragen.
Kontakt aufnehmen