Copertura endpoint
Espone 1 endpoint pubblici: chat_completion.
Gemini 2.5 Flash-Lite; contesto 1M, thinking disattivato per impostazione predefinita; Chat Completions compatibile OpenAI
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Analizza questa codebase e suggerisci tre miglioramenti delle prestazioni con esempi prima/dopo."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Analizza questa codebase e suggerisci tre miglioramenti delle prestazioni con esempi prima/dopo."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Analizza questa codebase e suggerisci tre miglioramenti delle prestazioni con esempi prima/dopo." }]
});
11 versioni disponibili
Gemini 2.5 Flash-Lite è il livello Flash-Lite della generazione Gemini 2.5 di Google, pensato per classificazione ed estrazione ad alto volume e altri lavori a bassa latenza. È disponibile per tutti dal 22 luglio 2025, con data limite delle conoscenze a gennaio 2025. La finestra di contesto è di 1.048.576 token e l'output arriva a 65.536 token.
Il thinking è disattivato per impostazione predefinita, e Google documenta una modalità thinking opzionale per i prompt più difficili. Google supporta function calling e output strutturati su questo modello.
Il modello di Google accetta input di testo, immagini, video, audio e PDF. Su RunAPI, invia testo tramite l'endpoint Chat Completions compatibile OpenAI (/v1/chat/completions); RunAPI accetta solo input testuale per questo modello. Google consiglia Gemini 3.5 Flash-Lite per i nuovi progetti, e RunAPI lo offre come gemini-3.5-flash-lite.
Scegli un modello e genera in pochi secondi.
| Provider | |
| ID modello | gemini-2.5-flash-lite |
| Modalità | Testo |
| Tipi di attività | Synchronous |
| Endpoint API | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| Unità di fatturazione | 1K token |
| Stato del catalogo | Operativo |
Registrati gratuitamente e crea una chiave API per gemini-2.5-flash-lite dalla dashboard.
Invia una richiesta POST a /v1/chat/completions con l’identificatore del modello gemini-2.5-flash-lite e i tuoi parametri.
Leggi direttamente dall’endpoint la risposta completata di gemini-2.5-flash-lite.
Espone 1 endpoint pubblici: chat_completion.
Misurata in base a 1K token, senza requisito di abbonamento.
Nessun parametro della richiesta è pubblicato per questo endpoint.
Rispondi alle domande dei clienti partendo da una knowledge base privata, riducendo il volume dei ticket.
Redigi riepiloghi di contratti e segnala le clausole chiave per la revisione dell'avvocato.
Genera automaticamente test unitari, code review e suggerimenti di refactoring in CI.
Il feedback verificato dei clienti non è ancora disponibile per questo modello.
Google consiglia Gemini 3.5 Flash-Lite o Gemini 3.8 Flash per i nuovi lavori. Scegli gemini-2.5-flash-lite quando un carico, un set di prompt o una valutazione esistenti sono stati costruiti su di esso. Entrambi i modelli sono su RunAPI con la stessa chiave API.
Sì. Google non ha annunciato alcuna data di dismissione, anche se la sua API ora limita l'accesso ai modelli 2.5 agli utenti che li usavano già. Su RunAPI, gemini-2.5-flash-lite è disponibile per ogni account.
Sì. Punta l'SDK OpenAI su https://runapi.ai/v1 con la tua chiave API RunAPI e invia richieste Chat Completions con model impostato su gemini-2.5-flash-lite. I tool usano il formato standard di OpenAI.
Non per impostazione predefinita. Google lo distribuisce con il thinking disattivato per lavori ad alto volume e bassa latenza, e documenta una modalità thinking opzionale.
Passa l'ID del modello mostrato nel quickstart.
I limiti per chiave scalano in base al tier di utilizzo. Consulta la pagina prezzi per i limiti attuali.
Sì — la variante è un flag. Puoi cambiarla modificando il parametro model.
Dove lo streaming è disponibile, RunAPI esegue lo streaming end-to-end.
Apri un issue nel repository GitHub pubblico oppure scrivi all’assistenza.
Ti aiutiamo con la configurazione enterprise, le integrazioni e le domande tecniche.
Contattaci