endpoint 구성
1개의 공개 endpoint를 제공합니다: chat_completion.
Gemini 2.5 Flash-Lite; 1M 컨텍스트, 사고 기본값 꺼짐; OpenAI 호환 Chat Completions
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-2.5-flash-lite:generateContent
POST /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [
{
"role": "user",
"content": "이 코드베이스를 분석하고 이전/이후 예시와 함께 세 가지 성능 개선 방안을 제안해 주세요."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "이 코드베이스를 분석하고 이전/이후 예시와 함께 세 가지 성능 개선 방안을 제안해 주세요."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "이 코드베이스를 분석하고 이전/이후 예시와 함께 세 가지 성능 개선 방안을 제안해 주세요." }]
});
사용 가능한 버전 11개
Gemini 2.5 Flash-Lite는 Google Gemini 2.5 세대의 Flash-Lite 등급으로, 대량 분류, 추출처럼 지연 시간이 짧아야 하는 작업을 위한 모델입니다. 2025년 7월 22일 정식 출시되었고 지식 기준일은 2025년 1월입니다. 컨텍스트 윈도우는 1,048,576토큰이고 출력은 최대 65,536토큰입니다.
사고는 기본적으로 꺼져 있으며, Google은 어려운 프롬프트를 위해 선택형 사고 모드를 안내합니다. Google은 이 모델에서 함수 호출과 구조화된 출력을 지원합니다.
Google의 모델은 텍스트, 이미지, 비디오, 오디오, PDF 입력을 받습니다. RunAPI에서는 OpenAI 호환 Chat Completions 엔드포인트(/v1/chat/completions)로 텍스트를 보내세요. 이 모델에 대해 RunAPI는 텍스트 입력만 받습니다. Google은 새 프로젝트에 Gemini 3.5 Flash-Lite를 권장하며, RunAPI에서는 gemini-3.5-flash-lite로 제공합니다.
원하는 모델을 선택하고 몇 초 만에 생성해보세요.
| 제공자 | |
| 모델 ID | gemini-2.5-flash-lite |
| 모달리티 | 텍스트 |
| 작업 유형 | Synchronous |
| API 엔드포인트 | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-2.5-flash-lite:generateContent | |
| /v1beta/models/gemini-2.5-flash-lite:streamGenerateContent | |
| 청구 단위 | 1K 토큰 |
| 카탈로그 상태 | 운영 중 |
무료로 가입하고 대시보드에서 gemini-2.5-flash-lite용 API 키를 만드세요.
/v1/chat/completions로 gemini-2.5-flash-lite 모델 ID와 매개변수를 포함한 POST 요청을 보내세요.
엔드포인트에서 완료된 gemini-2.5-flash-lite 응답을 직접 읽으세요.
1개의 공개 endpoint를 제공합니다: chat_completion.
1K 토큰 기준으로 측정되며 구독 없이 이용 가능합니다.
이 엔드포인트에 게시된 요청 매개변수가 없습니다.
LLM을 채팅과 추론에 사용합니다.
구현 작업을 생성하고 리뷰합니다.
모델을 backend 작업에 연결합니다.
이 모델에 대한 검증된 고객 피드백이 아직 없습니다.
Google은 새 작업에 Gemini 3.5 Flash-Lite 또는 Gemini 3.8 Flash를 권장합니다. 기존 워크로드, 프롬프트 세트, 평가가 gemini-2.5-flash-lite를 기준으로 만들어졌다면 이 모델을 고르세요. RunAPI에서는 두 모델을 같은 API 키로 쓸 수 있습니다.
네. Google은 종료 날짜를 발표하지 않았습니다. 다만 Google 자체 API에서는 2.5 모델을 이전에 사용한 적이 있는 사용자만 쓸 수 있도록 제한하고 있습니다. RunAPI에서는 모든 계정이 gemini-2.5-flash-lite를 사용할 수 있습니다.
네. OpenAI SDK의 연결 주소를 https://runapi.ai/v1로 지정하고 RunAPI API 키를 설정한 뒤, model을 gemini-2.5-flash-lite로 지정한 Chat Completions 요청을 보내세요. 도구는 표준 OpenAI tools 형식을 사용합니다.
기본적으로는 사고하지 않습니다. Google은 대량 처리와 짧은 지연 시간을 위해 사고를 끈 상태로 제공하며, 선택형 사고 모드를 안내합니다.
quickstart에 표시된 모델 ID를 전달하세요.
네. 호출 또는 단위 기준으로 측정됩니다.