endpoint 구성
1개의 공개 endpoint를 제공합니다: chat_completion.
Gemini 3.1 Flash-Lite; 1M 컨텍스트, 조절형 사고; OpenAI 호환 Chat Completions로 텍스트 요청
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/gemini-3.1-flash-lite:generateContent
POST /v1beta/models/gemini-3.1-flash-lite:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-lite",
"messages": [
{
"role": "user",
"content": "이 코드베이스를 분석하고 이전/이후 예시와 함께 세 가지 성능 개선 방안을 제안해 주세요."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="gemini-3.1-flash-lite",
messages=[{"role": "user", "content": "이 코드베이스를 분석하고 이전/이후 예시와 함께 세 가지 성능 개선 방안을 제안해 주세요."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "gemini-3.1-flash-lite",
messages: [{ role: "user", content: "이 코드베이스를 분석하고 이전/이후 예시와 함께 세 가지 성능 개선 방안을 제안해 주세요." }]
});
사용 가능한 버전 11개
Gemini 3.1 Flash-Lite는 Google Gemini 3 시리즈에서 지연 시간이 짧고 비용이 낮은 모델입니다. Google은 번역, 분류, 개체 추출, 문서 선별, 모델 간 요청 라우팅처럼 단순하지만 물량이 많은 작업을 위해 만들었습니다. 안정 버전 gemini-3.1-flash-lite는 2026년 5월 7일 정식 출시되었습니다. 컨텍스트 윈도우는 1,048,576토큰이고 출력은 최대 65,536토큰입니다.
사고는 조절할 수 있습니다. Google은 minimal부터 high까지 네 가지 사고 수준을 제공하며, 사고 토큰은 출력으로 계산됩니다. Google은 이 모델에서 함수 호출과 구조화된 출력을 지원합니다.
Google의 모델은 텍스트, 이미지, 비디오, 오디오, PDF 입력을 받습니다. RunAPI에서 gemini-3.1-flash-lite는 텍스트 입력만 받습니다. OpenAI 호환 Chat Completions 엔드포인트(/v1/chat/completions), OpenAI Responses, Anthropic Messages, Gemini generateContent로 요청을 보내세요. Google은 후속 모델로 Gemini 3.5 Flash-Lite를 안내하며, RunAPI에서는 gemini-3.5-flash-lite로 제공합니다.
원하는 모델을 선택하고 몇 초 만에 생성해보세요.
| 제공자 | |
| 모델 ID | gemini-3.1-flash-lite |
| 모달리티 | 텍스트 |
| 작업 유형 | Synchronous |
| API 엔드포인트 | /v1/chat/completions |
| /v1/responses |
| /v1/messages | |
| /v1beta/models/gemini-3.1-flash-lite:generateContent | |
| /v1beta/models/gemini-3.1-flash-lite:streamGenerateContent | |
| 청구 단위 | 1K 토큰 |
| 카탈로그 상태 | 운영 중 |
무료로 가입하고 대시보드에서 gemini-3.1-flash-lite용 API 키를 만드세요.
/v1/chat/completions로 gemini-3.1-flash-lite 모델 ID와 매개변수를 포함한 POST 요청을 보내세요.
엔드포인트에서 완료된 gemini-3.1-flash-lite 응답을 직접 읽으세요.
1개의 공개 endpoint를 제공합니다: chat_completion.
1K 토큰 기준으로 측정되며 구독 없이 이용 가능합니다.
이 엔드포인트에 게시된 요청 매개변수가 없습니다.
LLM을 채팅과 추론에 사용합니다.
구현 작업을 생성하고 리뷰합니다.
모델을 backend 작업에 연결합니다.
이 모델에 대한 검증된 고객 피드백이 아직 없습니다.
Google은 3.1 Flash-Lite의 후속 모델로 Gemini 3.5 Flash-Lite를 안내합니다. 새 프로젝트는 gemini-3.5-flash-lite로 시작하고, 기존 워크로드, 프롬프트 세트, 평가가 gemini-3.1-flash-lite를 기준으로 만들어졌다면 이 모델을 고르세요. RunAPI에서는 두 모델을 같은 API 키로 쓸 수 있습니다.
Google은 gemini-3.1-flash-lite의 가장 이른 종료일을 2027년 5월 7일로 안내합니다. 프리뷰 모델은 2026년 5월에 종료되었으므로 안정 버전 모델 ID를 사용하세요.
네. OpenAI SDK의 연결 주소를 https://runapi.ai/v1로 지정하고 RunAPI API 키를 설정한 뒤, model을 gemini-3.1-flash-lite로 지정한 Chat Completions 요청을 보내세요. 도구는 표준 OpenAI tools 형식을 사용합니다.
아직은 안 됩니다. Google의 모델은 이미지, 비디오, 오디오, PDF를 읽지만 RunAPI는 gemini-3.1-flash-lite에 텍스트 입력만 받으며, 미디어 파트가 포함된 요청은 거부됩니다.
quickstart에 표시된 모델 ID를 전달하세요.
네. 호출 또는 단위 기준으로 측정됩니다.