하나의 API key
모델과 제공사를 넘나들며 같은 인증 정보를 사용합니다.
RunAPI를 통해 모델 스킬, 통합 인증, 종량제 요금으로 GLM API를 사용하세요.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "이 멀티 파일 저장소를 읽고 실패하는 통합 테스트를 찾은 뒤, 근본 원인 설명과 함께 패치를 제안하세요."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "이 멀티 파일 저장소를 읽고 실패하는 통합 테스트를 찾은 뒤, 근본 원인 설명과 함께 패치를 제안하세요."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [{ role: "user", content: "이 멀티 파일 저장소를 읽고 실패하는 통합 테스트를 찾은 뒤, 근본 원인 설명과 함께 패치를 제안하세요." }]
});
GLM은 Z.ai의 MIT 라이선스 Mixture-of-Experts 언어 모델 패밀리입니다. GLM-4.5는 355B 전체 / 32B 활성 파라미터와 128K 컨텍스트로 플래그십 및 더 가벼운 Air 티어를 갖춘 오픈웨이트 MoE 라인을 열었습니다. GLM-4.6과 4.7은 더 강한 코드 생성과 함께 200K 컨텍스트로 확장되며, 4.7은 SWE-bench 73.8%를 달성합니다. GLM-5 시리즈는 744B / 40B 활성, 200K 컨텍스트로 SWE-bench Verified 77.8%까지 끌어올리고, GLM-5.1은 SWE-bench Pro 58.4%로 오픈웨이트 최고 점수를 보유합니다. 모두 하나의 RunAPI 키와 토큰 단위 과금으로 사용할 수 있습니다.
| Endpoint | Protocol |
|---|---|
POST /v1/chat/completions | OpenAI compatible |
POST /v1/responses | OpenAI Responses |
POST /v1/messages | Anthropic compatible |
POST /v1beta/models/{model}:generateContent | Gemini generateContent |
POST /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
| 변형 | 과금 | 요금 | |
|---|---|---|---|
| glm-4.5 | 1K 토큰 | 입력 $0.41 / 100만 토큰 | 출력 $1.61 / 100만 토큰 | 보기 → |
| glm-4.5-air | 1K 토큰 | 입력 $0.10 / 100만 토큰 | 출력 $0.55 / 100만 토큰 | 보기 → |
| glm-4.6 | 1K 토큰 | 입력 $0.60 / 100만 토큰 | 출력 $1.22 / 100만 토큰 | 보기 → |
| glm-4.7 | 1K 토큰 | 입력 $0.60 / 100만 토큰 | 출력 $1.19 / 100만 토큰 | 보기 → |
| glm-5 | 1K 토큰 | 입력 $1.00 / 100만 토큰 | 출력 $1.60 / 100만 토큰 | 보기 → |
| glm-5-turbo | 1K 토큰 | 입력 $1.20 / 100만 토큰 | 출력 $2.00 / 100만 토큰 | 보기 → |
| glm-5.1 | 1K 토큰 | 입력 $1.40 / 100만 토큰 | 출력 $2.20 / 100만 토큰 | 보기 → |
| glm-5.2 | 1K 토큰 | 입력 $0.70 / 100만 토큰 | 출력 $2.20 / 100만 토큰 | 보기 → |
| glm-5.3 | 1K 토큰 | 입력 $1.40 / 100만 토큰 | 출력 $4.40 / 100만 토큰 | 보기 → |
| endpoint | 해상도 | 길이 | 가격 | |
|---|---|---|---|---|
| chat_completion | — | — | 입력 $0.41 / 100만 토큰 | 출력 $1.61 / 100만 토큰 |
glm-4.5 기준 요금입니다. 다른 변형은 각자의 endpoint 요금이 적용됩니다.
출력 유형, 품질 기준, 지연 시간 목표에 맞는 모델과 변형을 고릅니다.
모든 지원 모델에 RunAPI key를 사용합니다.
기능을 구현하기 전에 코딩 워크스페이스에 model skill을 추가합니다.
task ID로 조회하거나 생성 완료 시 callback을 처리합니다.
모델과 제공사를 넘나들며 같은 인증 정보를 사용합니다.
model skill에 schema, 설정 메모, 가격 컨텍스트, 모델 ID가 포함됩니다.
호출 전에 사용량 기반 가격을 확인할 수 있습니다.
코딩과 에이전틱 도구 사용에 강합니다. GLM-5.1은 SWE-bench Pro 58.4%로 오픈웨이트 모델을 선도하고 AIME 2026에서 95.3%를 기록합니다. 전체 라인은 다단계 도구 호출, 대형 코드베이스 전반의 코드 생성, 수학적 추론에 강합니다.
glm-4.5는 128K 컨텍스트를 갖춘 355B 플래그십(32B 활성 파라미터)이고, glm-4.5-air는 더 빠르고 비용이 낮은 일상 작업용 106B MoE(12B active) 경량 모델입니다.
GLM-5는 256개 전문가를 갖춘 744B 전체 / 40B 활성 규모로, GLM-4.7의 358B / 32B보다 큽니다. SWE-bench Verified는 73.8%에서 77.8%로 상승합니다. 둘 다 200K 컨텍스트를 공유합니다.
OpenAI SDK의 Chat Completions 또는 Responses, 또는 Anthropic Messages SDK를 RunAPI에 연결하고 GLM 모델 id를 전달하세요. 프록시가 프로토콜을 맞춰 줍니다.
각 GLM 모델에 대해 RunAPI에 공개된 입력 및 출력 요율에 따라 토큰 단위, 사용량 기반으로 과금되며 구독은 필요하지 않습니다.
model skill을 설치하고 RunAPI key와 함께 설정 메모를 따르세요.