GLM API
RunAPI를 통한 Z.ai GLM API 액세스, 최대 200K 컨텍스트와 선도적인 오픈웨이트 코딩 벤치마크를 갖춘 MIT 라이선스 MoE 모델.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "이 멀티 파일 저장소를 읽고 실패하는 통합 테스트를 찾은 뒤, 근본 원인 설명과 함께 패치를 제안하세요."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "이 멀티 파일 저장소를 읽고 실패하는 통합 테스트를 찾은 뒤, 근본 원인 설명과 함께 패치를 제안하세요."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "이 멀티 파일 저장소를 읽고 실패하는 통합 테스트를 찾은 뒤, 근본 원인 설명과 함께 패치를 제안하세요." }]
});
GLM은 Z.ai의 MIT 라이선스 Mixture-of-Experts 언어 모델 패밀리입니다. GLM-4.5는 355B 전체 / 32B 활성 파라미터와 128K 컨텍스트로 플래그십 및 더 가벼운 Air 티어를 갖춘 오픈웨이트 MoE 라인을 열었습니다. GLM-4.6과 4.7은 더 강한 코드 생성과 함께 200K 컨텍스트로 확장되며, 4.7은 SWE-bench 73.8%를 달성합니다. GLM-5 시리즈는 744B / 40B 활성, 200K 컨텍스트로 SWE-bench Verified 77.8%까지 끌어올리고, GLM-5.1은 SWE-bench Pro 58.4%로 오픈웨이트 최고 점수를 보유합니다. 모두 하나의 RunAPI 키와 토큰 단위 과금으로 사용할 수 있습니다.
- 품질과 지연 시간 목표에 맞춘 모델 변형
- 통합 API key
- Model skill에 docs, schema, 설정 메모 포함
- 실패한 생성은 과금되지 않습니다
변형
| Variant | Billing | Pricing | |
|---|---|---|---|
| glm-4.5 | 1K tokens | Input $0.41 / 1M tokens | Output $1.61 / 1M tokens | 보기 → |
| glm-4.5-air | 1K tokens | Input $0.10 / 1M tokens | Output $0.55 / 1M tokens | 보기 → |
| glm-4.6 | 1K tokens | Input $0.60 / 1M tokens | Output $1.22 / 1M tokens | 보기 → |
| glm-4.7 | 1K tokens | Input $0.60 / 1M tokens | Output $1.19 / 1M tokens | 보기 → |
| glm-5 | 1K tokens | Input $1.00 / 1M tokens | Output $1.60 / 1M tokens | 보기 → |
| glm-5-turbo | 1K tokens | Input $1.20 / 1M tokens | Output $2.00 / 1M tokens | 보기 → |
| glm-5.1 | 1K tokens | Input $1.40 / 1M tokens | Output $2.20 / 1M tokens | 보기 → |
| glm-5.2 | 1K tokens | Input $0.70 / 1M tokens | Output $2.20 / 1M tokens | 보기 → |
GLM API 엔드포인트
RunAPI 키로 OpenAI 또는 Anthropic SDK를 사용하세요. 추가 SDK가 필요 없습니다.
| Endpoint | Protocol |
|---|---|
| /v1/chat/completions | OpenAI compatible |
| /v1/responses | OpenAI Responses |
| /v1/messages | Anthropic compatible |
| /v1beta/models/{model}:generateContent | Gemini generateContent |
| /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
이 model skill로 구현하는 방법
모델 선택
출력 유형, 품질 기준, 지연 시간 목표에 맞는 모델과 변형을 고릅니다.
한 번 인증
모든 지원 모델에 RunAPI key를 사용합니다.
skill 설치
기능을 구현하기 전에 코딩 워크스페이스에 model skill을 추가합니다.
결과 받기
task ID로 조회하거나 생성 완료 시 callback을 처리합니다.
GLM의 위치
Z.ai의 GLM 모델은 128K-200K 컨텍스트를 지원하는 MIT 라이선스 MoE LLM입니다. GLM-5.1은 SWE-bench Pro에서 오픈웨이트 모델을 선도합니다. RunAPI를 통해 단일 API 키와 사용량 기반 토큰 과금을 공유하며, OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 표면에서 호출할 수 있습니다.
RunAPI로 GLM을 쓰는 이유
하나의 API key
모델과 제공사를 넘나들며 같은 인증 정보를 사용합니다.
Skill-ready
model skill에 schema, 설정 메모, 가격 컨텍스트, 모델 ID가 포함됩니다.
예측 가능한 과금
호출 전에 사용량 기반 가격을 확인할 수 있습니다.
자주 묻는 질문
GLM 모델은 무엇에 강한가요?
코딩과 에이전틱 도구 사용에 강합니다. GLM-5.1은 SWE-bench Pro 58.4%로 오픈웨이트 모델을 선도하고 AIME 2026에서 95.3%를 기록합니다. 전체 라인은 다단계 도구 호출, 대형 코드베이스 전반의 코드 생성, 수학적 추론에 강합니다.
glm-4.5와 glm-4.5-air의 차이점은 무엇인가요?
glm-4.5는 128K 컨텍스트를 갖춘 355B 플래그십(32B 활성 파라미터)이고, glm-4.5-air는 더 빠르고 비용이 낮은 일상 작업용 106B MoE(12B active) 경량 모델입니다.
GLM-5는 GLM-4.7과 어떻게 다른가요?
GLM-5는 256개 전문가를 갖춘 744B 전체 / 40B 활성 규모로, GLM-4.7의 358B / 32B보다 큽니다. SWE-bench Verified는 73.8%에서 77.8%로 상승합니다. 둘 다 200K 컨텍스트를 공유합니다.
어떤 SDK로 RunAPI에서 GLM을 호출할 수 있나요?
OpenAI SDK의 Chat Completions 또는 Responses, 또는 Anthropic Messages SDK를 RunAPI에 연결하고 GLM 모델 id를 전달하세요. 프록시가 프로토콜을 맞춰 줍니다.
GLM은 어떻게 과금되나요?
각 GLM 모델에 대해 RunAPI에 공개된 입력 및 출력 요율에 따라 토큰 단위, 사용량 기반으로 과금되며 구독은 필요하지 않습니다.
이 모델은 어떻게 호출하나요?
model skill을 설치하고 RunAPI key와 함께 설정 메모를 따르세요.
실패한 생성도 비용이 드나요?
실패한 생성은 과금되지 않습니다
애플리케이션에서 호출할 수 있나요?
네. 코딩 워크스페이스에 model skill을 설치하고 모델 기능을 추가할 때 사용하세요.