GLM API
Acesso à API do Z.ai GLM via RunAPI — modelos MoE licenciados MIT com até 200K de contexto e benchmarks de coding open-weight líderes.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz." }]
});
GLM é a família de modelos de linguagem Mixture-of-Experts licenciada MIT da Z.ai. GLM-4.5 (355B total / 32B ativos, contexto 128K) introduziu a linha MoE open-weight com um flagship e um tier Air mais leve. GLM-4.6 e 4.7 ampliam para 200K de contexto com geração de código mais forte — 4.7 chega a 73,8% no SWE-bench. A série GLM-5 (744B / 40B ativos, contexto 200K) avança para 77,8% no SWE-bench Verified, e GLM-5.1 mantém o maior score open-weight no SWE-bench Pro com 58,4%. Todos estão disponíveis pelo RunAPI com uma única key e cobrança por token.
- Variantes para diferentes metas de qualidade e latência
- API key unificada
- O model skill inclui documentação, schemas e notas de setup
- Gerações com falha não são cobradas
Variantes
| Variant | Billing | Pricing | |
|---|---|---|---|
| glm-4.5 | 1K tokens | Input $0.41 / 1M tokens | Output $1.61 / 1M tokens | Ver → |
| glm-4.5-air | 1K tokens | Input $0.10 / 1M tokens | Output $0.55 / 1M tokens | Ver → |
| glm-4.6 | 1K tokens | Input $0.60 / 1M tokens | Output $1.22 / 1M tokens | Ver → |
| glm-4.7 | 1K tokens | Input $0.60 / 1M tokens | Output $1.19 / 1M tokens | Ver → |
| glm-5 | 1K tokens | Input $1.00 / 1M tokens | Output $1.60 / 1M tokens | Ver → |
| glm-5-turbo | 1K tokens | Input $1.20 / 1M tokens | Output $2.00 / 1M tokens | Ver → |
| glm-5.1 | 1K tokens | Input $1.40 / 1M tokens | Output $2.20 / 1M tokens | Ver → |
| glm-5.2 | 1K tokens | Input $0.70 / 1M tokens | Output $2.20 / 1M tokens | Ver → |
Endpoints da API GLM
Use o SDK OpenAI ou Anthropic com sua chave RunAPI. Nenhum SDK extra necessário.
| Endpoint | Protocol |
|---|---|
| /v1/chat/completions | OpenAI compatible |
| /v1/responses | OpenAI Responses |
| /v1/messages | Anthropic compatible |
| /v1beta/models/{model}:generateContent | Gemini generateContent |
| /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
Como construir com este model skill
Escolha o modelo
Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.
Autentique uma vez
Use sua chave RunAPI para todos os modelos compatíveis.
Instale o skill
Adicione o model skill ao workspace de código antes de implementar a funcionalidade.
Receba a saída
Consulte por task ID ou trate o callback quando a geração terminar.
Onde GLM se encaixa
Os modelos GLM da Z.ai são LLMs MoE licenciados MIT com contexto de 128K–200K. GLM-5.1 lidera modelos open-weight no SWE-bench Pro. Pelo RunAPI, compartilham uma única API key com cobrança pay-as-you-go por token, chamáveis pelas superfícies OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.
Por que usar GLM pela RunAPI
Uma API key
Use as mesmas credenciais entre modelos e provedores.
Pronto para skills
O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.
Cobrança previsível
O preço por uso fica visível antes da chamada.
Perguntas frequentes
Para que os modelos GLM são bons?
Coding e uso agêntico de ferramentas. GLM-5.1 lidera modelos open-weight no SWE-bench Pro (58,4%) e pontua 95,3% no AIME 2026. A linha completa é forte em tool calling multi-etapas, geração de código em grandes bases e raciocínio matemático.
Qual é a diferença entre glm-4.5 e glm-4.5-air?
glm-4.5 é o flagship 355B (32B parâmetros ativos) com contexto 128K; glm-4.5-air é um MoE mais leve de 106B (12B ativos) para trabalho cotidiano mais rápido e barato.
Como o GLM-5 se compara ao GLM-4.7?
GLM-5 escala para 744B total / 40B ativos com 256 especialistas, contra 358B / 32B do GLM-4.7. SWE-bench Verified salta de 73,8% para 77,8%. Ambos compartilham contexto 200K.
Quais SDKs podem chamar GLM pelo RunAPI?
Aponte o SDK da OpenAI (Chat Completions ou Responses) ou o SDK Anthropic Messages para o RunAPI e passe o model id do GLM; o proxy adapta o protocolo para você.
Como o GLM é cobrado?
Por token, pay-as-you-go, nas taxas publicadas pelo RunAPI para entrada e saída de cada modelo GLM — sem assinatura.
Como chamo este modelo?
Instale o model skill e siga as notas de setup com sua chave RunAPI.
Gerações com falha custam dinheiro?
Gerações com falha não são cobradas
Posso chamar a partir da minha aplicação?
Sim. Instale o model skill no workspace de código e use durante a implementação da funcionalidade.