Uma API key
Use as mesmas credenciais entre modelos e provedores.
It looks like you may prefer a different language. Switch anytime.
Use a API do GLM via RunAPI com um model skill, autenticação unificada e preços pay-as-you-go.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [{ role: "user", content: "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz." }]
});
GLM é a família de modelos de linguagem Mixture-of-Experts licenciada MIT da Z.ai. GLM-4.5 (355B total / 32B ativos, contexto 128K) introduziu a linha MoE open-weight com um flagship e um tier Air mais leve. GLM-4.6 e 4.7 ampliam para 200K de contexto com geração de código mais forte — 4.7 chega a 73,8% no SWE-bench. A série GLM-5 (744B / 40B ativos, contexto 200K) avança para 77,8% no SWE-bench Verified, e GLM-5.1 mantém o maior score open-weight no SWE-bench Pro com 58,4%. Todos estão disponíveis pelo RunAPI com uma única key e cobrança por token.
| Endpoint | Protocol |
|---|---|
POST /v1/chat/completions | OpenAI compatible |
POST /v1/responses | OpenAI Responses |
POST /v1/messages | Anthropic compatible |
POST /v1beta/models/{model}:generateContent | Gemini generateContent |
POST /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
| Variante | Cobrança | Preços | |
|---|---|---|---|
| glm-4.5 | 1K tokens | Input $0.41 / 1M tokens | Output $1.61 / 1M tokens | Ver → |
| glm-4.5-air | 1K tokens | Input $0.10 / 1M tokens | Output $0.55 / 1M tokens | Ver → |
| glm-4.6 | 1K tokens | Input $0.60 / 1M tokens | Output $1.22 / 1M tokens | Ver → |
| glm-4.7 | 1K tokens | Input $0.60 / 1M tokens | Output $1.19 / 1M tokens | Ver → |
| glm-5 | 1K tokens | Input $1.00 / 1M tokens | Output $1.60 / 1M tokens | Ver → |
| glm-5-turbo | 1K tokens | Input $1.20 / 1M tokens | Output $2.00 / 1M tokens | Ver → |
| glm-5.1 | 1K tokens | Input $1.40 / 1M tokens | Output $2.20 / 1M tokens | Ver → |
| glm-5.2 | 1K tokens | Input $0.70 / 1M tokens | Output $2.20 / 1M tokens | Ver → |
| glm-5.3 | 1K tokens | Input $1.40 / 1M tokens | Output $4.40 / 1M tokens | Ver → |
| Endpoint | Resolução | Duração | Preço | |
|---|---|---|---|---|
| chat_completion | — | — | Input $0.41 / 1M tokens | Output $1.61 / 1M tokens |
Preços exibidos para glm-4.5. Outras variantes mantêm seus próprios preços por endpoint.
Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.
Use sua chave RunAPI para todos os modelos compatíveis.
Adicione o model skill ao workspace de código antes de implementar a funcionalidade.
Consulte por task ID ou trate o callback quando a geração terminar.
Os modelos GLM da Z.ai são LLMs MoE licenciados MIT com contexto de 128K–200K. GLM-5.1 lidera modelos open-weight no SWE-bench Pro. Pelo RunAPI, compartilham uma única API key com cobrança pay-as-you-go por token, chamáveis pelas superfícies OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.
Use as mesmas credenciais entre modelos e provedores.
O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.
O preço por uso fica visível antes da chamada.
Coding e uso agêntico de ferramentas. GLM-5.1 lidera modelos open-weight no SWE-bench Pro (58,4%) e pontua 95,3% no AIME 2026. A linha completa é forte em tool calling multi-etapas, geração de código em grandes bases e raciocínio matemático.
glm-4.5 é o flagship 355B (32B parâmetros ativos) com contexto 128K; glm-4.5-air é um MoE mais leve de 106B (12B ativos) para trabalho cotidiano mais rápido e barato.
GLM-5 escala para 744B total / 40B ativos com 256 especialistas, contra 358B / 32B do GLM-4.7. SWE-bench Verified salta de 73,8% para 77,8%. Ambos compartilham contexto 200K.
Aponte o SDK da OpenAI (Chat Completions ou Responses) ou o SDK Anthropic Messages para o RunAPI e passe o model id do GLM; o proxy adapta o protocolo para você.
Por token, pay-as-you-go, nas taxas publicadas pelo RunAPI para entrada e saída de cada modelo GLM — sem assinatura.
Instale o model skill e siga as notas de setup com sua chave RunAPI.