Text · Z.ai

GLM API

Acesso à API do Z.ai GLM via RunAPI — modelos MoE licenciados MIT com até 200K de contexto e benchmarks de coding open-weight líderes.

Operacional · 8 variants · a partir de $0.0001
runapi.ai
# Base URL
https://runapi.ai

# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "glm-5.2",
  "messages": [
    {
      "role": "user",
      "content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."
    }
  ]
}'
from openai import OpenAI

client = OpenAI(
    base_url="https://runapi.ai/v1",
    api_key="your-runapi-key"
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."}]
)
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://runapi.ai/v1",
  apiKey: "your-runapi-key"
});

const response = await client.chat.completions.create({
  model: "glm-5.2",
  messages: [{ role: "user", content: "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz." }]
});
https://runapi.ai 5 endpoints
VISÃO GERAL

GLM é a família de modelos de linguagem Mixture-of-Experts licenciada MIT da Z.ai. GLM-4.5 (355B total / 32B ativos, contexto 128K) introduziu a linha MoE open-weight com um flagship e um tier Air mais leve. GLM-4.6 e 4.7 ampliam para 200K de contexto com geração de código mais forte — 4.7 chega a 73,8% no SWE-bench. A série GLM-5 (744B / 40B ativos, contexto 200K) avança para 77,8% no SWE-bench Verified, e GLM-5.1 mantém o maior score open-weight no SWE-bench Pro com 58,4%. Todos estão disponíveis pelo RunAPI com uma única key e cobrança por token.

  • Variantes para diferentes metas de qualidade e latência
  • API key unificada
  • O model skill inclui documentação, schemas e notas de setup
  • Gerações com falha não são cobradas
VARIANTES

Variantes

Variant Billing Pricing
glm-4.5 1K tokens Input $0.41 / 1M tokens | Output $1.61 / 1M tokens Ver →
glm-4.5-air 1K tokens Input $0.10 / 1M tokens | Output $0.55 / 1M tokens Ver →
glm-4.6 1K tokens Input $0.60 / 1M tokens | Output $1.22 / 1M tokens Ver →
glm-4.7 1K tokens Input $0.60 / 1M tokens | Output $1.19 / 1M tokens Ver →
glm-5 1K tokens Input $1.00 / 1M tokens | Output $1.60 / 1M tokens Ver →
glm-5-turbo 1K tokens Input $1.20 / 1M tokens | Output $2.00 / 1M tokens Ver →
glm-5.1 1K tokens Input $1.40 / 1M tokens | Output $2.20 / 1M tokens Ver →
glm-5.2 1K tokens Input $0.70 / 1M tokens | Output $2.20 / 1M tokens Ver →
API

Endpoints da API GLM

Use o SDK OpenAI ou Anthropic com sua chave RunAPI. Nenhum SDK extra necessário.

Endpoint Protocol
/v1/chat/completions OpenAI compatible
/v1/responses OpenAI Responses
/v1/messages Anthropic compatible
/v1beta/models/{model}:generateContent Gemini generateContent
/v1beta/models/{model}:streamGenerateContent Gemini streamGenerateContent
COMO FUNCIONA

Como construir com este model skill

01

Escolha o modelo

Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.

02

Autentique uma vez

Use sua chave RunAPI para todos os modelos compatíveis.

03

Instale o skill

Adicione o model skill ao workspace de código antes de implementar a funcionalidade.

04

Receba a saída

Consulte por task ID ou trate o callback quando a geração terminar.

CONTEXTO

Onde GLM se encaixa

Os modelos GLM da Z.ai são LLMs MoE licenciados MIT com contexto de 128K–200K. GLM-5.1 lidera modelos open-weight no SWE-bench Pro. Pelo RunAPI, compartilham uma única API key com cobrança pay-as-you-go por token, chamáveis pelas superfícies OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.

Provider
Z.ai
Modality
Text
POR QUE RUNAPI

Por que usar GLM pela RunAPI

Uma API key

Use as mesmas credenciais entre modelos e provedores.

Pronto para skills

O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.

Cobrança previsível

O preço por uso fica visível antes da chamada.

FAQ

Perguntas frequentes

Para que os modelos GLM são bons?

Coding e uso agêntico de ferramentas. GLM-5.1 lidera modelos open-weight no SWE-bench Pro (58,4%) e pontua 95,3% no AIME 2026. A linha completa é forte em tool calling multi-etapas, geração de código em grandes bases e raciocínio matemático.

Qual é a diferença entre glm-4.5 e glm-4.5-air?

glm-4.5 é o flagship 355B (32B parâmetros ativos) com contexto 128K; glm-4.5-air é um MoE mais leve de 106B (12B ativos) para trabalho cotidiano mais rápido e barato.

Como o GLM-5 se compara ao GLM-4.7?

GLM-5 escala para 744B total / 40B ativos com 256 especialistas, contra 358B / 32B do GLM-4.7. SWE-bench Verified salta de 73,8% para 77,8%. Ambos compartilham contexto 200K.

Quais SDKs podem chamar GLM pelo RunAPI?

Aponte o SDK da OpenAI (Chat Completions ou Responses) ou o SDK Anthropic Messages para o RunAPI e passe o model id do GLM; o proxy adapta o protocolo para você.

Como o GLM é cobrado?

Por token, pay-as-you-go, nas taxas publicadas pelo RunAPI para entrada e saída de cada modelo GLM — sem assinatura.

Como chamo este modelo?

Instale o model skill e siga as notas de setup com sua chave RunAPI.

Gerações com falha custam dinheiro?

Gerações com falha não são cobradas

Posso chamar a partir da minha aplicação?

Sim. Instale o model skill no workspace de código e use durante a implementação da funcionalidade.

COMEÇAR

Comece a construir com GLM.