It looks like you may prefer a different language. Switch anytime.

Text Z.ai

GLM API

Use a API do GLM via RunAPI com um model skill, autenticação unificada e preços pay-as-you-go.

runapi.ai
# Base URL
https://runapi.ai

# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "glm-5.3",
  "messages": [
    {
      "role": "user",
      "content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."
    }
  ]
}'
from openai import OpenAI

client = OpenAI(
    base_url="https://runapi.ai/v1",
    api_key="your-runapi-key"
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz."}]
)
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://runapi.ai/v1",
  apiKey: "your-runapi-key"
});

const response = await client.chat.completions.create({
  model: "glm-5.3",
  messages: [{ role: "user", content: "Leia este repositório multi-arquivo, encontre o teste de integração que falha e proponha um patch com explicação da causa raiz." }]
});
https://runapi.ai 5 endpoints
VISÃO GERAL

Sobre GLM

GLM é a família de modelos de linguagem Mixture-of-Experts licenciada MIT da Z.ai. GLM-4.5 (355B total / 32B ativos, contexto 128K) introduziu a linha MoE open-weight com um flagship e um tier Air mais leve. GLM-4.6 e 4.7 ampliam para 200K de contexto com geração de código mais forte — 4.7 chega a 73,8% no SWE-bench. A série GLM-5 (744B / 40B ativos, contexto 200K) avança para 77,8% no SWE-bench Verified, e GLM-5.1 mantém o maior score open-weight no SWE-bench Pro com 58,4%. Todos estão disponíveis pelo RunAPI com uma única key e cobrança por token.

Provedor
Z.ai
Modalidade
Text

Endpoints da API GLM

EndpointProtocol
POST /v1/chat/completionsOpenAI compatible
POST /v1/responsesOpenAI Responses
POST /v1/messagesAnthropic compatible
POST /v1beta/models/{model}:generateContentGemini generateContent
POST /v1beta/models/{model}:streamGenerateContentGemini streamGenerateContent

Variantes

Variante Cobrança Preços
glm-4.5 1K tokens Input $0.41 / 1M tokens | Output $1.61 / 1M tokens Ver →
glm-4.5-air 1K tokens Input $0.10 / 1M tokens | Output $0.55 / 1M tokens Ver →
glm-4.6 1K tokens Input $0.60 / 1M tokens | Output $1.22 / 1M tokens Ver →
glm-4.7 1K tokens Input $0.60 / 1M tokens | Output $1.19 / 1M tokens Ver →
glm-5 1K tokens Input $1.00 / 1M tokens | Output $1.60 / 1M tokens Ver →
glm-5-turbo 1K tokens Input $1.20 / 1M tokens | Output $2.00 / 1M tokens Ver →
glm-5.1 1K tokens Input $1.40 / 1M tokens | Output $2.20 / 1M tokens Ver →
glm-5.2 1K tokens Input $0.70 / 1M tokens | Output $2.20 / 1M tokens Ver →
glm-5.3 1K tokens Input $1.40 / 1M tokens | Output $4.40 / 1M tokens Ver →
PREÇOS

Preços de GLM

Endpoint Resolução Duração Preço
chat_completion Input $0.41 / 1M tokens | Output $1.61 / 1M tokens

Preços exibidos para glm-4.5. Outras variantes mantêm seus próprios preços por endpoint.

Integração com agentes

Execute GLM a partir de um agente

COMO FUNCIONA

Comece com GLM

  1. Escolha o modelo

    Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.

  2. Autentique uma vez

    Use sua chave RunAPI para todos os modelos compatíveis.

  3. Instale o skill

    Adicione o model skill ao workspace de código antes de implementar a funcionalidade.

  4. Receba a saída

    Consulte por task ID ou trate o callback quando a geração terminar.

CONTEXTO

Onde GLM se encaixa

Os modelos GLM da Z.ai são LLMs MoE licenciados MIT com contexto de 128K–200K. GLM-5.1 lidera modelos open-weight no SWE-bench Pro. Pelo RunAPI, compartilham uma única API key com cobrança pay-as-you-go por token, chamáveis pelas superfícies OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.

Provedor
Z.ai
Ver tudo →
Modalidade
Text
Explorar modelos →

Por que usar GLM pela RunAPI

Uma API key

Use as mesmas credenciais entre modelos e provedores.

Pronto para skills

O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.

Cobrança previsível

O preço por uso fica visível antes da chamada.

Perguntas sobre GLM

Para que os modelos GLM são bons?

Coding e uso agêntico de ferramentas. GLM-5.1 lidera modelos open-weight no SWE-bench Pro (58,4%) e pontua 95,3% no AIME 2026. A linha completa é forte em tool calling multi-etapas, geração de código em grandes bases e raciocínio matemático.

Qual é a diferença entre glm-4.5 e glm-4.5-air?

glm-4.5 é o flagship 355B (32B parâmetros ativos) com contexto 128K; glm-4.5-air é um MoE mais leve de 106B (12B ativos) para trabalho cotidiano mais rápido e barato.

Como o GLM-5 se compara ao GLM-4.7?

GLM-5 escala para 744B total / 40B ativos com 256 especialistas, contra 358B / 32B do GLM-4.7. SWE-bench Verified salta de 73,8% para 77,8%. Ambos compartilham contexto 200K.

Quais SDKs podem chamar GLM pelo RunAPI?

Aponte o SDK da OpenAI (Chat Completions ou Responses) ou o SDK Anthropic Messages para o RunAPI e passe o model id do GLM; o proxy adapta o protocolo para você.

Como o GLM é cobrado?

Por token, pay-as-you-go, nas taxas publicadas pelo RunAPI para entrada e saída de cada modelo GLM — sem assinatura.

Como chamo este modelo?

Instale o model skill e siga as notas de setup com sua chave RunAPI.

MODELOS SIMILARES

Modelos similares a GLM

Comece a construir com GLM.