Text · Z.ai

GLM API

Acceso a la API de Z.ai GLM a través de RunAPI — modelos MoE con licencia MIT, hasta 200K de contexto y benchmarks líderes de programación open-weight.

Operativo · 8 variants · desde $0.0001
runapi.ai
# Base URL
https://runapi.ai

# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "glm-5.2",
  "messages": [
    {
      "role": "user",
      "content": "Lee este repositorio de varios archivos, encuentra la prueba de integración que falla y propone un parche con una explicación de la causa raíz."
    }
  ]
}'
from openai import OpenAI

client = OpenAI(
    base_url="https://runapi.ai/v1",
    api_key="your-runapi-key"
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Lee este repositorio de varios archivos, encuentra la prueba de integración que falla y propone un parche con una explicación de la causa raíz."}]
)
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://runapi.ai/v1",
  apiKey: "your-runapi-key"
});

const response = await client.chat.completions.create({
  model: "glm-5.2",
  messages: [{ role: "user", content: "Lee este repositorio de varios archivos, encuentra la prueba de integración que falla y propone un parche con una explicación de la causa raíz." }]
});
https://runapi.ai 5 endpoints
RESUMEN

GLM es la familia de modelos de lenguaje Mixture-of-Experts con licencia MIT de Z.ai. GLM-4.5 (355B total / 32B activos, contexto 128K) introdujo la línea MoE open-weight con un modelo insignia y un nivel Air más ligero. GLM-4.6 y 4.7 amplían el contexto a 200K con una generación de código más fuerte — 4.7 alcanza 73,8% en SWE-bench. La serie GLM-5 (744B / 40B activos, contexto 200K) sube a 77,8% en SWE-bench Verified, y GLM-5.1 mantiene la máxima puntuación open-weight en SWE-bench Pro con 58,4%. Todos están disponibles a través de RunAPI con una sola key y facturación por token.

  • Variantes para distintos objetivos de calidad y latencia
  • API key unificada
  • El model skill incluye documentación, schemas y notas de setup
  • Las generaciones fallidas no se cobran
VARIANTES

Variantes

Variant Billing Pricing
glm-4.5 1K tokens Input $0.41 / 1M tokens | Output $1.61 / 1M tokens Ver →
glm-4.5-air 1K tokens Input $0.10 / 1M tokens | Output $0.55 / 1M tokens Ver →
glm-4.6 1K tokens Input $0.60 / 1M tokens | Output $1.22 / 1M tokens Ver →
glm-4.7 1K tokens Input $0.60 / 1M tokens | Output $1.19 / 1M tokens Ver →
glm-5 1K tokens Input $1.00 / 1M tokens | Output $1.60 / 1M tokens Ver →
glm-5-turbo 1K tokens Input $1.20 / 1M tokens | Output $2.00 / 1M tokens Ver →
glm-5.1 1K tokens Input $1.40 / 1M tokens | Output $2.20 / 1M tokens Ver →
glm-5.2 1K tokens Input $0.70 / 1M tokens | Output $2.20 / 1M tokens Ver →
API

Endpoints API de GLM

Usa el SDK de OpenAI o Anthropic con tu clave RunAPI. No se necesita SDK adicional.

Endpoint Protocol
/v1/chat/completions OpenAI compatible
/v1/responses OpenAI Responses
/v1/messages Anthropic compatible
/v1beta/models/{model}:generateContent Gemini generateContent
/v1beta/models/{model}:streamGenerateContent Gemini streamGenerateContent
CÓMO FUNCIONA

Cómo construir con este model skill

01

Elige el modelo

Selecciona el modelo y la variante que encajan con tu tipo de salida, calidad objetivo y latencia.

02

Autentica una vez

Usa tu clave RunAPI para todos los modelos compatibles.

03

Instala el skill

Añade el model skill a tu workspace de código antes de implementar la función.

04

Recibe la salida

Consulta por task ID o procesa el callback cuando termine la generación.

CONTEXTO

Dónde encaja GLM

Los modelos GLM de Z.ai son LLMs MoE con licencia MIT y contexto de 128K–200K. GLM-5.1 lidera los modelos open-weight en SWE-bench Pro. A través de RunAPI comparten una única API key con facturación por token de pago por uso, y pueden llamarse desde OpenAI Chat Completions, OpenAI Responses y Anthropic Messages.

Provider
Z.ai
Modality
Text
POR QUÉ RUNAPI

Por qué usar GLM mediante RunAPI

Una API key

Usa las mismas credenciales entre modelos y proveedores.

Listo para skills

El model skill incluye schemas, notas de setup, contexto de precios e IDs de modelo.

Facturación predecible

El precio por uso es visible antes de llamar.

FAQ

Preguntas frecuentes

¿Para qué sirven mejor los modelos GLM?

Programación y uso agéntico de herramientas. GLM-5.1 lidera los modelos open-weight en SWE-bench Pro (58,4%) y obtiene 95,3% en AIME 2026. Toda la línea destaca en llamadas a herramientas de varios pasos, generación de código en grandes bases de código y razonamiento matemático.

¿Cuál es la diferencia entre glm-4.5 y glm-4.5-air?

glm-4.5 es el modelo insignia de 355B (32B parámetros activos) con contexto 128K; glm-4.5-air es un MoE más ligero de 106B (12B activos) para trabajo cotidiano más rápido y económico.

¿Cómo se compara GLM-5 con GLM-4.7?

GLM-5 escala a 744B totales / 40B activos con 256 expertos, frente a los 358B / 32B de GLM-4.7. SWE-bench Verified sube de 73,8% a 77,8%. Ambos comparten contexto 200K.

¿Qué SDKs pueden llamar a GLM a través de RunAPI?

Apunta el SDK de OpenAI (Chat Completions o Responses) o el SDK de Anthropic Messages a RunAPI y pasa el ID del modelo GLM; el proxy adapta el protocolo por ti.

¿Cómo se factura GLM?

Por token, en modalidad de pago por uso, según las tarifas publicadas de entrada y salida de RunAPI para cada modelo GLM — sin suscripción.

¿Cómo llamo a este modelo?

Instala el model skill y sigue sus notas de setup con tu clave RunAPI.

¿Las generaciones fallidas cuestan dinero?

Las generaciones fallidas no se cobran

¿Puedo llamarlo desde mi aplicación?

Sí. Instala el model skill en tu workspace de código y úsalo mientras añades la función del modelo.

EMPEZAR

Empieza a construir con GLM.