Text · Z.ai

GLM API

Z.ai GLM API-Zugang über RunAPI — MIT-lizenzierte MoE-Modelle mit bis zu 200K Kontext und führenden Open-Weight-Coding-Benchmarks.

Betriebsbereit · 8 variants · ab $0.0001
runapi.ai
# Base URL
https://runapi.ai

# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $RUNAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "glm-5.2",
  "messages": [
    {
      "role": "user",
      "content": "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor."
    }
  ]
}'
from openai import OpenAI

client = OpenAI(
    base_url="https://runapi.ai/v1",
    api_key="your-runapi-key"
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor."}]
)
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://runapi.ai/v1",
  apiKey: "your-runapi-key"
});

const response = await client.chat.completions.create({
  model: "glm-5.2",
  messages: [{ role: "user", content: "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor." }]
});
https://runapi.ai 5 endpoints
ÜBERBLICK

GLM ist die Familie MIT-lizenzierter Mixture-of-Experts-Sprachmodelle von Z.ai. GLM-4.5 (355B gesamt / 32B aktiv, 128K Kontext) führte die Open-Weight-MoE-Linie mit einem Flagship und einer leichteren Air-Stufe ein. GLM-4.6 und 4.7 erweitern auf 200K Kontext mit stärkerer Code-Generierung — 4.7 erreicht 73,8 % auf SWE-bench. Die GLM-5-Serie (744B / 40B aktiv, 200K Kontext) geht weiter bis 77,8 % SWE-bench Verified, und GLM-5.1 hält mit 58,4 % den höchsten Open-Weight-Score auf SWE-bench Pro. Alle sind über RunAPI mit einem Key und tokenbasierter Abrechnung verfügbar.

  • Modellvarianten für verschiedene Qualitäts- und Latenzziele
  • Einheitlicher API Key
  • Model Skill enthält Docs, Schemas und Setup-Hinweise
  • Fehlgeschlagene Generierungen werden nicht berechnet
VARIANTEN

Varianten

Variant Billing Pricing
glm-4.5 1K tokens Input $0.41 / 1M tokens | Output $1.61 / 1M tokens Ansehen →
glm-4.5-air 1K tokens Input $0.10 / 1M tokens | Output $0.55 / 1M tokens Ansehen →
glm-4.6 1K tokens Input $0.60 / 1M tokens | Output $1.22 / 1M tokens Ansehen →
glm-4.7 1K tokens Input $0.60 / 1M tokens | Output $1.19 / 1M tokens Ansehen →
glm-5 1K tokens Input $1.00 / 1M tokens | Output $1.60 / 1M tokens Ansehen →
glm-5-turbo 1K tokens Input $1.20 / 1M tokens | Output $2.00 / 1M tokens Ansehen →
glm-5.1 1K tokens Input $1.40 / 1M tokens | Output $2.20 / 1M tokens Ansehen →
glm-5.2 1K tokens Input $0.70 / 1M tokens | Output $2.20 / 1M tokens Ansehen →
API

GLM API-Endpunkte

Nutze das OpenAI- oder Anthropic-SDK mit deinem RunAPI-Key. Kein zusätzliches SDK nötig.

Endpoint Protocol
/v1/chat/completions OpenAI compatible
/v1/responses OpenAI Responses
/v1/messages Anthropic compatible
/v1beta/models/{model}:generateContent Gemini generateContent
/v1beta/models/{model}:streamGenerateContent Gemini streamGenerateContent
SO FUNKTIONIERT ES

Mit diesem Model Skill bauen

01

Modell wählen

Wähle Modell und Variante passend zu Ausgabetyp, Qualitätsziel und Latenz.

02

Einmal authentifizieren

Nutze deinen RunAPI Key für jedes unterstützte Modell.

03

Skill installieren

Füge den Model Skill deinem Coding-Workspace hinzu, bevor du das Feature implementierst.

04

Ergebnis empfangen

Frage per Task ID ab oder verarbeite den Callback, wenn die Generierung abgeschlossen ist.

KONTEXT

Wo GLM passt

GLM-Modelle von Z.ai sind MIT-lizenzierte MoE-LLMs mit 128K–200K Kontext. GLM-5.1 führt Open-Weight-Modelle auf SWE-bench Pro an. Über RunAPI teilen sie einen gemeinsamen API-Key mit nutzungsbasierter Token-Abrechnung und sind über OpenAI Chat Completions, OpenAI Responses und Anthropic Messages aufrufbar.

Provider
Z.ai
Modality
Text
WARUM RUNAPI

Warum GLM über RunAPI nutzen

Ein API Key

Nutze dieselben Zugangsdaten über Modelle und Anbieter hinweg.

Skill-ready

Der Model Skill enthält Schemas, Setup-Hinweise, Preiskontext und Modell-IDs.

Planbare Abrechnung

Nutzungsbasierte Preise sind vor dem Aufruf sichtbar.

FAQ

Häufige Fragen

Wofür sind GLM-Modelle gut?

Coding und agentischer Tool-Einsatz. GLM-5.1 führt Open-Weight-Modelle auf SWE-bench Pro an (58,4 %) und erreicht 95,3 % auf AIME 2026. Die gesamte Linie ist stark bei mehrstufigen Tool Calls, Code-Generierung über große Codebasen und mathematischem Reasoning.

Was ist der Unterschied zwischen glm-4.5 und glm-4.5-air?

glm-4.5 ist das 355B-Flagship (32B aktive Parameter) mit 128K Kontext; glm-4.5-air ist ein leichteres 106B-MoE-Modell (12B aktiv) für schnellere, günstigere Alltagsaufgaben.

Wie schneidet GLM-5 im Vergleich zu GLM-4.7 ab?

GLM-5 skaliert auf 744B gesamt / 40B aktiv mit 256 Experten, gegenüber 358B / 32B bei GLM-4.7. SWE-bench Verified steigt von 73,8 % auf 77,8 %. Beide haben 200K Kontext.

Welche SDKs können GLM über RunAPI aufrufen?

Richte das OpenAI SDK (Chat Completions oder Responses) oder das Anthropic Messages SDK auf RunAPI und übergib die GLM-Modell-ID; der Proxy passt das Protokoll für dich an.

Wie wird GLM abgerechnet?

Pro Token, nutzungsbasiert, zu RunAPIs veröffentlichten Input- und Output-Raten für jedes GLM-Modell — ohne Abo.

Wie rufe ich dieses Modell auf?

Installiere den Model Skill und folge den Setup-Hinweisen mit deinem RunAPI Key.

Kosten fehlgeschlagene Generierungen Geld?

Fehlgeschlagene Generierungen werden nicht berechnet

Kann ich es aus meiner Anwendung aufrufen?

Ja. Installiere den Model Skill im Coding-Workspace und nutze ihn beim Einbau des Modell-Features.

JETZT STARTEN

Mit GLM bauen.