GLM API
Z.ai GLM API-Zugang über RunAPI — MIT-lizenzierte MoE-Modelle mit bis zu 200K Kontext und führenden Open-Weight-Coding-Benchmarks.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor." }]
});
GLM ist die Familie MIT-lizenzierter Mixture-of-Experts-Sprachmodelle von Z.ai. GLM-4.5 (355B gesamt / 32B aktiv, 128K Kontext) führte die Open-Weight-MoE-Linie mit einem Flagship und einer leichteren Air-Stufe ein. GLM-4.6 und 4.7 erweitern auf 200K Kontext mit stärkerer Code-Generierung — 4.7 erreicht 73,8 % auf SWE-bench. Die GLM-5-Serie (744B / 40B aktiv, 200K Kontext) geht weiter bis 77,8 % SWE-bench Verified, und GLM-5.1 hält mit 58,4 % den höchsten Open-Weight-Score auf SWE-bench Pro. Alle sind über RunAPI mit einem Key und tokenbasierter Abrechnung verfügbar.
- Modellvarianten für verschiedene Qualitäts- und Latenzziele
- Einheitlicher API Key
- Model Skill enthält Docs, Schemas und Setup-Hinweise
- Fehlgeschlagene Generierungen werden nicht berechnet
Varianten
| Variant | Billing | Pricing | |
|---|---|---|---|
| glm-4.5 | 1K tokens | Input $0.41 / 1M tokens | Output $1.61 / 1M tokens | Ansehen → |
| glm-4.5-air | 1K tokens | Input $0.10 / 1M tokens | Output $0.55 / 1M tokens | Ansehen → |
| glm-4.6 | 1K tokens | Input $0.60 / 1M tokens | Output $1.22 / 1M tokens | Ansehen → |
| glm-4.7 | 1K tokens | Input $0.60 / 1M tokens | Output $1.19 / 1M tokens | Ansehen → |
| glm-5 | 1K tokens | Input $1.00 / 1M tokens | Output $1.60 / 1M tokens | Ansehen → |
| glm-5-turbo | 1K tokens | Input $1.20 / 1M tokens | Output $2.00 / 1M tokens | Ansehen → |
| glm-5.1 | 1K tokens | Input $1.40 / 1M tokens | Output $2.20 / 1M tokens | Ansehen → |
| glm-5.2 | 1K tokens | Input $0.70 / 1M tokens | Output $2.20 / 1M tokens | Ansehen → |
GLM API-Endpunkte
Nutze das OpenAI- oder Anthropic-SDK mit deinem RunAPI-Key. Kein zusätzliches SDK nötig.
| Endpoint | Protocol |
|---|---|
| /v1/chat/completions | OpenAI compatible |
| /v1/responses | OpenAI Responses |
| /v1/messages | Anthropic compatible |
| /v1beta/models/{model}:generateContent | Gemini generateContent |
| /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
Mit diesem Model Skill bauen
Modell wählen
Wähle Modell und Variante passend zu Ausgabetyp, Qualitätsziel und Latenz.
Einmal authentifizieren
Nutze deinen RunAPI Key für jedes unterstützte Modell.
Skill installieren
Füge den Model Skill deinem Coding-Workspace hinzu, bevor du das Feature implementierst.
Ergebnis empfangen
Frage per Task ID ab oder verarbeite den Callback, wenn die Generierung abgeschlossen ist.
Wo GLM passt
GLM-Modelle von Z.ai sind MIT-lizenzierte MoE-LLMs mit 128K–200K Kontext. GLM-5.1 führt Open-Weight-Modelle auf SWE-bench Pro an. Über RunAPI teilen sie einen gemeinsamen API-Key mit nutzungsbasierter Token-Abrechnung und sind über OpenAI Chat Completions, OpenAI Responses und Anthropic Messages aufrufbar.
Warum GLM über RunAPI nutzen
Ein API Key
Nutze dieselben Zugangsdaten über Modelle und Anbieter hinweg.
Skill-ready
Der Model Skill enthält Schemas, Setup-Hinweise, Preiskontext und Modell-IDs.
Planbare Abrechnung
Nutzungsbasierte Preise sind vor dem Aufruf sichtbar.
Häufige Fragen
Wofür sind GLM-Modelle gut?
Coding und agentischer Tool-Einsatz. GLM-5.1 führt Open-Weight-Modelle auf SWE-bench Pro an (58,4 %) und erreicht 95,3 % auf AIME 2026. Die gesamte Linie ist stark bei mehrstufigen Tool Calls, Code-Generierung über große Codebasen und mathematischem Reasoning.
Was ist der Unterschied zwischen glm-4.5 und glm-4.5-air?
glm-4.5 ist das 355B-Flagship (32B aktive Parameter) mit 128K Kontext; glm-4.5-air ist ein leichteres 106B-MoE-Modell (12B aktiv) für schnellere, günstigere Alltagsaufgaben.
Wie schneidet GLM-5 im Vergleich zu GLM-4.7 ab?
GLM-5 skaliert auf 744B gesamt / 40B aktiv mit 256 Experten, gegenüber 358B / 32B bei GLM-4.7. SWE-bench Verified steigt von 73,8 % auf 77,8 %. Beide haben 200K Kontext.
Welche SDKs können GLM über RunAPI aufrufen?
Richte das OpenAI SDK (Chat Completions oder Responses) oder das Anthropic Messages SDK auf RunAPI und übergib die GLM-Modell-ID; der Proxy passt das Protokoll für dich an.
Wie wird GLM abgerechnet?
Pro Token, nutzungsbasiert, zu RunAPIs veröffentlichten Input- und Output-Raten für jedes GLM-Modell — ohne Abo.
Wie rufe ich dieses Modell auf?
Installiere den Model Skill und folge den Setup-Hinweisen mit deinem RunAPI Key.
Kosten fehlgeschlagene Generierungen Geld?
Fehlgeschlagene Generierungen werden nicht berechnet
Kann ich es aus meiner Anwendung aufrufen?
Ja. Installiere den Model Skill im Coding-Workspace und nutze ihn beim Einbau des Modell-Features.