It looks like you may prefer a different language. Switch anytime.

Text Z.ai

GLM API

Nutze die GLM API über RunAPI mit einem Modell-Skill, einheitlicher Authentifizierung und Pay-as-you-go-Preisen.

runapi.ai
# Base URL
https://runapi.ai

# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "glm-5.3",
  "messages": [
    {
      "role": "user",
      "content": "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor."
    }
  ]
}'
from openai import OpenAI

client = OpenAI(
    base_url="https://runapi.ai/v1",
    api_key="your-runapi-key"
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor."}]
)
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://runapi.ai/v1",
  apiKey: "your-runapi-key"
});

const response = await client.chat.completions.create({
  model: "glm-5.3",
  messages: [{ role: "user", content: "Lies dieses Repository mit mehreren Dateien, finde den fehlschlagenden Integrationstest und schlage einen Patch mit Erklärung der Ursache vor." }]
});
https://runapi.ai 5 endpoints
ÜBERBLICK

Über GLM

GLM ist die Familie MIT-lizenzierter Mixture-of-Experts-Sprachmodelle von Z.ai. GLM-4.5 (355B gesamt / 32B aktiv, 128K Kontext) führte die Open-Weight-MoE-Linie mit einem Flagship und einer leichteren Air-Stufe ein. GLM-4.6 und 4.7 erweitern auf 200K Kontext mit stärkerer Code-Generierung — 4.7 erreicht 73,8 % auf SWE-bench. Die GLM-5-Serie (744B / 40B aktiv, 200K Kontext) geht weiter bis 77,8 % SWE-bench Verified, und GLM-5.1 hält mit 58,4 % den höchsten Open-Weight-Score auf SWE-bench Pro. Alle sind über RunAPI mit einem Key und tokenbasierter Abrechnung verfügbar.

Anbieter
Z.ai
Modalität
Text

GLM API-Endpunkte

EndpointProtocol
POST /v1/chat/completionsOpenAI compatible
POST /v1/responsesOpenAI Responses
POST /v1/messagesAnthropic compatible
POST /v1beta/models/{model}:generateContentGemini generateContent
POST /v1beta/models/{model}:streamGenerateContentGemini streamGenerateContent

Varianten

Variante Abrechnung Preise
glm-4.5 1K tokens Input $0.41 / 1M tokens | Output $1.61 / 1M tokens Ansehen →
glm-4.5-air 1K tokens Input $0.10 / 1M tokens | Output $0.55 / 1M tokens Ansehen →
glm-4.6 1K tokens Input $0.60 / 1M tokens | Output $1.22 / 1M tokens Ansehen →
glm-4.7 1K tokens Input $0.60 / 1M tokens | Output $1.19 / 1M tokens Ansehen →
glm-5 1K tokens Input $1.00 / 1M tokens | Output $1.60 / 1M tokens Ansehen →
glm-5-turbo 1K tokens Input $1.20 / 1M tokens | Output $2.00 / 1M tokens Ansehen →
glm-5.1 1K tokens Input $1.40 / 1M tokens | Output $2.20 / 1M tokens Ansehen →
glm-5.2 1K tokens Input $0.70 / 1M tokens | Output $2.20 / 1M tokens Ansehen →
glm-5.3 1K tokens Input $1.40 / 1M tokens | Output $4.40 / 1M tokens Ansehen →
PREISE

GLM-Preise

Endpoint Auflösung Dauer Preis
chat_completion Input $0.41 / 1M tokens | Output $1.61 / 1M tokens

Preise für glm-4.5 angezeigt. Andere Varianten behalten ihre eigenen Endpoint-Preise.

Agent-Integration

GLM mit einem Agenten ausführen

SO FUNKTIONIERT ES

Mit GLM starten

  1. Modell wählen

    Wähle Modell und Variante passend zu Ausgabetyp, Qualitätsziel und Latenz.

  2. Einmal authentifizieren

    Nutze deinen RunAPI Key für jedes unterstützte Modell.

  3. Skill installieren

    Füge den Model Skill deinem Coding-Workspace hinzu, bevor du das Feature implementierst.

  4. Ergebnis empfangen

    Frage per Task ID ab oder verarbeite den Callback, wenn die Generierung abgeschlossen ist.

KONTEXT

Wo GLM passt

GLM-Modelle von Z.ai sind MIT-lizenzierte MoE-LLMs mit 128K–200K Kontext. GLM-5.1 führt Open-Weight-Modelle auf SWE-bench Pro an. Über RunAPI teilen sie einen gemeinsamen API-Key mit nutzungsbasierter Token-Abrechnung und sind über OpenAI Chat Completions, OpenAI Responses und Anthropic Messages aufrufbar.

Anbieter
Z.ai
Alle ansehen →
Modalität
Text
Modelle durchsuchen →

Warum GLM über RunAPI nutzen

Ein API Key

Nutze dieselben Zugangsdaten über Modelle und Anbieter hinweg.

Skill-ready

Der Model Skill enthält Schemas, Setup-Hinweise, Preiskontext und Modell-IDs.

Planbare Abrechnung

Nutzungsbasierte Preise sind vor dem Aufruf sichtbar.

GLM-Fragen

Wofür sind GLM-Modelle gut?

Coding und agentischer Tool-Einsatz. GLM-5.1 führt Open-Weight-Modelle auf SWE-bench Pro an (58,4 %) und erreicht 95,3 % auf AIME 2026. Die gesamte Linie ist stark bei mehrstufigen Tool Calls, Code-Generierung über große Codebasen und mathematischem Reasoning.

Was ist der Unterschied zwischen glm-4.5 und glm-4.5-air?

glm-4.5 ist das 355B-Flagship (32B aktive Parameter) mit 128K Kontext; glm-4.5-air ist ein leichteres 106B-MoE-Modell (12B aktiv) für schnellere, günstigere Alltagsaufgaben.

Wie schneidet GLM-5 im Vergleich zu GLM-4.7 ab?

GLM-5 skaliert auf 744B gesamt / 40B aktiv mit 256 Experten, gegenüber 358B / 32B bei GLM-4.7. SWE-bench Verified steigt von 73,8 % auf 77,8 %. Beide haben 200K Kontext.

Welche SDKs können GLM über RunAPI aufrufen?

Richte das OpenAI SDK (Chat Completions oder Responses) oder das Anthropic Messages SDK auf RunAPI und übergib die GLM-Modell-ID; der Proxy passt das Protokoll für dich an.

Wie wird GLM abgerechnet?

Pro Token, nutzungsbasiert, zu RunAPIs veröffentlichten Input- und Output-Raten für jedes GLM-Modell — ohne Abo.

Wie rufe ich dieses Modell auf?

Installiere den Model Skill und folge den Setup-Hinweisen mit deinem RunAPI Key.

ÄHNLICHE MODELLE

Ähnliche Modelle wie GLM

Mit GLM bauen.