GLM API
Accès API Z.ai GLM via RunAPI — modèles MoE sous licence MIT avec contexte jusqu'à 200K et benchmarks de code open-weight de premier plan.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Lisez ce dépôt multi-fichiers, trouvez le test d'intégration en échec et proposez un patch avec une explication de la cause racine."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Lisez ce dépôt multi-fichiers, trouvez le test d'intégration en échec et proposez un patch avec une explication de la cause racine."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "Lisez ce dépôt multi-fichiers, trouvez le test d'intégration en échec et proposez un patch avec une explication de la cause racine." }]
});
GLM est la famille de modèles de langage Mixture-of-Experts sous licence MIT de Z.ai. GLM-4.5 (355B total / 32B actifs, contexte 128K) a introduit la ligne MoE open-weight avec un flagship et un niveau Air plus léger. GLM-4.6 et 4.7 étendent le contexte à 200K avec une génération de code plus forte — 4.7 atteint 73,8 % sur SWE-bench. La série GLM-5 (744B / 40B actifs, contexte 200K) va plus loin avec 77,8 % sur SWE-bench Verified, et GLM-5.1 détient le meilleur score open-weight sur SWE-bench Pro à 58,4 %. Tous sont disponibles via RunAPI avec une seule clé et une facturation au token.
- Variantes de modèle pour différents objectifs de qualité et de latence
- API key unifiée
- Le model skill inclut docs, schémas et notes de setup
- Les générations échouées ne sont pas facturées
Variantes
| Variant | Billing | Pricing | |
|---|---|---|---|
| glm-4.5 | 1K tokens | Input $0.41 / 1M tokens | Output $1.61 / 1M tokens | Voir → |
| glm-4.5-air | 1K tokens | Input $0.10 / 1M tokens | Output $0.55 / 1M tokens | Voir → |
| glm-4.6 | 1K tokens | Input $0.60 / 1M tokens | Output $1.22 / 1M tokens | Voir → |
| glm-4.7 | 1K tokens | Input $0.60 / 1M tokens | Output $1.19 / 1M tokens | Voir → |
| glm-5 | 1K tokens | Input $1.00 / 1M tokens | Output $1.60 / 1M tokens | Voir → |
| glm-5-turbo | 1K tokens | Input $1.20 / 1M tokens | Output $2.00 / 1M tokens | Voir → |
| glm-5.1 | 1K tokens | Input $1.40 / 1M tokens | Output $2.20 / 1M tokens | Voir → |
| glm-5.2 | 1K tokens | Input $0.70 / 1M tokens | Output $2.20 / 1M tokens | Voir → |
Points d'accès API GLM
Utilisez le SDK OpenAI ou Anthropic avec votre clé RunAPI. Aucun SDK supplémentaire requis.
| Endpoint | Protocol |
|---|---|
| /v1/chat/completions | OpenAI compatible |
| /v1/responses | OpenAI Responses |
| /v1/messages | Anthropic compatible |
| /v1beta/models/{model}:generateContent | Gemini generateContent |
| /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
Construire avec ce model skill
Choisir le modèle
Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.
S'authentifier une fois
Utilisez votre clé RunAPI pour tous les modèles pris en charge.
Installer le skill
Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.
Recevoir la sortie
Interrogez par task ID ou traitez le callback quand la génération se termine.
Où utiliser GLM
Les modèles GLM de Z.ai sont des LLM MoE sous licence MIT couvrant 128K–200K de contexte. GLM-5.1 mène les modèles open-weight sur SWE-bench Pro. Via RunAPI, ils partagent une seule clé API avec facturation au token à l'usage, et sont appelables depuis OpenAI Chat Completions, OpenAI Responses et Anthropic Messages.
Pourquoi utiliser GLM via RunAPI
Une API key
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Prêt pour les skills
Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.
Facturation prévisible
Les tarifs à l'usage sont visibles avant l'appel.
Questions fréquentes
À quoi servent les modèles GLM ?
Au code et à l'utilisation d'outils agentiques. GLM-5.1 mène les modèles open-weight sur SWE-bench Pro (58,4 %) et obtient 95,3 % sur AIME 2026. Toute la ligne est forte en appels d'outils multi-étapes, génération de code sur de grandes bases de code et raisonnement mathématique.
Quelle est la différence entre glm-4.5 et glm-4.5-air ?
glm-4.5 est le flagship 355B (32B paramètres actifs) avec contexte 128K ; glm-4.5-air est un MoE plus léger de 106B (12B actifs) pour les tâches courantes plus rapides et moins coûteuses.
Comment GLM-5 se compare-t-il à GLM-4.7 ?
GLM-5 passe à 744B total / 40B actifs avec 256 experts, contre 358B / 32B pour GLM-4.7. SWE-bench Verified passe de 73,8 % à 77,8 %. Les deux partagent un contexte 200K.
Quels SDKs peuvent appeler GLM via RunAPI ?
Pointez le SDK OpenAI (Chat Completions ou Responses) ou le SDK Anthropic Messages vers RunAPI et passez l'identifiant de modèle GLM ; le proxy adapte le protocole pour vous.
Comment GLM est-il facturé ?
Au token, à l'usage, selon les tarifs d'entrée et de sortie publiés par RunAPI pour chaque modèle GLM — sans abonnement.
Comment appeler ce modèle ?
Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.
Les générations échouées coûtent-elles quelque chose ?
Les générations échouées ne sont pas facturées
Puis-je l'appeler depuis mon application ?
Oui. Installez le model skill dans votre workspace de code et utilisez-le pendant l'ajout de la fonctionnalité.