Une API key
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Utilisez l'API GLM via RunAPI avec une compétence de modèle, une authentification unifiée et une tarification à l'usage.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Lisez ce dépôt multi-fichiers, trouvez le test d'intégration en échec et proposez un patch avec une explication de la cause racine."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "Lisez ce dépôt multi-fichiers, trouvez le test d'intégration en échec et proposez un patch avec une explication de la cause racine."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [{ role: "user", content: "Lisez ce dépôt multi-fichiers, trouvez le test d'intégration en échec et proposez un patch avec une explication de la cause racine." }]
});
GLM est la famille de modèles de langage Mixture-of-Experts sous licence MIT de Z.ai. GLM-4.5 (355B total / 32B actifs, contexte 128K) a introduit la ligne MoE open-weight avec un flagship et un niveau Air plus léger. GLM-4.6 et 4.7 étendent le contexte à 200K avec une génération de code plus forte — 4.7 atteint 73,8 % sur SWE-bench. La série GLM-5 (744B / 40B actifs, contexte 200K) va plus loin avec 77,8 % sur SWE-bench Verified, et GLM-5.1 détient le meilleur score open-weight sur SWE-bench Pro à 58,4 %. Tous sont disponibles via RunAPI avec une seule clé et une facturation au token.
| Endpoint | Protocol |
|---|---|
POST /v1/chat/completions | OpenAI compatible |
POST /v1/responses | OpenAI Responses |
POST /v1/messages | Anthropic compatible |
POST /v1beta/models/{model}:generateContent | Gemini generateContent |
POST /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
| Variante | Facturation | Tarifs | |
|---|---|---|---|
| glm-4.5 | 1 000 jetons | Entrée $0.41 / 1M de tokens | Sortie $1.61 / 1M de tokens | Voir → |
| glm-4.5-air | 1 000 jetons | Entrée $0.10 / 1M de tokens | Sortie $0.55 / 1M de tokens | Voir → |
| glm-4.6 | 1 000 jetons | Entrée $0.60 / 1M de tokens | Sortie $1.22 / 1M de tokens | Voir → |
| glm-4.7 | 1 000 jetons | Entrée $0.60 / 1M de tokens | Sortie $1.19 / 1M de tokens | Voir → |
| glm-5 | 1 000 jetons | Entrée $1.00 / 1M de tokens | Sortie $1.60 / 1M de tokens | Voir → |
| glm-5-turbo | 1 000 jetons | Entrée $1.20 / 1M de tokens | Sortie $2.00 / 1M de tokens | Voir → |
| glm-5.1 | 1 000 jetons | Entrée $1.40 / 1M de tokens | Sortie $2.20 / 1M de tokens | Voir → |
| glm-5.2 | 1 000 jetons | Entrée $0.70 / 1M de tokens | Sortie $2.20 / 1M de tokens | Voir → |
| glm-5.3 | 1 000 jetons | Entrée $1.40 / 1M de tokens | Sortie $4.40 / 1M de tokens | Voir → |
| Endpoint | Résolution | Durée | Prix | |
|---|---|---|---|---|
| chat_completion | — | — | Entrée $0.41 / 1M de tokens | Sortie $1.61 / 1M de tokens |
Prix affichés pour glm-4.5. Les autres variantes conservent leurs propres tarifs par endpoint.
Sélectionnez le modèle et la variante adaptés au type de sortie, au niveau de qualité et à la latence cible.
Utilisez votre clé RunAPI pour tous les modèles pris en charge.
Ajoutez le model skill à votre workspace de code avant d'implémenter la fonctionnalité.
Interrogez par task ID ou traitez le callback quand la génération se termine.
Les modèles GLM de Z.ai sont des LLM MoE sous licence MIT couvrant 128K–200K de contexte. GLM-5.1 mène les modèles open-weight sur SWE-bench Pro. Via RunAPI, ils partagent une seule clé API avec facturation au token à l'usage, et sont appelables depuis OpenAI Chat Completions, OpenAI Responses et Anthropic Messages.
Utilisez les mêmes identifiants pour les modèles et les fournisseurs.
Le model skill inclut schémas, notes de setup, contexte tarifaire et IDs de modèle.
Les tarifs à l'usage sont visibles avant l'appel.
Au code et à l'utilisation d'outils agentiques. GLM-5.1 mène les modèles open-weight sur SWE-bench Pro (58,4 %) et obtient 95,3 % sur AIME 2026. Toute la ligne est forte en appels d'outils multi-étapes, génération de code sur de grandes bases de code et raisonnement mathématique.
glm-4.5 est le flagship 355B (32B paramètres actifs) avec contexte 128K ; glm-4.5-air est un MoE plus léger de 106B (12B actifs) pour les tâches courantes plus rapides et moins coûteuses.
GLM-5 passe à 744B total / 40B actifs avec 256 experts, contre 358B / 32B pour GLM-4.7. SWE-bench Verified passe de 73,8 % à 77,8 %. Les deux partagent un contexte 200K.
Pointez le SDK OpenAI (Chat Completions ou Responses) ou le SDK Anthropic Messages vers RunAPI et passez l'identifiant de modèle GLM ; le proxy adapte le protocole pour vous.
Au token, à l'usage, selon les tarifs d'entrée et de sortie publiés par RunAPI pour chaque modèle GLM — sans abonnement.
Installez le model skill et suivez ses notes de setup avec votre clé RunAPI.