GLM-5.1 : IA capable d'optimisation de code à long terme sans plateaux
GLM-5.1 de Z.ai domine SWE-Bench Pro avec 58.4 points, surpassant GPT-5.4 (57.7), Claude Opus 4.6 (57.3) et Gemini 3.1 Pro (54.2). Le modèle est disponible sur Hugging Face sous licence MIT. Avancée clé — résilience aux sessions longues : il décompose les tâches, expérimente, analyse les logs et ajuste les stratégies sur des centaines d'itérations.
Optimisation à long terme au lieu de plateaux rapides
Les modèles précédents, y compris GLM-5, épuisent rapidement leurs outils : ils appliquent des approches standard, atteignent un maximum local et s'arrêtent. GLM-5.1 est conçu pour des cycles de plusieurs heures. Enrichi de rétroaction, il :
- Décompose la tâche en sous-objectifs.
- Lance des expériences avec des outils.
- Lit les métriques et les logs.
- Identifie les goulots d'étranglement.
- Reconstruit la stratégie.
Cela permet de surmonter les plateaux grâce à des milliers d'appels d'outils.
Bureau Linux dans le navigateur : 8 heures d'assemblage autonome
Tâche : implémenter une application web simulant un bureau Linux — sans code source ni maquettes. Les modèles typiques créent un squelette avec une barre des tâches et des stubs, puis abandonnent.
GLM-5.1 dans un cycle de revue a travaillé pendant 8 heures :
- A construit un gestionnaire de fichiers avec navigation et aperçus.
- A ajouté un terminal avec émulation bash.
- A intégré un éditeur de texte avec coloration syntaxique.
- A implémenté un moniteur système (CPU, RAM, réseau).
- A inclus une calculatrice et des jeux simples.
Tous les composants dans un style d'interface unifié. Le modèle lui-même a décidé quoi affiner après chaque passage.
Record sur VectorDBBench : accélération 6x sur plus de 600 itérations
Benchmark : optimisation de la recherche de voisins les plus proches approximative (ANN) sur un squelette Rust. Précédent SOTA de Claude Opus 4.6 — 3547 QPS en 50 itérations.
GLM-5.1 dans un cycle étendu (plus de 600 soumissions, plus de 6000 appels) :
- A atteint 21.5k QPS — 6x mieux.
- A traversé 6 reconstructions structurelles :
- Force brute → index IVF.
- Compression vectorielle en f16.
- Recherche en deux étapes : notation u8 + classement f16.
- Routage hiérarchique.
Graphique de progression — un escalier : ajustements ponctuels alternent avec des changements radicaux d'approche basés sur l'analyse des logs.
KernelBench niveau 3 : optimisation GPU
Tâche : réglage de noyaux GPU. GLM-5.1 l'a accéléré 3.6x sur 1200 itérations. Claude Opus 4.6 domine (4.2×), mais GLM montre du potentiel en sessions longues.
Disponibilité et limites
Le modèle s'intègre avec Claude Code, OpenCode, Cline, OpenClaw. Disponible pour les abonnés GLM Coding Plan. Inconvénients :
- Au pic, consomme la quota 3x plus vite (jusqu'à fin avril, hors pic — au tarif de base).
- Lutte avec la cohérence sur des milliers d'appels.
- Auto-évaluation sans métriques est faible.
Z.ai prévoit des optimisations pour les tâches longues.
Points clés
- GLM-5.1 bat le SOTA sur SWE-Bench Pro (58.4 %) grâce à la pensée à long terme.
- Sur VectorDBBench, atteint 21.5k QPS — 6x le record.
- A assemblé un bureau Linux complet dans le navigateur en 8 heures sans indices.
- Démontre une progression en escalier : 6 reconstructions de stratégie.
- Nécessite des améliorations de cohérence pour les sessions extrêmes.
— Editorial Team
Aucun commentaire pour le moment.