Retour à l'accueil

GLM-5.1 domine sur SWE-Bench Pro : 58.4 %

GLM-5.1 de Z.ai a atteint SOTA sur SWE-Bench Pro (58.4 %) grâce au mécanisme d'optimisation à long terme. Le modèle a assemblé un bureau Linux dans le navigateur en 8 heures et a accéléré la recherche ANN 6x sur VectorDBBench. Disponible sous MIT sur HuggingFace.

GLM-5.1 : 8 heures sur bureau Linux et SOTA en codage
Advertisement 728x90

GLM-5.1 : IA capable d'optimisation de code à long terme sans plateaux

GLM-5.1 de Z.ai domine SWE-Bench Pro avec 58.4 points, surpassant GPT-5.4 (57.7), Claude Opus 4.6 (57.3) et Gemini 3.1 Pro (54.2). Le modèle est disponible sur Hugging Face sous licence MIT. Avancée clé — résilience aux sessions longues : il décompose les tâches, expérimente, analyse les logs et ajuste les stratégies sur des centaines d'itérations.

Optimisation à long terme au lieu de plateaux rapides

Les modèles précédents, y compris GLM-5, épuisent rapidement leurs outils : ils appliquent des approches standard, atteignent un maximum local et s'arrêtent. GLM-5.1 est conçu pour des cycles de plusieurs heures. Enrichi de rétroaction, il :

  • Décompose la tâche en sous-objectifs.
  • Lance des expériences avec des outils.
  • Lit les métriques et les logs.
  • Identifie les goulots d'étranglement.
  • Reconstruit la stratégie.

Cela permet de surmonter les plateaux grâce à des milliers d'appels d'outils.

Google AdInline article slot

Bureau Linux dans le navigateur : 8 heures d'assemblage autonome

Tâche : implémenter une application web simulant un bureau Linux — sans code source ni maquettes. Les modèles typiques créent un squelette avec une barre des tâches et des stubs, puis abandonnent.

GLM-5.1 dans un cycle de revue a travaillé pendant 8 heures :

  • A construit un gestionnaire de fichiers avec navigation et aperçus.
  • A ajouté un terminal avec émulation bash.
  • A intégré un éditeur de texte avec coloration syntaxique.
  • A implémenté un moniteur système (CPU, RAM, réseau).
  • A inclus une calculatrice et des jeux simples.

Tous les composants dans un style d'interface unifié. Le modèle lui-même a décidé quoi affiner après chaque passage.

Google AdInline article slot

Record sur VectorDBBench : accélération 6x sur plus de 600 itérations

Benchmark : optimisation de la recherche de voisins les plus proches approximative (ANN) sur un squelette Rust. Précédent SOTA de Claude Opus 4.6 — 3547 QPS en 50 itérations.

GLM-5.1 dans un cycle étendu (plus de 600 soumissions, plus de 6000 appels) :

  • A atteint 21.5k QPS — 6x mieux.
  • A traversé 6 reconstructions structurelles :

- Force brute → index IVF.

Google AdInline article slot

- Compression vectorielle en f16.

- Recherche en deux étapes : notation u8 + classement f16.

- Routage hiérarchique.

Graphique de progression — un escalier : ajustements ponctuels alternent avec des changements radicaux d'approche basés sur l'analyse des logs.

KernelBench niveau 3 : optimisation GPU

Tâche : réglage de noyaux GPU. GLM-5.1 l'a accéléré 3.6x sur 1200 itérations. Claude Opus 4.6 domine (4.2×), mais GLM montre du potentiel en sessions longues.

Disponibilité et limites

Le modèle s'intègre avec Claude Code, OpenCode, Cline, OpenClaw. Disponible pour les abonnés GLM Coding Plan. Inconvénients :

  • Au pic, consomme la quota 3x plus vite (jusqu'à fin avril, hors pic — au tarif de base).
  • Lutte avec la cohérence sur des milliers d'appels.
  • Auto-évaluation sans métriques est faible.

Z.ai prévoit des optimisations pour les tâches longues.

Points clés

  • GLM-5.1 bat le SOTA sur SWE-Bench Pro (58.4 %) grâce à la pensée à long terme.
  • Sur VectorDBBench, atteint 21.5k QPS — 6x le record.
  • A assemblé un bureau Linux complet dans le navigateur en 8 heures sans indices.
  • Démontre une progression en escalier : 6 reconstructions de stratégie.
  • Nécessite des améliorations de cohérence pour les sessions extrêmes.

— Editorial Team

Advertisement 728x90

Lire ensuite