Zpět na domů

GLM-5.1 vede na SWE-Bench Pro: 58,4%

GLM-5.1 od Z.ai dosáhla SOTA na SWE-Bench Pro (58,4%) díky mechanismu dlouhodobé optimalizace. Model sestavil Linux desktop v prohlížeči za 8 hodin a zrychlil ANN-vyhledávání 6krát na VectorDBBench. Dostupná pod MIT na HuggingFace.

GLM-5.1: 8 hodin na Linux desktop a SOTA v kódování
Advertisement 728x90

# GLM-5.1: AI schopný dlouhodobé optimalizace kódu bez plató

GLM-5.1 od Z.ai vede na SWE-Bench Pro s 58,4 body a překonává GPT-5.4 (57,7), Claude Opus 4.6 (57,3) a Gemini 3.1 Pro (54,2). Model je dostupný na HuggingFace pod MIT licencí. Klíčový průlom spočívá v odolnosti vůči dlouhým seancím: rozkládá úlohy, experimentuje, analyzuje logy a upravuje strategie při stovek iterací.

Dlouhodobá optimalizace místo rychlého plató

Předchozí modely včetně GLM-5 rychle vyčerpávají nástroje: aplikují standardní postupy, dosáhnou lokálního maxima a zastaví se. GLM-5.1 je navržena pro vícehodinové cykly. V kombinaci s zpětnou vazbou:

  • Rozkládá úlohu na dílčí cíle.
  • Spouští experimenty s nástroji.
  • Čte metriky a logy.
  • Identifikuje úzká místa.
  • Přestavuje strategii.

To umožňuje překonávat plató prostřednictvím tisíců volání nástrojů.

Google AdInline article slot

Linux desktop v prohlížeči: 8 hodin autonomního sestavování

Úloha: realizovat webovou aplikaci napodobující Linux desktop – bez zdrojového kódu nebo návrhů. Běžné modely vytvoří kostru s panelu úloh a náhražkami, pak se vzdají.

GLM-5.1 v cyklu s revizí pracovala 8 hodin:

  • Sestavila správce souborů s navigací a náhledy.
  • Přidala terminál s emulací bash.
  • Integruje textový editor s podsvícením syntaxe.
  • Realizovala systémový monitor (CPU, RAM, síť).
  • Zahrnula kalkulačku a jednoduché hry.

Všechny komponenty v jednotném stylu UI. Model sám rozhodoval, co vylepšit po každém průchodu.

Google AdInline article slot

Rekord na VectorDBBench: zrychlení x6 za 600+ iterací

Benchmark: optimalizace vyhledávání nejbližších sousedů (ANN) na Rust skeletu. Předchozí SOTA od Claude Opus 4.6 – 3547 QPS za 50 iterací.

GLM-5.1 v rozšířeném cyklu (600+ odeslání, 6000+ volání):

  • Dosáhla 21,5 tis. QPS – 6× lepší.
  • Prošla 6 strukturálními přestavbami:

- Plné prohledávání → IVF index.

Google AdInline article slot

- Komprese vektorů do f16.

- Dvoustupňové vyhledávání: u8 skórování + f16 řazení.

- Hierarchická směrování.

Graf pokroku – schodiště: bodové ladění střídají radikální změny přístupu na základě analýzy logů.

KernelBench Level 3: GPU optimalizace

Úloha: ladění GPU jader. GLM-5.1 zrychlila 3,6× za 1200 iterací. Claude Opus 4.6 vede (4,2×), ale GLM ukazuje potenciál v dlouhých seancích.

Dostupnost a omezení

Model se integruje s Claude Code, OpenCode, Cline, OpenClaw. Dostupný pro předplatitele GLM Coding Plan. Nevýhody:

  • V píku spotřebuje kvótu 3× rychleji (do konce dubna mimo špičku – podle základního tarifu).
  • Problémy s koherencí při tisících volání.
  • Sebehodnocení bez metrik je slabé.

Z.ai plánuje optimalizace pro dlouhotrvající úlohy.

Co je důležité

  • GLM-5.1 překonává SOTA na SWE-Bench Pro (58,4 %) díky dlouhodobému myšlení.
  • Na VectorDBBench dosáhla 21,5k QPS – x6 k rekordu.
  • Sestavila plnohodnotný Linux desktop v prohlížeči za 8 hodin bez nápověd.
  • Demonstruje schodišťový pokrok: 6 přestavb strategií.
  • Vyžaduje vylepšení koherence pro extrémní seance.

— Editorial Team

Advertisement 728x90

Číst dál