返回首页

GLM-5.1 在 SWE-Bench Pro 上领先:58.4%

Z.ai 的 GLM-5.1 凭借长期优化机制在 SWE-Bench Pro 上实现 SOTA(58.4%)。该模型在浏览器中 8 小时内组装 Linux 桌面,并在 VectorDBBench 上将 ANN 搜索加速 6 倍。在 HuggingFace 上以 MIT 许可提供。

GLM-5.1:Linux 桌面 8 小时以及编码 SOTA
Advertisement 728x90

# GLM-5.1:无需陷入平台期即可进行长期代码优化的 AI

Z.ai 的 GLM-5.1 在 SWE-Bench Pro 上以 58.4 分领先,超越了 GPT-5.4 (57.7)、Claude Opus 4.6 (57.3) 和 Gemini 3.1 Pro (54.2)。该模型已在 Hugging Face 上以 MIT 许可证形式提供。主要突破在于对长时间会话的韧性:它能分解任务、开展实验、分析日志,并在数百次迭代中调整策略。

长期优化而非快速平台期

以往模型,包括 GLM-5,都会很快耗尽工具:它们采用标准方法,达到局部最优后就停滞了。GLM-5.1 专为多小时循环设计。结合反馈机制,它能:

  • 将任务拆分成子目标。
  • 使用工具运行实验。
  • 阅读指标和日志。
  • 识别瓶颈。
  • 重建策略。

这使得它能通过数千次工具调用突破平台期。

Google AdInline article slot

浏览器中的 Linux 桌面:8 小时自主组装

任务:实现一个模拟 Linux 桌面的 Web 应用——没有源代码或样例。通常模型只会搭建一个带任务栏和占位符的骨架,然后放弃。

GLM-5.1 在审查循环中工作了 8 小时:

  • 构建了带导航和预览的文件管理器。
  • 添加了带 bash 仿真的终端。
  • 集成了支持语法高亮的文本编辑器。
  • 实现了系统监视器(CPU、RAM、网络)。
  • 包含了计算器和简单游戏。

所有组件采用统一的 UI 风格。模型自己在每次迭代后决定优化哪些部分。

Google AdInline article slot

VectorDBBench 纪录:600+ 迭代下 6 倍加速

基准测试:优化 Rust 骨架上的近似最近邻 (ANN) 搜索。此前 Claude Opus 4.6 的最先进水平 (SOTA) 为 50 次迭代下 3547 QPS。

GLM-5.1 在扩展循环中(600+ 次提交,6000+ 次调用):

  • 达到了 21.5k QPS——提升 6 倍。
  • 经历了 6 次结构重建:

- 暴力搜索 → IVF 索引。

Google AdInline article slot

- 向量压缩至 f16。

- 两阶段搜索:u8 评分 + f16 排序。

- 分层路由。

进度图呈阶梯状:针对性微调与基于日志分析的激进方法变革交替进行。

KernelBench 3 级:GPU 优化

任务:调整 GPU 内核。GLM-5.1 在 1200 次迭代下加速 3.6 倍。Claude Opus 4.6 领先(4.2 倍),但 GLM 在长时间会话中展现潜力。

可用性和限制

该模型可与 Claude Code、OpenCode、Cline、OpenClaw 集成。GLM Coding Plan 订阅用户可用。缺点:

  • 峰值时配额消耗速度为 3 倍(4 月底前,非峰值时按基础速率)。
  • 数千次调用后连贯性不足。
  • 无指标时的自我评估较弱。

Z.ai 计划针对长时间任务进行优化。

关键要点

  • GLM-5.1 凭借长期思考在 SWE-Bench Pro 上击败最先进水平(58.4%)。
  • 在 VectorDBBench 上达到 21.5k QPS——纪录的 6 倍。
  • 8 小时内无提示组装完整浏览器 Linux 桌面。
  • 展现阶梯式进步:6 次策略重建。
  • 极端会话需提升连贯性。

— Editorial Team

Advertisement 728x90

继续阅读