返回首页

GLM-5V-Turbo 从设计生成代码

Z.ai 的 GLM-5V-Turbo 从设计和视频生成前端代码。在 Design2Code 基准测试中领先 (94.8%),得益于 CogViT 和 RL。包含 10 项技能和 URL=Code 模式。

全新 GLM-5V-Turbo:几秒钟从设计到代码
Advertisement 728x90

GLM-5V-Turbo:从设计生成前端的多模态模型

中国公司 Z.ai 推出了 GLM-5V-Turbo——首个用于编码的多模态模型。它能处理图像、视频和文本,输出可工作的前端代码。可在 chat.z.ai 的网页界面免费使用,通过 API 定价为每 100 万输入 token 1.2 美元,输出 4 美元。

该模型处理完整流程:分析视觉输入、规划并编写代码。GLM-5V-Turbo 能解析设计稿、界面截图,并生成完整的前端项目。与 Claude Code 结合,可激活 URL=Code 模式:自主探索网站、收集视觉元素,并在代码中重构它们。

基准测试结果

在 Z.ai 的内部测试中,该模型在 14 个多模态场景中的 9 个超越了 Claude Opus 4.6。主要指标:

Google AdInline article slot
  • Design2Code(设计稿转代码):94.8% vs. 77.3%。
  • AndroidWorld(GUI 代理):75.7% vs. 62.0%。
  • WebVoyager(网页导航):88.5% vs. 88.0%。

在纯文本编码任务中,Claude Opus 4.6 仍保持领先:后端、仓库分析和代理任务。

| Test | GLM-5V-Turbo | Claude Opus 4.6 |

|---------------|--------------|------------------|

Google AdInline article slot

| Design2Code | 94.8% | 77.3% |

| AndroidWorld | 75.7% | 62.0% |

| WebVoyager | 88.5% | 88.0% |

Google AdInline article slot

技术架构

GLM-5V-Turbo 包含四项改进:

  • 用于处理图像和视频的视觉编码器 CogViT
  • 在 30+ 种任务类型上的强化学习 (RL):从 STEM 到 GUI 代理。
  • 用于可扩展训练的代理数据生成系统。
  • 扩展的多模态工具链:截图捕获、边界框、带图像的网页阅读。

该模型内置 10 种技能 (Skills):

  • 图像描述生成。
  • OCR 和文档解析。
  • PDF 转演示文稿。
  • 财务报告和股票分析。
  • 简历筛选。

这些工具集成到代码生成流程中,提升代理自主性。

GLM-5 系列与竞争格局

本次发布属于 GLM-5 系列:

  • GLM-5-Turbo(3 月):面向代理的文本版本。
  • GLM-5.1(3 月底):编码优化。
  • GLM-5V-Turbo:新增视觉能力。

在多模态编码领域,直接竞争 Claude、Gemini 和 Kimi K2.5。Z.ai 专注其旗舰模型的细分变体,加强在 GUI 和网页开发领域的地位。

对于中高级开发者,该模型非常适合 UI 原型设计:输入 Figma 设计稿或截图,即可获得带 Tailwind 的 React/Vue/HTML 代码。在 chat.z.ai 上测试可实现快速迭代。API 集成适用于设计转代码工作流自动化。

关键要点

  • GLM-5V-Turbo 在 Design2Code(94.8%)和 GUI 测试中领先,超越 Claude。
  • CogViT + 30+ 任务强化学习确保多模态准确性。
  • 10 种内置技能扩展了编码之外的应用。
  • 免费网页访问 + 生产级 API。
  • 纯文本编码落后于 Claude;建议组合模型使用。

— Editorial Team

Advertisement 728x90

继续阅读