GLM-5V-Turbo:从设计生成前端的多模态模型
中国公司 Z.ai 推出了 GLM-5V-Turbo——首个用于编码的多模态模型。它能处理图像、视频和文本,输出可工作的前端代码。可在 chat.z.ai 的网页界面免费使用,通过 API 定价为每 100 万输入 token 1.2 美元,输出 4 美元。
该模型处理完整流程:分析视觉输入、规划并编写代码。GLM-5V-Turbo 能解析设计稿、界面截图,并生成完整的前端项目。与 Claude Code 结合,可激活 URL=Code 模式:自主探索网站、收集视觉元素,并在代码中重构它们。
基准测试结果
在 Z.ai 的内部测试中,该模型在 14 个多模态场景中的 9 个超越了 Claude Opus 4.6。主要指标:
- Design2Code(设计稿转代码):94.8% vs. 77.3%。
- AndroidWorld(GUI 代理):75.7% vs. 62.0%。
- WebVoyager(网页导航):88.5% vs. 88.0%。
在纯文本编码任务中,Claude Opus 4.6 仍保持领先:后端、仓库分析和代理任务。
| Test | GLM-5V-Turbo | Claude Opus 4.6 |
|---------------|--------------|------------------|
| Design2Code | 94.8% | 77.3% |
| AndroidWorld | 75.7% | 62.0% |
| WebVoyager | 88.5% | 88.0% |
技术架构
GLM-5V-Turbo 包含四项改进:
- 用于处理图像和视频的视觉编码器 CogViT。
- 在 30+ 种任务类型上的强化学习 (RL):从 STEM 到 GUI 代理。
- 用于可扩展训练的代理数据生成系统。
- 扩展的多模态工具链:截图捕获、边界框、带图像的网页阅读。
该模型内置 10 种技能 (Skills):
- 图像描述生成。
- OCR 和文档解析。
- PDF 转演示文稿。
- 财务报告和股票分析。
- 简历筛选。
这些工具集成到代码生成流程中,提升代理自主性。
GLM-5 系列与竞争格局
本次发布属于 GLM-5 系列:
- GLM-5-Turbo(3 月):面向代理的文本版本。
- GLM-5.1(3 月底):编码优化。
- GLM-5V-Turbo:新增视觉能力。
在多模态编码领域,直接竞争 Claude、Gemini 和 Kimi K2.5。Z.ai 专注其旗舰模型的细分变体,加强在 GUI 和网页开发领域的地位。
对于中高级开发者,该模型非常适合 UI 原型设计:输入 Figma 设计稿或截图,即可获得带 Tailwind 的 React/Vue/HTML 代码。在 chat.z.ai 上测试可实现快速迭代。API 集成适用于设计转代码工作流自动化。
关键要点
- GLM-5V-Turbo 在 Design2Code(94.8%)和 GUI 测试中领先,超越 Claude。
- CogViT + 30+ 任务强化学习确保多模态准确性。
- 10 种内置技能扩展了编码之外的应用。
- 免费网页访问 + 生产级 API。
- 纯文本编码落后于 Claude;建议组合模型使用。
— Editorial Team
暂无评论。