Retour à l'accueil

GLM-5V-Turbo génère du code à partir d'un design

GLM-5V-Turbo de Z.ai génère du code frontend à partir de designs et vidéos. Leader dans les benchmarks Design2Code (94,8 %) grâce à CogViT et RL. Inclut 10 Skills et le mode URL=Code.

Nouveau GLM-5V-Turbo : design vers code en quelques secondes
Advertisement 728x90

GLM-5V-Turbo : Modèle multimodal pour générer du frontend à partir de designs

L'entreprise chinoise Z.ai a présenté GLM-5V-Turbo — le premier modèle multimodal pour le codage. Il traite des images, des vidéos et du texte, générant du code frontend fonctionnel en sortie. Disponible gratuitement dans l'interface web sur chat.z.ai et via API à 1,2 $ par 1M de tokens d'entrée et 4 $ pour la sortie.

Le modèle gère le cycle complet : analyse de l'entrée visuelle, planification et écriture de code. GLM-5V-Turbo analyse les maquettes de design, les captures d'écran d'interfaces, et génère des projets frontend complets. Combiné à Claude Code, il active le mode URL=Code : exploration autonome de sites, collecte d'éléments visuels, et reconstruction en code.

Résultats des benchmarks

Dans les tests internes de Z.ai, le modèle surpasse Claude Opus 4.6 dans 9 des 14 scénarios multimodaux. Principales métriques :

Google AdInline article slot
  • Design2Code (maquette vers code) : 94,8 % contre 77,3 %.
  • AndroidWorld (agent GUI) : 75,7 % contre 62,0 %.
  • WebVoyager (navigation web) : 88,5 % contre 88,0 %.

En codage basé sur du texte, Claude Opus 4.6 conserve la tête : backend, analyse de dépôts, et tâches d'agents.

| Test | GLM-5V-Turbo | Claude Opus 4.6 |

|---------------|--------------|------------------|

Google AdInline article slot

| Design2Code | 94.8% | 77.3% |

| AndroidWorld | 75.7% | 62.0% |

| WebVoyager | 88.5% | 88.0% |

Google AdInline article slot

Architecture technique

GLM-5V-Turbo intègre quatre améliorations :

  • Encodeur visuel CogViT pour le traitement des images et vidéos.
  • Apprentissage par renforcement (RL) sur plus de 30 types de tâches : des STEM aux agents GUI.
  • Système de génération de données pour agents, pour un entraînement scalable.
  • Chaîne d'outils multimodaux étendue : capture d'écran, boîtes englobantes, lecture de pages web avec images.

Le modèle est livré avec 10 compétences intégrées (Skills) :

  • Génération de légendes d'images.
  • OCR et analyse de documents.
  • Conversion de PDF en présentation.
  • Analyse de rapports financiers et d'actions.
  • Tri de CV.

Ces outils s'intègrent dans le pipeline de génération de code, renforçant l'autonomie des agents.

Gamme GLM-5 et concurrence

Cette sortie s'inscrit dans la série GLM-5 :

  • GLM-5-Turbo (mars) : version texte pour agents.
  • GLM-5.1 (fin mars) : optimisation pour le codage.
  • GLM-5V-Turbo : ajout de la vision.

Concurrence directe avec Claude, Gemini et Kimi K2.5 en codage multimodal. Z.ai se concentre sur des variantes de niche de son produit phare, renforçant ses positions en GUI et développement web.

Pour les développeurs intermédiaires/seniors, le modèle est pratique pour le prototypage UI : fournissez une maquette Figma ou une capture d'écran — obtenez du React/Vue/HTML avec Tailwind. Testez sur chat.z.ai pour des itérations rapides. L'intégration API s'adapte à l'automatisation des workflows design-to-code.

Points clés

  • GLM-5V-Turbo domine en Design2Code (94,8 %) et tests GUI, surpassant Claude.
  • CogViT + RL sur plus de 30 tâches assurent une précision multimodale.
  • 10 Skills intégrées élargissent l'usage au-delà du codage.
  • Accès web gratuit + API pour la production.
  • Le codage texte reste en retrait de Claude ; combinez les modèles.

— Editorial Team

Advertisement 728x90

Lire ensuite