Zurück zur Startseite

GLM-5V-Turbo generiert Code aus Design

GLM-5V-Turbo von Z.ai generiert Frontend-Code aus Designs und Videos. Führt in Design2Code-Benchmarks (94,8 %) dank CogViT und RL. Beinhaltet 10 Skills und URL=Code-Modus.

Neues GLM-5V-Turbo: Design zu Code in Sekunden
Advertisement 728x90

GLM-5V-Turbo: Multimodales Modell zur Generierung von Frontend aus Design

Das chinesische Unternehmen Z.ai hat GLM-5V-Turbo vorgestellt — das erste multimodale Modell für die Programmierung. Es verarbeitet Bilder, Videos und Text und erzeugt als Ausgabe funktionierenden Frontend-Code. Kostenlos verfügbar in der Weboberfläche unter chat.z.ai und via API für 1,2 $ pro 1 Million Eingabe-Tokens bzw. 4 $ für die Ausgabe.

Das Modell bewältigt den gesamten Prozess: Analyse visueller Eingaben, Planung und Code-Erstellung. GLM-5V-Turbo parst Design-Mockups, Interface-Screenshots und generiert vollständige Frontend-Projekte. In Kombination mit Claude Code aktiviert es den URL=Code-Modus: autonome Erkundung von Websites, Sammlung visueller Elemente und Rekonstruktion in Code.

Benchmark-Ergebnisse

In internen Tests von Z.ai übertrifft das Modell Claude Opus 4.6 in 9 von 14 multimodalen Szenarien. Wichtige Metriken:

Google AdInline article slot
  • Design2Code (Mockup zu Code): 94,8 % vs. 77,3 %.
  • AndroidWorld (GUI-Agent): 75,7 % vs. 62,0 %.
  • WebVoyager (Web-Navigation): 88,5 % vs. 88,0 %.

In textbasierten Programmieraufgaben behält Claude Opus 4.6 die Führung: Backend, Repository-Analyse und Agent-Aufgaben.

| Test | GLM-5V-Turbo | Claude Opus 4.6 |

|---------------|--------------|------------------|

Google AdInline article slot

| Design2Code | 94,8 % | 77,3 % |

| AndroidWorld | 75,7 % | 62,0 % |

| WebVoyager | 88,5 % | 88,0 % |

Google AdInline article slot

Technische Architektur

GLM-5V-Turbo umfasst vier Verbesserungen:

  • Visueller Encoder CogViT zur Verarbeitung von Bildern und Videos.
  • Verstärkendes Lernen (RL) auf über 30 Aufgabentypen: von STEM bis GUI-Agenten.
  • Agent-Daten-Generierungssystem für skalierbares Training.
  • Erweiterte multimodale Toolchain: Screenshot-Erfassung, Bounding Boxes, Lesen von Webseiten mit Bildern.

Das Modell bringt 10 integrierte Fähigkeiten (Skills) mit:

  • Generierung von Bildbeschreibungen.
  • OCR und Dokumentenparsing.
  • Umwandlung von PDF in Präsentationen.
  • Analyse von Finanzberichten und Aktien.
  • Screening von Lebensläufen.

Diese Tools integrieren sich in die Code-Generierungs-Pipeline und steigern die Autonomie der Agenten.

GLM-5-Reihe und Konkurrenz

Diese Veröffentlichung passt in die GLM-5-Serie:

  • GLM-5-Turbo (März): Textversion für Agenten.
  • GLM-5.1 (Ende März): Optimierung für Programmierung.
  • GLM-5V-Turbo: Ergänzung um Vision.

Direkte Konkurrenz zu Claude, Gemini und Kimi K2.5 im multimodalen Coding. Z.ai setzt auf Nischenvarianten seines Flaggschiffs und stärkt seine Positionen in GUI- und Web-Entwicklung.

Für Mid- und Senior-Entwickler ist das Modell ideal für UI-Prototyping: Figma-Mockup oder Screenshot eingeben — React/Vue/HTML mit Tailwind erhalten. In chat.z.ai testen für schnelle Iterationen. API-Integration eignet sich für die Automatisierung des Design-to-Code-Workflows.

Wichtige Erkenntnisse

  • GLM-5V-Turbo führt in Design2Code (94,8 %) und GUI-Tests und übertrifft Claude.
  • CogViT + RL bei über 30 Aufgaben gewährleisten multimodale Präzision.
  • 10 integrierte Skills erweitern den Einsatz über Programmierung hinaus.
  • Kostenloser Webzugriff + API für den Produktionseinsatz.
  • Beim Text-Coding hinkt es Claude hinterher; Modelle kombinieren.

— Editorial Team

Advertisement 728x90

Weiterlesen