Volver al inicio

GLM-5V-Turbo genera código a partir de diseños

GLM-5V-Turbo de Z.ai genera código frontend a partir de diseños y videos. Líder en benchmarks Design2Code (94.8%) gracias a CogViT y RL. Incluye 10 Habilidades y modo URL=Code.

Nuevo GLM-5V-Turbo: de diseño a código en segundos
Advertisement 728x90

# GLM-5V-Turbo: Modelo multimodal para generar frontend a partir de diseños

La empresa china Z.ai ha presentado GLM-5V-Turbo, el primer modelo multimodal para programación. Procesa imágenes, videos y texto, generando código frontend funcional como salida. Disponible de forma gratuita en la interfaz web en chat.z.ai y mediante API a $1.2 por 1M de tokens de entrada y $4 para salida.

El modelo maneja el ciclo completo: analiza la entrada visual, planifica y escribe código. GLM-5V-Turbo analiza prototipos de diseño, capturas de pantalla de interfaces y genera proyectos frontend completos. Combinado con Claude Code, activa el modo URL=Code: exploración autónoma de sitios, recolección de elementos visuales y su reconstrucción en código.

Resultados de benchmarks

En las pruebas internas de Z.ai, el modelo supera a Claude Opus 4.6 en 9 de 14 escenarios multimodales. Métricas clave:

Google AdInline article slot
  • Design2Code (de mockup a código): 94.8% vs. 77.3%.
  • AndroidWorld (agente GUI): 75.7% vs. 62.0%.
  • WebVoyager (navegación web): 88.5% vs. 88.0%.

En programación basada en texto, Claude Opus 4.6 mantiene la ventaja: backend, análisis de repositorios y tareas de agentes.

| Test | GLM-5V-Turbo | Claude Opus 4.6 |

|------|--------------|------------------|

Google AdInline article slot

| Design2Code | 94.8% | 77.3% |

| AndroidWorld | 75.7% | 62.0% |

| WebVoyager | 88.5% | 88.0% |

Google AdInline article slot

Arquitectura técnica

GLM-5V-Turbo incluye cuatro mejoras:

  • Codificador visual CogViT para procesar imágenes y videos.
  • Aprendizaje por refuerzo (RL) en más de 30 tipos de tareas: desde STEM hasta agentes GUI.
  • Sistema de generación de datos para agentes con entrenamiento escalable.
  • Cadena de herramientas multimodal extendida: captura de capturas de pantalla, cuadros delimitadores, lectura de páginas web con imágenes.

El modelo viene con 10 habilidades integradas (Skills):

  • Generación de subtítulos para imágenes.
  • OCR y análisis de documentos.
  • Conversión de PDF a presentaciones.
  • Análisis de informes financieros y acciones.
  • Selección de currículos.

Estas herramientas se integran en la tubería de generación de código, aumentando la autonomía de los agentes.

Línea GLM-5 y competencia

Este lanzamiento encaja en la serie GLM-5:

  • GLM-5-Turbo (marzo): versión de texto para agentes.
  • GLM-5.1 (finales de marzo): optimización para programación.
  • GLM-5V-Turbo: adición de visión.

Competencia directa con Claude, Gemini y Kimi K2.5 en programación multimodal. Z.ai se centra en variantes nicho de su buque insignia, fortaleciendo posiciones en GUI y desarrollo web.

Para desarrolladores intermedios/senior, el modelo es útil para prototipado de UI: introduce un mockup de Figma o captura de pantalla, obtén React/Vue/HTML con Tailwind. Prueba en chat.z.ai para iteraciones rápidas. La integración de API encaja en la automatización de flujos de diseño a código.

Puntos clave

  • GLM-5V-Turbo lidera en Design2Code (94.8%) y pruebas GUI, superando a Claude.
  • CogViT + RL en más de 30 tareas aseguran precisión multimodal.
  • 10 Skills integradas amplían el uso más allá de la programación.
  • Acceso web gratuito + API para producción.
  • La programación de texto va por detrás de Claude; combina modelos.

— Editorial Team

Advertisement 728x90

Leer después