Volver al inicio

GLM-5.1 lidera en SWE-Bench Pro: 58.4%

GLM-5.1 de Z.ai logró SOTA en SWE-Bench Pro (58.4%) gracias al mecanismo de optimización a largo plazo. El modelo ensambló un escritorio Linux en el navegador en 8 horas y aceleró la búsqueda ANN 6x en VectorDBBench. Disponible bajo MIT en HuggingFace.

GLM-5.1: 8 horas en escritorio Linux y SOTA en codificación
Advertisement 728x90

# GLM-5.1: IA capaz de optimización de código a largo plazo sin estancamientos

GLM-5.1 de Z.ai lidera en SWE-Bench Pro con 58.4 puntos, superando a GPT-5.4 (57.7), Claude Opus 4.6 (57.3) y Gemini 3.1 Pro (54.2). El modelo está disponible en Hugging Face bajo la licencia MIT. Avance clave: resistencia a sesiones largas: descompone tareas, experimenta, analiza logs y ajusta estrategias durante cientos de iteraciones.

Optimización a largo plazo en lugar de estancamientos rápidos

Modelos anteriores, incluido GLM-5, agotan rápidamente sus herramientas: aplican enfoques estándar, alcanzan un máximo local y se detienen. GLM-5.1 está diseñado para ciclos de varias horas. Envuelto con retroalimentación, hace lo siguiente:

  • Descompone la tarea en subtareas.
  • Ejecuta experimentos con herramientas.
  • Lee métricas y logs.
  • Identifica cuellos de botella.
  • Reconstruye la estrategia.

Esto permite superar estancamientos mediante miles de llamadas a herramientas.

Google AdInline article slot

Escritorio Linux en el navegador: 8 horas de ensamblaje autónomo

Tarea: implementar una app web que simule un escritorio Linux, sin código fuente ni mockups. Los modelos típicos crean un esqueleto con barra de tareas y stubs, y luego se rinden.

GLM-5.1 en un ciclo de revisión trabajó durante 8 horas:

  • Construyó un gestor de archivos con navegación y vistas previas.
  • Agregó un terminal con emulación de bash.
  • Integró un editor de texto con resaltado de sintaxis.
  • Implementó un monitor del sistema (CPU, RAM, red).
  • Incluyó una calculadora y juegos simples.

Todos los componentes en un estilo de UI unificado. El modelo mismo decidió qué refinar después de cada pasada.

Google AdInline article slot

Récord en VectorDBBench: aceleración 6x en más de 600 iteraciones

Benchmark: optimización de búsqueda de vecinos más cercanos aproximados (ANN) en un esqueleto en Rust. SOTA anterior de Claude Opus 4.6: 3547 QPS en 50 iteraciones.

GLM-5.1 en un ciclo extendido (más de 600 envíos, más de 6000 llamadas):

  • Alcanzó 21.5k QPS: 6x mejor.
  • Pasó por 6 reconstrucciones estructurales:

- Fuerza bruta → índice IVF.

Google AdInline article slot

- Compresión de vectores a f16.

- Búsqueda en dos etapas: puntuación u8 + ranking f16.

- Enrutamiento jerárquico.

Gráfico de progreso: una escalera: ajustes puntuales alternan con cambios radicales de enfoque basados en análisis de logs.

KernelBench nivel 3: Optimización de GPU

Tarea: ajuste de kernels de GPU. GLM-5.1 lo aceleró 3.6x en 1200 iteraciones. Claude Opus 4.6 lidera (4.2×), pero GLM muestra potencial en sesiones largas.

Disponibilidad y limitaciones

El modelo se integra con Claude Code, OpenCode, Cline y OpenClaw. Disponible para suscriptores del GLM Coding Plan. Desventajas:

  • En pico, usa cuota 3x más rápido (hasta fin de abril, fuera de pico: a tarifa base).
  • Lucha con coherencia en miles de llamadas.
  • Autoevaluación sin métricas es débil.

Z.ai planea optimizaciones para tareas de larga duración.

Lecciones clave

  • GLM-5.1 supera al SOTA en SWE-Bench Pro (58.4%) gracias al pensamiento a largo plazo.
  • En VectorDBBench, alcanzó 21.5k QPS: 6x el récord.
  • Ensambló un escritorio Linux completo en el navegador en 8 horas sin pistas.
  • Demuestra progreso en escalera: 6 reconstrucciones de estrategia.
  • Necesita mejoras en coherencia para sesiones extremas.

— Editorial Team

Advertisement 728x90

Leer después