# GLM-5.1: IA capaz de optimización de código a largo plazo sin estancamientos
GLM-5.1 de Z.ai lidera en SWE-Bench Pro con 58.4 puntos, superando a GPT-5.4 (57.7), Claude Opus 4.6 (57.3) y Gemini 3.1 Pro (54.2). El modelo está disponible en Hugging Face bajo la licencia MIT. Avance clave: resistencia a sesiones largas: descompone tareas, experimenta, analiza logs y ajusta estrategias durante cientos de iteraciones.
Optimización a largo plazo en lugar de estancamientos rápidos
Modelos anteriores, incluido GLM-5, agotan rápidamente sus herramientas: aplican enfoques estándar, alcanzan un máximo local y se detienen. GLM-5.1 está diseñado para ciclos de varias horas. Envuelto con retroalimentación, hace lo siguiente:
- Descompone la tarea en subtareas.
- Ejecuta experimentos con herramientas.
- Lee métricas y logs.
- Identifica cuellos de botella.
- Reconstruye la estrategia.
Esto permite superar estancamientos mediante miles de llamadas a herramientas.
Escritorio Linux en el navegador: 8 horas de ensamblaje autónomo
Tarea: implementar una app web que simule un escritorio Linux, sin código fuente ni mockups. Los modelos típicos crean un esqueleto con barra de tareas y stubs, y luego se rinden.
GLM-5.1 en un ciclo de revisión trabajó durante 8 horas:
- Construyó un gestor de archivos con navegación y vistas previas.
- Agregó un terminal con emulación de bash.
- Integró un editor de texto con resaltado de sintaxis.
- Implementó un monitor del sistema (CPU, RAM, red).
- Incluyó una calculadora y juegos simples.
Todos los componentes en un estilo de UI unificado. El modelo mismo decidió qué refinar después de cada pasada.
Récord en VectorDBBench: aceleración 6x en más de 600 iteraciones
Benchmark: optimización de búsqueda de vecinos más cercanos aproximados (ANN) en un esqueleto en Rust. SOTA anterior de Claude Opus 4.6: 3547 QPS en 50 iteraciones.
GLM-5.1 en un ciclo extendido (más de 600 envíos, más de 6000 llamadas):
- Alcanzó 21.5k QPS: 6x mejor.
- Pasó por 6 reconstrucciones estructurales:
- Fuerza bruta → índice IVF.
- Compresión de vectores a f16.
- Búsqueda en dos etapas: puntuación u8 + ranking f16.
- Enrutamiento jerárquico.
Gráfico de progreso: una escalera: ajustes puntuales alternan con cambios radicales de enfoque basados en análisis de logs.
KernelBench nivel 3: Optimización de GPU
Tarea: ajuste de kernels de GPU. GLM-5.1 lo aceleró 3.6x en 1200 iteraciones. Claude Opus 4.6 lidera (4.2×), pero GLM muestra potencial en sesiones largas.
Disponibilidad y limitaciones
El modelo se integra con Claude Code, OpenCode, Cline y OpenClaw. Disponible para suscriptores del GLM Coding Plan. Desventajas:
- En pico, usa cuota 3x más rápido (hasta fin de abril, fuera de pico: a tarifa base).
- Lucha con coherencia en miles de llamadas.
- Autoevaluación sin métricas es débil.
Z.ai planea optimizaciones para tareas de larga duración.
Lecciones clave
- GLM-5.1 supera al SOTA en SWE-Bench Pro (58.4%) gracias al pensamiento a largo plazo.
- En VectorDBBench, alcanzó 21.5k QPS: 6x el récord.
- Ensambló un escritorio Linux completo en el navegador en 8 horas sin pistas.
- Demuestra progreso en escalera: 6 reconstrucciones de estrategia.
- Necesita mejoras en coherencia para sesiones extremas.
— Editorial Team
Aún no hay comentarios.