Degradación de Claude Code: Pensamiento Reducido 3,5 Veces Basado en 6852 Sesiones
Stella Laurenzo, directora del grupo de IA en AMD, analizó 6852 sesiones de Claude Code de enero a marzo de 2026. Volumen total: 234.760 llamadas a herramientas y 18.000 bloques de pensamiento. Conclusión: el modelo tiene dificultades con tareas de ingeniería complejas. La profundidad del pensamiento cayó de 2200 caracteres en febrero a 600 en marzo, correlacionada con la bandera redact-thinking-2026-02-12, que Anthropic introdujo a principios de marzo.
Cambios en el Comportamiento del Modelo
Tras la activación de la bandera, la proporción de pensamiento oculto pasó del 1,5 % al 100 % en una semana. Esto provocó menos lecturas de archivos antes de las ediciones: de 6,6 a 2 por edición. Ahora el modelo realiza cambios en los archivos sin previsualizarlos primero, lo que causa:
- Comentarios rotos.
- Violaciones de acuerdos de
CLAUDE.md. - Pseudoarreglos que no resuelven los problemas.
El script de AMD para detectar frases como «¿continuar?», «limitación conocida» o «esto no fue mi edición» se activó 173 veces después del 8 de marzo. Anteriormente: cero activaciones.
Escalado y Aumento de Costos
El equipo de AMD incrementó los agentes paralelos de 1-3 a 5-10 en 10 proyectos. Las solicitudes de API se dispararon de 1498 en febrero a 119.341 en marzo: ×80 con volúmenes similares de prompts de usuario. La degradación disparó el uso de tokens: más errores, repeticiones e iteraciones fallidas.
Dato curioso: el informe fue generado por Claude Opus 4.6 basado en logs. En su autoanálisis, el modelo notó la caída de la ratio lecturas/ediciones de 6,6 a 2,0 y 173 intentos de parada, pero no explicó la disminución de calidad.
Respuesta de Anthropic
Boris Cherny, líder de Claude Code, negó cualquier recorte en el pensamiento: la bandera redact-thinking solo los oculta en la IU. Recomendaciones:
- Activar manualmente
/effort higho/effort max. - Para clientes empresariales: niveles de esfuerzo altos por defecto en pruebas.
Rumores indican que AMD cambió temporalmente a una herramienta alternativa.
Metodología para Evaluar la Profundidad
El acceso directo al pensamiento está bloqueado por la bandera, por lo que Laurenzo usó correlaciones con otros campos de log. Datos de 6852 sesiones confirman la tendencia: la caída coincidió con el despliegue de la bandera. Ingenieros senior de AMD consideraron unánimemente a Claude inadecuado para trabajo de ingeniería.
Principales Conclusiones
- Profundidad del pensamiento reducida 3,5 veces (2200 → 600 caracteres).
- Lecturas de archivos antes de ediciones: 6,6 → 2.
- 173 activaciones de script por negativas después del 8 de marzo.
- Solicitudes de API ×80 con escalado del equipo.
- Anthropic niega la degradación y sugiere ajustes manuales de esfuerzo.
— Editorial Team
Aún no hay comentarios.