Volver al inicio

Degradación de Claude Code: razonamiento 3.5 veces menor

El director de IA de AMD analizó 6852 sesiones de Claude Code, revelando caída en la profundidad de razonamiento por 3.5 veces y reducción en lecturas de archivos antes de ediciones. Los costos de API crecieron 80 veces debido a errores. Anthropic recomienda configuraciones manuales de esfuerzo.

Claude Code embotado: informe de AMD sobre 6852 sesiones
Advertisement 728x90

Degradación de Claude Code: Pensamiento Reducido 3,5 Veces Basado en 6852 Sesiones

Stella Laurenzo, directora del grupo de IA en AMD, analizó 6852 sesiones de Claude Code de enero a marzo de 2026. Volumen total: 234.760 llamadas a herramientas y 18.000 bloques de pensamiento. Conclusión: el modelo tiene dificultades con tareas de ingeniería complejas. La profundidad del pensamiento cayó de 2200 caracteres en febrero a 600 en marzo, correlacionada con la bandera redact-thinking-2026-02-12, que Anthropic introdujo a principios de marzo.

Cambios en el Comportamiento del Modelo

Tras la activación de la bandera, la proporción de pensamiento oculto pasó del 1,5 % al 100 % en una semana. Esto provocó menos lecturas de archivos antes de las ediciones: de 6,6 a 2 por edición. Ahora el modelo realiza cambios en los archivos sin previsualizarlos primero, lo que causa:

  • Comentarios rotos.
  • Violaciones de acuerdos de CLAUDE.md.
  • Pseudoarreglos que no resuelven los problemas.

El script de AMD para detectar frases como «¿continuar?», «limitación conocida» o «esto no fue mi edición» se activó 173 veces después del 8 de marzo. Anteriormente: cero activaciones.

Google AdInline article slot

Escalado y Aumento de Costos

El equipo de AMD incrementó los agentes paralelos de 1-3 a 5-10 en 10 proyectos. Las solicitudes de API se dispararon de 1498 en febrero a 119.341 en marzo: ×80 con volúmenes similares de prompts de usuario. La degradación disparó el uso de tokens: más errores, repeticiones e iteraciones fallidas.

Dato curioso: el informe fue generado por Claude Opus 4.6 basado en logs. En su autoanálisis, el modelo notó la caída de la ratio lecturas/ediciones de 6,6 a 2,0 y 173 intentos de parada, pero no explicó la disminución de calidad.

Respuesta de Anthropic

Boris Cherny, líder de Claude Code, negó cualquier recorte en el pensamiento: la bandera redact-thinking solo los oculta en la IU. Recomendaciones:

Google AdInline article slot
  • Activar manualmente /effort high o /effort max.
  • Para clientes empresariales: niveles de esfuerzo altos por defecto en pruebas.

Rumores indican que AMD cambió temporalmente a una herramienta alternativa.

Metodología para Evaluar la Profundidad

El acceso directo al pensamiento está bloqueado por la bandera, por lo que Laurenzo usó correlaciones con otros campos de log. Datos de 6852 sesiones confirman la tendencia: la caída coincidió con el despliegue de la bandera. Ingenieros senior de AMD consideraron unánimemente a Claude inadecuado para trabajo de ingeniería.

Principales Conclusiones

  • Profundidad del pensamiento reducida 3,5 veces (2200 → 600 caracteres).
  • Lecturas de archivos antes de ediciones: 6,6 → 2.
  • 173 activaciones de script por negativas después del 8 de marzo.
  • Solicitudes de API ×80 con escalado del equipo.
  • Anthropic niega la degradación y sugiere ajustes manuales de esfuerzo.

— Editorial Team

Google AdInline article slot
Advertisement 728x90

Leer después