Dégradation de Claude Code : Réduction de la réflexion de 3,5 fois sur la base de 6852 sessions
Stella Laurenzo, directrice du groupe IA chez AMD, a analysé 6852 sessions Claude Code de janvier à mars 2026. Volume total : 234 760 appels d'outils et 18 000 blocs de réflexion. Conclusion : le modèle peine avec les tâches d'ingénierie complexes. La profondeur de réflexion est passée de 2200 caractères en février à 600 en mars — corrélée au drapeau redact-thinking-2026-02-12, qu'Anthropic a introduit début mars.
Changements dans le comportement du modèle
Après activation du drapeau, la part de réflexions cachées est passée de 1,5 % à 100 % en une semaine. Cela a entraîné moins de lectures de fichiers avant les modifications : de 6,6 à 2 par modification. Le modèle effectue désormais des changements sur les fichiers sans les prévisualiser au préalable, causant :
- Commentaires cassés.
- Violations des accords de
CLAUDE.md. - Pseudo-corrections qui ne résolvent pas les problèmes.
Le script d'AMD pour détecter des phrases comme « continue ? », « limitation connue » ou « ce n'était pas ma modification » s'est déclenché 173 fois après le 8 mars. Précédemment — zéro déclenchement.
Mise à l'échelle et augmentation des coûts
L'équipe AMD a augmenté les agents parallèles de 1–3 à 5–10 sur 10 projets. Les requêtes API ont explosé de 1498 en février à 119 341 en mars — ×80 avec des volumes de prompts utilisateur similaires. La dégradation a fait grimper l'utilisation des tokens : plus d'erreurs, de répétitions et d'itérations échouées.
Fait amusant : le rapport a été généré par Claude Opus 4.6 à partir des logs. Dans son auto-analyse, le modèle a noté la chute du ratio lectures/modifications de 6,6 à 2,0 et 173 tentatives d'arrêt, mais n'a pas expliqué le déclin de qualité.
Réponse d'Anthropic
Le responsable de Claude Code, Boris Cherny, a nié toute réduction de réflexion : le drapeau redact-thinking ne les cache que dans l'UI. Recommandations :
- Activer manuellement
/effort highou/effort max. - Pour les clients entreprise — niveaux d'effort élevés par défaut dans les tests.
Des rumeurs indiquent qu'AMD est temporairement passé à un outil alternatif.
Méthodologie pour évaluer la profondeur
L'accès direct à la réflexion est bloqué par le drapeau, donc Laurenzo a utilisé des corrélations avec d'autres champs des logs. Les données de 6852 sessions confirment la tendance : le déclin coïncide avec le déploiement du drapeau. Les ingénieurs seniors d'AMD ont unanimement jugé Claude inadapté au travail d'ingénierie.
Points clés
- Profondeur de réflexion réduite de 3,5 fois (2200 → 600 caractères).
- Lectures de fichiers avant modifications : 6,6 → 2.
- 173 déclenchements de script pour refus après le 8 mars.
- Requêtes API ×80 avec mise à l'échelle de l'équipe.
- Anthropic nie la dégradation, suggère des ajustements manuels d'effort.
— Editorial Team
Aucun commentaire pour le moment.