Retour à l'accueil

Dégradation de Claude Code : raisonnement 3.5 fois moindre

Le directeur IA d'AMD a analysé 6852 sessions Claude Code, révélant une chute de la profondeur de raisonnement par 3.5 fois et une réduction des lectures de fichiers avant modifications. Les coûts API ont augmenté 80 fois en raison des erreurs. Anthropic recommande des paramètres d'effort manuels.

Claude Code émoussé : rapport AMD sur 6852 sessions
Advertisement 728x90

Dégradation de Claude Code : Réduction de la réflexion de 3,5 fois sur la base de 6852 sessions

Stella Laurenzo, directrice du groupe IA chez AMD, a analysé 6852 sessions Claude Code de janvier à mars 2026. Volume total : 234 760 appels d'outils et 18 000 blocs de réflexion. Conclusion : le modèle peine avec les tâches d'ingénierie complexes. La profondeur de réflexion est passée de 2200 caractères en février à 600 en mars — corrélée au drapeau redact-thinking-2026-02-12, qu'Anthropic a introduit début mars.

Changements dans le comportement du modèle

Après activation du drapeau, la part de réflexions cachées est passée de 1,5 % à 100 % en une semaine. Cela a entraîné moins de lectures de fichiers avant les modifications : de 6,6 à 2 par modification. Le modèle effectue désormais des changements sur les fichiers sans les prévisualiser au préalable, causant :

  • Commentaires cassés.
  • Violations des accords de CLAUDE.md.
  • Pseudo-corrections qui ne résolvent pas les problèmes.

Le script d'AMD pour détecter des phrases comme « continue ? », « limitation connue » ou « ce n'était pas ma modification » s'est déclenché 173 fois après le 8 mars. Précédemment — zéro déclenchement.

Google AdInline article slot

Mise à l'échelle et augmentation des coûts

L'équipe AMD a augmenté les agents parallèles de 1–3 à 5–10 sur 10 projets. Les requêtes API ont explosé de 1498 en février à 119 341 en mars — ×80 avec des volumes de prompts utilisateur similaires. La dégradation a fait grimper l'utilisation des tokens : plus d'erreurs, de répétitions et d'itérations échouées.

Fait amusant : le rapport a été généré par Claude Opus 4.6 à partir des logs. Dans son auto-analyse, le modèle a noté la chute du ratio lectures/modifications de 6,6 à 2,0 et 173 tentatives d'arrêt, mais n'a pas expliqué le déclin de qualité.

Réponse d'Anthropic

Le responsable de Claude Code, Boris Cherny, a nié toute réduction de réflexion : le drapeau redact-thinking ne les cache que dans l'UI. Recommandations :

Google AdInline article slot
  • Activer manuellement /effort high ou /effort max.
  • Pour les clients entreprise — niveaux d'effort élevés par défaut dans les tests.

Des rumeurs indiquent qu'AMD est temporairement passé à un outil alternatif.

Méthodologie pour évaluer la profondeur

L'accès direct à la réflexion est bloqué par le drapeau, donc Laurenzo a utilisé des corrélations avec d'autres champs des logs. Les données de 6852 sessions confirment la tendance : le déclin coïncide avec le déploiement du drapeau. Les ingénieurs seniors d'AMD ont unanimement jugé Claude inadapté au travail d'ingénierie.

Points clés

  • Profondeur de réflexion réduite de 3,5 fois (2200 → 600 caractères).
  • Lectures de fichiers avant modifications : 6,6 → 2.
  • 173 déclenchements de script pour refus après le 8 mars.
  • Requêtes API ×80 avec mise à l'échelle de l'équipe.
  • Anthropic nie la dégradation, suggère des ajustements manuels d'effort.

— Editorial Team

Google AdInline article slot
Advertisement 728x90

Lire ensuite