Zpět na domů

Degradace Claude Code: přemýšlení o 3,5krát méně

Ředitelka AI v AMD analyzovala 6852 sezení Claude Code, odhalila pokles hloubky přemýšlení o 3,5krát a snížení čtení souborů před úpravami. Náklady na API vzrostly 80krát kvůli chybám. Anthropic doporučuje manuální nastavení effort.

Claude Code ztupil: zpráva AMD o 6852 sezeních
Advertisement 728x90

# Degradace Claude Code: zkrácení uvažování 3,5násobku podle dat z 6852 sezení

Ředitelka AI skupiny v AMD Stella Laurenco analyzovala 6852 sezení Claude Code za leden–březen 2026. Celkový objem — 234 760 volání nástrojů a 18 tisíc bloků uvažování. Závěr: model nezvládá složité inženýrské úkoly. Hloubka uvažování klesla z 2200 znaků v únoru na 600 v březnu — korelaci s příznakem redact-thinking-2026-02-12, který Anthropic zaváděl na začátku března.

Změny v chování modelu

Po aktivaci příznaku podíl skrytých uvažování vzrostl z 1,5 % na 100 % během týdne. To vedlo k snížení čtení souborů před úpravami: z 6,6 na 2 na úpravu. Model nyní provádí změny v souborech bez předchozího náhledu, což způsobuje:

  • Rozbité komentáře.
  • Porušení dohod z CLAUDE.md.
  • Pseudopřípravy, které problémy neřeší.

Skript AMD pro detekci frází jako „pokračovat?“, „známé omezení“ nebo „to nebyla moje úprava“ se aktivoval 173krát po 8. březnu. Dříve — nula aktivací.

Google AdInline article slot

škálování a růst nákladů

Tým AMD zvýšil počet paralelních agentů z 1–3 na 5–10 na 10 projektech. Požadavky na API vzrostly z 1498 v únoru na 119 341 v březnu — 80násobek při srovnatelném počtu uživatelských promptů. Degradace zesílila spotřebu tokenů: více chyb, opakování a neúspěšných iterací.

Zajímavý fakt: zprávu vygeneroval Claude Opus 4.6 na základě logů. V samoanalýze model zmínil pokles poměru čtení/úprav z 6,6 na 2,0 a 173 pokusů o zastavení, ale nevysvětlil příčiny poklesu kvality.

Reakce Anthropic

Vůdce Claude Code Boris Černi popřel zkrácení uvažování: příznak redact-thinking pouze skrývá je v UI. Doporučení:

Google AdInline article slot
  • Ručně aktivovat /effort high nebo /effort max.
  • Pro korporátní klienty — výchozí vysoká úroveň úsilí v testech.

Podle pověstí AMD dočasně přešla na alternativní nástroj.

Metodika hodnocení hloubky

Přímý přístup k uvažováním blokuje příznak, proto Laurenco použila korelaci s jinými poli logů. Data z 6852 sezení potvrzují trend: pokles souvisí s rolloutem příznaku. Starší inženýři AMD jednomyslně konstatovali nevhodnost Claude pro inženýrskou práci.

Co je důležité

  • Hloubka uvažování se zkrátila 3,5násobku (2200 → 600 znaků).
  • Čtení souborů před úpravami: 6,6 → 2.
  • 173 aktivací skriptu detekce odmítnutí po 8. březnu.
  • API požadavky ×80 při škálování týmu.
  • Anthropic popírá degradaci, navrhuje ruční nastavení úsilí.

— Editorial Team

Google AdInline article slot
Advertisement 728x90

Číst dál