# Degradacja Claude Code: skrócenie rozważań o 3,5 raza według danych z 6852 sesji
Dyrektorka grupy AI w AMD, Stella Laurenco, przeanalizowała 6852 sesje Claude Code z okresu styczeń–marzec 2026 roku. Łączna objętość — 234 760 wywołań narzędzi i 18 tysięcy bloków rozważań. Wniosek: model nie radzi sobie ze skomplikowanymi zadaniami inżynierskimi. Głębokość rozważań spadła z 2200 znaków w lutym do 600 w marcu — korelacja z flagą redact-thinking-2026-02-12, którą Anthropic wprowadził na początku marca.
Zmiany w zachowaniu modelu
Po aktywacji flagi udział ukrytych rozważań wzrósł z 1,5% do 100% w ciągu tygodnia. To doprowadziło do spadku odczytów plików przed edycjami: z 6,6 do 2 na edycję. Model teraz wprowadza zmiany w plikach bez wstępnego podglądu, co powoduje:
- Zepsute komentarze.
- Naruszenia zasad z
CLAUDE.md. - Pseudonaprawy, które nie rozwiązują problemów.
Skrypt AMD do wykrywania fraz typu „kontynuować?”, „znane ograniczenie” lub „to nie była moja edycja” uruchomił się 173 razy po 8 marca. Wcześniej — zero przypadków.
Skalowanie i wzrost kosztów
Zespół AMD zwiększył liczbę równoległych agentów z 1–3 do 5–10 na 10 projektach. Zapytania do API wzrosły z 1498 w lutym do 119 341 w marcu — czyli 80-krotnie przy podobnej liczbie użytkownikowych promptów. Degradacja zwiększyła zużycie tokenów: więcej błędów, powtórzeń i nieudanych iteracji.
Ciekawy fakt: raport wygenerował Claude Opus 4.6 na podstawie logów. W samoocenie model zauważył spadek wskaźnika odczytów/edycji z 6,6 do 2,0 oraz 173 próby zatrzymania, ale nie wyjaśnił przyczyn spadku jakości.
Reakcja Anthropic
Lider Claude Code, Boris Czerni, zaprzeczył cięciu rozważań: flaga redact-thinking tylko ukrywa je w UI. Zalecenia:
- Ręcznie aktywować
/effort highlub/effort max. - Dla klientów korporacyjnych — domyślny wysoki poziom wysiłku w testach.
Według plotek AMD tymczasowo przeszło na alternatywne narzędzie.
Metodyka oceny głębokości
Bezpośredni dostęp do rozważań zablokowała flaga, dlatego Laurenco wykorzystała korelację z innymi polami logów. Dane z 6852 sesji potwierdzają trend: spadek zbiegł się z wdrożeniem flagi. Starszyzna inżynierska AMD jednogłośnie uznała Claude za nieprzydatny do pracy inżynierskiej.
Co ważne
- Głębokość rozważań skróciła się o 3,5 raza (2200 → 600 znaków).
- Odczyty plików przed edycjami: 6,6 → 2.
- 173 uruchomienia skryptu detekcji odmów po 8 marca.
- Zapytania API ×80 przy skalowaniu zespołu.
- Anthropic zaprzecza degradacji, proponuje ręczne ustawienia wysiłku.
— Editorial Team
Brak komentarzy.