Powrót do strony głównej

Degradacja Claude Code: rozumowanie 3,5 raza mniej

Dyrektor AI w AMD przeanalizowała 6852 sesje Claude Code, wykrywając spadek głębokości rozumowania o 3,5 raza i zmniejszenie odczytów plików przed edycjami. Koszty API wzrosły 80-krotnie z powodu błędów. Anthropic zaleca ręczne ustawienia effort.

Claude Code otupiał: raport AMD po 6852 sesjach
Advertisement 728x90

# Degradacja Claude Code: skrócenie rozważań o 3,5 raza według danych z 6852 sesji

Dyrektorka grupy AI w AMD, Stella Laurenco, przeanalizowała 6852 sesje Claude Code z okresu styczeń–marzec 2026 roku. Łączna objętość — 234 760 wywołań narzędzi i 18 tysięcy bloków rozważań. Wniosek: model nie radzi sobie ze skomplikowanymi zadaniami inżynierskimi. Głębokość rozważań spadła z 2200 znaków w lutym do 600 w marcu — korelacja z flagą redact-thinking-2026-02-12, którą Anthropic wprowadził na początku marca.

Zmiany w zachowaniu modelu

Po aktywacji flagi udział ukrytych rozważań wzrósł z 1,5% do 100% w ciągu tygodnia. To doprowadziło do spadku odczytów plików przed edycjami: z 6,6 do 2 na edycję. Model teraz wprowadza zmiany w plikach bez wstępnego podglądu, co powoduje:

  • Zepsute komentarze.
  • Naruszenia zasad z CLAUDE.md.
  • Pseudonaprawy, które nie rozwiązują problemów.

Skrypt AMD do wykrywania fraz typu „kontynuować?”, „znane ograniczenie” lub „to nie była moja edycja” uruchomił się 173 razy po 8 marca. Wcześniej — zero przypadków.

Google AdInline article slot

Skalowanie i wzrost kosztów

Zespół AMD zwiększył liczbę równoległych agentów z 1–3 do 5–10 na 10 projektach. Zapytania do API wzrosły z 1498 w lutym do 119 341 w marcu — czyli 80-krotnie przy podobnej liczbie użytkownikowych promptów. Degradacja zwiększyła zużycie tokenów: więcej błędów, powtórzeń i nieudanych iteracji.

Ciekawy fakt: raport wygenerował Claude Opus 4.6 na podstawie logów. W samoocenie model zauważył spadek wskaźnika odczytów/edycji z 6,6 do 2,0 oraz 173 próby zatrzymania, ale nie wyjaśnił przyczyn spadku jakości.

Reakcja Anthropic

Lider Claude Code, Boris Czerni, zaprzeczył cięciu rozważań: flaga redact-thinking tylko ukrywa je w UI. Zalecenia:

Google AdInline article slot
  • Ręcznie aktywować /effort high lub /effort max.
  • Dla klientów korporacyjnych — domyślny wysoki poziom wysiłku w testach.

Według plotek AMD tymczasowo przeszło na alternatywne narzędzie.

Metodyka oceny głębokości

Bezpośredni dostęp do rozważań zablokowała flaga, dlatego Laurenco wykorzystała korelację z innymi polami logów. Dane z 6852 sesji potwierdzają trend: spadek zbiegł się z wdrożeniem flagi. Starszyzna inżynierska AMD jednogłośnie uznała Claude za nieprzydatny do pracy inżynierskiej.

Co ważne

  • Głębokość rozważań skróciła się o 3,5 raza (2200 → 600 znaków).
  • Odczyty plików przed edycjami: 6,6 → 2.
  • 173 uruchomienia skryptu detekcji odmów po 8 marca.
  • Zapytania API ×80 przy skalowaniu zespołu.
  • Anthropic zaprzecza degradacji, proponuje ręczne ustawienia wysiłku.

— Editorial Team

Google AdInline article slot
Advertisement 728x90

Czytaj dalej