Zurück zur Startseite

Degradierung von Claude Code: Denktiefe 3,5-mal geringer

AMD AI Director analysierte 6852 Claude Code-Sitzungen, deckte Rückgang der Denktiefe um das 3,5-Fache und Reduktion der Dateilesungen vor Bearbeitungen auf. API-Kosten stiegen aufgrund von Fehlern um das 80-Fache. Anthropic empfiehlt manuelle Aufwandeinstellungen.

Claude Code abgestumpft: AMD-Bericht über 6852 Sitzungen
Advertisement 728x90

Claude-Code-Degradation: Denken um Faktor 3,5 reduziert – basierend auf 6852 Sitzungen

Stella Laurenzo, Direktorin der AI-Gruppe bei AMD, hat 6852 Claude-Code-Sitzungen von Januar bis März 2026 analysiert. Gesamtvolumen: 234.760 Tool-Aufrufe und 18.000 Denkblöcke. Fazit: Das Modell kämpft mit komplexen Ingenieuraufgaben. Die Denktiefe fiel von 2200 Zeichen im Februar auf 600 im März – korreliert mit der redact-thinking-2026-02-12-Flagge, die Anthropic Anfang März eingeführt hat.

Änderungen im Modellverhalten

Nach Aktivierung der Flagge stieg der Anteil versteckter Denkprozesse innerhalb einer Woche von 1,5 % auf 100 %. Das führte zu weniger Datei-Lesevorgängen vor Bearbeitungen: von 6,6 auf 2 pro Bearbeitung. Das Modell führt nun Änderungen an Dateien durch, ohne sie vorher einzusehen, was zu:

  • Kaputten Kommentaren.
  • Verstößen gegen Absprachen aus CLAUDE.md.
  • Scheinselbstreparaturen führt, die die Probleme nicht lösen.

AMD-Skript zur Erkennung von Phrasen wie „continue?“, „known limitation“ oder „this wasn't my edit“ löste nach dem 8. März 173-mal aus. Zuvor: null Auslösungen.

Google AdInline article slot

Skalierung und Kostensteigerung

Das AMD-Team erhöhte parallele Agenten von 1–3 auf 5–10 über 10 Projekte. API-Anfragen schossen von 1498 im Februar auf 119.341 im März hoch – 80-fach bei ähnlichen User-Prompt-Volumen. Die Degradation trieb den Token-Verbrauch hoch: mehr Fehler, Wiederholungen und gescheiterte Iterationen.

Kurz und knackig: Der Bericht wurde von Claude Opus 4.6 anhand der Logs generiert. In seiner Selbstanalyse notierte das Modell den Rückgang des Reads/Edits-Verhältnisses von 6,6 auf 2,0 und 173 Stoppversuche, erklärte aber den Qualitätsabfall nicht.

Reaktion von Anthropic

Claude-Code-Leiter Boris Cherny bestreitet Denkschnitte: Die redact-thinking-Flagge versteckt sie nur in der UI. Empfehlungen:

Google AdInline article slot
  • Manuell /effort high oder /effort max aktivieren.
  • Für Enterprise-Kunden – standardmäßig hohe Effort-Level in Tests.

Gerüchte besagen, AMD sei vorübergehend zu einem Alternativtool gewechselt.

Methodik zur Bewertung der Tiefe

Direkter Zugriff auf Denken ist durch die Flagge blockiert, daher nutzte Laurenzo Korrelationen mit anderen Log-Feldern. Daten aus 6852 Sitzungen bestätigen den Trend: Der Rückgang fiel mit dem Flaggen-Rollout zusammen. AMD-Senior-Ingenieure erklärten Claude einstimmig für Ingenieursarbeit ungeeignet.

Wichtigste Erkenntnisse

  • Denktiefe um Faktor 3,5 reduziert (2200 → 600 Zeichen).
  • Datei-Lesevorgänge vor Bearbeitungen: 6,6 → 2.
  • 173 Skript-Auslösungen für Ablehnungen nach 8. März.
  • API-Anfragen ×80 bei Team-Skalierung.
  • Anthropic bestreitet Degradation, schlägt manuelle Effort-Anpassungen vor.

— Editorial Team

Google AdInline article slot
Advertisement 728x90

Weiterlesen