# Claude Code 성능 저하: 6852 세션 분석으로 사고 깊이 3.5배 감소
AMD AI 그룹 디렉터 Stella Laurenzo가 2026년 1~3월 6852개 Claude Code 세션을 분석했습니다. 총 규모: 234,760 tool calls와 18,000 thinking blocks. 결론: 모델이 복잡한 엔지니어링 작업에 어려움을 겪고 있습니다. 사고 깊이가 2월 2200자에서 3월 600자로 급감했습니다—이는 Anthropic이 3월 초에 도입한 redact-thinking-2026-02-12 플래그와 상관관계가 있습니다.
모델 동작 변화
플래그 활성화 후 일주일 만에 숨겨진 사고 비중이 1.5%에서 100%로 치솟았습니다. 이로 인해 편집 전에 파일 읽기 횟수가 편집당 6.6회에서 2회로 줄었습니다. 이제 모델은 파일을 먼저 확인하지 않고 바로 변경을 가합니다. 그 결과:
- 주석이 깨짐.
CLAUDE.md의 합의 사항 위반.- 문제를 해결하지 않는 가짜 수정.
AMD의 “continue?”, “known limitation”, “this wasn't my edit” 같은 구문 감지 스크립트가 3월 8일 이후 173회 작동했습니다. 이전에는 제로였습니다.
확장과 비용 증가
AMD 팀은 10개 프로젝트에서 병렬 에이전트를 1~3개에서 5~10개로 늘렸습니다. API 요청이 2월 1498회에서 3월 119,341회로 폭증했습니다—사용자 프롬프트 규모는 비슷한데 80배 증가. 성능 저하로 토큰 사용량이 급증: 오류, 반복, 실패 반복이 늘었습니다.
재미있는 사실: 보고서는 로그를 바탕으로 Claude Opus 4.6이 생성했습니다. 자체 분석에서 모델은 읽기/편집 비율이 6.6에서 2.0으로 떨어지고 173회 중단 시도가 있었음을 지적했지만, 품질 저하 이유는 설명하지 않았습니다.
Anthropic의 대응
Claude Code 리드 Boris Cherny는 사고 과정 축소는 없었다고 부인했습니다: redact-thinking 플래그는 UI에서만 숨기는 기능입니다. 권장 사항:
- 수동으로
/effort high또는/effort max활성화. - 기업 고객—테스트에서 기본 고노력 수준 설정.
소문에 따르면 AMD가 일시적으로 대체 도구로 전환했습니다.
깊이 평가 방법론
플래그로 사고 과정 직접 접근이 차단되어 Laurenzo는 다른 로그 필드와의 상관관계를 사용했습니다. 6852 세션 데이터가 추세를 확인: 저하는 플래그 배포와 맞물렸습니다. AMD 선임 엔지니어들은 만장일치로 Claude를 엔지니어링 작업에 부적합하다고 판단했습니다.
주요 요약
- 사고 깊이 3.5배 감소 (2200 → 600자).
- 편집 전 파일 읽기: 6.6 → 2.
- 3월 8일 이후 거부 스크립트 173회 작동.
- 팀 확장에도 API 요청 ×80.
- Anthropic은 저하 부인, 수동 노력 조정 제안.
— Editorial Team
아직 댓글이 없습니다.