返回首页

Claude Code 退化:推理减少 3.5 倍

AMD AI 总监分析了 6852 个 Claude Code 会话,揭示推理深度下降 3.5 倍以及编辑前文件读取减少。由于错误,API 成本增长 80 倍。Anthropic 推荐手动 effort 设置。

Claude Code 变钝:AMD 关于 6852 个会话的报告
Advertisement 728x90

# # Claude Code 性能退化:基于 6852 次会话,思考深度减少 3.5 倍

Stella Laurenzo,AMD AI 团队总监,分析了 2026 年 1 月至 3 月的 6852 次 Claude Code 会话。总计:234,760 次工具调用和 18,000 个思考块。结论:该模型在复杂工程任务中表现挣扎。思考深度从 2 月的 2200 字符下降到 3 月的 600 字符——与 Anthropic 在 3 月初引入的 redact-thinking-2026-02-12 标志相关。

模型行为变化

激活标志后,隐藏思考的比例在一周内从 1.5% 上升到 100%。这导致编辑前文件读取次数从 6.6 次降至每次编辑 2 次。模型现在不预览文件就直接修改,导致:

  • 注释被破坏。
  • 违反 CLAUDE.md 中的约定。
  • 伪修复,无法解决问题。

AMD 用于检测“continue?”、“known limitation”或“this wasn't my edit”等短语的脚本在 3 月 8 日后触发 173 次。此前——零次触发。

Google AdInline article slot

规模扩展与成本增长

AMD 团队将并行代理从 1–3 个增加到 5–10 个,覆盖 10 个项目。API 请求从 2 月的 1498 次激增至 3 月的 119,341 次——用户提示量相似的情况下增长 80 倍。性能退化导致令牌使用量大幅增加:更多错误、重复和失败迭代。

趣闻:这份报告由基于日志的 Claude Opus 4.6 生成。在自我分析中,模型注意到读取/编辑比率从 6.6 降至 2.0,以及 173 次停止尝试,但未解释质量下降原因。

Anthropic 的回应

Claude Code 负责人 Boris Cherny 否认有任何思考内容削减:redact-thinking 标志仅在 UI 中隐藏它们。建议:

Google AdInline article slot
  • 手动激活 /effort high/effort max
  • 对于企业客户——在测试中默认高努力级别。

传闻 AMD 暂时切换到替代工具。

评估深度的Methodology

标志阻挡了对思考的直接访问,因此 Laurenzo 使用与其他日志字段的相关性进行分析。来自 6852 次会话的数据证实了这一趋势:下降恰逢标志 rollout。AMD 高级工程师一致认为 Claude 不适合工程工作。

关键要点

  • 思考深度减少 3.5 倍(2200 → 600 字符)。
  • 编辑前文件读取:6.6 → 2。
  • 3 月 8 日后拒绝脚本触发 173 次。
  • 团队扩展下 API 请求 ×80。
  • Anthropic 否认退化,建议手动调整努力级别。

— Editorial Team

Google AdInline article slot
Advertisement 728x90

继续阅读