这也符合当前搜索引擎对内容质量的评估标准。
最近一个月,Hacker News 和 Reddit 上涌现大量开发者反馈,Claude Code 的编码质量出现明显下滑:复杂任务智能减弱、工具调用选择异常、思考过程频繁遗忘、重复输出增多,同时用户限额消耗速度加快。不少人将此归因于模型退化或 Anthropic 算力紧张,甚至质疑公司透明度。
深挖三个变更的时间线,能清晰看到它们如何形成连锁反应,间接加速了限额消耗。3月4日默认reasoning effort从high降至medium,本意缓解UI偶发卡顿,却削弱了复杂逻辑的深度分析能力;3月26日的缓存优化本想清理闲置会话的旧思考历史,却因bug导致每轮都清空上下文,造成重复输出和额外token浪费;4月16日系统prompt新增verbosity限制(工具间≤25词、最终响应≤100词),短期内让编码质量评估下降约3%。
Anthropic 4月23日发布的postmortem为Claude Code近期质量下滑提供了清晰解释。报告指出,问题并非模型底层退化,而是三次产品层变更叠加所致,影响范围限于Claude Code、Agent SDK和Cowork,API未受波及。所有问题已在4月20日v2.1.116版本中完全修复,并伴随订阅用户用量限额重置。
harness的作用就像汽车的底盘和控制系统。引擎再强劲,如果底盘调校失准,整车也会发飘、失控,甚至显得“笨拙”。AI编码工具同样如此,底层模型能力再突出,harness层一旦小调整没把控好,用户端体验就会出现系统性波动。
Hacker News 等社区的讨论中,不少开发者用“gaslighting”描述公司初期回应的倾向,有人分享复杂工程任务中模型忽略项目惯例、幻觉加剧的具体案例。表面上看,这是一次典型的“Bug修复”故事,媒体和社区多将其归为AI工具迭代的阵痛。但仔细观察,主流吐槽更多停留在质量下滑本身,却较少触及为什么用户反馈响应滞后,以及初期为何优先强调“未发现明显退化”而非主动深挖真实体验差异。
最近几周,开发者社区在Hacker News、Reddit和X平台上充斥着对Claude Code质量下滑的抱怨:代码生成深度不够、上下文记忆反复丢失、输出显得重复而缺乏洞察。Anthropic在4月23日发布的postmortem报告中,终于直面这些反馈,承认问题并非底层模型退化,而是三项独立的工程变更在harness层叠加所致。这些变更分别发生在3月和4月,已于4月20日通过版本更新全部修复,并伴随订阅限额的重置。
最近开发者在使用Claude Code时频繁遇到代码生成质量下滑的情况,模型偶尔出现遗忘上下文、重复输出或逻辑不完整的问题。4月23日Anthropic发布了一份详细postmortem报告,明确这些现象并非底层模型退化,而是Claude Code和Agent SDK产品层面的三个变更叠加所致。核心在于模型能力本身未变,但harness和prompt的调整直接放大了用户感知到的质量波动,尤其对依赖深度思考的Opus系列影响显著。
开发者或许会更倾向于多工具并行,比如保留Claude Code处理特定场景,同时用Cursor或OpenAI方案做备份。
紧接着 3 月 26 日的缓存优化引入 bug,本意清除闲置超一小时会话的旧 thinking 以降低恢复成本,却因实现失误导致每轮都清除先前推理,造成忘却、重复和 cache miss 加速额度消耗,该 bug 于 4 月 10 日修复。
深入拆解第一个变更,3月4日Anthropic将Sonnet 4.6和Opus 4.6的默认推理努力从high调整为medium。本意是缓解high模式下偶尔出现的长延迟,避免UI冻结感并控制token开销。medium努力确实降低了响应时间,但复杂编码任务的思考深度随之减弱。多数用户未主动切换更高努力模式,4月7日该调整被回滚,Opus 4.7甚至默认设为xhigh。单独看,这一权衡主要影响响应智能,却未引发全面崩盘。
这个反差,已成为行业最真实的写照。