Anthropic在7月24日放出了Claude Opus 5。大部分人的关注点在两个数字上——Frontier-Bench编码测试得分43.3%,超过上一代Opus 4.8的两倍,同时价格是Fable 5的一半。
但我翻完整个发布文档后,觉得最值得聊的不是这些。
是一个行为模式的变化。Opus 5开始自己检查自己的代码了。
Anthropic的发布文档里放了几个案例。其中一个让我停了很久。
有人给Opus 5一张机器零件的图纸,让它用FreeCAD重建3D模型。问题是——它没法直接看到这张图。之前所有模型在这种条件下都会卡住或者放弃。
Opus 5的反应是:自己写了一套计算机视觉pipeline,从原始像素里提取几何信息,然后重建了整个零件。
不是一次成功。它做了多次尝试,每次验证结果,调整方法,直到跑通。
另一个案例更有意思。一个开源包管理器里有真实bug,Opus 5不仅找到了根因,还修了一个社区补丁遗漏的edge case。作为对比,另一个模型只修了表面症状就报告「问题解决」。
Tako的联合创始人AJ Orbach说了句话,我觉得是这次发布最重要的一句话:
「Claude Opus 5检查自己的代码,就像一个真正的前端开发者那样。在我们的测试里,它自己打开浏览器,在桌面和手机宽度下分别看了看页面,发现了一个在手机端被折叠隐藏的产品和一个跑出屏幕的结账按钮,然后自己修了,才把工作交回来。」
模型从「写完就交」变成了「写完检查、检查完再交」。这个行为的转变,比任何benchmark分数都重要。
因为它替换的不是程序员的手——那个早就被替换了。它替换的是程序员的眼睛。
Opus 5在ARC-AGI 3上拿了30.2%。
这个数字单独看不够震撼,但需要上下文:第二名是GPT-5.6 Sol的7.8%,上一代Opus 4.8只有1.5%。Opus 5是第二名的将近四倍。
ARC-AGI 3是François Chollet设计的测试。和大多数benchmark不同,它不测模型记住了多少知识,而是把AI丢进一个完全陌生的交互环境里——没有说明书、没有规则、没有目标。模型必须通过试错自己搞清楚一切。
这种测试没法靠训练数据作弊。你要么能适应陌生规则系统,要么不能。
30.2%意味着什么?意味着Opus 5在真正地「解决从没见过的问题」,而不是从训练集里调取相似案例。人类在这个测试上还是100%,所以远没有到天花板。但从1.5%到30.2%的一步跨越,是整个AI领域今年最大的单一benchmark进步。
这件事和自查自纠放在一起看才有意思。
Anthropic的技术团队成员Tariq Shihipar在WF2026大会上说了一句话:他们砍掉了Claude Code系统提示词的80%。
原因不是省token。原因是——新的Claude 5系列模型「想要更小的系统提示词」。
早期的模型需要大量示例和限制性规则才能表现好。你给的指令越详细、示例越多,输出越好。这就是提示词工程的核心逻辑:模型是木偶,你拉线,它动。
但现在不一样了。
Shihipar说,示例反而会限制模型的能力,因为它「其实比你给的示例更有想象力」。所以Anthropic从硬规则(「不要做这个」)转向了上下文引导——给模型场景和背景,让它自己判断该怎么做。
我第一次看到这个说法的时候反应是:这不就是管理方式的转变吗?从「微观管理」到「放权」。你不再需要告诉一个资深开发者每一步该怎么做,你给他目标和上下文就够了。
只不过这次,「资深开发者」是一个模型。
自查自纠和系统提示词削减,这两件事看起来不相关,其实指向同一个变化。
模型正在从「被指挥」变成「自指挥」。
当模型需要80%更少的指令就能做好工作,同时还会自己检查和验证输出——这意味着什么?
意味着开发者的角色定义又变了一次。
第一次变化是「AI写了90%的代码」——开发者的手被替代了,但审查和决策还在人手里。你写代码变快了,但final review还是你做。
现在Opus 5在说:final review我也能做了。你给我一个任务,我不光写完,还会自己测、自己查、自己修完再给你。
所以开发者的角色正在从「代码审查者」滑向「任务定义者」。你的核心技能不再是「这段代码写得对不对」,而是「我要解决的问题到底是什么」。
这比「AI能不能写代码」要可怕得多。因为代码审查至少还是一个需要经验壁垒的活——你得看得懂才能审。而任务定义更像产品经理的能力——理解问题、拆解需求、定义成功标准。
程序员正在被推向一个他们不太舒服的位置。
如果自查自纠成为标配,如果系统提示词继续缩减到接近零,如果ARC-AGI 3的分数继续涨——那开发者和AI的关系会走到什么状态?
我目前的判断是这样的:开发者会分裂成两类。
一类是把AI当工具的人——给它明确的指令,检查它的输出,确保质量。这类人的效率会很高,但他们的护城河在缩窄,因为Opus 5正在接管「检查输出」这个环节。
另一类是把AI当同事的人——不告诉它怎么做,只告诉它做什么和为什么做。这类人需要的不是编程能力,而是判断力:什么问题值得解决、什么标准定义了「做好」、什么时候该信任AI的自查结果、什么时候该自己动手验证。
前一类人跟AI竞争效率,注定输。后一类人在跟AI协作,暂时还有优势——但这个「暂时」能持续多久,我不确定。
唯一确定的是,每次模型学会自己做一件新的事情,人类就必须往上游挪一步。从写代码到审代码,从审代码到定义任务。
上一次挪步的时候,我们说「AI写了90%的代码,真正稀缺的是判断力」。
这一次的信号更尖锐了。Opus 5在说:判断力我也会一点了,你往上游再挪挪。
关注 SomethingAI 公众号
每日 AI 趋势日报,深度选题分析,独立开发思考
微信搜索「SomethingAI」关注