我靠,看到这个数据第一反应是去翻了一下是不是搞错了。
DeepSeek今天推送了V4-Flash的新版本。官方changelog写着”仅重新后训练,架构和参数量与Preview版本完全相同”。
然后Terminal Bench从56.9飙到82.7。涨了25.8分。
同一套架构,同一个参数量,什么都没改,只是重新做了后训练。Agent能力就暴涨了26分。
Toolathlon从51.8涨到70.3。还新增了几个基准——Cybergym 76.7、DeepSWE 54.4、NL2Repo 54.2。多项指标超过自家V4-Pro-Preview。
这个数据让我想了一阵。如果模型架构没变,推理能力暴涨26分,说明什么?
说明当前大模型竞争的瓶颈根本不在”谁的架构更先进”。瓶颈在后训练数据工程——你怎么构造训练数据,怎么设计训练策略,怎么让模型从已有能力中榨取更多。这个方向的红利远没到头。
翻了一下历史数据。2025年8月V3.1的Terminal Bench是31.3。一年后Flash版本到了82.7。涨了两倍半。而这中间V4的架构变化是有的,但这次0731版本证明——连架构都不需要换,光是后训练策略就能拉26分。
这对OpenAI和Anthropic不是好消息。因为如果”重训练就能暴涨”成立,那迭代速度取决于谁有钱有卡快速跑实验——而DeepSeek的训练成本是行业最低的。
还有一个细节。这次更新原生支持了Responses API格式,专门适配Codex。DeepSeek现在不只在做模型,在抢AI编程生态的标准制定权。
来源:https://api-docs.deepseek.com/updates/
关注 SomethingAI 公众号
每日 AI 趋势日报,深度选题分析,独立开发思考
微信搜索「SomethingAI」关注