9月26日,Hacker News 首页挂着一篇博客。
一个网名 allanrbo 的开发者,用一台 RTX 3090 和一个 12B 的开源模型,让摄像头每秒看一帧画面,回答三个问题——有人吗?室内还是室外?光线亮不亮?
整套东西装在一个 Python 文件里。没什么技术奇迹,里面最核心的技巧——读取模型输出时的概率分布——在 OpenAI 的官方 cookbook 里躺了好几年,从没人觉得它能当产品。
他模仿的对象叫 Jev。一家由前 OpenAI 研究者创办的公司磨了两年的东西,11 天前刚刚发布。
9月15日,TypeSafe AI 结束两年隐身,发布了第一代「System One 模型」。
创始人 Diogo Almeida 在 OpenAI 期间参与构建了 ChatGPT 指令遵循能力背后的方法。这次创业,他选了一条和前东家完全相反的路——不做更会聊天的模型,做一个不会聊天的模型。
Jev 不生成文本。你给它一段状态描述和一组预定义问题,它一次性并行返回所有答案,每个答案自带概率和置信度。答案只有三种类型——选择题(最多 255 个选项)、评分、是否判断。名字借自心理学家卡尼曼在《思考,快与慢》里的划分——System 1 是快而自动的直觉,System 2 是慢而审慎的推理。Jev 的野心是做 AI 界的 System 1。
官方给出的对比数字很挑衅——同等智能水平下,比现有 LLM 快两个数量级(70 到 500 毫秒),便宜两个数量级。定价结构更是宣言式的——输入每百万 token 收 0.042 美元,输出免费。
输出免费。这个安排本身就在说,它认为自己的价值在「读题」,不在「写字」。
官方 demo 里有个流传很广的细节。用 Jev 驱动 Minecraft 游戏角色,两分钟消耗约 15 万 token,成本约 1 美分。到了夜晚,游戏里的僵尸出现,角色选择了逃跑——而代码里没有任何一条手写的「遇僵尸逃跑」规则。判断是从反复的状态查询里自己涌现的。
发布不到 24 小时,第一批开源复刻出现。
AINews 在两天内数到了 6 个克隆项目。一个叫 awesome-jev 的 GitHub 清单追踪着十几个。Reddit 上有开发者自称翻完了 287 个相关开源项目,筛出 20 个能用。到今天,头部的开源实现按 GitHub 星标数排(9月23日数据):
Laya,19301 星。Convai Innovations 在 Jev 发布三天后推出,单日暴涨过 5000 星。421M 参数,CPU 就能跑,实测中位延迟 66 毫秒一问,pip 一行命令安装。
Kev,5385 星,作者是知名开源开发者 Jared Palmer。这个项目最狠的一手是完整实现了 TypeSafe 的官方协议——开发者用官方 SDK,改一个 base URL,就能把付费的 Jev 换成免费的 Kev。这条帖子在 Hacker News 拿了 438 分。
SemIf,4023 星,思路最极简——不训练不微调,冻结一个 Qwen3.5-4B,直接读它的 logits。
再往下还有 NanoJev、jevlike 等等。
这些项目有一个共同点——地基几乎全是 Qwen,阿里通义千问的开源系列。
为什么抄得这么快?因为 TypeSafe 把 API 的「形状」公开在了文档里——状态进、类型化决策出。而形状这东西,开源世界有的是现成积木。最经典的路数,allanrbo 那篇博客用的就是——把问题拆成选项,逼模型只输出一个字母,同时读出它内部对每个选项的倾向度。一个周末,一个壳就搭好了。
但 pinggy 的横评把热闹背后的真相摊开了。
独立 49 任务基准测试上,Jev 官方成绩 0.966,最好的开源实现 0.704。差距不是一点。
Laya 的案例最典型。19000 多颗星的明星项目,开箱即用的 zero-shot 成绩 0.362——而随机瞎猜的基线是 0.318,无脑全选最常见答案的基线是 0.461。也就是说,不微调直接用,它连「无脑策略」都不如。它后来刷出的那个 0.766(超过 Jev 官方公布的 0.727),是在这个基准自己的训练集上微调出来的成绩。
抄走接口用了 24 小时。追上质量,到今天没有发生。
Jev 真正的护城河在两件抄不走的事上。一是 RLCD——用强化学习直接优化「概率校准」,让模型说八成把握时,长期看真的大约八成正确。这直接打在 LLM 的死穴上——被人类偏好调教出来的聊天模型习惯性自信,而一个说不出自己什么时候会错的系统,没法放心交给自动化流程。Diogo Almeida 的原话是——如果一个模型 95% 的时候都能做对,但说不出自己哪 5% 会错,它就没法自动化这个任务。
二是为并行输出重写的采样架构。开源实现本质还是串行地调 LLM,每个问题走一遍完整推理;Jev 从模型结构层面就是为「一次出全部答案」设计的。这是性能差距的来源,也是 0.2 帧每秒和 100 毫秒级的差距。
到这里,大多数人会问——Jev 会不会革掉 LLM 的命?
这个问法就问错了。
11 天的生态数据讲的是另一件事——「向 AI 要判断」这个动作的接口,被免费公开成了公共品。任何开发者今天就可以用免费的开源实现,或者花一个下午自己写一个,搭出决策层原型,验证自己的工作流。等真的需要 0.966 的准确率和毫秒级延迟时,再切到官方服务——Kev 已经证明,切换成本约等于改一行配置。
接口先于实现,接口快于实现。
这个剧本在历史里反复上演。SQL 立住了,最大的赢家不是发明它的 IBM;HTTP 立住了,浏览器战争的赢家换了三轮。范式的发明者,从来不是范式红利的天然收割者。
Jev 现在的处境是双面的。它可能赢得范式而输掉市场——接口成了公共品,开源实现用免费的 Qwen 就能跑,而它引以为傲的校准优势需要用户先撞上准确率的天花板才能感知。它也可能靠校准和延迟这两件硬功夫守住高端市场,像 GPU 之于深度学习那样成为默认底座。11 天,还看不出来。
能确定的是一件事——决策层从 LLM 里独立分层的那一天,被它提前拽来了。生成层的竞赛已经有了座次,决策层的竞赛刚开场。而这一层的地基,是免费的,还是中国造的。
allanrbo 在博客末尾说,专用的视觉模型肯定比他这套高效得多。但他喜欢的是另一件事——想改一个判断条件,用自然语言说一句话就行。
这大概就是「接口时刻」的样子。发明者公布的是一个产品,社区拿走的是一种语法。
下一个十年最值钱的模型,未必是最会说会写的那个,而是敢拍板、还说得出自己多有把握的那个。
关注 SomethingAI 公众号
每日 AI 趋势日报,深度选题分析,独立开发思考
微信搜索「SomethingAI」关注