← 返回

Kimi K3暂停订阅:开源最大的模型,跑不起最大的流量

詹叔 · 2026年07月20日

7月19日深夜,Kimi团队发了一则公告。

语气诚恳,态度克制,但信息量炸裂:「即日起,暂停C端新用户订阅。」

三天前,他们刚发布了Kimi K3——2.8万亿参数,全球参数规模最大的开源大模型。彭博社说它在「打破美国AI领先中国的固有认知」,社区里不少人称之为「又一个DeepSeek时刻」。

然后48小时不到,新用户就进不来了。

公告原文写得很坦诚:「过去48小时,用户请求量已大幅超出我们的预估,并且逼近现有集群的承载极限。」

这不是一次简单的服务器过载。这是一个2.8万亿参数模型的算力账单,第一次以最直白的方式摊在了所有人面前。

2.8万亿参数的显存陷阱

要理解为什么Kimi K3会在48小时内撑不住,得先搞清楚一件事:参数量不等于计算量,但参数量等于显存。

Kimi K3用的是混合专家架构(MoE),896个专家模块,每次推理只激活其中16个。这意味着它的单次推理计算量,远小于2.8万亿这个数字暗示的规模。很多人看到「2.8万亿参数」第一反应是「算力爆炸」,但计算其实不是最大的瓶颈。

真正的瓶颈是显存。

MoE架构的规则是:所有896个专家的权重,必须同时常驻在GPU显存里。推理时虽然只用16个,但另外880个不能临时从硬盘加载——那个延迟用户等不了。所以你的GPU集群必须有足够的显存,一次性装下全部2.8万亿参数的权重,外加KV Cache、上下文缓存和系统开销。

参数越大,需要的GPU越多。GPU越多,固定成本越高。这不是「用得多就多花钱」的可变成本,而是「不管有没有人用,这些GPU都得开着」的固定成本。

对比一下:DeepSeek V4是1.6万亿参数,文心大模型5.0是2.4万亿。Kimi K3的2.8万亿,是目前开源世界里最大的显存负担。

这意味着,每多服务一个并发用户,Kimi需要的边际算力投入,可能比参数更小的模型高出一个量级。当用户请求量「大幅超出预估」时,这个差距会被迅速放大——不是一个线性增长,而是逼近承载极限时的断崖式恶化。

Kimi选择「保老弃新」,本质上是在固定显存容量下做了一次零和分配:把已有的GPU全部留给已付费用户,把新用户挡在门外。

开源的定价天花板

如果说显存是技术层面的硬约束,那定价就是商业模式层面的软约束。

Kimi K3的API定价是:缓存未命中输入每百万Token 3美元,输出每百万Token 15美元。

作为对比,智谱GLM-5.2的定价是:输入1.4美元,输出4.4美元。Kimi K3的输出价格是GLM-5.2的3倍多。

这个定价合理吗?从成本角度说,2.8万亿参数的推理成本确实高于1.6万亿参数的模型,定价更高有技术依据。但从市场角度说,Kimi面临一个尴尬的位置:论便宜,打不过GLM-5.2和DeepSeek;论能力,社区的评价分裂严重,有人直呼「国产旗舰终于追上了」,也有人实测后吐槽「比竞品慢两三倍,token消耗猛,订阅转眼见底」。

这就是开源模型公司面临的核心矛盾:你把模型权重免费放出去了,定价就被锁死在一个区间里。

开源意味着任何拿到权重的人都可以自己部署。如果API定价太高,用户会直接自己拉权重跑——尤其是企业用户,他们有技术和资源做私有化部署。这就给API定价设了一道天花板:你不能比用户自己部署的成本贵太多。

但推理成本是实打实的。2.8万亿参数的模型,每一次API调用都在烧GPU、烧电、烧带宽。模型越大,这个成本越高。而开源又把你锁死在一个相对低的定价区间里。

模型越大越免费。推理成本越不可持续。这就是开源大模型的经济学悖论。

半年融了32亿美元,还是不够花

月之暗面的融资速度,能让你直观感受到这个悖论的烈度。

去年底完成5亿美元C轮。今年2月又拿了超过7亿美元。5月美团龙珠领投约20亿美元,投后估值200亿美元。仅仅一个月后,又开始寻求至多20亿美元的新一轮融资,目标估值300到315亿美元,同时考虑赴港上市。

半年三笔融资,累计超过32亿美元,估值从不到200亿冲向300亿以上。然后还没到下一轮融资落地,K3发布48小时就暂停了新用户订阅。

钱都去哪了?

训练只花一次,但推理天天付账。K3这样的2.8万亿参数稀疏模型,一次正式训练可能需要上万张H100等效芯片,完整项目消耗数千万甚至上亿美元。但训练完成后,更大的黑洞才打开:每一次用户调用,厂商都在持续烧算力、电力和带宽。模型越强大,用户用得越频繁,这个成本就越高。K3支持100万Token上下文窗口——这意味着用户一次对话可能消耗的Token量,是普通模型的几倍甚至几十倍。

更关键的是,用户用得越多,亏损就越大。这不是一个「规模效应降低边际成本」的经典商业模型——在推理成本居高不下的情况下,每多一个用户,就是在融资的钱上多烧一把火。

月之暗面面临的,是一个所有开源大模型公司都绕不开的结构性困境:要撑住高估值和IPO叙事,就必须维持「全球前沿、持续突破」的形象,就得不停砸钱做大模型;但模型越大,推理成本越高,亏损越严重,盈利预期越模糊,估值逻辑反而越站不住。

OpenAI砍窗口,Kimi砍用户

就在Kimi K3暂停订阅的同一周,OpenAI也在做一件类似的事。

OpenAI把Codex的上下文窗口从37.2万Token砍到了27.2万Token。OpenAI官方确认这是临时措施,原因不是延迟问题,而是Token消耗速度——说白了,就是推理成本。

同一个时间窗口里,全球最贵的闭源AI公司和最大的开源AI模型,都在做同一件事:收紧供给侧,控制推理成本。

但两者的路径截然不同。

OpenAI的做法是「精准手术」:缩小上下文窗口,让每个用户的每次调用消耗的Token减少。这相当于降低了每个人的成本,但所有人还能继续用。闭源模型的好处在于,公司对成本杠杆有完全的控制权——窗口多大、哪些功能收费、什么用量触发限流,全由自己说了算。

Kimi的做法是「壮士断腕」:直接暂停新用户。这不是精细调控,而是紧急制动。开源模型放出权重后,你就丧失了对成本结构的精细控制权——你能控制的是自己API服务的供给量,但你控制不了模型本身的运行成本结构。

这个区别的深层含义是:闭源模型公司在算力危机面前,有更多的工具和杠杆;开源模型公司的选择面要窄得多。你可以缩窗口、可以调价格、可以限功能,但当你的模型参数大到一定程度,显存成本变成刚性支出时,你唯一能做的,就是把一部分用户挡在门外。

谁在为免费的开源买单?

回到那个最本质的问题:Kimi K3的模型权重是免费开源的,7月27日前完整发布。那运行这些权重所需要的算力成本,到底谁在付?

答案是一组残酷的分配结构。

投资者在付。月之暗面半年融了32亿美元,这些钱大部分在填推理亏损的窟窿。投资者赌的是公司能撑到IPO,在二级市场退出。但如果推理成本持续失控,这个赌注的胜率在下降。

Kimi自己的API用户在付。输出每百万Token 15美元的定价,是GLM-5.2的3倍多。这些用户实际上在补贴模型运行的部分成本。但当他们发现更便宜的替代品时——比如GLM-5.2或者DeepSeek——他们会用脚投票。

被挡在门外的新用户在「付」——他们付出的是机会成本和时间成本。Kimi K3发布时的高调宣传让他们产生了期待,然后他们发现自己连订阅的资格都没有。

唯独第三方部署者不付。拿到开源权重的企业和开发者,可以自己拉集群跑模型,不向月之暗面付一分钱推理费用。这是开源的核心价值——也是开源模型公司最大的商业痛点。你花了数亿美元训练出来的模型,别人免费拿走就能用,而你还要自己承担API服务的全部算力成本。

这就是开源大模型最拧巴的地方:创造价值的人承担全部成本,使用价值的人不承担任何成本。当模型还小、推理成本还可以忽略的时候,这个矛盾不突出。但当参数规模到了万亿级别,算力成本变成了真金白银的时候,这个结构的不可持续性就暴露了。

免费的午餐,终究有人买单

经济学里有个基本常识:天下没有免费的午餐。

开源软件时代的共识是「代码免费,服务收费」——Red Hat靠企业支持服务上市,MongoDB靠云托管赚钱。但大模型的开源跟软件开源有一个根本区别:软件的复制成本趋近于零,而模型的推理成本是持续且巨大的。

你复制一份Linux内核,成本是零。你运行一个2.8万亿参数的模型,每一秒都在烧钱。

Kimi K3发布48小时暂停订阅,不是一个产品事故,而是这个结构性矛盾的一次集中爆发。它告诉所有人:模型可以开源,但运行模型的算力无法开源。参数规模越大,这个矛盾越尖锐。

月之暗面不是唯一面临这个问题的公司。DeepSeek、智谱、甚至Meta的Llama系列,都在不同程度上面对同样的困境。只不过Kimi K3的2.8万亿参数,把这个矛盾推到了一个前所未有的极端:全球最大的开源模型,搭配全球最紧张的算力供给。

接下来的问题是:这个模式能持续多久?

如果推理成本持续高于API收入,如果融资环境收紧,如果更便宜的竞品持续侵蚀定价空间——开源大模型公司的终局会是什么?会不会出现一种新的「半开源」模式,核心权重收费但生态工具免费?或者开源变成纯粹的营销手段,真正赚钱的永远是闭源的API服务?

Kimi K3的暂停订阅,不会是最后一次。每一个把模型做到万亿参数级别的开源公司,迟早都要面对同一个选择:到底是继续扩大免费用户的规模,还是在算力账单面前学会说不。

月之暗面选择了后者。这个选择本身,比Kimi K3的任何跑分数据都更值得记住。

关注 SomethingAI 公众号

每日 AI 趋势日报,深度选题分析,独立开发思考

微信搜索「SomethingAI」关注