Kimi K3 爆火 48 小时后熔断:开源模型再强,算力不够也是白搭
Kimi K3 发布不到 48 小时,月之暗面就宣布暂停 C 端新用户订阅。
理由是算力不够。官方公告的原话是"用户请求量已大幅超出团队预估,并且逼近现有集群的承载极限"。于是把已有的算力全部投给已经付费的用户,新来的先等等。
这事挺有意思的。一边是 2.8 万亿参数、全球首个 3 万亿级开源模型、Arena 前端开发榜拿第一,各种技术指标光鲜亮丽。另一边是上线两天就撑不住了,得"限流"。
模型能力的突破是真的,算力短缺的窘迫也是真的。两者放在一起看,才是今天大模型行业的完整现实。
K3 到底有多强
先快速过一下 Kimi K3 的基本盘。
2.8 万亿总参数的 MoE 模型,896 个专家,每 token 激活 16 个,活跃参数大概 320 亿。原生支持视觉(图像+视频),100 万 token 上下文。用的是 Kimi 自己的 KDA 混合线性注意力机制和注意力残差技术。
价格方面,API 输入 3 美元/百万 token(缓存命中 0.3 美元),输出 15 美元/百万 token。对比一下:Claude Fable 5 是 10/50 美元,GPT-5.6 Sol 是 5/30 美元。K3 的输出价格是 Fable 5 的三分之一。
性能呢?Arena 前端开发榜拿了 1679 分,超过了 Fable 5 的 1631 和 GPT-5.6 Sol 的 1618,七个分类里六个第一。但 Arena 自己也说了,这个榜衡量的是前端网页开发任务,不是模型整体能力。
整体能力排名,Artificial Analysis 的智能指数是:Fable 5 60 分、GPT-5.6 Sol 59 分、K3 57 分。确实是第一梯队,但还不是最强。
还有一个数据值得注意:K3 的幻觉率从上一代的 39% 涨到了 51%。能力上去了,胡说八道的概率也上去了。这不是 Kimi 一家的问题,是整个行业的通病——能力越强的模型,幻觉往往也越自信、越难分辨。
开源?开放权重而已
Kimi K3 一直被叫做"开源模型",但严格来说不是。
权重会在 7 月 27 日开放下载,Modified MIT 许可证。但训练代码、训练数据、架构细节,都不公开。KDA 注意力机制、Attention Residuals、Stable LatentMoE 路由框架、SiTU 激活函数——这些 K3 的核心创新,都只有名字,没有实现细节。
技术报告也还没发。说是"即将发布"。
这不是开源,是开放权重(open-weight)。你可以下载模型来用、来改,但你没法从 0 到 1 复现它。想知道这东西是怎么做出来的?对不起,保密。
这已经是中国大模型公司的标准操作了。DeepSeek 是这个路数,Qwen 也差不多。放权重拉生态,核心技术攥在自己手里。
对用户来说,开放权重当然比完全闭源好。你可以本地部署,可以二次开发,可以避免 API 依赖。但别真的以为这就是"开源"了。真正的开源,是连怎么训练的、用什么数据、踩了哪些坑,都公开给社区。
从 0 复现一个 K3 需要多少钱?有人估了一下:预训练 1500-2500 万美元,研发逆向工程 500-1000 万,后训练 RL 300-800 万,基础设施 200-500 万。加起来 2500-5000 万美元,还要 50 人以上的团队干 12-18 个月。
而且这还是假设你能搞到足够的 GPU。
算力才是真正的护城河
K3 发布两天就算力告急,这事比模型本身更说明问题。
模型架构可以抄,训练技巧可以学,权重甚至可以下载。但算力不行。你有多少 GPU、什么样的网络互连、多高的集群利用率、能不能持续拿到新的芯片——这些才是硬约束。
月之暗面不是小公司。估值 200 亿美元以上,融了好多轮钱,现金储备据说超百亿人民币。就这样,K3 一上线还是撑不住。
不是没钱买卡,是买不到。或者说,买到的速度赶不上用户增长的速度。
这不是 Kimi 一家的问题。智谱今年 1 月就因为 GLM-4.7 上线后用户增长太快,搞过 GLM Coding Plan 限售,每天只卖原来 20% 的量。MiniMax、DeepSeek 也都出过 API 过载或者服务中断的事。
海外巨头也一样。OpenAI 因为算力紧张,今年 3 月把 Sora 视频生成项目砍了。Anthropic 高峰期限制用户 token 额度,系统宕机也是家常便饭。
全行业都缺算力。而且缺的不只是 GPU 数量,还有整个基础设施栈——高速网络、电力供应、散热、机房空间、运维能力。这些东西不是有钱就能立刻搞定的,需要时间,需要供应链,需要工程能力。
模型能力的差距在缩小。K3 已经摸到了 Fable 5 和 GPT-5.6 Sol 的脚后跟。再过一代两代,追上也不是不可能。但算力的差距,可能反而在拉大。
谁能拿到更多、更好、更稳定的算力,谁才能笑到最后。模型做出来只是第一步,能稳定地、大规模地、低成本地跑起来,才是真正的竞争力。
为什么算力总是不够
有人可能会问:既然知道模型要发布,为什么不多准备点算力?
事情没那么简单。
首先,需求不可预测。K3 在前端开发榜拿了第一,海外反响远超预期,用户增长速度是团队"始料未及"的。你按预估的 2 倍准备,结果来了 5 倍的量,还是不够。
其次,大模型的算力需求不是线性的。K3 是 2.8 万亿参数的 MoE,虽然每 token 只激活 16 个专家,但显存占用还是巨大。推理至少需要 8 张 H100/H200 级别的 GPU,高吞吐场景要 64 卡的超级节点。而且 MoE 的专家负载均衡、all-to-all 通信,对网络要求极高,RoCEv2 或者 InfiniBand 一个都不能少。
换句话说,不是把 GPU 插上电就能跑。一整套集群基础设施,从网络到存储到运维,都得跟上。
第三,供给端确实紧张。高端 GPU 就那么几家在做,产能就那么多。全世界的 AI 公司都在抢。中国公司还多了一层限制——美国出口管制,最新的芯片拿不到或者拿得费劲。
结果就是:需求爆炸式增长,供给线性增长,缺口越来越大。
开源模型的尴尬
K3 算力荒还暴露了开放权重模型的一个尴尬处境:虽然权重是开放的,但大部分人其实跑不起来。
2.8 万亿参数,8 张 H100 才能推理——注意,是"至少"8 张。实际高并发场景下,需要的卡数要多得多。而且这 8 张卡还得高速互联,不是随便插在一台服务器上就行。
有多少公司有这个条件?
别说中小企业了,大部分互联网公司都没有。你说我可以用云啊——云厂商的 H100 实例不仅贵,还经常抢不到。
所以开放权重听起来很美," democratize AI"什么的,但真正能跑起来的,还是那些有算力的大公司。对绝大多数开发者和企业来说,开放权重模型的实际使用方式还是:调用 API。
那跟闭源模型有什么区别?价格便宜点,仅此而已。
而且这里面还有个陷阱:MoE 模型的推理优化非常难。专家并行、负载均衡、尾延迟控制、量化——每一项都是工程难题。月之暗面自己有全套优化栈,跑起来性能好。你下载权重自己部署,没有这些优化,可能性能差一大截。
到最后,开放权重反而成了一种获客手段——先用免费的权重吸引你进来,等你发现自己部署又贵又麻烦,自然就转去用官方 API 了。
上市的节奏
算力荒的另一个注脚,是月之暗面的上市计划。
去年杨植麟还在内部信里说"短期内不着急上市",现金超百亿,还能从一级市场募更多钱。结果今年就变了。5 月开始拆 VIE、拆红筹,为赴港 IPO 做准备。7 月 K3 发布后没多久,就向投资人发了上市议案,说最快 6 个月完成港股上市。
6 月 ARR 已经到了 3 亿美元,K3 发布后又数倍增长。看起来是形势大好,上市时机成熟。
但换个角度看:算力这么缺,扩算力要多少钱?买卡、建集群、租机房、招运维团队,都是吞金兽。光靠一级市场融资够不够?IPO 融一大笔钱砸算力,可能才是支撑下一轮增长的关键。
模型能力追上来了,接下来拼的就是谁能把规模做上去。规模靠什么?靠算力。算力靠什么?靠钱。钱从哪来?上市。
这个逻辑链,大概就是月之暗面急着上市的真正原因。
结语
Kimi K3 是个好模型。2.8 万亿参数、开源权重、前端开发榜第一、价格只有海外巨头的三分之一——这些都是实打实的成绩。中国大模型能做到这个水平,确实不容易。
但 48 小时算力告急这件事,也给所有人泼了一盆冷水。模型能力的突破只是上半场,算力、基础设施、工程化、商业化,这些才是下半场的主战场。
算法可以快速迭代,架构可以快速创新,但算力不行。芯片要造,机房要建,网络要铺,电要供。这些都需要时间,需要钱,需要产业链的整体进步。
未来一两年,大模型行业的竞争焦点,会从"谁的模型更强",逐渐转向"谁的算力更足、谁的成本更低、谁的服务更稳"。
到那时候,真正的护城河,可能不是你有多少顶尖算法研究员,而是你手里有多少张 GPU。