先别看那2.8万亿参数。
先看一根箭头。
2026年7月,Kimi K3发布。前端代码榜从第18名直冲第1,官方随后宣布需求逼近算力上限,暂停新订阅开发者还在拆架构、跑测试,一张拍摄于2024年的办公室照片,突然被翻了出来
照片拍在一间普通会议室,并非发布会现场
杨植麟站在普通会议室里,手握麦克风身后的PPT只有一条极醒目的路线:
Next-Token Prediction Scaling → Reinforcement Learning Scaling
两年后再看,所有人都在问同一个问题:
Kimi K3的爆发,真的早就写在这张PPT上了吗?
▲ Max For AI发布的2024年到访照片。照片可核验的是PPT内容;“两年前写好答案”则是K3发布后的回顾性解读。
那根向右的箭头
据内容创作者Max For AI回忆,2024年,他受邀前往月之暗面北京办公室,参观当时最新的K0-Math模型
意外的是,亲自讲解的人是杨植麟。
他略过产品、融资和增长,重点讲大模型下一阶段该往哪里扩张
屏幕左边,是Next-Token Prediction,根据前文预测下一个token这是过去一轮大模型革命最核心的发动机:更多数据、更大参数、更多训练算力,把“下一个词”预测得越来越准
屏幕右边,则是Reinforcement Learning Scaling旁边还有两个词:
- synthetic data:合成数据
- test-time compute:测试时算力
翻译成人话就是:模型不能只靠“读更多书”变聪明,还要在解题、验证、搜索、调用工具的过程中,学会怎样把事情做完;遇到难题时,也可以投入更多推理算力,反复尝试、自我检查,甚至让多个Agent协作
这条路线并非Kimi独有。2024年下半年,OpenAI o1把“强化学习+慢思考”推入公众视野,DeepSeek、Anthropic等多家团队也沿着相近方向前进
旧照片的分量在于:当这条路线还只是行业判断时,月之暗面已经把它写进了内部分享
两年后,箭头长成了一台2.8万亿参数机器
2026年7月16日前后,Kimi K3落地
按照月之暗面官方披露,K3拥有2.8T总参数、100万token上下文和原生视觉能力,并被称为“首个开放的3T级模型”完整权重计划在7月27日前放出。
它采用稀疏MoE架构。可以把它想象成一座拥有896位专家的大楼:仓库极大,但每次处理任务,只请其中约16位“上班”因此,2.8万亿是总知识容量,并不意味着每次回答都要调动全部参数
K3还把能力重心压在了长程编程、研究和Agent工作流上:从GPU kernel优化、编译器搭建,到视觉反馈游戏、科研代码复现,目标是连续工作很久,完成一个项目
第三方信号很快出现。
Arena.ai公布,Kimi-K3以1679分登顶Frontend Code Arena,超过Claude Fable 5;相较Kimi-k2.6,它从第18名跃升至第1名,七个前端子领域拿下六个第一


▲ Arena.ai榜单:Kimi-K3从前代第18名跃升至第1名。需要注意,这是特定前端竞技场的结果,并不代表所有能力全面第一。
月之暗面也没有宣称K3已经击败所有闭源模型
但市场给出了另一种反馈:用户开始密集涌入
官方称,过去48小时需求已逼近现有算力极限为保障老会员体验,Kimi暂时停止新订阅,并准备把会员拆成通用会员与Code会员
▲ 热度从讨论进入基础设施:GPU容量、会员分层与服务稳定性,成为K3爆发后的现实考题。
一个坐在CEO位置上的“PhD”
旧照片重新受到关注,那张PPT和杨植麟本人都是原因
Max回忆,杨植麟聊融资和市场时很平静;一谈架构、训练方法和数据细节,整个人便兴奋起来他没有独立办公室,工位与普通员工放在一起,这些是到访者的现场印象,并非可以独立审计的公司制度事实,却迅速拼出了一幅“研究型创始人”的画像
这幅画像并非毫无来由。
杨植麟拥有清华计算机背景,博士就读于CMU语言技术研究所,参与的代表性工作包括Transformer-XL与XLNet前者试图让模型处理更长的依赖关系,后者重新探索预训练目标
从早期长文本Kimi,到K0-Math、K1.5、K2,再到今天的K3,一条线越来越清楚:
更长的上下文,更复杂的推理,更长时间的自主工作
K3发布前三个月,Michael Guo还从杨植麟的英伟达GTC演讲中概括出三条缩放轴:token效率、上下文长度、Agent数量
先别急着封神:一张PPT无法证明因果
故事讲到这里,很容易滑向“天才两年前预言一切”的神话
评论区也有人直接质疑:“又开始吹了。”还有人提醒,杨植麟同样高度关注商业化;把一位创业公司CEO写成只谈技术、不食人间烟火的博士生,本身就是浪漫化
这些质疑有必要。
照片能够证明的,是2024年的会议室里,确实出现过RL Scaling、合成数据和测试时算力
照片无法证明的,是K3的每一项能力都由这页PPT直接推导而来;更不能证明创始人不关心收入、融资和竞争
事实上,技术热情与商业敏感完全可以同时存在一个CEO如果只会讲论文,却无法获得算力、组织团队、建立产品闭环,再漂亮的Scaling Law也只能停在屏幕上
因此,这件事更接近于:
他很早选择了一条路线,并让公司持续为这条路线付账
当“前沿智能”变成文件,硬仗才刚开始
K3的爆红,也是一次商业压力测试。
开放权重可以迅速获得全球开发者,却不自动产生护城河权重被下载后,推理服务商可以接入,竞争对手可以研究,开发者也可以迁移
摆在月之暗面面前的问题是:Kimi Code、Kimi Work和API能否把模型能力变成稳定留存?
官方API定价,缓存命中输入每百万token 0.30美元、未命中3美元、输出15美元,展示了低价扩张的野心;而暂停新订阅,又暴露了另一面:智能越受欢迎,算力账单越真实
榜单第一是技术新闻。
GPU接近上限,才是财经新闻。
它一方面证明需求,另一方面也提醒市场:开放模型最终仍要面对推理成本、服务稳定性和单位经济模型模型是发动机,产品工作流才是把发动机接入现金流的传动系统
所以,答案真的两年前就写好了吗?
写了一半。
那张PPT写下了方向,但2.8万亿参数、1679分和发布后的服务器洪峰都不在其中
称它为预言书,会夸大这张照片能够证明的内容
它记录了一次早期路线选择。
每一条Scaling Law,最后都会落到资产负债表上:GPU、工程师、训练时间、产品耐心,以及在外界看不懂时,继续烧钱的勇气
两年后,当K3冲上榜首、订阅被迫暂停,那根从左指向右的箭头才突然拥有了戏剧性
未来从来不藏在PPT里。
PPT只能指出方向。困难在于用两年时间,把那根箭头烧成现实