所有人都在问:Kimi怎么突然就这么强了?
答案,可能藏在一张两年前拍下的照片里
2026年7月,当Kimi K3以2.8万亿参数、百万级上下文、稀疏MoE架构横扫社交媒体的时候,一个叫Max For AI的博主,默默翻出了手机相册里两张旧照,拍摄于2024年,月之暗面北京办公室的一间普通会议室
照片里,杨植麟站在大屏前,手持话筒。屏幕标题四个大字:“新的 Scaling Law”
画面中央,一个箭头从左侧的球体指向右侧,从“Next-Token Prediction Scaling”,直直地射向“Reinforcement Learning Scaling”旁边还漂着两个关键词:synthetic data,test-time compute
这场分享设在普通会议室里,桌上散落着矿泉水瓶和咖啡杯,现场没有发布会式的聚光灯与倒计时这张幻灯片,精准地预告了接下来两年整个AI行业的走向



▲ Max For AI重新公开的两张2024年现场照片,屏幕上清晰可见“新的Scaling Law”路线图
一场“不讲产品”的内部分享
故事要从2024年秋天说起。
那时候Kimi刚上线一周年,月之暗面发布了k0-math,一个专攻数学推理的模型,号称在高考、考研等基准上超越了当时公开可用的OpenAI o1-mini和o1-preview媒体的关注点全在分数:“中国版o1来了!”
但Max For AI那天看到的,完全是另一个画面
他受邀到月之暗面办公室参观最新的K0-Math,创始人杨植麟亲自做了一场技术分享分享跳过产品演示和商业话题,主题落在“下一代Scaling Law”上
一个估值数十亿美金的独角兽CEO,站在会议室里像博士生答辩一样,一页一页地翻幻灯片,讲为什么预训练的“下一个词预测”正在逼近天花板,为什么强化学习才是打开新扩展轴的钥匙
Max回忆说,聊到商业模式时杨植麟语气平淡,但一切换到架构、训练和数据细节,眼睛就亮了他的工位也很普通,就在开放办公区里
箭头背后的判断
那张幻灯片上的箭头,放在2024年,其实是一个相当大胆的判断
让我用人话解释一下:
当时AI圈的主流打法还是“堆料”,更多数据、更大模型、更多算力,把预测下一个词这件事做到极致这叫Next-Token Prediction Scaling,也是GPT系列从3到4一路走来的核心逻辑
但杨植麟在那间会议室里画了一个箭头,指向另一条路:Reinforcement Learning Scaling他想表达的是,继续扩大预训练数据之外,还可以让模型通过试错和奖励学习推理:做对了奖励,做错了惩罚,如同训练一个会思考的学生
旁边标注的synthetic data(合成数据)和test-time compute(测试时计算),则进一步说明了配方:训练数据可以由模型自己生成思考过程来补充;推理时舍得多花算力去“想一想”,比单纯把底座做大更有效
2024年,这还是一个“判断”。2026年,它已经成了行业共识。
▲ 2025年发布的k1.5论文,将会议室里的箭头变成了可引用的工程方法论
从PPT到论文到产品:一条肉眼可见的线
如果说那张幻灯片是起点,那接下来的两年就是一场公开的“交作业”过程
2025年初,Kimi团队在arXiv上发布论文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》摘要开宗明义:预训练的next-token prediction虽然有效,但受限于可用训练数据;强化学习打开了新的扩展轴。论文报告了长上下文扩展、改进的策略优化,以及一种叫long-to-short的技巧,把长思维链的能力迁移到更短、更快的模型里
同一时期,杨植麟在英伟达GTC做了一场公开演讲,把“下一阶段scaling”拆成了三个维度:token效率、上下文长度、agent数量他明确说:不打算靠训练一个更大的模型来赢,而是投资底层机制,更好的优化器、训练稳定性、内存效率、长上下文架构和agent集群



▲ 观察者Michael Guo将GTC演讲与K3产品特征逐条对照
然后,K3来了。2.8万亿参数的稀疏MoE、百万token上下文、长程编码与研究任务、多agent工作流,几乎是把过去两年每一场演讲、每一篇论文里说过的话,变成了你能用的产品
赞美与骂声齐飞
旧照片一经放出,评论区瞬间炸开。
捧的人把它当成教科书案例。“这就叫长期主义”,一位网友写道,“当大家都在卷预训练数据的时候,人家两年前就认定RL Scaling是未来并死磕到底”
▲ “长期主义”成为支持者最常用的关键词
另一位直接封神:“非常严谨的技术型有AGI梦想的大格局的创始人,K3也只是一个开始”还有人感慨:“工程师作为领导者,对职业经理人是降维打击”
批评者的语气也很尖锐。有一条长评转述了较早的交流印象:杨植麟看重商业变现,而这种特质可能有助于创业评论者认为,这个角度比纯粹的“实验室PhD”形象更有说服力
▲ 批评者认为,商业变现导向的人物形象更有说服力
评论区出现了两种人物画像:一种是纯粹的技术信仰者,另一种是精明的创业者哪一种更接近真相,现有材料不足以下定论
那个箭头为什么重要
让我们从情绪中抽身,回到幻灯片本身:它到底有多少“预测”的含金量?
先说强的一面。杨植麟的学术底色确实支持长期投入这件事他的博士导师、深度学习先驱Salakhutdinov后来接受Business Insider采访时回忆:大约2019年前后,杨植麟就已经相信“只要规模足够大,单一模型就能从自然语言提示完成多种任务”,这在当时并非共识从Transformer-XL到XLNet,他对长依赖建模的执念也一脉相承,后来Kimi产品线里反复出现的“长文本、百万级上下文”,也延续着同一个问题意识
再说弱的一面。这张幻灯片的精确日期、文件性质和听众范围均未公开 Max For AI的到访记录属于第一手材料,同时也带有个人观察的主观性,目前只有这一来源还应看到,AI圈时常会在模型登顶后翻出某条旧推文或旧PPT,说“他们早就知道了”
这份材料的中间环节相对完整:2024年的幻灯片→2024年底的k0-math公开发布→2025年的k1.5论文→GTC公开演讲→2026年的K3几个节点连成了一条可追溯、可验证的技术路径
箭头从左指向右。两年过去了,整个行业都站到了箭头的右边
这里记录的,是一个判断被执行、被验证、被放大的过程那间普通的会议室、开放办公区里的工位、那些散落的矿泉水瓶,反而比任何精心布置的发布会舞台,更能说明一件事,
有时候,最重要的决定,就是安静地写在一页PPT上