2026年7月,Kimi K3炸翻了整个海外AI圈
所有人都在讨论参数、架构、榜单,2.8万亿参数,百万级上下文,稀疏MoE,长程编码与Agent工作流社交平台上,从硅谷到中关村,工程师们像拆盲盒一样拆解着K3的每一个技术细节
但一个叫Max For AI的人绕开了榜单和分数的讨论
他翻出了两张拍摄于2024年的老照片
照片里,一个年轻人站在会议室大屏前,手持话筒,身后的幻灯片上只画了两个圆球、一个箭头,
左边写着“Next-Token Prediction Scaling”,右边写着“Reinforcement Learning Scaling”
箭头从左指向右。旁边还标注着synthetic data与test-time compute
这张PPT的标题是:“新的Scaling Law”



▲ Max For AI重新公开的两张2024年现场照片:杨植麟在月之暗面北京办公室讲解“下一代Scaling Law”
那天会议室里发生了什么
时间回到2024年末。
月之暗面内部邀请了一批朋友到北京办公室,参观他们当时最新的数学推理模型K0-MathMax For AI是被邀请者之一。
让他意外的是:那天讲课的人,是杨植麟本人
Max回忆道,杨植麟略过产品与商业,讲的是下一代Scaling Law
PPT上的核心命题极其简单粗暴,AI的下一轮扩展,不再靠“预测下一个词”往死里堆,而是靠强化学习打开新轴
这是什么意思?
简单解释:过去几年,所有大模型公司做的事本质上都一样,把互联网上的文字喂给模型,让它学会"猜下一个词"模型越大、数据越多、算力越猛,就猜得越准这就是Next-Token Prediction Scaling
但杨植麟那天画了一个箭头,指向另一种路径:让模型像人一样“试错” 做数学题?先试一步,判断对不对,错了就回来换一条路做代码?跑一下,看结果,不对就修改重来。奖励正确,惩罚错误,这就是强化学习(RL)Scaling
放在2024年,这是一种判断。
放在2026年,OpenAI、DeepSeek、Anthropic、Kimi,几乎所有前沿玩家,都走到了这条路上
"他像一个还在实验室里的PhD"
Max还注意到了别的东西。
"聊商业、聊融资、聊市场,他都很平静。但一聊到架构、训练方法、数据细节,整个人一下子就兴奋起来了,眼睛都是亮的,能一直不停地讲"
后来他们去杨植麟的工位看了一眼,
那里看不到独立办公室。 工位只是一个特别普通的位置,和周围的人没区别,桌上放着少量日常用品
这画面他记到现在。
杨植麟,1992年生于广东汕头,清华本科,卡内基梅隆大学博士他的学术代表作XLNet和Transformer-XL至今被NLP领域反复引用,两篇论文的核心问题恰恰都是:当序列变得更长,模型还能不能保持智能?
十年后,Kimi产品线上反复出现的“长文本”“百万级上下文”“长程任务”,像极了同一个研究者对同一个问题的持续执念
他博士导师Salakhutdinov后来接受Business Insider采访时回忆:大约2019年,杨植麟就倾向于相信,如果充分扩大规模,单一模型可以从自然语言提示完成多种任务,不必为每个任务单独建模
"那时候,这一信念并非所有研究者共享"
从箭头到论文:判断如何变成工程
▲ arXiv论文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》,把会议室里的箭头变成了可复现的训练配方
2024年11月,K0-Math公开亮相品玩、Global Times等中英文媒体记录了这一刻:一个强调强化学习和思维链推理的数学模型,会在解题时花更多时间规划、反思与重试初代测试数据显示,在中考到竞赛级的多个基准上超过当时可用的o1-mini与o1-preview
▲ 品玩报道:月之暗面发布k0-math数学推理模型
同期,杨植麟在36Kr英文访谈中的表态更加直接:"Scaling law没有失效,变的是'被缩放的对象'以前优先堆算力和参数;以后,重点是通过强化学习精炼推理。"
然后是2025年,arXiv上出现了一篇名为《Kimi k1.5: Scaling Reinforcement Learning with LLMs》的论文摘要开宗明义:预训练的next-token prediction受限于可用训练数据;RL打开了新的扩展轴,模型可以通过带奖励的探索扩大有效训练信号
会议室里的那个箭头,终于从幻灯片走进了可被同行阅读的方法论文
K3:路线图的"兑现时刻"
2026年7月,K3降临。



▲ Michael Guo的平行分析:K3的成功并非偶然,杨植麟在GTC演讲中已提出"三维scaling"框架
观察者Michael Guo指出:三个月前的英伟达GTC演讲上,杨植麟已经把下一阶段扩展具体拆成了三个维度,Token效率、上下文长度、Agent数量他明确表态:Kimi不打算靠训练更大的模型赢,而是投资底层机制,更好的优化器、训练稳定性、内存效率、长上下文架构、Agent集群
K3恰恰是这套论文的产品版本。
▲ "这就叫长期主义。当大家都在卷预训练数据的时候,人家两年前就认定RL Scaling是未来并死磕到底"
舆论撕裂:先知还是吹牛?
旧照放出后,评论区并不太平。
支持者高呼“长期主义”,赞叹工程师作为领导者的稀缺气质有人写道:非常严谨的技术型、有AGI梦想的大格局创始人,我非常相信Kimi能走得很远K3也只是一个开始。
▲ 熊猫校长Ming:技术型有AGI梦想的创始人,K3只是开始
但质疑者同样激烈。
有人更尖锐地指出:私下交流中,杨植麟给人的印象是"满脑子商业变现"在这位评论者看来,创业成功需要这种特质,这也比"实验室PhD"的抒情描述更有说服力
两种印象相距很远。
照片和幻灯片文字是可核验的视觉事实"整个行业都走上了这条路"属于概括,"K3并非突然变强"属于事后解释赞美与嘲讽也只是观点,均非公司声明
尾声:答案写在那张PPT上
让我们最后回到那间北京会议室。
桌上摆着瓶装水和咖啡杯,笔记本电脑散落在围桌上,墙上贴着办公场所常见的提示贴纸一个1992年出生的年轻人,站在大屏前,讲着他认为这个行业接下来十年最重要的一件事
台下只有普通听众,记者席与直播镜头均未出现
只有一个随手拍照的访客,以及一张从左指向右的箭头
两年后,当全世界都在讨论那个箭头右边的词时,你回头看,
领先之处,并不只在Benchmark第一
而是两年前没人相信的时候,你就已经在往那个方向烧钱了
K3今天取得的一切来自长期积累。答案,早就写在了那张PPT上。