K3发布的那天,所有人都在讨论参数、架构、榜单
但一个叫 Max For AI 的博主,发了两张旧照片,拍摄于2024年,北京,月之暗面办公室的一间普通会议室
照片里,一个年轻人站在大屏幕前,手持话筒屏幕略去了产品发布的华丽主视觉和商业模式图表,留下一张极其简洁的示意图:
左边一个球,写着 Next-Token Prediction Scaling
右边一个球,写着 Reinforcement Learning Scaling
中间,一支箭头。
标题四个大字:新的 Scaling Law
那是杨植麟。估值百亿美金独角兽的CEO,没坐在独立办公室里,而是像一个还没毕业的博士生一样,站在会议室给一小群访客讲他眼中的"下一代扩展定律"
两年后,这张PPT上的箭头,变成了整个行业的航向



▲ Max For AI 发布的原帖,底部可见两张2024年现场照片,屏幕上"Reinforcement Learning Scaling"清晰可辨
一场没人在意的内部分享
2024年11月前后,Kimi发布了数学推理模型 K0-Math品玩、Global Times等中英文媒体都有报道:这是一款基于强化学习的推理模型,对标OpenAI当时引来热议的o1系列,解题时会花更多时间规划、反思、再尝试
同期,月之暗面内部邀请了一批朋友到北京办公室参观Max For AI就是其中之一。
他本以为会看到产品demo、听到融资故事但走进会议室才发现,讲的人是杨植麟本人,讲的内容跟产品一个字没关
"他不讲产品,不讲商业。他讲的是下一代 Scaling Law。"
PPT上那支箭头的意思,用人话翻译就是:过去大模型变强,靠的是喂更多数据、堆更多参数;未来变强,靠的是让模型通过强化学习自己"想"、自己"试错"、自己"进化"
旁边还标着两个关键词:synthetic data(合成数据)和 test-time compute(测试时计算),前者意味着训练素材不再只靠人类语料,模型自身的推理过程也能成为"饲料";后者意味着智能不仅来自"出厂配置",还来自"使用时愿意多想一步"
放在2024年,这还是一项少数派判断
放在2026年,OpenAI、DeepSeek、Anthropic、Kimi,几乎所有前沿玩家,全都挤上了这条路
▲ KrASIA/36Kr英文访谈中,杨植麟明确回应"Scaling Law是否失效":定律仍在,改变的是"被缩放的对象"
"满脑子搞钱"还是"眼睛发亮的PhD"?
Max的帖子火了之后,评论区迅速分裂
一派是"长期主义"信徒。有人引用转发,写下四个字:这就叫死磕
▲ "当大家都在卷预训练数据的时候,人家两年前就认定RL Scaling是未来并死磕到底"
另一边,一条长评给出了不同的观察。ID为ArcadiaLin的用户写道:自己的师兄曾与杨植麟私下交流,留下的印象是他"满脑子只想搞钱和变现"评论者把这种商业意识视为创业成功所需,并认为这个解释"比那篇谄媚的文章更有说服力"
▲ "虚头巴脑"vs"实验室PhD",关于同一个人的两种截然对立的解读
哪个才是真的?
也许两个都是。创始人的面貌总是复杂。杨植麟的博士导师、卡内基梅隆大学教授 Ruslan Salakhutdinov 后来接受Business Insider采访时,概括他的四个特质:独立、原创思维、技术广度、愿意承担风险Salakhutdinov还回忆,大约2019年,杨植麟就倾向于相信,只要规模足够大,单一模型就能从自然语言提示完成多种任务,而那时,这个信念远未成为共识
一个愿意在少有人相信时坚持方向的人,和一个看重商业变现的人,可能根本就是同一个人的两只手
从箭头到论文,从论文到产品
如果只有一张PPT和一段回忆,那它确实只是"谄媚文章"
但关键在于,中间环节存在。
2025年,Kimi团队在arXiv发表论文 《Kimi k1.5: Scaling Reinforcement Learning with LLMs》摘要开宗明义:预训练的next-token prediction对扩展有效,但受限于可用训练数据;强化学习打开了新的扩展轴,使模型通过带奖励的探索来扩大有效训练信号论文报告了长上下文扩展、改进的策略优化,以及把长思维链能力"压缩"到短思维链模型的 long-to-short 迁移方法
▲ k1.5论文摘要,那支箭头从会议室PPT,走进了可被同行审阅的学术文献
那支PPT上的箭头由愿景走进了可引用的方法论
再往后,就是K3。2.8万亿参数、百万级上下文、稀疏MoE架构、长程编码与研究任务、多Agent工作流,海外AI圈为之震动Michael Guo在推文中指出,杨植麟三个月前在英伟达GTC大会上,就已经把下一阶段scaling拆解为三个维度:token效率、上下文长度、Agent数量他当时的原话大意是:不能只靠训练更大的模型,要投资底层机制,更好的优化器、训练稳定性、内存效率、长上下文架构和Agent集群



▲ "K3取得的成功并非偶然",GTC演讲中已预示了方向
一张2024年的PPT → 一篇2025年的论文 → 一次2026年的产品爆发
三个锚点连成一条线。你可以质疑其中的美化程度,但这条线有公开材料可循
领先发生在榜单之前
Max在原帖末尾把领先定义为:
"两年前没人相信的时候,你就在往那个方向烧钱了。"
这句话当然带有抒情成分。但它触及了一个AI行业正在经历的深层焦虑:当预训练数据逼近天花板,当所有人都在问"Scaling Law是否失效",下一个十倍增长到底从哪里来?
杨植麟两年前给出的答案是那支箭头今天,K3是那支箭头的第一次大规模兑现
而在一次深度访谈中,他还谈到另一层判断:推理能力强不等于Agent强;纯推理模型像"缸中之脑",缺少与真实世界的校验闭环;编码之所以先爆发,是因为测试可以自动判定,它只触到"指尖",距离完整形态仍远
K3只是指尖。
整只手还没有伸出来。
那张PPT留下的不安延伸到了未来:它关于今天的判断已经落地,余下的箭头还指向明天