2026年7月17日凌晨,一张排行榜截图在AI圈炸开了锅。
Kimi K3,以1679分登顶Arena前端代码竞技场第一。它起步的位置同样令人惊讶:同一份榜单上,它的前代Kimi-k2.6排名第18。
一夜之间,跨越17个名次,超越Claude Fable 5。
全球AI推特开始疯转但就在这片喧嚣里,一个中国AI从业者翻出了两年前的一张手机照片,那是2024年,他受邀参观Kimi北京办公室时,随手拍下的一张PPT。
没有人想到,那张照片上的一行字,是这一切的起点。
那张PPT,写了什么?
▲ 2024年内部分享现场:屏幕上清晰写着“新的Scaling Law:Next-Token Prediction Scaling → Reinforcement Learning Scaling”
画面里,杨植麟站在会议室的大屏幕前,穿着一件黑色长袖,手持麦克风。屏幕上是一个箭头,从左边的球体"Next-Token Prediction Scaling",指向右边的球体"Reinforcement Learning Scaling"。旁边标注着:synthetic data,test-time compute。
标题只有六个字:新的Scaling Law。
写下这件事的,是X用户MaxForAI。他在K3发布后重新翻出这段记忆,用中文写道,当时是2024年,他被邀请参观Kimi办公室,看最新的K0-Math模型演示。杨植麟亲自来到会议室,跳过融资进展和产品路演,直接开讲技术。
"一进入架构、训练和数据细节,他眼睛都是亮的,能一直不停地讲。"
两年之后,OpenAI、DeepSeek、Anthropic纷纷加大强化学习与推理侧扩展的投入,整个行业把"RL Scaling"当成新的咒语,那张PPT突然显得像一份预言。
2.8万亿参数,究竟意味着什么?
先说结果:Kimi K3是目前全球规模最大的开源模型之一,总参数量2.8万亿,激活参数约160亿,支持100万token上下文,原生多模态。
这些数字有多夸张?
GPT-4的参数量据估计约为1.8万亿。而K3,比它大了将近60%,还把完整权重放出来开源。
但月之暗面自己也很坦诚,官方博客明确写道:"overall performance still trails Claude Fable 5 and GPT 5.6 Sol"(整体性能仍落后于Claude Fable 5与GPT 5.6 Sol)。
这句话没有被媒体大量引用,却是理解K3的关键:它的目标,是率先把开源模型做到这个量级。
用杨植麟自己在GTC演讲里说的那句话:
"Open models cannot be just open. They also have to be great."(开源模型不能只是开放,还必须足够出色。)
这句话,把开源定义成了一种战略选择。


▲ Kimi官方公告:2.8T参数、百万上下文、Kimi Delta Attention架构
前端编程世界第一:一张排行榜刷屏AI推特
技术参数是写给工程师看的,但有一张图,人人都能看懂。
Arena.ai发布的榜单截图显示:Kimi-K3在前端代码竞技场七个子域中拿下六个第一,品牌与营销、参考设计、数据分析、消费品、模拟仿真、内容创作工具,唯独在游戏域输给了Claude Fable 5,屈居第二。


▲ Arena.ai宣布Kimi-K3以1679分登顶,超越Claude Fable 5,相比前代从第18跃升至第1
这张图很快就吸引了技术圈的目光
VentureBeat随即将其定性为"有史以来最大开源模型之一",并回溯了月之暗面的命运弧线:早期以超长文本处理建立声誉,被DeepSeek冲击后一度跌出活跃用户前列,再以K2系列全面转向开源,K3则是这场反攻的顶点。
从陪跑者到登顶者,用了不到两年
他看起来像一个还没毕业的PhD
技术报道之外,另一条暗流正在涌动
K3走红的同时,人们开始翻找杨植麟这个人。
1992年生,广东汕头人高中信息学竞赛,然后是清华,热能工程转计算机,本科拿了系里第一。2015年赴美,CMU博士,导师是Ruslan Salakhutdinov,Transformer时代最重要的一批研究者之一。博士论文期间,他参与写出了XLNet(NeurIPS 2019 oral)和Transformer-XL(ACL 2019),这两篇论文至今仍是自然语言处理领域的经典引用。
博士毕业后,他去了Google Brain,又在Meta做研究,然后2023年回国,创立月之暗面。
公司取名"月之暗面",灵感来自Pink Floyd的专辑《The Dark Side of the Moon》。
据报道,办公室会议室的名字,都是以摇滚乐相关词汇命名的。更早在清华读书时,他组了一支乐队叫Splay,取自数据结构"Splay Tree"(伸展树),自己担任主音和作词,歌曲《Daydream》《Bleeding》至今在音乐平台可以搜到。


▲ David Sun评价:杨植麟喜爱嬉皮士音乐与前卫摇滚,办公室以此命名
MaxForAI在帖子里写的那段细节,被反复转发:"他身上看不到典型创业演讲者的派头,像一名仍在实验室的博士生。谈融资与市场时他很平静,进入架构和训练细节后却停不下来。" 参观工位时,他坐在和同事相同的普通位置,周围看不出"百亿估值CEO"的外在痕迹。
导师的那封邮件,让全场沉默
K3发布后,英文世界出现了一个疑问:一个CMU计算机博士,为什么不留在美国?
疑问的背后,带着某种预设:他是否因无法留下才做出这个选择?
杨植麟的博士导师、CMU教授Russ Salakhutdinov亲自下场澄清了。他公开发帖写道:"存在大量误解" 他说,自己曾参与一封苹果高层发来的邮件,对方询问杨是否愿意加入苹果。在得知杨想回中国后,苹果的回复是,"北京也有办公室。"
杨植麟拒绝了
导师说,杨告诉他:"如果我不去至少尝试创办自己的公司,我会后悔一辈子。"
"I respect that. And I think he was right." ("我尊重这个决定。我认为他是对的")


▲ CMU导师Salakhutdinov:杨植麟有大量留美机会,是他主动选择回国创业
这段导师证词,在中文互联网上引发了另一种共鸣。MaxForAI随后写了一段分析,直击问题核心:
"以他的履历留在美国,最可能成为大厂顶尖科学家,但那是别人的公司,别人的判断。回来之后,他可以决定把多少算力和资金押在自己认准的方向上。"
这场冒险的重量,落在尚未取得广泛信任时,一家公司愿意向认定的方向投入多少资金。
旧PPT的震撼,来自它留下的现场记录
现在,让我们回到那张照片
为什么一张2024年的PPT截图,会在2026年引发这么大的反应?
因为这是一张事前留下的原始记录
在AI圈,"我们早就预见到了"是最廉价的话术。创业公司路演PPT里,"三年前我们就在做的事"这句话,几乎每家都有。
MaxForAI的那张照片来自访客手机,公司PR并未为画面做准备。背景里有矿泉水瓶、纸杯、前排听众的MacBook,照片里还有"京东东站"的提示牌,留下了当时的现场细节。
而PPT上那个箭头,从"Next-Token Prediction Scaling"指向"Reinforcement Learning Scaling",写于2024年。那时候,RL Scaling还像是一种偏激的判断。
两年后,它成了整个行业的共识



▲ 核心帖文:MaxForAI重述2024年北京办公室参观,配两张现场原图
Michael Guo在K3发布后呼应道,三个月前杨植麟在英伟达GTC大会上的那次演讲,"也像是一个博士生在讲课题",那时他已经阐述了下一阶段scaling的三个维度:token效率、上下文长度、agent数量。关注点落在底层机器的扎实程度上:更好的优化器、更稳定的训练、更高效的内存管理、更长的上下文架构、更大规模的agent集群。
K3,就是那套论题的产品化答案
那一刻,我们在目睹什么
一个模型发布,何以变成一次集体寻根?
部分原因是时机DeepSeek在2025年初引起广泛关注,其后海外AI圈对新的开源模型保持着更高关注。Kimi K3到来时,受众已经对又一次榜单变化有了心理准备。Arena榜单、VentureBeat头条、CNN解释性报道,形成了一波接一波的信息浪头。
那张2024年的旧照片又给这条新闻增加了可核对的先见性:当时的技术判断有记录可查,与两年后的产品一一对应。
微博上出现"90后清华天才"的热搜词条,有人评论"未来属于天才,与普通人无关",带着一种虚无的酸涩。这种情绪本身,也是故事的一部分:当一个同龄人用两年时间兑现了两年前的预言,旁观者的反应,往往比主角更能说明时代的气氛。
科技记者张小珺(@zhang_benita)在K3上线当天,重新回链了自己K2时期与杨植麟的播客访谈,感叹"一年间变化之大"。
▲ 记者张小珺:K3发布时,重新回链K2时期的播客访谈,感叹一年来的剧变
MaxForAI在帖子结尾将领先归结为一次早于共识的投入:两年前尚无多少人相信时,杨植麟已经把资金投向了那个方向。
完整权重,官方计划于2026年7月27日开放。
届时,这场由一张旧照片点燃的讨论,才算迎来尾声,或者,下一章的开始。