7月17日,Kimi K3一出来,整个AI圈的情绪就很像数码圈看到“旗舰突然把价格打穿”那一刻:先是惊讶,接着开始扒底子。真正让人停下来看的,不只是2.8万亿参数、100万token上下文这些大数字,而是它不像一台突然冲出来的新机,更像一条两年前就埋好的技术路线,终于量产了。
素材里那张老照片,我觉得特别有意思。
2024年,北京办公室,一页PPT,一个箭头:Next-Token Prediction Scaling → Reinforcement Learning Scaling。这话放在今天听着很顺,放在2024年其实挺硬。那会儿行业主旋律还是继续堆预训练、堆数据、堆算力,谁把模型做大,谁就更像正确答案。杨植麟那页PPT的意思不是“不Scale了”,而是继续Scale,但把重心从“会接话”转到“会推理、会纠错、会多走几步再回答”。
这一点很关键。
因为大模型过去最强的地方,是把话说顺、把知识串起来;一旦碰到数学、代码、长链条任务,就容易在中间某一步拧巴。强化学习的价值,说白了就是把模型从“像人说话”往“像人解题”推一把。旁边再配上synthetic data和test-time compute,意思就更直白了:训练时别只喂现成文本,推理时也别急着秒回,该多想的时候就多花算力。
月之暗面这条线,其实不是K3才开始。
2024年11月,k0-math上线,当时就已经把数学推理单拎出来做实验场。为什么先打数学?因为这玩意儿最适合练RL,答案能验,对错分明,模型每走一步都有反馈。社区早期实测也很典型:难题能做,简单题有时反而绕一点。这种“愿意思考,但还没完全收住手”的感觉,老玩家一看就知道,方向对了,只是火候还在调。
再往前看,杨植麟的技术底子也挺统一。Transformer-XL解决的是上下文太短,XLNet解决的是预训练目标怎么更强。后来Kimi靠超长上下文被更多人记住,再往下走到数学推理、长程编码、多Agent协作,这条线从论文时代到产品时代,其实一直没断过。
这机器有点东西。
所以K3真正厉害的,不是单点参数有多猛,而是把几条路拧成了一股绳。公开资料里,K3是2.8T总参数的稀疏MoE架构,激活参数约104B,原生视觉,100万token上下文,还放出了开放权重。这些词别看很工程,翻成人话就是:它不是只想做个聊天模型,而是想做那种能吃超长资料、能盯住复杂任务、还能拉起Agent干活的“生产力底座”。
更有意思的是它的行业位置。
第三方评分把K3放到一个很微妙的坐标里:能力已经贴近前沿闭源模型,但单任务成本大约0.94美元,和更贵的头部模型相比,性价比非常能打。注意,这不是“便宜替代”,而是在能打的前提下,把使用门槛压低。这就像一台真旗舰,不是做丐版思路,而是把核心体验保住,再把上车价打到更多开发者能接受的区间。
我个人特别吃这一套。
因为开源这件事,过去很多时候容易停在“我也开放了”。但杨植麟在GTC那句判断我很认:Open models cannot be just open. They also have to be great. 开放不是标签,强才是门票。K3现在能搅动硅谷,靠的不是情怀,也不是一句“中国版谁谁谁”,而是它真的把token效率、上下文长度、Agent数量这三个维度往前推了一步。
当然,围绕创始人的评价一定会分裂。有人看见的是研究者气质,有人更在意商业野心。这个我倒觉得正常。做大模型到今天,哪还有纯粹的实验室神话,最后拼的都是研究判断、工程兑现和资源组织能力。真正值得记住的,不是谁人设更讨喜,而是2024年的那支箭头,到了2026年,居然真被做成了产品。
这比任何神话都硬。
如果你是普通用户,这事未必等于“立刻换主力工具”;但如果你是开发者、Agent工作流玩家、长文档重度用户,或者你本来就在找一个足够前沿、又不想被闭源生态彻底锁死的模型,K3这次确实值得认真看。它未必样样第一,但路线很正,手也够硬。
说到底,行业每天都在发新模型,真正稀缺的不是热闹,是把两年前PPT上的箭头,一步一步兑现出来的人。K3火,不是偶然。



⚠️ 文中信息整理自网络公开渠道,参数和价格口径可能会有变化,最终还是以官方发布和实际情况为准。