我朋友前几天跟我吐槽了一件事。
他们公司技术部门最近多出一条考核:统计每个人的 Token 使用量,用得少的,要影响绩效。
具体到什么程度?Claude 的 Max 套餐,必须用满 50% 额度以上,API 另算。
技术那边怨声载道,因为真的有人就是用不完,活就那么多,你让他往哪儿用?
我第一反应是想笑——这年头还有人发愁 Token 用不完?随便干点啥不就见底儿了?甚至有点儿羡慕:起码公司是真掏钱买了。
可笑完,50%这个数字让我陷入了思考。
这是一个非常具体的数字。它具体到像是有人认真算过、讨论过,最后觉得至少比“大家多用用 AI”靠谱。
但正是这种具体,让人很不舒服,这 50%,到底在衡量什么?
AI 用起来了,然后呢?
我其实能理解这家公司。
现在很多公司推 AI 落地,最先碰到的不是投资回报,不是效率提升,是一个更原始的问题:员工不用 AI。
老板买了账号,开了权限,组织了培训,最后发现大家还是该怎么干怎么干。
那怎么办?总得先抓一个数字。
Token 就是那个最容易抓住的数字。后台可见,可以统计、可以排名、可以写进绩效。相比“你有没有真的改变工作方式”,它至少真实发生过。
所以这个逻辑有它的道理。企业推 AI,第一步确实是先让人用起来。这没毛病。
问题是,“用起来”一旦变成一个指标,它会悄悄滑向另一件事:证明我用过。
前不久另一家公司,员工述职。PPT 做得挺认真,讲完以后老板第一句话是:“你这个是自己做的还是 AI 做的?”员工说,自己做的。老板脸就沉了。
一家在后台盯 Token,一家在现场盯 PPT。用量不够说明你没跟上,没用 AI 说明你没转变。
公司把员工往 AI 那边推,心里想的是同一句话:用起来,就是进步。
我也信这句话的一半。一个新工具,大家连打开都不打开,后面的所有想象都不存在。
但另一半问题是,AI 用起来了,然后呢?
米哈游一夜烧掉了 200 万
这个问题在米哈游那个案例里,突然变得更清楚了。
今年 5 月,米哈游《崩坏》系列 AI 技术负责人郑银河,在阿里云峰会上分享过一件事:团队为了测试多 Agent 协作,搭了几十个 Agent 一起跑。下班以后忘了设置消耗上限,Agent 自己连续跑了 13 个小时。
烧掉了价值 200 万人民币的 Token。
这个数字放在前面的 50% 配额旁边,就显得有点微妙。
一边是公司担心员工用得太少,想办法把 Token 用量拉上去;另一边是 Agent 在没人盯着的时候,自己就能跑出一张很夸张的账单。
我不是说 AI 自己运行不对。恰恰相反,未来很多 AI 落地,就是要让 Agent 自己去跑任务,人不用一直守在旁边。
但米哈游这个例子提醒我的地方在于:如果目标没看住,边界没设好,AI 也会非常努力地“工作”。它会一直跑,一直调用,一直消耗 Token,最后给你留下一张很贵的账单。
所以问题不是“有没有人在用”。
问题是,只看 Token 的时候,我们分不清楚:AI 到底是在帮人推进工作,还是只是在系统里空转。
所以,我们并不能把 Token 用量,直接当成 AI 使用程度来看。
更准确地说:Token 能证明 AI 被调用过,但不能证明它真的产生了价值。
88%的公司用 AI,只有6%的公司赚钱
那不看 Token,看产出?
听起来更靠谱。但这边的数字也没好到哪儿去。
麦肯锡去年一项调查里有个数字让我印象很深:88% 的公司说已经在用 AI,64% 觉得 AI 在推动创新——但一层层筛下去,能说清楚利润影响的只剩 39%,真正看到显著回报的,只有 6%。
也就是说,“我知道大家在用 AI”和“我知道 AI 值多少钱”之间,隔着一条很深的鸿沟。
不止如此。Uber 的例子更直接。
他们今年很早就用完了原定全年的 AI 预算。Uber 总裁兼 COO Andrew Macdonald 后来承认,公司内部的 AI 使用指标增长得非常快,但“目前还无法在这些数据和真正交付给用户的有用功能之间,建立清晰的联系”。
AI 或许确实让团队交付了更多东西。
但问题是,这些指标很难直接回答一个更朴素的问题:用户到底有没有因此得到更好用的功能?
如果这个问题回答不上来,钱就不好花了。继续买更多 Token,还是多招几个人,哪个更划算?公司迟早要面对这个比较。
你看,问题绕了一圈又回来了。
你用 Token 衡量,可能会奖励空转。
换成 ROI 衡量,又会发现很多变化暂时折算不成利润。
那是不是因为 AI 太新?再过两年,方法成熟了,指标就清楚了?
5000 个客服,藏着一笔算不出的账
我也想过这个解释。但后来发现,不是“新”能解释的。
美国国家经济研究局做过一个实验。5000 多名客服用上了 AI 助手——不是替他们干活,是在聊天时实时给建议。经验最少的那批人,每小时能多解决 35% 的问题。系统偶尔挂掉的时候,用过 AI 的人还是比没用过的人做得好。
老员工的经验通过 AI 过了一遍,一部分留在了新人身上。这个实验发表于 2025 年,AI 已经足够好了。
但接下来的问题才是难的:这种变化,到任何一家公司的后台去看,你看不到。一次投诉没发生,它值多少钱?一个新人少走了几个月的弯路,该算在谁的账上?
你会发现,这跟 AI 新不新没关系。是知识工作本来就这样。
一个工程师花半天教新人,自己的代码提交量下去了,团队以后少踩十个坑。一个产品经理花一周琢磨方向,什么文档都没出,后面半年的路是那周想清楚的。工时表只能告诉你交了多少代码、关了多少工单——这些说明一个人干了什么,不说明干成了什么。
AI 不过是让这个老问题变得更难忽视了。
留下痕迹,就是用好了吗?
回到我朋友那边。
他们公司的技术还在为用不完 Token 发愁。老板可能正盯着后台,看谁这个月又没达标。所有人都默认:数字往上走,AI 就算落地了。
但米哈游那 200 万说明,数字往上走也可以是空转。Uber 的 COO 说明,指标涨了跟用户得到的东西可以没有关系。
50% 和 200 万是同一件事的两面。一边焦虑用得太少,一边震惊烧得太多。
但两边盯的都是同一个东西:痕迹。Token 用了多少,PPT 是不是 AI 做的,Agent 跑了多少小时——这些都是痕迹。
只是没人问过:留下痕迹,和真的用好了,是一回事吗?