为什么 AI 写的 Excel 公式,看着对,一算就错?
- 2026-09-22 12:22:12
周三下午三点,你把那张 2000 行的销售表丢给 AI,让它加一列"按区域算同比"。它回得飞快,公式长得像模像样,IF 套 SUMIFS,结尾还贴心地补一句"记得下拉填充"。😵
你复制、粘贴、双击填充。表格里瞬间冒出一排 #VALUE!。
你开始自我怀疑:是列名写错了?是版本太老?还是它在糊弄我?
它没想糊弄你。它只是从头到尾都没有"算"过。🧊
AI 写的公式,本质上是"像公式的东西"
大模型是一台文字接龙机器。它见过海量公式,知道 SUMIFS 后面通常跟三个参数,知道括号要配对,知道你讨厌辅助列。所以它能吐出一个看起来完全合理的公式。
问题在于,它写出公式之后,不会自己代入数据跑一遍。
卡内基梅隆大学 Gao 等人在 ICML 2023 发表的 PAL(Program-aided Language Models)论文里,把这件事拆得很清楚。他们的做法是:让模型负责把问题翻译成 Python 代码,真正的计算交给 Python 解释器。结果在 GSM8K 小学数学题上,直接作答 19.7 分,思维链 65.6 分,PAL 72.0 分。
最有意思的是消融实验那张表。研究者做了一个变体:同样让模型写代码,但不让它调用解释器,让模型自己"模拟"着把代码执行一遍。得分直接掉到 23.2,几乎退回"不做任何推理"的基线水平。
论文对这一现象的解释是:模型可以非常擅长写出解题计划,但在真正执行计划这件事上并不可靠(论文原文用的是"reinforces our hypothesis",属于作者基于实验提出的假说)。打个比方,它像一个背下了全部菜谱、但从没进过厨房的人。步骤写得比谁都清楚,火候全靠蒙。
你的表越乱,它错得越狠
如果只是"算术不靠谱",多检查几遍也能兜住。但表格任务的真实难度,比想象中大得多。
中国人民大学、清华大学与智谱的研究者做了一个专门针对真实表格的测评集 SpreadsheetBench(NeurIPS 2024 Datasets & Benchmarks Track,Spotlight)。数据很实在:912 条题目全部来自真实 Excel 论坛的用户提问,配 2,729 个测试用例,用类似在线判题的严格方式打分。
结果:4 位 Excel 专家的人类成绩是 71.33%,当年的最强模型 GPT-4o 只有 18.35%,Excel 里的 Copilot 大约是 20%。人类的通过率是 AI 的三到四倍。
同一份论文还给了分组数据,这组数字才是真正扎心的地方(以下均为 GPT-4o 的通过率):
单张工作表 21.12%,多张工作表 13.71% 标准表格 19.50%,非标准表格 16.95% 行数不超过 50 时 20.63%,超过 50 行时 11.50%
你的表越像"真实世界里的表",也就是多表混排、表头不规整、行数很长,它就越容易错。
论文里还有一个值得记住的观察:把评测标准从"部分分"改成"整题全对"之后,所有模型的成绩都会掉一截。这说明模型给出的解法经常是只对当前这份数据有效,数据一变就不成立了。你遇到的"换一批数据就崩",正是这个现象。
把文件真的交出去,成绩能涨一截
OpenAI 在 2025 年发布 ChatGPT agent 时,附录里公开了同一份基准上的对比成绩(厂商自测数据,未经同行评审,参考价值有限但方向值得看):
GPT-4o:18.35% Excel 中的 Copilot:20.00% ChatGPT agent:35.27% ChatGPT agent 拿到 .xlsx 文件后:45.54% 人类专家:71.33%
同一套模型,多给一个原始文件,成绩涨了约 10 个百分点。它不需要你描述表格长什么样,它需要真的看到那张表。
至于为什么给文件就有用,合理解释是模型能拿到真实的单元格坐标与结构,不用靠你那段文字描述去猜。这一条属于解释性推断,论文没有单独做归因实验,目前尚无定论。
立刻能用的做法:四步验收法
第 1 步:先给文件,再提要求。🗂️
把表格拖进输入框,或者用 @ 引用这个文件,不要用文字描述"我有一张 2000 行的表,第一列是日期,第二列是区域"。在 WorkBuddy 里,也可以点输入框左下角的"选择工作空间",指定这个表所在的目录,让它基于该目录读取处理。
第 2 步:一次只要一件产物,并且要它交出三样东西。✍️
公式(或脚本)、在 3 到 5 行自造小样例上的验算结果、以及一句"什么情况下会失效"。只要它写出验算过程,你就能一眼看出它是真的代入算过,还是只在背公式。
第 3 步:复杂计算走脚本。🐍
涉及多表匹配、跨 sheet 汇总、按条件去重的活,让它用 Python 算完直接写回文件,别让它在几十行长的公式里手推。这就是 PAL 论文的核心思路:把"算"交给解释器,把"翻译需求"留给模型。
第 4 步:看变更,再决定要不要接受。🔍
在 WorkBuddy 右侧结果区的"变更"视图里,可以查看本次任务修改了哪些文件、每个文件改了什么地方。先核对改动的单元格范围对不对,再决定要不要覆盖原表。
三个注意点:
合并单元格、双行表头、一个 sheet 里躺两张表,这些结构在测评里的错误率明显更高,动手前先用一句话交代清楚。 不要让 AI 猜列名。列名里有空格、换行、隐藏列、同名不同表,都要提前说明。 第一次别在原表上直接改。先复制一份副本,把它当作工作空间,出错了也不会掉数据。
你用 AI 写公式踩过哪种坑?是多算了一行、少算了一列,还是引用错了 sheet?评论区留一个,我把高频的整理成下一期的排查清单。👇
#AI提产 #WorkBuddy #Excel技巧 #办公效率 #AI工具 #表格函数 #职场提效 #AI避坑 #数据分析 #效率工具