关注「AI前哨局」,不只介绍AI工具,也把真正能复现、能验收的方法交给你。
把一张乱Excel交给AI,最危险的结果不一定是它报错。
而是它顺利生成了一个“清洗完成.xlsx”,看起来整整齐齐,你却不知道它删了哪些行、改了哪些金额,又把多少个空值补成了自己猜测的答案。
表格能打开,不等于数据还能用。
所以这篇教程不教你一句“帮我清洗Excel”的万能提示词。
我们要完成的是一套可以检查的工作流:
先让Codex找问题,再由人确认规则;另存清洗结果,记录每一处修改;最后用行数、金额和公式做验收。
最终交付五个文件:
原始数据问题清单.md清洗规则.md清洗后数据.xlsx清洗前后对照表.xlsx验收报告.md
整个过程不覆盖原表,也不允许AI擅自删除记录。
这张测试表,故意放进七种常见问题
第一次练习,建议使用一份订单、客户或者费用明细表的副本。
表格可以包含订单编号、客户名称、日期、手机号、金额、负责人和地区等字段,再故意保留这些问题:
- 日期既有
2026-08-01,也有8/1/26和Excel日期序号; - 同一条订单出现两次;
- 金额中混入人民币符号、逗号和文本格式;
- 手机号被识别成数字,部分前导零已经丢失;
- 客户名称同时出现“前哨科技”“前哨科技有限公司”等写法;
- 负责人、地区或者备注存在空值;
- 某些本应为公式的单元格被手工数字覆盖。
不要拿唯一一份业务原表直接练习。
复制文件,放入一个新建的Excel清洗测试文件夹,再让Codex只打开这个目录。涉及客户隐私、财务明细或未公开经营数据时,应先脱敏,并遵守所在公司的数据使用规则。
开始前:免费用户用的是Codex里的GPT-5.6 Terra
OpenAI目前向ChatGPT Free和Go用户限时提供Codex,免费用户可以在Codex中使用GPT-5.6 Terra。
这不是普通ChatGPT聊天框里的GPT-5.6 Sol,也不代表OpenAI API免费。
打开新版ChatGPT桌面应用,从左上角进入Codex,使用ChatGPT账号登录,然后选择刚才建立的测试文件夹。
如果模型选项中能够看到GPT-5.6 Terra,就选择它。具体可用模型和额度,以账户实际显示为准。
第一轮:只检查,不允许修改
先把这段提示词发给Codex:
请检查当前文件夹中的Excel副本,但不要修改、覆盖、移动或删除任何文件,也不要创建清洗后的Excel。
逐个工作表检查:总行数、总列数、字段类型、空值、完全重复行、关键字段重复、异常日期、金额格式、手机号格式、客户名称写法,以及疑似被手工数值覆盖的公式。
对每类问题列出涉及的工作表、列名、行号、数量和示例。日期存在日月歧义时不要猜;手机号已经丢失前导零时不要补;公式只能标记疑似异常,不能自行恢复。
将结果写入“原始数据问题清单.md”,并在聊天中总结。等待我确认后再进行下一步。
这一轮的重点不是让AI马上动手,而是看它能不能把问题说具体。
“日期格式不统一”还不够。它应该告诉你哪一列、多少行、出现了哪些格式,以及其中是否存在无法判断的01/02/2026。
“有重复数据”也不够。它要区分完全重复行和业务重复。
两行内容完全相同,可以视为重复候选;但同一个客户下了两笔金额不同的订单,不能因为客户名称相同就删除一行。
第二轮:先确定清洗规则
看完问题清单后,不要回复“可以,继续”。
先把业务规则说清楚。
例如,订单编号是否必须唯一?客户名称以合同名称还是开票名称为准?空地区应该留空、标记待确认,还是允许从地址推断?日期采用北京时间还是原始时区?
然后发送第二段提示词:
根据已经发现的问题,生成“清洗规则.md”,但仍然不要修改Excel。
每条规则必须包含:目标字段、识别条件、处理方式、预计影响行数、无法自动处理的情况和验收方法。
默认规则如下:
-
- 不删除任何记录;完全重复行只标记为“重复候选”。
-
- 空值保持为空并标记“待补充”,不得根据上下文猜测。
-
- 日期统一为YYYY-MM-DD;存在日月歧义的日期保留原值并标记待确认。
-
- 金额移除货币符号和千位分隔符后转为数值,但必须保留两位小数。
-
- 手机号整列按文本保存;已经丢失的前导零不得自动恢复。
-
- 客户名称只按我确认的映射表统一,不能自行合并相似名称。
-
- 疑似被覆盖的公式只记录位置,不自动填回公式。
-
这一步看起来慢,却是整个教程最重要的一步。
AI擅长发现模式,但它不知道公司的业务定义。数据清洗不是把表格变整齐,而是让同一字段遵守同一套可解释规则。
第三轮:另存新表,记录每一次修改
确认清洗规则.md后,再允许Codex执行:
清洗规则已经确认,请开始执行。
必须保留原始Excel不变,将结果另存为“清洗后数据.xlsx”,不得覆盖原文件。
同时生成“清洗前后对照表.xlsx”。对每一个被修改的单元格记录:工作表、原始行号、字段、原值、新值、使用的规则和修改原因。重复候选、待补充、日期歧义和疑似公式异常也要单独记录。
保留原有工作表名称、表头、公式和基础格式。不要删除行,不要改变记录顺序,不要恢复无法确认的值。
完成后汇报输出文件、修改单元格数量和仍需人工处理的问题数量。
为什么一定要生成对照表?
因为一张一万行的表格,即使只改了两百个单元格,也不可能靠肉眼重新找一遍。
对照表相当于清洗日志。以后有人问“这个客户名称为什么变了”“这笔金额是谁修改的”,至少可以找到原值、规则和原因。
如果Codex只交付清洗后的Excel,却无法列出改动记录,这个结果不适合直接进入正式业务流程。
四类数据,最容易被AI改得很合理又很错误
日期。
01/02/2026究竟是1月2日还是2月1日,取决于原始地区和系统设置。没有外部依据时,正确动作是标记待确认,而不是选择一个“更像”的日期。
手机号和编号。
Excel经常把它们当作数字,自动去掉开头的零,或者用科学计数法显示。统一为文本可以防止继续损坏,但已经消失的数字无法凭空找回。
重复记录。
重复文件可以算哈希,重复业务记录却需要业务主键。订单编号相同可能是重复,也可能是更新记录;客户名称相同更不能直接合并。
公式。
某一格本该是公式却变成数字,AI可以通过相邻单元格发现异常模式,但不能保证原公式是什么。最稳妥的处理是标记位置,再由熟悉表格的人确认。
这些地方共同遵守一个原则:
能确定的自动处理,不能确定的明确暴露。
第四轮:让它证明自己没有改坏
最后发送验收提示词:
请对原始Excel和“清洗后数据.xlsx”执行只读验收,不再修改任何文件。
对比并检查:工作表数量、工作表名称、总行数、总列数、关键字段非空数量、唯一订单数、金额合计、公式数量、错误值数量和清洗前后对照记录数。
检查“清洗前后对照表.xlsx”是否覆盖每一个实际变化。随机抽查10条修改记录,核对原值、新值和规则。
将结果写入“验收报告.md”。任何无法解释的差异都标记为“验收失败”,不要使用“基本一致”等模糊结论。
验收时,至少盯住五个数字:
**总行数。**没有允许删除记录,行数就不应该减少。
**金额合计。**格式转换不应该让总金额发生变化。重复记录尚未删除时,也不要擅自去重后重算。
**公式数量。**如果清洗前有300个公式,清洗后突然只剩250个,说明某些公式可能被写成了值。
**关键字段空值数量。**AI不能为了让报表更漂亮,静默填满原本缺失的数据。
**实际修改数与对照表行数。**两者不一致,意味着仍有修改没有留下记录。
机器生成验收报告以后,人还要随机打开几条记录检查。这不是不信任AI,而是数据任务本来就需要抽样验证。
三个动作不要交给AI自动完成
第一,不要让它覆盖原表。
第二,不要让它根据“看起来相似”自动合并客户和删除订单。
第三,不要让它把清洗结果直接上传到正式系统、发送给同事或替换共享文件。
清洗和发布应该是两个独立动作。前者可以在测试目录自动完成,后者必须在人工验收后确认。
尤其涉及工资、财务、客户和医疗数据时,除了技术检查,还要遵守公司的权限、隐私和审计要求。
真正省时间的,不是少点几下鼠标
让AI清洗Excel,最诱人的想象是:上传文件,等几分钟,拿到一张干净表格。
但真正可靠的工作流不是“一键清洗”,而是把原本散落在人脑里的判断过程记录下来。
问题清单告诉你哪里不一致;清洗规则告诉你准备怎样处理;对照表记录实际改了什么;验收报告证明关键数据没有被悄悄改变。
这五个交付物加在一起,才是一项完成的任务。
所以,别让AI直接改Excel。
先让它证明自己看懂了问题,再允许它改副本;最后让它用数据证明,没有把表格改坏。
这才是免费GPT-5.6最值得普通人学习的地方:不是回答更聪明,而是把一件重复、繁琐但可以验收的工作,真正做完。
AI前哨局,关注AI产品、真实工作流和普通人可以直接复现的使用方法。
你手里最想清洗的是订单表、客户表还是费用表?欢迎在评论区说说。