Excel交给GPT分析前,先排除这3种“假数字”
把Excel上传给GPT,然后问“哪个产品利润最高”,几秒钟就能得到一段像样的分析。真正危险的不是它没有回答,而是它回答得很完整,你却不知道表格里有些数字根本不能直接计算。GPT确实可以处理常见的XLSX、XLS、CSV和TSV文件,也能根据表格生成汇总、比较和图表。但分析质量首先取决于原始数据是否结构清楚:列名明确、每行代表一条记录、数字确实是数字。最常见的情况,是金额从系统、网页或聊天记录里复制进Excel后,变成了文本。它可能带有空格、人民币符号、千位分隔符,甚至混入不可见字符。人在表格里看到“12,800”和“9800”都像金额,但程序可能把前者当字符串。此时求和、排序和平均值都可能遗漏它。上传前先做一个快速检查:选中金额列,看看是否存在靠左显示、单元格角标或公式无法参与计算的值。再让GPT先输出“无法识别为数值的行号、原值和原因”,不要直接让它给业务结论。同一列里同时出现“3.2万”“8600”“1.5万元”,人能理解,计算却需要统一口径。如果GPT没有先完成单位换算,它可能比较的是字符,也可能按自己推断的规则处理。更隐蔽的是百分比:有的单元格存储为0.18并显示18%,有的直接写入18。二者看起来都像“18%”,底层却差100倍。正确做法是要求它先建立数据字典:每一列的字段含义、单位、数据类型、允许范围和缺失值规则。只有单位统一后,再计算排名、增长率和异常值。不少业务表格会在每个月、每个地区后面插入“小计”,最后再放一行“总计”。如果把整张表直接求和,同一批数据就可能被重复计算。合并单元格、隐藏行、空白分隔行也会破坏“一行一条记录”的结构。GPT能帮助识别异常,但你要明确要求它先找出汇总行、重复行和不完整行,并说明哪些行被排除。最稳妥的顺序不是“上传—提问—复制答案”,而是“识别结构—列出异常—确认清洗规则—再分析—抽样复核”。“先不要给业务结论。请检查这份表格的字段、数据类型、单位、文本数字、重复行、空值、异常值、隐藏汇总行和可能重复计算的记录。先输出问题清单与建议处理规则;等我确认后,再按确认后的口径计算结果。每个结论请注明使用了哪些列、排除了哪些行,并给出可人工抽查的样本。”这段指令的价值不在于让答案更长,而在于强迫分析过程留下证据。真正可用的数据分析,不只是一个结论,还应该让你知道结论从哪里来、哪些数据没有被采用、怎样抽查。如果你正需要用GPT处理Excel、CSV或业务数据,可以通过下方服务号开始使用。