做了十年数据分析,最磨人的从来不是"想清楚要看什么",而是把一份脏数据收拾干净。
去年这时候,业务方甩来一张按月份拆的 12 个 Excel,列名对不上、日期混着两种格式、还有几百行重复。我得手动打开、筛选、 union、改格式,一下午就没了。今年我把一份同样结构的脏数据丢给 WorkBuddy,从体检到出报告,几分钟。
不是模型突然变聪明了,是"脏活流水线"这件事,终于能交给它了。
今天实跑一遍,把真实数字摊开给你看
我构造了一份真实业务结构的脏销售数据:2 万行有效记录,故意混进了几类真实场景里最常见的脏点——
- 日期列两种格式混排(2026/1/5 和 2026-01-05):全表都有
以前我得先肉眼翻一遍才知道"这表有多脏"。现在第一步让 AI 做"数据体检",它直接回报:总行数多少、哪些列有空值、日期有几种写法、重复多少——相当于动手前先把战场侦察清楚。
体检完才清洗。我下的指令很具体:"统一日期格式为 yyyy-mm-dd、'未知'和空值单独标出来、删掉完全重复行、销售额超 100 万的打异常标记。"一条指令,它把五步清洗跑完,生成一份干净表和一份清洗报告:处理了 312 行重复、47 行缺失销售额、2870 行空客户经理、157 笔异常大单,去重后剩 2 万行有效记录。
接着分析。我让它"按产品汇总销售额和占比、按区域看分布、拉月度趋势",它算出有效销售额合计约 12.56 亿,华南区最高(约 2.74 亿),2026 年 1 到 7 月逐月可追。最后一步直接出了带图表的 HTML 报告——饼图看产品占比、柱状图看区域、折线看趋势,打开就是能发的成品。
脚本执行本身不到 1 秒;但从我下指令、它出计划、我确认、它跑、我复核,真实体感是几分钟。这跟腾讯云开发者社区里两位开发者的实战记录对得上:有人用 WorkBuddy 把 5 万行脏数据 4 句指令几分钟变报告,有人把周报流程从 2–4 小时压到 1–3 分钟,自述效率提升约 300%。
但有个前提:AI 干的是"执行",不是"定义什么叫对"
这次能跑通,是因为我下指令时把口径说死了——"超 100 万算异常""空值标未知不删除""日期统一成这一种格式"。如果我不说,它就会用自己默认的口径,结果可能对、可能差一截,你还没察觉。这恰好是我一直强调的那句话:模型负责把活干出来,人负责定义什么叫对,在关键节点把一道闸。
落到日常,我给三个动作
第一,给口径再动手。清洗前先写清楚"什么算异常、空值怎么处理、日期用哪种格式",别指望它猜你的业务规则。
第二,不可逆不自动。删数据、覆盖原表这种动作,让它先出预览、你确认了再执行。脏数据最怕"一键清完发现清错了"。
第三,留回放。让每一步产出可复现的脚本和中间结果,哪天数对不上,能倒回去查是哪步的锅。
我跑的这份是构造的演示数据(固定随机种子,结果可复现),不是某家公司真账——这点不藏着。但流程是真实的:任何一份结构类似的脏 Excel,照这套指令都能跑。
工具是杠杆,深度实践才是护城河。WorkBuddy 把"收拾脏数据"这根杠杆加长了,但杆子那头撬的,还是得是你想清楚的东西:这份数据要回答什么问题、用什么口径才算对。