这份 PPT 提纲看起来很完整:有数据、有结论、有下一步。但我仍然删掉了 1 页,并补回两个模型漏掉的边界。
原始任务是把 9 条零散材料整理成 6 页。模型给了 7 页,固定结构检查通过 7/12 项。它没有编造新的核心数字,却漏掉“下一场是否收费”尚未决定,也没有完整解释“约 220 人”与最终 218 人的关系。
这是一组完全虚构的模拟材料,不对应真实公司、人员或活动。下面只复盘这一份模型原稿与人工修正版之间的差异,不把一次结果外推成模型能力。
先把材料分成四种状态
原始文件只有 9 段,混在一起读很容易把不同可信度的句子当成同一种事实。我先按用途分层:
| | |
|---|
| 报名 320、去重入场 218、完成观看 176;渠道 132/108/80 | |
| | |
| | |
| | |
这一步的价值不在于把文字变漂亮,而是先给每句话绑定一个权限:哪些可以做指标,哪些只能保留为背景,哪些必须继续讨论。
模型抓住了主漏斗,却多写了一页
我要求模型输出 6 页,使用固定的 S1-S9 材料,并在每页保留来源片段。它保留了最终报名、入场和完成观看三组数字,也保留了三个带负责人和截止日期的行动项:
- 技术 C 与运营 B:08-20 完成音频检查清单。
但它最后生成了 7 页,而不是要求的 6 页。固定验收脚本的 12 项检查中,只有 7 项通过。这里的 7/12 只是这一组模拟材料、一次本地 qwen2.5:7b 运行的结果,不是模型的通用准确率。
表里合并展示了两个相关的嘉宾检查项,因此是 11 行;底层验收脚本仍按 12 项计分,其中“嘉宾不进行动”和“嘉宾留在待讨论”分别通过。
真正危险的是两个被漏掉的边界
第一,模型没有把“下一场是否收费”保留为未决事项。它写出了复盘和行动,但把一个还没有结论的问题挤出了结构。读者看到“下一轮怎么做”时,可能误以为收费方案已经确定。
第二,模型没有完整结构化第二组数字冲突:主持人口头说“约 220 人”,最终去重入场是 218 人。它保留了 218,却没有像处理“约 300 → 320”那样明确说明“约 220”只是近似记录。
这两处看起来都只是少写一句话,实际却改变了信息的权限。一个把未决变成了已定,一个把近似数变成了无须解释的背景。
人工修正后的 6 页怎么排
- 先交代边界:这是公开线上分享会的模拟复盘,所有数字都是虚构测试数据。
- 再做材料分层:最终事实、近似口径、未决事项、无责任人想法各自放在对应位置。
- 单独展示最终漏斗:320 报名,218 去重入场,176 完成观看;“完成观看”定义为看到结束前 10 分钟以内,不等于全程观看、转化或满意。
- 展示渠道但不越界:公众号 132、社群 108、转介绍 80。没有成本数据,所以只能说报名量不同,不能下“性价比最高”的结论。
- 把反馈和决策拆开:模拟反馈 68 条中,49 条认为案例有用、12 条认为开场偏慢、7 条提到短暂音频问题;保留两个案例、开场缩到 8 分钟是已决定,下一场是否收费仍未决定,邀请嘉宾仍是待讨论。
- 最后只放有条件的行动:每项行动都带负责人和截止日期;没有这三个字段的想法不放进时间线。
我用四列验收,不凭“读起来顺”放行
下一次处理材料时,我会先把每个句子落进一行记录,而不是直接让模型写页标题。最低限度保留以下四列:
内容|状态|采用值或结论|来源 报名大概300人|近似口径|不进入正式指标|S3 最终报名320人|最终事实|320|S2 下一场是否收费|未决定|不得补结论|S7 上传回放|明确行动|运营B,08-15|S8
第一步,查数字。同一指标出现两个值时,先找“最终导出、去重后、已确认”之类的口径词,再把未采用值和原因留在冲突字段。本次采用 320 而不是约 300,采用 218 而不是约 220。
第二步,查状态。搜索“决定、暂定、未决定、建议、希望”等词。正文中的“下一场是否收费”只能落在未决定;“邀请嘉宾”没有确认结论,只能落在待讨论。
第三步,查行动。只有动作、负责人、截止日期三项同时存在,才进入最后一页时间线。本次三项行动满足条件;邀请嘉宾缺三项条件,不进入。
第四步,查硬约束。核对页数、每页来源、所有最终指标和所有否定表达。程序化检查发现 7 页后,不能通过合并小字来掩盖,而要重新决定每页只回答什么问题。
这份修正版最终保留 6 页,并用 slides_test.py 检查画布溢出;6 张渲染图也逐页看过,没有发现标题换行错误、遮挡或裁切。这些检查只能证明文件结构和当前画面通过,不能替代真实业务人员对结论的确认。
这次的处理结果:模型原稿保留,作为 7/12 的测试证据;人工修正版另存为 6 页 PPTX。两者不能混写成“模型一次完成”。
证据说明:本文使用 work/article-3-evidence-v1/materials.txt 的 S1-S9 虚构模拟材料;模型原始输出、7/12 检查结果和人工修正后的 6 页 PPTX 均保留在同一工作目录。本文不代表真实活动效果、模型泛化能力或公众号收益。