AI 做 PPT,为什么总在"重做"
每次让 AI 帮忙改幻灯片,最让人抓狂的不是它改得不对,而是它改了不该改的地方。
典型的场景是这样的:你做了一套 20 页的汇报材料,整体版式、配色、图表样式都已经调到了自己满意的状态。然后你提了一句"第 8 页的标题改成红色"。几秒钟之后,AI 返回一份新文件——第 8 页标题确实变红了,但第 3 页的图表样式被改过,第 12 页的正文行距变了,连第 17 页的页脚颜色都不再是原本那个灰。
你只是要改一个标题,它把整份演示文稿又"重做"了一遍。
更让人崩溃的是下次。当你再次打开这个 AI 工具,让它帮你做一份完全不同的汇报,你之前明确说过的"我喜欢双栏布局""图表用架构图而不是饼图""封面开门见山用大数字",它一条都不记得。一切都要重新解释一遍。
这两个问题的本质是同一个:AI 没有"记忆"。
不是它不长内存,而是它根本没有一套机制来"记住你是谁、记住当前任务里你说过什么、记住上一次操作踩过什么坑"。结果就是,每一轮对话都像是第一次见面。
2026 年 6 月,一项由北京邮电大学、清华大学、上海交通大学联合开展的研究(论文编号 arXiv:2606.17162)正式把这套"记忆盲区"摆到了台面上,并给出了一个系统的解决方案——MemSlides。
现有方案为什么都没补上这块
过去几年,学术界和工业界其实已经做过不少尝试。
PPTAgent 关注的是首版生成质量。它能根据一段主题描述,自动规划大纲、选择版式、生成内容,质量评估在不少公开榜单上已经接近人类设计师的水平。
DeepPresenter 在生成阶段加入了"环境感知"的反思机制。它会回头检查生成的演示文稿是否符合商务或学术规范,并通过自反思修正一些明显的问题。
SlideTailor 走的是另一条路,允许用户在生成时直接提供一份参考幻灯片或模板作为风格参照,让生成的版本更贴近既有作品。
这三类方法把"如何让首版生成更专业"这件事推进了一大步。但它们的共同局限在于:个性化只发生在"当前这一次任务"里,用户的风格偏好没有被积累和延续到下一次。
更深层的问题有两个。
第一,人们对风格的描述往往不是在任务开始就能讲清楚的,而是在反复修改过程中才逐渐显形——你看到第一版觉得"有点乱",才意识到自己喜欢留白多一点;看到配色太花,才想起自己其实偏好单色调。这种"边改边想"的过程,传统 AI 工具完全接不住。
第二,就算 AI 在一次对话里接收了你的修改意见,面对"只改第 8 页标题颜色"这种请求,它往往还是会把整份文件重新生成一遍,搞出一堆你没要求的变化。这不是 bug,是底层没有"局部性"约束。
这两个问题,一个是"记不住人",一个是"改东改西范围失控"。MemSlides 就是冲着这两个方向去的。
把"记住你"拆成三层记忆
MemSlides 的核心思想可以用一句话概括:给 AI 幻灯片助手装上一套分层记忆系统,让它既能记住你这个人的长期风格偏好,又能在一次修改对话里记住你中途提出的临时要求,还能积累"怎么改幻灯片不出错"的操作经验。
这套分层记忆体系可以类比成一位经验丰富的私人助理的大脑结构。这位助理有三块不同的"记忆区",分别负责不同时间跨度和不同类型的信息。
最持久的那层叫做"用户档案记忆"。
它相当于助理随身携带的一本小册子,里面记着你这个人的固定偏好——比如做学术报告喜欢用双栏布局,做商业提案喜欢开门见山用大数字做封面,图表偏好架构图而非饼图。这些偏好按照职业身份和使用场景分门别类存储,每次你开始做新一套幻灯片,助理会先翻开对应那一页,把相关偏好摆在桌上参考。
实验中构建的档案库覆盖了十种职业角色,每种角色设定了三个使用意图,共 30 个档案条目,涵盖大学教师、软件开发者、管理咨询师、市场经理、平面设计师、培训专员、财务经理、运营经理、医疗服务管理者、立法者。每个条目都具体到"这类人在这类场景下偏好什么样的页面结构、什么样的图表类型"。
第二层叫做"工作记忆"。
这是当次对话里的临时便签。假设你在第一轮修改时顺口说"以后如果加新页面,标题颜色也要用蓝色",助理会把这条记在便签上。等到第五轮你真的新增页面时,它会回头查这张便签,确保新页面的标题颜色是蓝色——哪怕你已经不记得自己说过这句话了。
这一层记忆只在当次工作任务内有效。任务结束后,真正稳定的、反复出现的偏好才会被整理进第一层的小册子,而那些一次性的临时指令则不会被永久存储。
第三层叫做"工具记忆"。
这一层最容易被忽视,但却非常关键。它记录的不是"你喜欢什么风格",而是"怎么操作幻灯片才不容易出错"——比如修改某类元素之前要先截个快照做校验,比如批量修改多页标题样式用哪种工具最稳当,比如遇到某种格式错误该怎么恢复。这些操作经验积累下来,相当于助理在实战中总结出的"避坑手册",下次遇到类似操作时可以直接调取参考。
这三层记忆共同构成了一个层级结构:最底层(工具记忆)管"怎么操作",中间层(工作记忆)管"这次任务的临时状态",最上层(用户档案记忆)管"这个人长期的风格倾向"。它们各司其职,互不混淆。
把记忆混在一起塞进上下文窗口,是当前绝大多数 AI 工具的做法。MemSlides 验证下来发现,这种"堆"的方式会导致信息相互干扰——长期偏好被临时指令覆盖,操作经验被无关对话稀释。分开管理、按需调取,才是让记忆真正发挥作用的方式。
Plan-Act-Guard:让修改可审计
解决"记不住人"的问题之后,MemSlides 还设计了一套局部修改执行机制,专门对付"改东改西范围失控"。
这套机制叫做 Plan-Act-Guard,处理一次修改请求的流程可以类比成医生做手术。
第一步是"制定手术方案"。
在动手之前,系统先分析这次修改请求涉及的范围——是只影响某一页?还是要传播到所有页面?还是只影响新增页面而不触碰已有内容?这个范围判断的结果会被写进一份明确的执行协议,记录目标页面路径、需要修改的样式规则、是否要求验证覆盖完整性等。
不同类型的请求有不同的处理方式:纯局部请求只绑定到对应的那一页;全局规则才会扩展到所有页面;而"插入新页面"这类操作产生的新规则,不会被错误地强行应用到原本已有的页面上。
第二步是"最小化手术操作"。
系统根据第一步确定的范围,选择最合适的编辑工具——如果多页共享同一个 CSS 选择器,就用批量 CSS 更新;如果是修改标题、正文、页脚这类跨页语义元素,就用语义批量样式工具;如果只是某一页的内容或局部结构变化,就只读取那一页的布局快照,只在那个局部区域写入修改。
第三步是"手术完成验证"。
系统把"修改完成"视为一个需要验证的状态,而不是模型自己说"我改好了"就算数。修改操作绑定到页面内容的哈希值,如果检测到快照已经过期,会触发重新绑定提示而不是直接全量重写。更重要的是,如果一个请求要求覆盖多个目标页面,在所有目标都被修改或明确确认无需修改之前,系统会阻止过早宣布"完成"。
下面是一个简化的执行协议示例,描述了一次"改第 8 页标题颜色"的请求会被怎样拆解:
{
"plan_id": "edit-2026-07-06-001",
"intent": "color_change",
"scope": "single_page",
"targets": ["page_008"],
"rules": {
"element": "title",
"property": "color",
"value": "#C0392B"
},
"verification": {
"required": true,
"snapshot_hash_required": true,
"coverage_check": "all_targets_modified"
},
"act_tool": "semantic_batch_style",
"guard": {
"block_overwrite": true,
"block_global_propagation": true
}
}
这套 Plan-Act-Guard 组合起来,构成的是一个有约束的精准修改流程——改的是你要改的那块,保持不变的是你已经调好的其他部分。
实验数据:哪些维度真的提升了
研究团队设计了三组实验来验证这套系统的效果,每组对应一种记忆类型。
针对用户档案记忆,使用的是前面提到的 30 条档案的档案库,在每个角色身份和使用意图的组合下生成第零轮幻灯片,然后由"盲评"裁判来评分——裁判只知道目标角色的描述,不知道哪份幻灯片用了档案记忆、哪份没用,也看不到原始任务提示词。
评分维度包括四个:内容匹配度(内容选择、证据类型、表达重心是否符合角色)、结构匹配度(页面顺序和布局是否反映了角色的组织习惯)、视觉匹配度(信息密度、图表风格、视觉层次是否符合角色审美)、特异性(幻灯片是否能被辨认出是针对该特定角色生成的,而非一般性专业风格)。
跨三个模型(GPT-5、GLM-5、Gemini 3.1 Pro)平均来看,相比 DeepPresenter,内容提升 1.37 分、视觉提升 1.66 分、结构提升 0.53 分、特异性提升 1.19 分(均基于 0–10 分制);相比 SlideTailor 的提升幅度更大,四个维度分别为 2.73、2.79、2.95 和 3.08 分。
结构和特异性这两个维度的提升尤其值得关注。 结构维度明确排除了"模板检索是否准确"这个因素,所以它反映的是档案记忆对决策层面的真实影响——它帮助系统更好地决定哪些页面应该起什么作用、内容应该如何排序、布局如何与角色需求契合。特异性维度的提升则说明档案记忆不只是让幻灯片变得更"精致",而是让它变得真正"像这个角色的作品",而不是一份通用的专业演示文稿。
针对工具记忆,采用的是"匹配配对"设计:每对实验中,除了是否注入工具记忆之外,其他所有条件(原始幻灯片、模型、角色、修改请求)完全相同。共 9 对配对,覆盖三个模型。
评估指标包括:闭环完成率(修改是否成功完成、验证通过并最终确定输出)、严格验证率(修改完成后是否紧接着对修改结果进行了局部验证)、首次正确修改时间(从任务开始到第一次做出正确修改操作的耗时)、核心工具时间比值(排除内容查看和格式转换操作后的工具实际耗时比,以无记忆注入为基准 1 倍)。
结果非常醒目——注入工具记忆后,整体闭环完成率从 0.815 提升到 0.963;严格验证率从 0.310 提升到 0.534;首次正确修改时间从平均 609.5 秒降至 242.5 秒;核心工具时间比值的几何均值降到了 0.327 倍(即注入记忆后只需要无记忆时约三分之一的核心工具耗时)。
对 9 对配对做逐对分析,严格验证率和核心工具时间比值这两个指标的改善具有统计显著性(精确单侧符号检验 p=0.0195)。另外两个指标也呈正向趋势但属于"方向性证据"。
工作记忆的效果通过定性案例进行展示。研究团队展示了一种"跨轮次延迟偏好延续"的案例:在早期轮次里提出的面向未来的偏好规则("如果以后加新页面,标题颜色要用蓝色"),在多轮之后真正新增页面时,注入工作记忆的版本能准确执行这条规则,而没有工作记忆的版本则完全依赖当前上下文,无法重现这条规则。
局限与诚实的一面
研究团队对局限性保持了坦率。
首先,实验用的档案库和修改请求是研究团队构建的受控测试场景,不是真实用户在真实场景下的数据,所以结论更准确地说是"在受控设定下的概念验证",而不是"在真实部署中的表现保证"。
其次,工具记忆的实验只涉及 9 对配对,样本量较小,且其中一组集中在 Gemini 的"困难修改"场景上,结果的普适性有待更大规模验证。
第三,关于工作记忆效果的展示目前仍以定性案例为主,缺少系统性的定量评估。
第四,持久化的个人偏好档案在实际部署中涉及隐私问题——用户应当能够查看、修改和删除自己的偏好档案,系统也需要区分稳定偏好和敏感的一次性指令。这些治理机制被留给了未来工作。
这些不是缺陷,而是研究在诚实划定自己的边界。
从"一次性生成器"到"长期协作者"
MemSlides 做的事情,本质上是把"AI 幻灯片助手"从一个每次都需要重新认识你的工具,改造成一个能逐渐了解你、在对话里记得你说了什么、还会在操作中自我精进的长期伙伴。
它的核心洞察在于,个性化这件事不是一次性的。
它需要跨任务的积累(用户档案记忆),需要单次任务内的状态延续(工作记忆),还需要操作层面的经验积累(工具记忆)。把这三类记忆混为一谈、统统塞进一个上下文窗口里,只会导致信息相互干扰;分开管理、按需调取,才是让记忆真正发挥作用的方式。
这背后其实是一个更普遍的判断:AI 工具的评估对象,正在从"生成结果"扩展到"修改过程"。 只有记忆、局部性和验证机制同时成立,AI 才更接近真实改稿流程中的协作者,而不是一个每次都要重新介绍自己的陌生助手。
对于每天和幻灯片打交道的职场人来说,这项研究预示着一种可能的未来:你的 AI 创作助手会越来越"懂你",不需要你每次都重新解释自己的风格偏好,也不会因为你说"改一下第五页"就把整个文件搞得面目全非。
当然,这条路还有很多工程和伦理层面的工作要做——档案库如何真实反映个体差异、隐私边界如何划定、跨任务迁移如何避免偏好漂移——但方向已经清晰。
下一代 PPT Agent 不再是"一键生成器",而是一个会记住你、懂你、并在一次次修改里和你一起进化的协作者。 这件事从 MemSlides 这套分层记忆+审计流程开始,正式走出了实验室。