AI 做 PPT,终于记住你长什么样了:北邮清华上交联合提出 MemSlides,三层记忆让 AI 学会"改一页不动全局"
做 PPT 这件事, AI 其实一直没做好。
不是生成不了——现在随便一个工具都能给你扔出十几页。是用起来别扭。每次都要重新说一遍"我用蓝色主题""标题要大""图表用柱状图别用饼图"。说了三五次,它还是记不住。改了第三页的排版,好,第五页也跟着变形了。改完第五页,第三页又回去了。
折腾一圈,有那功夫自己都做完了。
像请了一个每次都把你忘干净的助手。你说烦不烦。
6 月 15 日,北京邮电大学、清华大学(朱军团队)和上海交通大学联合在 arXiv 上公开了一项新工作——MemSlides。名字很直白:给 AI 做 PPT 这件事装上一个"记忆"系统。论文的代码也已经开源。
它解决的核心问题,跟生成速度没关系,跟"记不记得住"有关系。
从"每次都重来"到"你一说它就想起来了"
先看数据。
在 10 种职业角色 × 3 种使用意图的测试集上, MemSlides 在内容、结构、视觉、特异性四个维度的个性化对齐评分上,平均比 DeepPresenter ( ACL 2026 录用)高出 1.19 分( 10 分制),比 SlideTailor 高出 2.89 分。特异性维度——也就是"这篇 PPT 一看就是给这个角色写的,不是万能模版"——领先了将近 3 分。
效果最好的组合是用 GLM-5 跑的:内容 9.00 ,结构 8.78 ,视觉 8.56 ,特异性 8.89 。接近满分。
不同角色的增益差异也挺有意思。平面设计师提了 4 分,市场经理提了 3.17 分,但软件开发者的提升只有 2.33 分,而且在结构和视觉上还倒退了——说明这套记忆架构对非技术类角色的个性化效果更好。软件开发者做的 PPT 可能本来就比较标准化,记忆的价值有限。
但说实话,分数这东西看看就好,真正有意思的是它怎么做到的。
三层记忆,解决三个不同寿命的问题
MemSlides 的架构核心是分层记忆。论文把 AI 做 PPT 过程中需要"记住"的东西,按生命周期拆成了三层。
用户档案记忆是"长期记忆"。你习惯用什么字体、喜欢什么色系、做学术汇报和给投资人讲故事的版本应该长不一样——这些按"角色 × 意图"分类存好。下次你做同类型 PPT , Agent 直接调对应档案,不需要你重说一遍。
工作记忆是"短期记忆",只管当前这次任务。你今天说"把第三页的图表换成柱状图""第五页加一个对比表格"——这些约束丢进工作记忆,后续修改一直带着,不会丢。
工具记忆是"操作肌肉记忆"。前几次改了哪些地方,哪一步容易出错,哪一步耗时最长——这些经验被记下来,后续修改时优先避开踩过的坑。
这套设计的核心洞察其实挺朴素的:不是所有记忆都该活一样长。你的字体偏好应该管一辈子,这轮改稿的要求做完就忘,工具调用的经验越用越准。一个设计管一个事儿,别混。
但话又说回来——"分层"这个概念本身不新鲜。任何一个做了三年以上的工程师都知道"把不同生命周期的数据分开存"。新鲜的是把它搬到 AI PPT 这个领域,而且真的搭了一套系统去跑。
论文跑了一个工具记忆的消融实验——就是拔掉工具记忆看看还灵不灵。结果:注入工具记忆后, AI 的闭环修改完成率从 81.5% 提升到 96.3%,首次正确修改的平均耗时从 609 秒降到 242 秒,核心工具操作时间压缩到原来的三分之一。这些数据来自论文的 Table 3 , GLM-5 上的提升最明显,耗时直接从 500 秒砍到 196 秒。
609 秒到 242 秒。十分钟变四分钟。这已经不是"一点点提升",是量级变化。
改一页,别动全局——这比看起来难得多
用过 AI 做 PPT 的应该都懂那种烦躁——改一页, AI 直接给你重来整个文件。页面布局变了。字号换了。之前对齐好的内容全歪了。第三页改完,第六页又不对了。
就是那种"你改你的,我改我的"的既视感。
崩溃吧。谁用谁知道。
MemSlides 管这个叫"修改边界膨胀",做了局部修订机制——不是大砍刀,是手术刀。流程分三步:先分析用户反馈,找到"最小影响范围"——只需要改这一页?还是全局配色都要动?然后动手,只动那几页。最后验证:改好了没有?别的地方有没有被带歪?
说起来简单,做到可不容易。大模型的天性是"我给你整个重来一遍",因为全量生成比精确手术对模型友好得多——就像你让一个人重新写篇文章比让他只改第三段容易。工具记忆的价值就在这里:它记住了上次在这个位置踩的坑,这次绕着走。
论文举了一个典型案例:第三页的标题要改。无记忆的基线会重新审视整个 PPT 的结构,可能把第一页的配色也换了。 MemSlides 通过工具记忆中记录的"上次改类似位置时踩了哪些坑",直接把修改范围锁定在第三页内部。不改别处。
从"比谁快"到"比谁懂你"
这个方向上不是没有竞争。 DeepPresenter 走的是"环境感知"路线,让 Agent 能看到渲染后的幻灯片再反思修正; SlideTailor 侧重科研论文到 PPT 的单向转换。但 MemSlides 是第一个把"记忆"作为核心架构设计的——坦白说,这反而让人觉得"嗯?不是早该这么做了吗?"
如果把 AI PPT 的发展拉一条线:第一代是模板填空( 2023 前),那会儿整的跟 Word 排版似的。第二代是大模型生成 + 规则排版( 2024-2025 )。第三代在 2026 年开始分化——有人走多模态布局,有人走多 Agent 协作, MemSlides 选了记忆这条路。三条路,没有一条是瞎折腾的,但方向不同。
这个选择背后的判断很直白: PPT 生成的技术瓶颈早就不在"能不能生成",而在"能不能不用每次从零开始"。尤其在专业场景下,一个人的 PPT 风格是高度稳定的——你做三次学术报告,不会一个换一个风格。那为什么 AI 每次都要重新学?
团队也说了,MemSlides 没有做真实用户研究。论文自己坦白了——测试集是自己构建的,不是真实的用户环境。三层记忆的硬收益主要在用户档案和工具记忆上有数据支撑,工作记忆目前只给了几个定性案例,翻来覆去就那么几个截图。九个工具记忆的配对测试,样本量确实不大。严格说,这更像一个技术验证,不是产品级方案。
而且隐私这块: AI 记住你的偏好当然是好事,但你每一次怎么改 PPT 都被记录下来了。这东西存在哪?谁有权删?论文没展开讲。开源了,社区可以继续完善,但目前确实是个开放问题。
不过方向大概率是对的。 AI 工具从"能用"到"好用",跨越的往往不是多一个功能,而是少一个摩擦——不需要每次都说同样的话。
代码和论文链接: - 论文: https://arxiv.org/abs/2606.17162 - 开源: https://github.com/huohua325/Memslides
- 在线体验: https://memslides.com/