MemSlides登顶抱抱脸,让Agent记住你的改稿习惯

2026-07-24 06:25:25 · chineseheadlinenews.com · 来源: 新智元

最尴尬的一刻,往往不是AI PPT生成失败。

而是它明明已经生成了一套还不错的slides,你只是说:“把第 8 页右下角那块改得更像流程图。”

下一秒,第8页可能确实改了,但第3页标题层级变了,第12页配色也漂了,前面反复调好的风格又被打散。

这才是真实PPT工作流里更常见的痛点。

第一版只是草稿,改稿才是主战场。

从“生成一套”到“生成得像这个用户”

过去几年,自动幻灯片生成进步很快。很多系统已经可以从论文、产品说明或一句主题出发,生成结构完整、视觉上也不算粗糙的初稿。

但在真实使用里,第一版slides的关键不只是“有没有生成出来”,而是它是不是已经贴近某个用户的表达习惯。

同一篇Transformer论文,可以被讲成基础教学课,也可以被组织成组会汇报、论文精读或技术培训。不同用户关心的页面角色、内容密度、证据边界和机制展开方式都不一样。有人希望先给结论和takeaways,有人更希望把定义、机制、边界条件拆清楚。

这正是用户画像记忆在round-0阶段的作用。

由北京邮电大学、清华大学、上海交通大学合作完成MemSlides 不是等到用户反复修改之后才开始“记住”,而是在首轮生成时就会根据当前任务意图检索用户画像,将兼容的长期偏好路由到当前工作记忆里,用来影响页面组织和表达方式。

该工作登顶Hugging Face Daily Papers #1 Paper of the Day,GitHub已获400+ stars;Demo website上线后也已吸引 100+ verified users试用。

图1展示的不是一个泛泛的“生成效果图”。它更像是在说明:系统如何把论文材料拆成定义、核心机制、实验依据、常见误区和边界条件等页面。这些选择背后,对应的就是用户画像中关于内容结构、信息密度和证据导向表达的偏好。

图1:首轮生成不仅体现完整性,也体现用户画像记忆对页面组织、内容密度和证据边界的影响。

项目也提供了在线Demo。用户可以上传材料、选择memory profile或模板,生成初稿后继续进入revision,并下载当前版本的PPTX、HTML或PDF。

也就是说,MemSlides面向的是从个性化初稿到后续持续修改的完整流程。

而一旦第一版已经开始贴近用户,后续问题就变得更尖锐:系统能否在多轮修改中继续保留这些偏好?当前会话里临时提出的要求,会不会过几轮就失效?用户只想改一个局部区域时,系统能不能避免把已经对齐的页面重新打散?

让记忆分工

很多人一听到“Agent memory”,会自然想到:那就把历史对话放进更长的上下文里。

MemSlides 没这么做。

原因很简单:历史越长,里面的冲突也越多。今天用户说“这套报告用蓝色标题”,不代表他以后所有 PPT 都要蓝色标题;用户在某次编辑里遇到的工具错误,也不应该和“他喜欢什么风格”混在一起。

因此,MemSlides 把个性化幻灯片生成建模成一个有状态的 authoring process:系统先根据源材料、用户画像记忆和可选模板生成 round-0 初稿;之后每一轮反馈都会更新当前 session state,再围绕当前 deck 做局部编辑。

它的记忆组织有两个视角。

从生命周期看,有长期记忆和工作记忆。长期记忆保存跨任务稳定存在的信息,工作记忆保存当前 deck 中仍然有效的临时约束、修改目标和执行状态。

从功能角色看,有用户画像记忆和工具记忆。前者回答“这套 slides 应该体现什么偏好”,后者回答“Agent 应该怎么改得更稳”。

换句话说,MemSlides 不是让 Agent 记住包多废话,而是让它知道哪些信息该长期保留,哪些只在当前任务里生效,哪些属于用户偏好,哪些属于工具经验。

图2:MemSlides 将长期记忆、工作记忆、用户画像记忆和工具记忆组织到同一个多轮改稿流程中。

用户画像

真正的个性化,通常不是一句 role prompt 能解决的。

同样是学术汇报,有人喜欢每页只放一个核心结论,有人会保留公式和实验细节;同样是商业路演,有人偏好高密度表格,有人更依赖趋势图和对比图。

这些差异不是一次 prompt 里的标签,而是用户在长期写作和修改中慢慢暴露出来的习惯。

MemSlides 用用户画像记忆来保存这类跨任务偏好。它不是把 profile 整块贴到 prompt 前面,而是在任务开始时根据当前 intent 检索相关偏好,再与本轮请求做协调。

如果长期偏好和当前明确指令兼容,它们会一起进入工作记忆;如果发生冲突,当前这套 slides 的明确要求优先。

这一步很重要。否则,系统很容易把“这次临时想要蓝色标题”误当成“用户永远喜欢蓝色标题”。

任务结束后,MemSlides 也不会把每一句反馈都写回长期画像。它只沉淀稳定、可迁移的交互信号,让下一次生成更贴近用户,而不是更混乱。

图3:用户画像记忆会经历检索、路由、当前任务使用和任务结束后的稳定信号沉淀。

工作记忆

多轮改稿里,还有一类信息更微妙。

它不是长期偏好,却必须在当前 deck 里持续有效。

比如用户在第2轮说:“后面如果新增 summary/tip box,就用浅灰背景。”当时系统还没有新增这类元素,所以这条要求没有立刻执行对象。几轮之后,如果用户要求插入带 summary box 的页面,这条规则就应该被触发。

如果Agent只看当前轮输入,就很容易把这类延迟生效的约束忘掉。

MemSlides的工作记忆就是当前写作任务的状态板:active temporary preferences、carryover instructions、resolved targets、coverage status 都放在这里。Plan 阶段读取这些状态来确定修改范围,Act 阶段据此执行受限编辑,Guard 阶段再更新检查结果。

这让多轮修改不再是彼此孤立的一次次 prompt,而是围绕同一套 slides 持续推进的编辑过程。

图4:工作记忆让早先提出、后续才触发的临时样式偏好继续生效。

只改该改的地方

对人类编辑来说,“只改这一处”是一句很自然的话。

对生成式系统来说,这句话却很难。

因为很多系统在处理反馈时,会重新读取或重写大范围内容。结果就是目标区域改对了,但非目标页面也发生变化。用户看上去只提了一个小要求,系统却把整套 PPT 的状态重新打散。

MemSlides用scoped slide-local revision来约束这个问题。

每次反馈先被映射到最小有效修改区域,然后进入Plan-Act-Guard流程。

Plan阶段把自然语言请求转成execution contract,明确目标slide、作用范围、selector hints 和覆盖要求。

Act阶段根据页面结构选择编辑工具,并在受限范围内执行最小有效操作。Guard 阶段把“完成”变成一个需要检查的状态:目标没覆盖不能草率finalize,snapshot 过期需要重新绑定,局部请求也不应被扩展成整套deck的重写。

这一步把“模型觉得自己改完了”,变成“系统能检查这次修改是否真的覆盖目标、是否越界”。

图5:Plan-Act-Guard 将局部修改拆成范围规划、受控执行和结果检查。

工具记忆

Slides编辑不是纯文本改写。

一个局部修改可能涉及页面结构、选择器、样式规则、布局快照和验证逻辑。Agent 即使理解了用户想要什么,也可能在工具调用时读错区域、重复试错、扩大修改范围,或者在目标尚未覆盖时提前结束。

所以,MemSlides 还引入了工具记忆。

工具记忆不记录“用户喜欢什么”,而是记录“类似编辑任务里,什么执行路径有效,什么错误应该避免”。

论文将其组织成两种粒度:round-scope task experience 记录一轮修改中的经验、错误总结和可迁移模式;operation-scope tool-chain experience 保存更细粒度的 reasoning-tool-observation 片段,在相似工具调用前被检索出来作为参考。

这种设计把目标和执行分开了。

用户画像决定 slides 应该往什么方向变,工具记忆则让 Agent 少走弯路,减少无效探索和执行不确定性。

图6:工具记忆关注的是工具调用经验,而不是用户审美偏好。

实验结果

MemSlides 的评估没有只给一个总体生成分数,而是把不同记忆组件对应的能力拆开验证:用户画像记忆对应 round-0 persona alignment,工作记忆对应多轮会话中的 delayed preference carryover,工具记忆则在 diagnostic matched-pair modify setting 中隔离验证。

在个性化生成上,用户画像记忆提升了多 persona、多 intent 设置下的 persona alignment。论文进一步指出,这种提升不仅体现在“更像某个模板”,也体现在内容重点、页面角色、证据组织和 persona 区分等规划层面的选择。

在局部修改的配对诊断中,工具记忆带来的变化更直接:

同时,core tool time ratio降至0.327x。

需要注意的是,这些数字来自诊断性matched-pair modify setting,不能被解读为所有场景下单调领先。更准确地说,它们支持的是一个过程性结论:当工具记忆提供可复用执行经验时,Agent在闭环完成、严格验证和找到首次正确编辑路径上更容易收敛。

图7:局部编辑对比是论文中的定性案例,用来展示工具记忆注入前后编辑过程的差异。

PPT Agent的下一步

是长期协作

MemSlides讨论的是PPT,但它背后的问题不只属于PPT。

当 Agent 进入文档生成、代码修改、数据分析、企业知识系统等长周期任务时,都会遇到类似挑战:哪些信息应该长期保留,哪些状态只属于当前任务,哪些执行经验可以复用,哪些内容在局部修改时必须保持不变。

如果说一键生成解决的是从0到1,那么多轮修改考验的是从1到可用。

未来的Slides Agent,不只要会生成更漂亮的第一页,还要能在反复改稿中持续理解用户、保持编辑边界,并让一套slides稳定地向用户真正想要的版本靠近。


    24小时新闻排行榜更多>>
  1. 菲尔兹奖得主邓煜谈“是否回国”:不存在唯一答案
  2. 汽车行业的寒气,还是吹到特斯拉了
  3. 王虹:法国学习给我留下深刻印记
  4. 性侵幼女、枪杀妻子 中国警方向美遣返美籍红通逃犯
  5. 纽约锁匠女孩一支影片爆红 接单接到手软
  6. 卖芯片的狂赚 用芯片的亏钱!摩根大通发警告下一步…
  7. 传江金权被抄家 习丢车保帅?“撒胡椒面”习愣四秒
  8. 日经:习近平希望尽快摆平波及核心圈子的一桩丑闻
  9. “迄今最令人担忧AI事故!”震惊科技圈 经济学人发警告
  10. 趋磁细菌可延长生物体健康寿命
  11. 王虹也曾怀疑过自己::数学没有建筑难学
  12. 川普的“死亡之吻”,他如何为美国带来灾难
  13. 传万斯儿子差点取名“唐纳”致敬川普 妻子喊停
  14. 首战即终战论五年后 世界变了多少
  15. 川普放话再攻伊朗 “规模前所未有” 国会急阻止
  16. 中国最惨的一个暑假!镑大景区空荡荡没有人
  17. 梁文锋:英伟达自掘坟墓
  18. 美国凶杀率大降18% 或创百年来最低 川普功劳?
  19. 美新空军一号升级 红外反制系统竟不如30年旧机
  20. 忽视亚裔选民,或致民主党选举失利
  21. 一个笔误造出“幽灵卡车”!五角大楼清查近兆军费
  22. 华邮披露川普拟出兵西非马里 恐成第二任动武第8国
  23. 白宫被告知:若封禁中国模型 硅谷百家企业会完蛋
  24. 梁文锋直言:英伟达护城河正快速瓦解
  25. 我敢说99%的AI课,都是“割韭菜”
  26. 美国大熊受困电线杆顶!专家不敢打镇定剂 最终....
  27. 北大祝贺两位校友获菲尔兹奖 王虹高考成绩公开
  28. 盛雪:杨植麟在重走50年代的海归路
  29. OpenAI对中国开源大模型极度担忧,甚至说了这些话...
  30. 涉替中共发展组织判刑8年定谳 中配周满芝台湾身分将遭注销
  31. 如果这一趋势持续下去 十年后美国就没人懂中国了
  32. 郑州夜抓知了猴:3小时赚近400元
  33. 美国麻疹疫情“失控”:暴增十倍
  34. 女星录取北大研究生
  35. 五杀美国!你永远可以相信中国女排
  36. 2026世界杯之“最”:评分王梅西,射门王姆巴佩
  37. 长鑫科技敲定7月27日挂牌
  38. 中国外交官气炸集体离场
  39. 危险的非洲大蜗牛正在扩张,北方也可能失守
  40. 炼油厂关闭后 加州会缺油或油价飙涨?
  41. 从孙志刚到旺旺:一次不会发生的立法跃进
  42. 纪念反迫害27周年 纽约法轮功学员举行烛光夜悼
  43. 卖一辆亏十几万,保时捷经销商扛不住了
  44. 华人女子爬山被砸死
  45. “万年空头”胡思曼揭4大警讯
  46. 前瑞银副总监私吞南京卖淫团伙头目约1.35亿港元
  47. 乒超新规引发3个连锁反应
  48. 乌军总司令被解职后发休闲照片
  49. 疲倦心悸肠胃差?其实是身体在求救
  50. 川普社媒拟贩售“提前知情权” 两党都警告“别踩红线”
  51. 资本永不眠 泡沫猎手:马斯克的三次完美逃顶
  52. 男子开黄腔遭女同事掌掴后被开除
  53. 美威胁发动空前打击 伊朗、胡塞:已做好准备
  54. “黑吃黑”!前瑞银副总监私吞南京卖淫团伙1.35亿
  55. 373名乘客在杭州被困机舱12小时 有人因高温晕倒
  56. 赞比亚人眼中的中国人
  57. 体型堪比黑熊 称霸北美湿地的“巨型河狸”
  58. 古代家道为什么失效了?人伦大乱的根源
  59. 台风“红霞”将登陆广东福建沿海 暴风雨将波及6省
  60. 猪周期反转,这次可能来真的