LSTM之父:Agent如何学会“自我进化”?

2026-08-27 08:25:25 · chineseheadlinenews.com · 来源: 海豚数智科学实验室

过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent 等概念不断涌现。它们有时指模型继续训练,有时指 Prompt 或工具自动优化,也有时被直接归入递归式自我改进(Recursive Self-Improvement,RSI)。

问题在于,这些术语描述的变化层级和强度并不相同,却长期缺少一套统一坐标系。

近日,来自吉林大学、KAUST、阿尔伯塔大学和瑞士人工智能实验室等机构的研究团队发布综述,从系统层面重新定义“自我改进”,并将模型训练、记忆演化、工具创建和 Agent 架构搜索放进同一张地图。配套项目目前已整理 312 篇相关工作。

? 配套资源

? 论文:arxiv.org/abs/2607.13104

? 项目主页:selfimproving-agent.github.io

? 代码仓库:github.com/selfimproving-agent/awesome-Self-Improving-Agents

值得一提的是,这篇综述发布后迅速在海外 AI 社区获得关注。配套 GitHub 仓库一周左右已收获 200+ Stars;X 上也有不少论文推荐帖获得了约 800 个 Likes。这也折射出一个清晰信号,self-improving agent 正成为海外研究者和开发者共同关注的新焦点。

图 1配套 GitHub 仓库在一周左右获得 200+ Stars

图 2X 上的论文推荐帖获得约 800 个 Likes

图 3现代自我改进 Agent 的整体版图

一、什么才算“自我改进”

论文将基础模型 Agent 表示为:

基础模型 Agent 的形式化表示

其中,θ 是基础模型参数;Σ 是围绕模型运行的脚手架,包括 Prompt、Memory、Tools,以及路由、调度和安全约束等控制逻辑。

这个定义划出了一条重要边界:上下文中的临时计划、对话历史和一次性反思,只属于运行时状态;只有当系统依据自身执行产生的轨迹、评价或验证结果,持久修改了 θ 或 Σ,并让下一次任务从不同起点出发,才构成真正的 self-improvement。

? 关键边界

因此,self-reflection 和 self-correction 本身不必然等于自我改进。一次任务中“再想一遍”可以提高当前答案,却未必留下任何跨任务能力。反过来,一条经过验证并写入长期记忆的规则、一个被修复后持续复用的工具,哪怕没有更新模型权重,也已经改变了 Agent 未来的行为。

自我改进也不是大模型时代突然出现的概念。从反馈控制、学习如何学习、自指程序,到 G?del Machine 和元学习,相关思想延续了数十年。基础模型带来的变化,在于自然语言成为统一的修改介质:错误可以写成批评,经验可以压缩为记忆,工具和工作流可以直接生成与重写。自我修改由此从低层代码与权重搜索,逐渐变成更可表达、也更可检查的工程过程。

图 4基础模型提供认知能力,Prompt、Memory、Tools 与控制逻辑共同决定 Agent 如何感知、推理和行动

二、两条路线:写进模型,或写进系统

路线 ①Foundation Model Improvement(基础模型改进)

Agent 自己生成训练示例、评价信号,或从真实环境与世界模型中获得探索经验,再通过 SFT、偏好优化或强化学习写回参数。这类更新较慢、成本较高,也不易回滚,但一旦成功,能力可以跨任务共享。

论文将其学习信号分为三类:

一是自生成示例与推理轨迹,二是模型给出的分数、偏好或批评,三是来自代码执行、网页交互、游戏和机器人环境的真实或模拟经验。Self-Instruct、Constitutional AI、WebRL 等分别体现了这些思路。

?? 风险也很直接

模型可能把自身错误重新训练进权重,导致偏差放大、模型坍塌或灾难性遗忘;也可能学会钻奖励函数和世界模型的空子。参数更新因此必须配合数据过滤、外部验证、版本管理和回滚。

路线 ②Scaffolding Improvement(脚手架改进)

模型参数保持不变,系统改写 Prompt,整理和淘汰 Memory,选择、修复或创建 Tools,甚至重构规划器、路由器和整套 Agent 代码。TextGrad、Mem0、Voyager、G?del Agent、Darwin G?del Machine 等工作都可放入这条路线。它更轻量、更透明,也更容易验证和撤销,因此是当前工程实践中最活跃的方向。

论文对 skill 的处理尤其值得注意:skill 不是 Prompt、Memory、Tool 之外的第五个组件,而是一种“可序列化、可复用的更新”。同一个技能可以被存成工具及其调用约定,可以是一条工作流或记忆,也可以被固化进权重或控制逻辑。换言之,skill 描述的是“保留下来的能力单元”,而不是它被存在哪里。

这种定义也区分了两类技能:对象级 skill用于完成外部任务,例如反复调用一段“收集资源”流程;元级 skill则直接作用于 Agent 自身,例如重写 Prompt、整理 Memory、创建工具或触发参数更新。后者一旦还能改进“如何改进自己”,就开始触及 RSI 最核心的自指结构。

但这里需要降温:今天多数所谓 RSI,仍是受目标函数、测试集、沙箱和权限边界约束的“有限自我修改”,距离不受约束的智能爆炸相去甚远。论文关注的重点也不是科幻式失控,而是如何让这种更新可测量、可归因、可回滚。

两条路线并非彼此排斥。更合理的系统会让脚手架承担快速、局部、可逆的探索,再把反复验证有效的经验蒸馏进参数,形成“快速适应—慢速固化”的双时间尺度。

图 5基础模型更新与脚手架更新构成两条主路径

三、六大应用场景

论文系统梳理了六类应用:软件工程、网页导航与自动化、游戏与策略推理、科学发现、具身智能与机器人、通用计算机控制。它们的共同点是 Agent 都能从环境获得反馈;差异在于反馈是否可靠、获取成本多高,以及失败能否撤销。

软件工程拥有编译器、单元测试和持续集成,是反馈最密集、结果最容易验证的试验场。网页 Agent 面对的则是持续变化的页面、DOM 和 API,需要把成功与失败轨迹沉淀为记忆、grounding 策略或可复用工具。游戏能够提供可重置环境、清晰规则和 self-play 经验,但也可能让 Agent 过拟合固定对手或钻模拟器的空子。

科学发现把循环扩展到假设、实验与证据管理,难点在于新颖性、可复现性和反馈延迟。具身智能需要跨越仿真与现实,处理 sim-to-real gap 和物理安全。通用计算机控制则要跨应用与操作系统形成可迁移的程序性经验。

在这些场景中,skill 可以是代码修复流程、网页策略、游戏技能库、实验工作流、机器人动作程序或桌面操作脚本。介质不同,核心都是把一次成功转化为可复用的持久更新。

图 6自我改进 Agent 的六类代表性应用,以及各领域常用的环境与反馈来源

四、如何评测一个会持续变化的系统

传统基准只测静态模型的最终分数,但自我改进 Agent 的研究对象是一条更新轨迹。可信实验至少要回答:固定预算下每轮提高多少?能否迁移到未见任务?旧问题是否再次失败?消耗了多少工具调用与人工监督?安全风险是否累积?

论文区分了可执行指标与Judge-based 评测:前者适合代码和工具调用,后者覆盖开放式、长链条任务。如果同一个模型既提出改进又负责打分,Agent 可能只是越来越会讨好“裁判”。因此,生成者与评估者应分离,并用独立 Judge、隐藏测试和可验证子集校准。

评测还要覆盖两个层面:机制级评测隔离 Prompt、Memory、Tool 或参数更新的贡献;领域级评测检验其能否承受分布变化、执行成本和安全约束。不只看 Agent 达到多高,还要看它以多大代价、沿怎样的轨迹到达。

图 7自我改进 Agent 常用 benchmark 的分布,覆盖模型层与脚手架层、静态任务与交互式任务

五、从快速探索到慢速固化

论文给出的核心设计原则,可以概括为八个字:

核心设计原则

快环探索 · 慢环固化

Fast Exploration, Slow Consolidation

在反馈嘈杂、任务变化快时,优先修改 Prompt、Memory、Tools 和控制逻辑,因为这些变化透明、便宜、可回滚。只有当一种策略经过充分验证,证明能够跨任务迁移时,再把它蒸馏或微调进模型权重,成为稳定的长期能力。真正成熟的系统不会在“改模型”与“改脚手架”之间二选一,而会让两条路径形成协同循环。

论文据此提出六个方向:测试时持续适应、主动探索与好奇心、参数蒸馏与模型—脚手架联合优化、资源受限的改进效率、多 Agent 协作式共同进化,以及面对环境变化的开放世界鲁棒性。

六、进化越深入,安全边界越重要

当 Agent 能够修改 Memory、Tools 乃至自身代码时,安全对象本身也在变化。一次 Prompt Injection 可能不再只是临时干扰,而会被写入记忆或工具逻辑,成为持久漏洞。

?? 安全设计准则

因此,Critic 应被视为受治理的基础设施,提出更新与批准更新也不应由同一闭环完全控制。

每次修改都要经过功能、权限和安全检查。

尤其在 Full Scaffolding 与 RSI 场景中,Agent 应被当作受保护环境中的“不可信程序”,所有更新都需经过分层门控。

未来的 AI 进步,未必只来自更多参数。更值得关注的是:Agent 能否从失败中提取经验,把经验封装为可复用 skill,管理自己的记忆与工具,修改工作流程,再把验证过的能力稳妥沉淀下来。当 AI 从“每次任务都重新开始”,走向“每次任务都留下可验证的成长”,它才真正跨过从工具到学习型系统的门槛。

所谓 self-evolving agent 的关键,也不在“进化”这个热词本身,而在每一次更新是否持久、有效,并且始终处于可控边界之内。

? 结 语 ?

这篇综述真正提供的,不是又一个关于“AI 自我进化”的宏大预言,而是一套判断进步是否真实发生的工程语言:经验有没有被保存,能力能不能被复用,收益能否跨任务迁移,更新是否经得起验证。

未来的 Agent 或许会越来越擅长修改自己,但比“会进化”更重要的,是它知道该改什么、为什么改,以及什么时候不应该改。


    24小时新闻排行榜更多>>
  1. 刘翔怼体育局:10年才想起安置我 分广告费咋不依规
  2. 那些显示你正在变老的“奇怪”迹象 你理解对了吗?
  3. "在中国,为中国"战略不如预期 大众集团压力山大
  4. 盖茨万字长文警告:动荡的AI时代已到来 这次不同
  5. 营收翻倍、数据中心暴涨117%,英伟达还能狂奔多久?
  6. 美国新增录取安全审查,8月15日生效
  7. 新加坡,为什么突然鼓励“讲华语”?
  8. 35年来从未见过:经济学家警告
  9. 中国糖都,正在面临历史级大洪水
  10. 中国年轻女性群体与“腋毛自由”潮流的背后
  11. 外卖投毒者是蜜雪冰城员工?传百草枯中毒死亡逾4千人
  12. 毁灭性泥石流突袭中尼口岸
  13. 买折叠手机前,先算三笔账
  14. 播客鼓吹战时拘禁所有华裔 3名华裔议员联合谴责
  15. 尼泊尔山洪暴发前后卫星图对比,差异惊人!
  16. 特勤局高官被FBI押出办公室 疑涉泄漏机密信息
  17. 癌症疫苗,真的要来了吗?
  18. 美财长出手 长债暂回稳 交易员不敢轻易与之作对
  19. 泽连斯基感谢习近平发来独立日贺电 官媒集体沉默
  20. 川普称伊最高领袖左半身重伤 美伊战争“很快”结束
  21. 吉隆泥石流现场救出2人,3人遇难558人失联
  22. 生一个孩子补37万:新加坡真急了
  23. 一个女生教170万直男谈恋爱:先学卫生 从洗头开始
  24. 西藏边境夺命山洪:灭村“宛如末日” 95死579游客失踪
  25. 中国女留学生遭分尸 老师竟穿死者衣服“扮成她”…
  26. 8到10米,尼泊尔乡政府大楼被卷走
  27. 川普再次宣称:没有我,就没有以色列
  28. 政协副主席陈武本命年早夭 蓝天立还是许家印的杰作?
  29. 西藏泥石流致3死265失联 家属:妻子和项目部约60人失联
  30. 加州134年房价暴涨真相曝光
  31. 摆平社交媒体成瘾诉讼 Meta拿出180亿美元和解
  32. 龙虾卷
  33. 狗仔再曝包贝尔和惹火美女开房细节
  34. 硅谷AI大逃杀:Anthropic如何吸干OpenAI“超级大脑”?
  35. 韩国济州岛3年失踪3000人?
  36. 65岁华女再闯川普海湖庄园 推着一车家当被捕
  37. 刘翔在线二选一!体坛巨星退役后都在解锁哪些职业?
  38. 专家分析:西藏吉隆泥石流灾害属特大型
  39. 被曝“羞辱式劝退应届生”,星宇股份发致歉信
  40. “幸运又沉重的一天”,吉隆带客导游称换行程救了命
  41. 哈里斯县警员涉违规与ICE“协作”被调职
  42. “牛来”跑在10万国产卡上
  43. 胰腺癌治疗重大突破!FDA批准新药 生存期近翻倍
  44. 原来华为真的可以光速捂嘴、为所欲为
  45. 尼泊尔山洪“100m高水墙直扑”,市场瞬间消失
  46. 她亲手杀死3个儿女 却获大量民众支持 网友吵翻天...
  47. 苹果9.10发布首款折叠iPhone,开启特努斯时代
  48. 中国女留学生在韩国遇害,嫌犯:分散抛尸250公里外
  49. 卫星照太震撼 山洪为何如此恐怖 喜马拉雅正在发生什么?
  50. 旅美“辱毛”雕塑家高兟被判监禁 妻儿被禁离开中国
  51. 中尼边境土石流“活埋人车”!增至95人罹难
  52. 上海13岁女孩靠AI自研虚拟家长App 3天爽赚1.8万
  53. “你也是女人吧?”,农村还有多少“房主任”
  54. 2亿60后“谢幕”,中国再无此代人
  55. 地铁迎来涨价潮
  56. 山洪爆发前诡异一幕!河面扬尘 数秒后6米巨浪袭来
  57. “硬汉特工”上位:别让我11岁和9岁的儿子上战场
  58. 油烟机油垢难清?这种方法一抹就亮!
  59. 贝森特“救美债”,下一招是什么?
  60. 川普关税行动令共和党中期选举承压