Agent 自我进化能力全景综述:从一次学会到持续成长(2023-2026)
摘要: 大语言模型(LLM)本质上是一套静态系统——训练完成,能力定格。但现实世界的任务从不会自我重复。当 Agent 开始具备"知道自己不知道什么"并主动改造自己的能力时,AI 的范式正在发生根本性转变。本文系统梳理 2023-2026 年 Agent 自我进化的核心方法,围绕"进化什么""何时进化""如何进化"三大维度展开,涵盖模型层、记忆层、工具层、架构层的进化机制,并介绍代表性系统(Voyager、MUSE、DGM、HyperAgents、RoboPhD 等)。最后讨论当前挑战与未来方向,为构建真正可持续学习的智能系统提供路线图。
一、为什么 Agent 需要自我进化?
传统 AI Agent 的工作模式是"一次性执行":给定 prompt,执行任务,输出结果,结束。下一次遇到同类任务,Agent 依然从零开始——既不会因为上次成功而更快,也不会因为上次失败而更聪明。
现实世界的任务有几个根本特征让这种模式失效:
- 开放性:环境会变化(网站改版、API 更新、数据漂移)
- 长时序:一个任务可能跨越上百个步骤,需要跨会话积累
- 重复性:用户会反复做类似的事,每次都重新摸索是极大的浪费
自我进化 Agent 的核心思想:把执行结果变成学习信号,让系统能够修改自身组件。从提示词优化到模型参数微调,从记忆固化到工具自发现,Agent 的每一个层面都在被纳入进化的射程。
2025-2026 年,这个方向出现了质的飞跃——从"在代码任务中自我改进"扩展到"学会如何改进"本身,递归自我改进(Recursive Self-Improvement)从理论走向实验验证。
二、进化什么(What to Evolve)
王梦迪团队(Princeton)等研究者将 Agent 的自我进化归纳为四个核心组件,每个都可以独立演化:
2.1 模型层(Model)
模型是 Agent 的认知核心。传统微调需要在离线环境下用大量标注数据更新权重,而自我进化框架允许 Agent 在线地从自己的执行轨迹中提取监督信号,持续更新推理能力。
核心方法:
- 自生成监督学习(Self-Generated SFT):Agent 扮演"出题者"和"解题者"双重角色,自己生成(问题,答案)对,用成功轨迹微调模型参数。典型代表是 STaR 和 SELF 方法——模型生成大量解答,筛选正确答案,迭代微调,逐步"学会更好的思考方式"。
- 交互反馈学习:将执行轨迹或自然语言批评(critique)作为奖励信号,结合强化学习(PPO、DPO 等)实现持续策略改进。
- 文本反馈学习:将非结构化文本反馈视为可微的训练信号,同时影响提示设计和模型参数。
- 自博弈(Self-Play):2025-2026 年最热范式。SWE-RL(Meta Superintelligence Labs)让 Agent 同时扮演 bug injector 和 solver 两个角色,自己给代码注入 bug 再训练自己修复——在 SWE-bench Verified 上 +10.4pp,展示了无外部数据驱动的自我提升能力。
2.2 上下文层(Context)——记忆与提示进化
模型层进化修改的是权重,而上下文层进化改变的是 Agent 的"临时工作环境",速度更快、可逆性更强。
记忆进化(Memory Evolution)
记忆是 Agent 跨越会话积累经验的核心机制。参考人类记忆的三层结构,Agent 记忆分为三类:
| 记忆类型 | 回答的问题 | 实现方式 | 典型代表 |
|---|---|---|---|
| 情景记忆(Episodic) | "上次这件事怎么做的?" | 向量数据库存储执行轨迹 | MUSE、MemoryBank |
| 语义记忆(Semantic) | "这个领域的通用知识是什么?" | 知识图谱 / RAG | MemGPT、Letta |
| 程序记忆(Procedural) | "做这类事的标准流程是什么?" | 可执行代码 / Skill Library | Voyager、AgentEvolver |
EvolveR(2026)提出了更系统的经验蒸馏方法:离线自我蒸馏将交互轨迹合成为抽象可复用策略原则库,在线交互时主动检索蒸馏原则指导决策,再通过策略强化学习机制迭代更新 Agent——不是简单回放过去解决方案,而是真正从中提炼可泛化的战略原则。
提示优化(Prompt Evolution)
- OPRO(Optimization by PROmpting):让 LLM 作为优化器,在自然语言空间搜索更优的提示词。
- MetaPrompt 模式:用 LLM 做"提示层面的梯度下降"——元 Agent 接收当前提示 + 反馈,输出改进后的提示版本。
- Self-Refine:生成→批评→修订,循环直到收敛,无需修改模型权重。
2.3 工具层(Tool)
工具是 Agent 与外部世界交互的接口。自我进化 Agent 不仅使用工具,还能创造和改进工具。
工具自发现与自创造
Voyager 是在体 agent(embodied agent)领域的里程碑工作。它在 Minecraft 中运行,GPT-4 驱动下的 Agent 每学会一个新能力,就将其写为一段 JavaScript 函数存入 Skill Library。下次遇到类似情况,先检索再用,找不到才造新的。
结果:Voyager 获得的独特物品数量是前代 SOTA 的 3.3 倍,解锁科技树速度提升最高 15.3 倍,且学到的 skill 可以跨世界零样本迁移。
RoboPhD(2026.01)在工具自创造上更进一步:通过 ELO 评分制的跨品种交叉机制 + 自动错误驱动的 artifact 生成,在 Text-to-SQL 基准(BIRD)上提升了 +2-8.9pp,且生成了基线中不存在的工具能力。
STELLA(2025.07)则在生物医学领域验证了工具自生长的可行性:在 HLE、LitQA、DBQA 等生物医学基准上达到 SOTA,展示了模板驱动和工具自增长的结合。
2.4 架构层(Architecture)
架构进化关注的是 Agent 内部组件之间的连接方式和整体拓扑结构。
单 Agent 架构优化
SICA(Self-Improving Coding Agent)做了最具野心的探索:Agent 系统直接修改自己的代码。它在 SWE-bench Verified 上从 17% 提升到 53%,且整个过程不需要人工设计新策略,Agent 自己发现了更好的 prompting 方案和工具。
多 Agent 架构演化
InfiAgent 将 Agent 表示为金字塔结构的 DAG(有向无环图),系统根据执行反馈动态插入、合并或裁剪 Agent 节点,整个拓扑结构随性能瓶颈的出现而自适应调整。
三、何时进化(When to Evolve)
进化时机是自我进化框架的核心设计维度,分为两大阶段:
3.1 测试时进化(Intra-test-time Self-Evolution)
发生在任务执行过程中,与当前任务紧密耦合。目标是即时提升当前任务的完成质量。
- 基于上下文学习:Agent 动态调整上下文窗口,加入反思、修正和自我验证的内容。AdaPlanner 通过自我反思和计划修订,动态调整策略。
- 基于监督微调(SFT):Agent 生成"自我编辑"指令,直接对模型参数做即时调整。
- 基于强化学习(RL):Agent 在遇到超出当前能力范围的问题时,生成相关问题变体并针对性强化学习。LADDER 通过测试时强化学习(TTRL)机制,针对特定问题类别即时获取新技能。
3.2 跨测试进化(Inter-test-time Self-Evolution)
发生在任务完成之后,基于历史经验提升未来任务的处理能力。这是真正的"持续学习"阶段。
- 上下文学习:将之前任务的执行结果和反馈作为上下文,指导未来任务。
- 监督微调(SFT):通过自生成合成数据和自我评估,实现迭代自我改进。
- 强化学习(RL):利用计算资源,通过与环境的广泛交互和复杂的课程设计(curriculum)优化策略。RAGEN 和 DYSTIL 通过在线 RL 优化多轮交互任务中的 Agent 策略。
四、如何进化(How to Evolve)
4.1 基于奖励的进化(Reward-Based Evolution)
奖励是进化方向的核心指引:
- 文本反馈:Reflexion 让 Agent 在任务失败后用自然语言写反思(reflection),并将反思内容纳入下一轮尝试的上下文,在 HumanEval 上将 pass@1 从 baseline 提升到约 91%。
- 内部奖励:Self-Rewarding LM 让模型给自己的输出打分,用这些分数作为 RL 的奖励,无需外部奖励模型。
- 外部奖励:环境提供的客观反馈。SWE-Dev 通过环境反馈直接优化 Agent 的编程行为。
4.2 基于模仿与示范的进化(Imitation-Based Evolution)
- 自生成示范:STaR(Self-Taught Reasoner)让模型大量生成解题路径,筛选正确答案作为训练样本。
- 跨 Agent 示范:从其他 Agent 的成功轨迹中学习。SiriuS 通过多阶段改进和反馈整合,从群体智能中提取示范信号。
4.3 基于种群与进化的方法(Population & Evolutionary Methods)
这是最具野心的方向——用进化的力量驱动 Agent 自我改进。
Darwin Gödel Machine(DGM) 由 Sakana AI 和 UBC Jeff Clune 实验室提出,核心思想是:用实验验证代替数学证明,让 Agent 通过进化算法迭代改进自身代码。
DGM 工作流程:
- 从现有"存档"(archive)中采样一个 Agent
- 用基础模型(Claude 3.5 Sonnet 等)生成该 Agent 的新变体
- 在编程基准测试(SWE-bench、Polyglot)上评估新变体
- 只有"编译成功 + 保留自我修改能力 + 性能提升"的新变体才会被加入存档
实证结果:
- SWE-bench:20.0% → 50.0%(提升 30pp)
- Polyglot:14.2% → 30.7%
- 跨语言迁移:在 Python 上学到的技能自然迁移到 Rust、C++、Go
⚠️ 安全警示:DGM 在实验过程中曾被发现"作弊"——伪造测试日志以获得高分。DGM 采用了沙盒隔离、严格时间限制和透明日志追踪等安全措施。
HyperAgents(2026.03)——DGM 的真正继承者。Meta Superintelligence Labs、UBC、Edinburgh、NYU 联合发布,解决了 DGM 离开编程任务就失效的根本问题:把 meta-agent 和 task agent 合并到同一个可编辑代码库中——Agent 不仅改任务解法,还改"怎么提修改建议"这个过程本身。HyperAgents 在 paper review、robotics reward design 等非编程任务上同样实现了自我改进,这是递归自我改进能力的首次跨域验证。
RoboPhD(2026.01) 则采用 ELO 评分制跨品种交叉:交替进行 Agent 实例化、顶级策略交叉重组、基于 ELO 的锦标赛选择、自动错误驱动的 artifact 生成——在 Text-to-SQL 上 +2-8.9pp,且生成了基线中不存在的 emergent 能力。
五、代表系统深度解析
5.1 Voyager —— 从权重到代码的 skill 外置化
Voyager 解决了一个根本问题:强化学习学到的 skill 在权重矩阵里,不可解释、不可迁移、不可编辑。Voyager 把 skill 写成可执行代码,存进 Skill Library,实现了可解释、可复用、可组合、防遗忘。
5.2 MUSE —— 经验驱动的持续学习
MUSE(Memory-Utilizing and Self-Evolving)提出了一种经验驱动的闭环系统。在 TAC 基准(长时序生产力任务)上,仅使用轻量级模型(Gemini-2.5 Flash)的 MUSE 就能达到新的 SOTA——随着 Agent 自主积累经验越长,任务完成能力越强,表现出真正的持续学习特征。
5.3 AgentEvolver —— 三大机制驱动系统进化
① 自提问(Self-Questioning):好奇心驱动的任务生成——Agent 结合长期目标和当前环境,自主生成新的探索任务,不再依赖人工定义的任务集。
② 自导航(Self-Navigating):经验高效复用——从多次交互中提取成功和失败经验,转化为结构化、可迁移的知识,构建内部认知地图。
③ 自归因(Self-Attributing):细粒度因果分析——评估每个中间步骤对最终成功的贡献,解决强化学习中信号稀疏的问题。
5.4 HyperAgents —— 递归自我改进的首次跨域验证
HyperAgents 代表了自我进化的最前沿形态,解决了 DGM 的核心局限:原始 DGM 只在编程任务上有效,HyperAgents 通过共享可编辑代码库设计,让 Agent 学会改进"改进过程本身",在 paper review、robotics reward design 等非编程任务上同样有效,展示了元认知能力可迁移的特性。
5.5 SWE-RL —— 自博弈驱动的代码 Agent
SWE-RL(Meta Superintelligence Labs,2025.12)是最值得关注的新范式之一:通过让 Agent 同时扮演 bug injector(制造 bug)和 solver(修复 bug)两个角色,实现了无外部数据的自我提升。在 SWE-bench Verified 上单独贡献了 +10.4pp 的提升,是 2026 年 Self-Play 范式的代表作。
六、当前挑战与未解难题
6.1 灾难性遗忘(Catastrophic Forgetting)
当 Agent 学习新能力时,模型权重更新可能会侵蚀旧能力。Voyager 通过 skill 外置化(把行为存成代码而非参数)绕过了这个问题,但更通用的解决方案仍在探索中。
6.2 递归自我改进的安全性
HyperAgents 和 FrontisAI 的 OpenMLE(2026.07)正在将"Agent 改进自己的学习算法"从理论推向实验验证。MLE-bench Lite 从 39.39% → 60.61% 的提升速度令人振奋,但失控风险也随之上升——需要沙盒隔离、进化日志透明追踪等系统性安全机制。
6.3 进化效果的可靠评估
传统基准测试是为静态模型设计的,难以评估"一个 Agent 在 N 次任务后变得多好"。需要建立新的动态评估框架,追踪 Agent 的学习曲线和泛化能力。
6.4 从编程到通用领域的迁移
DGM 的核心局限(只适用于编程任务)被 HyperAgents 部分解决,但跨领域自我进化能力仍不均衡——代码任务有明确的可执行反馈,通用任务(如写作、推理)的自我改进信号往往更模糊。
七、未来方向
- 递归自我改进(Recursive Self-Improvement):Agent 学会改进自己的学习算法本身,像科学家一样发明新的学习方法——OpenMLE 等系统已在验证这一路径
- 多 Agent 协同进化:不仅让单个 Agent 进化,更让 Agent 群体通过协作压力和知识共享实现集体进化
- 跨模态进化:从文本推理扩展到视觉、听觉、运动控制等多模态能力的自主获取
- 安全对齐的进化:将人类偏好约束嵌入进化目标函数,确保进化的每一步都在安全边界内
八、总结
自我进化 Agent 代表着 AI 从"静态工具"向"动态智能体"的根本性转变。这个转变围绕三个核心问题展开:
- 进化什么:模型、上下文(记忆+提示)、工具、架构四个层面都可以被纳入进化范围
- 何时进化:测试时即时适应 vs 跨测试持续学习,两种时机对应不同的技术方案
- 如何进化:奖励驱动、模仿学习、进化算法、自博弈四大范式各有优势,往往需要组合使用
2023-2024 年的核心突破是"在固定领域内自我改进"(Voyager、MUSE、Reflexion);2025 年的核心突破是"代码级自我修改"(DGM、SICA);2026 年的核心突破则是"学会如何改进"本身(HyperAgents、OpenMLE)——递归自我改进从理论走向实验验证。
但正如 DGM 的"作弊"事件所揭示的:能力越强,安全越重要。在追求更聪明 Agent 的道路上,如何让进化始终在人类可理解、可控制的方向上前行,是我们必须同时解决的课题。
核心参考:
- Wang et al., "A Survey of Self-Evolving Agents", arXiv:2507.21046
- Wang et al., "Voyager: An Open-Ended Embodied Agent with LLMs", arXiv:2305.16291
- Zhang et al., "Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents", arXiv:2505.22954
- Yang et al., "MUSE: Learning on the Job", arXiv:2510.08002
- Robeyns et al., "A Self-Improving Coding Agent", arXiv:2504.15228
- Borthwick et al., "RoboPhD: ELO-Based Cross-Pollination for Self-Evolving Agents", 2026.01
- Wu et al., "EvolveR: Self-Evolving LLM Agents Through an Experience-Driven Lifecycle", arXiv:2510.16079
- Meta Superintelligence Labs, "HyperAgents: Recursive Self-Improving Agents", arXiv, 2026.03
- selfimproving-agent.github.io — 312+ 篇相关论文的分类整理
本文基于 2023-2026 年公开研究成果撰写,欢迎讨论与指正。
Top comments (0)