文章总结: 自进化智能体综述系统梳理了智能体从静态执行到持续成长的研究框架,围绕进化什么、何时进化、如何进化、在哪里进化及怎样评估五个维度展开。核心结论是智能体可通过更新模型参数、上下文、工具或架构实现持久适应,但面临遗忘、成本、安全等挑战。关键发现包括任务内与任务间进化、奖励驱动与群体搜索等方法。可操作建议是注重经验质量控制和长期安全监控。 综合评分: 88 文章分类: 其他
论文解读 | 从静态执行到持续成长:自进化智能体研究综述
王秋雨 王秋雨
北邮 GAMMA Lab
2026年7月17日 12:19 北京
在小说阅读器读本章
去阅读
大语言模型正在从“回答问题的模型”逐渐发展为能够规划、调用工具并与环境交互的智能体。然而,当前多数智能体仍存在一个根本限制:系统完成部署后,其模型、提示词、记忆、工具和工作流通常保持固定。面对新任务、环境变化或反复出现的失败,智能体可以临时调整当前回答,却不一定能够把经验沉淀为后续可复用的能力。
自进化智能体(Self-Evolving Agents)试图突破这一限制。其核心目标不是简单增加模型规模,而是让智能体能够从交互轨迹、环境反馈和历史经验中持续学习,并以相对持久的方式更新自身。2026 年 1 月发表于 TMLR 的综述《A Survey of Self-Evolving Agents》对这一快速发展的研究方向进行了系统梳理,围绕 “进化什么、何时进化、如何进化、在哪里进化,以及怎样评估” 五个问题,建立了一套较为完整的分析框架。本文将结合该综述,对自进化智能体的概念、技术路线、应用场景与关键挑战进行介绍。
图1 从大语言模型到自进化智能体的概念演进路径
1. 什么是自进化智能体?
1.1 从“临时修正”到“持久改变”
并不是所有带有反思、重试或反馈的智能体都可以称为自进化智能体。综述给出的操作性定义强调:自进化智能体需要根据自身产生的轨迹或接收到的反馈,修改内部模型参数、上下文状态、工具集合或系统结构,从而提升未来任务中的表现。
这一概念包含三个重要条件。
- 第一,更新需要由经验驱动。智能体应当利用真实或模拟交互中的成功、失败、环境反馈和自我评价,定位能力边界,而非仅依赖与当前运行无关的通用训练数据。
- 第二,更新需要产生相对持久的影响。仅在当前对话中按照用户要求临时改变措辞,不等同于进化;新的经验需要影响后续决策,例如被写入长期记忆、转化为技能、改变提示策略、更新模型参数,或调整智能体的工作流。
- 第三,系统需要具备一定程度的自主学习能力。完全脱离人工干预的开放式进化仍是远期目标,但自进化系统至少应能主动收集经验、发起探索、评价结果,或自主决定何时进行更新。
因此,自进化智能体并不是某一种特定算法,而是一种系统级的持续适应范式。监督微调、强化学习、上下文学习、记忆更新、工具生成和架构搜索,都可能成为实现进化的手段。
1.2 与持续学习、模型编辑有什么区别?
自进化智能体与持续学习、课程学习和模型编辑存在交叉,但关注点并不相同。
课程学习主要研究如何安排训练样本的难度顺序;持续学习关注模型如何连续获取新知识并减轻灾难性遗忘;模型编辑通常针对模型参数中的特定知识进行局部修改。相比之下,自进化智能体将适应视为智能体运行过程中的核心能力,允许系统同时改变模型、运行时上下文、记忆、工具乃至多智能体协作结构。
换言之,传统持续学习往往关心“模型怎样持续训练”,而自进化智能体进一步追问:“一个完整的智能体系统,怎样在长期交互中重组自身?”
表1 自进化智能体与课程学习、持续学习及模型编辑的对比
2. 统一框架:智能体究竟如何“进化”?
综述将 What、When、How 三个问题作为组织全文的基础维度,并在此基础上进一步系统分析了 Where(进化机制部署于哪些场景)与 Evaluation(如何评估进化效果),共同构成自进化智能体的整体研究地图:
- What to evolve: 智能体的哪些组成部分发生变化?
- When to evolve: 更新发生在单次任务内部,还是多个任务之间?
- How to evolve: 系统依靠什么反馈和学习机制完成更新?
- Where to evolve: 进化机制被部署在哪些通用或专业场景中?
- Evaluation: 如何判断系统是真的持续成长,而不是偶然在某次测试中得分更高?
这一框架的价值在于,它将看似分散的研究统一到几个相互独立但彼此关联的维度中。一个方法可以同时被描述为:进化记忆(What)、在任务之间更新(When)、使用文本反馈(How),并应用于代码智能体(Where)。这种描述方式有助于比较不同系统真正改变了什么,而不仅仅比较最终成功率。
图2 自进化智能体的总体研究框架
3. 进化什么:从模型参数到智能体架构
综述将可进化对象归纳为四个层次:模型、上下文、工具和智能体架构。它们分别对应智能体的“能力内核”“经验载体”“行动手段”和“组织方式”。
3.1 模型:改变智能体的参数化能力
最直接的方式是更新底层模型参数。智能体可以根据执行轨迹自动生成训练样本,将成功解法、环境反馈或自我评价转化为监督信号,再通过监督微调或强化学习提升策略。
与传统一次性训练不同,自进化模型强调闭环:智能体先执行任务,获得反馈,再据此构造新的学习数据并更新自身。部分研究还让模型同时扮演出题者、执行者和评价者,通过不断提高任务难度来扩展能力边界。
模型层进化的优势是能力可能被真正“内化”,无需每次都在上下文中附加大量历史经验。但它也面临训练成本高、更新不稳定和灾难性遗忘等问题。
3.2 上下文:让提示词与记忆随经验更新
相比修改大模型参数,更新上下文通常更加轻量。这里的上下文主要包括提示词、历史经验、反思记录和长期记忆。
以 Reflexion、Self-Refine 等工作为代表,智能体可以使用自然语言总结失败原因,并在后续尝试中读取这些总结。ExpeL 等方法则进一步从多条成功和失败轨迹中提取可迁移的经验,使智能体在新任务中检索并复用过去的策略。
上下文进化具有成本低、可解释性较强、无需重新训练底层模型等特点,因此是当前较常见的技术路线。不过,经验并非越多越好:冗余、过时或错误的记忆可能占用上下文窗口,干扰决策,甚至使系统将偶然经验误认为普遍规律。因此,记忆的筛选、压缩、更新和遗忘,与记忆的积累同样重要。
3.3 工具:从“调用已有工具”到“创造和掌握工具”
传统智能体通常使用开发者预先提供的固定工具集。自进化智能体则可能进一步完成工具创建、工具熟练化和工具选择。
例如,Voyager 在 Minecraft 环境中将已掌握的行为组织为可复用技能,并随着探索不断扩充技能库;部分通用智能体能够根据任务需要编写代码、封装新的工具接口,或从大量候选工具中学习更有效的调用策略。
工具进化使智能体不再被固定动作空间限制,但也扩大了系统风险:自动生成的代码可能存在漏洞,外部工具可能包含恶意依赖,过度扩张的工具库也会提高检索和选择成本。
3.4 架构:让工作流和多智能体组织方式发生变化
更高层次的进化发生在智能体架构上。这里的变化不再局限于单个提示词或工具,而是重新设计任务由哪些模块完成、模块之间如何传递信息,以及多个智能体如何分工协作。
Automated Design of Agentic Systems、AFlow 和 EvoAgent 等工作探索了自动生成或搜索智能体工作流的方法。系统可以构造不同的角色、连接方式和执行顺序,通过任务表现筛选更有效的架构。与人工固定一个“规划者—执行者—评价者”模板相比,架构级进化希望让系统根据任务特征寻找更合适的组织方式。
不过,架构搜索往往需要大量试验和模型调用。复杂工作流带来的性能提升,是否足以抵消增加的计算成本,也是判断其实际价值的重要问题。
4. 何时进化:任务内适应与任务间学习
按照更新发生的时间,综述将自进化划分为两类。
4.1 任务内自进化
任务内自进化发生在一次任务尚未结束时。智能体生成候选方案、检查当前结果、读取环境反馈,并立即修正后续行为。更新主要依赖上下文学习,不一定修改模型参数。
这类方法响应速度快,能够处理当前任务中的意外情况。例如,在网页操作或交互式环境中,智能体发现原计划无法执行后,可以根据新观察调整策略。其局限是经验往往只服务于当前任务;一旦上下文被清空,学习效果可能随之消失。
4.2 任务间自进化
任务间自进化发生在一次或一批任务结束后。系统收集历史轨迹,分析成功与失败模式,再更新模型、记忆、工具或工作流,用于未来任务。
由于不受当前任务时限约束,任务间学习可以进行更复杂的数据筛选、轨迹归纳和参数优化,更容易形成跨任务能力。但它需要解决经验质量控制、更新频率和长期稳定性等问题。
两者并非互斥。一个完整系统可以在执行过程中进行即时调整,同时在任务结束后将有价值的经验进一步沉淀。真正关键的问题是:哪些反馈只应影响当前决策,哪些经验值得长期保留。
图3 任务内自进化与任务间自进化
5. 如何进化:奖励、示范与群体搜索
在“如何进化”这一维度上,综述将现有方法归纳为奖励驱动、模仿与示范学习、群体与进化式方法三大家族。
5.1 奖励驱动:让反馈指出改进方向
奖励是最常见的进化信号,但这里的“奖励”并不只指数值分数。综述进一步区分了四种来源:
- 文本反馈: 使用自然语言描述错误原因和改进建议;
- 内部奖励: 使用模型置信度、自洽性等内部指标;
- 外部奖励: 来自环境、规则程序、人工评价或其他智能体;
- 隐式奖励: 不显式训练价值模型,而是在上下文中利用简单标量信号调整行为。
文本反馈信息丰富且易解释,能够说明“哪里错了、应该怎样改”;数值奖励更便于优化,但可能只告诉系统结果好坏,难以定位具体原因。实际方法常将二者结合,以获得更稳定的学习信号。
图4 奖励驱动自进化的反馈来源
5.2 模仿与示范学习:从高质量轨迹中学习
当系统能够获得高质量示范时,可以直接学习完整的行为轨迹。示范既可以来自人类专家,也可以来自更强模型、其他智能体,或者智能体自身筛选出的成功尝试。
这一方向通常比稀疏奖励更稳定,因为它不仅给出最终结果,还提供了中间过程。不过,方法效果高度依赖示范质量。如果示范覆盖不足、风格单一或包含隐藏错误,智能体也可能将这些缺陷一并继承。
5.3 群体与进化式方法:在多样性中搜索更优策略
群体方法借鉴生物进化和群体智能,同时维护多个智能体、提示词、工作流或策略变体,再通过选择、变异、交叉、竞争与合作探索解空间。
这类方法适合搜索复杂架构,并可能发现人工难以预先设计的新型协作模式。Darwin Gödel Machine 等工作进一步探索了智能体修改自身代码、评估改动并保留有效版本的开放式改进过程。
群体搜索的主要代价是计算量大、结果复现困难,并且随着系统结构越来越复杂,研究者可能难以解释性能提升究竟来自哪个改动。
5.4 三条贯穿不同方法的设计轴
除了上述三类方法,综述还总结了三条贯穿各类方法的设计轴:
- 在线还是离线: 是在与环境持续交互时更新,还是先收集数据再统一训练;
- 同策略还是异策略: 使用当前智能体自身轨迹,还是使用历史缓存、人类示范及其他智能体的数据;
- 过程奖励还是结果奖励: 反馈针对每个中间步骤、最终结果,或二者结合。
这些选择共同影响样本效率、稳定性、探索能力和计算成本。不存在适用于所有场景的唯一组合,方法设计需要根据任务是否可验证、反馈是否稀疏以及交互成本等条件进行权衡。
图5 自进化方法的三条关键设计轴
6. 在哪里进化:从通用环境到专业领域
自进化机制已经被应用于多种场景。
在代码与软件工程中,智能体可以根据测试结果修改代码生成策略、搜索更有效的工作流,甚至尝试改写自身代码。由于代码任务通常具备可执行测试,系统较容易获得明确反馈,因此成为自进化研究的重要试验场。
在网页和图形界面操作中,智能体需要面对页面结构变化、工具状态不确定和长流程交互。通过反复执行、积累经验和更新操作策略,系统有望逐步减少重复错误。
在游戏和具身环境中,Voyager 等智能体通过自动课程、技能库与环境反馈持续扩展能力。此类环境能够提供长时间、多阶段的交互过程,适合研究技能积累和开放式探索。
在医疗、教育和金融等专业领域,自进化带来的潜力与风险同时更加突出。智能体可以从历史案例中改善诊断辅助、反馈生成或领域决策,但专业知识更新、隐私保护、责任边界和安全审查也提出了更严格要求。
这些应用说明,自进化并非单一领域的技巧,而是一种跨场景的智能体设计思想。但不同领域的反馈质量、容错空间和监管要求差异很大,通用方法不能直接无条件迁移到高风险场景。
7. 怎样评价:不能只看一次任务的成功率
传统智能体通常在固定测试集上运行一次,并以准确率或成功率衡量性能。对于自进化智能体,这种静态评估是不充分的:系统可能短期提升,却遗忘旧能力;也可能通过消耗大量算力获得小幅增益;甚至可能在持续更新中逐渐偏离安全约束。
综述提出五类核心评价目标:
- 适应性: 随着经验增加,性能是否稳定提升,提升速度如何;
- 保持性: 学习新任务后,旧知识和旧技能是否被遗忘;
- 泛化性: 经验能否迁移到新任务、新领域或分布外场景;
- 效率: 性能提升消耗了多少 token、时间、工具调用、存储和人工监督;
- 安全性: 系统在持续变化后是否仍遵守约束,是否出现隐私泄露或行为漂移。
在评价时间尺度上,又可以分为静态评估、短周期适应评估和长周期终身学习评估。静态评估只观察某个时间点;短周期评估关注少量迭代内能否快速改进;长周期评估则要求系统状态跨任务保留,并持续测量学习、遗忘、迁移、成本和安全变化。
图6 自进化智能体的评价目标与评价范式
从现有研究看,适应性指标相对常见,而保持性和长期安全仍明显不足。许多实验在不同任务之间重置智能体状态,这实际上无法检验经验是否被积累,也无法观察长期遗忘。不同论文采用的底层模型、工具权限、迭代预算和成本统计方式也不一致,导致方法之间难以进行严格的横向比较。
表2 适应性、保持性、泛化性、效率和安全性的代表性评价指标
8. 仍待解决的关键问题
8.1 如何避免“越学越错”?
自进化并不天然等于正向进步。智能体可能从低质量轨迹中提取错误经验,过度拟合某类任务,或者在反复自训练中放大早期偏差。系统需要判断哪些经验值得保留、哪些只是偶然成功,以及何时应该回滚更新。
8.2 如何兼顾适应与记忆?
持续吸收新知识会带来稳定性与可塑性的矛盾:更新太慢,智能体无法适应环境;更新太快,又可能遗忘已有能力。参数高效训练、选择性记忆、经验回放和主动遗忘都是可能的解决方向,但长期平衡仍未建立。
8.3 如何实现跨任务、跨领域迁移?
很多系统只在单一环境中展示持续提升。一个在网页任务中形成的策略,能否迁移到代码、桌面操作或其他任务,仍缺乏充分证据。真正具有通用性的自进化系统,不仅要积累经验,还要将具体轨迹抽象为可迁移的知识。
8.4 如何控制成本和系统复杂度?
反复采样、调用多个评价模型、搜索工作流和训练新策略都可能产生高昂成本。未来评价不能只报告“提升了多少”,还需要报告为此消耗的时间、token、工具调用和人工干预,并观察成本是否随进化阶段持续增长。
8.5 如何保证长期安全与可控?
静态系统的安全测试发生在部署前,而自进化系统在部署后仍会变化。新的记忆可能被污染,自动生成的工具可能包含漏洞,奖励信号也可能被系统钻空子。因此,安全机制需要覆盖完整生命周期,包括沙箱执行、更新前测试、持续监控、审计日志、版本回滚和高风险操作的人类审批。
自进化系统的核心挑战可以概括为:它不仅要具备改变自身的能力,还必须知道何时改变、改变什么、依据什么改变,以及如何证明改变是有益且安全的。
9. 总结
自进化智能体代表了智能体研究从“构建一个固定系统”向“构建一个能够持续成长的系统”转变。本文介绍的综述从进化对象、时间尺度、学习机制、应用场景和评价方式五个方面,对这一方向进行了系统梳理。
现阶段,自进化智能体已经展现出多种可行路径:模型可以从交互数据中更新参数,记忆可以积累和提炼经验,工具可以被创建与掌握,工作流和多智能体结构也可以通过搜索得到优化。然而,现有方法仍多集中于短周期或受控环境中的性能提升。长期保持、跨域泛化、成本控制和持续安全,仍是该方向迈向真实部署必须解决的问题。
未来,评价一个智能体是否真正具备“进化”能力,不能只看它是否在下一次尝试中得到更高分,还要考察它是否能够在长期交互中持续吸收可靠经验、保留已有能力、迁移到新环境,并始终保持可解释、可回滚和可控制。只有当“学习能力”与“治理能力”同步发展,自进化智能体才可能从实验性系统走向稳定可靠的现实应用。
参考文献
[1] Gao, H.-a., Geng, J., Hua, W., et al. A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence. Transactions on Machine Learning Research, 2026.
[2] Shinn, N., Cassano, F., Berman, E., et al. Reflexion: Language Agents with Verbal Reinforcement Learning. Advances in Neural Information Processing Systems, 2023.
[3] Madaan, A., Tandon, N., Gupta, P., et al. Self-Refine: Iterative Refinement with Self-Feedback. Advances in Neural Information Processing Systems, 2023.
[4] Wang, G., Xie, Y., Jiang, Y., et al. Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291, 2023.
[5] Zhao, A., Huang, D., Xu, Q., et al. ExpeL: LLM Agents Are Experiential Learners. Proceedings of the AAAI Conference on Artificial Intelligence, 2024.
[6] Hu, S., Lu, C., and Clune, J. Automated Design of Agentic Systems. arXiv:2408.08435, 2024.
[7] Zhang, J., Xiang, J., Yu, Z., et al. AFlow: Automating Agentic Workflow Generation. arXiv:2410.10762, 2024.
[8] Yuan, S., Song, K., Chen, J., et al. EvoAgent: Towards Automatic Multi-Agent Generation via Evolutionary Algorithms. arXiv:2406.14228, 2024.
[9] Qiu, J., Qi, X., Zhang, T., et al. ALITA: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution. arXiv:2505.20286, 2025.
[10] Zhang, J., Hu, S., Lu, C., et al. Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents. arXiv:2505.22954, 2025.
[11] Zheng, J., Cai, X., Li, Q., et al. LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners. arXiv:2505.11942, 2025.
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:北邮 GAMMA Lab 王秋雨 王秋雨《论文解读 | 从静态执行到持续成长:自进化智能体研究综述》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论