文中所有方法名称后的括号(如 Reflexion (Shinn et al., 2023))均为原论文中引用的文献来源;章节号(如 §5.1)对应原论文章节。
一、先搞懂:这一章到底在讲什么?
想象你养了一只"AI 宠物"(智能体 Agent),你希望它越用越聪明,而不是永远停留在出厂水平。问题是:怎么让它变聪明? 这就是 “How to Evolve”(如何演化)要回答的问题。
用论文的正式语言说:自演化智能体需要一个"演化策略",把系统从旧状态 Π 变成新状态 Π′(§5 引言)。传统做法是"一次性训练"——就像上学时一次性考完试就再也不学习了;而自演化强调的是一个持续进行的过程:智能体从真实交互中学习、主动寻求反馈、自我反思、自己生成或筛选新数据,并随环境变化调整策略(§5 引言)。
论文把目前所有的"进化方法"归纳成三大流派,它们像三代技术一样依次出现,每一代都在弥补上一代的缺陷(§5 引言):
| 流派 | 一句话理解 | 好比 | 优点 | 缺点 |
|---|---|---|---|---|
| ① 奖励驱动(Reward-based) | 做对给糖吃,做错给批评 | 训练宠物用零食 | 目标明确、自主性强 | “糖"的设计很难,设计不好就学歪 |
| ② 模仿学习(Imitation-based) | 直接抄学霸的作业 | 看例题学解题 | 学得快、学得稳 | 只会模仿,探索新招的能力弱 |
| ③ 种群进化(Population-based) | 养一大群,优胜劣汰 | 生物进化/养蛊 | 能发现意想不到的新方法 | 非常烧钱(计算量大) |
论文原话总结这条演进路线:奖励方法首先"闭合了反馈回路"但脆弱且昂贵;模仿学习用高质量示范让演化更稳定,但有时牺牲了探索;种群进化则把适应扩展到集体规模,强调多样性与涌现协作——三者共同勾勒出**“从个体自我提升走向集体智能”**的轨迹(§5 引言)。
二、第一流派:奖励驱动的自演化(§5.1)
核心思想:给智能体一个"反馈信号”(奖励),让它根据反馈迭代改进自己。关键在于奖励信号怎么设计。论文按反馈的来源把方法分成四类(§5.1,对应原论文 Figure 6):
2.1 文本反馈(Textual Feedback)——用"自然语言"当奖励
不给你打一个分数,而是直接用语言告诉你"哪里错了、该怎么改",就像老师批改作文写评语。
- Reflexion (Shinn et al., 2023):提出"语言强化学习"(verbal reinforcement learning)。智能体用自然语言反思过去的失败,把反思存进"情景记忆",下次决策时参考。好比每次考完试写错题本。
- AdaPlanner (Sun et al., 2023):闭环自适应规划——根据"计划内"和"计划外"的反馈修改计划,还能减少幻觉。
- Self-Refine (Madaan et al., 2023a) 和 SELF (Lu et al., 2023):让模型多轮"自我批评、自我修改",证明即使是最强模型也能靠自我反馈继续提升,不需要额外监督数据。
- TextGrad (Yellamraju et al., 2024):把文本批评类比成深度学习里的"梯度",用"文字版反向传播"优化系统。
小结:语言作为奖励通道,细腻、灵活、省样本(§5.1 Textual Feedback 段)。
2.2 内部奖励(Internal Rewards)——“跟着感觉走”
不看外部评价,而是用模型自己的置信度/概率估计来判断好坏。好比一个人凭"把握程度"自我评估。
- CISC (Taubenfeld et al., 2025):按置信度给多条推理路径加权,从多个候选答案中筛出高质量的,既准又省算力。
- Self-Ensemble (Xu et al., 2025b):把选项分成小组再聚合预测,缓解"过度自信"问题。
- Self-Rewarding Language Models (Yuan et al., 2025b):模型自己当自己的"奖励函数",通过"自指令 + 自评估"循环生成训练数据。
- AgentEvolver (Zhai et al., 2025):三合一机制——自我提问(自己出任务)、自我导航(用经验引导探索)、自我归因(精细分配每一步的功劳/责任)。
小结:这类方法减少了对人工标注和外部评估器的依赖,可以实现无需人类干预、持续运转的自我改进闭环(§5.1 Internal Rewards 段)。
2.3 外部奖励(External Rewards)——来自外界的"客观信号"
奖励来自模型之外,主要有三种(§5.1 External Rewards 段):
- 多数投票(Majority Voting):让模型生成多个答案,“少数服从多数”,把一致性当作正确性的代理信号(如 Shafayat et al., 2025; Wei et al., 2025c; Zhang et al., 2025j)。
- 环境反馈(Environment Feedback):智能体直接和真实环境/工具交互,从结果中学习,如 SWE-Dev (Du et al., 2025)、SICA (Robeyns et al., 2025a)、DYSTIL (Wang et al., 2025c)。好比学游泳必须下水。
- 规则奖励(Rule-based Rewards):用明确的规则或逻辑约束当"裁判",在数学推理、游戏等"对错可验证"的领域特别好用(如 OTC-PO (Wang et al., 2025h)、AUTORULE (Wang & Xiong, 2025)、LADDER (Simonds & Yoshiyama, 2025)、RAGEN (Wang et al., 2025q))。
小结:客观可靠,但可能需要大量工程设计,表达能力有限(§5.1)。
2.4 隐式奖励(Implicit Rewards)——“没有奖励也能学”
最神奇的一类:即使反馈信号没有被明确标注为奖励,模型也能从中学习。
- Reward Is Enough / ICRL Prompting (Song et al., 2025):在上下文窗口里放几个简单标量信号,模型就能做"上下文内强化学习",无需真正的 RL 微调。
- Endogenous Reward (Li et al., 2025e):揭示了一个惊人事实——模型日常的"预测下一个词"训练,本身就隐含学出了一个通用奖励函数,可以直接从模型 logits 里"提取"出来。
- PIT (Wang et al., 2024i):从人类偏好数据中隐式学习"改进目标",无需额外人工努力。
§5.1 总结:奖励驱动演化提供了明确的优化目标和强自主性,但对奖励设计非常敏感——“经常在稳定性/安全性与适应性/开放性之间做权衡”(§5.1 末段)。
三、第二流派:模仿与示范学习(§5.2)
核心思想:不让智能体自己瞎摸索,而是直接给它看"完整正确答案"(示范 demonstration),让它照着学。
和奖励方法的区别(§5.2 开头):
- 模仿学习是"规定性"的:给你一份完整的成功攻略(比如完整推理过程),你照着复现就行;
- 奖励方法是"评估性"的:只告诉你结果好不好,路要自己试出来。
在自演化语境下,“专家"不一定是人类——示范可以由智能体自己产生、由其他更强的智能体产生、或从环境交互中合成(§5.2)。按示范来源分三类:
3.1 自生成示范学习(§5.2.1)——“自己给自己出题改卷”
- STaR (Zelikman et al., 2022):奠基性框架。流程像"刷题循环”:生成推理链 → 只在答对的题上微调 → 重复。不需要人工写的推理过程,模型自己" bootstrap(自力更生)“出推理能力。
- V-STaR (Hosseini et al., 2024):加了一个"验证器"模型,先检查生成的推理链质量再拿来训练,更可靠。
- AdaSTaR (Koh et al., 2025):根据模型在各类题上的表现,动态调整训练数据配比,防止偏科。
- 多模态方向:STIC (Deng et al., 2024) 让视觉语言模型用自己生成的图像描述来迭代提升自己;GENIXER (Zhao et al., 2024c) 让多模态大模型自己当"数据生成器”。
3.2 跨智能体示范学习(§5.2.2)——“同学之间互相抄作业”
- SiriuS (Zhao et al., 2025b):多智能体系统维护一个共享"经验库",里面存着各个智能体的成功轨迹,大家都能用集体经验加速学习。像一个班级共享错题本和好题本。
- 领域应用:推荐系统中的自优化微调 SOFT (Tang et al., 2025)——从成功的推荐记录中生成示范,反过来微调模型,推荐越来越个性化。
3.3 混合示范学习(§5.2.3)——“自己的 + 别人的,都要”
- RISE (Qu et al., 2024b):递归自我改进——智能体内省自己的推理过程、找出薄弱点、生成"纠正性示范"针对性补强,形成持续改进循环。
- IoE (Li et al., 2024b):用置信度筛选示范——低质量的示范会"带坏"模型,所以只用高置信度、高质量的样本训练。
§5.2 总结:模仿学习靠高质量示范让学习更稳定、样本效率更高,但"经常用探索性和泛化能力换取可靠性和样本效率"(§5.2 末段)。如果所在领域缺少好示范,这招就不灵了。
四、第三流派:种群与进化方法(§5.3)
核心思想:向大自然学习——不优化单个个体,而是同时养一群智能体变体,用"选择、变异、交叉、竞争"让好方案活下来(§5.3)。
历史渊源(§5.3 开头):John Holland 的**遗传算法(GA)确立了选择/交叉/变异三大算子 (Holland, 1976);John Koza 的遗传编程(GP)**直接进化可执行程序 (Koza, 2010);NEAT 算法能进化神经网络的整个拓扑结构 (Stanley & Miikkulainen, 2002)。
为什么需要它?当解空间复杂、多峰(有很多个"还不错的答案"),或者最优策略需要架构级大改而非微调参数时,并行搜索比梯度下降更有优势(§5.3)。
4.1 单智能体进化(§5.3.1)
(a)从进化中学习(Learning from Evolution)
- DGM 达尔文-哥德尔机 (Zhang et al., 2025h):明星方法。它保存所有历史版本的档案,可以从任何一个"祖先"分支进化(不是一条道走到黑);智能体能直接修改自己的 Python 代码库实现"自我指涉"式改进;选择"父母"时既看成绩也看"新颖性",鼓励多样探索。
- LLM_GP (Hemberg et al., 2024) / CodeEvolve (Assumpção et al., 2025):让 LLM 自己充当变异、交叉、选择算子,直接对代码文本做进化;CodeEvolve 用"岛屿式遗传算法"在数学基准上甚至超过了专有系统 AlphaEvolve (Novikov et al., 2025)。
- GENOME / GENOME+ (Zhang et al., 2025r):把遗传算法直接用在模型参数上——对权重做交叉、变异、选择,证明"不用梯度"也能进化模型。
- EvoLLM-JP (Akiba et al., 2025):用进化算法把多个基础模型"合并"成一个更强的专用模型。
- SOAR (Pourcel et al., 2025):进化搜索和"事后学习"交替进行——成功和失败的尝试都变成微调数据,形成良性循环。
(b)自我博弈(Self-Play)
灵感来自 AlphaZero (Silver et al., 2017):不靠人类棋谱,自己跟自己下棋就能成绝顶高手。妙处在于**“共同进化”**:你变强了,你的对手(过去的你)也变强,课程难度永远自动匹配你的水平(§5.3.1 Self-Play 段)。
- Absolute Zero (Zhao et al., 2025a) / R-Zero (Huang et al., 2025b):一个"挑战者"专门给"求解者"出难题——题目要难到刚好在求解者能力边界上。
- Socratic-Zero (Wang et al., 2025m):三方协同——Solver 解题、Teacher 出难题、Generator 把 Teacher 的出题策略"蒸馏"出来批量生产课程。
- R-Few (Yu et al., 2025b):用少量人类示例"锚定"挑战者,防止纯自主系统"跑偏"(概念漂移、多样性崩塌)。
- SPIN (Chen et al., 2024f):当前模型 vs 历史版本,制造进化压力。
- SPC (Chen et al., 2025c):一个"狡猾生成器"专门制造隐蔽错误,一个"步骤批评器"学习抓错,对抗中共同进化。
- SPELL (Yang et al., 2025e):一个模型循环扮演提问者、回答者、验证者三个角色,解决长上下文推理中难以自动验证的问题。
自我博弈与模仿学习的区别(§5.3.1):STaR 类方法是"筛选静态的成功轨迹来训练";而自我博弈的学习信号来自博弈互动过程本身——即使没有完美范例,也能从"相对胜负"中学习。
4.2 多智能体进化(§5.3.2)——进化"整个团队"
(a)系统架构进化:优化团队结构、分工与工作流
- EvoMAC (Hu et al., 2024d):模仿神经网络训练,把编译错误、测试失败当作"损失函数",做"文本版反向传播"——专门的"更新团队"分析反馈、找出问题智能体、生成修改指令。
- Puppeteer (Dang et al., 2025):一个"木偶师"(中央编排器)用强化学习进化调度策略,动态决定每一步激活哪些"木偶"(智能体),在效果和算力成本间平衡。
- FELA (Wang et al., 2025e):工业级应用——“Idea"“Code"“Critic"三类智能体协作进化,从复杂数据中挖掘高性能特征。
- Agent0 (Xia et al., 2025b):从零数据开始,“课程智能体"和"执行智能体"互相成就、协同进化。
(b)知识库进化:不动参数,靠积累集体知识变强
- MDTeamGPT (Chen et al., 2025e):双知识库——CorrectKB 存成功案例,ChainKB 存失败反思,既从成功也从错误中学习。
- MedAgentSim (Almansoori et al., 2025b):医疗诊断场景,从病人交互中积累经验,用检索增强生成(RAG)越诊越准。
- PiFlow (Pu et al., 2025):科学发现场景,维护"原理-结果"对,用信息论优化引导假设生成。
§5.3 总结:种群与自我博弈进化增强了多样性和开放式发现能力,但"通常比单智能体范式计算成本更高、可解释性更低”(§5.3 末段)。
五、横切维度:三大流派怎么选?(§5.4)
三大流派不是非此即彼。论文用三个"正交坐标轴"帮你分析任何自演化方法(§5.4,对应原论文 Figure 7):
5.1 在线学习 vs 离线学习(§5.4.1)——“边上班边学"还是"先脱产培训”
- 离线学习(Offline):学习和实际干活分开。先收集数据 → 筛选 → 微调,部署前把模型练强。
- 代表:Self-Instruct (Wang et al., 2022) 让模型自己生成指令和回答来自举;WizardLM (Xu et al., 2024a) 逐步提升自生成指令的难度;OS-Genesis (Sun et al., 2024b)、UI-Genie (Xiao et al., 2025a) 为 GUI 智能体自动造轨迹数据;GUI-R1 (Luo et al., 2025b)、InfiGUI-R1 (Liu et al., 2025e) 在离线数据上做规则奖励的 RL。
- 在线学习(Online):边和环境交互边实时调整。
- 代表:Voyager (Wang et al., 2023a) 在《我的世界》里边玩边学,自建课程和技能库;AdaPlanner (Sun et al., 2023) 在任务中在线改计划;SwiftSage (Lin et al., 2023) “快思考失败就切换慢思考”;DigiRL (Bai et al., 2024)、DistRL (Wang et al., 2024g)、MobileGUI-RL (Shi et al., 2025b) 用在线 RL 训练设备控制智能体。
5.2 同策略 vs 异策略(§5.4.2)——“只信自己的经验"还是"别人的经验也用”
- 同策略(On-policy):只从"当前版本的自己"产生的经验学习。稳定、不会"学岔”,但每次都新要采集数据,费样本、费算力。
- 代表:Reflexion (Shinn et al., 2023)、GRPO (Shao et al., 2024b)、DAPO (Yu et al., 2025a)。
- 异策略(Off-policy):历史版本、其他智能体、人类示范的经验都能用。省样本,但有"分布偏移"风险(经验来自旧策略,新策略可能学偏),还可能被"钻空子”(reward hacking)。
- 代表:Yuan et al. (2024c) 用 DPO 的 KL 约束防止新策略偏离太远;Yuan et al. (2023) 的 RRHF 把对齐当成排序问题;SiriuS (Zhao et al., 2025b) 的共享经验库。
5.3 奖励粒度(§5.4.3)——“只看期末成绩"还是"每次作业都批改”
- 结果奖励(Outcome-based):只看最终成败,不管中间步骤。信号稀疏但简单。
- 代表:DPO (Rafailov et al., 2023)、RRHF (Yuan et al., 2023)、AutoWebGLM (Lai et al., 2024) 的拒绝采样微调、WebRL (Qi et al., 2024) 的结果监督奖励模型 ORM。
- 过程奖励(Process-based):每一步都打分。更精细可靠,但传统上要人工标注,又贵又慢。
- 破局方法:Math-Shepherd (Wang et al., 2023b) 用蒙特卡洛树搜索(MCTS)自动给步骤打分;AlphaMath (Chen et al., 2024a) 训练价值模型评估步骤;rStar-Math (Guan et al., 2025)、AgentPRM (Choudhury, 2025) 让策略和过程奖励模型一起迭代进化;Agent Q (Putta et al., 2024) 在 MCTS 中加步骤验证再用 DPO 精炼。
- 混合奖励(Hybrid):两者结合——既有最终目标指引方向,又有步骤级纠偏。
- 代表:GiGPO (Feng et al., 2025a) 的双层奖励(episode 级 + step 级);SPA-RL (Wang et al., 2025d) 把最终结果奖励"分摊"到每一步。
5.4 一张表看懂三大流派对比(§5.5,整理自原论文 Table 4)
| 维度 | 奖励驱动 | 模仿/示范学习 | 种群进化 |
|---|---|---|---|
| 反馈类型 | 标量奖励、自然语言、置信度、外部信号 | 示范轨迹、范例、推理依据 | 适应度分数、任务成败、竞争信号 |
| 数据来源 | 自己生成、环境、外部规则 | 自己/其他智能体/人类 | 种群世代、多智能体系统 |
| 样本效率 | 中等(取决于奖励稀疏程度) | 高(示范质量高时) | 低(要试很多次) |
| 稳定性 | 敏感于奖励设计(怕 reward hacking) | 敏感于示范质量/多样性 | 敏感于种群规模/多样性(怕早熟收敛) |
| 可扩展性 | 反馈自动化时扩展性好(如模拟器) | 受示范收集成本限制 | 可扩展但资源密集 |
六、给小白的三句话总结
- 想让 AI 自己变强,有三条路线:用奖励信号引导(§5.1)、用优秀示范带路(§5.2)、用种群竞争进化(§5.3)——它们分别像"赏罚训练"“抄学霸作业"“生物进化”。
- 没有银弹:奖励方法灵活但怕奖励设计失误;模仿学习快而稳但缺探索;种群方法能发现惊喜但烧钱(§5.5 Table 4)。
- 选方法时想三个问题:数据是边用边收还是先收好(在线/离线)?学自己的还是学别人的经验(同策略/异策略)?反馈是看最终结果还是逐步打分(奖励粒度)?(§5.4)
附:术语速查表
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 智能体 | Agent | 能感知环境、做决策、执行动作的 AI 系统 |
| 大语言模型 | LLM | 如 GPT 系列,智能体的"大脑” |
| 上下文学习 | ICL (In-Context Learning) | 不改模型参数,只在提示词里给示例让模型现学 |
| 监督微调 | SFT (Supervised Fine-Tuning) | 用标注好的数据调整模型参数 |
| 强化学习 | RL (Reinforcement Learning) | 通过奖励/惩罚信号试错学习 |
| DPO | Direct Preference Optimization | 直接从"哪个回答更好"的偏好数据学习的方法 (Rafailov et al., 2023) |
| MCTS | Monte Carlo Tree Search | 蒙特卡洛树搜索,一种"向前模拟多步再决策"的搜索算法 |
| 奖励黑客 | Reward Hacking | 智能体钻奖励函数的空子,“高分低能” |
| 分布偏移 | Distribution Shift | 训练数据和新策略产生的数据"对不上”,导致学偏 |
| 自举 | Bootstrapping | “自力更生”——用自己的输出改进自己 |
资料来源:本文全部内容整理自《A Survey of Self-Evolving Agents》第五章 “How to Evolve”(§5.1–§5.5,论文第 19–31 页,含 Table 3、Table 4、Figure 6、Figure 7),发表于 Transactions on Machine Learning Research (01/2026)。文中各方法后的引用(如 Shinn et al., 2023)为原论文参考文献,如需深入阅读请查阅原论文参考文献列表。