自进化智能体如何进化?

本文是对论文《A Survey of Self-Evolving Agents》(发表于 Transactions on Machine Learning Research, 01/2026)第五章 "How to Evolve"(论文第 19–31 页)的通俗化总结。本文由Kimi K3生成。

文中所有方法名称后的括号(如 Reflexion (Shinn et al., 2023))均为原论文中引用的文献来源;章节号(如 §5.1)对应原论文章节。


一、先搞懂:这一章到底在讲什么?

想象你养了一只"AI 宠物"(智能体 Agent),你希望它越用越聪明,而不是永远停留在出厂水平。问题是:怎么让它变聪明? 这就是 “How to Evolve”(如何演化)要回答的问题。

用论文的正式语言说:自演化智能体需要一个"演化策略",把系统从旧状态 Π 变成新状态 Π′(§5 引言)。传统做法是"一次性训练"——就像上学时一次性考完试就再也不学习了;而自演化强调的是一个持续进行的过程:智能体从真实交互中学习、主动寻求反馈、自我反思、自己生成或筛选新数据,并随环境变化调整策略(§5 引言)。

论文把目前所有的"进化方法"归纳成三大流派,它们像三代技术一样依次出现,每一代都在弥补上一代的缺陷(§5 引言):

流派一句话理解好比优点缺点
① 奖励驱动(Reward-based)做对给糖吃,做错给批评训练宠物用零食目标明确、自主性强“糖"的设计很难,设计不好就学歪
② 模仿学习(Imitation-based)直接抄学霸的作业看例题学解题学得快、学得稳只会模仿,探索新招的能力弱
③ 种群进化(Population-based)养一大群,优胜劣汰生物进化/养蛊能发现意想不到的新方法非常烧钱(计算量大)

论文原话总结这条演进路线:奖励方法首先"闭合了反馈回路"但脆弱且昂贵;模仿学习用高质量示范让演化更稳定,但有时牺牲了探索;种群进化则把适应扩展到集体规模,强调多样性与涌现协作——三者共同勾勒出**“从个体自我提升走向集体智能”**的轨迹(§5 引言)。


二、第一流派:奖励驱动的自演化(§5.1)

核心思想:给智能体一个"反馈信号”(奖励),让它根据反馈迭代改进自己。关键在于奖励信号怎么设计。论文按反馈的来源把方法分成四类(§5.1,对应原论文 Figure 6):

2.1 文本反馈(Textual Feedback)——用"自然语言"当奖励

不给你打一个分数,而是直接用语言告诉你"哪里错了、该怎么改",就像老师批改作文写评语。

  • Reflexion (Shinn et al., 2023):提出"语言强化学习"(verbal reinforcement learning)。智能体用自然语言反思过去的失败,把反思存进"情景记忆",下次决策时参考。好比每次考完试写错题本。
  • AdaPlanner (Sun et al., 2023):闭环自适应规划——根据"计划内"和"计划外"的反馈修改计划,还能减少幻觉。
  • Self-Refine (Madaan et al., 2023a)SELF (Lu et al., 2023):让模型多轮"自我批评、自我修改",证明即使是最强模型也能靠自我反馈继续提升,不需要额外监督数据
  • TextGrad (Yellamraju et al., 2024):把文本批评类比成深度学习里的"梯度",用"文字版反向传播"优化系统。

小结:语言作为奖励通道,细腻、灵活、省样本(§5.1 Textual Feedback 段)。

2.2 内部奖励(Internal Rewards)——“跟着感觉走”

不看外部评价,而是用模型自己的置信度/概率估计来判断好坏。好比一个人凭"把握程度"自我评估。

  • CISC (Taubenfeld et al., 2025):按置信度给多条推理路径加权,从多个候选答案中筛出高质量的,既准又省算力。
  • Self-Ensemble (Xu et al., 2025b):把选项分成小组再聚合预测,缓解"过度自信"问题。
  • Self-Rewarding Language Models (Yuan et al., 2025b):模型自己当自己的"奖励函数",通过"自指令 + 自评估"循环生成训练数据。
  • AgentEvolver (Zhai et al., 2025):三合一机制——自我提问(自己出任务)、自我导航(用经验引导探索)、自我归因(精细分配每一步的功劳/责任)。

小结:这类方法减少了对人工标注和外部评估器的依赖,可以实现无需人类干预、持续运转的自我改进闭环(§5.1 Internal Rewards 段)。

2.3 外部奖励(External Rewards)——来自外界的"客观信号"

奖励来自模型之外,主要有三种(§5.1 External Rewards 段):

  1. 多数投票(Majority Voting):让模型生成多个答案,“少数服从多数”,把一致性当作正确性的代理信号(如 Shafayat et al., 2025; Wei et al., 2025c; Zhang et al., 2025j)。
  2. 环境反馈(Environment Feedback):智能体直接和真实环境/工具交互,从结果中学习,如 SWE-Dev (Du et al., 2025)、SICA (Robeyns et al., 2025a)、DYSTIL (Wang et al., 2025c)。好比学游泳必须下水。
  3. 规则奖励(Rule-based Rewards):用明确的规则或逻辑约束当"裁判",在数学推理、游戏等"对错可验证"的领域特别好用(如 OTC-PO (Wang et al., 2025h)、AUTORULE (Wang & Xiong, 2025)、LADDER (Simonds & Yoshiyama, 2025)、RAGEN (Wang et al., 2025q))。

小结:客观可靠,但可能需要大量工程设计,表达能力有限(§5.1)。

2.4 隐式奖励(Implicit Rewards)——“没有奖励也能学”

最神奇的一类:即使反馈信号没有被明确标注为奖励,模型也能从中学习。

  • Reward Is Enough / ICRL Prompting (Song et al., 2025):在上下文窗口里放几个简单标量信号,模型就能做"上下文内强化学习",无需真正的 RL 微调。
  • Endogenous Reward (Li et al., 2025e):揭示了一个惊人事实——模型日常的"预测下一个词"训练,本身就隐含学出了一个通用奖励函数,可以直接从模型 logits 里"提取"出来。
  • PIT (Wang et al., 2024i):从人类偏好数据中隐式学习"改进目标",无需额外人工努力。

§5.1 总结:奖励驱动演化提供了明确的优化目标和强自主性,但对奖励设计非常敏感——“经常在稳定性/安全性与适应性/开放性之间做权衡”(§5.1 末段)。


三、第二流派:模仿与示范学习(§5.2)

核心思想:不让智能体自己瞎摸索,而是直接给它看"完整正确答案"(示范 demonstration),让它照着学。

和奖励方法的区别(§5.2 开头):

  • 模仿学习是"规定性"的:给你一份完整的成功攻略(比如完整推理过程),你照着复现就行;
  • 奖励方法是"评估性"的:只告诉你结果好不好,路要自己试出来。

在自演化语境下,“专家"不一定是人类——示范可以由智能体自己产生、由其他更强的智能体产生、或从环境交互中合成(§5.2)。按示范来源分三类:

3.1 自生成示范学习(§5.2.1)——“自己给自己出题改卷”

  • STaR (Zelikman et al., 2022):奠基性框架。流程像"刷题循环”:生成推理链 → 只在答对的题上微调 → 重复。不需要人工写的推理过程,模型自己" bootstrap(自力更生)“出推理能力。
  • V-STaR (Hosseini et al., 2024):加了一个"验证器"模型,先检查生成的推理链质量再拿来训练,更可靠。
  • AdaSTaR (Koh et al., 2025):根据模型在各类题上的表现,动态调整训练数据配比,防止偏科。
  • 多模态方向:STIC (Deng et al., 2024) 让视觉语言模型用自己生成的图像描述来迭代提升自己;GENIXER (Zhao et al., 2024c) 让多模态大模型自己当"数据生成器”。

3.2 跨智能体示范学习(§5.2.2)——“同学之间互相抄作业”

  • SiriuS (Zhao et al., 2025b):多智能体系统维护一个共享"经验库",里面存着各个智能体的成功轨迹,大家都能用集体经验加速学习。像一个班级共享错题本和好题本。
  • 领域应用:推荐系统中的自优化微调 SOFT (Tang et al., 2025)——从成功的推荐记录中生成示范,反过来微调模型,推荐越来越个性化。

3.3 混合示范学习(§5.2.3)——“自己的 + 别人的,都要”

  • RISE (Qu et al., 2024b):递归自我改进——智能体内省自己的推理过程、找出薄弱点、生成"纠正性示范"针对性补强,形成持续改进循环。
  • IoE (Li et al., 2024b):用置信度筛选示范——低质量的示范会"带坏"模型,所以只用高置信度、高质量的样本训练。

§5.2 总结:模仿学习靠高质量示范让学习更稳定、样本效率更高,但"经常用探索性和泛化能力换取可靠性和样本效率"(§5.2 末段)。如果所在领域缺少好示范,这招就不灵了。


四、第三流派:种群与进化方法(§5.3)

核心思想:向大自然学习——不优化单个个体,而是同时养一群智能体变体,用"选择、变异、交叉、竞争"让好方案活下来(§5.3)。

历史渊源(§5.3 开头):John Holland 的**遗传算法(GA)确立了选择/交叉/变异三大算子 (Holland, 1976);John Koza 的遗传编程(GP)**直接进化可执行程序 (Koza, 2010);NEAT 算法能进化神经网络的整个拓扑结构 (Stanley & Miikkulainen, 2002)。

为什么需要它?当解空间复杂、多峰(有很多个"还不错的答案"),或者最优策略需要架构级大改而非微调参数时,并行搜索比梯度下降更有优势(§5.3)。

4.1 单智能体进化(§5.3.1)

(a)从进化中学习(Learning from Evolution)

  • DGM 达尔文-哥德尔机 (Zhang et al., 2025h):明星方法。它保存所有历史版本的档案,可以从任何一个"祖先"分支进化(不是一条道走到黑);智能体能直接修改自己的 Python 代码库实现"自我指涉"式改进;选择"父母"时既看成绩也看"新颖性",鼓励多样探索。
  • LLM_GP (Hemberg et al., 2024) / CodeEvolve (Assumpção et al., 2025):让 LLM 自己充当变异、交叉、选择算子,直接对代码文本做进化;CodeEvolve 用"岛屿式遗传算法"在数学基准上甚至超过了专有系统 AlphaEvolve (Novikov et al., 2025)。
  • GENOME / GENOME+ (Zhang et al., 2025r):把遗传算法直接用在模型参数上——对权重做交叉、变异、选择,证明"不用梯度"也能进化模型。
  • EvoLLM-JP (Akiba et al., 2025):用进化算法把多个基础模型"合并"成一个更强的专用模型。
  • SOAR (Pourcel et al., 2025):进化搜索和"事后学习"交替进行——成功和失败的尝试都变成微调数据,形成良性循环。

(b)自我博弈(Self-Play)

灵感来自 AlphaZero (Silver et al., 2017):不靠人类棋谱,自己跟自己下棋就能成绝顶高手。妙处在于**“共同进化”**:你变强了,你的对手(过去的你)也变强,课程难度永远自动匹配你的水平(§5.3.1 Self-Play 段)。

  • Absolute Zero (Zhao et al., 2025a) / R-Zero (Huang et al., 2025b):一个"挑战者"专门给"求解者"出难题——题目要难到刚好在求解者能力边界上。
  • Socratic-Zero (Wang et al., 2025m):三方协同——Solver 解题、Teacher 出难题、Generator 把 Teacher 的出题策略"蒸馏"出来批量生产课程。
  • R-Few (Yu et al., 2025b):用少量人类示例"锚定"挑战者,防止纯自主系统"跑偏"(概念漂移、多样性崩塌)。
  • SPIN (Chen et al., 2024f):当前模型 vs 历史版本,制造进化压力。
  • SPC (Chen et al., 2025c):一个"狡猾生成器"专门制造隐蔽错误,一个"步骤批评器"学习抓错,对抗中共同进化。
  • SPELL (Yang et al., 2025e):一个模型循环扮演提问者、回答者、验证者三个角色,解决长上下文推理中难以自动验证的问题。

自我博弈与模仿学习的区别(§5.3.1):STaR 类方法是"筛选静态的成功轨迹来训练";而自我博弈的学习信号来自博弈互动过程本身——即使没有完美范例,也能从"相对胜负"中学习。

4.2 多智能体进化(§5.3.2)——进化"整个团队"

(a)系统架构进化:优化团队结构、分工与工作流

  • EvoMAC (Hu et al., 2024d):模仿神经网络训练,把编译错误、测试失败当作"损失函数",做"文本版反向传播"——专门的"更新团队"分析反馈、找出问题智能体、生成修改指令。
  • Puppeteer (Dang et al., 2025):一个"木偶师"(中央编排器)用强化学习进化调度策略,动态决定每一步激活哪些"木偶"(智能体),在效果和算力成本间平衡。
  • FELA (Wang et al., 2025e):工业级应用——“Idea"“Code"“Critic"三类智能体协作进化,从复杂数据中挖掘高性能特征。
  • Agent0 (Xia et al., 2025b):从零数据开始,“课程智能体"和"执行智能体"互相成就、协同进化。

(b)知识库进化:不动参数,靠积累集体知识变强

  • MDTeamGPT (Chen et al., 2025e):双知识库——CorrectKB 存成功案例,ChainKB 存失败反思,既从成功也从错误中学习。
  • MedAgentSim (Almansoori et al., 2025b):医疗诊断场景,从病人交互中积累经验,用检索增强生成(RAG)越诊越准。
  • PiFlow (Pu et al., 2025):科学发现场景,维护"原理-结果"对,用信息论优化引导假设生成。

§5.3 总结:种群与自我博弈进化增强了多样性和开放式发现能力,但"通常比单智能体范式计算成本更高、可解释性更低”(§5.3 末段)。


五、横切维度:三大流派怎么选?(§5.4)

三大流派不是非此即彼。论文用三个"正交坐标轴"帮你分析任何自演化方法(§5.4,对应原论文 Figure 7):

5.1 在线学习 vs 离线学习(§5.4.1)——“边上班边学"还是"先脱产培训”

  • 离线学习(Offline):学习和实际干活分开。先收集数据 → 筛选 → 微调,部署前把模型练强。
    • 代表:Self-Instruct (Wang et al., 2022) 让模型自己生成指令和回答来自举;WizardLM (Xu et al., 2024a) 逐步提升自生成指令的难度;OS-Genesis (Sun et al., 2024b)、UI-Genie (Xiao et al., 2025a) 为 GUI 智能体自动造轨迹数据;GUI-R1 (Luo et al., 2025b)、InfiGUI-R1 (Liu et al., 2025e) 在离线数据上做规则奖励的 RL。
  • 在线学习(Online):边和环境交互边实时调整。
    • 代表:Voyager (Wang et al., 2023a) 在《我的世界》里边玩边学,自建课程和技能库;AdaPlanner (Sun et al., 2023) 在任务中在线改计划;SwiftSage (Lin et al., 2023) “快思考失败就切换慢思考”;DigiRL (Bai et al., 2024)、DistRL (Wang et al., 2024g)、MobileGUI-RL (Shi et al., 2025b) 用在线 RL 训练设备控制智能体。

5.2 同策略 vs 异策略(§5.4.2)——“只信自己的经验"还是"别人的经验也用”

  • 同策略(On-policy):只从"当前版本的自己"产生的经验学习。稳定、不会"学岔”,但每次都新要采集数据,费样本、费算力
    • 代表:Reflexion (Shinn et al., 2023)、GRPO (Shao et al., 2024b)、DAPO (Yu et al., 2025a)。
  • 异策略(Off-policy):历史版本、其他智能体、人类示范的经验都能用。省样本,但有"分布偏移"风险(经验来自旧策略,新策略可能学偏),还可能被"钻空子”(reward hacking)。
    • 代表:Yuan et al. (2024c) 用 DPO 的 KL 约束防止新策略偏离太远;Yuan et al. (2023) 的 RRHF 把对齐当成排序问题;SiriuS (Zhao et al., 2025b) 的共享经验库。

5.3 奖励粒度(§5.4.3)——“只看期末成绩"还是"每次作业都批改”

  • 结果奖励(Outcome-based):只看最终成败,不管中间步骤。信号稀疏但简单。
    • 代表:DPO (Rafailov et al., 2023)、RRHF (Yuan et al., 2023)、AutoWebGLM (Lai et al., 2024) 的拒绝采样微调、WebRL (Qi et al., 2024) 的结果监督奖励模型 ORM。
  • 过程奖励(Process-based):每一步都打分。更精细可靠,但传统上要人工标注,又贵又慢。
    • 破局方法:Math-Shepherd (Wang et al., 2023b) 用蒙特卡洛树搜索(MCTS)自动给步骤打分;AlphaMath (Chen et al., 2024a) 训练价值模型评估步骤;rStar-Math (Guan et al., 2025)、AgentPRM (Choudhury, 2025) 让策略和过程奖励模型一起迭代进化;Agent Q (Putta et al., 2024) 在 MCTS 中加步骤验证再用 DPO 精炼。
  • 混合奖励(Hybrid):两者结合——既有最终目标指引方向,又有步骤级纠偏。
    • 代表:GiGPO (Feng et al., 2025a) 的双层奖励(episode 级 + step 级);SPA-RL (Wang et al., 2025d) 把最终结果奖励"分摊"到每一步。

5.4 一张表看懂三大流派对比(§5.5,整理自原论文 Table 4)

维度奖励驱动模仿/示范学习种群进化
反馈类型标量奖励、自然语言、置信度、外部信号示范轨迹、范例、推理依据适应度分数、任务成败、竞争信号
数据来源自己生成、环境、外部规则自己/其他智能体/人类种群世代、多智能体系统
样本效率中等(取决于奖励稀疏程度)(示范质量高时)低(要试很多次)
稳定性敏感于奖励设计(怕 reward hacking)敏感于示范质量/多样性敏感于种群规模/多样性(怕早熟收敛)
可扩展性反馈自动化时扩展性好(如模拟器)受示范收集成本限制可扩展但资源密集

六、给小白的三句话总结

  1. 想让 AI 自己变强,有三条路线:用奖励信号引导(§5.1)、用优秀示范带路(§5.2)、用种群竞争进化(§5.3)——它们分别像"赏罚训练"“抄学霸作业"“生物进化”。
  2. 没有银弹:奖励方法灵活但怕奖励设计失误;模仿学习快而稳但缺探索;种群方法能发现惊喜但烧钱(§5.5 Table 4)。
  3. 选方法时想三个问题:数据是边用边收还是先收好(在线/离线)?学自己的还是学别人的经验(同策略/异策略)?反馈是看最终结果还是逐步打分(奖励粒度)?(§5.4)

附:术语速查表

术语英文通俗解释
智能体Agent能感知环境、做决策、执行动作的 AI 系统
大语言模型LLM如 GPT 系列,智能体的"大脑”
上下文学习ICL (In-Context Learning)不改模型参数,只在提示词里给示例让模型现学
监督微调SFT (Supervised Fine-Tuning)用标注好的数据调整模型参数
强化学习RL (Reinforcement Learning)通过奖励/惩罚信号试错学习
DPODirect Preference Optimization直接从"哪个回答更好"的偏好数据学习的方法 (Rafailov et al., 2023)
MCTSMonte Carlo Tree Search蒙特卡洛树搜索,一种"向前模拟多步再决策"的搜索算法
奖励黑客Reward Hacking智能体钻奖励函数的空子,“高分低能”
分布偏移Distribution Shift训练数据和新策略产生的数据"对不上”,导致学偏
自举Bootstrapping“自力更生”——用自己的输出改进自己

资料来源:本文全部内容整理自《A Survey of Self-Evolving Agents》第五章 “How to Evolve”(§5.1–§5.5,论文第 19–31 页,含 Table 3、Table 4、Figure 6、Figure 7),发表于 Transactions on Machine Learning Research (01/2026)。文中各方法后的引用(如 Shinn et al., 2023)为原论文参考文献,如需深入阅读请查阅原论文参考文献列表。