<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Self-Evolution on 📝Mocong's Blogs</title><link>https://taffyboys.github.io/tags/self-evolution/</link><description>Recent content in Self-Evolution on 📝Mocong's Blogs</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://taffyboys.github.io/tags/self-evolution/index.xml" rel="self" type="application/rss+xml"/><item><title>自进化智能体如何进化？</title><link>https://taffyboys.github.io/posts/how_to_evolve/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://taffyboys.github.io/posts/how_to_evolve/</guid><description>&lt;blockquote&gt;
&lt;p&gt;文中所有方法名称后的括号（如 Reflexion (Shinn et al., 2023)）均为原论文中引用的文献来源；章节号（如 §5.1）对应原论文章节。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="一先搞懂这一章到底在讲什么"&gt;一、先搞懂：这一章到底在讲什么？&lt;/h2&gt;
&lt;p&gt;想象你养了一只&amp;quot;AI 宠物&amp;quot;（智能体 Agent），你希望它&lt;strong&gt;越用越聪明&lt;/strong&gt;，而不是永远停留在出厂水平。问题是：&lt;strong&gt;怎么让它变聪明？&lt;/strong&gt; 这就是 &amp;ldquo;How to Evolve&amp;rdquo;（如何演化）要回答的问题。&lt;/p&gt;
&lt;p&gt;用论文的正式语言说：自演化智能体需要一个&amp;quot;演化策略&amp;quot;，把系统从旧状态 Π 变成新状态 Π′（§5 引言）。传统做法是&amp;quot;一次性训练&amp;quot;——就像上学时一次性考完试就再也不学习了；而&lt;strong&gt;自演化&lt;/strong&gt;强调的是一个&lt;strong&gt;持续进行的过程&lt;/strong&gt;：智能体从真实交互中学习、主动寻求反馈、自我反思、自己生成或筛选新数据，并随环境变化调整策略（§5 引言）。&lt;/p&gt;
&lt;p&gt;论文把目前所有的&amp;quot;进化方法&amp;quot;归纳成&lt;strong&gt;三大流派&lt;/strong&gt;，它们像三代技术一样依次出现，每一代都在弥补上一代的缺陷（§5 引言）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;流派&lt;/th&gt;
					&lt;th&gt;一句话理解&lt;/th&gt;
					&lt;th&gt;好比&lt;/th&gt;
					&lt;th&gt;优点&lt;/th&gt;
					&lt;th&gt;缺点&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;① 奖励驱动（Reward-based）&lt;/td&gt;
					&lt;td&gt;做对给糖吃，做错给批评&lt;/td&gt;
					&lt;td&gt;训练宠物用零食&lt;/td&gt;
					&lt;td&gt;目标明确、自主性强&lt;/td&gt;
					&lt;td&gt;&amp;ldquo;糖&amp;quot;的设计很难，设计不好就学歪&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;② 模仿学习（Imitation-based）&lt;/td&gt;
					&lt;td&gt;直接抄学霸的作业&lt;/td&gt;
					&lt;td&gt;看例题学解题&lt;/td&gt;
					&lt;td&gt;学得快、学得稳&lt;/td&gt;
					&lt;td&gt;只会模仿，探索新招的能力弱&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;③ 种群进化（Population-based）&lt;/td&gt;
					&lt;td&gt;养一大群，优胜劣汰&lt;/td&gt;
					&lt;td&gt;生物进化/养蛊&lt;/td&gt;
					&lt;td&gt;能发现意想不到的新方法&lt;/td&gt;
					&lt;td&gt;非常烧钱（计算量大）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;论文原话总结这条演进路线：奖励方法首先&amp;quot;闭合了反馈回路&amp;quot;但脆弱且昂贵；模仿学习用高质量示范让演化更稳定，但有时牺牲了探索；种群进化则把适应扩展到集体规模，强调多样性与涌现协作——三者共同勾勒出**&amp;ldquo;从个体自我提升走向集体智能&amp;rdquo;**的轨迹（§5 引言）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="二第一流派奖励驱动的自演化51"&gt;二、第一流派：奖励驱动的自演化（§5.1）&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;核心思想&lt;/strong&gt;：给智能体一个&amp;quot;反馈信号&amp;rdquo;（奖励），让它根据反馈迭代改进自己。关键在于&lt;strong&gt;奖励信号怎么设计&lt;/strong&gt;。论文按反馈的来源把方法分成四类（§5.1，对应原论文 Figure 6）：&lt;/p&gt;
&lt;h3 id="21-文本反馈textual-feedback用自然语言当奖励"&gt;2.1 文本反馈（Textual Feedback）——用&amp;quot;自然语言&amp;quot;当奖励&lt;/h3&gt;
&lt;p&gt;不给你打一个分数，而是直接用语言告诉你&amp;quot;哪里错了、该怎么改&amp;quot;，就像老师批改作文写评语。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Reflexion (Shinn et al., 2023)&lt;/strong&gt;：提出&amp;quot;语言强化学习&amp;quot;（verbal reinforcement learning）。智能体用自然语言反思过去的失败，把反思存进&amp;quot;情景记忆&amp;quot;，下次决策时参考。好比每次考完试写错题本。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AdaPlanner (Sun et al., 2023)&lt;/strong&gt;：闭环自适应规划——根据&amp;quot;计划内&amp;quot;和&amp;quot;计划外&amp;quot;的反馈修改计划，还能减少幻觉。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Self-Refine (Madaan et al., 2023a)&lt;/strong&gt; 和 &lt;strong&gt;SELF (Lu et al., 2023)&lt;/strong&gt;：让模型多轮&amp;quot;自我批评、自我修改&amp;quot;，证明即使是最强模型也能靠自我反馈继续提升，&lt;strong&gt;不需要额外监督数据&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TextGrad (Yellamraju et al., 2024)&lt;/strong&gt;：把文本批评类比成深度学习里的&amp;quot;梯度&amp;quot;，用&amp;quot;文字版反向传播&amp;quot;优化系统。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;小结：语言作为奖励通道，细腻、灵活、省样本（§5.1 Textual Feedback 段）。&lt;/p&gt;</description></item><item><title>自进化智能体的稳定性调查</title><link>https://taffyboys.github.io/posts/agent-self-evolution-stability/</link><pubDate>Fri, 10 Jul 2026 00:00:00 +0000</pubDate><guid>https://taffyboys.github.io/posts/agent-self-evolution-stability/</guid><description>&lt;h1 id="自进化智能体的稳定性多维度分析"&gt;自进化智能体的稳定性：多维度分析&lt;/h1&gt;
&lt;h2 id="稳定性一个多面体概念"&gt;稳定性：一个多面体概念&lt;/h2&gt;
&lt;p&gt;自进化智能体的&amp;quot;稳定性&amp;quot;不是单一维度——它同时涉及多个层面的问题，贯穿从方法选择到评估测量的全过程。与传统静态 AI 系统不同，自进化智能体的稳定性必须在其&lt;strong&gt;持续适应和修改自身的动态过程中&lt;/strong&gt;理解。&lt;/p&gt;
&lt;p&gt;稳定性在自进化研究中的多重含义：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;核心问题&lt;/th&gt;
					&lt;th&gt;时间尺度&lt;/th&gt;
					&lt;th&gt;相关章节&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;性能稳定性&lt;/strong&gt;（Retention）&lt;/td&gt;
					&lt;td&gt;新学习是否侵蚀已有知识？&lt;/td&gt;
					&lt;td&gt;中等—长期（任务间）&lt;/td&gt;
					&lt;td&gt;Ch7 Evaluation&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;行为稳定性&lt;/strong&gt;（Safety）&lt;/td&gt;
					&lt;td&gt;进化过程中价值观和对齐是否漂移？&lt;/td&gt;
					&lt;td&gt;长期（整个部署周期）&lt;/td&gt;
					&lt;td&gt;Ch8 Future&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;方法稳定性&lt;/strong&gt;（Method）&lt;/td&gt;
					&lt;td&gt;不同进化方法对超参数/初始化有多敏感？&lt;/td&gt;
					&lt;td&gt;短—中期（单次进化 loop）&lt;/td&gt;
					&lt;td&gt;Ch5 How-to&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;收敛稳定性&lt;/strong&gt;（Convergence）&lt;/td&gt;
					&lt;td&gt;自博弈/群体进化是否收敛到有意义解？&lt;/td&gt;
					&lt;td&gt;中期（多代进化）&lt;/td&gt;
					&lt;td&gt;Ch5 群体型&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;归因稳定性&lt;/strong&gt;（Credit Assignment）&lt;/td&gt;
					&lt;td&gt;谁/什么对进化结果负责——进化过程本身还是环境随机性？&lt;/td&gt;
					&lt;td&gt;跨时间尺度&lt;/td&gt;
					&lt;td&gt;Ch7 Evaluation&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="1-性能稳定性知识保持retention"&gt;1. 性能稳定性：知识保持（Retention）&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;定义：衡量自进化智能体知识库的稳定性——核心挑战是灾难性遗忘。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="核心指标"&gt;核心指标&lt;/h3&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;指标&lt;/th&gt;
					&lt;th&gt;含义&lt;/th&gt;
					&lt;th&gt;理想值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Forgetting (FGT)&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;旧任务性能退化的程度&lt;/td&gt;
					&lt;td&gt;越低越好&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Backward Transfer (BWT)&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;正 BWT = 新学习对旧任务有正面效益&lt;/td&gt;
					&lt;td&gt;正值最优&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="覆盖差距最欠缺的评估维度"&gt;覆盖差距：最欠缺的评估维度&lt;/h3&gt;
&lt;p&gt;论文第七章明确指出，Retention 是五大评估目标中&lt;strong&gt;最欠缺的维度&lt;/strong&gt;：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;记忆回放的容量天花板&lt;/strong&gt;：当前记忆机制在动态状态更新和扩展交互中维持一致性方面挣扎；经验回放存在内在张力——扩展超越最佳阈值会触发性能退化&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;情景评估的盲区&lt;/strong&gt;：大多数基准采用&lt;strong&gt;情景评估&lt;/strong&gt;——智能体状态在任务间重置，从根本上排除了对知识积累或退化的测量&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长视野保持的隐私约束&lt;/strong&gt;：尚无基准同时结合扩展记忆评估和严格安全审计&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="稳定性-可塑性困境-stability-plasticity-dilemma"&gt;稳定性-可塑性困境 (Stability-Plasticity Dilemma)&lt;/h3&gt;
&lt;p&gt;这是性能稳定性的最根本权衡：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;方向&lt;/th&gt;
					&lt;th&gt;描述&lt;/th&gt;
					&lt;th&gt;代价&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;强调稳定性&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;优先保持旧知识&lt;/td&gt;
					&lt;td&gt;适应新任务缓慢&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;强调可塑性&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;优先快速学习新任务&lt;/td&gt;
					&lt;td&gt;遗忘旧知识（灾难性遗忘）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;论文第七章将此列为各评估目标间的首要权衡：&lt;strong&gt;Adaptivity vs Retention&lt;/strong&gt;。&lt;/p&gt;</description></item></channel></rss>