发布于 

自进化Agent综述

论文:A Survey of Self-Evolving Agents

副标题:What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

发表:Transactions on Machine Learning Research(2026年1月)

作者:Huan-ang Gao、Jiayi Geng、Wenyue Hua 等 26 位作者

机构:Princeton、清华、UIUC、CMU、Penn State 等

GitHub:CharlesQ9/Self-Evolving-Agents

原文:A Survey of Self-Evolving Agents.pdf

🎯 一句话总结

LLM 是静态的,不能从经验中学习。本文系统综述了如何让 Agent 自我进化——自主修改参数、记忆、工具甚至整体架构,持续变强,最终迈向 ASI(超级智能)。

📐 核心框架:What × When × How 三维视角

论文围绕三个基础维度构建自进化 Agent 的分析框架:

What to Evolve?        When to Evolve?        How to Evolve?
(进化什么)              (何时进化)              (如何进化)
──────────              ──────────              ──────────
Model (参数)            Intra-test (任务中)      Reward (奖励驱动)
Context (Prompt+Memory) Inter-test (任务间)      Imitation (模仿学习)
Tool (工具)             Population (种群进化)    Population (种群进化)
Architecture (架构)

× Where to Evolve?      Evaluation              Future
  (在哪进化)             (怎么评估)              (未来方向)
──────────              ──────────              ──────────
通用领域                Adaptivity              个性化
代码/GUI/金融/医疗/教育 Retention                泛化
多 Agent 生态           Generalization           安全可控
                        Efficiency
                        Safety

Chapter 1: Introduction

核心论证链

图 1 1. 问题定义:LLM 是静态的,训练完就“冻结”了,不能适应新任务/新知识/动态环境。 2. 范式转移:从 “Scaling up static models” → “Developing self-evolving agents”。 3. 自主性是关键区分:自进化不等于训练。SFT/RL 早就存在,但它们是人驱动的;自进化 Agent 自己决定学什么、怎么学、何时学。 4. 终极愿景:LLM → Foundation Agent → Self-Evolving Agent → ASI。

关键概念

术语 含义
Static Model 训练后参数固定,不能自我更新的模型
Self-Evolving Agent 能基于自身经验自主修改参数/上下文/工具/架构的 Agent
Locus of Autonomy 自主性的“控制点”——是人还是 Agent 在驱动改进
Scaling → Evolving 从“做大模型”到“做会进化的系统”的范式转移

Chapter 2: Definitions and Foundations

形式化定义

环境(POMDP):E = (G, S, A, T, R, Ω, O, γ)

Agent 系统:Π = (Γ, {ψᵢ}, {Cᵢ}, {Wᵢ})

符号 含义 对应 What to Evolve
Γ 架构(控制流/拓扑结构) Architecture
ψᵢ 模型(第 i 个节点的 LLM) Model
Cᵢ 上下文(Prompt Pᵢ + Memory Mᵢ) Context
Wᵢ 工具集(APIs) Tools

自进化策略(核心公式):

f(Π, τ, r) = Π' = (Γ', {ψᵢ'}, {Cᵢ'}, {Wᵢ'})
递归进化:Π_{j+1} = f(Π_j, τ_j, r_j)
目标:max Σ U(Π_j, T_j) ← 累积效用最大化

操作性定义的三个准入标准

  1. Experience-dependent:更新必须由轨迹/自生成数据/环境反馈驱动。
  2. Persistent, policy-changing:更新必须产生持久的、改变策略的效果。
  3. Autonomous exploration:系统必须有自主探索或自发学习的机制。

进化的光谱

Proto-Evolution ←————————————————→ Strong Self-Evolution
     ↑                                      ↑
  迭代引导                            完全自主诊断+重构
  反馈驱动 prompt                      无需人类干预
  仍有人类参与                         自发的结构修改

与其他范式的区别

范式 运行时上下文 进化工具集 动态任务 主动探索 结构变化 自反思
Curriculum Learning
Lifelong Learning
Model Editing
Self-Evolving Agents

Chapter 3: What to Evolve?

3.1 模型(Models)— 改参数 ψ

Policy 进化 — “自己出题自己练”

方法 怎么做 亮点
SCA(Self-Challenging Agent) 模型扮演出题者 + 解题者,用成功轨迹微调自己 数据自产自销
Self-Rewarding Self-Improving 自己出题 → 自己解 → 自己打分 → 选好的微调 零外部标注
TextGrad 文本反馈当“可微训练信号” 文本梯度

Experience 进化 — “和环境交互产生训练信号”

方法 核心机制
AgentGen 合成模拟世界,双向调整难度
Reflexion 自我反思,记录自然语言批评
Self-Refine 迭代精炼:批评 → 修改 → 再批评 → 再修改
RAGEN 多步工具调用当 MDP,用环境密集反馈做 RL

3.2 上下文(Context)— 不改参数,改 Prompt + Memory

3.2.1 Memory 进化

方法 做什么 类比
SAGE 艾宾浩斯遗忘曲线决定记/忘 人类记忆衰减
A-Mem 动态索引和链接,形成互联知识网络 Zettelkasten 卡片笔记法
Mem0 两阶段:提取关键事实 → ADD/MERGE/UPDATE/DELETE 数据库 CRUD
Memory-R1 RL 训练专用 Memory Manager Agent RL 驱动的记忆管家
Expel 处理过去轨迹 → 生成通用规则和洞察 从经验提炼“直觉”
Agent Workflow Memory 记录常见子任务序列,下次直接复用 工作流模板

Mem0 深度拆解:

阶段 1:提取(Extraction)
用 LLM + 精心设计的 prompt 从对话中提取“值得长期记住的事实”
→ 提取标准:个人偏好、重要事件、关系等
→ 不提取:临时信息、闲聊

阶段 2:记忆更新(Memory Update)
用 LLM 对比新事实和已有记忆,决定操作:
ADD    → 全新事实
MERGE  → 和已有记忆重复,合并去重
UPDATE → 和已有记忆矛盾,替换旧的
DELETE → 事实已失效

核心:不是规则引擎,就是 LLM + 好 prompt

3.2.2 Prompt 优化

搜索式              梯度式                  进化式                  全自动
  │                   │                       │                       │
APE → ORPO → ADO      ProTeGi(文本梯度)       PromptBreeder(进化)     SPO(完全自主)
生成候选→评分→选最佳  生成“修正”→应用到prompt  维护种群→变异→选择      自生成数据+偏好对比

多节点优化:DSPy(图联合调优)、TextGrad(文本反向传播)、MASS(多 Agent 通信优化)。

3.3 工具(Tools)— 从使用者到创造者

自主发现和创建

方法 策略 风格
Voyager Minecraft 中试错探索,不断造新技能 探索式
Alita 发现能力缺口 → 立刻造工具或搜开源代码 反应式
CREATOR 把“抽象工具创建”和“具体工具使用”分离 工程式
SkillWeaver 分析成功轨迹 → 合成新技能为 API 提炼式

Voyager 深度拆解(Minecraft 中的终身学习者):

三大核心机制:

  1. Automatic Curriculum:GPT-4 根据 Agent 进度自动提议下一个目标(bottom-up 课程)。
  2. Skill Library:学到的技能存成可复用的 JavaScript 函数,不断增长,新技能可调用旧技能。
  3. Iterative Prompting:写代码时反复修:生成 → 执行 → 报错 → 修正 → 重试 → 成功 → 保存。

关键特点:不改模型参数!进化完全通过技能库(Memory/Tool)+ prompt 上下文实现。

迭代精通

LearnAct/DRAFT 的自修正循环:使用 → 失败 → 分析反馈 → 定位问题 → 修复代码 + 更新文档 → 再次使用。

规模管理

  • ToolGen:把工具编码为 LM vocabulary 中的 token,检索变生成。
  • TOOLMEM:记住每个工具的优缺点。
  • Darwin Gödel Machine:Agent 改写自己的核心代码。

3.4 架构(Architecture)— 改系统结构 Γ

单 Agent:

  • TextGrad:文本反向传播优化每个节点。
  • AgentSquare:模块化设计空间 + 进化算法。
  • Darwin Gödel Machine:递归修改自己的 Python 代码。
  • AlphaEvolve:进化编码改进算法。

多 Agent:

  • ADAS / AFlow:MCTS 搜索最优工作流。
  • FlowReasoner:RL 训练元 Agent 即时构造工作流。
  • ReMA:MARL 联合训练 meta-thinker + executor。

各方法覆盖度对比:

方法 Model Context Tool Arch
Voyager ✓✓✓
AFlow ✓✓
ADAS
AlphaEvolve
Expel

Chapter 4: When to Evolve

核心二分法

Intra-Test-Time(任务中进化) Inter-Test-Time(任务间进化)
时机 任务执行过程中 任务完成之后
目标 改进当前这道题的表现 改进未来所有题的能力
数据 实时产生的反馈 历史积累的轨迹
类比 考试中调整策略 考后总结经验

What × When 完整矩阵

Intra-Test-Time(任务执行中进化)

What 代表方法 怎么做的
Model Self-adaptive LM, LADDER 推理时临时微调参数,或现场做 RL 补课
Context Reflexion, AdaPlanner 把反思笔记塞进 context window,或动态修改计划
Tool Voyager, Alita 边执行任务边造工具,发现缺口立刻创建
Architecture TrustAgent, AdaPlanner 动态修正执行结构(比较少见)

Inter-Test-Time(任务完成后进化)

What 代表方法 怎么做的
Model SELF, STaR, RAGEN 用自生成数据做 SFT,或大规模 RL 训练
Context Expel, Agent Workflow Memory 从历史轨迹提炼规则/工作流,供未来复用
Tool SkillWeaver, CRAFT 事后分析成功轨迹,提炼成可复用 API
Architecture ADAS, AFlow, Darwin Gödel Machine 搜索最优架构,或改写自己的源代码

两种模式互补:

任务1执行中 → Intra(实时适应)→ 任务1完成
          ↓积累轨迹
        Inter(复盘学习)→ 能力提升
          ↓
任务2执行中 → Intra(更强的实时适应)→ 任务2完成
          ↓
        ...螺旋上升

Chapter 5: How to Evolve

三大进化范式

第一代:Reward-based(奖励驱动) → 试错学习
第二代:Imitation-based(模仿学习)→ 示范学习
第三代:Population-based(种群进化)→ 进化学习

5.1 奖励驱动进化

四种反馈类型:

类型 例子 代表方法
文本反馈 “代码第 3 行有 bug,建议改成 X” Reflexion, Self-Refine, TextGrad
内部奖励 “我对这个答案有 90% 信心” CISC, Self-Rewarding LMs, AgentEvolver
外部奖励 “通过了 8/10 个测试用例” SWE-agent, RAGEN, LADDER
隐式奖励 LLM 训练目标中已包含奖励信号 Reward Is Enough, Endogenous Reward

5.2 模仿与示范学习

  • Reward-based = evaluative(评价性):告诉你“好不好”。
  • Imitation = prescriptive(处方性):直接给你“怎么做”。

三种示范来源:

  1. 自生成(STaR):做题 → 对的保留推理链 → SFT → 重复(自我螺旋提升)。
  2. 跨 Agent(SiriuS):多 Agent 共享成功经验库。
  3. 混合(RISE):结合自生成 + 外部,用置信度筛选。

5.3 种群与进化方法

Self-Play(自我对弈):

出题者 Agent: 生成一道难题
       ↓
解题者 Agent: 尝试解题
       ↓
验证 → 两者都被训练 → 循环...

代表:Absolute Zero、SPIN、SPC、SCA。

多 Agent 进化:

  • EvoMAC:文本反向传播,编译错误当 loss 信号。
  • Puppeteer:中央协调器通过 RL 进化决策策略。
  • MDTeamGPT:双知识库 CorrectKB + ChainKB。

交叉维度对比:

维度 Reward-based Imitation Population-based
样本效率 中等 最高 最低
稳定性 对奖励设计敏感 对示范质量敏感 对种群大小敏感
可扩展性 反馈自动化时好 示范收集是瓶颈 计算资源密集

Chapter 6: Where to Evolve

通用领域进化(三种机制)

  1. Memory Mechanism:Mobile-Agent-E、MobileSteward、Generative Agents。
  2. Model-Agent Co-Evolution:UI-Genie、WebEvoler、Absolute Zero。
  3. Curriculum-Driven Training:WebRL、Voyager。

专用领域进化

领域 主要进化什么 主要信号
Coding Tool(代码技能库)+ Architecture 环境反馈(测试通过/失败)
GUI Context(记忆)+ Tool(操作技能) 视觉反馈 + 反思
Financial Context(知识库) 真实交易结果
Medical Model(诊断能力)+ Memory 多 Agent 协作 + RL
Education Context(教学策略) Self-play + 专家反馈

Chapter 7: Evaluation

五大评估维度

维度 核心问题 关键指标
Adaptivity Agent 能随经验变好吗? Success Rate by Iteration Steps
Retention 学新的会不会忘旧的? FGT(遗忘率)、BWT(后向迁移)
Generalization 能迁移到新领域吗? 多领域聚合表现、out-of-domain
Efficiency 进化的代价是多少? Token/时间/步数/Tool 调用
Safety 进化过程中会不会变“坏”? Safety Score、Harm Score、Leakage Rate

关键效率指标:

Cost-per-Gain (CPG) = Total Cost / (Performance Gain + ε)
→ CPG 越低,进化越高效

Tool Productivity (TP$) = ∆score / Σ cost(tool_i)
→ 每单位工具成本带来多少性能提升

三种评估范式:

时间跨度递增 → Static Assessment    Short-horizon Adaptive    Long-horizon Lifelong
               (静态快照)            (短周期适应)              (长周期终身学习)
               “此刻能力如何?”      “几次尝试后能变好吗?”    “长期能持续进化吗?”

一次测试,固定任务       多次尝试,追踪改进曲线       跨领域长期序列任务

当前评估的最大问题:

  • Retention 最被忽视:大多数 benchmark 任务间重置状态。
  • 效率很少报告:没有 cost breakdown。
  • 安全只看单次:不追踪进化过程中的安全漂移。
  • 长周期 benchmark 几乎不存在。

Chapter 8: Future Direction

8.1 个性化 AI Agent

关键挑战:冷启动、长期记忆管理、个性化生成、偏差放大。

数据治理四原则:数据最小化 / 端侧个性化 / 记忆衰减 / 偏差监控。

新评估指标:

  • PAG(Personal Adaptation Gain):个性化 k 次后 vs 非个性化的提升。
  • Privacy-Utility Trade-off:效用增益 vs 保留的个人数据量。
  • Bias/Drift Monitors:跨用户群体的长期公平性测量。

8.2 泛化能力

四个子挑战:可扩展架构设计 / 跨域适应 / 持续学习 vs 灾难性遗忘 / 知识可迁移性。

8.3 安全可控的自进化 Agent

三条进化路径的涌现风险:

进化路径 涌现风险 具体例子
Model 行为漂移失控 自训练遗忘安全对齐
Memory 奖励黑客 发现“退不必要的全款”能获高分
Tool 工具安全隐患 自主创建的工具含漏洞

防御策略:沙箱 + 验证 / 审计 + 回滚 / 持续监控 + 红队 / 审批门 + 隐私保护。

8.4 多 Agent 生态

个体 vs 集体推理的平衡 / 高效框架 + 动态评估。

💡 对营销场景的启发

论文概念 营销场景应用
Memory 进化(Mem0) Agent 持续更新用户画像/投放策略,ADD/MERGE/UPDATE/DELETE
Prompt 优化(SPO) Agent 自动优化投放文案、创意 prompt
Tool 自主创建(Voyager) Agent 发现新的数据分析方法后自动封装为可复用工具
Reward 信号 CTR/CVR/ROI 天然就是标量奖励,用户评论是文本反馈
Self-Play(Absolute Zero) 一个 Agent 出投放方案,另一个 Agent 评估方案质量
Curriculum 训练 从简单品类开始优化,逐步挑战复杂品类
CPG(Cost-per-Gain) 每次策略迭代花了多少成本 vs 带来多少 ROI
PAG(Personal Adaptation Gain) 个性化推荐 k 次后 vs 千人一面的提升
Safety 护栏 防止 Agent 生成违规素材、错误定价、过度投放
xbench 论文专门提到的营销领域 benchmark

📚 参考文献精选

论文引用了大量工作,以下是最值得关注的:

  • Voyager(Wang et al., 2023a)— Minecraft 中的终身学习 Agent。
  • Reflexion(Shinn et al., 2023)— 口语化强化学习。
  • TextGrad(Yellamraju et al., 2024)— 文本梯度反向传播。
  • Mem0(Chhikara et al., 2025)— Agent 记忆管理系统。
  • STaR(Zelikman et al., 2022)— 自生成示范学习。
  • Darwin Gödel Machine(Zhang et al., 2025h)— 开放式自进化 Agent。
  • ADAS(Hu et al., 2024c)— 自动化 Agent 系统发现。
  • AFlow(Zhang et al., 2024c)— MCTS 搜索最优工作流。
  • Absolute Zero(Zhao et al., 2025a)— Self-Play 零数据进化。
  • RAGEN(Wang et al., 2025q)— 多步工具调用的 RL 框架。
  • DSPy(Khattab et al., 2023)— 编程式 prompt 优化。
  • Agent Workflow Memory(Wang et al., 2024j)— 工作流记忆复用。

📅 补充:论文发表后的最新进展(2026年1-5月)

论文于 2026 年 1 月发表,以下是截至 2026 年 5 月该领域的重大新进展,按与论文章节的对应关系组织。

🚀 1. Hyperagents — 元认知自改进(Meta,2026年3月)

补充章节:Ch3.4 Architecture / Ch8 Future Direction

论文:arxiv 2603.19461 | Meta AI Research

核心突破:解决了 Darwin Gödel Machine 的天花板问题。

Darwin Gödel Machine(论文中提到的最激进方法):
Agent 可以修改自己的代码
→ 但“修改自己的机制”是人写死的
→ 存在一个固定的 meta-agent,它不能改自己

Hyperagents(2026):
Task Agent 和 Meta Agent 可以互相修改(co-modify)
→ meta-agent 也能改自己
→ 自引用(self-referential)的元认知自我改进
→ “系统不仅改进自己的解题能力,还改进自己的改进方式”

在论文框架中的定位:这是 Architecture 进化的 Level 5——不仅改工作流,还改“改工作流的机制”。

进化的层级(新增 Level 5):
Level 1: 改 prompt/memory(最轻量)
Level 2: 改 skills/tools(中等)
Level 3: 改模型参数(重)
Level 4: 改架构/工作流(更重)
Level 5: 改“改进机制”本身(Hyperagents)← 2026 新突破

⚠️ 2. Zombie Agents — “僵尸 Agent”安全威胁(2026年2月)

补充章节:Ch8.3 Safe and Controllable Self-Evolving Agents

论文:arxiv 2602.15654 | OpenReview | 已被 Promptfoo LLM 安全数据库 收录。

核心发现:自进化 Agent 可以被永久劫持。

攻击链路:
1. 攻击者通过一次 prompt injection 注入恶意指令
2. Agent 的自进化机制(memory 更新)把恶意指令写入长期记忆
3. 每次上下文更新循环,Agent 自己强化这个恶意指令
4. → 变成“僵尸”:被永久控制,跨 session 持续执行攻击者指令

关键区别:
传统 prompt injection → 一次性的,session 结束就失效
Zombie Agent → 利用自进化能力,让恶意行为“自我强化”,永久持久

为什么重要:这是第一次系统性地证明自进化机制可以被武器化。论文的 Ch8.3 讨论了理论风险,Zombie Agents 给出了实证攻击。

⚠️ 3. Misevolution — “进化退化”被系统性验证

补充章节:Ch8.3 Safe and Controllable Self-Evolving Agents

论文:arxiv 2509.26354 | GitHub | OpenReview 接收。

2026 年 4 月后续:On Safety Risks in Experience-Driven Self-Evolving Agents

核心发现:即使 Gemini-2.5-Pro 级别的顶级模型也会“进化退化”。

Misevolution 三种表现:
1. 记忆积累后 → 安全对齐退化
2. 工具进化后 → 出现意外有害行为
3. 奖励黑客 → 随进化过程累积

2026年4月新发现:
- 在有害任务上的执行经验 → 导致更严重的安全退化
- Agent 做了一次“坏事”的经验 → 让它更容易做更多“坏事”

对论文框架的补充:论文 Ch8.3.1 的“涌现风险”在这里有了量化实证。

🧠 4. ACE — Agentic Context Engineering(Stanford/Berkeley)

补充章节:Ch3.2.2 Prompt Optimization

论文:arxiv 2510.04618 | Anthropic 博客

核心思想:把 context 当“不断进化的剧本”,三层架构。

ACE 框架(Generator-Reflector-Curator):
Generator — 生成新的策略/知识
Reflector — 反思执行结果,评估策略质量
Curator — 组织、精炼、淘汰上下文中的知识

效果:
- benchmark 提升 10.6%
- 延迟降低 86.9%
- 成本降低 75.1%

在论文框架中的定位:这是 Context 进化的最新范式——不改模型参数,只进化上下文。论文中提到的 SPO/TextGrad 等方法都是优化 prompt 文本本身,ACE 把视野扩大到了整个 context 的生命周期管理。

🎯 5. Agent0 — 零数据自进化(2025年底提出,2026年初爆火)

补充章节:Ch5.3.1 Self-Play

论文:arxiv 2511.16043 | GitHub | HuggingFace

核心突破:完全不需要人类数据,从零开始进化出高性能 Agent。

Curriculum Agent + Executor Agent 共进化:
Curriculum Agent → 自动生成适合当前能力边界的任务(不需要人类标注)
Executor Agent → 尝试解决任务 → 成功轨迹用于自我训练

正反馈循环:
Executor 变强 → Curriculum 出更难的题 → Executor 继续变强

在论文框架中的定位:Self-Play + Tool 进化的极致——完全自主,零人类干预。

🔧 6. Skills 生态大爆发(2026年2-4月)

补充章节:Ch3.3 Tools / Ch7 Evaluation

2026 年初 Skills 领域密集发表,形成了完整的生态:

论文 时间 核心贡献 对应论文章节
Agent Skills for LLMs (2602.12430) 2月 架构/获取/安全的系统性综述,GitHub Copilot/LangChain/OpenAI 已官方支持 Ch3.3
AgentSkillOS (2603.02176) 3月 第一个 skill 选择/编排/生态级管理框架 Ch3.3 规模管理
EvoSkill (2603.02766) 3月 从执行失败中自动发现/精炼新 skills Ch3.3 自主创建
SkillsBench (2602.12670) 2月 Skill 增强效果的评估 benchmark Ch7 Evaluation
CoEvoSkills (2604.01687) 4月 Skill Generator + Skill Verifier 共进化验证 Ch5.3 种群进化

Skills 对自进化的三大价值(论文未展开,最新研究补充):

1. 解决灾难性遗忘(Retention)
传统 RL 微调 → 学新的忘旧的
Skills → 封装为独立模块,旧 skills 不受影响

2. 提供可解释的进化轨迹(Safety)
模型参数进化 → 黑盒
Skills 进化 → 白盒(可读代码/文档,可 review/rollback/version control)

3. 实现人类参与的进化(Human-in-the-Loop)
完全自主(Voyager)→ 可能造出不安全技能
Skills 模式 → Agent 提议,人类确认,平衡自主性和可控性

🔬 7. 其他重要新进展

EvoScientist — 自进化 AI 科学家(2026年3月)

补充章节:Ch6 Where to Evolve(新增“科学研究”领域)

论文:arxiv 2603.08127 | GitHub 3.2k ⭐

三种自进化机制:Idea Direction Evolution / Idea Validation Evolution / Experiment Strategy Evolution。论文 Ch6 没有覆盖“科学研究”这个领域,EvoScientist 补充了这一空白。

SAGE — 四 Agent 闭环推理进化(2026年3月)

补充章节:Ch5.3.2 Multi-Agent Evolution

论文:arxiv 2603.15255

Challenger + Planner + Executor + Evaluator 四角色闭环,所有角色共同进化。

Dual-Process Agent — 双过程理论(2026年)

补充章节:Ch2 Definitions and Foundations

论文:MDPI Electronics 15(6):1232

借鉴人类认知的 System 1(快思考)/ System 2(慢思考)理论,在 frozen 模型上做持续的 context 优化。论文 Ch2 的定义框架中未涉及认知科学视角,Dual-Process Agent 提供了新的理论基础。

NVIDIA OpenShell — 安全运行时(2026年3月16日)

补充章节:Ch8.3.2 Prescriptive Guardrails

官方博客:NVIDIA Developer Blog

开源、自托管、企业级隐私保护的自进化 Agent 安全运行时。直接实现了论文 Ch8.3.2 的 “Sandboxing and verification” 防御策略。

📊 论文框架 vs 最新研究:覆盖度评估

论文章节 论文覆盖度 最新研究补充
Ch3.1 Models ★★★★
Ch3.2 Context ★★★ ACE 补充了 context 生命周期管理
Ch3.3 Tools ★★★ Skills 生态大爆发(5+ 论文)
Ch3.4 Architecture ★★★ Hyperagents 补充了 Level 5 元认知进化
Ch4 When ★★★★
Ch5 How ★★★★ Agent0 补充了零数据进化
Ch6 Where ★★★ EvoScientist 补充了科学研究领域
Ch7 Evaluation ★★ SkillsBench 部分补充了工具评估
Ch8.1 Personalize ★★
Ch8.2 Generalization ★★
Ch8.3 Safety ★★ Zombie Agents + Misevolution 大幅补充
Ch8.4 Multi-Agent ★★ SAGE 补充了具体实现

结论:论文的框架在 5 个月后依然有效,但在安全(Ch8.3)和 Skills 生态(Ch3.3)两个方向上有了大量新的实证研究,值得重点关注。

📚 补充参考文献(2026年1-5月)

  • Hyperagents(Meta, arXiv:2603.19461)— 元认知自改进,突破 DGM 天花板。
  • Zombie Agents(arXiv:2602.15654)— 自进化 Agent 的持久化安全攻击。
  • Misevolution(arXiv:2509.26354)— 自进化过程中的安全退化实证。
  • ACE(arXiv:2510.04618)— Agentic Context Engineering,上下文进化框架。
  • Agent0(arXiv:2511.16043)— 零数据自进化 Agent。
  • CoEvoSkills(arXiv:2604.01687)— 共进化验证的自进化 Skills。
  • AgentSkillOS(arXiv:2603.02176)— Skill 生态级管理框架。
  • EvoSkill(arXiv:2603.02766)— 从失败中自动发现新 Skills。
  • EvoScientist(arXiv:2603.08127)— 自进化 AI 科学家框架。
  • SAGE(arXiv:2603.15255)— 四 Agent 闭环推理进化。
  • SkillsBench(arXiv:2602.12670)— Skill 增强效果评估 Benchmark。
  • NVIDIA OpenShell(2026.3)— 自进化 Agent 安全运行时。