自进化Agent综述
论文:A Survey of Self-Evolving Agents
副标题:What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence
发表:Transactions on Machine Learning Research(2026年1月)
作者:Huan-ang Gao、Jiayi Geng、Wenyue Hua 等 26 位作者
机构:Princeton、清华、UIUC、CMU、Penn State 等
GitHub:CharlesQ9/Self-Evolving-Agents
原文:A Survey of Self-Evolving Agents.pdf
🎯 一句话总结
LLM 是静态的,不能从经验中学习。本文系统综述了如何让 Agent 自我进化——自主修改参数、记忆、工具甚至整体架构,持续变强,最终迈向 ASI(超级智能)。
📐 核心框架:What × When × How 三维视角
论文围绕三个基础维度构建自进化 Agent 的分析框架:
What to Evolve? When to Evolve? How to Evolve?
(进化什么) (何时进化) (如何进化)
────────── ────────── ──────────
Model (参数) Intra-test (任务中) Reward (奖励驱动)
Context (Prompt+Memory) Inter-test (任务间) Imitation (模仿学习)
Tool (工具) Population (种群进化) Population (种群进化)
Architecture (架构)
× Where to Evolve? Evaluation Future
(在哪进化) (怎么评估) (未来方向)
────────── ────────── ──────────
通用领域 Adaptivity 个性化
代码/GUI/金融/医疗/教育 Retention 泛化
多 Agent 生态 Generalization 安全可控
Efficiency
Safety
Chapter 1: Introduction
核心论证链
1. 问题定义:LLM 是静态的,训练完就“冻结”了,不能适应新任务/新知识/动态环境。
2. 范式转移:从 “Scaling up static models” → “Developing self-evolving agents”。
3. 自主性是关键区分:自进化不等于训练。SFT/RL 早就存在,但它们是人驱动的;自进化 Agent 自己决定学什么、怎么学、何时学。
4. 终极愿景:LLM → Foundation Agent → Self-Evolving Agent → ASI。
关键概念
| 术语 | 含义 |
|---|---|
| Static Model | 训练后参数固定,不能自我更新的模型 |
| Self-Evolving Agent | 能基于自身经验自主修改参数/上下文/工具/架构的 Agent |
| Locus of Autonomy | 自主性的“控制点”——是人还是 Agent 在驱动改进 |
| Scaling → Evolving | 从“做大模型”到“做会进化的系统”的范式转移 |
Chapter 2: Definitions and Foundations
形式化定义
环境(POMDP):E = (G, S, A, T, R, Ω, O, γ)
Agent 系统:Π = (Γ, {ψᵢ}, {Cᵢ}, {Wᵢ})
| 符号 | 含义 | 对应 What to Evolve |
|---|---|---|
| Γ | 架构(控制流/拓扑结构) | Architecture |
| ψᵢ | 模型(第 i 个节点的 LLM) | Model |
| Cᵢ | 上下文(Prompt Pᵢ + Memory Mᵢ) | Context |
| Wᵢ | 工具集(APIs) | Tools |
自进化策略(核心公式):
f(Π, τ, r) = Π' = (Γ', {ψᵢ'}, {Cᵢ'}, {Wᵢ'})
递归进化:Π_{j+1} = f(Π_j, τ_j, r_j)
目标:max Σ U(Π_j, T_j) ← 累积效用最大化
操作性定义的三个准入标准
- Experience-dependent:更新必须由轨迹/自生成数据/环境反馈驱动。
- Persistent, policy-changing:更新必须产生持久的、改变策略的效果。
- Autonomous exploration:系统必须有自主探索或自发学习的机制。
进化的光谱
Proto-Evolution ←————————————————→ Strong Self-Evolution
↑ ↑
迭代引导 完全自主诊断+重构
反馈驱动 prompt 无需人类干预
仍有人类参与 自发的结构修改
与其他范式的区别
| 范式 | 运行时上下文 | 进化工具集 | 动态任务 | 主动探索 | 结构变化 | 自反思 |
|---|---|---|---|---|---|---|
| Curriculum Learning | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| Lifelong Learning | ✗ | ✗ | ✓ | ✗ | ✗ | ✗ |
| Model Editing | ✗ | ✗ | ✓ | ✓ | ✗ | ✗ |
| Self-Evolving Agents | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
Chapter 3: What to Evolve?
3.1 模型(Models)— 改参数 ψ
Policy 进化 — “自己出题自己练”
| 方法 | 怎么做 | 亮点 |
|---|---|---|
| SCA(Self-Challenging Agent) | 模型扮演出题者 + 解题者,用成功轨迹微调自己 | 数据自产自销 |
| Self-Rewarding Self-Improving | 自己出题 → 自己解 → 自己打分 → 选好的微调 | 零外部标注 |
| TextGrad | 文本反馈当“可微训练信号” | 文本梯度 |
Experience 进化 — “和环境交互产生训练信号”
| 方法 | 核心机制 |
|---|---|
| AgentGen | 合成模拟世界,双向调整难度 |
| Reflexion | 自我反思,记录自然语言批评 |
| Self-Refine | 迭代精炼:批评 → 修改 → 再批评 → 再修改 |
| RAGEN | 多步工具调用当 MDP,用环境密集反馈做 RL |
3.2 上下文(Context)— 不改参数,改 Prompt + Memory
3.2.1 Memory 进化
| 方法 | 做什么 | 类比 |
|---|---|---|
| SAGE | 艾宾浩斯遗忘曲线决定记/忘 | 人类记忆衰减 |
| A-Mem | 动态索引和链接,形成互联知识网络 | Zettelkasten 卡片笔记法 |
| Mem0 | 两阶段:提取关键事实 → ADD/MERGE/UPDATE/DELETE | 数据库 CRUD |
| Memory-R1 | RL 训练专用 Memory Manager Agent | RL 驱动的记忆管家 |
| Expel | 处理过去轨迹 → 生成通用规则和洞察 | 从经验提炼“直觉” |
| Agent Workflow Memory | 记录常见子任务序列,下次直接复用 | 工作流模板 |
Mem0 深度拆解:
阶段 1:提取(Extraction)
用 LLM + 精心设计的 prompt 从对话中提取“值得长期记住的事实”
→ 提取标准:个人偏好、重要事件、关系等
→ 不提取:临时信息、闲聊
阶段 2:记忆更新(Memory Update)
用 LLM 对比新事实和已有记忆,决定操作:
ADD → 全新事实
MERGE → 和已有记忆重复,合并去重
UPDATE → 和已有记忆矛盾,替换旧的
DELETE → 事实已失效
核心:不是规则引擎,就是 LLM + 好 prompt
3.2.2 Prompt 优化
搜索式 梯度式 进化式 全自动
│ │ │ │
APE → ORPO → ADO ProTeGi(文本梯度) PromptBreeder(进化) SPO(完全自主)
生成候选→评分→选最佳 生成“修正”→应用到prompt 维护种群→变异→选择 自生成数据+偏好对比
多节点优化:DSPy(图联合调优)、TextGrad(文本反向传播)、MASS(多 Agent 通信优化)。
3.3 工具(Tools)— 从使用者到创造者
自主发现和创建
| 方法 | 策略 | 风格 |
|---|---|---|
| Voyager | Minecraft 中试错探索,不断造新技能 | 探索式 |
| Alita | 发现能力缺口 → 立刻造工具或搜开源代码 | 反应式 |
| CREATOR | 把“抽象工具创建”和“具体工具使用”分离 | 工程式 |
| SkillWeaver | 分析成功轨迹 → 合成新技能为 API | 提炼式 |
Voyager 深度拆解(Minecraft 中的终身学习者):
三大核心机制:
- Automatic Curriculum:GPT-4 根据 Agent 进度自动提议下一个目标(bottom-up 课程)。
- Skill Library:学到的技能存成可复用的 JavaScript 函数,不断增长,新技能可调用旧技能。
- Iterative Prompting:写代码时反复修:生成 → 执行 → 报错 → 修正 → 重试 → 成功 → 保存。
关键特点:不改模型参数!进化完全通过技能库(Memory/Tool)+ prompt 上下文实现。
迭代精通
LearnAct/DRAFT 的自修正循环:使用 → 失败 → 分析反馈 → 定位问题 → 修复代码 + 更新文档 → 再次使用。
规模管理
- ToolGen:把工具编码为 LM vocabulary 中的 token,检索变生成。
- TOOLMEM:记住每个工具的优缺点。
- Darwin Gödel Machine:Agent 改写自己的核心代码。
3.4 架构(Architecture)— 改系统结构 Γ
单 Agent:
- TextGrad:文本反向传播优化每个节点。
- AgentSquare:模块化设计空间 + 进化算法。
- Darwin Gödel Machine:递归修改自己的 Python 代码。
- AlphaEvolve:进化编码改进算法。
多 Agent:
- ADAS / AFlow:MCTS 搜索最优工作流。
- FlowReasoner:RL 训练元 Agent 即时构造工作流。
- ReMA:MARL 联合训练 meta-thinker + executor。
各方法覆盖度对比:
| 方法 | Model | Context | Tool | Arch |
|---|---|---|---|---|
| Voyager | ✓ | ✓ | ✓✓✓ | ✓ |
| AFlow | ✓ | ✓ | ✓ | ✓✓ |
| ADAS | ✓ | ✓ | ✓ | ✓ |
| AlphaEvolve | ✓ | ✓ | ✓ | ✓ |
| Expel | ✓ | ✓ | — | — |
Chapter 4: When to Evolve
核心二分法
| Intra-Test-Time(任务中进化) | Inter-Test-Time(任务间进化) | |
|---|---|---|
| 时机 | 任务执行过程中 | 任务完成之后 |
| 目标 | 改进当前这道题的表现 | 改进未来所有题的能力 |
| 数据 | 实时产生的反馈 | 历史积累的轨迹 |
| 类比 | 考试中调整策略 | 考后总结经验 |
What × When 完整矩阵
Intra-Test-Time(任务执行中进化)
| What | 代表方法 | 怎么做的 |
|---|---|---|
| Model | Self-adaptive LM, LADDER | 推理时临时微调参数,或现场做 RL 补课 |
| Context | Reflexion, AdaPlanner | 把反思笔记塞进 context window,或动态修改计划 |
| Tool | Voyager, Alita | 边执行任务边造工具,发现缺口立刻创建 |
| Architecture | TrustAgent, AdaPlanner | 动态修正执行结构(比较少见) |
Inter-Test-Time(任务完成后进化)
| What | 代表方法 | 怎么做的 |
|---|---|---|
| Model | SELF, STaR, RAGEN | 用自生成数据做 SFT,或大规模 RL 训练 |
| Context | Expel, Agent Workflow Memory | 从历史轨迹提炼规则/工作流,供未来复用 |
| Tool | SkillWeaver, CRAFT | 事后分析成功轨迹,提炼成可复用 API |
| Architecture | ADAS, AFlow, Darwin Gödel Machine | 搜索最优架构,或改写自己的源代码 |
两种模式互补:
任务1执行中 → Intra(实时适应)→ 任务1完成
↓积累轨迹
Inter(复盘学习)→ 能力提升
↓
任务2执行中 → Intra(更强的实时适应)→ 任务2完成
↓
...螺旋上升
Chapter 5: How to Evolve
三大进化范式
第一代:Reward-based(奖励驱动) → 试错学习
第二代:Imitation-based(模仿学习)→ 示范学习
第三代:Population-based(种群进化)→ 进化学习
5.1 奖励驱动进化
四种反馈类型:
| 类型 | 例子 | 代表方法 |
|---|---|---|
| 文本反馈 | “代码第 3 行有 bug,建议改成 X” | Reflexion, Self-Refine, TextGrad |
| 内部奖励 | “我对这个答案有 90% 信心” | CISC, Self-Rewarding LMs, AgentEvolver |
| 外部奖励 | “通过了 8/10 个测试用例” | SWE-agent, RAGEN, LADDER |
| 隐式奖励 | LLM 训练目标中已包含奖励信号 | Reward Is Enough, Endogenous Reward |
5.2 模仿与示范学习
- Reward-based = evaluative(评价性):告诉你“好不好”。
- Imitation = prescriptive(处方性):直接给你“怎么做”。
三种示范来源:
- 自生成(STaR):做题 → 对的保留推理链 → SFT → 重复(自我螺旋提升)。
- 跨 Agent(SiriuS):多 Agent 共享成功经验库。
- 混合(RISE):结合自生成 + 外部,用置信度筛选。
5.3 种群与进化方法
Self-Play(自我对弈):
出题者 Agent: 生成一道难题
↓
解题者 Agent: 尝试解题
↓
验证 → 两者都被训练 → 循环...
代表:Absolute Zero、SPIN、SPC、SCA。
多 Agent 进化:
- EvoMAC:文本反向传播,编译错误当 loss 信号。
- Puppeteer:中央协调器通过 RL 进化决策策略。
- MDTeamGPT:双知识库 CorrectKB + ChainKB。
交叉维度对比:
| 维度 | Reward-based | Imitation | Population-based |
|---|---|---|---|
| 样本效率 | 中等 | 最高 | 最低 |
| 稳定性 | 对奖励设计敏感 | 对示范质量敏感 | 对种群大小敏感 |
| 可扩展性 | 反馈自动化时好 | 示范收集是瓶颈 | 计算资源密集 |
Chapter 6: Where to Evolve
通用领域进化(三种机制)
- Memory Mechanism:Mobile-Agent-E、MobileSteward、Generative Agents。
- Model-Agent Co-Evolution:UI-Genie、WebEvoler、Absolute Zero。
- Curriculum-Driven Training:WebRL、Voyager。
专用领域进化
| 领域 | 主要进化什么 | 主要信号 |
|---|---|---|
| Coding | Tool(代码技能库)+ Architecture | 环境反馈(测试通过/失败) |
| GUI | Context(记忆)+ Tool(操作技能) | 视觉反馈 + 反思 |
| Financial | Context(知识库) | 真实交易结果 |
| Medical | Model(诊断能力)+ Memory | 多 Agent 协作 + RL |
| Education | Context(教学策略) | Self-play + 专家反馈 |
Chapter 7: Evaluation
五大评估维度
| 维度 | 核心问题 | 关键指标 |
|---|---|---|
| Adaptivity | Agent 能随经验变好吗? | Success Rate by Iteration Steps |
| Retention | 学新的会不会忘旧的? | FGT(遗忘率)、BWT(后向迁移) |
| Generalization | 能迁移到新领域吗? | 多领域聚合表现、out-of-domain |
| Efficiency | 进化的代价是多少? | Token/时间/步数/Tool 调用 |
| Safety | 进化过程中会不会变“坏”? | Safety Score、Harm Score、Leakage Rate |
关键效率指标:
Cost-per-Gain (CPG) = Total Cost / (Performance Gain + ε)
→ CPG 越低,进化越高效
Tool Productivity (TP$) = ∆score / Σ cost(tool_i)
→ 每单位工具成本带来多少性能提升
三种评估范式:
时间跨度递增 → Static Assessment Short-horizon Adaptive Long-horizon Lifelong
(静态快照) (短周期适应) (长周期终身学习)
“此刻能力如何?” “几次尝试后能变好吗?” “长期能持续进化吗?”
一次测试,固定任务 多次尝试,追踪改进曲线 跨领域长期序列任务
当前评估的最大问题:
- Retention 最被忽视:大多数 benchmark 任务间重置状态。
- 效率很少报告:没有 cost breakdown。
- 安全只看单次:不追踪进化过程中的安全漂移。
- 长周期 benchmark 几乎不存在。
Chapter 8: Future Direction
8.1 个性化 AI Agent
关键挑战:冷启动、长期记忆管理、个性化生成、偏差放大。
数据治理四原则:数据最小化 / 端侧个性化 / 记忆衰减 / 偏差监控。
新评估指标:
- PAG(Personal Adaptation Gain):个性化 k 次后 vs 非个性化的提升。
- Privacy-Utility Trade-off:效用增益 vs 保留的个人数据量。
- Bias/Drift Monitors:跨用户群体的长期公平性测量。
8.2 泛化能力
四个子挑战:可扩展架构设计 / 跨域适应 / 持续学习 vs 灾难性遗忘 / 知识可迁移性。
8.3 安全可控的自进化 Agent
三条进化路径的涌现风险:
| 进化路径 | 涌现风险 | 具体例子 |
|---|---|---|
| Model | 行为漂移失控 | 自训练遗忘安全对齐 |
| Memory | 奖励黑客 | 发现“退不必要的全款”能获高分 |
| Tool | 工具安全隐患 | 自主创建的工具含漏洞 |
防御策略:沙箱 + 验证 / 审计 + 回滚 / 持续监控 + 红队 / 审批门 + 隐私保护。
8.4 多 Agent 生态
个体 vs 集体推理的平衡 / 高效框架 + 动态评估。
💡 对营销场景的启发
| 论文概念 | 营销场景应用 |
|---|---|
| Memory 进化(Mem0) | Agent 持续更新用户画像/投放策略,ADD/MERGE/UPDATE/DELETE |
| Prompt 优化(SPO) | Agent 自动优化投放文案、创意 prompt |
| Tool 自主创建(Voyager) | Agent 发现新的数据分析方法后自动封装为可复用工具 |
| Reward 信号 | CTR/CVR/ROI 天然就是标量奖励,用户评论是文本反馈 |
| Self-Play(Absolute Zero) | 一个 Agent 出投放方案,另一个 Agent 评估方案质量 |
| Curriculum 训练 | 从简单品类开始优化,逐步挑战复杂品类 |
| CPG(Cost-per-Gain) | 每次策略迭代花了多少成本 vs 带来多少 ROI |
| PAG(Personal Adaptation Gain) | 个性化推荐 k 次后 vs 千人一面的提升 |
| Safety 护栏 | 防止 Agent 生成违规素材、错误定价、过度投放 |
| xbench | 论文专门提到的营销领域 benchmark |
📚 参考文献精选
论文引用了大量工作,以下是最值得关注的:
- Voyager(Wang et al., 2023a)— Minecraft 中的终身学习 Agent。
- Reflexion(Shinn et al., 2023)— 口语化强化学习。
- TextGrad(Yellamraju et al., 2024)— 文本梯度反向传播。
- Mem0(Chhikara et al., 2025)— Agent 记忆管理系统。
- STaR(Zelikman et al., 2022)— 自生成示范学习。
- Darwin Gödel Machine(Zhang et al., 2025h)— 开放式自进化 Agent。
- ADAS(Hu et al., 2024c)— 自动化 Agent 系统发现。
- AFlow(Zhang et al., 2024c)— MCTS 搜索最优工作流。
- Absolute Zero(Zhao et al., 2025a)— Self-Play 零数据进化。
- RAGEN(Wang et al., 2025q)— 多步工具调用的 RL 框架。
- DSPy(Khattab et al., 2023)— 编程式 prompt 优化。
- Agent Workflow Memory(Wang et al., 2024j)— 工作流记忆复用。
📅 补充:论文发表后的最新进展(2026年1-5月)
论文于 2026 年 1 月发表,以下是截至 2026 年 5 月该领域的重大新进展,按与论文章节的对应关系组织。
🚀 1. Hyperagents — 元认知自改进(Meta,2026年3月)
补充章节:Ch3.4 Architecture / Ch8 Future Direction
论文:arxiv 2603.19461 | Meta AI Research
核心突破:解决了 Darwin Gödel Machine 的天花板问题。
Darwin Gödel Machine(论文中提到的最激进方法):
Agent 可以修改自己的代码
→ 但“修改自己的机制”是人写死的
→ 存在一个固定的 meta-agent,它不能改自己
Hyperagents(2026):
Task Agent 和 Meta Agent 可以互相修改(co-modify)
→ meta-agent 也能改自己
→ 自引用(self-referential)的元认知自我改进
→ “系统不仅改进自己的解题能力,还改进自己的改进方式”
在论文框架中的定位:这是 Architecture 进化的 Level 5——不仅改工作流,还改“改工作流的机制”。
进化的层级(新增 Level 5):
Level 1: 改 prompt/memory(最轻量)
Level 2: 改 skills/tools(中等)
Level 3: 改模型参数(重)
Level 4: 改架构/工作流(更重)
Level 5: 改“改进机制”本身(Hyperagents)← 2026 新突破
⚠️ 2. Zombie Agents — “僵尸 Agent”安全威胁(2026年2月)
补充章节:Ch8.3 Safe and Controllable Self-Evolving Agents
论文:arxiv 2602.15654 | OpenReview | 已被 Promptfoo LLM 安全数据库 收录。
核心发现:自进化 Agent 可以被永久劫持。
攻击链路:
1. 攻击者通过一次 prompt injection 注入恶意指令
2. Agent 的自进化机制(memory 更新)把恶意指令写入长期记忆
3. 每次上下文更新循环,Agent 自己强化这个恶意指令
4. → 变成“僵尸”:被永久控制,跨 session 持续执行攻击者指令
关键区别:
传统 prompt injection → 一次性的,session 结束就失效
Zombie Agent → 利用自进化能力,让恶意行为“自我强化”,永久持久
为什么重要:这是第一次系统性地证明自进化机制可以被武器化。论文的 Ch8.3 讨论了理论风险,Zombie Agents 给出了实证攻击。
⚠️ 3. Misevolution — “进化退化”被系统性验证
补充章节:Ch8.3 Safe and Controllable Self-Evolving Agents
论文:arxiv 2509.26354 | GitHub | OpenReview 接收。
2026 年 4 月后续:On Safety Risks in Experience-Driven Self-Evolving Agents
核心发现:即使 Gemini-2.5-Pro 级别的顶级模型也会“进化退化”。
Misevolution 三种表现:
1. 记忆积累后 → 安全对齐退化
2. 工具进化后 → 出现意外有害行为
3. 奖励黑客 → 随进化过程累积
2026年4月新发现:
- 在有害任务上的执行经验 → 导致更严重的安全退化
- Agent 做了一次“坏事”的经验 → 让它更容易做更多“坏事”
对论文框架的补充:论文 Ch8.3.1 的“涌现风险”在这里有了量化实证。
🧠 4. ACE — Agentic Context Engineering(Stanford/Berkeley)
补充章节:Ch3.2.2 Prompt Optimization
论文:arxiv 2510.04618 | Anthropic 博客
核心思想:把 context 当“不断进化的剧本”,三层架构。
ACE 框架(Generator-Reflector-Curator):
Generator — 生成新的策略/知识
Reflector — 反思执行结果,评估策略质量
Curator — 组织、精炼、淘汰上下文中的知识
效果:
- benchmark 提升 10.6%
- 延迟降低 86.9%
- 成本降低 75.1%
在论文框架中的定位:这是 Context 进化的最新范式——不改模型参数,只进化上下文。论文中提到的 SPO/TextGrad 等方法都是优化 prompt 文本本身,ACE 把视野扩大到了整个 context 的生命周期管理。
🎯 5. Agent0 — 零数据自进化(2025年底提出,2026年初爆火)
补充章节:Ch5.3.1 Self-Play
论文:arxiv 2511.16043 | GitHub | HuggingFace
核心突破:完全不需要人类数据,从零开始进化出高性能 Agent。
Curriculum Agent + Executor Agent 共进化:
Curriculum Agent → 自动生成适合当前能力边界的任务(不需要人类标注)
Executor Agent → 尝试解决任务 → 成功轨迹用于自我训练
正反馈循环:
Executor 变强 → Curriculum 出更难的题 → Executor 继续变强
在论文框架中的定位:Self-Play + Tool 进化的极致——完全自主,零人类干预。
🔧 6. Skills 生态大爆发(2026年2-4月)
补充章节:Ch3.3 Tools / Ch7 Evaluation
2026 年初 Skills 领域密集发表,形成了完整的生态:
| 论文 | 时间 | 核心贡献 | 对应论文章节 |
|---|---|---|---|
| Agent Skills for LLMs (2602.12430) | 2月 | 架构/获取/安全的系统性综述,GitHub Copilot/LangChain/OpenAI 已官方支持 | Ch3.3 |
| AgentSkillOS (2603.02176) | 3月 | 第一个 skill 选择/编排/生态级管理框架 | Ch3.3 规模管理 |
| EvoSkill (2603.02766) | 3月 | 从执行失败中自动发现/精炼新 skills | Ch3.3 自主创建 |
| SkillsBench (2602.12670) | 2月 | Skill 增强效果的评估 benchmark | Ch7 Evaluation |
| CoEvoSkills (2604.01687) | 4月 | Skill Generator + Skill Verifier 共进化验证 | Ch5.3 种群进化 |
Skills 对自进化的三大价值(论文未展开,最新研究补充):
1. 解决灾难性遗忘(Retention)
传统 RL 微调 → 学新的忘旧的
Skills → 封装为独立模块,旧 skills 不受影响
2. 提供可解释的进化轨迹(Safety)
模型参数进化 → 黑盒
Skills 进化 → 白盒(可读代码/文档,可 review/rollback/version control)
3. 实现人类参与的进化(Human-in-the-Loop)
完全自主(Voyager)→ 可能造出不安全技能
Skills 模式 → Agent 提议,人类确认,平衡自主性和可控性
🔬 7. 其他重要新进展
EvoScientist — 自进化 AI 科学家(2026年3月)
补充章节:Ch6 Where to Evolve(新增“科学研究”领域)
论文:arxiv 2603.08127 | GitHub 3.2k ⭐
三种自进化机制:Idea Direction Evolution / Idea Validation Evolution / Experiment Strategy Evolution。论文 Ch6 没有覆盖“科学研究”这个领域,EvoScientist 补充了这一空白。
SAGE — 四 Agent 闭环推理进化(2026年3月)
补充章节:Ch5.3.2 Multi-Agent Evolution
Challenger + Planner + Executor + Evaluator 四角色闭环,所有角色共同进化。
Dual-Process Agent — 双过程理论(2026年)
补充章节:Ch2 Definitions and Foundations
论文:MDPI Electronics 15(6):1232
借鉴人类认知的 System 1(快思考)/ System 2(慢思考)理论,在 frozen 模型上做持续的 context 优化。论文 Ch2 的定义框架中未涉及认知科学视角,Dual-Process Agent 提供了新的理论基础。
NVIDIA OpenShell — 安全运行时(2026年3月16日)
补充章节:Ch8.3.2 Prescriptive Guardrails
开源、自托管、企业级隐私保护的自进化 Agent 安全运行时。直接实现了论文 Ch8.3.2 的 “Sandboxing and verification” 防御策略。
📊 论文框架 vs 最新研究:覆盖度评估
| 论文章节 | 论文覆盖度 | 最新研究补充 |
|---|---|---|
| Ch3.1 Models | ★★★★ | — |
| Ch3.2 Context | ★★★ | ACE 补充了 context 生命周期管理 |
| Ch3.3 Tools | ★★★ | Skills 生态大爆发(5+ 论文) |
| Ch3.4 Architecture | ★★★ | Hyperagents 补充了 Level 5 元认知进化 |
| Ch4 When | ★★★★ | — |
| Ch5 How | ★★★★ | Agent0 补充了零数据进化 |
| Ch6 Where | ★★★ | EvoScientist 补充了科学研究领域 |
| Ch7 Evaluation | ★★ | SkillsBench 部分补充了工具评估 |
| Ch8.1 Personalize | ★★ | — |
| Ch8.2 Generalization | ★★ | — |
| Ch8.3 Safety | ★★ | Zombie Agents + Misevolution 大幅补充 |
| Ch8.4 Multi-Agent | ★★ | SAGE 补充了具体实现 |
结论:论文的框架在 5 个月后依然有效,但在安全(Ch8.3)和 Skills 生态(Ch3.3)两个方向上有了大量新的实证研究,值得重点关注。
📚 补充参考文献(2026年1-5月)
- Hyperagents(Meta, arXiv:2603.19461)— 元认知自改进,突破 DGM 天花板。
- Zombie Agents(arXiv:2602.15654)— 自进化 Agent 的持久化安全攻击。
- Misevolution(arXiv:2509.26354)— 自进化过程中的安全退化实证。
- ACE(arXiv:2510.04618)— Agentic Context Engineering,上下文进化框架。
- Agent0(arXiv:2511.16043)— 零数据自进化 Agent。
- CoEvoSkills(arXiv:2604.01687)— 共进化验证的自进化 Skills。
- AgentSkillOS(arXiv:2603.02176)— Skill 生态级管理框架。
- EvoSkill(arXiv:2603.02766)— 从失败中自动发现新 Skills。
- EvoScientist(arXiv:2603.08127)— 自进化 AI 科学家框架。
- SAGE(arXiv:2603.15255)— 四 Agent 闭环推理进化。
- SkillsBench(arXiv:2602.12670)— Skill 增强效果评估 Benchmark。
- NVIDIA OpenShell(2026.3)— 自进化 Agent 安全运行时。