记忆系统也会"进化"? MemEvolve 让 Agent 自己设计自己的大脑
当我们谈论 AI Agent 的自我进化时, 记忆系统始终是最核心的引擎——它负责把 Agent 与环境的交互沉淀为可复用的知识和技能。 但有一个被长期忽视的问题:记忆系统自身的架构, 是不是也该跟着任务一起进化?
OPPO AI Agent Team 与 LV-NUS lab 合作的工作 MemEvolve(发表于 ICML 2026)给出了一个漂亮的答案。 这篇论文提出了一个元进化框架, 让 Agent 不仅能积累经验, 还能持续改进"它从经验中学习的方式"。
痛点:没有万能记忆架构
记忆系统的表征形态一直在演进。 从最早的原始轨迹存储 + few-shot 提示, 到更抽象的文本产物(tips、shortcuts、推理模板), 再到近期的结构化工具接口(API、MCP)和代码仓库。 但一个根本性的矛盾始终存在:
不存在一个普适最优的记忆架构。
一个擅长从历史轨迹中蒸馏可复用 API 的记忆系统, 在网页浏览任务上表现出色, 但对数学推理几乎毫无帮助;反过来, 基于自我批判(self-critique)的记忆在推理密集型任务上很强, 却在编码和工具使用场景下彻底失效。
作者把这种 trade-off 归因于当前记忆系统的静态本质:研究者设计一条固定的记忆流水线(摄入 / 抽象 / 检索), 嵌入 Agent 后, 就假设它能靠"不断接触新经验"维持长期进化。 但这忽略了一个关键现实——不同任务耦合着不同的记忆需求, 一个无法自我调整的记忆系统, 从根本上就与开放式 Agent 进化的前提相矛盾。
从"熟练学习者"到"自适应学习者"
论文用了一个类比来阐明核心思想:
- 平庸学习者:无法从经验中受益, 等同于没有记忆的 Agent
- 熟练学习者:能从过去经验中提取可复用技能, 但使用的是固定预定义的抽象方式
- 自适应学习者:在积累经验的同时, 还能动态调整"经验被巩固和利用的策略"
MemEvolve 的目标, 就是让 Agent 从"熟练学习者"跃迁为"自适应学习者"。
方法:双层优化 + 四组件模块化设计空间
双层优化:经验进化与架构进化并行
MemEvolve 在概念上是一个双层优化(bilevel optimization)过程:
- 内层循环(一阶进化):在固定记忆系统的引导下, Agent 通过持续的新任务流填充自己的经验库
- 外层循环(二阶进化):元学习出一个更有效的记忆架构, 来加速未来的学习
这形成了一个良性循环:外层进化出更好的架构 → 提升 Agent 学习效率 → 更强的 Agent 产出更高质量的轨迹 → 为外层提供更精确的适应度信号去驱动下一轮架构进化。
EvolveLab:把任意记忆系统拆解为四个组件
由于记忆系统的设计空间庞大且异构(知识图谱、技能库、向量数据库……), 直接做可控优化几乎不可能。 为此, 论文把任意记忆架构 Ω 解耦为四个功能独立又相互依赖的组件:
- Encode(编码 E):把原始经验(轨迹片段、工具输出、自我批判)转化为结构化表征。 可以简单如压缩原始 trace, 也可复杂如提炼可泛化的 lessons
- Store(存储 U):把编码后的经验整合进持久记忆, 载体可以是向量数据库、知识图谱等
- Retrieve(检索 R):提供任务相关的记忆内容, 指导 Agent 的策略决策。 检索内容可以是可复用工具、规划经验或蒸馏的程序性知识
- Manage(管理 G):执行离线、异步的操作, 如整合(consolidation)、抽象、选择性遗忘, 以维护长期记忆质量与效率
这一模块化抽象把每个记忆系统表示为 (E, U, R, G) 四个可编程实现的具体组合, 构成一个"基因型", 正是 MemEvolve 元进化的操作对象。
基于此设计空间, 作者构建了 EvolveLab——一个统一、可扩展的自进化记忆代码库, 把 12 个代表性记忆系统(Voyager、ExpeL、Generative、DILU、AWM、Mobile-E、Cheatsheet、SkillWeaver、G-Memory、Agent-KB、Memp、EvolveR)在同一模块化接口下重新实现, 全部继承自单一抽象基类 BaseMemoryProvider, 强制实现统一的四组件接口。 EvolveLab 同时提供标准化测试平台(GAIA、xBench、DeepResearchBench 等), 支持在线模式和离线模式两种范式。
双层进化过程
传统自进化记忆在固定 Ω 下演化:能积累知识, 但从根本上排除了架构适应, 因为接口 Ω 本身不可变。
MemEvolve 不再维护单个静态 Ω, 而是在每个进化迭代 k 维护一个候选记忆系统的有限集合。 初始迭代从单例集(一个手工设计的 baseline 记忆)出发, 后续迭代允许多个竞争候选:
- 内层(经验进化):对每个候选, 其记忆状态从空初始化, 沿轨迹更新。 执行后对每条轨迹产出反馈向量(任务成功、Token 消耗、延迟三个指标), 聚合为汇总分数
- 外层(架构进化):元进化算子根据汇总分数选出高性能候选、提出新变体, 产生下一代候选集。 具体地, 按分数排序保留 top-K 记忆系统, 再通过修改或重组它们的四个组件生成新架构
一句话概括:每轮迭代交替执行"在固定架构下从空初始化演化经验库"和"基于诱导出的性能演化架构本身", 让记忆库与治理它的架构协同进化。
Diagnose-and-Design:元进化算子的核心
元进化算子分解为两个协同部分:
1. 架构选择
把每个候选的汇总向量定义为 (Perf, -Cost, -Delay), 三个维度都是越大越好。 候选先按非支配排序得到 Pareto rank;同一 Pareto rank 内再按主性能指标排序;取 top-K 作为父代集合。 这保证架构进化由"兼顾任务效果与资源效率的系统"引导。
2. 诊断-设计进化
对每个父代架构, 通过两阶段生成后代:
- 诊断:用父代自己执行批次的轨迹级证据检查它。 对每条轨迹提供结果统计 + 任务查询的结构化描述;一个 replay 接口允许回放对应轨迹, 做针对性检查(包括检索失败、无效抽象、存储低效等)。 诊断阶段产出一份结构化缺陷画像, 刻画四个组件上的架构瓶颈
- 设计:以缺陷画像为条件, 只修改模块化接口内允许的实现位点来构造重设计架构, 从而保证兼容性、把架构变更隔离在指定设计空间内。 产出 S 个变体, 它们在编码策略、存储规则、检索约束或管理策略上各不相同, 但都符合统一接口
这一机制保证架构更新既有经验依据, 又被结构化约束在统一设计空间内。
实验:跨任务、跨模型、跨框架的一致增益
Benchmark:GAIA、WebWalkerQA、xBench-DeepSearch、TaskCraft 四个高难度 Agentic 基准
Agent 框架:集成到 SmolAgent(轻量双 Agent 架构)和 Flash-Searcher(高性能单 Agent 深研系统);另在两个 held-out 多 Agent 系统上验证泛化:腾讯 CK-Pro 和 OWL
模型:主干用 GPT-5-mini(同时也支撑元进化算子), 另加 DeepSeek V3.2 和 Kimi K2 测跨 LLM 泛化
主要结果
- 记忆系统对 Agent 至关重要:xBench 上 SmolAgent + GPT-5-Mini 初始 pass@1 为 51%, 接入 MemEvolve 后 +6%, pass@3 涨到 68%;Flash-Searcher + GPT-5-Mini 从 69% 提到 74%。 在 GAIA 上 MemEvolve + Flash-Searcher pass@3 达 80.61%, 超过 OWL-Workforce、CK-Pro 等强多 Agent 系统
- 跨任务 / 跨模型 / 跨框架泛化:WebWalkerQA 和 xBench 上用的记忆系统直接继承自 TaskCraft 上进化的结果、未做任何任务特定元进化, 仍带来一致增益(WebWalkerQA 58.82→61.18%, xBench 69.0→74.0%), 说明 MemEvolve 捕获的是任务无关的记忆设计原则而非对单个数据集的过拟合
- 成本可控:API 成本与 No-Memory baseline 相当(GAIA:$0.085 vs $0.086;xBench:$0.136 vs $0.141), 执行延迟也与其他自进化 baseline 同一量级
与人工设计记忆系统的对比
作者把 EvolveLab 里 7 个代表性人工记忆系统接到 Flash-Searcher 上对比, 发现:
- 现有记忆系统难以带来一致增益:DILU 在 xBench 和 WebWalkerQA 上提升却在 GAIA 上掉 2.42%;Dynamic Cheatsheet 靠技能凝练在 WebWalkerQA 上 +1.76% 却在 GAIA、xBench 上表现很差;ExpeL 在三个基准上全部退化——因为它原本是为简单具身/QA 场景设计的, 机制不适配长程、长上下文的深度研究
- MemEvolve 提供稳健一致的改进:虽在 TaskCraft 上进化, 却在三个基准上稳定取得 3.54%~5.0% 的提升, 且累积成功率曲线随任务推进逐渐稳定收敛到明显更优的水平
元进化动态:Agent 如何自发学会设计记忆
论文展示了从固定的 AgentKB 架构出发, 逐步进化到越来越 agentic、越来越高效的记忆架构的路径:
- 初始 AgentKB 对 encode 和 store 都采用冻结设计, 无法吸收新经验
- 第一轮里出现激进候选(把单条轨迹分解为 9 种技能粒度的 Adaptive Decision System)和保守候选(四层存储轨迹 + 检索时引入 LLM meta-guardrail 过滤无关信息的 Meta Memory System), 后者胜出
- 第三轮进化里, 记忆系统学会不仅蒸馏文本洞察, 还蒸馏可复用工具, 并引入对记忆数据库的周期性维护
进化出的记忆在实际中确实有效:从最简 few-shot baseline 进化出的 Lightweight 系统能在不同任务阶段自适应地提供不同粒度的记忆——早期规划阶段给高层任务分解策略, 执行推进时给细粒度工具使用建议 + 高亮关键信息的工作记忆;它甚至表现出预测性行为, 预判目标信息可能出现在在线旅游网站的图片内容里, 成功引导 Agent 在 trip.com 上定位证据。
总结:记忆设计原则的自动发现
MemEvolve 揭示了几条自动进化出的记忆设计原则:更多的 agentic 参与、分层组织、多层抽象。 它把"自进化记忆"这件事从"人工精心设计单一架构并期望其跨域泛化"推进到"由经验交互反馈驱动的、架构级的自适应进化"。
这篇工作的立意很好, 抓住了当前记忆系统研究的一个真痛点——大家都在卷"记忆表征形态"(tips vs 工具 vs 图谱), 但很少有人去问"这个记忆架构本身该不该随任务自适应"。 把记忆系统解耦成 Encode/Store/Retrieve/Manage 四组件、再用 Pareto 排序 + Diagnose-and-Design 去做架构级进化, 思路是干净且可复现的(配套开源了 EvolveLab, 把 12 个记忆系统统一实现, 这个工程贡献本身就很有价值)。
论文标题:MemEvolve: Meta-Evolution of Agent Memory Systems
机构:OPPO AI Agent Team, LV-NUS lab
arXiv:2512.18746(2025.12)

评论0