多智能体总忘记关键经验?隐空间记忆给出另一种解法

文章配图

这篇工作由同济、上海 AI Lab、港中文、南大和上交合作完成,目前发布在 Arxiv 26.03 上。当前多智能体系统(MAS)的记忆设计普遍卡在两个瓶颈:记忆同质化(缺乏角色感知的定制)和信息过载(记忆条目过于细碎冗长)。本文提出 LatentMem,一套可学习的隐空间多智能体记忆框架:用轻量经验库存原始轨迹,再用记忆合成器(memory composer)结合角色画像把轨迹蒸馏成定长的隐式记忆(latent memory),随后通过 LMPO 把任务级信号反传给合成器,使其学会产出紧凑且实用的表示。

背景

LLM 驱动的多智能体系统靠角色分工来协作解决复杂任务,而多智能体记忆正是它随时间持续适应的物质基础。失败会暴露隐藏约束,成功的 rollout 会暴露可复用策略,奖励则把行为锚定在环境反馈上。近期研究越来越偏向多粒度记忆库,在不同抽象层次上捕捉经验:MAS 轨迹、蒸馏出的语义洞察、可编排的技能 schema。不过作者指出,现有记忆系统被两个关键问题卡住:

  • 记忆同质化 :大多数方法采用 one-size-fits-all 的策略,忽视了 Agent 的功能异质性,导致角色遵从性被破坏、相关性错误被放大,削弱系统鲁棒性
  • 信息过载 :MAS 本身就有很长的交互上下文,多粒度记忆设计又引入大量存储条目,最终淹没 Agent、遮蔽关键决策信号

由此引出核心问题:在 MAS 又长又复杂的上下文里,能否设计一种既角色感知又 token 高效、且不需要大量人工工程的可学习记忆?

方法

LatentMem 由两个核心组件构成:一个负责存取历史轨迹的轻量经验库(experience bank),以及一个把检索到的轨迹转成紧凑、角色感知隐式记忆的可学习记忆合成器(memory composer)。整体流程分四步:(1)从经验库检索相关轨迹;(2)结合角色画像,用 LMPO 训练过的合成器压成隐式记忆;(3)把隐式记忆注入 Agent 的推理过程;(4)任务完成后把新轨迹存回经验库,形成自改进闭环。

问题形式化

一个 MAS 记为 \(\mathcal{X} = (\mathcal{A}, \mathcal{G}, \mathcal{M})\),含 \(N\) 个 Agent、执行图 \(\mathcal{G}\)(可以是静态拓扑也可以是中心化的动态调度)和全局记忆模块 \(\mathcal{M}\)。每个 Agent \(a_k = (\gamma_k, \pi_{\theta_k})\) 由角色画像 \(\gamma_k\) 和策略 \(\pi_{\theta_k}\) 定义,执行时接收输入 prompt \(p\) 和检索到的记忆 \(m\),产出响应 \(o = a_k(p, m)\)。优化目标是找到最大化 MAS 期望表现的记忆模块:$$\max_{\mathcal{M}} \mathbb{E}_{q \sim D, \tau \sim \mathcal{X}(q)}[R(\tau)]$$这个形式化对具体记忆架构不可知,从手工符号系统到可学习参数化记忆都能套进来。

Memory Bank

为了忠实记录历史轨迹供日后复用,作者搭了一个极度轻量的经验库。秉持"可扩展系统应依赖通用学习机制而非手工知识"的原则,这个库只存原始轨迹,不引入任何人工先验(既不做轨迹压缩,也不做洞察抽取)。

  • 初始化 :用覆盖多领域、多 MAS 框架的轨迹集合填充经验库,让合成器学到可泛化的记忆模式。每条轨迹 \(\tau = \{(\alpha_j, p_j, o_j)\}_{j=1}^{H}\) 记录每一步活跃 Agent 的索引、输入 prompt 和输出

文章配图

  • 检索 :新 query \(q\) 到来时做基于相似度的检索,取 top-\(K\) 条相关轨迹 \(\mathcal{T}q = \text{top-}K{\tau_i \in \mathcal{B}}(\text{sim}(v(q), v(\tau_i)))\)其中 \(v(\cdot)\) 用 MiniLM 把 query/轨迹映到 embedding 空间、\(\text{sim}\) 是余弦相似度
  • 更新 :任务完成后新轨迹直接 append 进库 \(\mathcal{B} \leftarrow \mathcal{B} \cup \{\tau_{\text{new}}\}\),实现推理时的在线增量积累,无需重训

需说明,直接把检索到的原始轨迹喂给 Agent 是次优做法:过量的上下文会淹没 LLM,也抓不到异质 MAS 里的角色特定表示,这正是 Memory Composer 存在的意义。

Memory Composer

合成器 \(\mathcal{C}\) 实例化为一个参数为 \(\phi\) 的深度网络 \(\sigma_\phi\)。在第 \(j\) 步推理,它以检索轨迹 \(\mathcal{T}q\) 和当前活跃 Agent 的角色画像 \(\gamma{\alpha_j}\) 为输入,产出一个定长、角色感知的隐式记忆矩阵 :\(m_j = \sigma_\phi(\gamma_{\alpha_j}, \mathcal{T}_q) \in \mathbb{R}^{L' \times D}\)其中 \(L'\) 是隐式记忆的固定长度、\(D\) 是基座模型隐藏维度。

关键设计在于注入方式 :活跃 Agent 先把输入 prompt 编码成隐状态序列 \(h_j \in \mathbb{R}^{L \times D}\),然后把隐式记忆 \(m_j\) 拼接到 \(h_j\) 上形成 \(\mathbb{R}^{(L+L') \times D}\) 的扩展输入,得到记忆增强策略 \(\tilde\pi_{\theta_{\alpha_j}}(p_j, m_j) = \pi_{\theta_{\alpha_j}}(\text{concat}(h_j, m_j))\)。这种注入发生在模型层面 ,对 Agent 层透明,不需要改动系统架构(相当于把记忆当成几个额外的 latent token 塞进去,而不是拼一大段文字进 prompt)。

LMPO

这是全文的训练核心,是 GRPO 的一个变体,目的是端到端优化合成器,同时冻结所有 Agent 骨干

  • 可微接口 :隐式记忆 \(m_j = \sigma_\phi(\mathcal{T}q, \gamma{\alpha_j})\) 是一个可微接口,\(\phi\) 通过它影响活跃 Agent 自回归产出的 \(o_j\)。因为组合策略 \(\tilde\pi\) 是以 \(m_j\) 为条件的,任何任务级目标的梯度都能穿过 Agent 的前向过程反传回 \(\phi\),从而端到端优化合成器(Agent 本身不动,只学怎么造记忆)
  • 组内相对优势 :给定 query 采样一组 \(G\) 条轨迹,用 group-based advantage \(\hat{A}_i = \frac{R(\hat\tau_i) - \text{mean}(\{R\})}{\text{std}(\{R\}) + \epsilon}\) 刻画相对质量
  • Token 级目标 :标准 RL 常用轨迹级目标,会让长 MAS 交互里的 token 对梯度贡献被稀释,抓不住长程协调模式。因此 LMPO 改用 token 级 surrogate 目标 (PPO 式 clip),重要性采样比 \(r_{i,j,t}(\phi)\) 衡量的是 Agent 策略在第 \(j\) 步第 \(t\) 个 token 上被更新后的记忆调制了多少

实验

评测覆盖包括知识密集 QA(TriviaQA、PopQA)、代码(KodCode、BigCodeBench)、推理 QA(StrategyQA)和符号规划(PDDL)。其中 TriviaQA/KodCode/StrategyQA/PopQA 属于 held-in,BigCodeBench/PDDL 属于 held-out。

MAS 框架 :AutoGen、MacNet 是 in-distribution,CAMEL、DyLAN 是没见过的框架 (引入新角色和协作模式)。骨干用 Qwen3-4B-Instruct-2507 和 Llama-3.1-8B-Instruct。

文章配图

Baseline :memory-free + 单智能体记忆(Voyager、Generative、JoyAgent)+ 多智能体记忆(MetaGPT、ChatDev、OAgents、G-Memory)。

训练配置 :embedding 用 all-MiniLM-L6-v2,合成器是从骨干初始化、用 LoRA 训练的轻量 transformer,检索数 \(K=1\),隐式记忆长度 \(L'=8\)。

主要结果

  • 跨领域跨框架高性能 :在 AutoGen、MacNet 上分别平均超过单/多智能体记忆 baseline 约 7.86% 和 6.66%,AutoGen + TriviaQA 上提升 16.20%,最大提升在 DyLAN + PopQA 上达 19.36%
  • 强泛化 :在 held-out 上多数 baseline 都掉点(MetaGPT/Voyager 在 PDDL 上分别掉 4.44%/2.77%),而 LatentMem 在 PDDL 上 +7.10%、在没见过的 CAMEL + KodCode 上 +7.05%
  • 高效率 :既拿到最大性能增益又只花最少的时间和 token。DyLAN + TriviaQA 上把推理时间相对 OAgents 砍到 1/2.16,AutoGen + KodCode 上用的 token 甚至比 No-Memory 还少 0.01M;对比之下 JoyAgent 多花 1.87M token 只换来 2.50% 提升
  • 对比多智能体微调 :和在同等算力下用 GRPO 训练的 MARTI 比,LatentMem 全面胜出,AutoGen + TriviaQA 上高出 11.73%。这说明只训一个造记忆的小合成器比直接微调整个 Agent 骨干更划算

框架分析与消融

  • 角色感知可视化 :t-SNE 显示 user-proxy 和 assistant 的记忆形成两个清晰分离的簇,即使在没见过的 CAMEL + BigCodeBench 上依然分得开,证明它确实避免了同质化记忆
  • 随任务时程扩展 :累积准确率随经验积累稳步上升,早期方差大但很快稳定并持续改进
  • 消融 :去掉角色画像(\(\gamma\))→ AutoGen 上掉 2.30%、复杂的 MacNet 上掉 6.45%,说明角色感知对复杂 MAS 更重要;去掉经验库实时更新 → KodCode 上掉 3.60%、PDDL 上掉 7.63%,说明在线更新对适应复杂任务分布至关重要
  • Case Study :Vanilla MacNet 常犯步骤重复 (pick-move-drop 来回循环),MacNet + OAgents 则盲目照抄检索到的轨迹 违反任务规范;而 LatentMem 的角色感知隐式记忆让 Agent 强化角色遵从、自我纠错

总结

LatentMem 的核心贡献,是把多智能体记忆从「手工设计的离散文本记忆」推进到「可学习的定长隐式记忆」:用极轻量经验库存原始轨迹,用受角色画像条件化的合成器把轨迹蒸成角色感知的 latent token,再借助 LMPO 与隐式记忆的可微性做端到端优化,一次性缓解了记忆同质化和信息过载两个问题。

不过有两点值得琢磨:其一,隐式记忆是模型内部的 latent 向量,可解释性基本丧失,t-SNE 虽能看出分簇,但到底记了什么说不清,在需要 agent 审计的场景里是个隐患;其二,检索只取 \(K=1\)、隐式长度仅 \(L'=8\),在这么高的压缩比下,面对更长程、更多轨迹的任务能否扛住,正文并未充分展开。

论文标题 :LatentMem: Customizing Latent Memory for Multi-Agent Systems

机构 :同济大学、上海 AI Lab、香港中文大学(CUHK)、南京大学、上海交通大学

核心贡献者 :Muxin Fu(一作);通讯:Xiaoye Qu, Yu Cheng, Yang Yang

arXiv :2602.03036v2(2026.03)

代码

关键词 :Multi-Agent Memory, Latent Memory, Role-Aware Customization, LMPO

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?