上海AI Lab团队推出MemHarness:让Agent记忆像人类一样被重构

检索过往经验,已成为增强LLMAgent 决策能力的常见方法。在面对新任务时,Agent 往往会直接调用过去的经验,借助记忆辅助判断。

但问题在于,历史经验只有在适配当前上下文时,才具有实用价值。多数现有记忆增强 Agent 会把检索到的经验当作静态记录,直接注入上下文,很少判断这些经验是否适合当前上下文。如果“旧”经验与当前状态不匹配,反而可能干扰决策、导致负面效果(负迁移)。

与人工智能(AI)系统不同,人类调用记忆则更加灵活:通常会结合当前上下文,重新判断以往经验该如何使用,从而更好地服务于当前决策。

受到这一启发,上海 AI Lab 团队及其合作者提出了“LLM Agent 经验重构”框架 MemHarness,通过在检索与动作之间插入显式的记忆重构环节来主动 harness 检索到的经验,并通过 GRPO 端到端地学习这一能力,且无需任何额外的人工标注。

结果显示,MemHarness 的性能显著优于纯强化学习(RL)和静态记忆增强基线方法,且在分布外(OOD)场景中展现出很强的鲁棒性。同时,重构目标不仅减少了负迁移,也在记忆重构过程中进一步训练了 Agent 的推理能力。

论文链接:https://arxiv.org/abs/2607.28272

像人类一样“检索、评估和重构”

MemHarness 的设计思路是通过在“检索”与“动作”之间显式插入“批判”与“重构”这两个新的环节,主动地 harness 所检索到的经验,从而将记忆从静态的提示片段转变为具有上下文敏感性的指导信息。

其中,历史记忆只保留可迁移的部分,供模型在新状态下继续使用。具体流程如下:

检索:根据最近几步的观测和动作,判断是否需要调用历史经验。需要时,模型会查询经验记忆库,获取相关经验。

重构:负责将检索到的经验改写成当前可用的指导。模型会结合任务描述、当前上下文、检索到的记忆和来源状态,比较过去与现在的差异,再决定保留、改写还是丢弃。如果没有合适的记忆,就跳过这一步,直接让模型继续推理。

动作生成:模型结合当前历史信息和重构后的指导生成动作。重构模块不单独提供标注,整个流程主要依赖任务奖励,并通过 GRPO 端到端优化。

图|MemHarness 框架概览。

整个训练阶段,MemHarness 采用 GRPO 进行端到端优化,优化信号来自任务奖励和格式约束。GRPO 会比较同一任务下多条轨迹的表现,思考、重构和动作生成可以同时训练,不需要单独训练价值网络。

持续优于纯RL基线

研究团队在两个具有挑战性的 agent 决策基准 ALFWorld 和 WebShop 上评估了MemHarness。

结果显示,MemHarness 持续优于纯 RL 基线以及 SOTA 静态记忆增强方法。消融实验进一步表明,去除重构阶段会使模型性能退化到与朴素记忆重放相当的水平,这证实了自适应重构(而非单纯的检索)才是实验中所观察到的性能提升的主要驱动因素。

详细实验结果如下:

1.优于纯 RL 和静态记忆

结果显示,相比直接叠加外部记忆的做法,MemHarness 通过记忆重构取得了更好的整体表现;即便模型规模只有 7B,其表现也超过了更大规模的 Gemini-2.5-Pro 等闭源模型。

图|ALFWorld 和 WebShop 上的主要结果。

2. 直接复用记忆会引入噪声

消融结果显示,当去掉记忆重构后,Agent 在 ALFWorld 上的表现会下降。直接将检索到的经验放入上下文,并不一定能辅助决策。

图|MemHarness 各组件的消融实验。

在 OOD 评测中,测试环境换成了训练时没见过的布局和物品位置。当 Agent 直接套用旧经验时,更容易做出错误决策;MemHarness 则会先判断记忆是否适用,并改写或舍弃不匹配的内容,在OOD场景中具有强大的鲁棒性。

图|ALFWorld 在 OOD 场景中的表现。

3.重构需要端到端训练

训练过程中,Agent 会把交互轨迹中的经验逐步存进记忆库,每次只取最相关的三条作为参考。由于没有现成标注告诉模型记忆该怎么改写,整套“检索-重构-行动”流程只能靠 GRPO 结合任务奖励端到端训练。

图|RL 训练过程中记忆使用行为的演化。

4.当前状态决定重构是否有效

结果显示,策略模型是否采纳重构内容,取决于来源状态和当前状态是否匹配。如果将来源状态替换为明显不匹配的随机状态,模型的拒绝率会上升;如果直接删去原始状态信息,拒绝率变化不大,任务成功率会下降。

图|按记忆决策条件划分的成功率训练动态。“SR when Accepted/Rejected”表示包含至少一次被接受或被拒绝的记忆重构的轨迹对应的成功率。

当然,目前的方法也存在一些不足。

例如,MemHarness 目前主要只在 ALFWorld 和 WebShop 两个交互式基准上进行了验证,尚未覆盖更开放、更多样的真实环境。未来,研究团队仍需在更大规模的模型和更开放的环境中进一步验证该方法。

此外,目前冷启动模型本身的任务表现有限,真正的重建和决策能力仍需要要依赖后续的任务级强化学习。

本文来自微信公众号 “学术头条”(ID:SciTouTiao),作者:夏千斯,36氪经授权发布。

发布时间:2026-08-03 17:16