【ICLR 2026】ELMUR:长时程部分可观测决策,给每一层 Transformer 装上可重写的外部记忆|从智能体记忆与具身决策视角
摘要本文解读 ICLR 2026 论文《ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems》。该论文提出ELMUR——一种在 Transformer 的每一层外挂结构化外部记忆的架构通过融合层内局部记忆嵌入、双向 token–memory 交叉注意力与基于 LRU 的替换/凸混合重写规则让智能体在部分可观测的长时程任务中仍能记住很久之前出现过的关键线索其特别之处在于记忆容量有界、开销与序列长度解耦且完全不改动注意力本身。实验表明在上下文只有 10 步的前提下ELMUR 在长达一百万步的 T-Maze 走廊上仍保持 100% 成功率在 MIKASA-Robo 的 32 个操作任务上把聚合成功率从 5.42 提升到 9.24相对提升约 70%并在 POPGym-48 上以 10.41 的总分居首为长时程记忆与具身决策提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQELMUR 和 Transformer-XL 有什么本质区别为什么不直接把上下文窗口做得更长记忆槽数要设多大ELMUR 会损害反应式任务的性能吗混合系数应该怎么选这套机制能迁移到视觉语言动作模型上吗参考链接论文基本信息项目内容标题英文ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems标题中文长时程部分可观测决策给每一层 Transformer 装上可重写的外部记忆作者Egor Cherepanov$^{1,2}$, Alexey K. Kovalev$^{1,2}$, Aleksandr I. Panov$^{1,2}$机构俄罗斯人工智能研究院AIRI· 莫斯科物理技术学院MIPT会议ICLR 2026arXivarXiv:2510.07151项目网站elmur-paper.github.io背景与动机论文用了一个非常具体的场景开场机器人煮意面时把盐加了一遍又一遍因为盐溶进汤里看不见它无法确认自己是否已经加过。这正是部分可观测的日常形态——世界不会把所有必要信息同时呈现出来。在强化学习的形式化里这类任务被建模为 POMDP$(\mathcal{S}, \mathcal{A}, \mathcal{O}, T, Z, R, \rho_0, \gamma)$其中状态空间与观测空间分离最优策略必须依赖整段历史 $h_t (o_0, a_0, \dots, o_t)$ 而不是当前观测 $o_t$。一个实用的替代方案是把历史压缩成一个学到的记忆状态即 $\pi(a_t \mid m_t)$其中 $m_t$ 由某种更新规则递推得到。问题在于关键线索往往出现在决策之前很久。该团队在前序工作中把这件事量化成「相关性视界」$\xi t_r - t_e - \Delta t 1$它衡量一次事件结束到需要回忆它的决策点之间隔了多少步。只要 $\xi 1$纯反应式的策略就不够用。而现有路线各有硬伤扩大注意力窗口代价随长度平方增长长时程任务直接不可承受。截断历史直接遗忘线索一旦滑出窗口就再也找不回来。隐式循环LSTM、xLSTM、Mamba 等把历史压进隐藏动态效率高但对「存什么、什么时候忘」几乎没有控制权。可寻址外部记忆NTM、DNC容量可控但寻址与优化复杂在长时程决策上难以稳定训练。序列模型改造RATE、GTrXL、AMAGO-2、DMamba把循环记忆重新接回决策 Transformer但记忆通常拼接在序列层面仍受上下文长度牵制。作为对照本文选择的基线覆盖了完整的谱系决策 TransformerDT、带记忆的循环动作 TransformerRATE、状态空间模型DMamba、行为克隆BC-MLP、BC-LSTM、离线强化学习CQL与生成式策略Diffusion Policy。论文明确说明不比较在线强化学习因为其交互式探索预算不可比也不做真机实验以避免延迟、复位与安全约束带来的混淆。从历史脉络看这条技术线相当清晰2019 年的 Transformer-XL 用段级循环加激活缓存迈出第一步随后压缩缓存与可检索外部键值对让「容量」成为显式问题2023 年的 POPGym 与同期工作把「记忆长度」与「信用分配长度」解耦证明 Transformer 在强化学习里的优势主要来自记忆——需求第一次被量化到 2026 年RATE 把循环记忆接回决策 Transformer而本文把记忆下沉到每一层并用 LRU 显式规定覆盖策略同时给出半衰期与有界性证明。研究主线从问题到结论图 13ELMUR 的研究主线——从部分可观测下「线索远早于决策」的问题出发指出扩大窗口与截断历史这两条现成路线的失效模式进而设计出每层独立、容量有界的记忆槽用双向交叉注意力读写并由 LRU 规则决定覆盖谁最终在合成、棋盘控制与视觉操作三类基准上验证得到有效记忆视界达注意力窗口十万倍量级的结论。Mermaid 流程图基准/方法设计ELMUR 的出发点是不要让注意力去装历史而是给它配一条旁路。整体架构仍是 GPT 式的 Transformer 解码器但每个层里都有两条并行轨道——token 轨道负责把观测变成动作记忆轨道负责跨段持久。两条轨道通过交叉注意力交换信息。图 1ELMUR 的总体设计。每个 Transformer 层在 token 轨道之外并行维护一条记忆轨道token 通过 mem2tok 从记忆读取信息记忆通过 tok2mem 从 token 吸收新内容LRU 块决定用替换还是凸混合来重写某个槽——容量有界但信息可以跨任意多的段延续。设计上有三个必须同时成立的要素层内局部记忆嵌入每一层各自持有一组记忆向量而不是全网络共享一个记忆池。消融实验显示把每层独立记忆改为共享记忆成功率会从 1.00 直接掉到 0.45说明层内局部性是负载要素而非实现细节。双向读写交叉注意力读路径 mem2tok 让 token 以记忆为键和值取信息写路径 tok2mem 在段末让记忆从 token 吸收新内容。LRU 重写规则记忆槽在填满之前整槽替换填满之后只刷新最久未使用的那个槽并与新内容做凸混合。这个设计还带来一个容易被忽略的好处记忆的开销随槽数增长而不是随序列长度增长。在 T-Maze 上 ELMUR 有 2.1M 参数RATE 为 1.7M、DT 为 1.8M但每一步反而更快单步耗时 $6.8 \pm 0.5$ 毫秒优于 RATE 的 7.2 毫秒与 DT 的 10.7 毫秒。分类全景图 14长时程记忆机制的分类。横轴按「记忆存在哪里、由谁控制遗忘」划分隐式循环把历史压进隐藏动态但几乎不控制遗忘可寻址外部记忆容量可控但优化复杂上下文扩展把缓存放在核心计算之外序列层记忆把它拼接进输入ELMUR 则把记忆放进每一层并用 LRU 显式决定覆盖谁。Mermaid 分类图方法细节LRU 记忆管理是整套机制的核心。每一层维护 $M$ 个记忆槽每个槽持有一个向量和一个锚点该槽最后一次被更新的时刻。初始化时槽内是随机向量并被标记为空。图 2LRU 记忆管理。新内容先填满空槽整槽替换全部填满后只刷新最久未使用的槽并与新内容做凸混合。槽下的锚点记录最近一次更新时间——这条规则让容量有界同时保住长时程信息。当所有槽被占满后写入不再是整槽替换而是凸混合。若把第 $j$ 个槽在第 $i$ 段之后的更新写成 $\mathbf{m}j^{(i1)} \lambda\,\mathbf{m}{\text{new}}^{(i1)} (1-\lambda)\,\mathbf{m}_j^{(i)}$其中 $\lambda \in [0,1]$ 是唯一的混合系数那么它同时给出了两个可推导的性质指数遗忘同一槽在连续重写 $k$ 次之后初始内容的系数是 $(1-\lambda)^k$而所有系数之和恰好为 1——这是一条凸组合因此可以正当地称之为「贡献占比」。由此得到半衰期 $k_{0.5} \ln 2 / (-\ln(1-\lambda))$当 $\lambda \to 0$ 时近似为 $\ln 2 / \lambda$。有效视界由于每 $M$ 段才会轮到某个槽被重写一次环境步尺度上的保持视界为 $H(\epsilon) M L \ln(\epsilon) / \ln(1-\lambda)$——它与槽数 $M$ 和段长 $L$ 的乘积成正比。作者特别说明这是一个保守下界实测视界通常显著更长。有界性若每次写入的范数不超过常数 $C$ 且初值满足同样约束凸组合保证任意段、任意槽都满足 $|\mathbf{m}| \le C$激活尺度不会随轨迹变长而漂移。还有一个与循环网络的关键区别没有被选中的槽其内容完全不动。RNN 每一步都在改写状态而 ELMUR 的槽在下一次被选中之前逐字保留原值。时间信号的处理同样值得注意。跨段之后绝对位置失去意义只有 token 时刻 $t$ 与记忆锚点 $p$ 的相对偏移有意义于是模型用一张可学习的嵌入表按偏移给出注意力偏置偏移截断在 $[-D_{\max}1, D_{\max}-1]$ 区间内读写两条路径共用同一张表但可以学出不同的模式读取用正偏移写入用反向偏移。训练时记忆在段之间 detach不做沿时间的反向传播损失在每一段上就地计算。各任务的关键超参如下表——可以看到所需记忆容量随任务变化非常大参数RememberColorTakeItBackT-MazePOPGym-Autoencode$d_{\text{model}}$1283212864层数42212注意力头数161624记忆槽数 $M$2563228记忆初始化标准差0.10.0010.0010LRU 混合系数0.400.200.050.80上下文长度 $L$20601035批大小6464128128学习率2.05e-42.57e-42.06e-41.16e-4训练轮数2003001000800读表提示原表把混合系数命名为 $\alpha$而正文与算法用 $\lambda$ 表示同一个量这是一处符号不一致数值本身可信。实验设计与结果实验覆盖三类基准共同点是奖励稀疏、观测不完整因此必须靠记忆而不是靠反应。T-Maze走廊尽头二选一出发时随机亮出目标训练时上下文只有 $L10$、只用 $S3$ 段评测时走廊最长到 $10^6$ 步数据是 6000 条 oracle 成功轨迹。MIKASA-Robo7-DoF 机械臂桌面操作双路 RGB 观测$3\times128\times128$加 7 个关节与夹爪成功才给奖励。其中 RememberColor 要求在延迟与干扰之后回忆隐藏方块的颜色TakeItBack 要求目标改变后把物体拿回原处每个环境 1000 条 PPO 专家示范。POPGym-4833 个记忆谜题copy、reverse、n-back、长走廊加 15 个部分可观测控制任务每环境 3000 条 PPO-GRU 专家轨迹。图 3三类基准的环境。上两条是 MIKASA-Robo 的操作轨迹RememberColor9 要求延迟后回忆隐藏方块颜色TakeItBack 要求目标改变后把物体拿回原处左下是 T-Maze右下为 POPGym 的棋盘与控制任务。奖励都只在成功时给出。评测协议是每个模型跑 3 次独立运行T-Maze 为 4 次每次 100 个不同环境种子报告运行均值的总均值与标准误所有模型从头训练、使用相同数据预算与预处理单卡 A100 80GB 承担一个任务。最关键的结论来自 T-Maze 的外推实验图 4RQ1 的结果——推理走廊长度与成功率的关系。上下文只有 $L10$、训练时只用了 $S3$ 段但 ELMUR 在一百万步走廊上仍保持 100% 成功率有效记忆跨度达到注意力窗口的约十万倍。这是全文最强的单条证据。泛化方向上的表现同样干净训练长度只覆盖 9 到 900 步而验证铺开到 9 到 9600 步所有训练与验证组合都保持满分——向更短的任务迁移不过拟合向更长的任务迁移不衰减。图 5RQ2 的泛化热力图。训练只用 9–900 步验证铺到 9–9600 步所有训练与验证组合都保持 100%两个方向同时成立。在 POPGym 上逐任务对比更能说明改进的分布图 6RQ4 的逐任务对比。对称对数刻度下比较 ELMUR 与 DT 在 48 个 POPGym 任务上的表现误差条为 3 次运行均值的 95% 置信区间增益集中在记忆密集型谜题上控制类任务没有付出代价。汇总到表格里三类基准的关键数字如下基准关键指标最强基线ELMUR结论T-Maze$10^6$ 步成功率随长度衰减100%超窗口十万倍MIKASA-Robo32 任务聚合成功率RATE 5.429.24相对提升约 70%POPGym-48总分RATE 9.5410.4124/48 个任务第一POPGym 记忆谜题33聚合回报RATE 0.451.2记忆类增益最大TakeItBack-v0成功率RATE 0.42 ± 0.240.78 ± 0.03延迟反转近乎翻倍消融实验给出了清晰的组件排序设置得分基线 ELMUR1.00 ± 0.00共享记忆各层共用一个记忆池0.45 ± 0.03去掉相对偏置0.95 ± 0.05去掉 LRU0.43 ± 0.22去掉相对偏置与 LRU0.22 ± 0.11MoE 前馈换回 MLP1.00 ± 0.00超参消融进一步显示记忆容量是硬阈值当槽数 $M$ 大于任务所需的段数 $N$ 时几乎所有设置都能达到满分一旦 $MN$准确率断崖式下跌而且对混合系数、初始化标准差与分段方式都高度敏感——容量不足会把其他所有设计选择都变成陷阱。图 10记忆超参在 RememberColor3-v0 上的消融。曲线分「容量不足$M N$」两组容量充足时几乎处处满分容量不足时对混合系数、初始化与分段高度敏感。为了回答「信息到底是写在记忆里还是仅仅因为参数更多」论文做了一组记忆探测实验。做法是先把策略训练到专家水平再跑 1000 个成功回合逐时刻抽出每一层的记忆向量与真值颜色标签对每个「层 × 时刻」组合单独训练一个三层 MLP 探针隐藏维度 512交叉熵Adam 200 轮80/20 划分。探针是事后训练的不参与策略更新。探针时刻 $t$第 0 层第 1–2 层第 3 层$t0$记忆仍随机约 33%约 33%约 33%$t1$首次写入后已可解码逐渐下降最弱$t5$线索已消失100%高高$t10$ / $t20$基本满分基本满分略低图 7记忆探测的混淆矩阵行为 $t \in {0,1,5,10,20}$列为第 0–3 层。$t0$ 时各层都接近三分类随机水平$t1$ 第 0 层已能可靠解码$t5$ 线索已从画面消失却达 100%到 $t10$ 与 $t20$前几层接近满分只有最深层略低。写入的时机同样高度结构化。各层呈现同一套轮转表早期只有槽 0 被写随后职责转到槽 1再到槽 2一个槽一旦失去职责就再也不被修改因此整段回合只有零星几次写入而不是持续翻搅。图 8各层的记忆写入时刻表横轴为 $t \in [0,60]$纵轴为槽 0–2绿色表示该步发生写入。槽一旦失活就不再被修改——线索写入专用槽后其内容在整个回合内被完整保留。从嵌入层面的演化看结论一致图 9记忆随层、槽与时间演化的快照。早期是接近随机的小幅值线索出现后每层只有一个槽变成强结构化并长期保持不变。读写两条路径的注意力模式则显示出明显的不对称图 11读写两条路径的交叉注意力图左为写入右为读取。写入几乎只在线索出现时出现短促高强度的脉冲并集中在单个槽读取则在空白期与决策期持续而结构化地回到同一个槽其余注意力头近乎静默。几何结构上记忆从初始化的弥散云迅速收敛到少数低维流形并在此后停留在那里不同槽共享同一个内容空间并不与特定颜色绑定。图 12记忆嵌入的 PCA 结构。左图按槽着色说明槽并不与特定颜色绑定而是共享一个内容空间右图按时刻着色显示记忆从初始化附近的弥散云迅速收敛到少数低维流形。最后论文还检验了两件容易被忽略的事。第一记忆机制在完全可观测任务上是否会造成损失CartPole-v1 上所有模型都拿到满分 500在 D4RL MuJoCo 的 D4RL 数据上 ELMUR 与强基线同级用 $(R,o,a)$ 条件化得平均 76.4只用观测得 74.7差距仅约 2%说明它不依赖回报或动作标签这类额外条件也能工作。第二它并非在所有任务上都赢——在 ViZDoom-Two-Colors 的 3D 视觉导航上ELMUR 的回报是 55.28 ± 0.94落在 RATE 的 59.21 ± 1.19 之后。结果对比总结图 15结果对比总结。最强基线 RATE 在 MIKASA-Robo 上的聚合成功率是 5.42、POPGym-48 总分 9.54ELMUR 分别达到 9.24 与 10.41相对提升约 70%并在 24 个任务上排名第一同时在上下文只有 10 步的条件下于一百万步 T-Maze 上保持 100% 成功率。Mermaid 结果对比图关键发现有效记忆跨度达注意力窗口的约十万倍训练时上下文只有 10 步、只用 3 段推理时走廊最长 $10^6$ 步成功率始终 100%而理论给出的保持下界只是保守估计实测视界通常更长。容量是硬阈值不是可调参数槽数 $M$ 大于任务所需段数 $N$ 时接近满分$MN$ 时准确率断崖式下跌且 $M \approx N$ 附近最敏感无法靠调混合系数弥补。LRU 与层内局部性是负载组件去掉 LRU 得分从 1.00 掉到 0.43共享记忆掉到 0.45两者与相对偏置一起去掉只剩 0.22而单独去掉相对偏置只掉到 0.95说明它是放大器而非地基。信息确实写在记忆里初始时刻探针约 33%三分类随机水平首次写入后第 0 层即可解码线索消失后第 0 层达到 100%写入热力图、嵌入演化与 PCA 从三个独立角度给出同一结论。机制是稀疏且可解释的整个回合只有零星几次写入每层每回合通常只做一次「一次性写入 长期只读」槽一旦失活就不再被修改。跨域一致且代价可控谜题类回报 1.2DT 为负分反应类保持 9.2 与最强持平T-Maze 上参数 2.1M、单步 6.8 ± 0.5 毫秒比 RATE7.2 毫秒与 DT10.7 毫秒更快。从创新模式的角度看这篇论文同时命中三条被验证过的高价值模式刻画极限然后超越先给出指数遗忘与有效视界的形式化下界再在实验上跨过它、设计混淆隔离诊断工具用逐层逐时刻的探针把「记忆真的存了任务变量」与「参数更多所以更强」这两个解释拆开、以及异构分解差异化处理每层各自持有记忆显著优于全网络共享。三者都用可量化的消融或探测结果支撑这也是它执行质量最扎实的地方。局限性记忆规则本身不学习LRU 与混合系数都是固定的自适应重写策略被作者明确留作未来工作论文只给出这套规则的透明性与可分析性。额外成本不是零段级循环让每层多一次交叉注意力成本虽然随槽数而非序列长度增长但依然是实打实的开销。评测范围限定在仿真与模仿学习只在仿真环境、只做模仿与离线设定不比较在线强化学习、不做真机部署延迟、复位与安全性都未经验证。并非所有任务都赢32 个 MIKASA 任务里有 9 个成功率仍为 0全部集中在 BunchOfColors、SeqOfColors 与 ChainOfColors 这三族颜色序列任务上——记忆容量解决不了需要组合推理的问题ViZDoom 上也落在 RATE 之后论文用「matches the previous best baseline」来描述措辞比表格数字更乐观。超参仍有敏感性中等混合系数约 0.4–0.6反而不稳定初始化标准差太小会崩分段越细越需要同步扩大记忆容量。阅读时值得留意的几处细节论文称贡献为「twofold」却列了三条混合系数在正文与超参表里符号不同超参段落有一句重复的残句POPGym 的任务口径在正文24/48与附录表注12 个任务之间不一致最后版本仍保留着投稿期的匿名机构占位符。常见问题FAQELMUR 和 Transformer-XL 有什么本质区别Transformer-XL 用段级循环缓存上一段的激活缓存内容由网络自己产生、无法选择保留什么。ELMUR 把缓存换成每层独立的显式记忆槽并在填满之后用 LRU 规则决定覆盖哪一个槽、以多大比例覆盖。区别在于前者是「被动缓存」后者是「带策略的存储」因此可以给出半衰期与有界性的形式化刻画。为什么不直接把上下文窗口做得更长因为代价。自注意力的开销随上下文长度平方增长而长时程任务需要的是「记住几千步前的一个线索」不是「同时关注几千个 token」。ELMUR 的额外开销随记忆槽数而非序列长度增长于是把「更长的历史」和「更贵的注意力」这两件事解开了。记忆槽数要设多大论文的经验是至少不小于任务所需的段数。槽数 $M$ 大于所需段数 $N$ 时几乎所有超参设置都能达到满分而 $MN$ 时准确率断崖式下跌且对混合系数、初始化与分段方式都高度敏感。实践中可以从「预期需要保留的事件数」反推 $M$。ELMUR 会损害反应式任务的性能吗不会。在完全可观测的 CartPole-v1 上ELMUR 与所有基线一样拿到满分 500在 D4RL MuJoCo 上与强基线同级在 POPGym 的反应类任务上保持 9.2 分与最强基线持平。这说明加记忆并没有用反应速度去换。混合系数应该怎么选它控制稳定性与塑性的平衡$\lambda$ 越小保留越久半衰期近似为 $\ln 2 / \lambda$越大覆盖越快。论文中不同任务的最优值从 0.05T-Maze到 0.80POPGym-Autoencode不等而且要避开 0.4–0.6 这段反而不稳定的中间区间。这套机制能迁移到视觉语言动作模型上吗从设计上看很有机会它不改变注意力本身只是在每一层加一条并行的读写旁路对骨干网络几乎没有侵入性。事实上论文的多数实验已经在带视觉输入的机器人操作任务上完成而相关团队也一直在做 VLA 的记忆扩展这是值得关注的方向。参考链接论文 arXiv 摘要页arXiv:2510.07151项目主页含代码与更多结果elmur-paper.github.io段级循环与激活缓存的起点Transformer-XL (arXiv:1901.02860)可检索外部记忆的代表作Memorizing Transformers (arXiv:2203.08913)评测基准POPGym (arXiv:2303.01859) 与 MIKASA-RoboICLR 2026把记忆与信用分配解耦的关键分析Ni et al., NeurIPS 2023 (arXiv:2307.03864)主要决策基线Decision Transformer (arXiv:2106.01345)、Diffusion Policy (arXiv:2303.04137)给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
上一篇/下一篇内容由系统自动关联
返回资讯列表 →