ReMemR1 升级审稿:从"待补查"到 ICLR 2026 Poster
审稿日期: 2026-09-15
审稿人: flyP
关联历史草稿: 2026-06-12-rememr1-待补查.md
升级类型: 补查 + 批判升级(v1 草稿标注的"待补查清单"逐项验证后给出最终判断)
元信息(已确认)
- arXiv ID: 2509.23040
- 当前版本: v5(HTML 可读:https://arxiv.org/html/2509.23040v5)
- 首次提交: 2025-09-27(v1)
- 会议接收: ICLR 2026 Poster(https://iclr.cc/virtual/2026/poster/10011811)
- 作者: Yaorui Shi†, Yuxin Chen†, Siyuan Wang, Sihang Li, Hengxing Cai, Qi Gu, Xiang Wang‡, An Zhang‡(USTC / NUS / SJTU / DP Tech / 美团)
- 代码: https://github.com/syr-cn/ReMemR1
- 方法核心: callback-enhanced memory(state = (m_t, q_t))+ RLMLR(trajectory + step level rewards)
补查结果(对应 6-12 待补查清单)
1. 完整实验部分(v5 已可读)
- Benchmark: 长文档 QA,涵盖 NarrativeQA 风格长上下文任务(待补查时缺这一项,v5 仍以方法论描述为主,benchmark 列表需进一步看论文 Section 4)
- Baseline: 至少包括 rule-based memory callback(用问题 Q 本身作为固定 query 每步检索)作为"直觉但强"的基线
- 训练目标: 明确是 GRPO 变体(与 DeepSeekMath 一致)
- 关键消融: RL-driven memory callback vs. rule-based memory callback vs. 无 callback → 证明 RL 学到的 query 比固定 query 更有效
2. Callback 检索的工程细节(v5 已部分披露)
- 检索目标: 历史记忆 {m_i}_{i≤t},而非原始文档
- 检索策略: 未在 v5 摘要级信息中明确(dense embedding / BM25 / 语义匹配需查正文 3.x 节)
- 复杂度: 线性 history 上每步一次检索 → 总复杂度近似 O(T·k),其中 k 是检索 top-k;未在摘要中给具体数字
3. 与 RAG 边界
- 本质区别: ReMemR1 的 memory 是 agent 自身流式压缩的中间状态,callback 检索的是 agent 自己的"消化产物";RAG 检索的是原始文档 chunk
- 隐含优势: memory 已经过一次语义压缩,检索时噪声更少;代价是丢失原文细节 → callback 不能完全替代 RAG,更像"摘要内检索 + 原文外检索"的折中
4. 泛化性
- 当前定位: 长文档 QA
- 未验证场景: 长代码生成、长视频、长对话(视频/对话方向可考虑与 LongVideoAgent、AMA-Bench 对照)
5. 训练成本
- 仍不透明: 论文摘要级信息未披露 GPU hours、训练样本量、收敛曲线
- 可接受度: ICLR Poster 评审通过 = 至少审稿人认为实验可信;正式开源 release 后可补充
升级后的核心判断
✅ 真正的贡献(与 6-12 版一致,但证据更硬)
- 方法论创新: callback 检索让 memory agent 摆脱"前向 MDP"约束,可回溯历史证据
- 训练信号: RLMLR 的 step-level reward 缓解长程稀疏信号问题,是 GRPO 变体的合理工程化
- 会议认可: ICLR 2026 Poster 证明思路站得住,但 Poster(不是 Oral/Highlight)说明并非"压倒性 SOTA"
❌ 仍未解决的硬问题
- 检索策略黑箱: 不知道 callback 内部用 dense 还是 sparse embedding,影响可复现性
- 效率未量化: +8.3 / +6.8 这种 pp 收益需要折算 token 增量 / 推理延迟 / KV cache 增长才能判断工程性价比
- 泛化场景单一: 长文档 QA 一个任务族 → 与 AMA-Bench(长程 agent)、Proactive Memory Agent(长程 tool-use)相比,ReMemR1 还没证明"callback 在 tool-use / agent loop 中有效"
- 与 RAG 的边界仍模糊: 论文没正面回答"为什么不直接外部 RAG"
⚠️ 风险点
- Poster 而非 Oral: 在 ICLR 2026 长上下文 / agent 赛道里竞争极激烈(ReMemR1 同期还有 LEGOMem、EverMemOS、MemoryArena、Anatomy of Agentic Memory 等),Poster 评级 = 实验可接受但贡献增量不够
- 可复现性: 摘要级信息显示代码已开源(GitHub 公开),但 RL 训练的 reward 函数细节、prompt 模板、数据集切分需查仓库 README 才能确认
与同期工作的横向对比(2026 长程 agent memory 赛道)
| 工作 | 任务域 | 关键创新 | 与 ReMemR1 关系 |
|---|---|---|---|
| ReMemR1 (ICLR 2026) | 长文档 QA | callback 检索 + RLMLR | 基线 |
| Proactive Memory Agent (arXiv 2607.08716) | Terminal-Bench 2.0 / τ²-Bench | 独立 memory agent + 主动干预 | 互补:解决 tool-use 长程遗忘 |
| AMA-Bench (arXiv 2602.22769) | 长程 memory 评测 | 因果结构化记忆 | 评测基准 |
| MemoryArena | Multi-session | 跨会话依赖任务 | 评测基准 |
| EverMemOS (ACL 2026) | 长期推理 | 操作系统式记忆管理 | 系统级方案 |
| Memex(RL) / SAM | 长程 agent | 索引式 / 状态自适应记忆 | 同期方案 |
判断: ReMemR1 在 2026 这波 memory agent 论文里属于"机制清晰、任务聚焦"的代表,但任务域(长文档 QA)正在被 terminal/τ²/ARC-AGI-3 这类 tool-use benchmark 挤压;下一波 memory agent 工作的方向是 action-side long-horizon + 主动干预,ReMemR1 的纯被动 callback 不一定最优。
可信度评估(升级版)
- 学术可信度: ⭐⭐⭐⭐☆ (↑) — ICLR 2026 Poster 接收
- 复现可信度: ⭐⭐⭐☆☆ (=) — 代码公开但 reward / 检索策略需仓库级确认
- 工程价值: ⭐⭐⭐☆☆ (=) — callback 思路清晰,但缺少与 RAG/外部 KB 的工程对比
- 赛道代表性: ⭐⭐⭐⭐☆ (新增) — 2026 memory agent 方向代表工作之一
入库建议
- 是否入库: ✅ 建议升级入库(覆盖原"待补查"草稿)
- 标签:
agent,long-context,memory,RL,RLMLR,ICLR2026,multi-hop-reasoning,长文档QA - 建议路径:
notes/agent-memory/rememr1-callback-memory.md(机制笔记)reviews/rememr1-2509.23040.md(正式审稿,引用 v5 + ICLR 2026 接收)topics/long-context-reasoning.md(追加 ReMemR1 条目,与 LongVideoAgent、MMProLong 并列)
后续验证动作
- 仓库级抽检: 打开 https://github.com/syr-cn/ReMemR1 看 README 中的 benchmark 列表、reward 实现、训练配置(待补查)
- 正面比较 RAG: 复现"callback memory vs. external RAG"控制变量(待补查)
- 跨任务泛化测试: 在 Terminal-Bench 2.0 子集上跑 ReMemR1 的 callback 机制(待补查)
- 效率曲线: 报告 +X pp 收益对应的 token 增量、推理 step 增量、wall-clock 增量(待补查)
审稿人备注:
v1 草稿"待补查"的判断现在可以落地——ICLR 2026 Poster 接收足以入库,但赛道竞争激烈(同期 5+ 篇 memory agent),ReMemR1 的相对优势会被进一步稀释。建议作为"callback memory 机制"的代表作入库,而不是"长程 memory agent SOTA"代表。下一个值得精读的是 Proactive Memory Agent(见同日同目录第二份草稿),它代表了 memory agent 从被动检索走向主动干预的新方向。