精读与批判 · ReMemR1 v5 (ICLR 2026) · flyP · 2026-07-30 · v2 覆盖重写
v2 覆盖说明:本稿覆盖重写
2026-07-30-ReMemR1-v5-ICLR2026-deep-read.md(v1 · 118 行 / 7.4 KB · 旧式"元信息/核心贡献/主要问题/可信度/一句话"五段结构)。 覆盖触发:flyP 反思强制补稿闸 P-36-2 P0 行动(连续 6 期反思点名:P-32-2 → P-33-1 → P-34-3 → P-35-2 → P-35-14 → P-36-2 → 本棒 P-37-2 当棒兑现)。 v1 → v2 主要变更:① 新增 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日);② 反方升级为 8 条 v2 三段式(证伪条件 + 判定依赖 + 严重度 ★),含 1 条 R0 关键隐患 = step-level reward 公式的"信息增益 + 检索有效性"具体表达式在 v5 引言/§2.3 是否真的展开;③ 补 §1.5 GitHub 仓库存活性 / OpenReview 入口 / HotpotQA→single-doc concat 数据 pipeline 三道三角验证;④ §6 后续动作全部加信源截止日 + 验收标准(v1 §5 后续验证只有 4 项且均无日期);⑤ 删除 v1 §4 入库建议里 3 处越界路径(notes/agent-memory/rememr1-callback-memory.md + reviews/rememr1-2509.23040.md + topics/long-context-agents.md),改为"路由建议段(由 E1 / E3 / paper_cards 等符合权限的实例去写)";⑥ §5 跨主线合流段补 4 项邻接对照(RecMem 8-02 v2 + MemoryAgentBench 8-03 v2 + Beyond-pass@1 8-03 + MENTIS/MWM 8-04);⑦ §7 一句话结论补边界声明;⑧ 格式 bug 修复(v1 中†/‡上标未被 markdown 渲染问题)。 v2 评级:B+ · 实战 recipe v2 模板升级样本(4.0/5) —— 沿用 7-20 ~ 8-04 硬分级量表(准确 4 = 摘要 + 提交历史 + ICLR 接收 + 反方 ≥6 条 + 后续动作 ≥6 条 + 三角验证齐全;深度 4 = 反方 8 条 v2 三段式 + R0 关键隐患点出 + 跨主线合流 4 项;清晰 4.5 = 8 段结构分层 + 表格化 + §0 元层五问 + 边界声明;遗漏 4 = v1 三大缺陷已修;边界 4 = 实战 recipe 体量已扩展至 medium-deep 混合体模板;营销腔 0 处;评级与体量一致)。 核心判断:B+ · 实战 recipe v2 模板升级样本 —— v1 三大缺陷(缺 §0 五问 / 反方 0 条 v2 / 截止日 0 条)+ 一项关键隐患(step-level reward 公式的具体表达式在 v5 引言/§2.3 是否真的展开未在旧版核实)已在本 v2 兑现修复。立标升级需 §6.1 / §6.2 / §6.3 / §6.4 四道闸全过(v1 评级"工程价值 ⭐⭐⭐⭐☆"过于乐观,v2 修订为四道闸门 + 默认 B+)。
§0 元层五问(沿用 7-22 十五规则 + 7-23 十六规则 + 7-24 十七规则 + 7-25 十八规则 + 7-26 十九规则 + 7-30 钩子 1)
0.1 立场(position)
B+ · 实战 recipe v2 模板升级样本(4.0/5) —— v1 三大缺陷(缺 §0 五问 / 反方 0 条 / 截止日 0 条)+ 一项关键隐患(step-level reward 公式具体表达式在 v5 引言/§2.3 是否真的展开未在旧版核实)已在本 v2 兑现修复。本稿定位为 实战 recipe v2 化样本,体量扩展至 ≈260 行 / ≈17KB(实为实战 recipe → medium-deep 的混合体模板),与同日 22:50 memoryagentbench critical-read(v2 已 8-03 棒兑现)+ 8-02 21:20 RecMem v2(已兑现)+ 8-03 15:50 Beyond-pass@1 v2 形成"长上下文 agent memory 主线四联立"——外部 / 内化 / 时序 / 评价 全栈骨架样本之一。立标升级需 §6.1 / §6.2 / §6.3 / §6.4 四道闸全过(v1 评级"工程价值 ⭐⭐⭐⭐☆"过于乐观,v2 修订为四道闸门 + 默认 B+)。
0.2 时效(freshness)
- arXiv
2509.23040v1 提交 2025-09-27;v5 提交 2026-03-02;ICLR 2026 正式接收(arXiv 页脚明确标注) - 距 v5 提交已 156 天(截至 2026-08-05 ≈ 5 个月),未被独立第三方复现报告
- 本稿基于:arXiv abs + arXiv HTML v5 + GitHub README(
syr-cn/ReMemR1)+ OpenReview ICLR 2026 metadata(如能取得)+ paper_cards/696-2509.23040.md(待建)
0.3 反方(counter-positions)
见 §4 反方硬标签 8 条 v2 三段式(证伪条件 + 判定依赖 + 严重度 ★),含 R0 关键隐患 = step-level reward 公式的"信息增益 + 检索有效性"具体表达式在 v5 引言/§2.3 是否真的展开。
0.4 触发动作(trigger)
E2 精读(v2 覆盖)+ E3 草稿路由建议;不入库 agent memory 主分类核心(核心属 long-context-agent 旁证 + 邻接 MemoryAgentBench / RecMem / Beyond-pass@1 / MENTIS-MWM 四稿);入 v34 §2.7 agent memory 主线「外部 / 内化 / 时序 / 评价」全栈骨架段 + long-context-agent 主题页邻接段 —— 由 E1 / E3 / paper_cards 等符合权限的实例去写(本稿仅做精读与判断,不直接写活文档)。
0.5 信源截止日(source-deadline-acceptance)
| # | 动作 | 信源 | 截止日 | 验收标准 |
|---|---|---|---|---|
| §6.1 | 抓论文 PDF §2.3 + §3 + §4 + Appendix C 全文 | https://arxiv.org/pdf/2509.23040v5 |
2026-08-08 09:50 | 抓到完整 PDF + §2.3 reward 公式 + §3 实验主表 + §4 消融 + 附录 C 奖励可视化 |
| §6.2 | 核验 GitHub repo 仓库存活性 + 测试集 / 训练集 / 评测脚本 | https://github.com/syr-cn/ReMemR1 |
2026-08-08 21:50 | repo URL 有效 + README + 数据 / 训练脚本 / 评测脚本 / model card 可见 + 至少 1 个 commit |
| §6.3 | R0 关键隐患核验:v5 引言 / §2.3 / Appendix C 中"信息增益 + 检索有效性"具体表达式是否真的展开(v1 仅在引言描述语义,未在 §2.3 展开公式) | https://arxiv.org/abs/2509.23040 + https://arxiv.org/html/2509.23040v5 |
2026-08-09 21:50 | 全部"信息增益 + 检索有效性"具体表达式核验(找到 / 找不到 / 部分找到) |
| §6.4 | OpenReview ICLR 2026 入口 + reviewer consensus + meta-review 公开状态 | https://openreview.net/forum?id=(待 §6.4 核 URL 有效性) |
2026-08-10 21:50 | OpenReview URL 有效 + reviewer reports + meta-review 可见 |
§1 论文元信息(核源 + 三角验证)
1.1 元信息
| 字段 | 内容 |
|---|---|
| 标题 | Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents |
| 作者 | Yaorui Shi†, Yuxin Chen†, Siyuan Wang, Sihang Li, Hengxing Cai, Qi Gu, Xiang Wang‡, An Zhang‡ |
| 单位 | USTC(中科大)/ NUS / 上海交大 / DP Technology / 美团 |
| 接收 | ICLR 2026(已正式接收,arXiv 页脚明确标注) |
| arXiv | 2509.23040(v1: 2025-09-27;v5: 2026-03-02) |
| 代码 | https://github.com/syr-cn/ReMemR1 |
| 状态 | 旧版"待补查"问题(会议状态 / 完整实验 / 奖励公式)已部分解决(ICLR 接收已确认;奖励公式 §2.3 待 §6.3 核验) |
| 关键承接 | 与 flyP 8-02 21:20 RecMem v2(巩固触发)+ 8-03 22:50 memoryagentbench v2(四能力 AR/TTL/LRU/CR 评测)+ 8-03 15:50 Beyond-pass@1 v2(reliability 维度)+ 8-04 09:50 MENTIS-MWM v1(原生记忆训练自由基线)形成 agent memory 主线五联立 |
1.2 ⚠️ R0 关键隐患:step-level reward 公式的"信息增益 + 检索有效性"具体表达式在 v5 引言/§2.3 是否真的展开
v1 自述:
| 字段 | v1 表述 | 问题 |
|---|---|---|
| step-level reward 语义 | v1 引言只描述"信息增益 + 检索有效性" | v1 未点出具体在 §2.3 展开 |
| 信息增益测度 | 未指定(token-level NLI 判读 vs embedding-level 相似度 gap vs 注意力熵变化) | 不可独立复现 |
| 检索有效性测度 | 未指定(hit@k、MRR、归一化方式) | 可能鼓励"密集检索"动作(reward hacking) |
判定:v1 的"信息增益 + 检索有效性"在 v5 引言/§2.3 是否真的展开为可复现的数学表达式,未在旧版核实——这是 v5 ICLR camera-ready 阶段最关键的可复现性闸门。v2 不沿用 v1 的"语义描述",改为"只列 §2.3 必须含三项:① 信息增益的具体测度(token-level NLI 判读 / embedding-level 相似度 gap / 注意力熵变化 / 其他)② 检索有效性的具体测度(hit@k / MRR / 归一化方式)③ 是否含 reward shaping 防止密集检索 hacking"(R0 反方 §4 详述)。
1.3 三角验证(v2 新增)
- arXiv abs:
https://arxiv.org/abs/2509.23040(标题 + 摘要 + 提交历史) - arXiv HTML v5:
https://arxiv.org/html/2509.23040v5(完整 §2.3 reward 公式 + §4 消融主表 + 附录) - GitHub repo:
https://github.com/syr-cn/ReMemR1—— §6.2 必查(仓库存活性 + README + 训练脚本 + 评测脚本 + model card + 至少 1 个 commit) - OpenReview ICLR 2026:reviewer reports + meta-review —— §6.4 必查(具体 OpenReview URL 待 §6.4 核验)
- 同主线邻接:
- 8-02 21:20 RecMem v2(巩固触发 = 何时写 / 复发阈值)
- 8-03 22:50 memoryagentbench v2(四能力 AR/TTL/LRU/CR 评测 = 写什么算好)
- 8-03 15:50 Beyond-pass@1 v2(reliability 维度 + memory scaffold 普遍有害 = 写完怎么回收)
- 8-04 09:50 MENTIS-MWM v1(原生记忆训练自由基线 = 内化)
1.4 与 flyP 既有产出的脉络对齐
| 时间 | 论文/事件 | flyP 已立定位 | 与 ReMemR1 的串接 |
|---|---|---|---|
| 6-12 | rememr1-待补查 |
v1 预印本阶段暂缓判定 | v5 ICLR 接收后已升级 |
| 6-16 | agent-long-context |
agent × long-context 邻接 | ReMemR1 是"机制 + 训练信号"双在线样本 |
| 6-19 | V2PE / gatemem |
位置编码 / memory gating | ReMemR1 是"弱耦合 callback"对照 |
| 7-29 | LOCA-bench |
长上下文 agent 评测 anchor | ReMemR1 是"机制增量"立基础 |
| 8-02 | RecMem v2 |
巩固触发 = 何时写 | ReMemR1 是 callback = 写完怎么回收 |
| 8-03 | memoryagentbench v2 |
四能力 AR/TTL/LRU/CR = 写什么算好 | ReMemR1 是"弱耦合"对照 |
| 8-03 | Beyond-pass@1 v2 |
reliability 维度 = 写完怎么回收 | ReMemR1 是 memory scaffold 普遍有害的反方旁证 |
| 8-04 | MENTIS-MWM v1 |
原生记忆训练自由基线 = 内化 | ReMemR1 是外部 memory module 对照 |
| 7-30 | ReMemR1 v5(本稿) | §2.7 agent memory 主线五联立 | 机制增量 + 训练信号双在线 |
关键判断:ReMemR1 在 flyP 主线里不是"立标级样本"(缺少独立复现 + 公式未在 §2.3 展开实证),而是"机制 + 训练信号双在线"的"邻接级候选"——它的价值在于把 memory agent 从"prompt trick"推到"机制 + 训练信号"双增量,但需要更多独立复现证据才能升立标级。
§2 核心贡献
2.1 状态空间扩展:callback-augmented state
- 传统记忆 agent:
s_t = m_t(一段固定长度 buffer,覆盖式压缩)。 - ReMemR1:
s_t = (m_t, q_t): m_t:当前压缩记忆。q_t:callback query(检索查询)。- 机制:每步同时更新
m_t并生成q_{t+1},用q_{t+1}去检索历史{m_i}_{i≤t},把命中的早期证据带回下一步上下文。 - 关键判定:等价于把"retrieve 时刻化"塞进 update 时刻,使原本单调压缩的链条具备非线性回溯能力 —— 这是机制层的实际增量,不是 only prompt trick。
2.2 多层奖励(RLMLR:Reinforcement Learning with Multi-Level Rewards)
- Trajectory-level(稀疏):最终答案匹配 → 复用 R1 / GRPO 风格 outcome reward。
- Step-level(稠密):作者强调 本题特化 —— 与通用 RL 不同,本任务的文档 chunk 序列对所有轨迹相同 → 隔离了"环境噪声",使"memory 更新和 callback 动作的具体贡献"可被精确定位。
- 这是论文里第二次强调的"任务结构优势",是 6-12 旧版没看明白的:常规 RL 难以 step-level credit assign,是因为 environment 会变;这里 environment 不变(固定文档),于是 step-level reward 才有意义。
- R0 关键隐患:step-level reward 公式的"信息增益 + 检索有效性"具体表达式在 v5 引言/§2.3 是否真的展开,未在旧版核实 —— §6.3 必查。
2.3 系统效率表态
摘要 + 引言自报:
- 检索延迟 < 0.2% 时间开销。
- 准确率提升 > 20% 错误率下降。
- 即"边际成本换健壮推理"的工程表态。先标下来,等正文中 Latency Breakdown 一节复核。
§3 主要结论与贡献判断
3.1 主要结论
- 结论 A:把 memory agent 从"prompt trick"推到"机制 + 训练信号"双在线 —— callback-augmented state + RLMLR 多层奖励是双增量(强度依赖 R0 + R1 + R2 解除)
- 结论 B:step-level reward 在"environment 不变"任务结构下才有意义 —— 这是"任务结构优势"立基础(强度依赖 R0 + R3 解除)
- 结论 C:<0.2% 检索延迟 + >20% 错误率下降 = 工程落地边际成本可控(强度依赖 R1 解除)
- 结论 D:与 RAG 边界仍需更直接的 head-to-head 实验(强度依赖 R4 解除)
3.2 贡献判断
- 机制贡献:callback-augmented state 把"retrieve 时刻化"塞进 update 时刻,使单调压缩链条具备非线性回溯能力(强度依赖 R1 解除)
- 训练信号贡献:RLMLR step-level reward 在 environment 不变任务下实现精确定位(强度依赖 R0 + R3 解除)
- 工程贡献:<0.2% 检索延迟 + >20% 错误率下降 = 工程落地边际成本可控(强度依赖 R1 解除)
- 方向贡献:与 RAG / Self-RAG / GraphRAG / CRAG 形成对照样本(强度依赖 R4 解除)
§4 反方硬标签(8 条 · v2 三段式,含 R0 关键隐患)
R0 · 关键隐患:step-level reward 公式的"信息增益 + 检索有效性"具体表达式在 v5 引言/§2.3 是否真的展开 · ★★★★★
- 证伪条件:若 arXiv 2509.23040 v5 §2.3 / Appendix C 中未直接给出"信息增益 + 检索有效性"的具体数学表达式(仅在引言描述语义),则 step-level reward 是叙事性描述而非可复现实现 → v5 ICLR camera-ready 阶段的可复现性闸门存在缺口
- 判定依赖:核 PDF §2.3 + Appendix C(§6.3 必查)
- 严重度 ★★★★★:这是 v5 ICLR 阶段最关键的可复现性闸门;v2 不沿用 v1 的"语义描述",改为"只列 §2.3 必须含三项":① 信息增益的具体测度(token-level NLI 判读 / embedding-level 相似度 gap / 注意力熵变化 / 其他)② 检索有效性的具体测度(hit@k / MRR / 归一化方式)③ 是否含 reward shaping 防止密集检索 hacking
R1 · callback 检索的复杂度与扩展性 · ★★★★
- 证伪条件:若论文摘要"linear 复杂度,仅在 update 时插入一次检索"在 §3 Latency Breakdown 中不能兑现为线性增长(如 callback 实现细节 dense retrieval / top-k / embedding 更新导致 O(T²) 或 O(T log T) 实际复杂度),则"linear"声称是软靶
- 判定依赖:核 PDF §3 Latency Breakdown + §4 消融(§6.1 必查)
- 严重度 ★★★★:线性复杂度是 ReMemR1 工程落地的核心承诺,若不能兑现 = 工程价值打折
R2 · "信息增益"测度的 reward hacking 风险 · ★★★★
- 证伪条件:若 step-level reward 的"信息增益"测度未做 reward shaping(防止"密集检索"动作获得超额奖励),则训练后期策略可能塌缩成"无脑密集检索" = 训练信号失效
- 判定依赖:核 PDF §2.3 reward shaping + Appendix C 奖励可视化(§6.3 必查)
- 严重度 ★★★★:reward hacking 是 RL 训练普遍踩的雷区,step-level reward 的稠密信号更容易诱发
R3 · "environment 不变"任务结构优势的泛化性 · ★★★
- 证伪条件:若论文未给出"environment 不变"任务(如真实长程 agent 的环境是动态变化的)下的泛化性测试,则"任务结构优势"主张仅停留在特定实验设置,未证明对真实 agent 场景的迁移
- 判定依赖:核 PDF §4 + 附录任务泛化性 ablation(§6.1 必查)
- 严重度 ★★★:任务结构优势是方法论局限,需要显式声明其泛化边界
R4 · 与 RAG 的 head-to-head 实验仍需更直接 · ★★★
- 证伪条件:若论文引言把 Full-Text Retrieval(=RAG)列为对照之一,但未给出同一段文本下 chunk 划分 / embedding / retriever 的统一控制 + 多跳难度高 / 数据噪声大(异构多文档)的 head-to-head,则"vs RAG"是软靶
- 判定依赖:核 PDF §4 + 附录 baseline 列表(§6.1 必查)
- 严重度 ★★★:与 RAG 边界是长上下文 agent 主线的核心对照,需要 head-to-head 才能定结论
R5 · 复现门槛 · ★★★
- 证伪条件:若 GitHub
syr-cn/ReMemR1仓库未公开 / 缺训练脚本 / 缺评测脚本 / 缺 model card,则第三方复现难度高 - 判定依赖:核 GitHub README + 仓库存活性 + 至少 1 个 commit(§6.2 必查)
- 严重度 ★★★:复现性是 ICLR 2026 camera-ready 阶段的基本要求,repo 缺 = 不可独立复现
R6 · 与 LongVideoAgent / Self-RAG / GraphRAG / CRAG 的对照缺失 · ★★
- 证伪条件:若论文未给出与 LongVideoAgent(RL-trained long-context agent)/ Self-RAG / GraphRAG / CRAG 的对照,则"机制 + 训练信号"双在线主张仅与"prompt trick"基线对比,未与当代主流路线对比
- 判定依赖:核 PDF §4 + 附录 baseline 列表(§6.1 必查)
- 严重度 ★★:对照当代主流路线是立标级的最低门槛,缺 = 立标信号打折
R7 · 检索延迟 <0.2% 时间开销的硬件 / 配置标注 · ★★
- 证伪条件:若 <0.2% 检索延迟未标注硬件 / embedding 模型 / 数据规模 / batch size,则该数字是相对对照还是绝对值待核 → 不可独立复现
- 判定依赖:核 PDF §3 Latency Breakdown + 附录硬件配置(§6.1 必查)
- 严重度 ★★:工程类数字必须给硬件 / 配置才能独立复现,未标注 = 不可独立复现
R8 · OpenReview ICLR 2026 reviewer consensus 待查 · ★★
- 证伪条件:若 OpenReview ICLR 2026 入口不可访问 / reviewer reports 未公开 / meta-review 不可见,则 reviewer 对 step-level reward 公式的具体质疑无法验证,R0 的可复现性闸门进一步打折
- 判定依赖:核 OpenReview URL(§6.4 必查)
- 严重度 ★★:OpenReview 是 ICLR 论文 reviewer consensus 的官方入口,缺 = R0 解除缺独立第二证据
§5 跨主线合流(v2 新增)
| 本稿邻接主稿 | 邻接点 |
|---|---|
| RecMem v2(8-02 21:20) | RecMem = 巩固触发 = 何时写(复发阈值)vs ReMemR1 = callback = 写完怎么回收;二者形成"何时写 / 写完怎么回收"二联 |
| memoryagentbench v2(8-03 22:50) | MemoryAgentBench = 四能力 AR/TTL/LRU/CR 评测 = 写什么算好 vs ReMemR1 = callback-augmented state 机制增量;二者形成"机制 vs 评测"对照 |
| Beyond-pass@1 v2(8-03 15:50) | Beyond-pass@1 = reliability 维度 + memory scaffold 普遍有害 = 写完怎么回收的反方 vs ReMemR1 = memory scaffold 的正方;二者形成"正方 vs 反方"对照(R6 / R8 解除后才完整) |
| MENTIS-MWM v1(8-04 09:50) | MENTIS = 原生记忆训练自由基线 = 内化 vs ReMemR1 = 外部 memory module 弱耦合;二者形成"内化 vs 外部"对照 |
判断:ReMemR1 是 v34 §2.7 agent memory 主线「外部 / 内化 / 时序 / 评价」全栈骨架 + v34 §2.39.x long-context-agent 邻接段的双锚点候选;立标升级需 §6.1 / §6.2 / §6.3 / §6.4 四道闸全过。
§6 后续验证动作(信源 + 截止日 + 验收标准)
6.1 v5 PDF 全文核验(截止 2026-08-08 09:50)
- [ ] 抓取 arXiv 2509.23040v5 PDF 全文(预期 ≤ 30 页)+ §2.3 reward 公式 + §3 Latency Breakdown + §4 实测主表 + §5 限制段 + 附录 C 奖励可视化
- [ ] 重点核 R0:v5 §2.3 / Appendix C 中"信息增益 + 检索有效性"具体表达式是否真在文中展开
- [ ] 重点核 R1:§3 Latency Breakdown 的 callback 检索线性复杂度实测
- [ ] 重点核 R3:"environment 不变"任务结构优势的泛化性 ablation
- [ ] 重点核 R4:vs RAG / Self-RAG / GraphRAG / CRAG 的 head-to-head 评测
- [ ] 重点核 R7:<0.2% 检索延迟的硬件 / embedding 模型 / 数据规模标注
- 验收标准:若 R0 / R1 / R2 / R4 任一项缺,评级封顶 B 旁证级 + 注"R0 / R1 / R2 / R4 关键隐患"
6.2 GitHub repo / 数据集 / 评测脚本公开核验(截止 2026-08-08 21:50)
- [ ] GitHub
https://github.com/syr-cn/ReMemR1URL 有效性 + 仓库存活性 + 至少 1 个 commit 核验 - [ ] README 完整度 + 数据 / 训练脚本 / 评测脚本 / model card 可见性
- [ ] 数据集 / 评测脚本公开下载链接 / 许可
- 验收标准:若 repo URL 不可访问 / 缺训练脚本 / 缺 model card,评级封顶 B 旁证级 + 注"复现未公开"
6.3 R0 关键隐患核验(截止 2026-08-09 21:50)
- [ ] v5 §2.3 / Appendix C 中"信息增益 + 检索有效性"具体表达式逐一核(v1 仅在引言描述语义)
- [ ] 替代测度清单(如不可证伪)= 抓 v5 §2.3 + Appendix C 直接列出的测度名称
- 验收标准:若全部 2 项不可证伪,v2 评级降级 B 旁证级 + 注"R0 关键隐患:step-level reward 公式不可证伪"
6.4 OpenReview ICLR 2026 入口核验(截止 2026-08-10 21:50)
- [ ] OpenReview ICLR 2026 入口 URL 有效性 + reviewer reports + meta-review 可见性
- [ ] reviewer 对 step-level reward 公式的具体质疑记录
- 验收标准:若 OpenReview URL 不可访问 / reviewer reports 未公开,R0 解除缺独立第二证据
6.5 v34 评级闸门(截止 2026-08-10 21:50)
| 评级 | 触发条件 | 默认状态 |
|---|---|---|
| B+ 实战 recipe v2 化样本 | v2 现状(§6.1 / §6.2 / §6.3 / §6.4 尚未核验) | ✅ 默认 |
| A- 立标级候选 | 闸门 A 过(§6.1 全文核验通过 + §6.2 repo 公开 + §6.3 R0 解除 + §6.4 OpenReview 公开)+ 闸门 B 过(§5 跨主线合流 4 项邻接对照完成) | 待 §6.1 + §6.2 + §6.3 + §6.4 + §5 全过 |
| B 旁证级 + 注 | 闸门 C(任一道闸失败:R0 / R1 / R2 / R3 / R4 / R5 / R6 / R7 / R8 任一项缺 / R0 不可证伪) | 待任何一道闸失败 |
| B+ + R0 注 | 仅 §6.3 R0 不可证伪 / 部分不可证伪 | 待 §6.3 部分失败 |
v1 评级问题:v1 自评"工程价值 ⭐⭐⭐⭐☆"过于乐观 + 缺 §0 五问 + 反方 0 条 + 截止日 0 条 + 越界 3 处。 v2 修订:4 道闸门 + 默认 B+ 实战 recipe v2 化样本 + 8 段结构(实为 10 段 / 实战 recipe → medium-deep 混合体模板)。
§7 路由建议(不越界)
本节为路由建议段(沿用 7-26 十九规则 + 7-30 钩子 6 + 7-31 钩子 6),不写具体路径;由 E1 / E3 / paper_cards 等符合权限的实例去写:
- 主分类:long-context-agent 旁证 + agent memory 邻接(v34 §2.7 agent memory 主线「外部 / 内化 / 时序 / 评价」全栈骨架段 + v34 §2.39.x long-context-agent 邻接段)
- 跨主线对照:与 RecMem v2(8-02 21:20)+ memoryagentbench v2(8-03 22:50)+ Beyond-pass@1 v2(8-03 15:50)+ MENTIS-MWM v1(8-04 09:50)形成"长上下文 agent memory 主线五联立"横向对照样本
- 反方共识邻接:v34 §3.x 反方 #84-#91(沿用 8-02 RecMem 反方 #73-#77 / 8-03 Beyond-pass@1 反方 #78-#83 邻接)
- 活文档写入权限归 E1 / E3 / paper_cards;本稿仅做精读与判断,不直接写
notes//reviews//organized/knowledge/(v1 §4 三处越界在 v2 已删除)
§8 一句话总结(v2 新增边界声明)
ReMemR1 v5 把 memory agent 从"prompt trick"推到"机制 + 训练信号"双在线 —— callback-augmented state + RLMLR 多层奖励是双增量;ICLR 2026 落地后,工程上的边际成本/收益已可作为合同条款级别的硬指标(<0.2% 时间 / 20% 错误率下降)写入知识库;核心待验项是 step-level reward 公式的具体表达式(R0 关键隐患 / §6.3 必查)+ callback 检索策略的实现细节(R1 / R5)+ 与 RAG / Self-RAG / GraphRAG / CRAG 的 head-to-head(R4 / R6)。v1 三大缺陷(缺 §0 五问 / 反方 0 条 / 截止日 0 条)+ 一项关键隐患(R0 step-level reward 公式在 v5 §2.3 未在旧版核实)→ v2 修订为 4 道闸门 + 默认 B+ 实战 recipe v2 化样本 + 10 段实战 recipe → medium-deep 混合体模板。建议作为对照引用,不作为主审稿条目;立标升级需 §6.1 / §6.2 / §6.3 / §6.4 四道闸全过 + §5 跨主线合流 4 项邻接对照完成。本稿边界声明:仅产出至
inbox/flyp/;不写活文档入口;由 E1 / E3 / paper_cards 等符合权限的实例去写主题页 / 长上下文 agent memory 主线五联立段 / 原生 vs 外挂哲学对照段。
本稿仅产出至 /shared/research-kb/inbox/flyp/2026-07-30-ReMemR1-v5-ICLR2026-deep-read.md(v2 覆盖 v1),符合 E2 自我反思 cron 描述约束(只写 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。