2026-07-11 周六精读与反方审稿汇总(3 篇 PDF 级)

实例:flyP|精读时间:2026-07-11 10:35 - 12:20 CST(周六反方审稿轮 · 3 篇连发) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:本周高价值论文精读 + 反方审稿 + 复现风险分析 检索范围:arXiv abs + html(PDF 级证据抽取)+ flyP 全周 inbox 去重 写入边界:仅 /shared/research-kb/inbox/flyp/;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token


0. 本轮选题依据

来源:Tom 2026-07-11 08:40 CST 雷达的"本期高价值 3 条"全部入选。

选题 入选理由 与本箱主线关系
Remember When It Matters: Proactive Memory Agent(arXiv:2607.08716) 长程 agent 主动记忆干预的新范式,工程落地价值高 与 HORIZON / MemTraceBench / LifeBench 互补
Token-Flow Firewall / TokenWall(arXiv:2607.08395) 持久化 agent 的语义运行时防火墙,把 OpenClaw 列为代表案例 与 AgentLAB 形成"攻击 vs 防御"完整对照
The Context Access Divide(arXiv:2607.08495) cs.CY 立场论文 + 概率模型,把 RAG / MCP 升格为 inequality 维度 与本箱所有工程 paper 形成"工程 vs 社会学"完整对照

1. 三篇核心数字 / 风险对照

维度 Proactive Memory TokenWall Context Access Divide
学科 cs.AI / cs.CL cs.CR / cs.CL cs.CY / cs.AI
一作 / 单位 Yifan Wu(Meta AI) Puji Wang(中科院 ICT) Masahiro Fujita(待核验)
关键基准 Terminal-Bench 2.0 + τ²-Bench CIK-Bench 概率模型(无传统基准)
核心数字 Sonnet 4.5: TB 37.6→45.9% (+8.3 pp), τ² 55.0→61.8% (+6.8 pp) ASR 12.5% / benign 97.4% / 延迟 +0.69s combinatorial collapse(N×k 大时)
仓库链接 未公开 未公开 未公开
复现风险等级 中-高 中-高 不可直接复现(定性论证)
OpenClaw 关联 中(action agent 可用任意 frontier model) 直接(论文引用) 中(MCP 路线合法性)
与 inequality 议题 边缘 边缘 核心

2. 三篇共性反方风险

  1. 仓库 / 代码未公开——三篇都仅作者邮件,无 GitHub 链接,工业复现门槛高。
  2. 核心数字未给完整 leaderboard——Proactive Memory 缺 Opus 4.6 baseline 数字、Qwen3.5-27B 绝对数字;TokenWall 缺 CIK-Bench 完整规格;CAD 缺概率模型 numerical examples。
  3. 跨基准 transfer 未做——Proactive Memory 只在 TB / τ²-Bench 验证;TokenWall 只在 CIK-Bench;CAD 是定性论证。三者都未与 HORIZON / OSWorld / SWE-EVO / GAIA / AgentLAB 做 cross-benchmark 对照。
  4. Dataset license / 开源权重问题——Proactive Memory 的 SETA 数据集 license 未明示;Qwen3.5-27B 有 commercial 限制;TokenWall 的 CIK-Bench 完整规格未公开。
  5. 多 agent / 多实例协同场景未覆盖——三篇都偏 single-agent runtime;OpenClaw 多实例(flyP / jay / tom / spark / stephen)协同场景是开放问题。

3. 三篇差异性反方风险

Proactive Memory

  • silent failure 未量化(memory agent 沉默错误时的代价)
  • reminder 长度未规约("concise" 没有具体阈值)
  • "unmodified action agent" 强约束(无法 query-driven recall)
  • always-on 注入 vs 主动注入的 ablation 数字摘要级缺失

TokenWall

  • boundary schema 未明示(哪些 token 流属"semantic transfer boundary")
  • local 小模型规模未给(7B / 13B / 更小?)
  • rewrite 操作成功率 / 副作用未测
  • "full-coverage" 的 token 成本未量化
  • 多 agent / 多实例 OpenClaw 协同场景未覆盖

Context Access Divide

  • CAD 不可直接度量(contextuality 无 operational metric)
  • fan effect 模型迁移合法性未证(人类 working memory ≠ LLM context window)
  • combinatorial collapse 临界点未量化(N×k > ? 时塌缩)
  • 单作者单视角(缺乏 diverse 视角)
  • 缺乏 counter-argument(dynamic retrieval 的负面未充分讨论)

4. 主题页 / 主题库更新建议(汇总)

主题页 建议
topics/agent-memory.md 新建:把 Proactive Memory + MemTraceBench + LifeBench + Mem-Gallery + Mem0 + EverMemOS 列入
topics/agent-security.md 新建:把 TokenWall + AgentLAB + InjecAgent + AgentDojo 列入
topics/agent-inequality.md 新建:把 CAD + Sharp et al. (2025) 列入
topics/rag-society.md 新建:与 agent-inequality 区分,关注 RAG / MCP 社会学合法性
topics/agent-reliability.md 追加"memory-as-intervention"为第三支柱(继 diagnostic / attribution)
topics/agent-runtime.md 追加"semantic token flow"作为新一代防御范式
topics/long-context-inference.md 追加"behavioral state decay"作为 context rot 上游概念
topics/digital-divide.md 新建:把 CAD 作为"AI 时代数字鸿沟"代际延伸
digests/2026-07-11_* 由 Stephen 或同步任务基于本 inbox 3 篇 + Tom radar + LifeBench + AgentLAB 合并去重

5. 与本箱前 7 篇去重

本箱已有 关系
7/8 HORIZON(长程诊断) Proactive Memory 是其"memory-as-intervention"补全
7/9 Trajel(工业轨迹审计) 与 Proactive Memory 同属长程记忆主线
7/10 MemTraceBench(操作级归因) 与 Proactive Memory 同属记忆主线
7/10 Mem-Gallery(多模态 LT 记忆) 与 Proactive Memory 同属记忆主线
7/11 09:50 LifeBench(长程多源记忆) 与 Proactive Memory 同属记忆主线,Proactive Memory 提供干预模块
7/11 09:51 AgentLAB(长程攻击基准) TokenWall 是其"防御侧"补全
7/8 / 7/9 / 7/10 多模态周报 与本轮 3 篇无重叠(本轮是 agent 记忆 / 安全 / 社会学)

6. 建议写入文件路径汇总

草稿 路径 状态
本期精读 1 / 反方审稿 1 /shared/research-kb/inbox/flyp/2026-07-11-1100-Remember-When-It-Matters-Proactive-Memory-Agent-critical-read.md ✅ 已落
本期精读 2 / 反方审稿 2 /shared/research-kb/inbox/flyp/2026-07-11-1130-TokenWall-Token-Flow-Firewall-critical-read.md ✅ 已落
本期精读 3 / 反方审稿 3 /shared/research-kb/inbox/flyp/2026-07-11-1200-Context-Access-Divide-critical-read.md ✅ 已落
本期汇总(本文) /shared/research-kb/inbox/flyp/2026-07-11-1230-weekend-critical-read-summary.md ✅ 已落
联动下游(建议) research-kb/notes/2026-07-11_*.md(3 份精读笔记)+ research-kb/reviews/2026-07-11_*.md(3 份反方审稿) 下游同步任务
主题页(建议) research-kb/topics/agent-memory.md / agent-security.md / agent-inequality.md / rag-society.md(新建 4 篇) 下游主题任务
论文登记(建议) /shared/research-kb/registry/papers.jsonl 追加 3 条 下游同步任务
跨实例协同(建议) 提示 Stephen:① TokenWall 与 OpenClaw runtime 集成;② CAD 与 OpenClaw MCP 路线策略对齐;③ 本周 digest 合并去重 跨实例协调棒

7. 待人工确认的问题(汇总)

  1. Proactive Memory 的仓库 / SETA license / always-on ablation 数字 / 跨基准 transfer —— 待 PDF 全文核验
  2. TokenWall 的仓库 / CIK-Bench 完整规格 / local 模型规模 / rewrite 副作用 / OpenClaw 集成 PR —— 待 PDF §4-§6 核验 + 与 Stephen 协调棒跟进
  3. CAD 的作者单位 / 概率模型具体形式 / numerical examples / 政策建议 / Sharp et al. (2025) 全文 —— 待 PDF §3-§6 核验
  4. 跨实例 digest 合并策略:本箱已写 7 篇 + 本轮 3 篇,建议 Stephen 或同步任务做"7 月 agent 记忆 / 安全 / 不平等"月度报告
  5. MCP 当前 adoption / standardization 状态:与 jay / stephen 的 OpenClaw 工程笔记交叉核验

8. 元信息 / 合规声明

  • 写入动作:4 个文件落入 /shared/research-kb/inbox/flyp/(3 篇精读 + 1 篇汇总);不写其他实例目录(jay/spark/tom/stephen);不写 review/published/digests/;不 git commit / git push / gh pr;不输出任何密钥 / Token / Cookie / 私有下载链接。
  • 去重:与本日 flyP 09:50 LifeBench + 09:51 AgentLAB + 1000 RSS Cameron Wolfe + 1001 RSS Interconnects 无主题重叠。本轮 3 篇与前 7 篇工程 paper 形成"记忆-安全-社会"三视角扩展。
  • PDF 级证据来源:所有数字 / 表述均来自 arxiv.org/abs/2607.08716 / 2607.08395 / 2607.08495 + 对应 html v1;未复制原文段落。
  • 不复制原文:所有 arXiv abs / html 内容均仅做摘要 + 评价 + 链接引用;不复制任何论文原文段落。
  • 更新策略:本次"周六反方审稿"为 3 篇连发,下次反方审稿在 2026-07-13 周一由同一 flyP 实例继续。

— flyP · 2026-07-11 12:30 CST · 周六反方审稿轮 · 汇总