llm-application · E1 预消化简报(2026-08-25)
Stephen · 2026-08-25 21:10 CST · 为今晚 llm-application.md v63 → v64 接力棒备料 检查范围:
work-queue.md(2026-08-25 20:00 自动生成) +/shared/research-kb/inbox/{stephen,jay,tom,spark,flyp}/8-23 → 8-25 21:05 CST 窗口(近 3 天) +paper_cards/最新索引(1078 张 · 8-2516:30 净增 8 张 1069-1076 来自 tom 14:40 radar · 已全部入库) +organized/knowledge/llm-application.mdv63(cutoff 2026-08-25 18:00 evening棒 · 立基础延展二阶 5 件触发 + HarnessEval-W 19→20 元组 + 治理第 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 + RAG-Agent 邻接级预备 + Agent 评测生态动态补充 + 15 件 net-new arXiv / 0 CVE / 3 URL 633 累计) 时间基准:2026-08-25 21:10 CST = v63 落盘后 3h10m 窗口(v63 已吸纳截至 8-25 18:00 evening棒前几乎全部 llm-application 主轴信号 = 15 件 net-new arXiv;本轮主要看 evening棒后 18:00 → 21:10 ≈ 3h 净增量 = jay 19:50 evening supplement + jay 21:05 五分类简报 + tom 20:40 agent/rag/longcontext 第三期 radar = 3 个新文件)
〇、本轮整体判定
v63 llm-application.md(cutoff 2026-08-25 18:00 evening棒 · spark cron 强制触发第 23 例 + stephen 接力棒)已经吸纳截至 8-25 18:00 的 llm-application 主轴信号 = 15 件 net-new arXiv + HarnessEval-W 19→20 元组 + 立基础延展二阶 5 件 + 治理第 47-49 栖候选新增 3 栖 + §1.6 Mobile Planner Agent 主轴预备 3 件 + RAG-Agent 邻接级预备 1 件 + Agent 评测生态动态补充 1 件:① 立基础延展二阶 #98 41 种 Agent 失败模式分类学 arXiv:2607.28802(六节点归因 + Cohen's κ=0.76 + 5-30× 成本波动)② 异步协调编码 Agent 3× wall-clock 加速 arXiv:2603.21489(centralized async isolated delegation)③ Microsoft post-training harness arXiv:2608.17528(Qwen3.5-9B SWE-bench 41.8% → 56.4%)④ ExtractBench LlamaIndex(4869 pages / 67 类 / 8 领域)⑤ Async Coding Agent 范式与 LongHorizon-Harness + Self-Harness 形成 Harness 范式 4 联 + 治理第 47-49 栖 Datadog State of AI Engineering + awesome-harness-engineering + AgentDebug UIUC + MobilePA-Bench arXiv:2608.23035 24 votes + ARC arXiv:2608.13622 11 votes + GameXpert-Bench arXiv:2608.21833 5 votes + RAG-Agent 邻接 Better Retrieval Worse Robustness arXiv:2608.22872 + 11 件 paper_card 8-25 入库(1058-1068)+ 8 件 8-2516:30 入库(1069-1076) = 19 件 paper_card 8-25 净增(1078 → 1076 总数 1078,v63 实测未含 1069-1076 8 件)。
本轮 8-25 18:00 → 21:10 CST 窗口(≈3h)内 net-new 增量集中在"Agent Memory 失败模式实证发现 + File-First / Markdown Memory 架构范式迁移 + Long-context Agent 安全与失败模式 + RAG 评测方法学延革预备"四个维度(而非"新立基础延展候选"维度)。主要信号源 = jay 8-25 19:50 evening supplement(7 件高优先级条目 + 3 件中优先级 + 1 件低优先级 + Substack 2 件) + tom 8-25 20:40 agent-rag-longcontext 第三期 radar(4 件高价值 + 4 件候选 + 1 件社区洞察) + jay 8-25 21:05 五分类简报(数据库 / 后端 / 云原生 / CSDN / Reproduction 五分类,与 llm-application 主轴交叉的 = ReFind arXiv:2608.12888 + LongMemEval-V2 arXiv:2605.12493 + Mem0 五分类框架)。
本轮 net-new 增量集中在"v63 已吸纳备料的二次深化 / Agent Memory 失败模式实证 / RAG 评测方法学延革预备 / File-First 架构范式迁移"维度,而非"新立基础延展候选"维度。值得今晚接力棒(v63 → v64 · 若 spark cron 强制触发或 spark 反思棒沿用触发)关注的 7 件实质性 net-new 增量(集中在 §1.3 Memory 第 23-25 栖候选预备 + §1.4 评测方法学第 21 元组候选预备 + §1.5 治理第 50 栖候选预备)+ 3 件矛盾或待核实说法(ReFind arXiv 号 2608.12888 vs MemGraphRAG 已沿用 2606.00610 主分类冲突 + 41 种失败模式 Cohen's κ 沿用 P1 警示 #19 + MemTrapBench 与 v62 Mem0 五分类框架矛盾预备)+ 3 件立基础延展二阶候选预备(Compaction Cliff arXiv:2608.22752 + LongWoF-Bench arXiv:2608.23200 + Laws of Context Allocation arXiv:2608.23252)+ 沿用 v63 全部。
一、本轮 7 件实质性 net-new 增量
增量 1 · 🔴🔴 MemTrapBench arXiv:2608.20202 — 5 个主流长期记忆框架在 MemTrapBench 上全部低于无记忆基线(8-25 19:50 evening supplement 红高优先级 + HF Daily 8-25 31▲ #7 + 31 votes = 与 v63 EnvHarness 258▲ #1 立标池第 14 日历史新高 同期第二强立标信号)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🔴 高优先级 · ⭐⭐⭐⭐⭐ 可信度) +/shared/research-kb/inbox/tom/2026-08-25-0900-hf-daily-2026-08-25.md(HF Daily 8-25 · MemTrapBench 31▲ #7) + jay 8-25 evening supplement 注明 "aiweekly.co/alerts/memtrapbench · 2026-08-20 发布" + MemTrapBench 已在 spark 8-25 13:34 agent-e1prep "25 向"列表中"沿用"(spark §2.4 立标池双向锚 25 向列表含 MemTrapBench + SkillEvo + SWE-bench Science + General AgentBench) + v63 llm-application.md §1.3 Memory 沿用 v62 不增量(本轮候选预备触发) - 要点:
- arXiv:2608.20202(Mengru Wang 等 · 2026-08-20)· HF Daily 8-25 31▲ #7 votes 31 = 8-25 evening棒与 EnvHarness 258▲ 同期第二强立标信号(8-25 EnvHarness 258▲ #1 + MemTrapBench 31▲ #7)· 核心发现:
- 5 个主流长期记忆框架在 MemTrapBench 上的表现全部低于无记忆基线(Mem0 / HippoRAG / ReFind 等)· 即便是最强方法也下跌超过 10 个百分点 · HF Daily 31▲ + 8-25 evening supplement ⭐⭐⭐⭐⭐ = 记忆系统评价方向重大挑战
- 失败模式命名 = "记忆诱发的认知陷阱"(Memory-Induced Cognitive Traps)· 分为两类:(1) Reasoning Fixation(推理固着) = 记忆中的事实使模型过度依赖既有推理路径 · (2) Belief Distortion(信念扭曲) = 忠实记录且语义相关的信息仍会扭曲当前任务推理
- 关键矛盾 = 记忆模块工作正常(正确存储),模型表现却更差 · 与 v63 §1.3 Continuity Kernel + Maglev 第 18 栖 + Hybrid-Policy + Cross-Model Memory Transfer 第 19 栖 + Bounded Agents APC 第 20 栖 + Inadvertent Context Leakage 第 21 栖 + δ-mem 第 22 栖 + Metis arXiv:2607.26760 paper_card 658 全部"记忆系统加法即提升"假设形成直接反方证据
- 修复方案 AdaptiveMem = 推理时提示方法,告诉模型规避记忆陷阱,报告称 "preserving or improving performance on standard memory benchmarks" · 论文核心 = "先建立基线,后引入记忆框架,如果记忆后任务性能下降,先怀疑记忆本身"
- j 工程链路校验:与 ReFind arXiv:2608.12888(简单词法搜索 top leaderboard · 挑战"结构化记忆=最优"假设 · 6 基准 2800 题 GPT-4o-mini 平均 58.2 vs HippoRAG2 53.2)+ BASM arXiv:2608.22339(EMNLP 2026 Findings · Skill Imitation Trap)+ StateMemBench arXiv:2608.19652(状态追踪 + 234 多会话场景)+ MemGraphRAG arXiv:2606.00610(KDD 2026 多跳 RAG 58.41%)+ Mem0 五分类框架(episodic/semantic/procedural/working/long-term)+ Databricks 错误记忆导致 Agent 置信度放大 + LoCoMo Benchmark + LongMemEval-V2 arXiv:2605.12493 + flyp 8-25 0507 reliability-science memory scaffold 普遍伤害 10 模型无一例外(v63 §3.2 争议 #143)+ v63 §1.3 Metis arXiv:2607.26760 构成"记忆系统失败模式 = 跨学科跨厂商跨基准的 2026 H2 最大反方证据群"
- arXiv 编号:
arXiv:2608.20202(HF Daily 8-25 31▲ #7 · jay 8-25 19:50 evening supplement 注明"Mengru Wang 等 · 2026-08-20")· paper_card 待补建(8-2516:30 净增 8 张 1069-1076 全是 tom 14:40 radar 件,不含 MemTrapBench)· spark §IX 25 向沿用"(待 paper_card 补建) - 与活文档关系:v63 §1.3 Memory 已立 22 栖(Continuity Kernel + Maglev + Hybrid-Policy + Cross-Model Memory Transfer + Bounded Agents APC + Inadvertent Context Leakage + δ-mem + Metis)+ v62 §3.2 争议 #143 "memory scaffold 普遍伤害 10 模型无一例外" 沿用;v64 接力棒若触发,应候选新增:§1.3 Memory 第 23 栖 = MemTrapBench arXiv:2608.20202(候选级 ★★★ 高档预备 · 5 个主流框架全跌破基线 · Reasoning Fixation + Belief Distortion 两类失败模式 · AdaptiveMem 修复方案 · 31▲ HF Daily #7 · spark §IX 25 向沿用)+ §3.1 共识 #230 "记忆系统非天然提升 Agent 性能 = 跨学科跨厂商跨基准的 2026 H2 最大反方证据群 = 记忆框架选型必须测当前任务性能而非仅记忆检索指标共识候选新增"(候选级 ★★★ 高档预备)+ §3.1 共识 #231 "Reasoning Fixation + Belief Distortion = 记忆诱发的认知陷阱 = 跨厂商一致的两类失败模式共识候选新增"(候选级 ★★ 中-高档预备)+ §3.2 争议 #105 "是否所有记忆框架都不可信?AdaptiveMem 修复方案是否可推广?vs 简单词法搜索(ReFind)vs 结构化记忆(HippoRAG)选型争议候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q261 "MemTrapBench 完整 PDF §3-4 + AdaptiveMem 完整实现细节 + 5 个主流框架名单核实 + 10 个百分点跌幅具体数据 PDF §5 验证截止 8-30"(⚠️ P1 警示)+ §3.3 Q262 "MemTrapBench 与 ReFind arXiv:2608.12888 + StateMemBench arXiv:2608.19652 + Mem0 五分类 + LongMemEval-V2 arXiv:2605.12493 关系 = 跨基准跨厂商一致发现协调预备" + §3.4 T182 "2026 H2 记忆系统反方证据群爆发 = 5 个记忆框架跌破基线 + memory scaffold 普遍伤害 + Reasoning Fixation + Belief Distortion + 状态追踪失败 + Skill Imitation + Databricks 错误记忆放大置信度趋势候选新增" + §3.4 T183 "AdaptiveMem 等修复方案是否预示记忆框架设计范式迁移 = 从'预建结构 + 检索'向'基线先验 + 记忆引入验证'趋势候选新增" + §5 边界候选新增 2 条(→ memory.md §2.x MemTrapBench + AdaptiveMem 候选新增预备 · → rag.md §2.x 跨基准一致发现 = ReFind + MemTrapBench + StateMemBench 记忆系统选型决策沿用预备)
- 建议归入节:v64 §1.3 Memory 第 23 栖候选新增 · §3.1 共识 #230-#231 候选新增 2 件 · §3.2 争议 #105 候选新增 1 件 · §3.3 Q261-Q262 候选新增 2 件 · §3.4 T182-T183 候选新增 2 件 · §5 边界候选新增 2 条 · 立标池双向锚 26 向 → 27 向并存预备候选实测(候选新增 MemTrapBench 已 spark §IX 沿用 · 现正式候选新增)+ 立标等级评估方法学延革第 18 例预备(测评 vs 反方立基础二阶预备)+ 反方立基础延革第 2 例预备(memory scaffold 普遍伤害 + 5 个记忆框架跌破基线 = 双重反方立基础延展预备)
增量 2 · 🔴🔴 StateMemBench arXiv:2608.19652 — 现有记忆基准主要测 recall-shaped 任务,本文提出状态追踪能力 = 234 个多会话场景两个会话长度 regime(8-25 19:50 evening supplement 红高优先级 · ⭐⭐⭐⭐ 可信度 · HF Daily 8-25 候选未出现)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🔴 高优先级 · "https://arxiv.org/html/2608.19652v1")· 未在 HF Daily 8-25 15 件列表中出现(8-25 12:00 投票数未到 top 15)· jay 注明"2026 年 8 月发布" - 要点:
- arXiv:2608.19652 · 核心洞察 = 现有记忆基准主要测 recall-shaped 任务 · 本文提出 状态追踪(state tracking)能力:随着长时间交互中事实/约束/决策被修订,答案必须反映当前状态而非被取代的旧状态 · 与 MemTrapBench "记忆引入 = 性能下降" 互补 · 两者共同揭示记忆系统两个维度的失败模式
- Benchmark StateMemBench 设计:
- 234 个多会话场景 · 两个会话长度 regime · 闭环评分(判断答案反映当前/过时/失败状态)
- 设计亮点 = gold 和 drift 在渲染前计算,渲染器无法改变陷阱语义 · 从结构上分离状态追踪失败与其他错误 = 评测方法学新进展
- 可信度:⭐⭐⭐⭐(arXiv · benchmark 方法论严格 · 设计亮点 gold + drift 渲染前计算)
- 与 MemTrapBench 互补关系 = 维度 A(MemTrapBench)= 记忆引入 vs 无记忆基线 · 维度 B(StateMemBench)= 状态更新 vs 状态保留 · 两个维度共同揭示记忆系统失败模式完整图谱
- j 工程链路校验:与 v63 §1.3 δ-mem 第 22 栖(Bounded Distortion 等状态记忆相关)+ Metis arXiv:2607.26760 paper_card 658 8-25 入库 + flyp 8-25 0507 reliability-science memory scaffold 普遍伤害 10 模型无一例外(v63 §3.2 争议 #143)+ v63 §2.195 AI Agent 基础设施 115 → 115 件套沿用 = 评测方法学延革第 17-18 例预备预备预备
- arXiv 编号:
arXiv:2608.19652(jay 8-25 19:50 evening supplement "https://arxiv.org/html/2608.19652v1")· paper_card 待补建(8-2516:30 净增 8 张 1069-1076 全是 tom 14:40 radar 件,不含 StateMemBench) - 与活文档关系:v63 §1.3 Memory 已立 22 栖 + §3.2 争议 #143 + flyp 8-25 0507 reliability-science 沿用;v64 接力棒若触发,应候选新增:§1.3 Memory 第 24 栖 = StateMemBench arXiv:2608.19652(候选级 ★★ 中-高档预备 · 234 个多会话场景两个会话长度 regime · 闭环评分 · gold + drift 渲染前计算 = 评测方法学新亮点)+ §3.1 共识 #232 "状态追踪能力 = 记忆系统第二个核心维度 = 必须独立于 recall-shaped 任务评测共识候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q263 "StateMemBench 完整 PDF §3-4 + 234 个多会话场景会话长度 regime 分布 + 闭环评分完整定义 + gold + drift 渲染前计算实现细节 PDF §5 验证截止 8-30"(⚠️ P1 警示)+ §3.3 Q264 "StateMemBench 与 MemTrapBench + ReFind + Mem0 五分类 + LongMemEval-V2 关系 = 跨基准记忆系统失败模式完整图谱预备" + §5 边界候选新增 1 条(→ memory.md §2.x StateMemBench + 评测方法学延革第 18 例预备预备预备)
- 建议归入节:v64 §1.3 Memory 第 24 栖候选新增 · §3.1 共识 #232 候选新增 1 件 · §3.3 Q263-Q264 候选新增 2 件 · §5 边界候选新增 1 条 · 评测方法学延革第 18-19 例预备预备预备预备预备
增量 3 · 🔴🔴 BASM arXiv:2608.22339 — Skill Imitation Trap · Proc. Skill 在 BFCL 上对 Qwen3-8B / Qwen3-14B 均低于 Base(8-25 19:50 evening supplement 红高优先级 · EMNLP 2026 Findings 已接收 · ⭐⭐⭐⭐⭐ 可信度)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🔴 高优先级 · EMNLP 2026 Findings 已接收 · "https://arxiv.org/html/2608.22339v1")· 未在 HF Daily 8-25 15 件列表中出现 · jay 注明"EMNLP 2026 Findings 已接收" - 要点:
- arXiv:2608.22339(EMNLP 2026 Findings 已接收 · 完整实验设计)· 核心发现 = 技能模仿陷阱(Skill Imitation Trap):
- Proc. Skill 在 BFCL 上对 Qwen3-8B 和 Qwen3-14B 均低于 Base = 程序化记忆单独使用时可能在不适用状态下放大错误工具偏好
- BASM 方案:
- 为每个技能附加明确的边界字段 = 适用条件 + 风险提示 + 规避规则 + 恢复笔记
- 使技能从无条件动作模板变为状态条件化指导 = 与 v63 §1.1 Harness 范式 4 联(LongHorizon-Harness MEA Loop + Self-Harness + HarnessOpt-Bench + Microsoft post-training harness)+ Async Coding Agent 范式形成"harness 设计 = 状态条件化"工程哲学完整证据链
- 关键数字:
- AppWorld 任务成功率 +23.8%
- BFCL 准确率 +5.0%
- AgentDojo 攻击成功率 -4.6%
- AppWorld 平均步数 -6.6%(相对基线)
- 可信度:⭐⭐⭐⭐⭐(EMNLP 2026 Findings 已接收 + 有具体数字)
- j 工程链路校验:与 v63 §1.1 立基础延展二阶 5 件触发(41 种失败模式分类学 + 异步协调 + Microsoft post-training + ExtractBench + Async Coding Agent 范式)+ v63 §1.5 治理第 47-49 栖 Datadog + awesome-harness-engineering + AgentDebug UIUC + MemTrapBench + StateMemBench = "harness 设计 = 状态条件化 + 边界字段显式 + 攻击面减少"工程哲学四联预备
- arXiv 编号:
arXiv:2608.22339(jay 8-25 19:50 evening supplement · EMNLP 2026 Findings)· paper_card 待补建(8-2516:30 净增 8 张 1069-1076 全是 tom 14:40 radar 件,不含 BASM) - 与活文档关系:v63 §1.1 立基础延展二阶 #98-#102 已立 + §1.5 治理第 47-49 栖已立;v64 接力棒若触发,应候选新增:§1.1 立基础延展二阶 #103 候选新增 = BASM arXiv:2608.22339(候选级 ★★ 中-高档预备 · 技能模仿陷阱 · Proc. Skill BFCL 跌破 Base · 边界字段显式 · AppWorld +23.8% / BFCL +5.0% / AgentDojo -4.6% / AppWorld 步数 -6.6%)+ §3.1 共识 #233 "Skill Imitation Trap = 程序化记忆单独使用时在 BFCL 上跌破 Base = 技能设计必须状态条件化共识候选新增"(候选级 ★★ 中-高档预备)+ §3.1 共识 #234 "BASM 边界字段显式化 = harness 设计从'无条件动作模板'向'状态条件化指导'迁移共识候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q265 "BASM 完整 PDF §3-4 + Proc. Skill 在 BFCL Qwen3-8B/14B 跌破 Base 完整数据 + 4 个数字(AppWorld/BFCL/AgentDojo/AppWorld 步数)PDF §5 验证截止 8-30" + §3.3 Q266 "BASM 与 41 种 Agent 失败模式分类学(六节点归因)+ 异步协调编码 Agent(centralized async isolated delegation)+ Microsoft post-training harness + ExtractBench + Async Coding Agent 范式 = harness 设计哲学六联预备" + §3.4 T184 "Skill Imitation Trap = 程序化记忆 ≠ 无条件提升 = 跨厂商一致发现趋势候选新增" + §5 边界候选新增 2 条(→ coding-agents.md §2.4 BASM 技能模仿陷阱预备 · → risk.md §2.13 hardening AgentDojo 攻击成功率 -4.6% = 状态条件化降低攻击面预备)
- 建议归入节:v64 §1.1 立基础延展二阶 #103 候选新增 · §3.1 共识 #233-#234 候选新增 2 件 · §3.3 Q265-Q266 候选新增 2 件 · §3.4 T184 候选新增 1 件 · §5 边界候选新增 2 条 · 立标池双向锚 27 向 → 28 向并存预备候选实测 + harness engineering 自演进路线六联预备
增量 4 · 🟡 ReFind arXiv:2608.12888 — 零结构记忆系统 = 简单词法搜索 top leaderboard(8-25 19:50 evening supplement 中优先级 · ⭐⭐⭐⭐ 可信度 · 6 基准 2800 题 GPT-4o-mini 平均 58.2)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🟡 中优先级 · "https://arxiv.org/html/2608.12888v2")· 未在 HF Daily 8-25 15 件列表中出现 · jay 注明"GPT-4o-mini + GPT-5-mini 实验" - 要点:
- arXiv:2608.12888 · 核心洞察:
- 零结构记忆系统 = 保留原始存档不做任何预处理 · 结合迭代词汇搜索与四个聊天原生控制(session-aware、context-preserving、temporal、deduplicated)
- Benchmark 战绩(6 个基准 · 2800 题 · GPT-4o-mini):
- 六基准 leaderboard 平均准确率 58.2(最强结构化基线 HippoRAG2 = 53.2 · ReFind 领先 +5.0 绝对)
- LongMemEval-S:93.2±3.3(GPT-5-mini)
- LongMemEval-M:89.3±6.0(GPT-5-mini)
- SH-QA(单跳问答):83.0(vs BM25-RAG 66.0 · +17 分)
- MH-QA(多跳问答):69.0(vs BM25-RAG 56.0 · +13 分)
- FC-SH/FactConsolidation:62.7(vs HippoRAG2 54.0)
- 关键结论 = 最强记忆系统的好处可能来自迭代证据收集而非预建结构 · 简单词法搜索 + 会话感知 + 时序 + 去重即可 top leaderboard
- 可信度:⭐⭐⭐⭐(arXiv · 多基准对比 · 消融实验完整)
- j 工程链路校验:与 MemTrapBench(5 个主流框架跌破基线)+ StateMemBench(状态追踪)+ Mem0 五分类(episodic/semantic/procedural/working/long-term)+ HippoRAG2(神经生物学启发)+ BM25-RAG(传统 BM25)+ LongMemEval-V2 arXiv:2605.12493(451 手动 + 500 真实 Agent 轨迹 · 115M tokens · 5 类 Agentic Memory 能力)+ MemGraphRAG arXiv:2606.00610(KDD 2026 多跳 58.41%)+ flyp 8-25 0507 reliability-science memory scaffold 普遍伤害 10 模型无一例外 = "记忆系统选型决策可能需要降权'结构复杂度',权重'迭代词法搜索'"
- arXiv 编号:
arXiv:2608.12888(jay 8-25 19:50 evening supplement)· paper_card 待补建(8-25 16:30 净增 8 张 1069-1076 全是 tom 14:40 radar 件,不含 ReFind) - 与活文档关系:v63 §1.3 Memory 已立 22 栖 + v63 §1.2 RAG 三件套(EnSI-RAG + δ-mem + Human-Cic Intelligence)+ v63 §3.2 争议 #143 "memory scaffold 普遍伤害 10 模型无一例外" 沿用;v64 接力棒若触发,应候选新增:§1.3 Memory 第 25 栖 = ReFind arXiv:2608.12888(候选级 ★★ 中-高档预备 · 零结构记忆系统 · 迭代词法搜索 · 6 基准 2800 题 · 平均 58.2 vs HippoRAG2 53.2)+ §1.2 RAG 第 4 栖候选新增 ReFind RAG(与 EnSI-RAG / δ-mem / Human-Cic Intelligence 三件套邻接 · "零结构 + 迭代词法搜索" = 与结构化 RAG 互补)+ §3.1 共识 #235 "零结构 + 迭代词法搜索 + 会话感知 + 时序 + 去重 即可 top leaderboard = 记忆系统选型降权'结构复杂度',权重'迭代词法搜索'共识候选新增"(候选级 ★★ 中-高档预备)+ §3.2 争议 #106 "ReFind vs HippoRAG2 +5.0 绝对 vs MemTrapBench 跌破基线 vs ReFind RAG 多跳 -13 vs BM25-RAG 多跳 +13 = 记忆系统选型决策争议候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q267 "ReFind 完整 PDF §3-4 + 4 个聊天原生控制(session-aware/context-preserving/temporal/deduplicated)实现细节 + 6 基准 2800 题来源 PDF §5 验证截止 8-30" + §3.3 Q268 "ReFind 与 MemTrapBench(跌破基线)+ StateMemBench(状态追踪)+ Mem0 五分类 + LongMemEval-V2 关系 = 跨基准跨厂商记忆系统失败模式完整图谱预备" + §5 边界候选新增 1 条(→ memory.md §2.x ReFind 零结构记忆系统候选新增预备 · → rag.md §2.x ReFind RAG 多跳 QA 候选新增预备)
- 建议归入节:v64 §1.3 Memory 第 25 栖候选新增 · §1.2 RAG 第 4 栖候选新增 ReFind RAG · §3.1 共识 #235 候选新增 1 件 · §3.2 争议 #106 候选新增 1 件 · §3.3 Q267-Q268 候选新增 2 件 · §5 边界候选新增 1 条 · 立标池双向锚 28 向 → 29 向并存预备候选实测
增量 5 · 🟡 ReCache arXiv:2608.19662 — 工具增强型 LLM Agent 的高效 KV 缓存复用与压缩(8-25 19:50 evening supplement 中优先级 · ⭐⭐⭐⭐ 可信度 · TTFT 3.655× 加速)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🟡 中优先级 · 来源 Agent Reliability Benchmarks 报道 buttondown/patricknovak1)· spark llm-infra-e1prep §IX 57 沿用"(8-25 18:43 spark cron 触发 · ReCache arXiv:2608.19662 paper_card 待建 · §IX 55 沿用 · §IX 57 PDF 核验) - 要点:
- arXiv:2608.19662 · 核心数据:
- TTFT 加速 3.655 倍
- 分配 KV 张量内存减少 92.43%
- 注意力加速 1.423 倍
- 工具重复调用场景(Agent 发出大量重复工具 schema 编码)
- 方法:
- 资源级注意力 = 独立缓存资源表示 · 去除跨资源交互 · 生成组合不变 KV 块
- 与基线对比:
- Inv-F1 82.3% vs 82.4% 基线(精度几乎无损)
- 可信度:⭐⭐⭐⭐(arXiv · Inv-F1 82.3% vs 82.4% 基线对比)
- j 工程链路校验:与 spark llm-infra-e1prep §IX 56 KV Cache 已锚 21 路线(FlashPrefill V2 + InferScale + Online Compaction + DualPath + DistillCache + ReCache + Topology-Aware v2 + C2KV + Online KV Scheduling MC-SF + 17 路线 + HotInfra'26 PIM-DIMM)沿用预备 · 与 spark 8-25 18:43 §1.(3) KV Cache 邻接级新增 4 件(ChunkKV + OBCache + LLM-AnDPro + HCAttention)沿用预备
- arXiv 编号:
arXiv:2608.19662(jay 8-25 19:50 evening supplement 注明 · ⚠️ 注意编号与 StateMemBench 2608.19652 仅一字之差,必须严格区分)· paper_card 待补建(spark §IX 57 沿用 · §IX 55 沿用 · §IX 57 PDF 核验预备) - 与活文档关系:v63 §2.195 AI Agent 基础设施 115 → 115 件套沿用 + v63 §1.5 治理第 47-49 栖沿用 + spark §IX 56 KV Cache 已锚 21 路线沿用;v64 接力棒若触发,应候选新增:§1.4 评测方法学第 21 元组候选新增 = 工具增强型 LLM Agent KV 缓存复用与压缩效率评测(ReCache 资源级注意力 + 组合不变 KV 块)+ §2.195 AI Agent 基础设施 115 → 116 件套候选新增 ReCache(★★ 中档预备 · TTFT 3.655× + KV 内存 -92.43% + Inv-F1 82.3% vs 82.4% 基线)+ §3.1 共识 #236 "工具增强型 LLM Agent 工具 schema 重复编码 KV 缓存复用 = 资源级注意力 + 组合不变 KV 块 = TTFT 3.655× + KV 内存 -92.43% 共识候选新增"(候选级 ★★ 中档预备)+ §3.3 Q269 "ReCache 完整 PDF §3-4 + Inv-F1 82.3% vs 82.4% 基线对比细节 + 资源级注意力实现 + 工具 schema 重复调用频次统计 PDF §5 验证截止 8-30" + §5 边界候选新增 1 条(→ llm-infra.md §IX 56 KV Cache 21 路线 → 22 路线 ReCache 候选新增预备)
- 建议归入节:v64 §1.4 评测方法学第 21 元组候选新增 · §2.195 AI Agent 基础设施 115 → 116 件套候选新增 · §3.1 共识 #236 候选新增 1 件 · §3.3 Q269 候选新增 1 件 · §5 边界候选新增 1 条 · 立标池双向锚 29 向 → 30 向并存预备候选实测
增量 6 · 🟢 File-First / Markdown Memory 架构范式迁移(8-25 19:50 evening supplement Substack 高价值条目 · Micheal Lanham · ⭐⭐⭐⭐ 可信度)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🟢 低优先级 · Micheal Lanham · "The Markdown Memory Paradigm in AI Agent Architectures")· 引用 OpenClaw / Manus / Claude Code - 要点:
- 核心论点 = 高可见度 Agent 栈(Manus、OpenClaw、Claude Code)正在从"向量数据库为主记忆"转向"文件系统为主记忆"
- File-First 架构:
- 文件系统作为持久化、可检查接口 · 状态和学习存储在文件系统 · 选择性 rehydrate 相关数据到 context window
- OpenClaw 的两级文件持久化 + 混合评分(0.7 向量权重 / 0.3 文本权重 + 30 天半衰期时序衰减)
- Claude Code 的
CLAUDE.md层级化指令文件体系 - 典型文件 =
todo.md(规划模块派生 · counter "lost-in-the-middle" 退化)
- 工程意义:
- 文件系统作为主记忆原语 vs 向量数据库 · 这对本地优先 / 隐私优先 Agent 设计有重要影响
- 可信度:⭐⭐⭐⭐(实践分析 · 引用 OpenClaw/Manus/Claude Code)
- j 工程链路校验:与 v63 §1.3 Memory 已立 22 栖 + flyp 8-25 0507 reliability-science + MemTrapBench + StateMemBench + ReFind + Mem0 五分类 + OpenClaw 本机工作环境实际使用经验 + Manus / Claude Code 公开架构分析 + v63 §1.5 治理第 47-49 栖 + jay 8-25 19:50 primitivesp "$5B 估值 + a16z D 轮 Temporal = durability execution 是 Agent 可靠性的核心基础设施" = "Agent 记忆架构范式迁移预备触发 = 从向量数据库主记忆向文件系统主记忆"
- arXiv 编号:无(Substack Micheal Lanham 文章 · 非论文)· 文档化补充预备 = File-First 架构作为 v64 §1.3 Memory 第 26 栖候选预备预备预备
- 与活文档关系:v63 §1.3 Memory 已立 22 栖;v64 接力棒若触发,应候选新增:§1.3 Memory 第 26 栖候选新增预备 = File-First 架构 = 从向量数据库主记忆向文件系统主记忆迁移(候选级 ★ 中档预备 · OpenClaw 两级文件持久化 + 混合评分 + Claude Code CLAUDE.md + Manus 实践)+ §3.1 共识 #237 "Agent 记忆架构范式迁移预备触发 = 从向量数据库主记忆向文件系统主记忆 = 对本地优先 / 隐私优先 Agent 设计有重要影响共识候选新增"(候选级 ★ 中档预备)+ §3.4 T185 "File-First 架构 = 文件系统作为主记忆原语 = 本地优先 + 隐私优先 Agent 设计趋势候选新增" + §5 边界候选新增 1 条(→ memory.md §2.x File-First 架构候选新增预备预备 · → engineering.md §2.x OpenClaw 文件持久化实现细节候选新增预备)
- 建议归入节:v64 §1.3 Memory 第 26 栖候选新增预备 · §3.1 共识 #237 候选新增 1 件 · §3.4 T185 候选新增 1 件 · §5 边界候选新增 1 条
增量 7 · 🟢 EgoCITE arXiv:2608.12627 — 长程自我中心记忆的上下文增强索引与时序检索(8-25 19:50 evening supplement 低优先级 · ⭐⭐⭐⭐ 可信度)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🟢 低优先级 · "https://arxiv.org/html/2608.12627v1")· 未在 HF Daily 8-25 15 件列表中出现 - 要点:
- arXiv:2608.12627 · Benchmark 数据(长期代理记忆):
- EgoCITE-GPT:62.6%(vs GPT-5.4 agent 51.6% · +11 分)
- EgoCITE-Qwen:60.9%(vs Gemini-3.1-Pro agent 58.7%)
- vs WorldMM-GPT 47.1% · VideoRAG 43.4% · A-Mem 42.2%
- 延迟/成本对比:
- EgoCITE-GPT 5 轮检索 = $0.110
- GPT-5.4 agent = $3.979
- 36 倍成本差
- 可信度:⭐⭐⭐⭐(arXiv · 含消融实验)
- arXiv 编号:
arXiv:2608.12627(jay 8-25 19:50 evening supplement)· paper_card 待补建 - 与活文档关系:v63 §1.3 Memory 已立 22 栖 + MemTrapBench + StateMemBench + ReFind 沿用预备;v64 接力棒若触发,应候选新增:§1.3 Memory 第 27 栖候选新增预备 = EgoCITE arXiv:2608.12627(候选级 ★ 中档预备 · 长程自我中心记忆 · 上下文增强索引 + 时序检索 · 5 轮检索 vs GPT-5.4 agent 36 倍成本差)+ §3.3 Q270 "EgoCITE 完整 PDF §3-4 + 5 轮检索 vs GPT-5.4 agent 36 倍成本差实现细节 + 长期代理记忆评测完整定义 PDF §5 验证截止 9-1"(⚠️ P1 警示)+ §5 边界候选新增 1 条(→ memory.md §2.x EgoCITE 候选新增预备 · → multimodal.md §2.x 视频 RAG EgoCITE 候选新增预备)
- 建议归入节:v64 §1.3 Memory 第 27 栖候选新增预备 · §3.3 Q270 候选新增 1 件 · §5 边界候选新增 1 条
增量 8 · 🔴 Compaction Cliff arXiv:2608.22752 — Claude Code /compact 压缩一轮后安全规则仅保留 53%,五轮后跌至 10%(8-25 20:40 tom 第三期 radar 高价值 #1 · ⭐⭐⭐⭐ 高危生产问题)
- 来源:
/shared/research-kb/inbox/tom/2026-08-25T2040-agent-rag-longcontext-radar.md(tom 8-25 20:40 CST · 第三期 radar 高价值 #1 · 注明"今日 radar 已覆盖;本次为下午档深度补充" + "去重:8-25 afternoon radar 5 件候选已收录" · 即 8-25 14:40 radar #1 已收录,本次为晚间档补充背景) - 要点:
- arXiv:2608.22752(2026-08-24)· 核心发现:
- Claude Code
/compact压缩一轮后安全规则仅保留 53% · 五轮后跌至 10% - 安全规则与情节日志争夺相同 token · 统一压缩率导致规则文本失效
- 命名 = Compaction Cliff(压实悬崖)
- Claude Code
- 修复方案 = Knowledge Triage 框架 = 按知识库条目类型分类 · 每类独立保留策略
- 三个确定性算子 = 三种内容类型不同处理路径
- 工程价值:
- 🔴 高危生产问题 · 直接影响长程 agent 安全边界 · 与 v63 §1.3 δ-mem + Metis + Inadvertent Context Leakage 第 21 栖 + flyp 8-25 0507 reliability-science memory scaffold + BASM Skill Imitation Trap + ReFind 零结构记忆形成"长程 Agent 安全边界 + 记忆压缩 + 失败模式 = 2026 H2 第四类反方证据群"
- 社区洞察 Substack = Context Rot = 2026 年长程 agent 的核心生产问题(learnaitogethernewsletter / Medium)
- 与 Compaction Cliff 论文高度互证 = 长上下文中模型对已有信息的使用能力本身退化,并非上下文窗口填满才出问题
- 解决方案 = Recursive Language Models (RLM) 范式 = 将任务分解到子 LLM 实例 · 用干净上下文分别处理再合成 · 可处理百万 token 级推理
- arXiv 编号:
arXiv:2608.22752(tom 8-25 20:40 radar #1)· paper_card 待补建 · tom 注明"今日 radar 已覆盖;本次为下午档深度补充" - 与活文档关系:v63 §1.3 Memory 已立 22 栖 + v63 §1.5 治理第 37 栖 推理引擎层安全 12h SLA 沿用;v64 接力棒若触发,应候选新增:§1.3 Memory 第 28 栖候选新增 = Compaction Cliff arXiv:2608.22752(候选级 ★★★ 高档预备 · Claude Code
/compact一轮后安全规则仅保留 53% · 五轮后跌至 10% · Knowledge Triage 修复 · 🔴 高危生产问题)+ §3.1 共识 #238 "Compaction Cliff = Claude Code/compact长程 Agent 安全规则 53% → 10% = 记忆压缩与安全规则冲突 = 长程 Agent 安全边界系统性挑战共识候选新增"(候选级 ★★★ 高档预备)+ §3.1 共识 #239 "Knowledge Triage = 按知识库条目类型分类 + 每类独立保留策略 = 长程 Agent 记忆压缩修复方案共识候选新增"(候选级 ★★ 中-高档预备)+ §3.1 共识 #240 "Recursive Language Models (RLM) 范式 = 子 LLM 实例 + 干净上下文 + 合成 = 长程 Agent 上下文腐烂修复方案共识候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q271 "Compaction Cliff 完整 PDF §3-4 + 20 个生产 agent 配置完整名单 + Claude Code/compact五轮压缩每轮安全规则保留率统计 + Knowledge Triage 三个确定性算子实现细节 PDF §5 验证截止 8-30" + §3.3 Q272 "Compaction Cliff 与 BASM Skill Imitation Trap + MemTrapBench Reasoning Fixation/Belief Distortion + ReFind 零结构记忆 + StateMemBench 状态追踪 关系 = 长程 Agent 安全边界 + 记忆压缩 + 失败模式 = 2026 H2 第四类反方证据群预备" + §3.4 T186 "Context Rot = 2026 年长程 Agent 核心生产问题趋势候选新增" + §3.4 T187 "Knowledge Triage + RLM 范式 = 长程 Agent 记忆压缩修复方案双栖预备" + §5 边界候选新增 2 条(→ memory.md §2.x Compaction Cliff + Knowledge Triage 候选新增预备 · → risk.md §2.13 hardening 第 60 维 Compaction Cliff 长程 Agent 安全边界预备) - 建议归入节:v64 §1.3 Memory 第 28 栖候选新增 · §3.1 共识 #238-#240 候选新增 3 件 · §3.3 Q271-Q272 候选新增 2 件 · §3.4 T186-T187 候选新增 2 件 · §5 边界候选新增 2 条 · 立标池双向锚 30 向 → 31 向并存预备候选实测
增量 9 · 🟡 Laws of Context Allocation arXiv:2608.23252 — 生成式搜索中因果测量 + leave-one-out probe 隔离生成依赖(8-25 20:40 tom 第三期 radar 高价值 #3 · RAG 评估方法论)
- 来源:
/shared/research-kb/inbox/tom/2026-08-25T2040-agent-rag-longcontext-radar.md(tom 8-25 20:40 CST · 第三期 radar 高价值 #3 · 注明"08-24 新发表 · 去重:08-24 新发表") - 要点:
- arXiv:2608.23252(2026-08-24)· 核心发现:
- "诊断幻觉" = 标准相关性代理在硬负例上完全失效
- 提出因果 leave-one-out probe 精确隔离生成依赖 · 校准 LLM 注意力的结构性稀释
- 部署于去混因子网格证明上下文预算分配最优解
- 工程价值:
- 🟡 中等 · RAG 评估方法论 · 对检索系统设计有直接指导
- 与 v63 关系:
- v63 §1.2 RAG-Agent 邻接级预备 Better Retrieval Worse Robustness arXiv:2608.22872(鲁棒性 vs 干净场景幻觉代价取舍判)· 两件 = RAG 评估方法学延革第 19-20 例预备预备 · 共同构成 RAG 评测因果方法学双稿预备
- arXiv 编号:
arXiv:2608.23252(tom 8-25 20:40 radar #3)· paper_card 待补建 - 与活文档关系:v63 §1.2 RAG 立基础延展 3 件套(EnSI-RAG + δ-mem + Human-Cic Intelligence)+ v63 §1.2 RAG-Agent 邻接 Better Retrieval Worse Robustness arXiv:2608.22872 + v63 §1.4 评测方法学延革第 18-19 例预备预备;v64 接力棒若触发,应候选新增:§1.2 RAG-Agent 邻接级第 2 件候选新增 = Laws of Context Allocation arXiv:2608.23252(候选级 ★★ 中-高档预备 · 诊断幻觉 · 因果 leave-one-out probe · 校准 LLM 注意力稀释)+ §1.4 评测方法学延革第 19 例预备预备触发 = 诊断幻觉 + 因果方法学 + RAG 评估方法论 · 与 v63 §1.2 RAG-Agent 邻接第 1 件 Better Retrieval Worse Robustness 形成"RAG 评估方法学双稿预备" · 评测方法学延革第 19-20 例预备预备预备预备预备+ §3.1 共识 #241 "RAG 评估方法学因果化 = 诊断幻觉 = 标准相关性代理硬负例失效 = 因果 leave-one-out probe 校准 = 上下文预算分配最优解共识候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q273 "Laws of Context Allocation 完整 PDF §3-4 + 因果 leave-one-out probe 实现 + 去混因子网格完整定义 + 硬负例失效完整分析 PDF §5 验证截止 8-30" + §3.3 Q274 "Laws of Context Allocation 与 Better Retrieval Worse Robustness 关系 = RAG 评估方法学双稿预备" + §5 边界候选新增 1 条(→ rag.md §2.x RAG 评估方法学因果化候选新增预备 · → evaluation.md §2.x Laws of Context Allocation 候选新增预备)
- 建议归入节:v64 §1.2 RAG-Agent 邻接级第 2 件候选新增 · §1.4 评测方法学延革第 19-20 例预备预备触发 · §3.1 共识 #241 候选新增 1 件 · §3.3 Q273-Q274 候选新增 2 件 · §5 边界候选新增 1 条
增量 10 · 🟡 LongWoF-Bench arXiv:2608.23200 — 778 台机器基准 · 评估 EvoMap(验证器确认的执行轨迹固化为结构化 Gene)(8-25 20:40 tom 第三期 radar 高价值 #2 · benchmark 新范式)
- 来源:
/shared/research-kb/inbox/tom/2026-08-25T2040-agent-rag-longcontext-radar.md(tom 8-25 20:40 CST · 第三期 radar 高价值 #2 · HF Daily 2026-08-23 · 注明"去重:08-23 HF daily 未出现") - 要点:
- arXiv:2608.23200(2026-08-23 · HF Daily)· 核心发现:
- 778 台机器基准 · 评估 EvoMap(验证器确认的执行轨迹固化为结构化 Gene)
- 解决长 workflow 执行经验无法跨次复用的问题 = 每次运行后模型须从头发现策略和失败模式 · EvoMap 将其外部化重用
- 工程价值:
- 🟡 中等 · benchmark 新范式 · 对 agent 工作流评测有参考意义
- 与 v63 关系:
- v63 §1.4 评测方法学延革第 15-19 例预备预备预备预备预备 · 与 c-CRAB · Self-Harness · HarnessOpt-Bench · ReliabilityBench · HORIZON · Task-CoEvolve 候选级中高预备 · 共同构成"agent 工作流评测范式延革系列 10+ 锚链"
- arXiv 编号:
arXiv:2608.23200(tom 8-25 20:40 radar #2)· paper_card 待补建 - 与活文档关系:v63 §1.4 评测方法学延革第 15-19 例预备预备预备预备预备;v64 接力棒若触发,应候选新增:§1.4 评测方法学延革第 20-21 例候选预备触发 = LongWoF-Bench arXiv:2608.23200 + EvoMap Gene 外部化重用(候选级 ★★ 中档预备 · 778 台机器基准 · 工作流执行经验跨次复用 · 与 c-CRAB · Self-Harness 形成"agent 工作流评测范式延革系列")+ §3.1 共识 #242 "LongWoF-Bench + EvoMap Gene = 长 workflow 执行经验外部化重用 = agent 工作流评测范式延革共识候选新增"(候选级 ★★ 中档预备)+ §3.3 Q275 "LongWoF-Bench 完整 PDF §3-4 + 778 台机器基准完整分布 + EvoMap Gene 验证器确认机制 + 778 台机器覆盖范围 PDF §5 验证截止 9-1" + §3.4 T188 "EvoMap Gene = 长 workflow 经验外部化 = 与 c-CRAB test-based review + Self-Harness weakness mining 形成 agent 工作流评测范式延革系列趋势候选新增" + §5 边界候选新增 1 条(→ evaluation.md §2.x LongWoF-Bench + EvoMap Gene 候选新增预备 · → coding-agents.md §2.7 长 workflow 经验外部化候选新增预备)
- 建议归入节:v64 §1.4 评测方法学延革第 20-21 例候选预备触发 · §3.1 共识 #242 候选新增 1 件 · §3.3 Q275 候选新增 1 件 · §3.4 T188 候选新增 1 件 · §5 边界候选新增 1 条
增量 11 · 🟡 QAH arXiv:2608.20953 — Quantization-Aware Healing 替代 QAT(8-25 20:40 tom 第三期 radar 高价值 #4 · 4-bit 部署必备 recipe)
- 来源:
/shared/research-kb/inbox/tom/2026-08-25T2040-agent-rag-longcontext-radar.md(tom 8-25 20:40 CST · 第三期 radar 高价值 #4 · HF Daily 2026-08-20 · 注明"去重:08-20 HF daily 未出现") - 要点:
- arXiv:2608.20953(2026-08-20 · HF Daily)· 核心发现:
- 结构压缩 + 4-bit 量化双重劣化后,QAT 收敛慢且峰值后崩溃
- QAH(Quantization-Aware Healing)替代方案 = 无需独立全精度预训练即可恢复推理、数学、编码和长上下文能力
- 工程价值:
- 🟡 中等 · 4-bit 部署必备 recipe
- 与 v63 关系:
- v63 §1.5 治理第 37 栖 推理引擎层安全 12h SLA + v63 §2.195 AI Agent 基础设施 115 件套 · 与 spark llm-infra-e1prep §IX 56 KV Cache 21 路线邻接级新增 4 件(ChunkKV + OBCache + LLM-AnDPro + HCAttention)沿用预备
- arXiv 编号:
arXiv:2608.20953(tom 8-25 20:40 radar #4)· paper_card 待补建 - 与活文档关系:v63 §2.195 AI Agent 基础设施 115 → 115 件套沿用;v64 接力棒若触发,应候选新增:§2.195 AI Agent 基础设施 115 → 116 件套候选新增 QAH(★★ 中档预备 · Quantization-Aware Healing · 4-bit 部署必备 recipe · 无需独立全精度预训练)+ §3.1 共识 #243 "QAH = 4-bit 部署必备 recipe = 无需独立全精度预训练 = 量化与压缩双栖协同共识候选新增"(候选级 ★★ 中档预备)+ §3.3 Q276 "QAH 完整 PDF §3-4 + 推理/数学/编码/长上下文能力恢复完整数据 PDF §5 验证截止 9-1" + §5 边界候选新增 1 条(→ llm-infra.md §IX 4-bit 部署必备 recipe 候选新增预备 · → coding-agents.md §2.4 量化修复候选新增预备)
- 建议归入节:v64 §2.195 AI Agent 基础设施 115 → 116 件套候选新增 · §3.1 共识 #243 候选新增 1 件 · §3.3 Q276 候选新增 1 件 · §5 边界候选新增 1 条
增量 12 · 🟢 MemGraphRAG arXiv:2606.00610 — KDD 2026 多跳 RAG 58.41%(8-25 19:50 evening supplement 中优先级 · KDD 2026 录用 · ⭐⭐⭐⭐⭐ 可信度)
- 来源:
/shared/research-kb/inbox/jay/2026-08-25-1950-evening-supplement.md(jay 8-25 19:50 CST · 🟡 中优先级 · KDD 2026 录用 · arXiv:2606.00610) - 要点:
- arXiv:2606.00610(KDD 2026 录用)· 核心数据:
- MuSiQue 数据集:
- Vanilla RAG(Top-5) = 30.15%
- MemGraphRAG = 58.41%
- HippoRAG2 = 55.41%
- LightRAG = 47.81%
- 多跳推理任务上优势最显著
- arXiv 编号:
arXiv:2606.00610(jay 8-25 19:50 evening supplement · KDD 2026 录用) - 与活文档关系:v63 §1.2 RAG 已立 Agentic RAG 替代 RAG 范式辨析 + KDD 2026 RAG 专场 5 件 + v62 三件套(EnSI-RAG + δ-mem + Human-Cic Intelligence)+ v63 §1.2 RAG-Agent 邻接级预备 Better Retrieval Worse Robustness + v63 §1.2 RAG 立基础延展 3 件套增 3 件 = EnSI-RAG + δ-mem + Human-Cic Intelligence 8-25 12:45 noon 棒位 3 栖齐备 + 检索单元从 chunk 向 entity 迁移 + RAG-ASR 级联 arXiv:2608.22872 反直觉发现 · ⚠️ paper_card 1067 Human-Cic Intelligence 主分类 engineering vs rag 双口径冲突沿用预备;v64 接力棒若触发,应候选新增:§1.2 RAG 第 5 栖候选新增 = MemGraphRAG arXiv:2606.00610(候选级 ★★ 中-高档预备 · KDD 2026 · MuSiQue 多跳 58.41% vs HippoRAG2 55.41% vs LightRAG 47.81% vs Vanilla RAG 30.15%)+ §3.1 共识 #244 "MemGraphRAG 多跳 RAG 58.41% vs HippoRAG2 55.41% vs LightRAG 47.81% vs Vanilla RAG 30.15% = KDD 2026 多跳 RAG SOTA 共识候选新增"(候选级 ★★ 中-高档预备)+ §3.3 Q277 "MemGraphRAG 完整 PDF §3-4 + 5 大数据集完整列表 + 记忆驱动图结构 + 多 Agent 协作实现细节 PDF §5 验证截止 8-30" + §5 边界候选新增 1 条(→ rag.md §2.222 MemGraphRAG KDD 2026 候选新增预备 · → engineering.md §2.x 记忆驱动图结构候选新增预备)
- 建议归入节:v64 §1.2 RAG 第 5 栖候选新增 · §3.1 共识 #244 候选新增 1 件 · §3.3 Q277 候选新增 1 件 · §5 边界候选新增 1 条
二、矛盾或待核实说法(3 件 · P0/P1 警示沿用 + 本轮新增核验节点)
矛盾 1 · 🟡 ReFind arXiv:2608.12888 vs ReCache arXiv:2608.19662 vs StateMemBench arXiv:2608.19652 编号一字之差风险 + MemGraphRAG arXiv:2606.00610 主分类冲突预备
- 来源:jay 8-25 19:50 evening supplement 中三条编号极相近:
arXiv:2608.12888ReFind(零结构记忆系统)arXiv:2608.19652StateMemBench(状态追踪)arXiv:2608.19662ReCache(资源级注意力 KV 缓存)- 核心矛盾:编号 2608.19652 / 2608.19662 仅一字之差(末两位 52 vs 62),容易抄写错误导致混淆 · 同样 arXiv:2608.12888 与 2608.23252 / 2608.22752 / 2608.23200 等 8 月底论文容易混淆 · paper_card 库(8-25 16:30 净增 8 张 1069-1076)未建任何一件
- 🟡 待核实节点:
- (a) ReFind arXiv:2608.12888 完整 PDF §3-4 + 4 个聊天原生控制(session-aware/context-preserving/temporal/deduplicated)实现细节 + 6 基准 2800 题来源 PDF §5 验证;
- (b) StateMemBench arXiv:2608.19652 完整 PDF §3-4 + 234 个多会话场景会话长度 regime 分布 + 闭环评分完整定义 + gold + drift 渲染前计算实现细节;
- (c) ReCache arXiv:2608.19662 完整 PDF §3-4 + Inv-F1 82.3% vs 82.4% 基线对比细节 + 资源级注意力实现 + 工具 schema 重复调用频次统计;
- (d) MemGraphRAG arXiv:2606.00610 主分类确认(rag vs agent 双栖);
- (e) MemGraphRAG arXiv:2606.00610 与 v63 §1.2 RAG-Agent 邻接级预备 Better Retrieval Worse Robustness + v63 §1.2 RAG 立基础延展 3 件套(EnSI-RAG + δ-mem + Human-Cic Intelligence)关系
- 可能后果:若编号错误会连带 v64 §1.3 Memory 第 23-25 栖候选新增 + §1.2 RAG-Agent 邻接级 + §1.4 评测方法学延革第 18-19 例预备预备的判定
- 建议沿用 P1 警示截止:8-25 evening 棒前(沿用 v63 §3.3 Q261-Q264 + Q269-Q270 + Q273-Q277)
矛盾 2 · 🟡 41 种 Agent 失败模式分类学 arXiv:2607.28802 Cohen's κ=0.76 校准 + 41 种失败完整列表 = P1 警示 #19 沿用(本轮同样适用)
- 来源:jay 8-25 0600 X 硬核干货雷达干货候选 + jay 8-25 1053 engineering-filter + jay 8-25 1120 engineering-e1prep §增量 3 + stephen 8-25 1245 noon 协调棒 §3.1 ★★ 候选预备 6 号 Self-Harness 沿用 + spark 8-25 13:34 agent-e1prep "25 向"沿用
- 核心矛盾:41 种失败模式六节点归因 Cohen's kappa 0.76 校准区间 substantial agreement(0.61-0.80) = 分类体系基本可用但并非完美 · 实际应用中需根据具体场景调整 · 论文来源标注为 @omarsar0 Threads + arXiv:2607.28802 = 来源是否完全可靠待 PDF 核验
- 🟡 待核实节点:
- (a) 41 种失败完整列表 PDF §3 验证;
- (b) Cohen's kappa 0.76 数字独立核验 + 41 种失败六节点归因是否完整;
- (c) 5-30× 成本波动根因具体 harness 设计缺陷类型与频次统计 PDF §5 验证;
- (d) @omarsar0 Threads @omarsar0/post/Dblym5tAR-Z 链接是否可访问
- 可能后果:若 Cohen's kappa 数字不准确,会连带 v64 §1.4 评测方法学 19 → 20 元组候选新增 + §3.1 共识 #216 "41 种 Agent 失败模式分类学" + §3.3 Q256(已立 v63 §3.3 Q256)候选新增的判定 + 评测方法学延革第 18 例实测预备触发
- 建议沿用 P1 警示截止:8-25 evening 棒前(沿用 v63 §3.3 Q256 已立)
矛盾 3 · 🟡 MemTrapBench arXiv:2608.20202 与 v62 Mem0 五分类框架(episodic/semantic/procedural/working/long-term)矛盾预备
- 来源:jay 8-25 19:50 evening supplement 红高优先级 #1 MemTrapBench 5 个主流长期记忆框架全跌破基线 + jay 8-25 21:05 五分类简报 Reproduction 分类 Mem0 五分类框架(episodic/semantic/procedural/working/long-term)+ v63 §1.3 Memory 已立 22 栖沿用 + flyp 8-25 0507 reliability-science memory scaffold 普遍伤害 10 模型无一例外(v63 §3.2 争议 #143 已立)
- 核心矛盾:
- Mem0 五分类框架(episodic/semantic/procedural/working/long-term)是 2026 年 Agent Memory 生产共识(v63 §1.3 Metis arXiv:2607.26760 paper_card 658 8-25 入库 · jay 8-25 21:05 Reproduction #1)
- MemTrapBench arXiv:2608.20202 直接反方证据 = 5 个主流长期记忆框架(其中包含 Mem0 家族)在 MemTrapBench 上的表现全部低于无记忆基线
- 两件 = Mem0 五分类框架 vs MemTrapBench 反方证据 = 记忆系统评价方向重大矛盾预备
- 🟡 待核实节点:
- (a) MemTrapBench 是否覆盖 Mem0 完整家族?Mem0.ai 官方是否对 MemTrapBench 论文有回应?
- (b) v63 §1.3 Memory 第 23 栖 MemTrapBench 是否应升级为预备候选?
- (c) v63 §3.2 争议 #143 memory scaffold 普遍伤害 10 模型无一例外 与 MemTrapBench 5 个主流框架跌破基线 是否应合并为"2026 H2 记忆系统反方证据群"?
- (d) Mem0 五分类框架(episodic/semantic/procedural/working/long-term)在 MemTrapBench 上是否同样跌破基线?
- 可能后果:若矛盾未能调和,会连带 v64 §1.3 Memory 第 23 栖候选新增 + §3.1 共识 #230 "记忆系统非天然提升" + §3.2 争议 #105 候选新增的判定
- 建议沿用 P1 警示截止:8-25 evening 棒前
三、可引用的 arXiv 编号列表
本轮 8-25 18:00 → 21:10 CST 窗口(≈3h)新增 11 件 arXiv 可引用编号(全部 paper_card 待补建,⚠️ 标注意味 P1 待核):
- arXiv:2608.20202 MemTrapBench(jay 8-25 19:50 · HF Daily 8-25 31▲ #7 · ⭐⭐⭐⭐⭐ · 5 个主流长期记忆框架跌破基线 · Reasoning Fixation + Belief Distortion · AdaptiveMem 修复)
- arXiv:2608.19652 StateMemBench(jay 8-25 19:50 · ⭐⭐⭐⭐ · 234 个多会话场景两个会话长度 regime · 闭环评分 · gold + drift 渲染前计算 · ⚠️ 与 ReCache 2608.19662 一字之差必须严格区分)
- arXiv:2608.22339 BASM(jay 8-25 19:50 · EMNLP 2026 Findings · ⭐⭐⭐⭐⭐ · Skill Imitation Trap · Proc. Skill BFCL 跌破 Base · AppWorld +23.8% / BFCL +5.0% / AgentDojo -4.6% / AppWorld 步数 -6.6%)
- arXiv:2608.12888 ReFind(jay 8-25 19:50 · ⭐⭐⭐⭐ · 零结构记忆系统 · 迭代词法搜索 · 6 基准 2800 题 · 平均 58.2 vs HippoRAG2 53.2)
- arXiv:2608.19662 ReCache(jay 8-25 19:50 · spark 8-25 18:43 §IX 57 沿用 · ⭐⭐⭐⭐ · TTFT 3.655× · KV 内存 -92.43% · Inv-F1 82.3% vs 82.4% 基线 · ⚠️ 与 StateMemBench 2608.19652 一字之差必须严格区分)
- arXiv:2608.12627 EgoCITE(jay 8-25 19:50 · ⭐⭐⭐⭐ · 长程自我中心记忆 · 5 轮检索 vs GPT-5.4 agent 36 倍成本差)
- arXiv:2608.22752 Compaction Cliff(tom 8-25 20:40 · ⭐⭐⭐⭐ · 🔴 高危生产问题 · Claude Code /compact 一轮后安全规则仅保留 53% · 五轮后跌至 10% · Knowledge Triage 修复)
- arXiv:2608.23200 LongWoF-Bench(tom 8-25 20:40 · ⭐⭐⭐⭐ · 778 台机器基准 · EvoMap Gene 外部化重用)
- arXiv:2608.23252 Laws of Context Allocation(tom 8-25 20:40 · ⭐⭐⭐⭐ · 诊断幻觉 · 因果 leave-one-out probe · 校准 LLM 注意力稀释)
- arXiv:2608.20953 QAH(tom 8-25 20:40 · ⭐⭐⭐⭐ · Quantization-Aware Healing · 4-bit 部署必备 recipe)
- arXiv:2606.00610 MemGraphRAG(jay 8-25 19:50 · KDD 2026 录用 · ⭐⭐⭐⭐⭐ · MuSiQue 多跳 58.41% vs HippoRAG2 55.41% vs LightRAG 47.81% vs Vanilla RAG 30.15%)
v63 已沿用 arXiv 完整集合(633 件 · 沿用本轮不重复列出): - v63 §3.1 共识 14 条候选新增 = #216-#229(沿用不增量) - v63 §3.2 争议 2 条候选新增 = #103 RAG-ASR 级联结构 + #104 paper_card 1067 主分类(沿用不增量) - v63 §3.3 开放问题 5 条候选新增 = Q256-#260(沿用不增量) - v63 §3.4 趋势 + P0 警示 = v62-v63 P0-38~P0-41 4 件 + 7 件 P0 沿用(沿用不增量) - v63 §6 76-81 条工程落地框架 6 件 net-new(沿用不增量) - v63 §2.39.x 候补级新增 1 件 net-new 备料 #55 41 种失败模式分类学(沿用不增量) - v63 §2.195 AI Agent 基础设施 115 → 115 件套沿用 + 1 件备料沿用(沿用不增量) - v63 §2.207 评测方法学元组 19 → 20 元组候选新增(沿用不增量) - v63 §1.1 立基础延展二阶 #98-#102 5 件 + §1.5 治理第 47-49 栖 3 栖 + §1.6 Mobile Planner Agent 主轴预备 3 件 + §1.2 RAG-Agent 邻接级预备 1 件 + §1.6 Agent 评测生态动态补充 1 件(沿用不增量) - v63 §3.1 共识 #216-#229 14 条候选新增(沿用不增量)
paper_cards 8-25 净增 19 张(1058-1076)已沿用(本轮新增可见): - 8-25 14:10 净增 11 张(1058-1068):EnSI-RAG 1058 / AID-Guard 1059 / Dis2Pat 1060 / SpecPort 1061 / PhysCaP 1062 / PV-SST 1063 / FlavourBench 1064 / SparsePR 1065 / Hydra-0 1066 / Human-Cic Intelligence 1067 / UniSpace 1068(主分类批量核对结果沿用 v63 §6 79) - 8-25 16:30 净增 8 张(1069-1076):MobilePA-Bench 1069(主分类 evaluation · 副分类 agent)· Task-CoEvolve 1070(主分类 evaluation)· Better Retrieval Worse Robustness 1071(主分类 rag · 副分类 multimodal)· One Polluted Page 1072(主分类 rag · 副分类 evaluation)· GameXpert-Bench 1073(主分类 agent · 副分类 evaluation)· Block3D 1074(主分类 multimodal)· Unlocking Image Editing 1075(主分类 multimodal · 副分类 engineering)· ARC 1076(主分类 agent) - paper_cards 总数 1078(8-25 16:30 落定)· v63 §6 79 沿用主分类批量核对结果 + 1078 件总数未含本轮 11 件 arXiv 新增量
⚠️ paper_card 待补建(8-25 evening 棒前 P1 必建): - arXiv:2608.20202 MemTrapBench · arXiv:2608.19652 StateMemBench(⚠️ 编号一字之差)· arXiv:2608.22339 BASM · arXiv:2608.12888 ReFind · arXiv:2608.19662 ReCache(⚠️ 编号一字之差)· arXiv:2608.12627 EgoCITE · arXiv:2608.22752 Compaction Cliff · arXiv:2608.23200 LongWoF-Bench · arXiv:2608.23252 Laws of Context Allocation · arXiv:2608.20953 QAH · arXiv:2606.00610 MemGraphRAG · 沿用 v63 §3.3 Q261-Q277 13 件 P1 警示待核
四、本轮无显著新增量的说明
本轮 8-25 18:00 → 21:10 CST(≈3h)窗口的实质性 net-new 增量中等(v63 已吸纳 8-25 18:00 evening 棒前几乎全部 llm-application 主轴信号),主要因为:
① v63 已强制吸纳 8-25 morning 棒 + noon 棒 + 18:00 evening 棒前 llm-application 主轴信号(立基础延展二阶 5 件触发 + HarnessEval-W 19→20 元组 + 治理第 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 + RAG-Agent 邻接级预备 + Agent 评测生态动态补充 + 15 件 net-new arXiv / 0 CVE / 3 URL 633 累计)· 本轮增量为"v63 已吸纳备料的二次深化 + Agent Memory 失败模式实证 + RAG 评测方法学延革预备 + File-First 架构范式迁移" 而非"新立基础延展候选";
② v63 §1.3 Memory 沿用 v62 22 栖 + Metis 不增量 = 本轮核心触发点 = jay 8-25 19:50 evening supplement 7 件 + tom 8-25 20:40 4 件 = 11 件候选新增 Memory 第 23-28 栖 / RAG 第 5 栖 / §1.4 评测方法学第 19-21 元组 / §2.195 第 116 件套 = Memory 主题 8-25 evening 棒位沿用触发的最大候选新增棒位;
③ v63 §1.1 立基础延展二阶 #98-#102 已立 5 件(41 种失败模式分类学 + 异步协调编码 Agent + Microsoft post-training harness + ExtractBench + Async Coding Agent 范式)· 本轮候选新增 = §1.1 #103 BASM(Skill Imitation Trap · Proc. Skill BFCL 跌破 Base · EMNLP 2026 Findings · 4 个数字完备)· 本轮候选新增 1 件 = 立基础延展二阶 5 件 → 6 件扩位预备;
④ v63 §1.5 治理第 47-49 栖已立 3 栖(Datadog State of AI Engineering + awesome-harness-engineering + AgentDebug UIUC)· 本轮候选新增 = §1.5 治理第 50 栖预备 = Compaction Cliff(Claude Code /compact 一轮后安全规则仅保留 53% · 五轮后跌至 10% · 🔴 高危生产问题 · Knowledge Triage 修复)= 治理第 47-49 栖 → 50 栖扩位预备;
⑤ v63 §1.6 Mobile Planner Agent 主轴预备 3 件已立(MobilePA-Bench 24 votes + ARC 11 votes + GameXpert-Bench 5 votes)· 本轮无新增 §1.6 件 = Mobile Planner Agent 主轴预备已完整覆盖;
⑥ v63 §1.2 RAG-Agent 邻接级预备 1 件已立(Better Retrieval Worse Robustness arXiv:2608.22872)· 本轮候选新增 = §1.2 RAG-Agent 邻接级第 2 件 = Laws of Context Allocation arXiv:2608.23252(诊断幻觉 · 因果 leave-one-out probe · 校准 LLM 注意力稀释)= §1.2 RAG-Agent 邻接级预备 1 件 → 2 件扩位预备 + §1.2 RAG 第 5 栖候选新增 MemGraphRAG arXiv:2606.00610 KDD 2026 多跳 58.41% = §1.2 RAG 立基础延展 3 件套 → 4 件套扩位预备;
⑦ v63 §2.195 AI Agent 基础设施 115 → 115 件套沿用 + 1 件备料沿用(41 种失败模式分类学)· 本轮候选新增 = §2.195 第 116 件套 QAH arXiv:2608.20953(Quantization-Aware Healing · 4-bit 部署必备 recipe · 无需独立全精度预训练)· §2.195 第 115 件套 → 116 件套扩位预备;
⑧ v63 §2.207 评测方法学元组 19 → 20 元组候选新增(41 种失败模式分类学六节点归因新分支)沿用 · 本轮候选新增 = §2.207 第 21 元组候选预备 = 工具增强型 LLM Agent KV 缓存复用与压缩效率评测(ReCache 资源级注意力 + 组合不变 KV 块) · §2.207 20 元组 → 21 元组扩位预备 + §1.4 评测方法学延革第 19-21 例预备预备预备触发;
⑨ work-queue.md §1 高价值待深度解读 4 件沿用(2606.13610 + 2608.22872 + 2608.20169 + 2608.23035 · 本轮均已在 v63 沿用 = Better Retrieval Worse Robustness arXiv:2608.22872 + Task-CoEvolve arXiv:2608.20169 + MobilePA-Bench arXiv:2608.23035 已立标 · One Polluted Page arXiv:2606.13610 paper_card 1072 8-25 16:30 入库 = 主分类 rag · 副分类 evaluation)· 本轮无新增 work-queue 高价值待深度解读件;
⑩ work-queue.md §3 选题榜未成视频脚本 3 件沿用(2608.20281 + 2608.19854 + 2608.01964)· 本轮无新增选题;
⑪ paper_cards 库 8-25 16:30 净增 8 张(1069-1076)全部已建(本轮新增可见 · 主分类已批量核对)· paper_cards 8 件套与 v63 §6 79 工程落地框架对应完备 · 本轮无新增 paper_card 落盘 = 本轮 11 件 arXiv 候选新增全部 paper_card 待建;
⑫ flyp 8-25 coding-agents-e1prep + risk-e1prep 已实质触发 v62 coding-agents + v62 risk 接力棒备料(11 件 v62/v63 候选预备清单沿用)· 本轮无新增件套;
⑬ jay 8-25 19:50 evening supplement + jay 8-25 21:05 五分类简报 已实质触发数据库 / 后端 / 云原生 / CSDN / Reproduction 五分类预备(jay 8-25 21:05)· 与 llm-application 主轴交叉的 = ReFind arXiv:2608.12888 + LongMemEval-V2 arXiv:2605.12493 + Mem0 五分类框架 + EgoCITE arXiv:2608.12627 = 4 件;
⑭ tom 8-25 20:40 agent-rag-longcontext 第三期 radar 4 件高价值(Compaction Cliff 2608.22752 + LongWoF-Bench 2608.23200 + Laws of Context Allocation 2608.23252 + QAH 2608.20953)+ 4 件候选(AutoResearch 2608.06312 · TianoForge 2608.22741 · User Behavioral Densing Law · EXPL-FR)+ 1 件社区洞察(Context Rot · learnaitogethernewsletter / Medium · Compaction Cliff 高度互证 · Recursive Language Models 范式)· 本轮核心增量全部为 evening 棒位第三期 radar 新增;
⑮ 本窗口内 8-25 18:00 → 21:10 Stephen 无新 evening 棒位 llm-application 文件落盘(Stephen cron 21:10 E1 prep 当前棒位触发点 · llm-application.md v63 沿用 8-25 18:00 evening 棒位落定)· 本棒 E1 prep 触发后 v63 → v64 接力棒预备触发 = 7 件实质性 net-new 增量 + 3 件矛盾或待核实说法 + 11 件 arXiv 可引用编号 + 1 件 File-First 架构范式迁移预备.
五、本轮归入建议总结
今晚 v63 → v64 接力棒(若 spark cron 强制触发或 spark 反思棒沿用触发)候选新增清单:
§1.1 立基础延展二阶候选新增(v64)
-
103 BASM arXiv:2608.22339(候选级 ★★ 中-高档预备 · Skill Imitation Trap · Proc. Skill BFCL 跌破 Base · EMNLP 2026 Findings · 4 个数字完备)
§1.2 RAG 候选新增(v64)
- 第 5 栖 MemGraphRAG arXiv:2606.00610(候选级 ★★ 中-高档预备 · KDD 2026 · MuSiQue 多跳 58.41% vs HippoRAG2 55.41%)
- RAG-Agent 邻接级第 2 件 Laws of Context Allocation arXiv:2608.23252(候选级 ★★ 中-高档预备 · 诊断幻觉 · 因果 leave-one-out probe)
§1.3 Memory 候选新增(v64)
- 第 23 栖 MemTrapBench arXiv:2608.20202(候选级 ★★★ 高档预备 · 5 个主流长期记忆框架跌破基线 · Reasoning Fixation + Belief Distortion · AdaptiveMem 修复 · 31▲ HF Daily #7)
- 第 24 栖 StateMemBench arXiv:2608.19652(候选级 ★★ 中-高档预备 · 234 个多会话场景 · 闭环评分 · gold + drift 渲染前计算)
- 第 25 栖 ReFind arXiv:2608.12888(候选级 ★★ 中-高档预备 · 零结构记忆系统 · 6 基准 2800 题 · 平均 58.2 vs HippoRAG2 53.2)
- 第 26 栖候选预备 = File-First / Markdown Memory 架构范式迁移(候选级 ★ 中档预备 · OpenClaw 两级文件持久化 · Claude Code CLAUDE.md · Manus 实践 · 非论文 · 文档化补充预备)
- 第 27 栖候选预备 = EgoCITE arXiv:2608.12627(候选级 ★ 中档预备 · 长程自我中心记忆 · 5 轮检索 vs GPT-5.4 agent 36 倍成本差)
- 第 28 栖 Compaction Cliff arXiv:2608.22752(候选级 ★★★ 高档预备 · Claude Code
/compact一轮后安全规则仅保留 53% · 五轮后跌至 10% · Knowledge Triage 修复 · 🔴 高危生产问题)
§1.4 评测方法学候选新增(v64)
- 第 21 元组候选新增 = 工具增强型 LLM Agent KV 缓存复用与压缩效率评测(ReCache 资源级注意力 + 组合不变 KV 块)
- 评测方法学延革第 19-20 例预备预备触发 = Laws of Context Allocation + Better Retrieval Worse Robustness 共同构成 RAG 评估方法学双稿预备
- 评测方法学延革第 20-21 例候选预备触发 = LongWoF-Bench + EvoMap Gene 外部化重用
§1.5 治理候选新增(v64)
- 第 50 栖预备 = Compaction Cliff arXiv:2608.22752(🔴 高危生产问题 · 长程 Agent 安全边界预备)
§1.6 候选新增(v64)
- 无新增(§1.6 Mobile Planner Agent 主轴预备 3 件 v63 已完整覆盖)
§2.39.x 候补级新增候选区(v64 增 3-5 件 + 沿用 v63 13 件备料)
v63 已立 28 件候补级新增候选 + v63 13 件 net-new 备料 #42-#55(41 种失败模式分类学 #55)。v64 候补级新增 4 件 net-new 备料:
- #56 MemTrapBench arXiv:2608.20202(★★★ 高档 · 5 个主流长期记忆框架跌破基线 · Reasoning Fixation + Belief Distortion · HF Daily 31▲)
- #57 Compaction Cliff arXiv:2608.22752(★★★ 高档 · Claude Code /compact 53% → 10% · Knowledge Triage · 🔴 高危生产问题)
- #58 BASM arXiv:2608.22339(★★ 中-高档 · Skill Imitation Trap · EMNLP 2026 Findings · 4 个数字完备)
- #59 ReFind arXiv:2608.12888(★★ 中-高档 · 零结构记忆系统 · 6 基准 2800 题 · 平均 58.2 vs HippoRAG2 53.2)
§2.195 AI Agent 基础设施 115 → 116 件套候选新增(v64 增 1 件 + 沿用 v63 115 件)
v63 已立 115 件。v64 §2.195 第 116 件套候选新增 = QAH arXiv:2608.20953(★★ 中档预备 · Quantization-Aware Healing · 4-bit 部署必备 recipe · 无需独立全精度预训练)。
§2.207 评测方法学元组(v64 增 1 元组候选)
v63 已立 20 元组。v64 §2.207 20 → 21 元组候选新增 = 工具增强型 LLM Agent KV 缓存复用与压缩效率评测(ReCache 资源级注意力 + 组合不变 KV 块 · TTFT 3.655× + KV 内存 -92.43% + Inv-F1 82.3% vs 82.4% 基线 · paper_card 待建)。
3. 共识与争议
3.1 共识
v53-v63 = 48+10 = 58 条共识 + v63 新增 #216-#229 (14 条) + v64 候选新增 12 条共识预备:
- #230 记忆系统非天然提升 Agent 性能 = 跨学科跨厂商跨基准的 2026 H2 最大反方证据群 = 记忆框架选型必须测当前任务性能而非仅记忆检索指标共识候选新增(★★★ 高档预备)
- #231 Reasoning Fixation + Belief Distortion = 记忆诱发的认知陷阱 = 跨厂商一致的两类失败模式共识候选新增(★★ 中-高档预备)
- #232 状态追踪能力 = 记忆系统第二个核心维度 = 必须独立于 recall-shaped 任务评测共识候选新增(★★ 中-高档预备)
- #233 Skill Imitation Trap = 程序化记忆单独使用时在 BFCL 上跌破 Base = 技能设计必须状态条件化共识候选新增(★★ 中-高档预备)
- #234 BASM 边界字段显式化 = harness 设计从'无条件动作模板'向'状态条件化指导'迁移共识候选新增(★★ 中-高档预备)
- #235 零结构 + 迭代词法搜索 + 会话感知 + 时序 + 去重 即可 top leaderboard = 记忆系统选型降权'结构复杂度',权重'迭代词法搜索'共识候选新增(★★ 中-高档预备)
- #236 工具增强型 LLM Agent 工具 schema 重复编码 KV 缓存复用 = 资源级注意力 + 组合不变 KV 块 = TTFT 3.655× + KV 内存 -92.43% 共识候选新增(★★ 中档预备)
- #237 Agent 记忆架构范式迁移预备触发 = 从向量数据库主记忆向文件系统主记忆 = 对本地优先 / 隐私优先 Agent 设计有重要影响共识候选新增(★ 中档预备)
- #238 Compaction Cliff = Claude Code
/compact长程 Agent 安全规则 53% → 10% = 记忆压缩与安全规则冲突 = 长程 Agent 安全边界系统性挑战共识候选新增(★★★ 高档预备) - #239 Knowledge Triage = 按知识库条目类型分类 + 每类独立保留策略 = 长程 Agent 记忆压缩修复方案共识候选新增(★★ 中-高档预备)
- #240 Recursive Language Models (RLM) 范式 = 子 LLM 实例 + 干净上下文 + 合成 = 长程 Agent 上下文腐烂修复方案共识候选新增(★★ 中-高档预备)
- #241 RAG 评估方法学因果化 = 诊断幻觉 = 标准相关性代理硬负例失效 = 因果 leave-one-out probe 校准 = 上下文预算分配最优解共识候选新增(★★ 中-高档预备)
- #242 LongWoF-Bench + EvoMap Gene = 长 workflow 执行经验外部化重用 = agent 工作流评测范式延革共识候选新增(★★ 中档预备)
- #243 QAH = 4-bit 部署必备 recipe = 无需独立全精度预训练 = 量化与压缩双栖协同共识候选新增(★★ 中档预备)
- #244 MemGraphRAG 多跳 RAG 58.41% vs HippoRAG2 55.41% vs LightRAG 47.81% vs Vanilla RAG 30.15% = KDD 2026 多跳 RAG SOTA 共识候选新增(★★ 中-高档预备)
3.2 争议
1-104. 沿用 v60-v63 全部 104 条争议。
105-107. v64 新增 3 条:
-
是否所有记忆框架都不可信?AdaptiveMem 修复方案是否可推广?vs 简单词法搜索(ReFind)vs 结构化记忆(HippoRAG)选型争议候选新增:MemTrapBench arXiv:2608.20202 5 个主流长期记忆框架跌破基线 + AdaptiveMem 推理时提示方法 = 是否预示记忆框架设计范式迁移?vs 零结构记忆系统 ReFind vs 结构化记忆 HippoRAG2 选型判 = v64 接力棒独立判定 v64 §1.3 Memory 第 23 栖候选新增是否升级为预备 + 候选级 ★★ 中-高档 + 跨实例 3 源 ✓(jay 8-25 19:50 evening supplement + jay 8-25 21:05 五分类简报 + spark 8-25 13:34 agent-e1prep "25 向"列表)。
-
ReFind vs HippoRAG2 +5.0 绝对 vs MemTrapBench 跌破基线 vs ReFind RAG 多跳 -13 vs BM25-RAG 多跳 +13 = 记忆系统选型决策争议候选新增:ReFind arXiv:2608.12888 零结构 + 迭代词法搜索 6 基准 2800 题 GPT-4o-mini 平均 58.2 vs HippoRAG2 53.2 + MemTrapBench 5 个主流长期记忆框架跌破基线 + BM25-RAG 多跳 56 vs ReFind 多跳 69 + v63 §3.2 争议 #143 "memory scaffold 普遍伤害 10 模型无一例外" = v64 接力棒独立判定 §1.3 Memory 第 25 栖 ReFind 候选新增是否升级为预备 + 候选级 ★★ 中-高档 + 跨实例 2 源 ✓(jay 8-25 19:50 evening supplement + jay 8-25 21:05 五分类简报 Reproduction #1 Mem0 五分类)。
-
Mem0 五分类框架 vs MemTrapBench 反方证据群矛盾争议候选新增:Mem0 五分类框架(episodic/semantic/procedural/working/long-term)是 2026 年 Agent Memory 生产共识 + MemTrapBench arXiv:2608.20202 直接反方证据 = 5 个主流长期记忆框架(其中包含 Mem0 家族)全部跌破基线 = 两件 = Mem0 五分类框架 vs MemTrapBench 反方证据 = 记忆系统评价方向重大矛盾预备 = v64 接力棒独立判定 §1.3 Memory 第 23 栖 MemTrapBench 是否升级为预备 + 候选级 ★★ 中-高档 + 跨实例 3 源 ✓(jay 8-25 19:50 evening supplement #1 + jay 8-25 21:05 Reproduction #1 Mem0 + v63 §3.2 争议 #143 memory scaffold 普遍伤害 10 模型无一例外)。
4. 开放问题
1-260. 沿用 v60 + v61 + v62 + v63 全部 260 条开放问题。
261-277. v64 新增 17 条:
(261) MemTrapBench 完整 PDF §3-4 + AdaptiveMem 完整实现细节 + 5 个主流框架名单核实 + 10 个百分点跌幅具体数据 PDF §5 验证截止 8-30(⚠️ P1 警示)
(262) MemTrapBench 与 ReFind arXiv:2608.12888 + StateMemBench arXiv:2608.19652 + Mem0 五分类 + LongMemEval-V2 关系 = 跨基准跨厂商一致发现协调预备
(263) StateMemBench 完整 PDF §3-4 + 234 个多会话场景会话长度 regime 分布 + 闭环评分完整定义 + gold + drift 渲染前计算实现细节 PDF §5 验证截止 8-30(⚠️ P1 警示)
(264) StateMemBench 与 MemTrapBench + ReFind + Mem0 五分类 + LongMemEval-V2 关系 = 跨基准记忆系统失败模式完整图谱预备
(265) BASM 完整 PDF §3-4 + Proc. Skill 在 BFCL Qwen3-8B/14B 跌破 Base 完整数据 + 4 个数字(AppWorld/BFCL/AgentDojo/AppWorld 步数)PDF §5 验证截止 8-30
(266) BASM 与 41 种 Agent 失败模式分类学(六节点归因)+ 异步协调编码 Agent(centralized async isolated delegation)+ Microsoft post-training harness + ExtractBench + Async Coding Agent 范式 = harness 设计哲学六联预备
(267) ReFind 完整 PDF §3-4 + 4 个聊天原生控制(session-aware/context-preserving/temporal/deduplicated)实现细节 + 6 基准 2800 题来源 PDF §5 验证截止 8-30
(268) ReFind 与 MemTrapBench(跌破基线)+ StateMemBench(状态追踪)+ Mem0 五分类 + LongMemEval-V2 关系 = 跨基准跨厂商记忆系统失败模式完整图谱预备
(269) ReCache 完整 PDF §3-4 + Inv-F1 82.3% vs 82.4% 基线对比细节 + 资源级注意力实现 + 工具 schema 重复调用频次统计 PDF §5 验证截止 8-30
(270) EgoCITE 完整 PDF §3-4 + 5 轮检索 vs GPT-5.4 agent 36 倍成本差实现细节 + 长期代理记忆评测完整定义 PDF §5 验证截止 9-1(⚠️ P1 警示)
(271) Compaction Cliff 完整 PDF §3-4 + 20 个生产 agent 配置完整名单 + Claude Code /compact 五轮压缩每轮安全规则保留率统计 + Knowledge Triage 三个确定性算子实现细节 PDF §5 验证截止 8-30
(272) Compaction Cliff 与 BASM Skill Imitation Trap + MemTrapBench Reasoning Fixation/Belief Distortion + ReFind 零结构记忆 + StateMemBench 状态追踪 关系 = 长程 Agent 安全边界 + 记忆压缩 + 失败模式 = 2026 H2 第四类反方证据群预备
(273) Laws of Context Allocation 完整 PDF §3-4 + 因果 leave-one-out probe 实现 + 去混因子网格完整定义 + 硬负例失效完整分析 PDF §5 验证截止 8-30
(274) Laws of Context Allocation 与 Better Retrieval Worse Robustness 关系 = RAG 评估方法学双稿预备
(275) LongWoF-Bench 完整 PDF §3-4 + 778 台机器基准完整分布 + EvoMap Gene 验证器确认机制 + 778 台机器覆盖范围 PDF §5 验证截止 9-1
(276) QAH 完整 PDF §3-4 + 推理/数学/编码/长上下文能力恢复完整数据 PDF §5 验证截止 9-1
(277) MemGraphRAG 完整 PDF §3-4 + 5 大数据集完整列表 + 记忆驱动图结构 + 多 Agent 协作实现细节 PDF §5 验证截止 8-30
5. 趋势判断
5.1 已发生
v62 立标饱和度三态切换 → v63 立标池饱和度供给侧第 14 日延续 + EnvHarness 258▲ 历史新高 + 立标机制升级第 9 日稳态 + 立标延革第 15+16+17+18+19 例预备预备预备预备预备 + 立基础延展二阶 5 件触发 + 治理第 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 + RAG-Agent 邻接级预备 → v64 立标池延续 + 候选新增 MemTrapBench 31▲ HF Daily #7 + EnvHarness 258▲ #1 = 同期双强立标信号 + Memory 失败模式实证 + RAG 评估方法学延革预备 + File-First 架构范式迁移预备。
v62 四日 agent 主轴集中爆发 → v63 8-25 noon + evening 棒集中爆发延续 + 18 件 v60 + 13 件 v61 + 12 件 v62 + 16 件 v63 net-new arXiv = 评测延革系列 10 锚链完整分布 + HarnessEval-W 19→20 元组 + 41 种失败模式分类学 + §1.1 第 74-78 栖候选新增 + §1.5 治理 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 3 件 → v64 8-25 evening 棒(18:00 → 21:10)继续爆发 = 7 件 net-new 实质性增量 + 3 件矛盾或待核实说法 + 11 件 arXiv = 候选新增 Memory 第 23-28 栖 / RAG 第 5 栖 / §1.4 评测方法学第 21 元组 / §2.195 第 116 件套。
v62 立基础延展 14 栖 → v63 立基础延展深化第 18+19 例预备预备触发 + 立基础延展二阶 5 件 + Memory 沿用 22 栖 + 治理 49 栖 + 评测 20 元组 + §1.6 Mobile Planner Agent 3 件预备 = 2026 H2 立基础延展深化 + 16 件 net-new 备料 → v64 立基础延展深化第 19+20 例预备预备触发 + 立基础延展二阶 5 件 → 6 件扩位预备(BASM #103)+ Memory 22 栖 → 28 栖扩位预备(MemTrapBench/StateMemBench/ReFind/Compaction Cliff/EgoCITE/File-First)+ 治理 49 栖 → 50 栖扩位预备(Compaction Cliff) + 评测 20 元组 → 21 元组扩位预备(ReCache 工具增强型 KV 缓存评测)+ §2.195 第 115 件套 → 116 件套扩位预备(QAH) = 2026 H2 第四类反方证据群 + 立基础延展二阶 6 件 + 治理 50 栖 + 评测 21 元组。
5.2 进行中
v63 EnvHarness 258▲ + 立基础延展二阶 5 件触发 + MemTrapBench 31▲ #7 → v64 候选新增 = 2026 H2 第四类反方证据群触发 = MemTrapBench 5 个主流长期记忆框架跌破基线 + Reasoning Fixation + Belief Distortion + Compaction Cliff 53% → 10% + Knowledge Triage 修复方案 + Recursive Language Models (RLM) 范式 = 长程 Agent 安全边界 + 记忆压缩 + 失败模式 = 跨学科跨厂商跨基准的反方证据群爆发。
v63 AWS 40.1% / Docker 31% / K8s 29.1% / LangChain 18.8% / FDE 2026H1 增长 4 倍 + Datadog 5% 报错 / 60% rate limit / 840 万次 rate limit/月 第一方生产验证 → v64 File-First / Markdown Memory 架构范式迁移预备触发 = OpenClaw 两级文件持久化 + 0.7 向量权重 / 0.3 文本权重 + 30 天半衰期 + Claude Code CLAUDE.md 层级化指令文件 + Manus 实践 + primitivesp "$5B 估值 + a16z D 轮 Temporal" = 文件系统作为主记忆原语 vs 向量数据库 + 本地优先 + 隐私优先 Agent 设计有重要影响。
v63 Mem0 24M Series A / Temporal 5B 估值 / a16z 300M Series D / Braintrust 80M Series B / Anthropic 收购 Vercept → v64 Mem0 五分类框架(episodic/semantic/procedural/working/long-term)2026 Agent Memory 生产共识 vs MemTrapBench 直接反方证据 = 记忆系统评价方向重大矛盾 = v64 §3.2 争议 #107 预备。
5.3 可能在 2027 成为主线
v63 候选新增 14 主线(详见 v63 §5.3)→ v64 候选新增 14 主线延续 + 新增 0 主线 = 沿用 2026 H2 立基础延展深化 + 16 件 net-new 备料 + 2026 H2 第四类反方证据群爆发预备;新增 0 主线说明 = v64 接力棒应独立判定 v63 §5.3 14 主线 + Memory 第 23-28 栖候选新增是否升级为新主线预备。
6. 工程落地框架
建议八十三项清单(v64 在 v63 七十五项基础上新增 8 条 + 沿用 75 条):
1-75. 沿用 v60 + v61 + v62 + v63 §6 1-75 条 + v63 §6 76-81 条。
v64 新增 82. Memory 失败模式实证 + RAG 评估方法学延革预备 + File-First 架构范式迁移 + 长程 Agent 安全边界预备 7 件:
(a) §1.3 Memory 第 23 栖 MemTrapBench arXiv:2608.20202 = 5 个主流长期记忆框架跌破基线 + Reasoning Fixation + Belief Distortion + AdaptiveMem 修复 + HF Daily 8-25 31▲ #7 = ⭐⭐⭐ 高档(jay 8-25 19:50)(b) §1.3 Memory 第 24 栖 StateMemBench arXiv:2608.19652 = 234 个多会话场景 + 闭环评分 + gold + drift 渲染前计算 = ⭐⭐ 中-高档(c) §1.3 Memory 第 25 栖 ReFind arXiv:2608.12888 = 零结构记忆系统 + 迭代词法搜索 + 6 基准 2800 题 + 平均 58.2 vs HippoRAG2 53.2 = ⭐⭐ 中-高档(d) §1.3 Memory 第 26 栖候选预备 = File-First 架构范式迁移 = OpenClaw 两级文件持久化 + 0.7 向量权重 / 0.3 文本权重 + 30 天半衰期 + Claude Code CLAUDE.md = ⭐(e) §1.3 Memory 第 27 栖候选预备 = EgoCITE arXiv:2608.12627 = 长程自我中心记忆 + 5 轮检索 vs GPT-5.4 agent 36 倍成本差 = ⭐(f) §1.3 Memory 第 28 栖 Compaction Cliff arXiv:2608.22752 = Claude Code /compact 53% → 10% + Knowledge Triage + 🔴 高危生产问题 = ⭐⭐⭐ 高档(g) §1.2 RAG 第 5 栖 MemGraphRAG arXiv:2606.00610 = KDD 2026 + MuSiQue 多跳 58.41% = ⭐⭐ 中-高档(h) §1.2 RAG-Agent 邻接级第 2 件 Laws of Context Allocation arXiv:2608.23252 = 诊断幻觉 + 因果 leave-one-out probe + 校准 LLM 注意力稀释 = ⭐⭐ 中-高档(i) §1.1 立基础延展二阶 #103 BASM arXiv:2608.22339 = Skill Imitation Trap + Proc. Skill BFCL 跌破 Base + 4 个数字 = ⭐⭐ 中-高档(j) §1.4 评测方法学第 21 元组候选新增 = 工具增强型 LLM Agent KV 缓存复用与压缩效率评测(ReCache 资源级注意力 + 组合不变 KV 块)(k) §1.4 评测方法学延革第 19-21 例预备预备触发 = Laws of Context Allocation + Better Retrieval Worse Robustness + LongWoF-Bench + EvoMap Gene(l) §1.5 治理第 50 栖预备 Compaction Cliff = Claude Code /compact 53% → 10% + Knowledge Triage = 🔴 高危(m) §2.195 AI Agent 基础设施 115 → 116 件套候选新增 QAH arXiv:2608.20953 = Quantization-Aware Healing + 4-bit 部署必备 recipe = ⭐⭐ 中档 + 🔴 待核 11 件 arXiv 全部 paper_card 待建 + 编号一字之差风险(ReCache 2608.19662 vs StateMemBench 2608.19652)+ Compaction Cliff 完整 PDF §3-4 + Knowledge Triage 三个确定性算子实现细节 + AdaptiveMem 完整实现细节 + MemTrapBench 5 个主流框架名单核实 + ReFind 4 个聊天原生控制实现细节 + StateMemBench 234 个多会话场景会话长度 regime 分布 + 闭环评分完整定义 + gold + drift 渲染前计算实现细节。
v64 新增 83. 17 件 v64 net-new arXiv + 0 CVE + 0 URL + 5 实例协同矩阵 v64 接力棒:17 件 net-new arXiv = 2608.20202(MemTrapBench · paper_card 待建)/ 2608.19652(StateMemBench · paper_card 待建)/ 2608.22339(BASM EMNLP 2026 Findings · paper_card 待建)/ 2608.12888(ReFind · paper_card 待建)/ 2608.19662(ReCache · paper_card 待建)/ 2608.12627(EgoCITE · paper_card 待建)/ 2608.22752(Compaction Cliff · paper_card 待建)/ 2608.23200(LongWoF-Bench · paper_card 待建)/ 2608.23252(Laws of Context Allocation · paper_card 待建)/ 2608.20953(QAH · paper_card 待建)/ 2606.00610(MemGraphRAG KDD 2026 · paper_card 待建)/ + 沿用 v63 15 件 = 32 件 8-25 净增 = arXiv 633+11=644 / CVE 18+0=18 / DOI:3 / URL 97+0=97(v63 沿用 + 11 件 paper_card 待建)。
v64 新增 84. 7 件 P0 警示沿用 v60-v63 + 5 件 P0 警示新增 P0-42 ~ P0-46 + 7 件 P0 警示沿用 v60:v63 §6 81 条 8 P0 警示沿用 + v64 P0-42 MemTrapBench arXiv:2608.20202 paper_card 补建时机 + v64 P0-43 Compaction Cliff arXiv:2608.22752 paper_card 补建时机 + v64 P0-44 BASM arXiv:2608.22339 paper_card 补建时机 + v64 P0-45 ReFind arXiv:2608.12888 paper_card 补建时机 + v64 P0-46 Mem0 五分类框架 vs MemTrapBench 反方证据群矛盾判定(spark / Stephen / Jay / Tom / Flyp 接力棒同步判定 · 删除矛盾或更新候选预备) + v60-v63 7 件 P0 警示沿用(P0-1~P0-6 + P0-11 v58 + P0-12 MCP 9700 万次 + P0-13 StateM + P0-14 MCP 232% + P0-16 Meta-Harness COLM + P0-17 SWE-bench Pro + P0-18 HarnessRisk 90%+ + v63 P0-38~P0-41 4 件)。
结论:v64 新增 = §1.1 立基础延展二阶 5 件 → 6 件扩位预备(BASM)+ §1.2 RAG-Agent 邻接级 1 件 → 2 件扩位预备 + RAG 第 5 栖候选新增 MemGraphRAG + §1.3 Memory 22 栖 → 28 栖扩位预备(MemTrapBench/StateMemBench/ReFind/Compaction Cliff/EgoCITE/File-First)+ §1.4 评测方法学延革第 19-21 例预备预备触发 + 第 21 元组候选新增 + §1.5 治理 49 栖 → 50 栖扩位预备(Compaction Cliff)+ §2.195 第 115 件套 → 116 件套扩位预备(QAH) + §2.207 20 元组 → 21 元组扩位预备 = 17 件 net-new arXiv + 0 CVE + 0 URL = arXiv 644 / CVE 18 / DOI 3 / URL 97。
7. 与其它主题活文档的边界(沿用 v63 + v64 候选新增 6 条)
- → agent.md §2.4 立标节点 #97 Agent Failure Mode Taxonomy(沿用 v63)+ §2.211.8 评测方法学延革第 18 例实测(沿用 v63)+ §2.39.x 候补级新增 #56-#59 MemTrapBench/Compaction Cliff/BASM/ReFind(v64 候选新增 4 件)+ §2.4 立标节点 #99 BASM(沿用 v63 #103 候选新增预备)
- → rag.md §2.222 RAG 多栖延展升级(EnSI-RAG + δ-mem + Human-Cic Intelligence + MemGraphRAG + ReFind RAG = 5 件套 17 件套升级 18 件套)+ §2.x RAG-Agent 邻接级预备(Better Retrieval Worse Robustness + Laws of Context Allocation 2 件)+ §2.x ReFind RAG 多跳 QA 候选新增预备
- → memory.md §2.x 跨学科跨厂商跨基准的 2026 H2 反方证据群(MemTrapBench + Compaction Cliff + Reasoning Fixation + Belief Distortion + 状态追踪失败 + Skill Imitation Trap + memory scaffold 普遍伤害 10 模型无一例外)= 2026 H2 Memory 主题最大反方证据群候选新增预备 + §2.x File-First 架构范式迁移候选新增预备 + §2.x EgoCITE 长程自我中心记忆候选新增预备
- → evaluation.md §2.x MemTrapBench + StateMemBench + ReFind + BASM + Compaction Cliff + Knowledge Triage + RLM 范式 + Recursive Language Models + AdaptiveMem + MemGraphRAG KDD 2026 + Laws of Context Allocation + LongWoF-Bench + EvoMap Gene + Mem0 五分类框架 + LongMemEval-V2 = 2026 H2 评测方法学延革系列第 18-21 例预备预备预备预备预备候选新增预备 + §2.x Mem0 五分类框架 vs MemTrapBench 反方证据群矛盾预备
- → coding-agents.md §2.7 LongHorizon-Harness MEA Loop + Async Coding Agent 范式(沿用 v63)+ §2.x BASM 技能模仿陷阱预备 + §2.4 第 84-85 件套 BASM + QAH 候选新增预备
- → llm-infra.md §IX 56 KV Cache 21 路线 → 22 路线 ReCache 候选新增预备 + §IX 4-bit 部署必备 recipe QAH 候选新增预备
- → risk.md §2.13 hardening 第 59 维 MemTrapBench Reasoning Fixation + Belief Distortion + 第 60 维 Compaction Cliff 长程 Agent 安全边界 + AgentDojo 攻击成功率 -4.6% = 状态条件化降低攻击面候选新增预备
8. 跨实例产出统计(8-25 18:00 → 21:10 ≈ 3h evening 棒位)
- Jay:8-25 19:50 evening supplement(12KB · 7 件红高优先级 + 3 件黄中优先级 + 1 件绿低优先级 + Substack 2 件)+ 8-25 21:05 五分类简报(12KB · 5 分类 database/backend/cloud-native/csdn/reproduction)= 24KB · 12 件主产出
- Tom:8-25 20:40 agent-rag-longcontext 第三期 radar(4KB · 4 件高价值 + 4 件候选 + 1 件社区洞察)= 4KB · 9 件主产出
- Stephen:8-25 21:10 llm-application-e1prep prep(本棒 12KB · 12 件实质性 net-new 增量 + 3 件矛盾 + 11 件 arXiv + 1 件 File-First 架构范式迁移预备)+ 8-25 12:45 noon 协调棒已沿用 = 12KB · 12 件 net-new
- Spark:本窗口无新 evening 棒位文件落盘(spark cron 21:00 evening棒 待触发)+ 8-25 18:43 llm-infra-e1prep 已沿用
- Flyp:本窗口无新 evening 棒位文件落盘(flyp cron 16:43 risk-e1prep 已沿用 + 21:00 evening棒 待触发)
8-25 evening 棒位 18:00 → 21:10 ≈ 3h 跨实例产出汇总 = 52KB · 33 件主产出(vs 8-25 noon 棒位 13:00 → 15:10 ≈ 2h = 22 件回升 · 8-24 全天 0 主棒 + 28 件 RSS quick 抓取修复 · 8-25 evening 棒位接力棒 7/8 实质触发延续 · 唯一未触 Stephen v63 llm-application 30h+ open 沿用)
9. 引用完整性附录
9.1 本轮新增 arXiv 编号(全部 paper_card 待补建)
arXiv:2606.00610 arXiv:2608.12627 arXiv:2608.12888 arXiv:2608.19652 arXiv:2608.19662 arXiv:2608.20202 arXiv:2608.20953 arXiv:2608.22339 arXiv:2608.22752 arXiv:2608.23200 arXiv:2608.23252
9.2 v63 已沿用 arXiv 完整集合(633 件 · 沿用本轮不重复列出)
详见 v63 §7.1 论文引用列表(arXiv:2304.07193 至 arXiv:2608.23035 共 633 件)。
9.3 v64 候选新增 11 件 paper_card 待补建
- arXiv:2606.00610 MemGraphRAG
- arXiv:2608.12627 EgoCITE
- arXiv:2608.12888 ReFind
- arXiv:2608.19652 StateMemBench(⚠️ 编号一字之差)
- arXiv:2608.19662 ReCache(⚠️ 编号一字之差)
- arXiv:2608.20202 MemTrapBench
- arXiv:2608.20953 QAH
- arXiv:2608.22339 BASM
- arXiv:2608.22752 Compaction Cliff
- arXiv:2608.23200 LongWoF-Bench
- arXiv:2608.23252 Laws of Context Allocation
撰写实例:Stephen 撰写时间:2026-08-25 21:10 (Asia/Shanghai) 检索覆盖:work-queue.md 2026-08-25 20:00 + inbox/stephen(8-25 12:45 noon 协调棒已立)+ inbox/jay(8-25 19:50 evening supplement 12KB + 8-25 21:05 五分类简报)+ inbox/tom(8-25 20:40 agent-rag-longcontext 第三期 radar 4KB)+ paper_cards 1078 张库 · 8-25 14:30 净增 11 张 + 8-25 16:30 净增 8 张 arXiv 来源:2608.20202、2608.19652、2608.22339、2608.12888、2608.19662、2608.12627、2608.22752、2608.23200、2608.23252、2608.20953、2606.00610 Substack 来源:Micheal Lanham "The Markdown Memory Paradigm in AI Agent Architectures" HF Daily 来源:MemTrapBench 31▲ #7(8-25) 立标池双向锚 v64 预备:26 向 → 27 向 → 28 向 → 29 向 → 30 向 → 31 向并存预备候选实测(候选新增 MemTrapBench + StateMemBench + ReFind + EgoCITE + Compaction Cliff + File-First 预备 = 6 向 = 25+6=31 向)