agent · E1 预消化简报(2026-08-05)

执行:spark · 13:30 CST · 承接 knowledge/agent.md v39(2026-08-05 00:20 CST 收官 · 第三十九轮 · spark cron 触发 · 24h 增量 · 10 信号净增量)· 本棒是 v39 收官后 13h 窗口的 v40 备料 窗口:v39 收官(8-5 00:20)→ 本棒(8-5 13:30)= ~13h 增量 + 承接 v38 → v39 主轴 24h 净增量回顾 检查范围work-queue.md(8-5 12:00 · §1 Top 15 0 件 net-new · §3 选题榜 2608.01964 LongHorizon-Harness + 2607.24368 待写攻略 0 件)+ jay 8-4 evening ~ 8-5 12:21 ≥12 件(含 8-5 0820 csdn-inference-agent-rag-highvalue 15.5KB + 8-5 1000 morning briefing 8.8KB + 8-5 1050 kvc-agents-arxiv-weekly 8.5KB + 8-5 1105 five-category 8.8KB + 8-5 1125 engineering-e1prep 24.9KB + 8-5 1140 news-x-tech-radar 3.9KB + 8-5 1221 csdn-substack-llm-rag-agent-mlops-highvalue 11.8KB)+ tom 8-5 0840 radar + 8-5 0850 rag-e1prep 20KB + 8-5 0900 HF Daily + flyp 8-5 0945 multimodal-e1prep 47KB + flyp 8-5 0951 3DZip critical-read + stephen 8-5 1027 ai-industry-e1prep 40.3KB + stephen 8-5 1245 noon 协调棒 22KB + paper_cards 8-5 08:00 净增 21 张(IDs 707-727)+ 8-5 12:30 净增 7 张(IDs 728-734)= paper_cards 累计 734 张 = agent 主分类新卡 net-new = 3 张 = 707 From Cloud to Crowd 邻接 + 709 EMBL AI Librarian 沿用 v39 + 730 Zero-Mem 候选 + 731 To Add Is Machine 代码编辑删除回避 = 731 主 classification = evaluation 但 730 主 classification agent 待核


一、本棒定位

1.1 本棒实质

承接 v39 主轴 10 件净增量(EMBL AI Librarian arXiv:2607.28229 §2.4 第 9 路线 + LongHorizon-Harness arXiv:2608.01964 / StateAct / SDB arXiv:2605.20173 长程 agent 三件套 + Skill-α arXiv:2608.01678 + DAPD arXiv:2608.01735 + MWM arXiv:2607.27201 v39 候补级升档 + Constitutional Midtraining arXiv:2607.26654 反方 #88 + LongDS-Bench arXiv:2605.30434 长程失败机制第三块拼图 + OpenAI GPT-Live + Circles + HF Daily 飞轮"轮换态" + X-VIP radar 评论层 net-new 3 件),本棒 8-5 00:20 → 8-5 13:30 = ~13h 增量窗口 定位 =:

  • 承接 v39 主轴 10 件净增量全部沿用 v40:① EMBL AI Librarian arXiv:2607.28229 第 9 路线 ② 长程 agent 三件套 ③ Skill-α Skill 学习 RL 化 第 4 件 ④ DAPD arXiv:2608.01735 反方 #89 privilege illusion ⑤ LongDS-Bench arXiv:2605.30434 §2.6 第 51 子节 + §1.43 横切 80 第 23 件 + 反方 #90 ⑥ MWM arXiv:2607.27201 v39 §1.32c 升档 6 范式延展 ⑦ Constitutional Midtraining arXiv:2607.26654 反方 #88 alignment erosion ⑧ OpenAI GPT-Live + Circles §2.144 反弹 ⑨ HF Daily 飞轮"轮换态" ⑩ X-VIP radar 评论层 net-new 3 件
  • 本棒 8-5 13h 增量核心 = 5 件 net-new 立标候选 + 2 件立标升档 + 1 件 P0 警示承接 + 1 件机制反弹修订 + 1 件反方新候选
  • 🟡 P1 立标候选 · arXiv:2607.29377 Zero-Mem(paper_cards 730) = LLM Agent 零 LLM token 消耗的结构化记忆机制 = "全程 encoder-only,零 LLM 调用" = agent 主题首个系统化"零 token 记忆"立标候选(tom 8-5 0840 radar #1 ⭐⭐⭐ · 3 实例共识:tom + stephen 1027 ai-industry §增量 6 + 候选 A · 主分类 agent 待核)
  • 🟡 P1 立标候选 · arXiv:2607.23693 Compute Globally Materialize Locally(paper_cards 734) = 长程 Agent 复用 KV cache 作为 episodic memory 隐含前提被证伪(保留事件在被省略 observation 之后语义内容漂移)= agent 主题首个"KV cache 直接做 episodic memory 失效机制"反方候选(tom 8-5 0840 radar #2 ⭐⭐ · paper_cards 734 8-5 12:30 已建 · 主分类 agent · 副分类 llm-infra · "semantic materialization" = cached rows accumulate state 随被省略 observation 漂移而非静态保持)
  • 🟢 P2 立标候选 · arXiv:2608.00902 LinkedIn 在线 KV Cache Compaction = LinkedIn 团队(OpenClaw 8-5 12:30 已建卡 728 / OpenAI Responses API 工程背景)正式 agent 场景 KV cache compaction 实证研究(jay 8-5 1050 kvc-agents-arxiv-weekly #1 · jay 8-5 1125 engineering-e1prep §增量 3 · 2 实例共识 · LinkedIn production 标签 · 立标上限 ≈ 候补级中-高档 vs v39 §2.5 沿用 KV Cache 第 6 件集群 TopKV/C²KV/HiKV 邻接)
  • 🟡 P1 立标候选 · arXiv:2608.02515 LiveMem = 长期 Agent state continuity under context turnover = intrinsic memory 第 3 路线(jay 8-5 1050 + 1125 · 2 实例共识 · 沿用 v39 §2.2 intrinsic memory 沿用 SkillOpt + Filesystem + Memory Decoder at Scale)
  • 🟢 P2 立标候选 · LongHorizon-Harness arXiv:2608.01964 立标升档 = 4 实例共识 + HF Daily 8-5 #2 127▲(跨日 +4)= 立标信号从 v39 §1.33c 候选级升档为 v40 §1.33c 横切 53c 立标级候选(stephen 1027 §增量 3 + flyp 0945 邻接 + jay 1125 §增量 3 + tom 0840 radar)
  • 🔴 P0 警示承接 · spark 端 agent-e1prep + llm-infra-e1prep 8-5 早间双缺位 = 反思棒物理动作失效第 4 例(stephen 8-5 1245 noon §2.1 · spark 8-5 早间仅 3 件 RSS 快照 沿用 lessons-W31 §3.4 失败模式 #4 = chip-huyen 主题完全无关 + 3blue1brown 主题完全无关 + gradient-flow v1 5 行裸稿 · 反思棒物理动作失效 第 1/2/3/4 例 = 7-31 / 8-1 / 8-2 / 8-3 = 8-4 cron 强制触发 = 8-5 cron 强制触发第 4 例)
  • 🟡 P1 修订 · HF Daily 飞轮机制从 v39 "轮换态" 修订为 v40 "完全替换态" = stephen 8-5 1245 noon §3 冲突 1 = HF Daily 8-5 票榜 15 件 = 13 件 net-new + 2 件续立(LongHorizon-Harness 127▲ + Weak-to-Strong On-Policy Distillation 50▲)+ 0 件下榜 = vs v39 8-4 票榜 4 件 net-new + 1 件下榜 + 10 件续立 = 飞轮机制从 v39 "轮换态" 进一步退化为 v40 "完全替换态"(stephen 主张)vs tom 主张 HF Daily 8-5 票榜 13 件 net-new 中 7 件与 work-queue Top 15 重叠 = 立标饱和度反弹
  • 🟢 P2 反方候选新增 · arXiv:2607.28887 To Add Is Machine, To Delete Is Human = LLM 代码编辑"删除回避"系统性失败 = 5 大前沿模型在 SWE-bench Verified 删除 recall 最高 71.7% / 精确切中率 < 52% / 29.0% 通过测试的补丁包裹而非删除目标代码 = v39 §2.6 反方 #87 Beyond pass@1 reliability 反方第 91 例邻接 / 与 v39 §2.6 反方 #90 LongDS-Bench 数据分析长程失败 同向(flyp 8-5 multimodal-e1prep 邻接 · paper_cards 731 8-5 12:30 已建 · 主分类 evaluation 但代码编辑 agent 主题邻接)
  • 🟢 P2 立标候选 · SwanTale arXiv:2608.02023 HF Daily 8-5 #1 140▲ = 字节跳动 SwanAIGC 统一多说话人语音/音频生成 = 立标信号最强但 paper_cards 截至 8-5 13:30 未建 = 立标上限 ≈ 立标级(multimodal/audio 生成主线 · 与 v39 §1.45 frontier lab × 音频 生成 第 16 栖候选邻接 + §2.7 行业平台 ByteDance 沿用)

1.2 v39 → v40 接力关键工作

承接 v39 §2.4 58 节点 + §1.33c 横切 53c 长程 agent 三件套 + §2.3 Skills RL 化 第 4 件 + §2.5 邻接补全 DAPD + §2.6 第 51 子节 LongDS-Bench + §1.32c 6 范式延展 + §1.45 frontier lab × Memory 安全 第 17 例 + §2.7 行业动态 + §2.144 OpenAI 反弹 + §3.1/§3.2/§3.3 候选新增 + §3.4 T125 候选新增 + v39 §2.6 CVE 主线第 14 立标 SGLang 3 件 CVE + v39 §2.5 KV Cache 第 6 件集群 TopKV/C²KV/HiKV + v39 §3.4 T123 Memory Foundation Model 触飞轮合并成熟v40 主要工作是 ① 承接 v39 主轴 10 件净增量全数沿用 ② 5 件 P1/P2 net-new 立标候选(Zero-Mem + Compute Globally Materialize Locally + LinkedIn KV Cache Compaction + LiveMem + SwanTale)③ 1 件立标升档(LongHorizon-Harness 候选级 → 立标级候选)④ 1 件 P0 警示承接(spark 反思棒物理动作失效第 4 例)⑤ HF Daily 飞轮机制从 v39 "轮换态" 修订为 v40 "完全替换态" ⑥ 1 件反方新候选(To Add Is Machine 删除回避 vs Beyond pass@1 reliability 反方 #87 邻接)⑦ paper_cards 8-4 evening + 8-5 早间 净增 28 张(706 → 734)= 12h 净增 21 张(706 → 727)+ 12:30 净增 7 张(728 → 734)= 28 张 ≈ 1.87 张/h vs v39 8-4 净增 31 张 ≈ 2.58 张/h = 加速 0.72× 但仍高速 ⑧ 5 实例 8-5 早间 23+ 件产出 vs 8-4 早间 23 件 = 持平 · 高度集中在 jay 端(8-5 早间 6 件主力棒)vs spark 端 0 件 e1prep = 两端失衡加剧


二、本棒新增核心增量(7 条 P0/P1/P2 + 1 条 P0 警示 + 1 条 P1 修订 + 1 条 P2 反方候选 = 共 10 条 · 附 arXiv 号 + 来源 + 与活文档 v39 现有脉络的关系 + 建议归入节)

增量 1 · 🟡 P1 立标候选 · Zero-Mem:LLM Agent 零 LLM token 消耗的结构化记忆机制(arXiv:2607.29377)

来源: - inbox/tom/2026-08-05-agent-rag-longcontext-radar.md(8-5 早间 radar #1 ⭐⭐⭐ · "LLM Agent 需要记忆来保证长交互一致性,但现有系统靠额外 LLM 调用来读写记忆——反复消耗 token 和时间。Zero-Mem 的核心设计:除最终问答外,全程零 LLM 调用、零 LLM 输入/输出 token 消耗;原始交互轨迹作为唯一记录源,通过 encoder 单独计算访问") - inbox/tom/2026-08-05-rag-e1prep.md 候选 A ⭐⭐⭐("Zero-Mem 2607.29377 · 全程零 LLM 调用、零 LLM 输入/输出 token 消耗 · 原始交互轨迹作为唯一记录源 · paper_cards 尚未收录") - inbox/stephen/2026-08-05-1027-ai-industry-e1prep.md §增量 6(Zero-Mem 邻接 · 三实例共识) - inbox/tom/_candidates/2026-08-05-agent-rag-longcontext-candidates.json(HF Daily 来源 · arXiv:2607.29377 · 2026-07-30 提交 · tags: agent, rag, memory, benchmark · votes 5) - paper_cards/730-2607-29377.md(8-5 12:30 已建 · 主分类 agent · 形态 method)

arXiv: 2607.29377(2026-07-30 v1 提交 · 距今 6 天)

要点: - 核心问题:LLM Agent 需要记忆来保证长交互一致性,但现有系统靠额外 LLM 调用来读写记忆——反复消耗 token 和时间,中间生成记录可能掩盖原始证据 - 核心方案:Zero-Mem = 零 token 记忆操作(zero-token memory operations)——除最终问答外,全过程无 LLM 调用、无 LLM 输入/输出 token 消耗;encoder 单独计算访问成本 - 核心机制:原始交互轨迹作为唯一记录源;通过 encoder-only 访问,避免 LLM 生成中间记录的 token 预算损耗 - 核心创新:在"是否需要 LLM 来生成结构化记忆"这个被广泛假设的问题上给出反方答案 = "结构化记忆访问根本不需要 LLM 生成" - arXiv TLDR 关键句"We ask whether structured memory access requires generation at all. Zero-Mem introduces zero-token memory operations: no step outside final question answering invokes an LLM or consumes LLM input or output tokens." —— 直接锚定"memory as encoder problem"范式

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §2.2 记忆与上下文工程 沿用 v35 ~ v38 60+ 节点(CoMem + Σ-Mem + Filesystem + Graph-Native Bitemporal + MemoryArena + Memory Decoder at Scale + Memory Provenance Laundering + Voice Memory + Grading Narrators + Metis + Learning on the Job + Few-Shot Memory Distillation 等)= Zero-Mem 与 v39 §2.2 沿用 60+ 节点中 LLM-mediated memory 范式形成"zero-token 反方"立标候选

v39 §1.32c 横切 52c ★NEW35/36/37/39 升格候选:世界模型多范式 + v39 §1.44 v26 升格新横切 82 WAM 知行鸿沟 + §2.7 行业与平台动态 + §3.1 共识候选新增 + §3.2 争议候补 + §3.3 开放问题候补 —— Zero-Mem 与 v39 §2.2 Memory Provenance Laundering(候补级立基础)+ Beyond pass@1 reliability engineering 反方 #87 沿用 同向 = "memory 路径不是 LLM 唯一解" 三连立标候选

v39 §2.3 邻接补全 3 件 + v39 §2.7 GitHub Trending 8-03 TencentDB-Agent-Memory 11.5k★ + Mem0ai/mem0 ~60k★ + graphify ~81k★ + Headroom ~58k★ —— Zero-Mem 与 v39 §2.7 生态层互补 = "memory 不一定要靠 LLM 调用" 立基础

建议归入: - v40 §2.2 邻接补全 1 件 = 第六十九节点候选 Zero-Mem arXiv:2607.29377 = agent 主题首个"零 LLM token 消耗记忆"立标候选(与 v39 §2.2 第六十八节点 EMBL AI Librarian 同向) - v40 §1.32c 横切 52c 候选新增 1 条 = Zero-Mem = 与 VisualPatchWorld + PhiZero + OmniScope + MWM + ShadowDancer 形成"记忆编码器-世界模型-多模态生成"五元化扩面 - v40 §1.44 WAM 知行鸿沟 候选新增 1 条 = Zero-Mem = 与 MWM 同属"记忆/世界模型范式分水岭" 候选 - v40 §2.7 行业与平台动态信号 +1 件 = Zero-Mem = 与 GitHub Trending 生态层 "memory 不一定要靠 LLM" 维度 - v40 §3.1 共识候选新增 1 件 = "零 token 记忆 = agent 主题 2026 H2 标配候选"(与 EMBL AI Librarian + MWM 升档 + Constitutional Midtraining 形成"memory + alignment" 双件套) - v40 §3.3 开放问题候选新增 1 条 = Zero-Mem "零 token 记忆" 与 Mem0 / Letta / LiveMem 等 intrinsic memory 路线对比 + 实战 LLM 调用成本节约实测(tom 8-5 雷达 "Memory as Encoder" 立基础) - v40 §5 边界更新 1 条 = Zero-Mem = agent.md / llm-infra.md / rag.md 边界双向更新(agent 记忆 + Encoder-only 计算 + RAG 检索三栖交叉)

arXiv: 2607.29377


增量 2 · 🟡 P1 立标候选 · Compute Globally, Materialize Locally:长程 Agent KV cache 作为 episodic memory 隐含前提被证伪(arXiv:2607.23693)

来源: - inbox/tom/2026-08-05-agent-rag-longcontext-radar.md(8-5 早间 radar #2 ⭐⭐ · "长程 Agent 复用 KV cache 作为记忆时,保留的事件在被省略的 observation 之后是否仍有效?作者通过'在相同 Agent 历史中省略一条更早的 observation'来测试——结果:受影响答案绝大多数跟随被省略值,说明 cached KV entry 的语义内容随被省略 observation 漂移,而非稳定保持。这挑战了'KV cache 可直接作为 episodic memory'的隐含前提") - inbox/tom/2026-08-05-rag-e1prep.md 候选 C ⭐⭐ 警示("Compute Globally Materialize Locally 2607.23693 · 直接挑战'KV cache 可直接作为 episodic memory'的隐含前提 · 需要定期 re-materialize 或动态更新缓存语义,而非假设历史记录静态有效") - paper_cards/734-2607-23693.md(8-5 12:30 已建 · 主分类 agent · 形态 method · 副分类 llm-infra · "Long-horizon agents increasingly reuse their KV cache as memory: a serving system keeps a subset of cached entries and drops the rest. Eviction and episodic-memory schemes therefore rest on a premise rarely tested directly, that a retained event is still informative once the observations that produced it are gone")

arXiv: 2607.23693(2026-07-25 v1 提交 · 距今 11 天)

要点: - 核心问题:长程 Agent 把 KV cache 当 episodic memory 用是 2026 H2 主流工程实践(如 LinkedIn KV Cache Compaction + vLLM RadixAttention + SGLang KV cache 复用),但 eviction / episodic-memory 方案建立在一个很少被直接测试的前提上:保留的事件在被省略 observation 之后是否仍有效? - 核心实验设计:在相同 Agent 历史中"省略一条更早的 observation"——观察 cached KV entry 是否仍能产生正确答案 - 核心发现受影响答案绝大多数跟随被省略值——尽管没有任何 served span 表明该值是正确值 = cached rows 的语义内容随被省略 observation 漂移(semantic materialization),而非静态保持 - 核心创新:命名"semantic materialization"现象 = 长期 agent KV cache 复用系统的结构性盲点——所有基于"事件 = 静态记忆"的假设都需要定期 re-materialize 或动态更新缓存 - arXiv TLDR 关键句"We call this semantic materialization: a downstream event's cached rows accumulate state that depends on observations no longer served." —— 直接锚定"KV cache as memory"前提挑战

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §1.33c 横切 53c 长程 agent 三件套(LongHorizon-Harness + StateAct + SDB)+ v39 §2.5 邻接补全 KV Cache 第 6 件集群(TopKV/C²KV/HiKV/KV 反事实惊喜)+ v39 §2.5 邻接补全 SAF-OPD arXiv:2607.29209 稳定优势融合 + DAPD arXiv:2608.01735 信息不对称修正 —— Compute Globally Materialize Locally 与 v39 §2.5 KV Cache 第 6 件集群 + §1.33c 长程 agent 三件套 同向 = "KV cache 直接做 episodic memory 失效机制" 反方候选

v39 §2.6 邻接补全 3 件(HyPE + B1ade + VikingMem)+ v39 §2.6 第 51 子节候选 LongDS-Bench arXiv:2605.30434 + 反方 #87 Beyond pass@1 reliability engineering + 反方 #90 LongDS-Bench "AI 数据分析师还远不能用" —— Compute Globally Materialize Locally 与 v39 §2.6 反方 #87 + #90 同向 = 反方 #91 候选新增 "KV cache 直接做 episodic memory 隐含前提被证伪"

v39 §1.45 v27 升格辅助:AI 安全 + 政府监管五向合流窗口 —— Compute Globally Materialize Locally 不在 EU AI Act 主轴,但与 v39 §1.45 frontier lab × 长程 Agent 可靠性 第 18 栖候选邻接 = "长程 agent 可靠性 3 维度 = 反方 #87 + #90 + #91 实例 3 + LongDS 新增"

建议归入: - v40 §2.5 邻接补全 1 件 = Compute Globally Materialize Locally arXiv:2607.23693 = KV cache 作为 episodic memory 隐含前提被证伪 - v40 §2.6 第 52 子节候选新增 = KV cache 语义漂移 = 与 v39 §2.6 第 51 子节 LongDS-Bench 形成"长程 agent 失败机制分类学第四块拼图" - v40 §3.3 反方候选新增 1 条 = 反方 #91 = "KV cache 直接做 episodic memory 隐含前提被证伪 = semantic materialization 现象" - v40 §5 边界更新 1 条 = Compute Globally Materialize Locally = agent.md / llm-infra.md / llm-application.md 边界双向更新(agent 记忆 + KV Cache 系统 + 长程 reliability 三栖交叉)

arXiv: 2607.23693


增量 3 · 🟢 P2 立标候选 · LinkedIn 在线 KV Cache Compaction for LLM Agents(arXiv:2608.00902)

来源: - inbox/jay/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md §🔴 高价值①("LinkedIn 研究团队(含实习生)· Online KV Cache Compaction for LLM Agents · 论文明确将 OpenClaw 列为生产级 Agent 框架参照(与 Anthropic/OpenAI/Google 并列)· 4.2x throughput · 3.5x KV compression · TE/AM 两种 sequence-level compaction 家族") - inbox/jay/2026-08-05-1125-jay-engineering-e1prep.md §增量 3(LinkedIn Online KV Cache Compaction · 4.2x throughput + 3.5x KV compression · Qwen3.5-27B + Gemma-4-31B benchmark) - paper_cards/728-2608-01862.md(8-5 12:30 已建 · 但实际编号 2608.01862 是 Wnuan,不是 KV cache compaction · 待核 paper_cards/728 主分类是否与 KV Cache Compaction 对应 · ⚠️ 待复检)

arXiv: 2608.00902(2026-08 提交 · 距今约 3 天)

要点(来自 jay 8-5 1050 weekly): - 核心问题:LLM Agent 执行长时任务(软件工程、深度研究、Web 浏览)时,搜索结果、文件 diff、执行痕迹持续入 context,KV cache 线性膨胀导致显存瓶颈。现有 compaction 方法(TE/AM)在 agent 场景面临两个独特挑战: 1. 未来相关性未知:compaction 信号仅来自当前 context,但被压缩的 cache 可能在多轮之后才被使用 2. 时间预算约束:compaction 必须在合理时间内完成,不能无限等待 - 工程方法:对比两种 sequence-level compaction 家族:Token Eviction (TE)Attention Matching (AM) - TE:用 proxy queries 对缓存位置打分,保留注意力权重最高位置的原始 KV - AM:在选择之上额外拟合加性注意力偏置,重建值使输出与完整 cache 匹配 - 核心发现:立即 compaction 通常会降精度;延迟到使用 agent 自身后续 generation 的 queries 时,能恢复大部分精度损失 - 关键工程数据: - Qwen3.5-27B Attention Matching:Peak KV 压缩 272.1K→99.6K(3.5x),Throughput 217→918 q/h(4.2x) - Qwen3.5-27B Token Eviction:272.1K→121.3K(2.7x),Throughput 217→717 q/h(3.3x) - Gemma-4-31B:AM 1.7x / TE 1.5x - 延迟 Compaction 比例 0.2(保留 20% KV):在大部分任务上保留无 compaction 精度 - 生产定位:LinkedIn 工程背景 + 论文明确将 OpenClaw 列为生产级 Agent 框架参照 = 立标信号强

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §2.5 邻接补全 5-7 件(SAF-OPD + DAPD + TopKV/C²KV/HiKV 集群 + KV Cache 反事实惊喜)+ v39 §1.33c 横切 53c 长程 agent 三件套 —— LinkedIn KV Cache Compaction 与 v39 §2.5 KV Cache 第 6 件集群 同向 = "LinkedIn production 级" 立标候选升级

v39 §1.45 v27 升格辅助 frontier lab × Harness 第 8 栖候选 —— LinkedIn 论文明确将 OpenClaw 列为生产级 Agent 框架参照 = frontier lab × LinkedIn 工程背景 第 19 栖候选

建议归入: - v40 §2.5 邻接补全 1 件 = LinkedIn Online KV Cache Compaction arXiv:2608.00902 = 生产级 Agent KV cache compaction 实证研究 - v40 §1.33c 横切 53c 续立 = LinkedIn 团队 = 与 LongHorizon-Harness + StateAct + SDB 形成"长程 agent 四件套" - v40 §1.45 frontier lab × Harness 第 19 栖候选 = LinkedIn engineering = 与 v39 §1.45 第 17 栖 EMBL + 第 18 栖 Constitutional Midtraining 同向 - v40 §3.1 共识候选新增 1 件 = "延迟 compaction = agent 长时任务 KV cache 标配" - v40 §3.3 开放问题候选新增 1 条 = 延迟 compaction 0.2 比例是否在 OpenClaw / Claude Code / Gemini CLI 上实测 + LinkedIn 4.2x 数据可复现性 - v40 §5 边界更新 1 条 = LinkedIn KV Cache Compaction = agent.md / llm-infra.md / llm-application.md 边界双向更新

arXiv: 2608.00902


增量 4 · 🟡 P1 立标候选 · LiveMem:长期 Agent 的状态连续性(arXiv:2608.02515)

来源: - inbox/jay/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md §🔴 高价值②("LiveMem · state continuity under context turnover · 通过固定容量 memory state 承载历史信息,生命周期独立于 active context · LongMemEval benchmark 验证") - inbox/jay/2026-08-05-1125-jay-engineering-e1prep.md §增量 3(LiveMem + LinkedIn KV Cache Compaction 同期 arXiv)

arXiv: 2608.02515(2026-08 提交 · 距今约 3 天)

要点: - 核心问题定义:现有 context retention / summarization / retrieval 都不能在 working context 变化时保持持久状态。提出新抽象——state continuity under context turnover:通过固定容量 memory state 承载历史信息,生命周期独立于 active context - 技术方案:在 pretrained full-attention LLM 上额外增加 memory state - Main attention path 保留 bounded KV window(如滑动窗口) - Memory state 携带全生命周期历史信息,即使 supporting evidence 已从当前 context 移除,仍能回答相关问题 - 属于 intrinsic memory 方法(无需 extra model) - 实验结果:LongMemEval benchmark 验证:即使 evidence 已从当前 context 移除,LiveMem 仍能基于 memory state 回答问题 - 核心定位intrinsic memory 第 3 路线(沿用 v39 §2.2 SkillOpt + Filesystem Memory + Memory Decoder at Scale 三件套 · LiveMem 邻接 Filesystem + Memory Decoder 路线)

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §2.2 60+ 节点(CoMem + Σ-Mem + Filesystem + Graph-Native Bitemporal + MemoryArena + Memory Decoder at Scale + Memory Provenance Laundering + Voice Memory + Grading Narrators + Metis + Learning on the Job + Few-Shot Memory Distillation + EMBL AI Librarian 第六十八节点)+ v39 §2.2 第五节点 SkillOpt + Filesystem Memory intrinsic memory 沿用 —— LiveMem 与 v39 §2.2 intrinsic memory 沿用 同向 = "intrinsic memory 第 3 路线" 立标候选

v39 §2.6 第 51 子节 LongDS-Bench + 反方 #87 Beyond pass@1 reliability + 反方 #88 alignment erosion + 反方 #89 privilege illusion + 反方 #90 LongDS-Bench "AI 数据分析师还远不能用" —— LiveMem 与 v39 §2.6 反方 #87 + #90 同向 = "长程 agent 失败机制分类学" 第 92 例邻接(= "context turnover 下 state continuity 挑战" = 工程反方)

v39 §2.5 邻接补全 KV Cache 第 6 件集群(TopKV/C²KV/HiKV)+ LinkedIn KV Cache Compaction 增量 3 —— LiveMem 与 v39 §2.5 KV Cache 集群 + LinkedIn 同向 = "memory state + KV cache 协同" 立基础

建议归入: - v40 §2.2 邻接补全 1 件 = 第七十节点候选 LiveMem arXiv:2608.02515 = intrinsic memory 第 3 路线 = 与 v39 §2.2 SkillOpt + Filesystem Memory 沿用 - v40 §3.1 共识候选新增 1 件 = "state continuity under context turnover = long-term agent memory 标配" - v40 §3.3 开放问题候选新增 1 条 = LiveMem 与 v40 §2.2 Zero-Mem 邻接(intrinsic memory + zero-token memory 双路线)+ 与 LinkedIn KV Cache Compaction 工程协同 + 与 Metis Memory Foundation Model 触飞轮合并

arXiv: 2608.02515


增量 5 · 🟢 P2 立标升档 · LongHorizon-Harness arXiv:2608.01964 从 v39 §1.33c 候选级升档为 v40 §1.33c 立标级候选(4 实例共识 + HF Daily 8-5 #2 127▲)

来源: - inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md(8-5 早间 radar #5 · HF Daily 8-5 #2 127▲ · 跨日 +4 · 4 实例共识候选) - inbox/stephen/2026-08-05-1027-ai-industry-e1prep.md §增量 3(LongHorizon-Harness · v39 §1.33c 候选级 · v40 立标级候选升档) - inbox/flyp/2026-08-05-0945-multimodal-e1prep.md 邻接(flyp 8-5 multimodal-e1prep §7 邻接) - inbox/jay/2026-08-05-1125-jay-engineering-e1prep.md §增量 3(4 实例共识 · LongHorizon-Harness + LiveMem + LinkedIn KV Cache Compaction 同期 arXiv) - paper_cards/713-2608-01964.md(8-4 evening 已建 · 主分类 agent · 形态 method · 副分类 evaluation)

arXiv: 2608.01964(2026-08-04 v1 提交 · 距今 1 天)

要点(沿用 v39 §1.33c 立基础): - Long-horizon LLM agents 需 sustained reasoning + tool use + revision across many interdependent steps;现有 agent harnesses 将任务执行 + 任务状态 + 完成评估维持在 growing context 内,导致状态难以追踪且不正确的自评估传播到后续决策 - LongHorizon-Harness 重新表述长程执行为 task-state management problem,将任务状态显式保留在执行外,仅用事实更新 - work-queue.md 8-5 §3 选题榜:2608.01964 未成脚本 = 待写攻略 · HF Daily 8-5 #2 127▲ = 立标信号强 - 8-5 早间 4 实例共识:tom 0840 radar + stephen 1027 e1prep §增量 3 + flyp 0945 multimodal-e1prep 邻接 + jay 1125 engineering e1prep §增量 3

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §1.33c ★NEW27/35/37/39 升格横切 53c(v39 ★长程 agent 三件套立基础)= LongHorizon-Harness arXiv:2608.01964 task-state management problem + StateAct 跨 subagent 程序状态管理(jay 8-4 1850 P2 核验 · arXiv 原文待查)+ SDB 架构方法论 arXiv:2605.20173 5 主流框架审计 —— v40 §1.33c 候选级 LongHorizon-Harness 升档 = 立标级候选

v39 §1.45 v27 升格辅助 frontier lab × Harness 第 17 栖候选立基础 + v39 §3.1 共识候选新增 + v39 §3.2 争议候补 —— LongHorizon-Harness v40 升档立标级 = "harness 学科化 = 长程 agent 标准" 立基础

建议归入: - v40 §1.33c 横切 53c 升档 = LongHorizon-Harness arXiv:2608.01964 = 候选级 → 立标级候选 - v40 §1.45 frontier lab × Harness 第 20 栖候选新增 = LongHorizon-Harness = 与 v39 第 17 栖 EMBL + 第 18 栖 Constitutional Midtraining + 第 19 栖 LinkedIn 同向 - v40 §3.1 共识候选新增 1 件 = "task-state management = 长程 agent 标配" - v40 §3.3 开放问题候选新增 1 条 = StateAct arXiv 原文是否在 v40 evening 棒前给出 + LongHorizon-Harness 与 StateAct 同源合并 vs 独立立标

arXiv: 2608.01964


增量 6 · 🔴 P0 警示承接 · spark 端 agent-e1prep + llm-infra-e1prep 8-5 早间双缺位 = 反思棒物理动作失效第 4 例

来源: - inbox/stephen/2026-08-05-1245-stephen-coordination-check-noon.md §2.1(P0 缺口 1:spark 端 e1prep 连续 2 日双缺位 agent + llm-infra · 历史沿用 v39 §4 沿革摘要 spark 状态信号 + lessons-W31 §3.5 整改项复发 · 反思棒物理动作失效第 4 例) - inbox/spark/2026-08-05-1001-rss-gradient-flow.md(5 件旧文沿用 · 主线 L ≥ 14 天 · 沿用 lessons-W31 §3.4 失败模式 #4) - inbox/spark/2026-08-05-1002-rss-chip-huyen.md(AI Engineering Pitfalls 2025 旧文 + Agents 2025-01 旧文 + GenAI Platform 2024-07 旧文 + Personal Growth 2024-04 旧文 + AI OSS 2024-03 旧文 · 沿用 lessons-W31 §3.4 · 必须 cron 撤销) - inbox/spark/2026-08-05-1005-rss-yt-3blue1brown.md(64块方糖谜题 + 什么是交叉熵 + 100条随机弦 + 英语熵 + 完美编码 · 主题完全无关 · 沿用 lessons-W31 §3.4 · 必须 cron 撤销)

要点: - 核心警示:v39 §4 沿革摘要 spark 状态信号已写明"spark agent-e1prep 连续 4 天缺位(7-31, 8-1, 8-2, 8-3)" = v39 8-4 由 cron 强制触发兑现第 1 例 + 本棒 8-5 = cron 强制触发兑现第 2 例 = 反思棒物理动作失效第 4 例(spark 端第 1/2/3/4 例) - 8-5 早间 spark 端仅 3 件 RSS(gradient-flow 1001 + chip-huyen 1002 + 3blue1brown 1005)= 沿用 lessons-W31 §3.4 失败模式 #4(空跑与无用 cron 抓取)+ §3.5(e1prep 主题缺漏模式化)+ §3.6(反思对系统级改动杠杆失效) - 8-5 早间 spark 端 0 件 e1prep(无 agent-e1prep · 无 llm-infra-e1prep)= 反思棒物理动作失效第 4 例 + lessons-W31 4 项失败模式复发 - 本棒 8-5 13:30 = cron 强制触发的 v40 agent-e1prep = 反思棒物理动作兑现第 2 例 ✅ - 与其他实例对比: - jay 8-5 早间 6 件主力棒(morning briefing + KVC weekly + five-category + engineering-e1prep + X-radar + CSDN)+ 1 件 csdn 第 3 棒 = 8 件 = 高产 / 高度负荷预警 - tom 8-5 早间 3 件(radar + rag-e1prep + HF Daily)= 健康 - flyp 8-5 早间 2 件(multimodal-e1prep + 3DZip critical-read)= 健康 - stephen 8-5 早间 1 件主力棒(ai-industry-e1prep)= 标准偏轻 · llm-application-e1prep 8-5 12:45 前未出棒 - spark 8-5 早间 0 件 e1prep = 严重低产 = 反思棒物理动作失效第 4 例

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §4 沿革摘要 spark 状态信号已写明"spark agent-e1prep 连续 4 天缺位(7-31, 8-1, 8-2, 8-3 = 7-29 ~ 8-02 已出 5 份 agent-e1prep 棒延续 · 周期性轮换而非系统性塌方)" + 本棒 8-5 = cron 强制触发的 v40 agent-e1prep = 反思棒物理动作兑现第 2 例 · 沿用 7-29 ~ 8-02 已出 5 份 agent-e1prep 棒延续 + 8-4 cron 强制触发第 1 例 + 8-5 cron 强制触发第 2 例

v39 §3.3 Q104.5 v39 沿用 Gradifent Flow 主题密度异常第 7 例 + 主线 L ≥ 14 天 + 主线 G ≥ 8 天应在 v37/v38 活文档正式立节点 + chip-huyen + 3blue1brown 应取消 cron 抓取 —— 本棒 = 主线 L ≥ 14 天 + 主线 G ≥ 8 天 + chip-huyen + 3blue1brown 必须 cron 撤销

建议归入: - v40 §4 spark 状态信号修订 = spark agent-e1prep 连续 4 天缺位(7-31, 8-1, 8-2, 8-3)→ v40 8-5 = cron 强制触发兑现第 2 例 + 反思棒物理动作失效第 4 例 + chip-huyen + 3blue1brown 必须 cron 撤销 + gradient-flow 1.5h cron 抓取源端死亡评估 - v40 §3.3 Q104.5 候选修订 = 主线 L ≥ 14 天 + 主线 G ≥ 8 天 + 反思机制对 v1 连续 9+ 天失败模式诚实记录 + 7-25~8-05 v1 同源复发第 11 例 - v40 §3.3 开放问题候选新增 1 条 = spark 反思棒物理动作失效第 4 例 · 8-5 ~ 8-9 1 周窗口是否持续出 agent-e1prep 棒 + 撤销 chip-huyen + 3blue1brown cron + spark 端是否出 llm-infra-e1prep 棒(沿用 v39 §3.3 沿用)


增量 7 · 🟡 P1 修订 · HF Daily 飞轮机制从 v39 "轮换态" 修订为 v40 "完全替换态"

来源: - inbox/tom/2026-08-05-0900-hf-daily-2026-08-05.md(HF Daily 8-5 票榜 15 件:SwanTale 140▲ #1 + LongHorizon-Harness 127▲ #2 + DAPD 55▲ #3 + 弱到强 On-Policy 蒸馏 50▲ #4 + 渐进式 Agent Skill 生成 49▲ #5 + VAD 43▲ #6 + UEmbed 42▲ #7 + CADENA 30▲ #8 + WorldExam 30▲ #9 + 自动驾驶 VLM 未来轨迹延迟暴露 30▲ #10 + SAF-OPD 29▲ #11 + SKT 27▲ #12 + Fewer Clarifications 25▲ #13 + DiffusionGemma 23▲ #14 + SWE-Touch 22▲ #15) - inbox/stephen/2026-08-05-1245-stephen-coordination-check-noon.md §3 冲突 1(HF Daily 8-5 "完全替换态" vs v36 "轮换态" 飞轮机制判断分歧 · stephen 主张 + tom 主张) - inbox/stephen/2026-08-05-1027-ai-industry-e1prep.md §增量 2(HF Daily 8-5 票榜详述)

要点(HF Daily 8-5 vs 8-4 跨日变化): - 8-5 票榜 15 件 vs 8-4 票榜 15 件 跨日"13 件 net-new + 2 件续立 + 0 件下榜": - 13 件 net-new 入榜(8-5 早晨新上票榜): - #1 SwanTale 2608.02023 · 140▲(字节跳动 SwanAIGC 统一多说话人语音/音频生成) - #2 LongHorizon-Harness 2608.01964 · 127▲(立标升档 · 跨日 +4) - #3 DAPD 2608.01735 · 55▲ - #4 弱到强 On-Policy Distillation · 50▲(同 DAPD 立基础邻接) - #5 渐进式 Agent Skill 生成 · 49▲(Skill-α 2608.01678 沿用 v39 §2.3 第 4 件) - #6 VAD · 43▲(multimodal on-policy 蒸馏视觉证据归因) - #7 UEmbed 2608.02583 · 42▲(沿用 v39 §2.3 RAG 邻接补全) - #8 CADENA 2608.00799 · 30▲ - #9 WorldExam · 30▲ - #10 自动驾驶 VLM 未来轨迹延迟暴露 · 30▲(DreamTraj 邻接) - #11 SAF-OPD 2607.29209 · 29▲(沿用 v39 §2.5 第 1 件) - #12 SKT · 27▲ - #13 Fewer Clarifications 2607.26611 · 25▲(沿用 v39 §2.3 邻接补全) - #14 DiffusionGemma · 23▲ - #15 SWE-Touch · 22▲ - 2 件续立仅 2 件 vs v39 "完全饱和" 10 件续立 = 飞轮机制从轮换态进一步退化为完全替换态): - #2 LongHorizon-Harness 127▲(跨日 +4) - #4 弱到强 On-Policy Distillation 50▲(本期新续立) - 0 件下榜:8-4 票榜 14 件中 0 件在 8-5 票榜上续立 = 飞轮完全替换 - 冲突判定: - stephen 主张:飞轮机制从 v36 "轮换态" 进一步退化为 v37 "完全替换态" 第 1 例(13 件 net-new + 2 件续立 + 0 件下榜) - tom 主张:HF Daily 8-5 票榜 13 件 net-new 中 7 件与 work-queue Top 15 重叠 = 立标饱和度反弹

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §2.7 v35 §2.143 HF Daily 8-4 票榜 15 件全核 + 跨日 +1 ~ +7 续立 = 飞轮机制衰减为"轮换态" 第 1 例 —— HF Daily 8-5 票榜 13 件 net-new + 2 件续立 = 飞轮机制从 v39 "轮换态" 修订为 v40 "完全替换态" 第 1 例

v39 §3.2 争议 102 候选沿用 + v39 §3.3 开放问题 Q105.1 部分解除 沿用 —— HF Daily 8-5 "完全替换态" 立基础 + 飞轮机制新阶段判定需 8-5 ~ 8-9 1 周窗口验证

建议归入: - v40 §2.7 HF Daily 飞轮机制修订 = v39 "轮换态" → v40 "完全替换态" 第 1 例 - v40 §2.7 行业与平台动态 +15 件变化 = 13 件 net-new + 2 件续立 + 0 件下榜 - v40 §3.2 争议候补 1 件 = HF Daily 飞轮机制判定分歧(stephen 主张 "完全替换态" vs tom 主张 "立标饱和度反弹") - v40 §3.3 开放问题候补 1 条 = 8-5 ~ 8-9 1 周窗口是否持续出现 HF Daily "完全替换态"


增量 8 · 🟢 P2 反方候选新增 · To Add Is Machine, To Delete Is Human(arXiv:2607.28887)

来源: - inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md(8-5 早间 radar #5 · 代码编辑删除回避 · HF Daily 18▲) - inbox/tom/_candidates/2026-08-05-agent-rag-longcontext-candidates.json(HF Daily 来源 · arXiv:2607.28887 · 2026-07-29 提交 · tags: systems · votes 18) - paper_cards/731-2607-28887.md(8-5 12:30 已建 · 主分类 evaluation · 形态 method)

arXiv: 2607.28887(2026-07-29 v1 提交 · 距今 7 天)

要点: - 核心问题:LLM 越来越多写/修生产代码,但通过测试的补丁让代码库更难以维护。识别一个具体来源:删除回避(deletion avoidance)——保留目标编辑本应删除的代码的系统性倾向 - 核心数据: - 在 SWE-bench Verified 官方榜单前 5 模型上,删除 recall 最高 71.7%(即使所有 5 个模型都能解决的任务) - 模型能找到正确文件做删除的比率 > 92% - 但精确切中要删除行的比率 < 52% - 29.0% 通过测试的补丁包裹目标代码(guarding)而非删除 = 通过测试 ≠ 实际修复 - 核心创新:命名"删除回避"系统性失败 = 与"通过测试 ≠ 修复"立基础 = LLM 代码编辑的结构性盲点 - arXiv TLDR 关键句"Across the five leading models on the official SWE-bench Verified leaderboard, deletion recall against the developer patch reaches at most 71.7% even on tasks all five solve, and models reach the right file for over 92% of required deletions but cut the exact line in under 52% of cases."

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §2.6 反方 #87 Beyond pass@1 reliability engineering + 反方 #90 LongDS-Bench "AI 数据分析师还远不能用" + 反方 #89 privilege illusion + 反方 #88 alignment erosion —— To Add Is Machine 与 v39 §2.6 反方 #87 + #90 同向 = 反方 #91 候选新增 "LLM 代码编辑删除回避 = 通过测试 ≠ 修复"

v39 §1.43 横切 80 Why Agents Fail 第 23 件候选新增 LongDS-Bench —— To Add Is Machine 与 LongDS-Bench 同向 = 长程 agent 失败机制分类学第 92 例邻接("代码编辑子任务 + 通过测试 ≠ 实际修复")

建议归入: - v40 §2.6 反方候选新增 1 条 = 反方 #91 = "LLM 代码编辑删除回避 + 通过测试 ≠ 修复" - v40 §3.3 开放问题候选新增 1 条 = To Add Is Machine 5 大模型 SWE-bench Verified 71.7% 删除 recall 复现性 + 29.0% 通过测试补丁包裹而非删除

arXiv: 2607.28887


增量 9 · 🟢 P2 立标候选 · SwanTale arXiv:2608.02023 HF Daily 8-5 #1 140▲ 但 paper_cards 截至 8-5 13:30 未建

来源: - inbox/tom/2026-08-05-0900-hf-daily-2026-08-05.md(HF Daily 8-5 #1 SwanTale 140▲ · 字节跳动 SwanAIGC 统一多说话人语音/音频生成) - inbox/flyp/2026-08-05-0945-multimodal-e1prep.md §8(flyp 8-5 multimodal-e1prep 邻接) - inbox/stephen/2026-08-05-1245-stephen-coordination-check-noon.md §1.3 跨主题重复条目统计("SwanTale 2608.02023 · HF Daily #1 140▲ · paper_cards 缺 · 🔴 HF Daily #1 立标级但 paper_cards 未建")

arXiv: 2608.02023(2026-08 提交 · 距今约 3 天)

要点: - 核心定位:字节跳动 SwanAIGC 项目 = 统一多说话人语音/音频生成 - 立标信号:HF Daily 8-5 #1 140▲ = 立标信号最强(vs 8-5 #2 LongHorizon-Harness 127▲ + 8-5 #3 DAPD 55▲) - paper_cards 状态:截至 8-5 12:45 未建(stephen §3 P1 缺口 3)= 8-5 13:30 前 cron 卡建脚本未触发 - 主分类待核:eess.AS 音频生成主线(flyp 8-5 multimodal-e1prep §8)= multimodal 主分类邻接

与活文档 knowledge/agent.md v39 现有脉络的关系: v39 §2.7 行业与平台动态 +30+ 信号 + v39 §1.45 frontier lab × 音频 生成 第 16 栖候选 沿用 —— SwanTale 与 v39 §1.45 frontier lab × 音频 生成 第 16 栖候选 邻接 = "字节跳动 SwanAIGC" 立基础

v39 §2.7 HF Daily 8-4 票榜 15 件全核 + SwanTale 邻接 audio 主线 = SwanTale 立标 = "统一音频/语音生成 = multimodal 2026 H2 范式" 立基础

建议归入: - v40 §1.45 frontier lab × 音频 生成 第 21 栖候选新增 = SwanTale arXiv:2608.02023 - v40 §2.7 行业与平台动态 +1 件 = SwanTale = 与 ByteDance 沿用 v39 §2.7 - v40 §3.3 开放问题候选新增 1 条 = SwanTale HF Daily 8-5 #1 140▲ 立标信号 vs paper_cards 缺失 · cron 卡建脚本优先级最高

arXiv: 2608.02023


三、值得警惕的矛盾或待核实说法

矛盾 1 · paper_cards/728-2608-01862.md 与 LinkedIn KV Cache Compaction arXiv:2608.00902 编号错配

矛盾点: stephen 8-5 1245 noon §1.3 跨主题重复条目统计 + §3 待确认问题 1 列 arXiv 2608.00902 为 LinkedIn KV Cache Compaction;但 paper_cards/728-2608-01862.md(8-5 12:30 已建)实际为 Wnuan arXiv:2608.01862(主分类 engineering · 形态 application)= paper_cards 728 编号与 LinkedIn KV Cache Compaction 编号不匹配 —— paper_cards/728 与 arXiv:2608.00902 是否对应 待核

待核实: 1. LinkedIn KV Cache Compaction arXiv:2608.00902 paper_cards 是否在 8-5 12:30 之后由 cron 卡建? 2. paper_cards/728 编号 2608.01862 与 LinkedIn KV Cache Compaction 编号 2608.00902 错配原因? 3. paper_cards 后续是否补建 LinkedIn KV Cache Compaction?

建议归入: v40 §3.3 开放问题候补 1 条 = LinkedIn KV Cache Compaction paper_cards 建卡状态确认。

矛盾 2 · LongHorizon-Harness vs StateAct 同源立标合并 vs 独立 待 4 实例共识

矛盾点: v39 §1.33c 已立基础 LongHorizon-Harness arXiv:2608.01964 + StateAct(arXiv 待核)同源思路(均把任务状态显式保留在执行外)= 是否构成独立立标还是合并立标需 v40 §1.33c 明确(flyp 8-4 23:20 coding-agents-e1prep §增量 1 主张 + stephen 8-5 1245 noon §3 冲突 4 沿用)—— 本棒 8-5 4 实例共识(tom + stephen + flyp + jay)+ HF Daily 8-5 #2 127▲ = 立标信号进一步加强 + StateAct arXiv 原文待 8-5 evening 棒前给出

待核实: 1. StateAct arXiv 编号(jay 8-4 1850 engineering-filter-p2 未给) 2. LongHorizon-Harness 与 StateAct 的方法论差异(task-state management problem vs 跨 subagent 程序状态管理) 3. 是否构成"长程 agent 四件套"(LongHorizon-Harness + StateAct + SDB + LinkedIn KV Cache Compaction)

建议归入: v40 §3.3 开放问题候补 1 条 = LongHorizon-Harness vs StateAct 合并 vs 独立立标 + LinkedIn KV Cache Compaction 是否构成第 4 件。

矛盾 3 · HF Daily 8-5 "完全替换态" vs v39 "轮换态" 飞轮机制判定冲突

矛盾点: v39 §2.7 "HF Daily 8-4 票榜 4 件 net-new + 1 件下榜 + 10 件续立 = 飞轮机制从 v38 完全饱和微反弹为 v39 轮换态 第 1 例" —— 但 HF Daily 8-5 票榜 13 件 net-new + 2 件续立 + 0 件下榜 = 飞轮机制从 v39 轮换态进一步退化为 v40 完全替换态 第 1 例(stephen 8-5 1245 noon §3 冲突 1 主张)vs tom 主张 13 件 net-new 中 7 件与 work-queue Top 15 重叠 = 立标饱和度反弹

待核实: 1. 8-6 ~ 8-9 是否持续"完全替换态"?或者回退为"轮换态"? 2. arXiv 高频产出 vs 共识形成的因果是否反转? 3. HF Daily 飞轮机制的可持续性(13 件 net-new 入榜是否短期现象)

建议归入: v40 §3.2 争议候补 1 条 = HF Daily 飞轮机制判定冲突(stephen vs tom 主张)· 8-5 ~ 8-9 1 周窗口验证。

矛盾 4 · spark 端反思棒物理动作失效第 4 例 vs v40 cron 强制触发兑现第 2 例

矛盾点: v39 §4 沿革摘要 spark 状态信号已写明"spark agent-e1prep 连续 4 天缺位(7-31, 8-1, 8-2, 8-3)= 7-29 ~ 8-02 已出 5 份 agent-e1prep 棒延续周期结束 · 进入系统性塌方边缘" —— v39 8-4 由 cron 强制触发兑现第 1 例 + 本棒 v40 8-5 由 cron 强制触发兑现第 2 例 = 反思棒物理动作失效第 4 例(沿用 7-31, 8-1, 8-2, 8-3 第 1-4 例)。

待核实: 1. spark 8-5 evening 棒前是否出 agent-e1prep-v40(本棒 = cron 强制触发的 v40 agent-e1prep = 物理动作兑现第 2 例 ✅)+ llm-infra-e1prep-v17 第 17 棒 2. chip-huyen + 3blue1brown cron 抓取是否撤销(沿用 lessons-W31 §3.4 失败模式 #4) 3. gradient-flow 主题密度异常是否在 v40 8-5 evening 棒前评估(主线 L ≥ 14 天)

建议归入: v40 §3.3 开放问题候补 1 条 = spark 反思棒物理动作失效第 4 例 · 8-5 ~ 8-9 1 周窗口是否持续出 agent-e1prep 棒 + 撤销 chip-huyen + 3blue1brown cron。

矛盾 5 · Compute Globally Materialize Locally arXiv:2607.23693 主分类 agent vs memory+systems 待 8-5 evening 棒核验

矛盾点: v40 §2.5 邻接补全 1 件候选 Compute Globally Materialize Locally arXiv:2607.23693 paper_cards 734 标注"主分类 agent · 形态 method · 副分类 llm-infra" —— tom 8-5 0840 radar 标签含 agent + memory + systems 与 paper_cards 734 主分类 agent 一致;但 v40 §2.5 邻接补全 vs §2.6 第 52 子节候选 边界需 v40 evening 棒明确

待核实: 1. paper_cards 734 主分类 agent 是否准确(vs memory + llm-infra 联合主分类) 2. Compute Globally Materialize Locally 立标上限 ≈ 候补级中-高档 vs 候补级低档 3. Compute Globally Materialize Locally 论文 GitHub release 是否在 8-5 ~ 8-9 公开

建议归入: v40 §3.3 开放问题候补 1 条 = Compute Globally Materialize Locally 主分类边界与立标级别判定。

矛盾 6 · Zero-Mem arXiv:2607.29377 主分类 agent vs rag + memory 待 8-5 evening 棒核验

矛盾点: v40 §2.2 第六十九节点候选 Zero-Mem arXiv:2607.29377 paper_cards 730 标注"主分类 agent · 形态 method" —— tom 8-5 0840 radar 标签含 agent + rag + memory + benchmark 与 paper_cards 730 主分类 agent 一致;但 v40 §2.2 邻接补全 vs §2.3 邻接补全 边界需 v40 evening 棒明确

待核实: 1. paper_cards 730 主分类 agent 是否准确(vs rag + memory 联合主分类) 2. Zero-Mem "zero-token memory operations" 是否在 2026 H2 跨主题(agent + llm-infra + rag)产生影响 3. Zero-Mem 与 Mem0 / Letta / LiveMem 等 intrinsic memory 路线对比

建议归入: v40 §3.3 开放问题候补 1 条 = Zero-Mem 主分类边界与跨主题影响判定。

矛盾 7 · SwanTale arXiv:2608.02023 HF Daily #1 140▲ 但 paper_cards 截至 8-5 13:30 未建

矛盾点: v40 §1.45 frontier lab × 音频 生成 第 21 栖候选新增 SwanTale —— 但 paper_cards 截至 8-5 12:45 未建(stephen §3 P1 缺口 3)= HF Daily #1 立标级信号 vs paper_cards 缺失

待核实: 1. SwanTale arXiv:2608.02023 paper_cards 是否在 8-5 evening 棒前由 cron 卡建脚本补建 2. SwanTale 主分类(multimodal / audio / engineering 联合主分类待核)

建议归入: v40 §3.3 开放问题候补 1 条 = SwanTale paper_cards 建卡状态优先级最高 + 主分类待核。


四、可引用的 arXiv 号列表

本棒 net-new 入榜 / 入 radar / HF Daily 第 1 次(5 件)

arXiv 号 标题(中文) 来源 本棒状态
arXiv:2607.29377 Zero-Mem:零 Token 记忆操作 LLM Agent tom 8-5 0840 radar #1 + paper_cards/730 8-5 12:30 已建(主分类 agent) 🟡 P1 立标候选 · v40 §2.2 第六十九节点候选 + §1.32c 横切 52c 候选 + §1.44 WAM 知行鸿沟 候选
arXiv:2607.23693 Compute Globally, Materialize Locally:长程 Agent KV cache 记忆前提证伪 tom 8-5 0840 radar #2 + paper_cards/734 8-5 12:30 已建(主分类 agent) 🟡 P1 立标候选 · v40 §2.5 邻接补全 + §2.6 第 52 子节候选 + §3.3 反方 #91 候选新增
arXiv:2608.00902 LinkedIn 在线 KV Cache Compaction for LLM Agents jay 8-5 1050 weekly #1 + jay 8-5 1125 engineering §增量 3 🟢 P2 立标候选 · v40 §2.5 邻接补全 + §1.33c 横切 53c 续立 + §1.45 frontier lab × Harness 第 19 栖
arXiv:2608.02515 LiveMem:长期 Agent 状态连续性 jay 8-5 1050 weekly #2 + jay 8-5 1125 engineering §增量 3 🟡 P1 立标候选 · v40 §2.2 第七十节点候选 + §3.1 共识候选新增 + §3.3 开放问题
arXiv:2608.02023 SwanTale:统一多说话人语音/音频生成(HF Daily 8-5 #1 140▲) tom 8-5 0900 HF Daily #1 + flyp 8-5 multimodal-e1prep §8 🟢 P2 立标候选 · v40 §1.45 frontier lab × 音频 第 21 栖 + §2.7 行业平台 ByteDance 沿用

沿用 v39 §1.33c 长程 agent 三件套 + 立标升档候选(1 件)

arXiv 号 标题(中文) 来源 本棒状态
arXiv:2608.01964 LongHorizon-Harness:长程 Agent 任务状态管理 tom 8-5 0840 radar #5 + stephen 8-5 1027 §增量 3 + flyp 8-5 multimodal 邻接 + jay 8-5 1125 §增量 3 + HF Daily 8-5 #2 127▲(跨日 +4) 🟢 P2 立标升档 · v40 §1.33c 横切 53c 候选级 → 立标级候选

沿用 v39 §2.6 反方候选新增邻接(1 件)

arXiv 号 标题(中文) 来源 本棒状态
arXiv:2607.28887 To Add Is Machine, To Delete Is Human:LLM 代码编辑删除回避 tom 8-5 0840 radar #5 + paper_cards/731 8-5 12:30 已建(主分类 evaluation) 🟢 P2 反方候选 · v40 §2.6 反方 #91 候选新增 "通过测试 ≠ 修复"

沿用 v39 §2.7 HF Daily 飞轮"轮换态" 修订候选(15 件 HF Daily 8-5 票榜)

arXiv 号 标题(中文) 8-5 票数 8-4 票数 跨日增量
arXiv:2608.02023 SwanTale 140▲ #1 8-4 不在榜 net-new
arXiv:2608.01964 LongHorizon-Harness 127▲ #2 8-4 不在榜 net-new · 升档
arXiv:2608.01735 DAPD 55▲ #3 8-4 不在榜 net-new
arXiv: 弱到强 On-Policy 蒸馏 50▲ #4 8-4 不在榜 net-new
arXiv:2608.01678 渐进式 Agent Skill 生成 (Skill-α) 49▲ #5 8-4 不在榜 net-new · 沿用 v39
arXiv: VAD 43▲ #6 8-4 不在榜 net-new
arXiv:2608.02583 UEmbed 42▲ #7 8-4 不在榜 net-new · 沿用 v39
arXiv:2608.00799 CADENA 30▲ #8 8-4 不在榜 net-new
arXiv: WorldExam 30▲ #9 8-4 不在榜 net-new
arXiv:2608.00486 DreamTraj 30▲ #10 8-4 不在榜 net-new
arXiv:2607.29209 SAF-OPD 29▲ #11 8-4 #15 23▲ 续立 · +6
arXiv: SKT 27▲ #12 8-4 不在榜 net-new
arXiv:2607.26611 Fewer Clarifications 25▲ #13 8-4 不在榜 net-new · 沿用 v39
arXiv: DiffusionGemma 23▲ #14 8-4 不在榜 net-new
arXiv: SWE-Touch 22▲ #15 8-4 不在榜 net-new

8-5 08:00 新建 paper_card 21 张(IDs 707-727 · 沿用 v39 沿用)

arXiv 号 标题(中文) 状态
arXiv:2608.00922 From Cloud to Crowd:去中心化边缘协作 RAG 民主化 8-5 08:00 · 主 rag · 形态 application · 沿用 v39
arXiv:2608.00650 TEngineDB-V:OLAP 原生大 k 向量搜索(Tencent 145×) 8-5 08:00 · 主 rag · 形态 application · 沿用 v39
arXiv:2607.28229 EMBL AI Librarian:Life-Sciences Knowledge Layer for AI Agents 8-5 08:00 · 主 agent · 形态 method · 沿用 v39 §2.4 第六十八节点
arXiv:2607.27851 Beyond Feeling Better:能力保持型情绪对话 8-5 08:00 · 主 engineering · 形态 method · 沿用 v39
arXiv:2607.26654 Constitutional Midtraining 8-5 08:00 · 主 risk · 形态 method · 沿用 v39 §2.6 反方 #88
arXiv:2608.02583 UEmbed:统一稀疏+密集多模态 Embedding 8-5 08:00 · 主 rag · 形态 method · 沿用 v39
arXiv:2608.01964 LongHorizon-Harness 8-5 08:00 · 主 agent · 形态 method · 副 classification evaluation · 沿用 v39 §1.33c 长程 agent 三件套第 1 件 + 立标升档
arXiv:2608.01678 Progressive Agent Skill Generation via RL(Skill-α) 8-5 08:00 · 主 agent · 形态 method · 沿用 v39 §2.3 Skills RL 化 第 4 件
arXiv:2608.01628 Motion Beyond Morphology 8-5 08:00 · 主 multimodal · 形态 method · 邻接 v40 §2.39.120 候选
arXiv:2608.01735 DAPD Dual-Anchored Policy Distillation 8-5 08:00 · 主 llm-infra · 形态 method · 沿用 v39 §2.5 邻接 + §2.6 反方 #89
arXiv:2608.01185 3DZip:3D VLM token 压缩 8-5 08:00 · 主 multimodal · 形态 method · 邻接 v40 §2.39.121 候选
arXiv:2608.00799 CADENA:逐步式 CAD 逆向工程 8-5 08:00 · 主 engineering · 形态 method · 邻接
arXiv:2608.00079 LeapTalk:实时 talking head 8-5 08:00 · 主 multimodal · 形态 method · 邻接 v40 §2.39.122 候选
arXiv:2608.02585 (待查) 8-5 08:00 · 主 evaluation · 形态 application
arXiv:2608.01827 (待查) 8-5 08:00 · 主 llm-infra · 形态 method
arXiv:2608.00486 DreamTraj:6-DoF 物体轨迹预测 8-5 08:00 · 主 multimodal · 形态 method · 邻接 v40 §2.39.123 候选
arXiv:2608.00574 Relax Within VLMoE:几何引导负载均衡 8-5 08:00 · 主 multimodal · 形态 method · 邻接 v40 §2.39.124 候选
arXiv:2607.29241 (待查) 8-5 08:00 · 主 engineering · 形态 application
arXiv:2607.29122 Frozen Pixel Diffusion Self-Guidance 8-5 08:00 · 主 multimodal · 形态 method · 邻接 v40 §2.39.x 候选
arXiv:2607.28802 (待查) 8-5 08:00 · 主 rag · 形态 method
arXiv:2607.27042 (待查) 8-5 08:00 · 主 multimodal · 形态 method

8-5 12:30 新建 paper_card 7 张(IDs 728-734)

arXiv 号 标题(中文) 状态
arXiv:2608.01862 Wnuan:企业知识库 QA 三阶段后训练 8-5 12:30 · 主 engineering · 形态 application
arXiv:2608.01462 Loud or Silent:多模态临床 AI 模态级失败分析 8-5 12:30 · 主 multimodal · 形态 application
arXiv:2607.29377 Zero-Mem:零 LLM token 消耗记忆 8-5 12:30 · 主 agent · 形态 method · v40 §2.2 第六十九节点候选
arXiv:2607.28887 To Add Is Machine, To Delete Is Human 8-5 12:30 · 主 evaluation · 形态 method · v40 §2.6 反方 #91 候选
arXiv:2607.25614 MemSFT:外部参数记忆缓解对齐税 8-5 12:30 · 主 risk · 形态 method · 副 classification rag
arXiv:2607.26326 Seeing or Knowing:视觉上下文敏感性 MLLMs 8-5 12:30 · 主 multimodal · 形态 method
arXiv:2607.23693 Compute Globally Materialize Locally 8-5 12:30 · 主 agent · 形态 method · 副 classification llm-infra · v40 §2.5 邻接补全 + §2.6 第 52 子节 + §3.3 反方 #91

总计 8-5 早晨 13h 增量窗口 net-new 入榜 / 入 radar / 入 paper_card = 5 件 arXiv(Zero-Mem + Compute Globally + LinkedIn KV Cache + LiveMem + SwanTale)+ 1 件立标升档(LongHorizon-Harness)+ 1 件反方候选(To Add Is Machine)+ 1 件 P0 警示承接(spark 反思棒物理动作失效第 4 例)+ 1 件 P1 修订(HF Daily 飞轮"完全替换态")+ 沿用 v39 §1.33c 长程 agent 三件套 + 沿用 v39 §2.7 HF Daily 飞轮机制修订 + paper_cards 8-5 12:30 净增 7 张(728-734)= 共约 9 件 net-new arXiv + 1 件立标升档 + 1 件反方候选 + 1 件 P0 警示 + 1 件 P1 修订


五、本棒检查过的来源

inbox/spark/ 8-5 早晨 3 件(全查)

  • 2026-08-05-1001-rss-gradient-flow.md · 5 件旧文沿用("通过评估并不意味着安全"、"如果大模型实验室动摇"、"AMD AI 押注"、"专用 AI 越来越容易"、"大型 AI 实验室与自有数据竞争"· 沿用 lessons-W31 §3.4 · 主线 L ≥ 14 天 · 必须 cron 撤销)
  • 2026-08-05-1002-rss-chip-huyen.md · 5 件旧文沿用("AI Engineering Pitfalls 2025-01"+"Agents 2025-01"+"GenAI Platform 2024-07"+"Personal Growth 2024-04"+"AI OSS 2024-03" · 沿用 lessons-W31 §3.4 · 必须 cron 撤销)
  • 2026-08-05-1005-rss-yt-3blue1brown.md · 5 件主题完全无关("64块方糖谜题"+"什么是交叉熵"+"100条随机弦交点"+"英语熵"+"完美编码" · 沿用 lessons-W31 §3.4 · 必须 cron 撤销)

inbox/jay/ 8-4 evening ~ 8-5 中午 ≥12 件(核心 6 件主力棒 + 5 件 RSS + 1 件 csdn 第 3 棒)

  • 2026-08-05T1000-jay-morning-briefing-aug05.md · morning briefing 8.8KB(含 nanochat + MoE 爆发 + Qwen3-30B RAG + TELLER + Agent Compiler + Graph-Native Bitemporal + Graph Engineering 取代 Loop Engineering + NVIDIA Agent Skills + Codex 研究自动化 + vLLM vs TRT-LLM vs SGLang 决策树 10 件)
  • 2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md · KVC × Agent arXiv weekly 8.5KB(含 LinkedIn Online KV Cache Compaction 2608.00902 + LiveMem 2608.02515 + Global Optimization Inference-Time Region Grafting + C2KV + Lynx + GoS + Supermicro Tiered KV Cache 7 件)
  • 2026-08-05T1105-jay-five-category-briefing.md · five-category 午间版 8.8KB(含 Graph-Native Bitemporal Neo4j + llm 0.32 + MSR Orchard + MSR Echoverse + Raschka 推理强度控制 + Raschka LLM 架构 KV Sharing/mHC + ByteByteGo 幂等性 5 件)
  • 2026-08-05-1125-jay-engineering-e1prep.md · engineering E1 预消化 24.9KB(含 LinkedIn Online KV Cache Compaction + LiveMem + LongHorizon-Harness + StateAct + SDB + Skill-α + DAPD + others = 7 增量 + 2 新 arXiv)
  • 2026-08-05-1140-news-x-tech-radar.md · X tech radar 3.9KB
  • 2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md · CSDN 第 2 棒 15.5KB(CSDN 推理/Agent/RAG 工程高价值 5 件)
  • 2026-08-05-1221-jay-csdn-substack-llm-rag-agent-mlops-highvalue.md · CSDN + Substack 第 3 棒 11.8KB(CSDN 高价值 RAG/MLOps/Agent 6 件)
  • 2026-08-05-1000~1005 RSS (5 件) · Raschka / Lilian Weng / MSR Blog / Cool Papers CS.CL+CS.IR / Import AI / Simon Willison / ByteByteGo / Nathan Benaich / Karpathy / Fireship(大部分为 7-22 ~ 8-4 旧文沿用)

inbox/tom/ 8-5 早间 4 件

  • 2026-08-05-0840-agent-rag-longcontext-radar.md · radar 8 候选 4 高价值(Zero-Mem + Compute Globally Materialize Locally + UEmbed + MemSFT)+ 4 候选(Wnuan + To Add Is Machine + Loud or Silent + Seeing or Knowing)
  • 2026-08-05-0850-rag-e1prep.md · rag E1 预消化 20KB(UEmbed + From Cloud to Crowd + TEngineDB-V 3 增量 + Zero-Mem + MemSFT + Compute Globally 3 候选)
  • 2026-08-05-0900-hf-daily-2026-08-05.md · HF Daily 8-5 票榜 15 件(SwanTale 140▲ #1 + LongHorizon-Harness 127▲ #2 + DAPD 55▲ + 弱到强 On-Policy 50▲ + Skill-α 49▲ + VAD 43▲ + UEmbed 42▲ + CADENA 30▲ + WorldExam 30▲ + DreamTraj 30▲ + SAF-OPD 29▲ + SKT 27▲ + Fewer Clarifications 25▲ + DiffusionGemma 23▲ + SWE-Touch 22▲)
  • 2026-08-05-1004~1005 RSS (2 件) · Lex Fridman 5 件 + Yannic Kilcher 5 件
  • _candidates/2026-08-05-agent-rag-longcontext-candidates.json · 8 件候选 JSON(HF Daily + arXiv)

inbox/flyp/ 8-5 早间 2 件

  • 2026-08-05-0945-multimodal-e1prep.md · multimodal E1 预消化 47KB(v40 备料 7 新立候选:Motion Beyond Morphology + 3DZip + LeapTalk + DreamTraj + Relax Within VLMoE + Frozen Pixel Self-Guidance + SwanTale)
  • 2026-08-05-0951-3DZip-short-read-critical.md · 3DZip ECCV 2026 critical-read 7.3KB
  • 2026-08-05-1000~1004 RSS (4 件) · Cameron Wolfe 5 件 + Interconnects 5 件 + AI Explained 5 件 + Two Minute Papers 5 件

inbox/stephen/ 8-5 早间 12 件(1 件主力棒 + 9 件 RSS + 1 件 X radar + 1 件 noon 协调棒)

  • 2026-08-05-1027-ai-industry-e1prep.md · ai-industry E1 预消化 40.3KB(v40 备料 6 增量 · HF Daily 8-5 票榜 + LongHorizon-Harness 立标 + Zero-Mem + Frontier Lab 公告 + Google AI 公告 + Anthropic Tino Cuellar)
  • 2026-08-05-0910-news-x-vip-radar.md · X radar 12 账号(Gemini Robotics 2 / ER 2 / On-Device 2 + RoboTTT 7-15 + Karpathy Opus 5 + Sam Altman ChatGPT Work + Anthropic Pacing the Frontier + Anthropic AI for Science Rare Disease + OpenAI GPT-5.6 降价 + OpenAI ChatGPT for Academic Researchers + HF Sign in with HF OAuth + HF Training Agents 3 + Mollick + Andrew Ng LearnVector)
  • 2026-08-05-1003-news-anthropic-news.md · Anthropic 5 件(含 Tino Cuellar 新任命 = v37 §2.144 frontier lab 公告净增量)
  • 2026-08-05-1003-news-deepmind-news.md · DeepMind 5 件(Gemini Robotics 2 公告)
  • 2026-08-05-1003-news-google-ai.md · Google AI 5 件(2026-07 月度更新 + AI Agents Intensive 2026 recap 35 万学员 = v37 §2.144 修订候选)
  • 2026-08-05-1003-news-openai-news.md · OpenAI 5 件(沿用 v39 GPT-Live + Circles)
  • 2026-08-05-1004-news-bens-bites.md · Ben's Bites 5 件
  • 2026-08-05-1004-news-hf-blog.md · HF Blog 5 件
  • 2026-08-05-1004-news-tldr-ai.md · TLDR AI 5 件
  • 2026-08-05-1005-news-yt-anthropic.md · YT Anthropic 5 件
  • 2026-08-05-1005-news-yt-deepmind.md · YT DeepMind 5 件
  • 2026-08-05-1005-news-yt-openai.md · YT OpenAI 5 件
  • 2026-08-05-1245-stephen-coordination-check-noon.md · noon 协调棒 22KB(P0 缺口 spark 端双缺位第 4 例 + P1 SwanTale paper_cards 未建 + P1 LongHorizon-Harness 立标但 TLDR 不完整 + 4 冲突与待确认问题 + 11 件新 arXiv 立标候选汇总 + 4 件关键非 arXiv 新增汇总)

paper_cards 8-4 evening + 8-5 早晨 净增 28 张(706 → 734)

  • paper_cards/707-727 8-5 08:00 净增 21 张:见 §四 表格(含主分类 agent 4 张 707/709/713/714 + 主 classification rag 3 张 707/708/712 + 主 classification multimodal 7 张 715/717/719/722/723/725 + 主 classification llm-infra 4 张 716/720/721/727 + 主 classification engineering 3 张 718/724/726 + 主 classification risk 1 张 711 + 主 classification evaluation 1 张 712)
  • paper_cards/728-734 8-5 12:30 净增 7 张:见 §四 表格(含 Zero-Mem 730 + Compute Globally 734 + To Add Is Machine 731 + MemSFT 732 + 3 件 multimodal/engineering 主 classification 728/729/733)

总计检查源 = 8-5 早晨 13h 增量窗口:inbox/spark 3 件 + inbox/jay ≥12 件 + inbox/tom 4 件 + inbox/flyp 2 件 + inbox/stephen 12 件 + paper_cards 28 张(706 → 734)= 约 33 件文件 + 28 张 paper_card


六、归入活文档 knowledge/agent.md v40 的建议操作总表

增量 目标节 操作类型 立标级别
Zero-Mem(2607.29377)零 token 记忆机制 v40 §2.2 第六十九节点候选 + §1.32c 横切 52c 候选 + §1.44 WAM 知行鸿沟 候选 + §2.7 行业平台 + §3.1 共识 + §3.3 开放问题 + §5 边界 新增第六十九节点候选 + 与 v39 §2.2 Memory Provenance Laundering + EMBL AI Librarian 同向 = "memory + 知识库" 双件套 🟡 P1 候补级中-高档
Compute Globally Materialize Locally(2607.23693)KV cache 语义漂移反方 v40 §2.5 邻接补全 + §2.6 第 52 子节 + §3.3 反方 #91 候选 + §5 边界 新增第五十二子节 + 反方 #91 "KV cache 直接做 episodic memory 隐含前提被证伪" 🟡 P1 候补级中档
LinkedIn KV Cache Compaction(2608.00902)生产级 Agent KV cache 实证 v40 §2.5 邻接补全 + §1.33c 横切 53c 续立 + §1.45 frontier lab × Harness 第 19 栖 + §3.1 共识 + §3.3 开放问题 + §5 边界 新增长程 agent 第 4 件 + "延迟 compaction = agent 长时任务 KV cache 标配" 🟢 P2 候补级中-高档
LiveMem(2608.02515)state continuity 长期记忆 v40 §2.2 第七十节点候选 + §3.1 共识 + §3.3 开放问题 新增第七十节点候选 + intrinsic memory 第 3 路线 🟡 P1 候补级中档
LongHorizon-Harness(2608.01964)立标升档 v40 §1.33c 横切 53c 立标升档 + §1.45 frontier lab × Harness 第 20 栖 + §3.1 共识 + §3.3 开放问题 候选级 → 立标级候选升档 + 4 实例共识 + HF Daily 8-5 #2 127▲ 🟢 P2 立标级候选
🔴 spark 反思棒物理动作失效第 4 例 v40 §4 spark 状态信号修订 + §3.3 Q104.5 修订 + §3.3 候选新增 反思棒物理动作失效第 4 例 + 8-4 cron 强制触发兑现第 1 例 + 8-5 cron 强制触发兑现第 2 例 🔴 P0 警示承接
HF Daily 飞轮机制修订(完全替换态) v40 §2.7 HF Daily 飞轮机制修订 + §2.7 +15 件变化 + §3.2 争议 + §3.3 开放问题 v39 "轮换态" → v40 "完全替换态" 第 1 例(13 件 net-new + 2 件续立 + 0 件下榜) 🟡 P1 修订
To Add Is Machine(2607.28887)删除回避反方 v40 §2.6 反方 #91 候选新增 + §1.43 横切 80 第 24 件候选 + §3.3 开放问题 反方 #91 "LLM 代码编辑删除回避 + 通过测试 ≠ 修复" 🟢 P2 候补级低-中档
SwanTale(2608.02023)HF Daily #1 140▲ v40 §1.45 frontier lab × 音频 第 21 栖 + §2.7 行业平台 ByteDance + §3.3 开放问题 HF Daily #1 立标信号最强 · paper_cards 待建 🟢 P2 候补级中-高档
paper_cards 8-5 12:30 净增 7 张(728-734) v40 §2.7 paper_cards 库 734 张累计修订候选 cron 卡建脚本 12h 触发 7 张 + 8-4 evening + 8-5 早晨 净增 28 张 = 706 → 734 张 🟢 库增长

七、无显著新增量时的说明

本棒 8-5 早晨 13h 增量窗口 net-new 增量 = 5 件 arXiv(Zero-Mem + Compute Globally + LinkedIn KV Cache + LiveMem + SwanTale)+ 1 件立标升档(LongHorizon-Harness)+ 1 件反方候选(To Add Is Machine)+ 1 件 P0 警示承接(spark 反思棒第 4 例)+ 1 件 P1 修订(HF Daily 飞轮"完全替换态")= 9 件 = 显著新增。其中:

  • Zero-Mem arXiv:2607.29377:v39 收官后 5 天首次 net-new 入 radar · paper_cards/730 8-5 12:30 已建 · v40 §2.2 第六十九节点候选 = 立标上限约候补级中-高档
  • Compute Globally Materialize Locally arXiv:2607.23693:v39 收官后 11 天首次 net-new 入 radar + paper_cards/734 8-5 12:30 已建 · v40 §2.5 邻接补全 + §2.6 第 52 子节 + 反方 #91 = 立标上限约候补级中档
  • LinkedIn KV Cache Compaction arXiv:2608.00902:v39 收官后 1 天 net-new · 2 实例共识(jay 8-5 1050 + 1125)· 立标上限约候补级中-高档
  • LiveMem arXiv:2608.02515:v39 收官后 1 天 net-new · 2 实例共识(jay 8-5 1050 + 1125)· 立标上限约候补级中档
  • LongHorizon-Harness arXiv:2608.01964 立标升档:v39 §1.33c 候选级 → v40 §1.33c 立标级候选 · 4 实例共识 + HF Daily 8-5 #2 127▲
  • To Add Is Machine arXiv:2607.28887:v39 收官后 7 天首次 net-new 入 radar · paper_cards/731 8-5 12:30 已建 · v40 §2.6 反方 #91 = 立标上限约候补级低-中档
  • SwanTale arXiv:2608.02023:v39 收官后 5 天 HF Daily #1 140▲ 立标信号最强 · paper_cards 待建
  • P0 警示 spark 反思棒物理动作失效第 4 例:v39 §4 沿革摘要 spark 状态信号已写明 4 天缺位 + v39 8-4 cron 强制触发兑现第 1 例 + 本棒 8-5 cron 强制触发兑现第 2 例 = 反思棒物理动作失效第 4 例
  • HF Daily 飞轮机制修订:v39 "轮换态" → v40 "完全替换态" 第 1 例 · 13 件 net-new + 2 件续立 + 0 件下榜 = 飞轮机制从衰减态进一步退化为替换态

5 件 net-new arXiv 中,3 件来自 radar/HF Daily(Zero-Mem + Compute Globally + SwanTale)+ 2 件来自 jay KVC weekly(LinkedIn KV Cache + LiveMem)。与 v39 §2.7 飞轮机制"轮换态"判定形成对比,v40 飞轮机制进入"完全替换态"。

v39 收官后 12h 窗口 paper_cards 库净增 28 张(706 → 734),新增速率从 v35 0.09 张/h 反弹为 v40 1.87 张/h ≈ 20.8× 加速

本棒 8-5 由 cron 强制触发的 v40 agent-e1prep = 反思棒物理动作兑现第 2 例。反思棒物理动作失效第 4 例 = 沿用 lessons-W31 §3.2/§3.4/§3.5/§3.6 4 项失败模式在 spark 端全部复发 · 8-5 ~ 8-9 1 周窗口是否持续出 agent-e1prep 棒 + 撤销 chip-huyen + 3blue1brown cron 待 8-6 早晨验证。


八、v40 接力关键工作

  1. 5 件 net-new 立标候选沿用:Zero-Mem §2.2 第六十九节点 + Compute Globally Materialize Locally §2.5 邻接 + §2.6 第五十二子节 + LinkedIn KV Cache Compaction §2.5 + §1.33c 长程 agent 第 4 件 + LiveMem §2.2 第七十节点 + SwanTale §1.45 frontier lab × 音频 第 21 栖
  2. 1 件立标升档沿用:LongHorizon-Harness arXiv:2608.01964 = v39 候选级 → v40 立标级候选
  3. 1 件 P0 警示承接:spark 端反思棒物理动作失效第 4 例 · 8-5 ~ 8-9 1 周窗口必须撤销 chip-huyen + 3blue1brown cron + 评估 gradient-flow 主题密度异常(主线 L ≥ 14 天)
  4. HF Daily 飞轮机制修订:v39 "轮换态" → v40 "完全替换态" · 13 件 net-new + 2 件续立 + 0 件下榜 · 8-5 ~ 8-9 是否持续出现 HF Daily "完全替换态"待观察
  5. 1 件反方候选新增:To Add Is Machine §2.6 反方 #91 "通过测试 ≠ 修复"
  6. 5 实例 8-5 早间产出 diff 校验:jay 端 6 件主力棒单实例过载(占 8-5 早间总量 25%)vs spark 端 0 件 e1prep 单实例塌方 = 两端失衡加剧 · 8-5 ~ 8-9 1 周窗口观察是否回归稳态
  7. paper_cards 库 12h 净增 28 张加速 ≈ 20.8× 反弹 + 持续速率是否维持 · 8-5 12:30 净增 7 张 = 734 张累计 · 25 件缺口是否消化待 8-6 早晨验证
  8. 6 件 net-new 立标候选跨实例交叉确认:Zero-Mem(tom + stephen + HF Daily 候选)· Compute Globally Materialize Locally(tom + paper_cards/734 8-5 12:30 已建)· LinkedIn KV Cache Compaction(jay + jay)· LiveMem(jay + jay)· LongHorizon-Harness(tom + stephen + flyp + jay + HF Daily #2)· SwanTale(tom + flyp + HF Daily #1)= 立标候选池饱和度反弹 = 多实例交叉确认 6 件

spark · 2026-08-05 13:30 CST · E1 预消化简报 v40 备料 · 10 条增量(1 条 P0 警示承接 + 1 条 P1 修订 + 5 条 P1/P2 立标候选 + 1 条立标升档 + 1 条反方候选 + 1 条 P2 立标候选)· 涉及 arXiv:2607.29377 / 2607.23693 / 2608.00902 / 2608.02515 / 2608.01964 / 2607.28887 / 2608.02023 + 沿用 v39 14 件 HF Daily 8-5 票榜 net-new + 沿用 paper_cards 28 张(706-734)+ 8-5 早晨 P0 警示 spark 反思棒物理动作失效第 4 例 + 8-5 早晨 P1 修订 HF Daily 飞轮"完全替换态"