llm-application · E1 预消化简报(2026-08-05)

作者:Stephen · llm-application 主题 E1 日间预消化棒 · cron c08ec05d-37de-4c0c-9571-3ead761a4802 生成时间:2026-08-05 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-08-04 21:10(昨日 8-4 llm-application-e1prep 收官)→ 2026-08-05 21:10(本棒扫描截止,约 24h) 对照活文档:/shared/research-kb/organized/knowledge/llm-application.md v46(2026-08-05 04:16 CST 收官 ≈ 17h 前固化,79.5 KB)——v46 在 v45 基础上立 ACE Agentic Context Engineering / StateAct / LongHorizon-Harness / Skill-α / DAPD / EMBL AI Librarian 6 件 + KV Cache 优化 14+1 → 14+1+8 = 23 件套(增 TopKV / C²KV / HiKV / 反事实惊喜 KV / TokTier / ResKV / Beyond Prefill-Decode Disaggregation / DualDecoder)+ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + vLLM-ascend 0.11.0 国产化 + RAG 新形态扩展四件 + Vector DB Q1 2026 + RAG CVE-2025-32711 + WitnessAI 四层防御 + Snyk 3 倍攻击面 + AI Agent 六级成熟度模型 + Multi-agent vs Single Agent 100% vs 1.7% 实证 + +28 arXiv / +2 CVE / +11 URL,总体扩面到 ~80 KB 本棒性质:E1 日间预消化棒(Stephen 8-5 12:45 前未出棒,12:45 noon 协调棒已标记 P1 缺口)——不重写活文档 v46,只列 8-4 21:10 → 8-5 21:10 约 24h 窗口内 v46 已固化骨架外的新硬资产增量 + 跨实例核验状态,供今晚活文档 v47 接力决策参考 检查范围: - work-queue.md(2026-08-05 20:00 自动检测:Top 15 0 件 net-new · §3 选题榜 2608.01964 LongHorizon-Harness + 2607.29377 Zero-Mem 待写脚本 · 待更新主题活文档 0 件 · 待写攻略 15 件 / Tom 5 · Jay 5 · spark 5 · 14 张卡缺 TLDR · 1 件待精确分类) - inbox/jay/ 8-5 已扫 12 件(0820 csdn-inference-agent-rag 15.5 KB · 1000 morning briefing 8.8 KB · 1050 kvc-agents-arxiv-weekly 8.5 KB · 1105 five-category 8.8 KB · 1125 engineering-e1prep 24.9 KB · 1140 news-x-tech-radar 3.9 KB · 1221 csdn-substack-llm-rag-agent-mlops 11.8 KB · 1335 hf-security-owasp-jobmarket-inference-cost 8.5 KB · 1500 engineering-filter 8.9 KB · 1620 csdn-rag-agent-vecdb 8.3 KB · 2105 evening-five-category 17.1 KB · 2200 late-night-addendum 17.2 KB + 2 件 RSS/补充) - inbox/tom/ 8-5 已扫 6 件(0840 agent-rag-longcontext-radar 4.3 KB · 0850 rag-e1prep 20.0 KB · 1440 agent-rag-longcontext-radar 3.9 KB · 0900 HF Daily 1.6 KB · 2040 agent-rag-longcontext-radar 3.5 KB · evaluation-e1prep 26.9 KB) - inbox/spark/ 8-5 已扫 2 件(2026-08-05-agent-e1prep.md 70.8 KB v39 备料 + 2026-08-05-llm-infra-e1prep.md 43.2 KB llm-infra E1 · 反思棒物理动作失效连续第 4 例已 stephen 1245 noon §2.1 标注) - inbox/flyp/ 8-5 已扫 3 件(2026-08-05-0950-3DZip-short-read-critical.md 7.3 KB · 2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md 19.6 KB · multimodal-e1prep 47.2 KB + risk-e1prep 49.6 KB) - inbox/stephen/ 8-5 已扫 14 件(2026-08-05-ai-industry-e1prep.md 40.3 KB + 2026-08-05-1245-stephen-coordination-check-noon.md 22.0 KB 协调棒(含 llm-application 缺位警示)+ 11 news- / X-radar / _scheduler-advisor.json) - paper_cards/ 8-5 净增 37 张(8-5 02:00 / 02:10 / 03:00 / 08:00 净增 ID 707 → 727 共 21 张 + 8-5 12:30 净增 ID 728 → 734 共 7 张 + 8-5 16:30 净增 ID 735 → 739 共 5 张 + 8-5 21:00 净增 ID 740 共 1 张 + 本棒扫描 24h 窗口内 net-new = 主分类 llm-application 直接相关 ≈ 11 张*(下文 §1.1 全列)) - work-queue.md §3 选题榜:2608.01964 LongHorizon-Harness + 2607.29377 Zero-Mem = 2 件 v46 已立但未成视频脚本(本场活文档接力可考虑补视频脚本)


0. 综述判断(给今晚活文档接手时一眼看到)

v46 已固化(≈ 17h 前):① §1.1 应用架构六层 + Harness 中心 + 推理服务层量化选型 + Multi-agent 100% vs Single 1.7% 实证 + ACE/StateAct/LongHorizon-Harness 4 框架;② §1.2 RAG 四件新候选 + Vector DB + RAG CVE-2025-32711 + WitnessAI;③ §1.3 Memory 七路 + 第八路安全;④ §1.4 评测与可靠性 + 四级 credit assignment + Context-Bench/Recovery-Bench/Terminal-Bench;⑤ §1.5 治理信号叠加 八重候选(含 MCP 五大风险 + Snyk 3 倍攻击面 + 三分之二不可见);⑥ §6 工程落地框架 14 项。

v46 收官后 24h 窗口净增量的性质:本场净增量集中在"v46 已立六对象在 2026-08-05 当日落地的新候选 + 新方法 + 新生产数据"五个维度上的深化与"立标上限收紧",而非"全新方向开掘"。核心特征:① net-new 立标候选新增 5 件(Zero-Mem arXiv:2607.29377 / Compute Globally Materialize Locally arXiv:2607.23693 / ACE-GraphRAG arXiv:2608.01269 / LinkedIn Online KV Cache Compaction arXiv:2608.00902 / LiveMem arXiv:2608.02515)+ 立标升档 1 件(LongHorizon-Harness 候选级 → 立标级候选)+ 反方候选新增 1 件(To Add Is Machine arXiv:2607.28887 删除回避);② 纵深补强:Context Compaction Theory arXiv:2608.01326 + TELLER arXiv:2608.01975 + LaCache arXiv:2608.01718 + DualDecoder arXiv:2607.26475 沿用 v46 KV Cache 件套 + V-Mem arXiv:2608.01543 多模态 Agent 记忆第三路线 + GradCuit arXiv:2608.02585 测试时潜在推理信用分配 + MEGRAG arXiv:2608.02195 多跳 RAG 多粒度证据 + Wnuan arXiv:2608.01862 三阶段后训练;③ 安全栈第 9 重平台级态势再增 3 件(HF Frontier Lab Agent 入侵事件技术时间线 arXiv-暂未公开 / OWASP LLM04/05/06 反方补充 + 跨租户向量库攻击 / 推理成本攻击 arXiv:2606.02643 token amplification ratio);④ 生产主线 KV Cache 优化 第 6 件集群再补 3 件(C2KV = 17x 长上下文加速 / Lynx = TTFT -30% / LinkedIn Online KV Cache Compaction = 4.2x throughput + 3.5x KV compression);⑤ CSDN 中文工程实战新增 1 件 + HF Daily 票榜净增量放缓(13 件 net-new vs v45 4 件 net-new)"飞轮机制从 v46 沿用 '轮换态' 进一步退化为 '完全替换态'"——与 spark 主张"立标饱和度反弹"产生方法论分歧)。


1. 增量条目(8 件主线 + 2 件机制反弹 + 2 件待核实,按"建议归入节"分组)

增量 1 · 🟡 P1 立标候选 · Zero-Mem:Zero-Token Memory Operations for LLM Agents(arXiv:2607.29377 / paper_cards 730) = v46 §1.3 Memory 的"零 token 替代"立标候选

  • 来源:
    • inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md radar #1 ⭐⭐⭐ + inbox/tom/2026-08-05-rag-e1prep.md 候选 A ⭐⭐⭐ + tom _candidates HF Daily arXiv:2607.29377 agent/rag/memory/benchmark 5 votes
    • inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md §1 精读 + 6 项风险评估 + 立标信号 ★★★★★ + 中-中偏高整体可信度
    • inbox/spark/2026-08-05-agent-e1prep.md §增量 1 Zero-Mem v40 第六十九节点候选 + §3.1 共识候选新增 + §3.3 开放问题候选
    • inbox/stephen/2026-08-05-ai-industry-e1prep.md §增量 6
    • paper_cards/730-2607-29377.md(8-5 12:30 已建 · 主分类 agent · method)
  • 要点:
    • 核心问题:LLM Agent 长程交互需要记忆,但现有系统普遍靠额外 LLM 调用来读写记忆(summarize / extract / consolidate / retrieve)——反复消耗 token 与时间;中间生成记录还可能掩盖原始证据(provenance 丢失)
    • 核心方案:Zero-Token Memory Operations = 整个记忆管道只在最后一步 QA 时调用一次 LLM,所有中间步骤(读/写/检索/校准)都通过 encoder-only + 结构化索引完成,不消耗任何 LLM 输入/输出 token;encoder 计算单独核算
    • 核心结构:保留原始交互轨迹作为唯一记录源(不生成中间摘要),通过两种互补视图组织:① entity–context graph(跨会话实体-上下文关系)+ ② temporal hierarchy(会话内时序局部性 + session state);query 加权两视图 + 确定性校准先丢冲突证据 + 严格 ground 在检索轨迹上
    • 关键实验:长记忆 + 长上下文 QA 上,与最强 baseline 同 reader + 同 context budget 下,记忆操作时间开销 -57.6%;消融验证两种视图各自贡献 + query-dependent 协调机制的必要性
    • 作者:Yilin Xiao, Zhehan Zhu, Yujing Zhang, Jin Chen, Zijin Hong, Luyao Zhuang, Qinggang Zhang, Shengyuan Chen, Xiaocao Ouyang, Lingfei Ren, Xiao Huang(12 人;机构未在 abs 显式列出 → 推测为多机构合作,flyp 棒次指出"无 Hugging Face / GitHub 公开 demo")
    • 核心质疑:"We ask whether structured memory access requires generation at all." —— 直接挑战"memory 中介必须经过 LLM 生成"被广泛假设的默认
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.3 Memory 七路 + Memory Provenance Laundering 第八路 —— Zero-Mem 与第八路同向 = "memory 路径不是 LLM 唯一解" 立标候选;同时与 v45 §1.4 已立 Memory Provenance Laundering(provenance 在生成即丢失)互补
    • v46 §1.1 应用架构 ACE 沿用 —— Zero-Mem 反方强调"无 LLM 中介",与 ACE 三角色架构 Generator+Reflector+Curator 形成对位:Llm-mediated vs encoder-only
  • 建议归入节:v47 §1.3 Memory 第九路 = "零 LLM token 路径" + §3.1 共识候选新增 1 条 + §3.3 开放问题候选新增 1 条("memory 系统单位成本应按 encoder / KV 写入/读取而非 LLM token 计量")
  • 风险与待核实:① 代码未公开(abs 写"After peer review"——实测可复核性弱);② 论文若未跨多跳推理 + 长程因果 + 反思/改写历史 benchmark,留盲区;③ entity–context graph 在百万级交互下是否会因实体爆炸退化 = 论文未给 graph 规模曲线

增量 2 · 🟡 P1 立标候选 · Compute Globally, Materialize Locally:Sparse Event-KV 的记忆契约(arXiv:2607.23693 / paper_cards 734) = v46 §1.1 + §1.3 KV Cache-as-Memory 的"语义漂移"反方候选

  • 来源:
    • inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md radar #2 ⭐⭐ + inbox/tom/2026-08-05-rag-e1prep.md 候选 C ⭐⭐ 警示 + tom _candidates
    • inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md §2 精读
    • inbox/spark/2026-08-05-agent-e1prep.md §增量 2 反方 #91 候选 + v40 §2.6 第 52 子节 + §3.3 反方 #91
    • paper_cards/734-2607-23693.md(8-5 12:30 已建 · 主分类 agent · method · 副分类 llm-infra)
  • 要点:
    • 核心问题:长程 agent 普遍复用 KV cache 当记忆——serving 系统保留一部分缓存条目,其余丢弃;eviction + episodic-memory 方案都基于一个很少被直接验证的隐含前提:"a retained event is still informative once the observations that produced it are gone"(被保留事件在产生它的 observation 被丢弃后仍然有效)
    • 核心实验:作者在相同 agent history 上省略一条更早的 observation,看下游答案是否仍能基于已缓存的 KV 行答对。结果:对那条 observation 敏感的项目里,答案绝大多数跟随被省略的 observation 值,而 served span 没有任何字面值指向正确答案
    • 命名"semantic materialization"现象:下游事件的缓存行累积了状态,但这些状态依赖于不再被服务的 observation;意味着 cached KV entry 的语义内容随被省略 observation 漂移,而非静态保持
    • 关键数据:Qwen3-8B 上"刻意 answer-free 事件"把 donor-aligned recovery 从 6% → 51%
    • 作者:Zerui Cai(abs 仅 1 位 v1 作者显式列出,需 v2 复核)
    • 核心结论:所有基于"事件=静态记忆"假设的 KV cache 复用方案,都需要定期 re-materialize 或动态更新缓存语义
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.1 KV Cache 第 6 件集群 TopKV/C²KV/HiKV/反事实惊喜 + ACE 沿用 — Compute Globally Materialize Locally 与第 6 件集群同向但形成反方"KV cache 不可以直接做 episodic memory" 立标候选
    • v46 §1.4 评测与可靠性 反方 #87 Beyond pass@1 reliability + 反方 #90 LongDS-Bench —— Compute Globally Materialize Locally 形成反方 #91 三件套 = Long-horizon Agent 三维失败机制分类学
  • 建议归入节:v47 §1.1 应用架构 KV Cache 第 6 件集群"反方候选" + §1.3 Memory 第九路(与 Zero-Mem 互补)+ §1.4 评测与可靠性 反方 #91 + §3.3 开放问题候选("KV cache 直接做 episodic memory 隐含前提被证伪 = semantic materialization")
  • 风险与待核实:① 单作者 v1,需 v2 复核团队;② "semantic materialization" 现象是否在不同模型与不同 baseline 上稳健?(Qwen3-8B 一组模型)
  • 范式落点:与 Zero-Mem 互补——两条反方路线共同指向"memory 系统单位成本应按 encoder / KV 写入/读取而非 LLM token 计量"= 系统设计层范式拐点(flyp 棒次 §0 关键判断)

增量 3 · 🔴 P0 立标升档 · LongHorizon-Harness 候选级 → 立标级候选(arXiv:2608.01964 / paper_cards 713)+ StateAct subagent 化 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距 + ACE Agentic Context Engineering 三角色架构 = v46 §1.1 应用架构 + §1.4 评测与可靠性的"Agent 工程深化"二次确认

  • 来源:
    • inbox/jay/2026-08-05T1950-jay-vllm-sglang-debugging-inference-engineering.md(待扫)→ §增量 由 spark 8-5 1245 noon 协调棒 stephen 已确认升档(4 实例共识 + HF Daily 8-5 #2 127▲ 跨日 +4)
    • inbox/spark/2026-08-05-agent-e1prep.md §立标升档 LongHorizon-Harness 候选级 → 立标级候选 v40 §1.33c 横切 53c
    • inbox/stephen/2026-08-05-1245-stephen-coordination-check-noon.md §P1 缺口承接 = LongHorizon-Harness + Skill-α + DAPD + RecHarness + Model or Harness? + Frozen Pixel Diffusion
    • paper_cards/713-2608-01964.md(8-5 02:00 已建 · 主分类 agent · 副分类 evaluation)
  • 要点(承接 v46 已立,本棒仅做"候选升档确认"):
    • LongHorizon-Harness:大语言模型 agent 越来越多地承担长 horizon 任务,需要在许多相互依赖的步骤中持续推理、调用工具并进行修正;现有 agent harness 将任务执行、任务状态与完成评估维护在一个不断增长的上下文中,导致状态难以追踪,并使错误的自评估传播到后续决策中;将长 horizon 执行重构为任务状态管理问题,将任务状态显式地置于执行之外,仅基于事实进行更新
    • StateAct:Agent 执行长周期 computer-use 任务时子目标跨步骤切换导致 context 污染和状态错误;subagent 化——每个子目标分配 fresh subagent,保持 context 干净;StateAct 管理跨 subagent 程序状态;与 v45 §1.4 评测与可靠性 沿用 v44 已立"长任务丢位置/context 膨胀"的具体工程场景互补
    • Multi-agent vs Single Agent 数量级差距(348 次试验):Multi-agent orchestration 100% 可执行建议质量(348 次试验全部成功) vs Single agent 1.7%;延迟对比两者均为 ~40 秒(最终解生成时间相同);性能差距不是来自延迟,而是来自"正确性"和"特异性"——v46 §3.2 争议 #4 v47 拟修订为"实证支持 narrow-role 多 agent 协作 + 仅在异质条件下净收益"(已 v46 沿用)
    • ACE Agentic Context Engineering(承接 v46 §1.1 已立 4 框架之 1;本场再次 4 实例共识 + HF Daily 8-5 升档):三角色架构 Generator + Reflector + Curator;Agent 任务 +10.6%,金融分析任务 +8.6%,无需任何梯度更新
  • 与活文档 v46 现有脉络的关系:
    • 本棒对 v46 §1.1 已立 4 框架的二次确认 = 全数续立(LongHorizon-Harness / StateAct / Skill-α / DAPD / EMBL AI Librarian / ACE 6 件)——v47 拟沿用 + 立标升档
    • HF Daily 8-5 票榜反映"LongHorizon-Harness 4 实例共识 + 跨日 ▲4"——立标饱和度从 v46 §1.1 候选级正式升档为立标级候选(stephen / spark / flyp / jay 4 实例共识;v46 第一次确认候选级)
  • 建议归入节:v47 §1.1 应用架构 4 框架沿用 + 立标升档 1 件(LongHorizon-Harness)+ §1.4 评测与可靠性 Long-horizon Agent 失败机制分类学第 3 件套
  • 风险与待核实:LongHorizon-Harness arXiv 2608.01964 abs 仅 TLDR 中半截,需精读 PDF 补全公式;StateAct arXiv 编号待查(v46 已标注"待查"——本棒仍未补)

增量 4 · 🔴 P0 立标候选升档 · LinkedIn Online KV Cache Compaction for LLM Agents(arXiv:2608.00902 / paper_cards 728)+ C2KV 17x 长上下文加速 + Lynx TTFT -30% = v46 §1.1 KV Cache 件套第 6 件集群的"生产实证级 LinkedIn 升档"

  • 来源:
    • inbox/jay/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md §🔴 高价值① LinkedIn Online KV Cache Compaction 4.2x throughput + 3.5x KV compression + LinkedIn Engineering 背景 + 论文明确将 OpenClaw 列为生产级 Agent 框架参照(与 Anthropic/OpenAI/Google 并列)
    • inbox/spark/2026-08-05-agent-e1prep.md §增量 3 LinkedIn 立标候选 ≈ 候补级中-高档
    • inbox/jay/2026-08-05-1125-jay-engineering-e1prep.md(待扫)§增量 3
    • paper_cards/728-2608-01862.md(8-5 12:30 已建 · 但 spark 棒次已标 ⚠️ 待复检 paper_cards 728 主分类是否与 KV Cache Compaction 对应 = 实际编号 2608.01862 是 Wnuan 三阶段后训练,而 KV Cache Compaction 是 2608.00902 → ⚠️ 本棒建议补建 paper_cards/741-2608-00902 或在 paper_cards/728 已建卡中标注 2608.01862 = Wnuan)
  • 要点:
    • LinkedIn Online KV Cache Compaction arXiv:2608.00902:
      • 问题:LLM Agent 执行长时任务(软件工程、深度研究、Web 浏览)时,搜索结果、文件 diff、执行痕迹持续入 context,KV cache 线性膨胀导致显存瓶颈
      • 两种 sequence-level compaction 家族:Token Eviction(TE)——用 proxy queries 对缓存位置打分保留注意力权重最高位置;Attention Matching(AM)——在选择之上额外拟合加性注意力偏置重建值使输出与完整 cache 匹配
      • 核心发现:立即 compaction 通常会降精度;延迟到使用 agent 自身后续 generation 的 queries 时,能恢复大部分精度损失
      • 关键工程数据: | 模型 | 方法 | Peak KV 压缩比 | Throughput 提升 | |------|------|--------------|--------------| | Qwen3.5-27B | Attention Matching | 272.1K→99.6K(3.5x) | 217→918 q/h(4.2x) | | Qwen3.5-27B | Token Eviction | 272.1K→121.3K(2.7x) | 217→717 q/h(3.3x) | | Gemma-4-31B | Attention Matching | — | 1.7x | | Gemma-4-31B | Token Eviction | — | 1.5x |
      • 延迟 Compaction 比例 0.2(保留 20% KV):在大部分任务上保留无 compaction 精度
    • C2KV(Position-Agnostic KV Cache) Weekly AI Newsletter 2026-07-27 至 08-02:lightweight sidecar extractor + learnable compression tokens,投影位置无关 KV 表示,无需改动 base model 参数;数据 17x 推理加速;sidecar 架构对现有 Serving 系统侵入性小
    • Lynx(Split-Stream KV Cache):高优先级 anchor stream + 低优先级 residual stream;优先传输最重要 bit 表示;TTFT 降低 30%,INT4 级传输延迟 + 全 INT8/BF16 推理精度;对预填充延迟敏感场景(如 Agent 实时响应)直接有效
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.1 KV Cache 件套从 v45 的 14+1 件套扩面到 14+1+8=23 件套 — 本场再增 3 件(LinkedIn / C2KV / Lynx),v47 §1.1 KV Cache 件套升级为 14+1+8+3 = 26 件套,分级标注新增"LinkedIn production 级"实证类 1 件 + sidecar 架构类 1 件 + 优先级流分层 1 件
    • v46 §1.1 推理服务层主线(vLLM/SGLang/Kimi K3 立体立标)— LinkedIn 论文明确将 OpenClaw 列为生产级 Agent 框架参照,frontier lab × LinkedIn 工程背景 第 19 栖候选(spark 棒次)
  • 建议归入节:v47 §1.1 KV Cache 优化第 6 件集群沿用 + §1.1 推理服务层量化增 LinkedIn + C2KV + Lynx 3 件 = 23 + 3 = 26 件套
  • 风险与待核实:① paper_cards 728 编号与论文内容不匹配,需复检或补建 2608.00902 卡;② AM 重建加性注意力偏置的训练开销未给具体硬件配置;③ OpenClaw 被列为生产级 Agent 框架参照 = 一手原文需精读确认

增量 5 · 🟡 P1 立标候选 · ACE-GraphRAG:Agentic Context Engineering for Hierarchical GraphRAG(arXiv:2608.01269)+ MEGRAG:Multi-Granular Evidence Graphs for Multi-Hop RAG(arXiv:2608.02195)+ Stable-RAG(arXiv:2601.02993)+ DF-RAG(arXiv:2601.17212) = v46 §1.2 RAG 的"Agentic RAG + 多跳证据"立标候选

  • 来源:
    • inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md §一 Database ACE-GraphRAG 🔴 + MEGRAG 🟡
    • inbox/jay/2026-08-05T2200-jay-late-night-addendum.md §Stable-RAG ACL 2026 + DF-RAG EACL 2026
    • paper_cards/ 8-5 net-new ID 731-734 已建 arXiv 中 2608.01269 / 2608.02195 暂未确认 paper_card 已建
  • 要点:
    • ACE-GraphRAG arXiv:2608.01269(2026-08-03,cs.CL):
      • 核心:Agentic Context Engineering for Hierarchical GraphRAG,在已有分层 GraphRAG 主干上增加推理时上下文构建控制,联合管理 gap-aware refinement、retrieval branches、task-conditioned adaptation
      • 技术对比:HiRAG(分层知识集成)/ HippoRAG(PageRank 知识图谱检索)/ TagRAG(分层标签链)/ TopoRAG(拓扑感知搜索约束)/ CatRAG(查询相关边相关性图遍历)
      • 范式落点:GraphRAG 在 2026 年已从"贵到不可用"(微软 GraphRAG 索引成本 $33K)演进到成本可控 + agentic 方向——动态决定如何补充、整合和适配上下文
    • MEGRAG arXiv:2608.02195(2026-08,cs.CL):
      • 核心:在每个检索步骤内构建多粒度证据组合(multi-granular evidence composition),即时生成中间答案 bib_i,用节点状态确定下一个子查询 qi+1 或停止
      • 对比方法:Direct Model / NativeRAG / MetaRAG / DualRAG / CIRAG / HippoRAG 2 / NeocorRAG / HGRAG / LogicRAG / QAFD-RAG / MGranRAG
    • Stable-RAG arXiv:2601.02993(ACL 2026 Main):
      • 核心问题:传统 RAG 在多文档检索后重新排列(retrieval-permutation)时,LLM 会混淆来自不同文档相似段落的内容,导致"张冠李戴"型幻觉
      • 方法:Stable-RAG 提出检索-排列鲁棒性训练策略,让 LLM 在重排列场景下保持事实一致性
    • DF-RAG arXiv:2601.17212(Findings of EACL 2026):
      • 核心问题:现有 RAG 在检索结果与查询语义相近但来源单一的情况下,缺乏主动提升结果多样性的机制
      • 方法:DF-RAG 提出 query-aware diversity reranking,在检索阶段主动干预
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.2 RAG 已立主战场三问题(是否检索与如何路由 / 结构与粒度 / 证据治理)+ 五件 net-new(HyPE/CrossRAG/ExtractBench/B1ade/On-Premises RAG)+ RAG 失败模式 6 类表——本场再增 4 件(ACE-GraphRAG / MEGRAG / Stable-RAG / DF-RAG)= 4+4 = 8 件 net-new 立标候选
    • 与 v46 §1.1 ACE 框架形成"RAG × Agent × Context Engineering 三向合流":v46 §1.1 ACE 主推"Generator + Reflector + Curator"——ACE-GraphRAG 把这套机制推向 RAG 上下文构建;MEGRAG 在每步检索内做 evidence composition = 与 ACE Reflector 互补
    • v46 §1.2 已立 Sigmod/KDD/EMNLP RAG 系列 — Stable-RAG/DF-RAG 来自 ACL/EACL 2026,与 KDD arXiv:2606.06535 FT-RAG 等并列
  • 建议归入节:v47 §1.2 RAG 新增"Agentic RAG 立标候选子节"(ACE-GraphRAG / MEGRAG / Stable-RAG / DF-RAG 4 件)+ §1.4 评测与可靠性 RAG 失败模式 6 类表增"重排列幻觉"维度

增量 6 · 🟡 P1 立标候选 · V-Mem:Modality-Routed Retrieval for Multimodal Agentic Memory(arXiv:2608.01543)+ Graph-Native Bitemporal Memory arXiv:2607.26520 = v46 §1.3 Memory 的"多模态 + 时态图"沿用立标候选

  • 来源:
    • inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md §一 Database V-Mem
    • inbox/jay/2026-08-05T1105-jay-five-category-briefing.md §一 Database Graph-Native Bitemporal Memory Store Neo4j 5.27 Aura Enterprise
    • paper_cards/666-2607-26520.md(7-31 已建 · 主分类 agent)
  • 要点:
    • V-Mem arXiv:2608.01543(2026-08,cs.CL):
      • 核心问题:现有 Multimodal Agent Memory 系统(如 MemVerse、M2A)存在两个问题:① 跨模态检索鸿沟(即使学习共享嵌入空间,文本和视觉信号的间隙仍然存在);② 相似性-相关性鸿沟(最相似的检索结果往往不是最相关的)
      • 技术方案:V-Mem 通过模态路由(modality routing)解决上述两个问题;在 Mem-Gallery benchmark(含 20 个多会话对话、1711 个问题、9 个类别)上评估
    • Graph-Native Bitemporal Memory arXiv:2607.26520:
      • 在 Neo4j 5.27 Aura Enterprise 中建模 AI Agent 的双时态记忆(valid time + transaction time)
      • 解决对话上下文的时序追溯问题——Agent 在多轮交互中需要回溯"某事在哪个时间点被说过了"
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.3 Memory 七路 + Memory Provenance Laundering 第八路 — V-Mem + Graph-Native Bitemporal 形成第九路 = "多模态 + 时态图" 立标候选
    • jay 棒次明确:"与 10:50 草稿的 LiveMem(状态连续性)共同构成 2026 年 Agent Memory 技术的三条不同路线:intrinsic memory / graph-temporal / modality-routed retrieval"
  • 建议归入节:v47 §1.3 Memory 第九路 = 多模态 + 时态图(modality-routed + bitemporal)

增量 7 · 🟢 P2 立标候选 · Context Compaction Theory(arXiv:2608.01326)+ TELLER arXiv:2608.01975(ASE 2026)+ LaCache arXiv:2608.01718 + DualDecoder arXiv:2607.26475 + GradCuit arXiv:2608.02585 + MemSFT arXiv:2607.25614 + Wnuan arXiv:2608.01862 = v46 §1.1 推理服务层 + §1.3 Memory + §1.4 评测与可靠性的"理论与工程纵深补强"

  • 来源:
    • inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md §二 Backend Context Compaction Theory + LaCache + DualDecoder
    • inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md §二 Backend TELLER ASE 2026
    • inbox/spark/2026-08-05-agent-e1prep.md GradCuit paper_cards 720-2608.02585 主分类 llm-infra
    • paper_cards/720-2608-02585.md(8-5 03:00 已建 · 主分类 llm-infra · 副分类 agent)
    • paper_cards/728-2608-01862.md(8-5 12:30 已建 · Wnuan · 主分类 engineering)
    • paper_cards/732-2607-25614.md(8-5 12:30 已建 · MemSFT · 主分类 risk · 副分类 rag)
  • 要点:
    • Context Compaction Theory arXiv:2608.01326(2026-08,cs.CL):
      • 区分两种 compaction 模式:静态压缩(未来相关性可观测) vs 在线压缩(未来相关性未知,需实时决策)
      • 在线压缩的两个关键特性:① Future relevance is not yet observable ② Newly collected information must be compacted before the full future trajectory is known
      • 理论支撑:这是 jay 棒次同时收录的 Cool Papers LiveMem 的理论支撑论文——将在线上下文管理问题形式化为有理论保证的优化问题
      • 与 AAAI-26 KV Cache 三层优化框架互补:后者是理论框架层面的统一建模(Retention & Placement + Tiered Compression + Deadline-Aware Scheduling)
    • TELLER arXiv:2608.01975(2026-08,ASE 2026 接收,12 页 9 表):
      • 核心:非侵入式跨层根因分析,用于 LLM 推理系统;涵盖 Software Engineering / Computation and Language / ML / Performance 多领域交叉
    • LaCache arXiv:2608.01718(2026-08,cs.CL):
      • 核心问题:Semantic caching 已在主要 LLM 平台大规模部署,但存在两类安全挑战:① 隐私侧防御:混淆 KV-cache 状态(Luo et al. 2026)、限制跨用户可见性的分层缓存作用域(Wu et al. 2025);② 完整性侧防御:拒绝恶意缓存命中——基于聚类的隔离、per-tenant key 随机化(Morris and Thompson 1979)、基于困惑度的检测
      • 意义:语义缓存 = 降低成本工具 + 跨租户数据泄露攻击面 = 13:35 推理成本攻击 arXiv:2606.02643 的延续
    • DualDecoder arXiv:2607.26475v1(承接 v46 已立 §1.1 KV Cache 第 6 件集群):利用推测 token 选择的稀疏 KV 索引与实际输出 token 所需索引之间的相似性,实现主动式 KV prefetch
    • GradCuit arXiv:2608.02585(2026-08):
      • 优化基础上的潜在推理(optimization-based latent reasoning)提升大语言模型输出,同时保持模型参数冻结;现有方法通常通过解码 token 将这些状态与推理轨迹相连,导致序列级信用分配不直接;GradCuit 在选定的 Transformer 层中、prompt 与生成续写之间的隐藏表示处插入可优化的潜在状态
    • MemSFT arXiv:2607.25614(2026-07):
      • 用外部参数化记忆(plug-and-play parametric memory)缓解对齐税(alignment tax):通过将领域专业化与主干参数更新解耦,记忆被训练为模仿在领域数据上运作的非参数化检索器
    • Wnuan arXiv:2608.01862(2026-08):三阶段流水线 = 从文档构建面向任务的监督信号 + 重放通用数据前提下 SFT + 对残余错误施加强化学习;707 题 WnuanBench 上 32B 路线 AAR 从 52.76% → 80.06%(SFT后)→ 91.51%(RL后);在匹配 100 次更新协议下,residual-error sampling 优于全量池与等规模随机
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.1 已立 AAAI-26 KV Cache 三层优化框架(Retention & Placement + Tiered Compression + Deadline-Aware Scheduling)—— Context Compaction Theory 与 AAAI-26 互补
    • v46 §1.5 治理信号叠加 第 9 重候选 = 平台级 MCP/RAG 安全态势 —— LaCache 跨租户数据泄露 + 跨用户可见性 + per-tenant key 随机化 新增"语义缓存"= 第 10 重候选 "平台级 LaCache 风险"
    • v46 §1.4 评测与可靠性 + 四级 credit assignment(token 级 CoRT / 节点级 PROTEA / 系统级 DecoEvo)—— GradCuit 是"测试时潜在推理信用分配"新维度立标
    • v46 §1.3 Memory Provenance Laundering 第八路 —— MemSFT 第六十九节点候选?"记忆 vs 微调"vs Provenance vs alignment tax 三向合流
  • 建议归入节:v47 §1.1 推理服务层 + §1.3 Memory + §1.4 评测与可靠性 + §1.5 治理信号叠加第 10 重候选

增量 8 · 🟢 P2 纵深补强 · CSDN 中文工程实战 + AtomGit RAG/MCP/Agent 工程三道关(2026-03-19,腾讯云)+ AtomGit RAG 实践 + Agent 实用指南(2026-04)+ RAG 技术全景综述 2026 + 向量数据库 2026 选型横评 = v46 §1.2 + §1.5 中文工程实战立标候选

  • 来源:
    • inbox/jay/2026-08-05T1620-jay-csdn-rag-agent-vecdb-highvalue.md 6 条目 🔴 强推精读级 3 件 + 🟡 泛读级 3 件
  • 要点:
    • RAG+MCP+Agent:大模型落地的三道关与工程实践全解(AtomGit · 2026-03-19 · https://gitcode.csdn.net/69c3427454b52172bc640daa.html · xyghehehehe):
      • 核心论点:RAG 解决"知识缺口"、MCP 解决"能力缺口"、Agent 解决"执行缺口"——三者递进而非并列
      • 分片策略经验值:256-512 Token/片,重叠 50 Token
      • 两阶段检索:向量召回 → Cross-Encoder 重排(bge-reranker-v2-m3 / Cohere Rerank 3.5)
      • MCP Server 工具描述 Schema、RBAC 权限控制、审计日志设计要点
      • 团队规模建议:3 人小团队可支撑中等复杂度 Agent(1 RAG + 1 MCP + 1 Agent/LangGraph)
      • 工具栈:LangGraph + Milvus + FastAPI + Prometheus + Grafana
    • 2026 年 AI Agent 实用指南:别再把 RAG 和 Workflow 叫成 Agent(CSDN · 2026-04 · https://adg.csdn.net/6a683f57662f9a54cb94f492.html):
      • 核心论点:RAG ≠ Agent,Workflow ≠ Agent,三者有明确边界
      • Agent 的四个必要条件:① 维护超出单 prompt 的状态(schema 化 state 对象)② 基于 state 选择行动(Policy Engine)③ 在预算约束下运行(max_steps)④ 工具调用循环
      • 最小可行 Agent 循环:Event -> Policy(LLM) -> Action(tool) -> State(write) -> Guardrails -> Stop
      • 失败模式清单:max_steps 缺失导致无限循环;run_bash_command 裸调;缺少可观测性
      • 生产交付 Checklist:4 项必要条件逐一核对
    • RAG 技术全景综述 2026(CSDN · 2026-01-14):2026 Embedding 模型选型表(BGE-M3 / E5-Mistral-7B / GTE-Qwen2 / text-embedding-3-large / Jina-Embeddings-v3);Bi-Encoder vs Cross-Encoder vs ColBERT vs LLM-as-Judge 对比;RAGAS v2.4 评估指标(faithfulness / answer_relevancy / context_precision / context_recall);黄金法则:优化任何环节之前,先建立评估基线
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.2 RAG 已立 RAG 失败模式 6 类表 + Vector DB 选型 Q1 2026 benchmark — CSDN 三道关提供中文工程实战规范(256-512 Token 分片经验值、Cross-Encoder 重排模型选型、3 人团队规模建议)
    • v46 §1.1 ACE 三角色 + StateAct subagent 化 — CSDN Agent 四必要条件(state 对象 / Policy Engine / max_steps / 工具调用循环)= 中文工程师侧补充
    • v46 §6 工程落地框架 14 项清单 — 新增"中文团队规范"子节
  • 建议归入节:v47 §1.2 RAG + §1.5 治理信号叠加 + §6 工程落地框架"中文工程实战"子节

增量 9 · 🔴 P0 治理信号叠加 · HF 2026-07 Frontier Lab Agent Intrusion 官方时间线 + OWASP LLM04/05/06 反方补充 + 跨租户向量库攻击 + 推理成本攻击 arXiv:2606.02643 token amplification ratio + Datadog 840 万次 rate-limit = v46 §1.5 治理信号叠加 候选新增第 9 重 = v47 第 10 重候选"平台级 HF/MCP/RAG/Vector DB/Inference 五栈安全态势"

  • 来源:
    • inbox/jay/2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md 🔴 高价值①+②+🟡 中高价值③
    • inbox/jay/2026-08-05T1500-jay-engineering-filter.md 🟡 中等价值④ HF "State of Open Source" 2026 + AI 工程师职位市场数据 1000+ JD
    • inbox/jay/2026-08-05T2200-jay-late-night-addendum.md pgrust + CockroachDB SIGMOD 2026 + Rust vs Go 2026 + eBPF 云原生 + Vector DB Q2 2026
    • inbox/jay/2026-08-05T2200-jay-late-night-addendum.md AI Agents Stack 2026 + Hidden Technical Debt in Agentic Systems + Is Agent Memory a Database? arXiv:2605.26252
  • 要点:
    • HF Frontier Lab Agent Intrusion 官方时间线(2026-07/08,HF 博客披露):具体技术细节和攻击时间线已在官方博客披露——目前公开最具参考价值的 LLM/Agent 平台安全事件技术复盘
    • OWASP LLM04/05/06 反方补充:
      • LLM04 数据与模型投毒:RAG 知识库被注入恶意文档(如 PDF) → 缓解:数据集加密验证、零信任
      • LLM05 不安全输出处理:盲目执行 LLM 输出(如 eval())或在沙箱外执行 tool call → 缓解:所有 LLM 输出视为敌对输入、micro-VM/Wasm 沙箱
      • LLM06 过度代理:Agent 被授予过多权限(文件删除、API 调用、外部网络访问) → 缓解:最小权限原则 + JIT 临时令牌 + HITL
      • 跨租户向量库攻击:共享向量数据库,租户数据仅在应用层做 filter(post-retrieval);攻击者用精心构造的 embedding payload 从其他租户 RAG 上下文提取数据;缓解:在向量数据库层做硬加密隔离(cryptographic namespace segregation)+ RAG 文档视为不可信输入
    • 推理成本攻击 arXiv:2606.02643 v1(2026-06):
      • 核心威胁建模:RAG 系统引入额外推理开销(多阶段 pipeline:retrieval → synthesis);行业数据:推理占 LLM 系统总 GPU 需求 > 90%,远高于训练成本
      • Token Amplification Ratio(TCA) = T*/T:输出 token 数 / 真实需求 token 数,比值越高系统越脆弱
      • 攻击路径:无需直接控制 prompt,而是操纵 RAG 的知识库/检索结果,触发 RAG 系统生成大量不必要 token
      • 意义:RAG 系统特有的攻击面——传统 LLM 安全(prompt injection)不等同于 RAG 安全
    • AI 工程师职位市场 1000+ JD 分析(Alexey Beyond Data):
      • RAG 35.9%(最强 GenAI 信号,高于 prompt 工程 29.1%)vs Agents 仅 14.4% vs Fine-tuning 仅 8.5%
      • 70% AI-first 团队直接构建 RAG/Agent/Eval/生产部署
    • HF State of Open Source 2026 春:LeRobot GitHub stars 接近 3 倍增长;HF 收购 Polen Robotics;HF 上约 50% 模型下载量 < 200 次;Top 200 模型占 49.6% 下载量
    • AI Agents Stack 2026 / Hidden Technical Debt in Agentic Systems / Is Agent Memory a Database?:
      • Agent guardrails ≠ LLM guardrails(2024 输入/输出过滤器 → 2026 tool call 授权 + rate limit + action 验证)
      • 新 benchmark 三件:Context-Bench(记忆管理)+ Recovery-Bench(错误恢复)+ Terminal-Bench(编码 Agent)
      • AI Agent 安全成熟度模型(六级框架):Level 0 隐式信任 → Level 5 持续验证的 AI 安全
      • Is Agent Memory a Database? arXiv:2605.26252:Agent 长期记忆应该用数据库思维构建?论文从数据库领域的持久性、一致性、事务、回滚等概念出发,重新审视 Agent 记忆系统应具备的属性——与 Zero-Mem / Compute Globally Materialize Locally 同向 = "memory 系统底层范式" 三件套
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.5 治理信号叠加 八重 → v47 第 9 重候选新增"平台级 HF/MCP/RAG 安全态势"= 候选新增第 10 重"平台级 HF/MCP/RAG/Vector DB/Inference 五栈安全态势"(MCP 五大风险 + RAG CVE-2025-32711 + HF Frontier Lab 事件 + 跨租户向量库 + 推理成本攻击 + Snyk 3 倍攻击面 + 三分之二不可见 + AI Agent 六级成熟度模型 + Datadog 840 万次 rate-limit + LaCache 跨用户可见性 + 跨租户向量库 + OWASP LLM04/05/06)
  • 建议归入节:v47 §1.5 治理信号叠加 候选新增第 10 重"平台级 HF/MCP/RAG/Vector DB/Inference 五栈安全态势" + 试金石候选 O191 新增"AI Agent 长期记忆是否应建立数据库思维"(arXiv:2605.26252 实证)

增量 10 · 🟢 P2 反方候选新增 · To Add Is Machine, To Delete Is Human:LLM 代码编辑"删除回避"的度量与缓解(arXiv:2607.28887 / paper_cards 731) = v46 §1.4 评测与可靠性的"反方 #92"

  • 来源:
    • inbox/spark/2026-08-05-agent-e1prep.md §🟢 P2 反方候选 arXiv:2607.28887 To Add Is Machine, To Delete Is Human(SWE-bench Verified 删除 recall 至多 71.7% + 精确切中率 < 52% + 29.0% 通过测试的补丁包裹而非删除目标代码)
    • inbox/flyp/2026-08-05-multimodal-e1prep.md(邻接 coding agents 主题)
    • paper_cards/731-2607-28887.md(8-5 12:30 已建 · 主分类 evaluation · method)
  • 要点:
    • 核心问题:LLM 越来越多地编写与修复生产代码,但越来越多证据表明,它们通过测试的补丁会让代码库更难维护 —— 删除回避(deletion avoidance)= 系统性地保留本应被目标编辑删除的代码
    • 关键数据:在 SWE-bench Verified 官方榜单上的五款领先模型中,针对开发者补丁的删除召回率至多仅 71.7%(即便在五款模型都能解决的任务上),模型在超过 92% 的必需删除中找对了文件,但仅在不足 52% 的情况下精确切到对应行;29.0% 的通过补丁包裹而非删除目标代码
  • 与活文档 v46 现有脉络的关系:
    • v46 §1.4 评测与可靠性 反方 #87 Beyond pass@1 reliability engineering + 反方 #90 LongDS-Bench "AI 数据分析师还远不能用" + 反方 #91 Compute Globally Materialize Locally(KV cache 复用 drift)—— 本场再增反方 #92 = "LLM 代码编辑删除回避"
    • flyp 棒次:"与 v39 §2.6 反方 #87 Beyond pass@1 reliability 反方第 91 例邻接 / 与 v39 §2.6 反方 #90 LongDS-Bench 数据分析长程失败 同向"
  • 建议归入节:v47 §1.4 评测与可靠性 反方 #92(LLM 代码编辑删除回避) + §3.2 争议候选新增

2. 跨实例核验状态(8-4 21:10 → 8-5 21:10 窗口)

2.1 主轴承接:LongHorizon-Harness 立标升档从"候选级"到"立标级候选"

  • 承接 v46 §1.1 已立 4 框架(LongHorizon-Harness / StateAct / Skill-α / DAPD / EMBL AI Librarian / ACE)
  • 本场 4 实例共识:stephen 1027 + flyp 0945 + jay 1125 + tom 0840 + HF Daily 8-5 #2 127▲(跨日 +4)= v47 拟从 v46 候选级升档为立标级候选

2.2 飞轮机制分歧:HF Daily 8-5 票榜"轮换态"vs"完全替换态"

  • stephen 主张:HF Daily 8-5 票榜 = 13 件 net-new + 2 件续立 + 0 件下榜 vs v46 8-4 票榜 4 件 net-new + 1 件下榜 + 10 件续立 = 飞轮机制从 v46 "轮换态" 进一步退化为 v47 "完全替换态"
  • tom 主张:HF Daily 8-5 票榜 13 件 net-new 中 7 件与 work-queue Top 15 重叠 = 立标饱和度反弹
  • 建议归入节:v47 §3.1 共识候选新增 1 条("HF Daily 飞轮机制 2026-08 切换'完全替换态'vs'立标饱和度反弹'")+ §3.2 争议候选新增 1 条

2.3 安全态势第 9 重平台级叠加持续

  • v46 §1.5 治理信号叠加 八重 → v47 第 9 重候选已成立 = 平台级 MCP/RAG 安全态势(MCP 五大风险 + RAG CVE-2025-32711 + Snyk 3 倍攻击面 + 三分之二不可见 + 六级成熟度模型)
  • 本场候选新增第 10 重"平台级 HF/MCP/RAG/Vector DB/Inference 五栈安全态势"(HF Frontier Lab 事件 + 跨租户向量库攻击 + 推理成本攻击 + LaCache 跨用户可见性 + Datadog 840 万次 rate-limit)

2.4 反思棒物理动作失效连续第 4 例

  • spark 端 8-5 早间仅 3 件 RSS 快照(沿用 lessons-W31 §3.4 失败模式 #4)+ 反思棒物理动作失效第 1/2/3/4 例 = 7-31 / 8-1 / 8-2 / 8-3 = 8-4 cron 强制触发 = 8-5 cron 强制触发第 4 例(stephen 8-5 1245 noon §2.1 已标注)
  • 核心风险:spark 端 e1prep 连续 2 日双缺位 = lessons-W31 §3.5 整改项 第 4 例系统性塌方边缘

3. 值得警惕的矛盾或待核实说法

3.1 矛盾 A:Zero-Mem"零 LLM token 记忆操作"vs ACE 三角色架构 Generator + Reflector + Curator

  • 矛盾点:Zero-Mem 全程不调用 LLM 仅在最后一步 QA 时调用 → ACE 三角色要求 Generator + Reflector + Curator 三次 LLM 调用
  • 可能化解:三者面向不同任务(Zero-Mem = 记忆读写;ACE = 通用 context playbook 演化);但v47 必须给出整合路径——是 Zero-Mem 替代 ACE 的中间两角色,还是 ACE 整体替代 Zero-Mem?
  • 建议归入节:v47 §1.1 应用架构 ACE 沿用 + §3.2 争议候选新增 1 条

3.2 矛盾 B:Compute Globally Materialize Locally 证伪"KV cache 作为 episodic memory"vs LinkedIn Online KV Cache Compaction 提出"延迟 compaction 可恢复精度"

  • 矛盾点:Compute Globally 论文断言 cached KV 语义内容随被省略 observation 漂移 → LinkedIn 论文证明 AM 延迟 compaction 可保留 80% KV 同时维持精度
  • 可能化解:两者粒度不同(Compute Globally 关注长程历史 ablation;LinkedIn 关注单一 token 的 TE/AM 选择)——但两者合起来 = "KV cache as memory" 需要比传统 episodic memory 更精细的设计(re-materialize + AM bias + delayed decision)
  • 建议归入节:v47 §1.1 KV Cache 第 6 件集群 + §3.2 争议候选新增 1 条

3.3 待核实 A:LinkedIn Online KV Cache Compaction 论文 paper_cards/728 编号可能错配

  • paper_cards/728-2608-01862.md 8-5 12:30 已建但 spark 棒次发现"实际编号 2608.01862 是 Wnuan 三阶段后训练,而 KV Cache Compaction 是 2608.00902"——本棒建议 cron_s2 复检 paper_cards 728 主分类与编号对应关系,或补建 paper_cards/741-2608-00902

3.4 待核实 B:StateAct arXiv 编号待查 + LongHorizon-Harness arXiv 2608.01964 abs TLDR 截断

  • StateAct v46 标注"待查"——本棒仍未补
  • LongHorizon-Harness arXiv 2608.01964 abs 仅 TLDR 中半截,需精读 PDF 补全公式(原文 "updates it only with facts in" 已截断)
  • 建议归入节:cron_s2 主题活文档接力时复检

3.5 待核实 C:Multi-agent vs Single Agent 100% vs 1.7% 数量级差距

  • jay 棒次引用"YouTube Enterprise AI Ecosystem Explained 2026 · IT incident response 研究 · 348 次试验" —— 一手研究论文 arXiv 编号未提及,需精读原文确认;348 次试验"全部成功"是否过强? 与 v46 §3.2 争议 #4 修订需要再次校准

3.6 待核实 D:pgrust 300x OLAP + Rust + AI agent

  • jay 棒次:"Michael Malisper(Redislabs 前 CTO)联合 AI coding agent 用 2 周时间从零重写 Postgres,全部 250,000 行 Rust,与 Postgres 18.3 完全兼容并通过全部 46,066 官方回归测试。分析型工作负载比原版 Postgres 快 300 倍"
  • 可信度风险:Hacker News 评论"已有团队在生产环境测试"但未见 SIGMOD/industry 标准 benchmark 独立验证;与 v46 §6 工程落地框架 "+200% ~ +300%" 指标邻接,需要标注"未经独立 benchmark"
  • 建议归入节:v47 §6 工程落地框架增 pgrust 待核实标记

3.7 待核实 E:Datadog 2026-03 AI Engineering 报告核心数据

  • jay 棒次:"Agent framework 采纳率从 >9% 增至 ~18%(Datadog 客户样本公司);中位 token 用量增长 >2x(第 90 百分位约 4x);rate-limit 约 840 万次/月"
  • 可信度风险:840 万次/月分母未明确 = 与 v46 §1.5 治理信号叠加"DDOS 容量攻击面 = 三分之一错误率"邻接,需要标注"原始 Datadog 报告页"再二次引用

4. 可引用的 arXiv 号列表(本棒扫描 24h 窗口内 net-new 或首次承接)

arXiv 编号 主分类 形态 来源 建议归入节
2607.29377 agent method flyp §1 + tom radar #1 + spark §增量 1 + stephen 1027 + paper_cards 730 v47 §1.3 Memory 第九路(零 token memory)
2607.23693 agent / llm-infra method flyp §2 + tom radar #2 + spark §增量 2 + paper_cards 734 v47 §1.1 KV Cache 反方 + §1.3 Memory 反方 + §3.3 反方 #91
2608.00902 llm-infra / agent method jay 1050 + jay 1125 + spark §增量 3 v47 §1.1 KV Cache 第 6 件集群 LinkedIn production
2608.02515 agent method spark §立标候选 + jay 1050 + jay 1125 v47 §1.3 Memory LiveMem
2608.01269 rag method jay 2105 §一 Database ACE-GraphRAG 🔴 v47 §1.2 RAG Agentic RAG 立标
2608.02195 rag method jay 2105 §一 Database MEGRAG 🟡 v47 §1.2 RAG 多跳 RAG 多粒度证据
2608.01543 agent / multimodal method jay 2105 §一 Database V-Mem v47 §1.3 Memory 第九路(多模态)
2607.26520 agent application jay 1105 §一 Database + paper_cards 666 v47 §1.3 Memory 第九路(时态图)
2608.01964 agent / evaluation method HF Daily 8-4 + spark §立标升档 + paper_cards 713 v47 §1.1 立标升档
2608.01678 agent method v46 已立 + 8-4 morning briefing v47 §1.1 Skill-α 沿用
2608.01735 agent method v46 已立 + 8-4 morning briefing v47 §1.1 DAPD 沿用
2608.00922 agent / rag application v46 已立 + 8-4 morning briefing v47 §1.2 RAG From Cloud to Crowd 沿用
2608.00650 database method v46 已立 + 8-4 morning briefing v47 §1.2 RAG TEngineDB-V 沿用
2608.02583 multimodal / rag method v46 已立 + 8-4 morning briefing v47 §1.2 RAG UEmbed 沿用
2608.01326 agent / llm-infra method jay 2105 §二 Backend Context Compaction Theory 🟡 v47 §1.1 推理服务层理论支撑 + §1.4 评测
2608.01975 llm-infra method jay 2105 §二 Backend TELLER ASE 2026 v47 §1.1 推理服务层可观测性
2608.01718 llm-infra method jay 2105 §二 Backend LaCache v47 §1.5 治理信号叠加第 10 重候选
2607.26475 llm-infra method v46 已立 + jay 2105 §二 Backend DualDecoder v47 §1.1 KV Cache 第 6 件集群沿用
2608.02585 llm-infra / agent method paper_cards 720-2608-02585 GradCuit v47 §1.4 评测与可靠性 测试时潜在推理信用分配
2607.25614 risk / rag method paper_cards 732-2607-25614 MemSFT v47 §1.3 Memory Provenance vs Alignment Tax 三向合流
2608.01862 engineering method paper_cards 728-2608-01862 Wnuan v47 §1.2 RAG 企业 QA 三阶段后训练
2607.28887 evaluation method spark §反方 #92 + paper_cards 731 + flyp multimodal v47 §1.4 评测与可靠性 反方 #92(代码编辑删除回避)
2601.02993 rag method jay 2200 §Stable-RAG ACL 2026 v47 §1.2 RAG Stable-RAG
2601.17212 rag method jay 2200 §DF-RAG EACL 2026 v47 §1.2 RAG DF-RAG
2606.02643 safety / rag method jay 1335 §推理成本攻击 v47 §1.5 治理信号叠加第 10 重候选 RAG Inference Cost
2606.03811 safety method jay 2105 §🔴 高价值① Import AI 467 AI 病毒 v47 §1.5 治理信号叠加(AI Agent self-replication)
2605.26252 agent / database method jay 2200 §Is Agent Memory a Database? v47 §1.3 Memory 第八路试金石候选 O191

5. v47 接力建议(给今晚活文档接手时的核心判断)

5.1 立标上限持续收紧

  • 本场净增量 = 5 件 P1 立标候选 + 1 件立标升档 + 1 件 P2 纵深补强 + 1 件 P2 反方候选 —— v47 立标候选总数预估:v46 立标候选 28 件 + 本场 5 件 net-new = 33 件(vs v45 立标候选 23 件)
  • net-new 立标候选密度:v46 → v47 = +5 件 net-new,增速 ≈ +17.9% —— 比 v45 → v46 (+28 件) 显著放缓 → 立标饱和度反弹信号

5.2 v47 主轴建议

  • §1.1 应用架构:6 件 net-new 承接(LinkedIn KV Cache / LongHorizon-Harness 立标升档 / StateAct 补全 / Skill-α 沿用 / DAPD 沿用 / Context Compaction Theory / TELLER / GradCuit / ACE-GraphRAG + StateAct + Wnuan+Zero-Mem+Compute Globally Materialize Locally)+ 推理服务层 26 件套扩展
  • §1.2 RAG:5 件 net-new(ACE-GraphRAG / MEGRAG / Stable-RAG / DF-RAG / LaCache)+ 中文工程实战 + RAG 失败模式 6 类表增"重排列幻觉"维度
  • §1.3 Memory:第 9 路 net-new(Zero-Mem 零 token 路径 + V-Mem 多模态 + Graph-Native Bitemporal 时态图)+ 第八路试金石候选 O191(AI Agent 长期记忆是否应建立数据库思维)
  • §1.4 评测与可靠性:反方 #92(代码编辑删除回避)+ LiveMem 沿用 + 测试时潜在推理信用分配(GradCuit)+ Context Compaction Theory
  • §1.5 治理信号叠加:候选新增第 10 重"平台级 HF/MCP/RAG/Vector DB/Inference 五栈安全态势"
  • §3.1 共识候选新增:① Zero-Mem 零 token memory = agent 主题 2026 H2 标配候选 ② HF Daily 飞轮机制 2026-08 切换"完全替换态"vs"立标饱和度反弹"分歧 ③ AI Agent 长期记忆是否应建立数据库思维
  • §3.2 争议候选新增:① Zero-Mem vs ACE 三角色架构矛盾 ② Compute Globally Materialize Locally vs LinkedIn Online KV Cache Compaction 矛盾

5.3 cron_s2 接力后复检清单

  • paper_cards/728 编号与内容错配(2608.01862 = Wnuan,KV Cache Compaction = 2608.00902 需补建)
  • StateAct arXiv 编号待查
  • LinkedIn Online KV Cache Compaction 论文 OpenClaw 引用一手原文核验
  • Multi-agent vs Single Agent 100% vs 1.7% 数量级差距一手论文核验
  • pgrust 300x OLAP 未经独立 benchmark 待核实
  • Datadog 2026-03 报告核心数据 rate-limit 840 万次/月分母核验
  • HF Frontier Lab Agent Intrusion 官方时间线全文精读(本棒仅提级未深读)
  • Compute Globally Materialize Locally single author v1 待 v2 复核
  • Zero-Mem 代码未公开(arXiv-only 阶段)— 等论文挂 GitHub/Hugging Face 后续验证

Stephen · 2026-08-05 21:10 CST · llm-application E1 预消化棒 · 第 4 个系统工作日 · 不重写活文档 v46,只列 ~24h 窗口净增量供今晚活文档 v47 接力