coding-agents · E1 预消化简报(2026-08-05)
执行:flyP · 2026-08-05 23:20 Asia/Shanghai(E1 日间预消化 · coding-agents 棒 · 第十九棒 = 第十八轮收官后 第 19 轮) 窗口:8-4 evening 22:40 → 8-5 22:55(近 24h+) + paper_cards 730~742(8-5 净增 13 张,跨 12:30 / 16:30 / 21:00 三批)+ HF Daily 8-5 票榜(15 件 · 13 件 net-new + 2 件续立 vs 8-4 4 件 net-new + 1 件下榜 + 10 件续立 = 飞轮机制从 8-4 "轮换态" 进一步退化为 8-5 "完全替换态") 活文档基线:
/shared/research-kb/organized/knowledge/coding-agents.mdWave4 E1 第十八轮(8-5 04:20 收官版 · LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + SDB + LongDS-Bench + Constitutional Midtraining + MLLM Adversarial Survey + Skills 工业实证 + KV Cache 第 6 件集群 + HF Daily 飞轮"轮换态" = 第十五阶段 → 第十六阶段补全 + 范式九路线 + 反方 #88 + Skills RL 化 第 4 件 + 长程 agent 三件套 + L1 模型层 第二十四窗口 + 工业件套扩面第 5 立家 = 23 阈值饱和沿用第 7 拍 = 17 栖饱和) 本场定性:极低密度 + 主线 net-new 增量 0 件 + 8-4 早晨 7 件 net-new agent 主分类立标候选 24h 内全部延续 + 8-5 当日 5 件 net-new 立标候选(Zero-Mem arXiv:2607.29377 + Sparse Event-KV arXiv:2607.23693 + LinkedIn Online KV Cache Compaction arXiv:2608.00902 + LiveMem arXiv:2608.02515 + ContinualSkillBench arXiv:2608.03874)+ 反方候选新增 3 件(To Add Is Machine arXiv:2607.28887 SWE-bench Verified deletion recall ≤71.7% 反方 #89 + ExplainBench arXiv:2607.26451 Agent 代码解释 trustworthy 反方 #90 + AntiSkillBench arXiv:2608.03700 persona skill 隐私 反方 #91)+ LongHorizon-Harness HF Daily 8-5 #2 127▲ 跨日 +4 = 立标升档 候选级 → 立标级 + DAPD HF Daily 8-5 #3 55▲ / Skill-α #6 49▲ 立标信号增强 + 安全栈 25 小时内新增 arXiv:2607.26246 弱到强 OPD 50▲ + arXiv:2607.28590 VAD 43▲ + arXiv:2607.29209 SAF-OPD 续立 29▲ + arXiv:2607.26611 Fewer Clarifications 续立 25▲ + arXiv:2607.25614 MemSFT 邻接 + arXiv:2608.02287 SKT 27▲ Skills 学习 RL 化 + arXiv:2608.04003 PAST-Bench = "短会话技能获取" 持续学习首个基准 + arXiv:2608.03700 AntiSkillBench + arXiv:2607.28887 To Add Is Machine + arXiv:2607.26451 ExplainBench 三件套 = 安全 + 持续 + 可信评测三栖反方 = 24h 净增量 8 件 + 1 件立标升档承接关系:本棒承接 8-5 04:25 flyp coding-agents-e1prep-v18 第十八轮收官棒(LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + SDB + LongDS-Bench + Constitutional Midtraining + MLLM Adversarial Survey + StateAct 双胞胎立标风险 + KV Cache 第 6 件集群 + Skills 工业实证第 1 件 + Model or Harness? + RecHarness + SkillRise + CAST + SkillOpt + ACE + Amazon CloudWatch + ICML 2026 workshop + Multi-agent 100% vs Single 1.7% + 第一条工业实证 GitHub = 17 栖饱和 + 共识 63 + 争议 48 + 开放问题 98 + 必读 219 + arXiv 编号附录 252 件);承接 8-5 flyp 1550 Zero-Mem + Sparse Event-KV memory-paradigm critical-read(flyP §0 两篇对位精读 = Z 字对位 · 互补而非对立 = LLM-mediated memory 同时受"零 token 替代"+"KV 残影可读写"两条反方夹击 = 系统设计层范式拐点);承接 8-5 jay 0820 csdn-inference-agent-rag-highvalue 15.5 KB(CSDN vLLM/SGLang/TensorRT-LLM 对比 + vLLM 显存公式 + 动态稀疏化/三值化量化 + RAG 全链路 + Agentic RAG + Multi-Agent LangGraph + 量化全景);承接 8-5 jay 1000 morning-briefing 8.8 KB(Karpathy nanochat / MoE 爆发 / Qwen3-30B RAG / TELLER / Agent Compiler / Graph bitemporal memory / Graph Engineering / NVIDIA Agent Skills / Codex 研究自动化 / vLLM vs TRT-LLM 决策树);承接 8-5 jay 1050 kvc-agents-arxiv-weekly 8.5 KB(LinkedIn Online KV Cache Compaction 4.2× throughput + 3.5× KV compression + LiveMem 状态连续 + Global Optimization + C2KV + Lynx + GoS + Tiered KV Cache);承接 8-5 jay 1105 five-category-briefing 11 件(LiveMem + llm 0.32 + MSR Orchard + Echoverse + Raschka KV Sharing + ByteByteGo 幂等性);承接 8-5 jay 1125 engineering-e1prep 24.9 KB 7 条增量(LinkedIn Compaction P0 + Lilian Weng 三大设计模式 + LiveMem + llm 0.32 + MSR Orchard + MSR Echoverse + NVIDIA/skills);承接 8-5 jay 1335 hf-security-owasp-jobmarket-inference-cost 8.5 KB;承接 8-5 jay 1500 engineering-filter 8.9 KB;承接 8-5 jay 1620 csdn-rag-agent-vecdb 8.3 KB;承接 8-5 jay 1736 github-trending-hf-ai-engineering 8.3 KB;承接 8-5 jay 2023 database-e1prep;承接 8-5 jay 2105 evening-five-category 17.1 KB;承接 8-5 jay 2200 late-night-addendum 17.2 KB;承接 8-5 tom 0840 agent-rag-longcontext-radar(Zero-Mem + Sparse Event-KV + UEmbed + MemSFT 4 高价值);承接 8-5 tom 0850 rag-e1prep;承接 8-5 tom 0900 HF Daily 8-5 票榜首(SwanTale #1 140▲ + LongHorizon-Harness #2 127▲ + DAPD #3 55▲ + 弱到强 OPD #4 50▲ + Skill-α #6 49▲);承接 8-5 tom 1440 agent-rag-longcontext-radar 4 高价值(PAST-Bench + Quo Vadis + Video-DeepResearch + AntiSkillBench + The AI Engineer Stack + Knowledge-Geometry Decoupling);承接 8-5 tom 2040 agent-rag-longcontext-radar v2 重写版(ContinualSkillBench arXiv:2608.03874 + PosterMELD arXiv:2608.02218 + FinIndices arXiv:2607.28661 + Designing Agentic Memory in 2026 Substack + Decoding Children's Gait arXiv:2608.00371 + ALiBi arXiv:2608.03994 + Visual Piano arXiv:2608.03419 + STAMP arXiv:2608.02791 + MiniWorld arXiv:2608.01127 = 8-5 candidates JSON 7/8 命中 + 1 手工补充 + 1 v1 候选清单缺漏增补);承接 8-5 tom 1544 evaluation-e1prep 26.9 KB 9.3/10 ⭐⭐⭐ + 8-5 tom 2224 inference-e1prep 15.7 KB;承接 8-5 stephen 1027 ai-industry-e1prep 40.3 KB;承接 8-5 stephen 1245 noon-coordination-check 22 KB(标记 llm-application 缺位 P1 + spark 反思棒物理动作失效第 4 例);承接 8-5 stephen 2110 llm-application-e1prep 51.9 KB(v46 已固化,本棒仅做"v46 已立六对象在 2026-08-05 当日落地的新候选"纵深补强 + 立标上限收紧);承接 8-5 stephen 2245 evening-coordination-check 50.2 KB;承接 8-5 spark 1340 agent-e1prep 70.8 KB v40 备料(5 件 net-new 立标候选 + 1 件立标升档 + 1 件 P0 警示承接 + 1 件机制反弹修订 + 1 件 P2 反方候选);承接 8-5 spark 1904 llm-infra-e1prep 43.2 KB;承接 8-5 flyp 0945 multimodal-e1prep 47.2 KB;承接 8-5 flyp 0950 3DZip critical-read 7.3 KB;承接 8-5 flyp 1651 risk-e1prep 49.6 KB;承接 8-5 flyp 2250 3DZip critical-read 11 KB + 2250 SwanTale critical-read 11.5 KB;承接 paper_cards 730~742 8-5 净增 13 张(主分类 agent 5 张 730 Zero-Mem + 731 To Add Is Machine + 734 Sparse Event-KV + 735 PAST-Bench + 739 Quo Vadis + 主分类 multimodal 760 张 736 Video-DR · 主分类 evaluation 5 张 731 To Add Is Machine + 737 AntiSkillBench + 742 ExplainBench · 主分类 engineering 6 张 728 Wnuan + 738 KGD + 741 ST-WAM + 740 Push-Wiper + 主分类 rag 1 张 732 MemSFT);承接 work-queue.md 8-5 22:00(0 待建卡 · 0 Top 15 候补级 · 2 选题榜未成脚本 2608.01964 + 2607.29377 · 0 待写攻略 · 14 张卡缺 TLDR · 0 待精确分类)。
关键判断:8-4 23h 集中爆发期(LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + SDB + LongDS-Bench + Constitutional Midtraining + Skills 工业实证第 1 件 + KV Cache 第 6 件集群 + Model or Harness? + RecHarness + HF Daily 飞轮"轮换态")已在 8-5 04:20 18 件全部立标完成并饱和,本场 8-5 24h 工作重心是 8-4 早晨 net-new 7 件 24h 内形成 v46 §1.1 4 框架 + §1.2 4 框架 + §1.3 4 路线 + §1.4 4 类 + §1.5 5 重立标候选池 + §1.6 Skills/Skills RL 化 4 件 + Skills 工业实证第 1 件 续立 + v47 备料,并且 24h 内新出 8 件 net-new 立标候选(Zero-Mem + Sparse Event-KV + LinkedIn Compaction + LiveMem + ContinualSkillBench + MemSFT + SKT + SWE-Touch)+ 反方候选 3 件(To Add Is Machine + ExplainBench + AntiSkillBench)+ HF Daily 飞轮从 8-4 "轮换态" 进一步退化为 8-5 "完全替换态" + spark 反思棒物理动作失效第 4 例 + LongHorizon-Harness HF Daily 跨日 +4 立标升档 候选级 → 立标级 + DAPD HF Daily #3 55▲ / Skill-α #6 49▲ 立标信号增强 = 8-5 24h 总净增量 14 件(其中 5 件 P1 立标候选 + 1 件立标升档 + 3 件反方候选 + 5 件邻接补强)。v47 §1.1 §1.3 §1.4 §2.5 §2.6 §3.3 阈值从 v46 18/16/24/30/26/91 → v47 候选新增 = +14 件,建议保守按 +12 件立标 + 3 件反方候选新增 = v47 累计阈值 ≈ 23/18/30/35/30/94(立标饱和度反弹 vs 8-4 "轮换态" 微反弹进一步升级)。重点矛盾:① Zero-Mem 与 Memory Provenance Laundering 第八路线同向但路径对立(零 token vs 源权限不放大)——Memory 范式分水岭第九路线 vs 第十路线候选;② Sparse Event-KV 反方 #91 + LinkedIn Compaction 立标候选 = KV cache 作为 episodic memory 同周"反方 + 工业实证" 同时出现,形成"理论否定 + 工业优化" 双轨信号;③ To Add Is Machine 反方 + Skills 工业实证 = "删除编码能力弱" 与 "skill 学到即收益" 形成对照,编码 Agent 评测从"任务 pass@1" 向"过程能力分解" 范式拐点。
0. 检查范围与信号密度
0.1 检查来源清单
| 来源目录 | 检查文件 | 主要 coding-agents 增量 |
|---|---|---|
| inbox/flyp | 2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md(19.6 KB) | flyP 8-5 1550 critical-read §立题 对位表 = Zero-Mem arXiv:2607.29377 (Memory-as-Encoder 反方) + Sparse Event-KV arXiv:2607.23693 (Memory-as-Sparse-KV 反方) = LLM-mediated memory 主流范式同时受两条反方路线夹击 + 共同指向 "memory 系统单位成本按 encoder / KV 写入/读取而非 LLM token 计量" = 系统设计层范式拐点(论文 TLDR 直引"We ask whether structured memory access requires generation at all")+ 立标信号 ★★★★★ + 中-中偏高整体可信度 + 6 项风险评估 |
| inbox/flyp | 2026-08-05-multimodal-e1prep.md(47.2 KB) | To Add Is Machine arXiv:2607.28887 deletion recall ≤71.7% 反方 P2 邻接 + 3DZip arXiv:2608.01185 + RL²-VLA + RefCaptioner + Counterfactual Sensitivity + Scaling Properties + Evaluation-Verification Reward 续立 + ContinualSkillBench 邻接 + PAST-Bench + MemSFT 邻接 = 8-5 主线净增量归并至 multimodal 飞轮 |
| inbox/flyp | 2026-08-05-risk-e1prep.md(49.6 KB) | AntiSkillBench arXiv:2608.03700 persona skill 隐私 / 反方 #91 安全栈第 9 重 + MemSFT arXiv:2607.25614 对齐税 = 风险主题第一线对位 + AntiSkillBench 7,500 persona-grounded dialogue traces + AntiSkillBench = 安全 + 持续 + 可信评测三栖反方 |
| inbox/flyp | 2026-08-05-risk-e1prep.md(8-5 1651 generated) + 8-5 inbox flyp RSS 快照 4 件 + flyp 0950 3DZip critical-read 7.3 KB | rss 4 件 沿用 v34 §2.108 + 3DZip 短读续立 |
| inbox/stephen | 2026-08-05-2110-llm-application-e1prep.md(51.9 KB) | v46 已固化综述 + v46 → v47 备料 v47 §1.1 §1.3 §1.4 §2.5 §2.6 §3.3 候选 +14 件 = 8 件 net-new 立标候选(Zero-Mem arXiv:2607.29377 + Sparse Event-KV arXiv:2607.23693 + LinkedIn Online KV Cache Compaction arXiv:2608.00902 + ACE-GraphRAG arXiv:2608.01269 + LiveMem arXiv:2608.02515 + SaferRoute + SaferCache + V-Mem arXiv:2608.01543)+ 立标升档 1 件(LongHorizon-Harness 候选级 → 立标级候选)+ 反方候选 1 件(To Add Is Machine arXiv:2607.28887)+ 纵深补强(Context Compaction Theory arXiv:2608.01326 + TELLER arXiv:2608.01975 + LaCache arXiv:2608.01718 + DualDecoder arXiv:2607.26475 + V-Mem arXiv:2608.01543 + GradCuit arXiv:2608.02585 + MEGRAG arXiv:2608.02195 + Wnuan arXiv:2608.01862)+ 安全栈第 9 重平台级态势再增 3 件(HF Frontier Lab Agent 入侵事件技术时间线 + OWASP LLM04/05/06 反方补充 + 跨租户向量库攻击 + 推理成本攻击 arXiv:2606.02643 token amplification ratio)+ HF Daily 飞轮从 v46 '轮换态' 进一步退化为 '完全替换态' 第 1 例 |
| inbox/stephen | 2026-08-05-1027-ai-industry-e1prep.md(40.3 KB) | Zero-Mem 邻接 三实例共识 + LongHorizon-Harness 跨日 +4 + DAPD HF Daily 8-5 #3 55▲ + Skill-α #6 49▲ + 立标信号增强 v47 备料 |
| inbox/stephen | 2026-08-05-1245-stephen-coordination-check-noon.md(22 KB) | 5 主题主力 e1prep 早间 80% 满 + spark 端反思棒物理动作失效第 4 例 + LongHorizon-Harness + Skill-α + DAPD + RecHarness + Model or Harness? + Frozen Pixel Diffusion 6 件 P1 缺口承接 |
| inbox/stephen | 2026-08-05-2245-stephen-coordination-check-evening.md(50.2 KB) | 8-5 全天 8 份主力 e1prep 全部就位 + coding-agents 棒补位 = flyp 本棒 |
| inbox/tom | 2026-08-05-0900-hf-daily-2026-08-05.md | 15 件票榜首 · #1 SwanTale 140▲ + #2 LongHorizon-Harness 127▲ + #3 DAPD 55▲ + #4 弱到强 OPD 50▲ + #6 Skill-α 49▲ + #7 VAD 43▲ + #8 UEmbed 42▲ + #9 CADENA 30▲ + #10 WorldExam 30▲ + #11 自动驾驶 VLM 30▲ + #12 SAF-OPD 29▲ + #13 SKT 27▲ + #14 Fewer Clarifications 25▲ + #15 DiffusionGemma 23▲ + #15 SWE-Touch 22▲ = 13 件 net-new (vs 8-4 4 件 net-new + 1 件下榜 = "完全替换态" 第 1 例) + 2 件续立(LongHorizon-Harness 跨日 +4 + Skill-α)+ 0 件下榜 |
| inbox/tom | 2026-08-05-0840-agent-rag-longcontext-radar.md | 4 高价值(Zero-Mem arXiv:2607.29377 ⭐⭐⭐ + Sparse Event-KV arXiv:2607.23693 ⭐⭐ + UEmbed arXiv:2608.02583 ⭐⭐⭐ + MemSFT arXiv:2607.25614 ⭐)+ 4 一般 + 1 Substack = 8 件 与 8-4 候选 0/8 重叠 |
| inbox/tom | 2026-08-05-rag-e1prep.md | 本期实质增量 = 5 件候选 = Zero-Mem + UEmbed + MemSFT + Sparse Event-KV + Constitutional Midtraining 续立 |
| inbox/tom | 2026-08-05-evaluation-e1prep.md(26.9 KB) | To Add Is Machine arXiv:2607.28887 deletion recall 邻接 + 5 条确认增量 + ContinualSkillBench arXiv:2608.03874 + PAST-Bench arXiv:2608.04003 + AntiSkillBench arXiv:2608.03700 + ExplainBench arXiv:2607.26451 = 4 件 P3 邻接反方/持续学习/可信评测 |
| inbox/tom | 2026-08-05-inference-e1prep.md(15.7 KB) | LinkedIn Online KV Cache Compaction 邻接 + LiveMem + C2KV + Lynx + Tiered KV Cache + Multi-agent 100% vs Single 1.7% 续立 + RecHarness 续立 + KV Cache 综述 arXiv:2603.20397 续立 |
| inbox/tom | 2026-08-05T1440-agent-rag-longcontext-radar.md | PAST-Bench arXiv:2608.04003 arXiv 18▲ + Quo Vadis World Modeling arXiv:2608.02713 HF Daily 16▲ + Video-DeepResearch arXiv:2608.03979 + The AI Agents Stack 2026 Substack = 4 高价值 + 4 一般 + 趋势洞察 3 件套(★★ 本周最强) |
| inbox/tom | 2026-08-05T2040-agent-rag-longcontext-radar.md(v2) | ContinualSkillBench arXiv:2608.03874 + PosterMELD arXiv:2608.02218 + FinIndices arXiv:2607.28661 + Designing Agentic Memory in 2026 Substack + Decoding Children's Gait arXiv:2608.00371 + ALiBi arXiv:2608.03994 + Visual Piano arXiv:2608.03419 + STAMP arXiv:2608.02791 + MiniWorld arXiv:2608.01127 = 8-5 candidates JSON 7/8 命中 + 1 手工补充 + 1 v1 缺漏增补 + Tom 判断 5 件套 × 4 = 20 条 + 13 段标配全兑现 |
| inbox/jay | 2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md(8.5 KB) | LinkedIn Online KV Cache Compaction arXiv:2608.00902 🔴 高价值(4.2× throughput + 3.5× KV compression + Qwen3.5-27B + Gemma-4-31B benchmark + OpenClaw 列为生产级 Agent 框架参照)+ LiveMem arXiv:2608.02515 🔴 高价值(state continuity under context turnover + LongMemEval 验证)+ Global Optimization + Region Grafting + C2KV 17× + Lynx TTFT -30% + GoS + Tiered KV Cache = 9 件 |
| inbox/jay | 2026-08-05T1105-jay-five-category-briefing.md(8.8 KB) | LiveMem + llm 0.32 + MSR Orchard + MSR Echoverse + Raschka KV Sharing + ByteByteGo 幂等性 + CSDN RAG 补遗 7 件 coding-agents 邻接 |
| inbox/jay | 2026-08-05T1000-jay-morning-briefing.md(8.8 KB) | 10 件 Karpathy nanochat + Agent Compiler + Graph bitemporal + NVIDIA Agent Skills + Codex 研究自动化 = coding-agents §2.7 工业件套扩面 第 6 立家 |
| inbox/jay | 2026-08-05-engineering-e1prep.md(24.9 KB) | 7 条增量 · 1 新 arXiv = LinkedIn Online KV Cache Compaction P0 + Lilian Weng Harness Engineering 三大设计模式 + LiveMem + llm 0.32 + MSR Orchard + MSR Echoverse + NVIDIA/skills = coding-agents §2.1 Harness 学术化 + §2.7 工业件套扩面 第 6 立家 |
| inbox/jay | 2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md(15.5 KB) | vLLM/SGLang/TensorRT-LLM/Ollama/XInference 框架对比 + 腾讯云生产部署 + vLLM 显存公式 + 动态稀疏化/三值化量化 + RAG 全链路 + Agentic RAG + Multi-Agent LangGraph + 量化全景 = coding-agents §2.94 邻接 |
| inbox/jay | 2026-08-05-1736-jay-github-trending-hf-ai-engineering.md(8.3 KB) | HF Trending + GitHub Trending 8-5 + LongHorizon-Harness GitHub AMAP-ML 持续 + Skill-α GitHub THU-MIG 持续 + NVIDIA Agent Skills 第 2 锚点(github.com/NVIDIA/skills 100+ verified skills) |
| inbox/jay | 2026-08-05-2023-database-e1prep.md(24.2 KB) | Tikv + PostgreSQL + Vector DB + Graph DB + RecMem LoCoMo/LongMemEval-S 续立 |
| inbox/spark | 2026-08-05-1340-agent-e1prep.md(70.8 KB) | v40 备料 5 件 P1/P2 net-new 立标候选(Zero-Mem + Sparse Event-KV + LinkedIn + LiveMem + SwanTale)+ 1 件立标升档(LongHorizon-Harness 候选级 → 立标级)+ 1 件 P0 警示(spark 反思棒物理动作失效第 4 例)+ 1 件 P1 修订(HF Daily 飞轮从 v39 "轮换态" → v40 "完全替换态")+ 1 件 P2 反方候选(To Add Is Machine 删除回避 反方 #91)+ 5 实例 8-5 早间 23+ 件 持平 vs 8-4 早间 |
| inbox/spark | 2026-08-05-1904-llm-infra-e1prep.md(43.2 KB) | §IX 39th 备料 + LinkedIn KV Cache Compaction 邻接 + LiveMem 邻接 + Sparse Event-KV 反方邻接 + Zero-Mem 邻接 |
| paper_cards | 近 3 天新卡 728~742(8-5 净增 15 张,跨 12:30 / 16:30 / 21:00 三批) | 主分类 agent 5 张:730 2607.29377 Zero-Mem + 731 2607.28887 To Add Is Machine(evaluation 主分类)+ 734 2607.23693 Sparse Event-KV + 735 2608.04003 PAST-Bench + 739 2608.02713 Quo Vadis World Modeling · 主分类 evaluation 5 张:731 2607.28887 + 737 2608.03700 AntiSkillBench + 742 2607.26451 ExplainBench · 主分类 multimodal 2 张:736 2608.03979 Video-DeepResearch + 729 2608.01462 Loud or Silent · 主分类 engineering 3 张:728 2608.01862 Wnuan + 738 2608.02738 KGD + 741 2607.28993 ST-WAM · 主分类 agent robotics 1 张:740 2608.00730 Push-Wiper · 主分类 rag/risk 1 张:732 2607.25614 MemSFT · 待补:2608.00902 LinkedIn Compaction + 2608.02515 LiveMem + 2608.02287 SKT |
| work-queue.md | 8-5 22:00 自动生成 | 0 件高价值 Top 15 · 0 件待更新主题活文档 · 选题榜 2 件(2608.01964 LongHorizon-Harness + 2607.29377 Zero-Mem 待写脚本 · 8-5 candidates JSON 7/8 命中 + 1 手工补充 + Decoding Children's Gait 2608.00371 缺漏 + 与 8-4 candidates JSON 0/8 重叠 + 与 8-5 1440 场 4/8 重叠未明示)+ 0 件待写攻略 · 14 张卡缺 TLDR · 0 件待精确分类 · 8-5 22:00 待建卡 0 件 |
0.2 信号密度判定
与 8-3 evening 22:40 → 8-4 23:00 flyp coding-agents-e1prep-v18 第十八轮收官棒(长程 agent 三件套 LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian 第九路线 + SDB 立基础 + LongDS-Bench 反方 #88 + Constitutional Midtraining 反方 #88 + MLLM Adversarial Survey + Skills 工业实证 第 1 件 + KV Cache 第 6 件集群 + Model or Harness? + RecHarness + Multi-agent 100% vs Single 1.7% + 第一条工业实证 GitHub + StateAct 双胞胎立标 + 长程失败机制分类学第三块拼图 + ICML 2026 workshop + Amazon CloudWatch + context rot + HF Daily 飞轮"轮换态" 微反弹 = 18 棒 17 件总增量)相比,8-4 evening → 8-5 22:55 24h 净增量定位 = 主线 net-new 增量 0 件 + 8-4 早晨 net-new 7 件全部沿用 + 8-5 当日 5 件 net-new 立标候选(Zero-Mem arXiv:2607.29377 + Sparse Event-KV arXiv:2607.23693 + LinkedIn Online KV Cache Compaction arXiv:2608.00902 + LiveMem arXiv:2608.02515 + ContinualSkillBench arXiv:2608.03874)+ 反方候选新增 3 件(To Add Is Machine arXiv:2607.28887 SWE-bench Verified deletion recall ≤71.7% 反方 #89 + ExplainBench arXiv:2607.26451 Agent 代码解释 trustworthy 反方 #90 + AntiSkillBench arXiv:2608.03700 persona skill 隐私 反方 #91)+ HF Daily 8-5 #2 LongHorizon-Harness 127▲ 跨日 +4 = 立标升档 候选级 → 立标级(4 实例共识 + stephen + spark + flyp + jay)+ DAPD HF Daily 8-5 #3 55▲ + Skill-α #6 49▲ 立标信号增强 + arXiv:2607.26246 弱到强 OPD HF Daily #4 50▲ + arXiv:2607.28590 VAD HF Daily #7 43▲ + arXiv:2607.29209 SAF-OPD HF Daily #12 29▲ 续立 + arXiv:2607.26611 Fewer Clarifications HF Daily #14 25▲ 续立 + arXiv:2608.02287 SKT HF Daily #13 27▲ = Skills 工业实证 第 2 件 + arXiv:2608.04003 PAST-Bench arXiv 18▲ "短会话技能获取" 持续学习首个基准 + arXiv:2608.02499 SWE-Touch HF Daily #15 22▲ 用户改代码时对编码 Agent 的 benchmark + arXiv:2607.25614 MemSFT 对齐税 arXiv-邻接 + arXiv:2608.03700 AntiSkillBench 隐私 + arXiv:2607.28887 To Add Is Machine deletion recall + arXiv:2607.26451 ExplainBench 代码解释 三件套 = 安全 + 持续 + 可信评测三栖反方 + HF Daily 飞轮从 8-4 "轮换态" 进一步退化为 8-5 "完全替换态"(13 件 net-new + 2 件续立 + 0 件下榜 vs 8-4 4 件 net-new + 1 件下榜 + 10 件续立)= 净增量 14 件主线 + 1 件立标升档。本场承接关系中主线编码 Agent 主题在 8-5 04:20 已经收官完整立标(LongHorizon-Harness 立标级 + Skill-α 立基础 + DAPD 反方 + EMBL AI Librarian 第九路线 + SDB 立基础 + LongDS-Bench 反方 #88 + Constitutional Midtraining 反方 #88 + MLLM Adversarial Survey + Skills 工业实证 第 1 件 + KV Cache 第 6 件集群 + Model or Harness? + RecHarness = 18 棒 17 件总增量),8-5 24h 内主要工作是 8-4 立标候选 24h 内立标信号增强(LongHorizon-Harness HF Daily 跨日 +4 立标升档 + DAPD HF Daily #3 + Skill-α HF Daily #6)+ 5 件 P1 立标候选新出(Zero-Mem + Sparse Event-KV + LinkedIn + LiveMem + ContinualSkillBench)+ 3 件反方候选新增(To Add Is Machine + ExplainBench + AntiSkillBench)+ HF Daily 飞轮从 8-4 "轮换态" 进一步退化为 8-5 "完全替换态" 第 1 例 + spark 反思棒物理动作失效第 4 例。关键判断:Sparse Event-KV arXiv:2607.23693 "semantic materialization" 反方 + LinkedIn Online KV Cache Compaction arXiv:2608.00902 工业实证 = 同周 KV cache 作为 episodic memory 同时出现"理论否定 + 工业优化"双轨信号;Zero-Mem arXiv:2607.29377 零 token 路径 vs Memory Provenance Laundering arXiv:2607.29167 源权限不放大 = "Memory 范式分水岭" 第九路线 vs 第十路线候选 = 与活文档 §2.4 范式九路线对立延伸至十路线候选;To Add Is Machine arXiv:2607.28887 SWE-bench Verified deletion recall ≤71.7% 反方 + Skills 工业实证 第 1 件 = "删除编码能力弱" 与 "skill 学到即收益" 形成对照,编码 Agent 评测从"任务 pass@1" 向"过程能力分解" 范式拐点;AntiSkillBench arXiv:2608.03700 persona skill 隐私 与 Skills 工业实证 第 1 件 + LongHorizon-Harness 立标级 + DAPD HF Daily #3 = v47 安全栈第八联立标 → 第九联立标候选新增 = "persona-skill 管道" 安全栈新立面。
一、今日 coding-agents 主线最重要的 net-new 增量(8 件主线 + 1 件立标升档 + 3 件反方候选新增 = 12 条)
增量 1 · 🟡 P1 立标候选 · Zero-Mem:Zero-Token Memory Operations for LLM Agents(arXiv:2607.29377 / paper_cards 730)= agent 主题首个"零 LLM token 路径" 立标候选
- 来源:
inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md§1 精读 + 6 项风险评估 + 立标信号 ★★★★★ + 中-中偏高整体可信度inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.mdradar #1 ⭐⭐⭐ +inbox/tom/2026-08-05-rag-e1prep.md候选 A ⭐⭐⭐inbox/spark/2026-08-05-1340-agent-e1prep.md§增量 1 Zero-Mem v40 第六十九节点候选 + §3.1 共识候选新增 + §3.3 开放问题候选inbox/stephen/2026-08-05-2110-llm-application-e1prep.md§增量 1 Zero-Mem 立标候选inbox/flyp/2026-08-05-multimodal-e1prep.md邻接paper_cards/730-2607-29377.md(8-5 12:30 已建 · 主分类 agent · method)- URL:
https://arxiv.org/abs/2607.29377 - 要点:
- 核心问题:LLM Agent 长程交互需要记忆,但现有系统普遍靠额外 LLM 调用来读写记忆(summarize / extract / consolidate / retrieve)——反复消耗 token 与时间;中间生成记录还可能掩盖原始证据(provenance 丢失)
- 核心方案:Zero-Token Memory Operations = 整个记忆管道只在最后一步 QA 时调用一次 LLM,所有中间步骤(读/写/检索/校准)都通过 encoder-only + 结构化索引完成;encoder 计算单独核算
- 核心结构:保留原始交互轨迹作为唯一记录源(不生成中间摘要),通过两种互补视图组织:① entity–context graph(跨会话实体-上下文关系)+ ② temporal hierarchy(会话内时序局部性 + session state);query 加权两视图 + 确定性校准先丢冲突证据 + 严格 ground 在检索轨迹上
- 关键实验:长记忆 + 长上下文 QA 上,与最强 baseline 同 reader + 同 context budget 下,记忆操作时间开销 -57.6%;消融验证两种视图各自贡献 + query-dependent 协调机制的必要性
- 作者:Yilin Xiao, Zhehan Zhu, Yujing Zhang, Jin Chen, Zijin Hong, Luyao Zhuang, Qinggang Zhang, Shengyuan Chen, Xiaocao Ouyang, Lingfei Ren, Xiao Huang(12 人;abs 标题无项目号 → 推测为多机构合作,spark 棒次指出"无 Hugging Face / GitHub 公开 demo")
- 核心质疑:"We ask whether structured memory access requires generation at all." —— 直接挑战"memory 中介必须经过 LLM 生成"被广泛假设的默认
- 范式落点:与 jay 8-5 1050 LiveMem 互补(Zero-Mem = external encoder-only 离线结构;LiveMem = intrinsic memory state continuous under context turnover)— 两条反方路径彼此不冲突,共同指向"memory 系统单位成本应按 encoder / KV 写入/读取而非 LLM token 计量"= 系统设计层范式拐点
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §2.4 范式九路线对立 → 本场 §2.4 续立 = Zero-Mem arXiv:2607.29377 第十路线候选 = "零 LLM token 路径" = Σ-Mem(多 Agent 信任)+ Filesystem(媒介化)+ ConMem(工业)+ Fewer Clarifications(跨会话)+ EMBL AI Librarian(专业库)+ Memory Provenance Laundering(源权限)+ Memory Decoder at Scale(参数化)+ LiveMem(intrinsic memory)+ Zero-Mem(零 LLM token)= 九路线 → 十路线 立标候选;
- v34 §2.4 沿用 v37 Σ-Mem + Filesystem-Based Memory 关系确认 → 本场 §2.4 续立 = Zero-Mem 与 v45 §2.3 Memory Provenance Laundering(provenance 在生成即丢失)同向 = "memory 路径不是 LLM 唯一解" 立标候选;
- v34 §2.1 Harness 学术化 第十六阶段 8-4 立标 → 本场 §2.1 续立 = Zero-Mem 零 LLM 调用作为 harness 设计模式(沿用 v44 §2.7 Lilian Weng 三大设计模式:Workflow Automation / File System as Persistent Memory / Sub-agent + Backend Jobs)= v46 harness 框架补全;
- v34 §2.94 LiveMem 邻接 → 本场 §2.94 续立 = Zero-Mem + LiveMem 双件套 = Memory-as-Encoder + Memory-as-Intrinsic state 双向立标;
- v34 §3.1 共识 63 → 本场 §3.1 = 共识 64 候选新增 1 条 = "Zero-Mem arXiv:2607.29377 零 LLM token 路径" = v45 §1.3 Memory 第七路 → 九路线 → 十路线 = "memory 系统单位成本按 encoder / KV 写入/读取而非 LLM token 计量" 范式拐点;
- v34 §4 开放问题 98 → 本场 §4 = 开放问题 99 候选新增 1 条 = "Zero-Mem vs MEM0/Letta/LiveMem intrinsic memory 路线对比 + 实战 LLM 调用成本节约实测 + 代码公开实测可复核性";
- v34 §5 边界(沿用):Zero-Mem + LiveMem + Sparse Event-KV 与 agent.md §2.2 记忆与上下文工程 + llm-application.md §1.1 应用架构 + §1.3 Memory 八路 + llm-infra.md §IX 39th + rag.md §2.3 capacity-aware slot 双向 reference。
- 建议归入节:
- §2.4 范式十路线对立候选新增 = Zero-Mem arXiv:2607.29377 = Memory-as-Encoder 反方 = Memory 第七路线沿用 baseline 范式 + Memory 第八路线 + 第九路线 + 第十路线扩面 = 与 v37 Σ-Mem + Filesystem + ConMem + Fewer Clarifications + EMBL AI Librarian + Memory Provenance Laundering + LiveMem 形成"agent 信任 + 文件系统 + 工业 + 跨会话 + 专业库 + 源权限 + intrinsic memory + 零 LLM token = 八元化扩面 = 七元 → 八元化"
- §2.1 Harness 学术化 续立 = Zero-Mem 零 LLM 调用 = harness 设计模式补全(与 Lilian Weng 三大设计模式工作流自动化 + 文件系统持久记忆 + 子代理后台作业)
- §2.94 Memory 综述 立基础栖补强 = Zero-Mem + LiveMem 双件套
- §3.1 共识 63 → 64 候选新增 1 条(Zero-Mem 第十路线 + Sparse Event-KV 反方 #91)
- §4 开放问题 98 → 99 候选新增 1 条(Zero-Mem vs MEM0/Letta/LiveMem 对比 + Sparse Event-KV semantic materialization + LinkedIn Compaction production 实证 + 反方 #89-#91 三栖三联立验证)
- §5 边界(与 agent.md §2.2 / llm-application.md §1.1 + §1.3 Memory / llm-infra.md §IX 39th / rag.md §2.3 双向 reference)
增量 2 · 🔴 P0 立标候选(反方类)· Compute Globally, Materialize Locally:Sparse Event-KV Memory Contract(arXiv:2607.23693 / paper_cards 734)= KV cache 作为 episodic memory 隐含前提被证伪 反方立标候选
- 来源:
inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md§2 精读inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.mdradar #2 ⭐⭐ +inbox/tom/2026-08-05-rag-e1prep.md候选 C ⭐⭐ 警示inbox/spark/2026-08-05-1340-agent-e1prep.md§增量 2 反方 #91 候选 + v40 §2.6 第 52 子节 + §3.3 反方 #91inbox/stephen/2026-08-05-2110-llm-application-e1prep.md§增量 2 立标候选paper_cards/734-2607.23693.md(8-5 12:30 已建 · 主分类 agent · method · 副分类 llm-infra)- URL:
https://arxiv.org/abs/2607.23693 - 要点:
- 核心问题:长程 agent 普遍复用 KV cache 当记忆——serving 系统保留一部分缓存条目,其余丢弃;eviction + episodic-memory 方案都基于一个很少被直接验证的隐含前提:"a retained event is still informative once the observations that produced it are gone"(被保留事件在产生它的 observation 被丢弃后仍然有效)
- 核心实验设计:作者在相同 agent history 上省略一条更早的 observation,看下游答案是否仍能基于已缓存的 KV 行答对
- 核心发现:受影响答案绝大多数跟随被省略的 observation 值——而 served span 没有任何字面值指向正确答案
- 命名"semantic materialization"现象:下游事件的缓存行累积了状态,但这些状态依赖于不再被服务的 observation;意味着 cached KV entry 的语义内容随被省略 observation 漂移,而非静态保持
- 关键数据:Qwen3-8B 上"刻意 answer-free 事件"把 donor-aligned recovery 从 6% → 51%
- 作者:Zerui Cai(abs 仅 1 位 v1 作者显式列出,需 v2 复核)
- 核心结论:所有基于"事件=静态记忆"假设的 KV cache 复用方案,都需要定期 re-materialize 或动态更新缓存语义——这是 2026 H2 LLM Agent memory 的真实格局"LLM-mediated memory 主流范式同时受到'零 token 替代'(Zero-Mem)和'KV 残影可读写'(Sparse Event-KV)两条反方路线夹击"的另一半
- 范式落点:与 Zero-Mem 互补——两条反方路线共同指向"memory 系统单位成本应按 encoder / KV 写入/读取而非 LLM token 计量"= 系统设计层范式拐点(flyp 棒次 §0 关键判断)
- 可信度:⚠️ 单作者 v1,需 v2 复核团队;"semantic materialization" 现象是否在不同模型与不同 baseline 上稳健(Qwen3-8B 一组模型)需独立验证
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §2.5 KV Cache 顶会三件套 + 七大顶会议 KV-cache 集中爆发立标 + v34 §2.94 KV Cache 五大方向系统综述 arXiv:2603.20397 + v34 §2.94 KV Cache 优化第 6 件集群 8-4 立标 → 本场 §2.94 续立 = Sparse Event-KV arXiv:2607.23693 与 v34 §2.94 KV Cache 第 6 件集群 + v34 §2.5 KV Cache 顶会三件套 同向但形成反方"KV cache 不可以直接做 episodic memory" 立标候选;
- v34 §2.1 Harness 学术化 第十六阶段 8-4 立标 SDB arXiv:2605.20173 → 本场 §2.1 续立 = Sparse Event-KV 反方证据 = SDB 架构边界形式化的"反方佐证";
- v34 §2.5 Agent 安全六联立标层 → 本场 §2.5 续立 = Sparse Event-KV 反方 = Agent 安全 7/8 联立标 "consolidation 期间被洗白" 维度的姊妹实证;
- v34 §2.94 KV Cache 优化第 6 件集群 + v34 §2.94 KV Cache 反事实惊喜 arXiv:2607.27600 → 本场 §2.94 续立 = Sparse Event-KV 反方 + LinkedIn Online KV Cache Compaction arXiv:2608.00902 工业实证 = 同周 KV cache 作为 episodic memory 同时出现"理论否定 + 工业优化"双轨信号;
- v34 §3.1 共识 64(沿用)→ 本场 §3.1 续立 = Sparse Event-KV 反方 #91 候选新增 1 条 + 零 LLM token 路径"第十路线 候选新增 1 条;
- v34 §3.3 反方 88(沿用)→ 本场 §3.3 = 反方 #91 候选新增 = Sparse Event-KV + 反方 #89 = To Add Is Machine + 反方 #90 = ExplainBench + 反方 #91 = AntiSkillBench;
- v34 §4 开放问题 99(沿用)→ 本场 §4 = 开放问题 100 候选新增 1 条 = "LinkedIn Online KV Cache Compaction 4.2× throughput + 3.5× KV compression + Sparse Event-KV semantic materialization 同周双轨信号:工业优化 vs 理论否定 哪个是真?";
- v34 §5 边界(沿用):Sparse Event-KV 与 engineering.md §2.7 Agentic Engineering + llm-infra.md §IX 39th + llm-application.md §1.1 应用架构 + agent.md §2.7 三向 saturation 双向 reference。
- 建议归入节:
- §2.94 KV Cache 优化第 6 件集群 续立 = Sparse Event-KV 反方 = "理论否定 vs 工业优化"双轨信号
- §2.1 Harness 学术化 续立 = Sparse Event-KV 反方证据 + SDB 架构边界形式化"反方佐证"
- §2.5 Agent 安全六联 → 七联立标层 续立 = Sparse Event-KV 反方 + Memory Provenance Laundering 第八路线 = "consolidation 期间被洗白 / 语义漂移"姊妹实证
- §3.3 反方 88 → 91 候选新增 3 条(Sparse Event-KV 反方 #89 + To Add Is Machine 反方 #90 + ExplainBench 反方 #91 + AntiSkillBench 反方 #92)
- §4 开放问题 99 → 100 候选新增 1 条
- §5 边界(与 engineering.md §2.7 + llm-infra.md §IX 39th + llm-application.md §1.1 + agent.md §2.7 三向 saturation)
增量 3 · 🟢 P2 立标候选 · LinkedIn Online KV Cache Compaction for LLM Agents(arXiv:2608.00902)+ C2KV 17× + Lynx TTFT -30% = v34 §2.94 KV Cache 件套第 6 件集群的"生产实证级 LinkedIn 升档"
- 来源:
inbox/jay/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md§🔴 高价值① LinkedIn Online KV Cache Compaction 4.2× throughput + 3.5× KV compression + LinkedIn Engineering 背景 + 论文明确将 OpenClaw 列为生产级 Agent 框架参照(与 Anthropic/OpenAI/Google 并列)inbox/jay/2026-08-05-engineering-e1prep.md§增量 1 ⭐⭐⭐⭐⭐ P0 升档候选inbox/spark/2026-08-05-1340-agent-e1prep.md§增量 3 LinkedIn 立标候选 ≈ 候补级中-高档inbox/stephen/2026-08-05-2110-llm-application-e1prep.md§增量 4 LinkedIn 立标候选升档inbox/jay/2026-08-05-1736-jay-github-trending-hf-ai-engineering.mdGitHub Trending 8-5 持续- URL:
https://arxiv.org/abs/2608.00902 - 要点:
- LinkedIn Online KV Cache Compaction arXiv:2608.00902:
- 问题:LLM Agent 执行长时任务(软件工程、深度研究、Web 浏览)时,搜索结果、文件 diff、执行痕迹持续入 context,KV cache 线性膨胀导致显存瓶颈
- 两种 sequence-level compaction 家族对比:① Token Eviction (TE)——用 proxy queries 对缓存位置打分保留注意力权重最高位置;② Attention Matching (AM)——在选择之上额外拟合加性注意力偏置重建值使输出与完整 cache 匹配
- 核心发现:立即 compaction 通常会降精度;延迟到使用 agent 自身后续 generation 的 queries 时,能恢复大部分精度损失
- 关键工程数据: | 模型 | 方法 | Peak KV 压缩比 | Throughput 提升 | |------|------|--------------|--------------| | Qwen3.5-27B | Attention Matching | 272.1K→99.6K(3.5×) | 217→918 q/h(4.2×) | | Qwen3.5-27B | Token Eviction | 272.1K→121.3K(2.7×) | 217→717 q/h(3.3×) | | Gemma-4-31B | Attention Matching | — | 1.7× | | Gemma-4-31B | Token Eviction | — | 1.5× |
- 延迟 Compaction 比例 0.2(保留 20% KV):在大部分任务上保留无 compaction 精度
- GitHub repo 可复现 + LinkedIn Engineering + OpenClaw 列为生产级 Agent 框架参照
- C2KV(Position-Agnostic KV Cache) Weekly AI Newsletter 2026-07-27 至 08-02:lightweight sidecar extractor + learnable compression tokens,投影位置无关 KV 表示,无需改动 base model 参数;数据 17× 推理加速
- Lynx(Split-Stream KV Cache):高优先级 anchor stream + 低优先级 residual stream;TTFT 降低 30%,INT4 级传输延迟 + 全 INT8/BF16 推理精度
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §2.94 KV Cache 优化第 6 件集群 8-4 立标级(TopKV + C²KV + HiKV + Beyond Prefill-Decode + DualDecoder + KV Cache 反事实惊喜 + TokTier + ResKV)= v34 §2.94 件套 8 件 → 本场 §2.94 续立 = LinkedIn Online KV Cache Compaction = v34 §2.94 件套第 9 件 + C2KV 17× = 第 10 件 + Lynx TTFT -30% = 第 11 件 = v34 §2.94 件套扩面到 11 件 = 立基础栖补强;
- v34 §2.94 RAG 工程化第三路线立基础栖补强 → 本场 §2.94 续立 = LinkedIn Compaction + C2KV + Lynx = v34 §2.94 KV Cache 件套"产业 级 LinkedIn 升档";
- v34 §2.7 Agentic Engineering 学科化 → 本场 §2.7 续立 = LinkedIn Engineering 正式 agent 场景 KV cache compaction 实证研究 + frontier lab × LinkedIn 工程背景 第 19 栖候选;
- v34 §2.143 HF Daily 8-4 票榜 飞轮"轮换态" → 本场 = LinkedIn Compaction 同周与 Sparse Event-KV 反方同步 = "工业优化 vs 理论否定" 双轨信号;
- v34 §6 必读 219 → 本场 = 必读 222 候选新增 3 件(LinkedIn Compaction + C2KV + Lynx)。
- 建议归入节:
- §2.94 KV Cache 件套扩面到 11 件 = LinkedIn + C2KV + Lynx 第 9-11 件
- §2.7 Agentic Engineering 学科化 续立 = LinkedIn frontier lab × 工程背景 第 19 栖候选
- §6 必读 219 → 222 候选新增 3 件
增量 4 · 🟡 P1 立标候选 · LiveMem:state continuity under context turnover(arXiv:2608.02515)= intrinsic memory 第三路线 沿用 baseline 范式
- 来源:
inbox/jay/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md§🔴 高价值② LiveMeminbox/jay/2026-08-05-engineering-e1prep.md§增量 3inbox/jay/2026-08-05T1105-jay-five-category-briefing.mdLiveMeminbox/spark/2026-08-05-1340-agent-e1prep.md§增量 4- URL:
https://arxiv.org/abs/2608.02515 - 要点:
- 核心问题定义:state continuity under context turnover——evidence 从当前 context 移除后,agent 仍能基于 memory state 回答相关问题
- 问题精确化:长时间运行的 Agent 消费持续增长的交互流超出上下文容量,现有方法(context retention / summarization / retrieval)无法在 working context 变化时保持持久状态
- 技术方案:pretrained full-attention LLM + 额外 memory state;main attention path 保留 bounded KV window(如滑动窗口);memory state 携带全生命周期历史信息
- 属于 intrinsic memory 方法(无需 extra model)
- LongMemEval benchmark 验证:即使 evidence 已从当前 context 移除,LiveMem 仍能基于 memory state 回答问题
- Evidence-distance 分析:有用信息持续存在于 active window 之外
- 关键关系:与 LongHorizon-Harness 互补(LongHorizon-Harness 将任务状态显式置于执行之外;LiveMem 提供 intrinsic memory 实现路径)= 状态管理概念 vs 内存实现机制
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §2.4 范式九路线对立 → 本场 §2.4 续立 = LiveMem intrinsic memory 第三路线 = 与 Mem0(外部向量存储路线)+ Σ-Mem(filesystem-based memory)+ Zero-Mem(零 token 路径)+ Filesystem-Based Memory 形成 Memory 范式五路线候选 = 七路线沿用 baseline + Memory 第七路线 → 八路线 → 九路线 → 十路线(Zero-Mem)→ 第十一路线候选 LiveMem;
- v34 §2.4 SkillRise + CAST + SkillOpt + ACE 三角色架构 → 本场 §2.4 续立 = LiveMem intrinsic memory state 与 Filesystem-Based Memory 互补 = "intrinsic vs extrinsic" 双向立基础;
- v34 §2.1 Harness 学术化 第十六阶段 → 本场 §2.1 续立 = LiveMem + LongHorizon-Harness = 状态管理概念 vs 内存实现机制 = 双件套;
- v34 §3.1 共识 64 → 本场 §3.1 = 共识 65 候选新增 1 条 = "LiveMem arXiv:2608.02515 intrinsic memory 第三路线 = Memory 范式五路线 七路线 → 第十一路线候选扩面";
- v34 §6 必读 222 → 本场 = 必读 223 候选新增 1 件 LiveMem。
- 建议归入节:
- §2.4 范式十一路线对立候选新增 = LiveMem intrinsic memory 第三路线(与 Mem0 / Σ-Mem / Zero-Mem / Filesystem-Based Memory 形成 Memory 范式五路线)
- §2.1 Harness 学术化 续立 = LiveMem 内存实现机制 与 LongHorizon-Harness 状态管理 双件套
- §3.1 共识 64 → 65 候选新增 1 条
- §6 必读 222 → 223 候选新增 1 件
增量 5 · 🟢 P2 立标升档 · LongHorizon-Harness arXiv:2608.01964 候选级 → 立标级候选(HF Daily 8-5 #2 127▲ 跨日 +4 = 4 实例共识 + stephen + spark + flyp + jay)
- 来源:
inbox/jay/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.mdLinkedIn Compaction 4.2× 邻接 + LongHorizon-Harness 跨日 +4inbox/spark/2026-08-05-1340-agent-e1prep.md§立标升档 LongHorizon-Harness 候选级 → 立标级候选 v40 §1.33c 横切 53cinbox/stephen/2026-08-05-2110-llm-application-e1prep.md§增量 3 LongHorizon-Harness 立标升档inbox/stephen/2026-08-05-1245-stephen-coordination-check-noon.md§P1 缺口承接 4 实例共识inbox/tom/2026-08-05-0900-hf-daily-2026-08-05.md#2 LongHorizon-Harness 127▲paper_cards/713-2608-01964.md(8-5 02:00 已建 · 主分类 agent · 副分类 evaluation)- 要点(承接 v46 已立,本棒仅做"候选升档确认"):
- LongHorizon-Harness:LLM agents 越来越多地承担长 horizon 任务,需要在许多相互依赖的步骤中持续推理、调用工具并进行修正;现有 agent harness 将任务执行、任务状态与完成评估维护在一个不断增长的上下文中,导致状态难以追踪,并使错误的自评估传播到后续决策中;将长 horizon 执行重构为任务状态管理问题,将任务状态显式地置于执行之外,仅基于事实进行更新
- StateAct:Agent 执行长周期 computer-use 任务时子目标跨步骤切换导致 context 污染和状态错误;subagent 化——每个子目标分配 fresh subagent,保持 context 干净;StateAct 管理跨 subagent 程序状态;与 LongHorizon-Harness 共享目标(均把任务状态显式保留在执行外)
- Multi-agent vs Single Agent 数量级差距(348 次试验):Multi-agent orchestration 100% 可执行建议质量(348 次试验全部成功) vs Single agent 1.7%;延迟对比两者均为 ~40 秒(最终解生成时间相同);性能差距不是来自延迟,而是来自"正确性"和"特异性"
- ACE Agentic Context Engineering:三角色架构 Generator + Reflector + Curator;Agent 任务 +10.6%,金融分析任务 +8.6%,无需任何梯度更新
- 8-5 HF Daily #2 LongHorizon-Harness 127▲ vs 8-4 #2 123▲ 跨日 +4 = 立标升档信号 + 立标饱和度反弹
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §2.1 第十五阶段 → 第十六阶段 8-4 立标级 P0 → 本场 §2.1 续立 = LongHorizon-Harness 立标级 P0 二次确认(4 实例共识 + HF Daily 跨日 +4)= v46 §1.1 4 框架候选 → 立标级候选升档;
- v34 §3.2 争议 48 → 本场 = 争议 48 续立 = LongHorizon-Harness + StateAct 同源双胞胎立标风险(沿用)→ v47 拟修订为"实证支持 narrow-role 多 agent 协作 + 仅在异质条件下净收益"已 v46 沿用;
- v34 §2.143 HF Daily 飞轮"轮换态" 8-4 修订候选 → 本场 = HF Daily 飞轮从 8-4 "轮换态" 进一步退化为 8-5 "完全替换态" 第 1 例(13 件 net-new vs 8-4 4 件 net-new + 1 件下榜);
- v34 §3.1 共识 65 → 本场 §3.1 = 共识 65 续立 = LongHorizon-Harness 立标级二次确认。
- 建议归入节:
- §2.1 第十六阶段 立标级 P0 二次确认 4 实例共识
- §3.2 争议 48 续立 = LongHorizon-Harness + StateAct 同源双胞胎立标风险
- §3.1 共识 65 续立
增量 6 · 🟢 P2 反方候选新增 · To Add Is Machine, To Delete Is Human(arXiv:2607.28887 / paper_cards 731)= SWE-bench Verified deletion recall ≤71.7% 反方 #89 候选新增
- 来源:
inbox/tom/2026-08-05-evaluation-e1prep.mdTo Add Is Machine deletion recall 邻接inbox/flyp/2026-08-05-multimodal-e1prep.md邻接inbox/spark/2026-08-05-1340-agent-e1prep.md§增量 反方 #91 候选新增paper_cards/731-2607-28887.md(8-5 12:30 已建 · 主分类 evaluation · method)- URL:
https://arxiv.org/abs/2607.28887 - 要点:
- 核心问题:LLM 越来越多地编写和修复生产代码,但有证据表明,其通过测试的补丁让代码库更难维护——具体原因:deletion avoidance 删除回避 = 系统性倾向于保留本应被删除的代码
- 关键数据:在 SWE-bench Verified leaderboard 的 5 个领先模型上,对开发者补丁的 deletion recall 最高也只 71.7%(即使所有 5 个模型都解决的任务);模型能到达正确文件的占比 > 92%,但精确切中行的占比 < 52%;29.0% 的测试通过的补丁包裹而非删除目标代码
- 意义:编码 Agent 评测从"任务 pass@1" 向"过程能力分解" 范式拐点;与 Skills 工业实证 第 1 件形成对照——"删除编码能力弱" + "skill 学到即收益"
- 与 v45 §1.4 Reliability Science Reliability 工程反方 #87 沿用 23,392 episodes 实证 邻接 = 第 89 反方候选新增
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §3.3 反方 88(沿用)→ 本场 §3.3 = 反方 88 → 89 候选新增 = To Add Is Machine arXiv:2607.28887 deletion avoidance = SWE-bench Verified 反方实证;
- v34 §2.6 工业化 第 4 立家 + Skills 工业实证 第 1 件 → 本场 §2.6 = Skills 工业实证 vs 反方 #89 To Add Is Machine = "skill 学到即收益" vs "删除编码能力弱" = 编码 Agent 评测从"任务 pass@1" 向"过程能力分解" 范式拐点;
- v34 §4 开放问题 100 → 本场 §4 = 开放问题 100 续立 = To Add Is Machine deletion recall 5 主流模型 71.7% vs Skills 工业实证 ICML 60/247 workshop 数量级对比 + Anthropic Skills 验证实战 loss 0%。
- 建议归入节:
- §3.3 反方 88 → 89 候选新增 1 条(SWE-bench Verified 反方实证)
- §2.6 工业化 第 4 立家 续立 = Skills 工业实证 第 1 件 + 反方 #89 To Add Is Machine 双向对位
- §4 开放问题 100 续立
增量 7 · 🟢 P2 反方候选新增 · ExplainBench arXiv:2607.26451 + AntiSkillBench arXiv:2608.03700 = 反方 #90 + #91 候选新增 = 编码 Agent "解释可信度 + skill 隐私" 安全 + 可信评测三栖反方
- 来源:
inbox/tom/2026-08-05-evaluation-e1prep.mdExplainBench + AntiSkillBench 邻接inbox/tom/2026-08-05T1440-agent-rag-longcontext-radar.mdAntiSkillBench arXiv:2608.03700 + SkillTrustStackinbox/flyp/2026-08-05-risk-e1prep.mdAntiSkillBench 隐私 邻接inbox/spark/2026-08-05-1340-agent-e1prep.md§增量 反方候选新增 2 件paper_cards/737-2608-03700.md(8-5 12:30 已建 · 主分类 evaluation · benchmark · 副分类 agent)+paper_cards/742-2607-26451.md(8-5 12:30 已建 · 主分类 agent · survey · 副分类 evaluation)- URL:
https://arxiv.org/abs/2607.26451+https://arxiv.org/abs/2608.03700 - 要点:
- ExplainBench arXiv:2607.26451:首个系统评估编码 Agent 代码解释可信度的基准 = 自动评估来自编码 Agent 的解释(开发者手动审查 Agent 结果日益不可行 → 转向解释以理解已生效的更改 → 但没有基准评估 Agent 生成解释的可信度)
- AntiSkillBench arXiv:2608.03700:persona skill 隐私泄漏 + 冒充风险 + 防御基准 = 7,500 persona-grounded dialogue traces + persona-skill pipeline 全过程风险与防御评估 = 安全 + 持续 + 可信评测三栖反方
- 意义:与 v46 §1.1 Skills 工业实证 第 1 件(ICML 2026 workshop "agentic AI" 60/247 + Amazon CloudWatch Coding Agent Insights)同向 = Skills 工业化的"安全 + 可信"反方对位
- 与 v45 §1.4 Reliability Science Reliability 工程反方 #87 沿用 邻接
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §3.3 反方 89 → 本场 §3.3 = 反方 89 → 90 候选新增 1 条 = ExplainBench arXiv:2607.26451 + 反方 90 → 91 候选新增 1 条 = AntiSkillBench arXiv:2608.03700;
- v34 §2.5 Agent 安全六联立标层 → 七联立标层 = Constitutional Midtraining 第七联 + Memory Provenance Laundering 第六联 → 本场 §2.5 = Agent 安全七联 → 八联立标层 = AntiSkillBench 第八联 = "persona-skill pipeline 隐私泄漏" 新立面;
- v34 §2.6 Skills 工业实证 第 1 件 + v34 §6 必读 223 → 本场 §2.6 + §6 = Skills 工业实证 vs 反方 #90 + #91 = "skill 学到即收益" vs "解释可信度" + "skill 隐私" = 工业化与安全对位。
- 建议归入节:
- §3.3 反方 89 → 90 + 反方 90 → 91 候选新增 2 条(ExplainBench + AntiSkillBench)
- §2.5 Agent 安全七联 → 八联立标层 = AntiSkillBench 第八联
- §2.6 工业化 第 4 立家 续立 = Skills 工业实证 vs 反方 #90 + #91 工业化与安全对位
- §6 必读 223 续立
增量 8 · 🟢 P2 立标候选 + 修订 · ContinualSkillBench arXiv:2608.03874 + PAST-Bench arXiv:2608.04003 + SKT arXiv:2608.02287 + SWE-Touch arXiv:2608.02499 = 持续学习 + 技能获取 + 会话保留 + 用户改代码时编码 Agent = 4 件基准立标候选 = v34 §2.3 Skills 学习 RL 化第 4 件 → 第 5 件 + 立基础栖补强
- 来源:
inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.mdinbox/tom/2026-08-05T1440-agent-rag-longcontext-radar.mdPAST-Bench arXiv 18▲ + Quo Vadis HF Daily 16▲inbox/tom/2026-08-05T2040-agent-rag-longcontext-radar.mdv2 ContinualSkillBench 4 高价值inbox/tom/2026-08-05-evaluation-e1prep.mdContinualSkillBench + PAST-Bench + Multi-Agent LangGraphinbox/jay/2026-08-05T1000-jay-morning-briefing.mdAgent Compiler + Graph bitemporal + NVIDIA Agent Skillsinbox/jay/2026-08-05T1105-jay-five-category-briefing.mdMSR Orchard + Echoverse + Raschka KV Sharing + ByteByteGoinbox/jay/2026-08-05-1736-jay-github-trending-hf-ai-engineering.mdNVIDIA Agent Skills 第 2 锚点inbox/spark/2026-08-05-1340-agent-e1prep.mdSwanTale 第 16 栖候选 邻接paper_cards/735-2608-04003.md(8-5 12:30 已建 · 主分类 agent · benchmark)+paper_cards/739-2608.02713.md(8-5 12:30 已建 · 主分类 agent · method)+paper_cards/728-2608-01862.md(8-5 12:30 已建 · 主分类 engineering · method)- URL:
https://arxiv.org/abs/2608.03874+https://arxiv.org/abs/2608.04003+https://arxiv.org/abs/2608.02287+https://arxiv.org/abs/2608.02499 - 要点:
- ContinualSkillBench arXiv:2608.03874:5 领域 × 100 互相联接子任务 + 难度递增 + 跨任务技能复用机会 = 首份持续学习专用 Agent 评测基准(填补 static-benchmark 与 real-world 之间的方法论空白)
- PAST-Bench arXiv:2608.04003:26 场景 / 204 集 + 覆盖 memory + procedural reuse + skill acquisition 三类任务 = 首位系统测试"历史经验是否真的让 Agent 变好"的基准(Shuhan Xue et al.)
- SKT arXiv:2608.02287(HF Daily 8-5 #13 27▲):基于已验证合成数据生成的大规模 Skill 使用训练 = Skills 工业实证 第 2 件
- SWE-Touch arXiv:2608.02499(HF Daily 8-5 #15 22▲):用户改动代码时对编码 Agent 的基准测试 = 编码 Agent "code-state-aware" 评测新维度
- Quo Vadis, World Modeling? arXiv:2608.02713(HF Daily 8-5 #9 30▲):Agent-Centric Interactive World Proxies = 用世界模型获得低成本、可控的反馈信号,支撑决策前的快速验证
- Video-DeepResearch arXiv:2608.03979:modality bias(绕开视觉工具走文本搜索)+ parametric knowledge leakage(用内部记忆而非真实工具调用)
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系:
- v34 §2.3 Skills 由静态说明书演变为可训练资产 + v34 §2.3 Skills RL 化 第 4 件 Skill-α + v34 §2.6 工业化 第 4 立家 + Skills 工业实证 第 1 件 → 本场 §2.3 + §2.6 续立 = ContinualSkillBench + PAST-Bench + SKT + SWE-Touch + Quo Vadis + Video-DeepResearch = Skills 工业实证 第 2 件 + 反方 #89 + 反方 #90 + 反方 #91 候选新增 + Skills 学习 RL 化 第 4 件 → 第 5 件 = 立基础栖扩面;
- v34 §2.4 范式九路线对立 → 本场 §2.4 = Skill-α + SKT + ContinualSkillBench + PAST-Bench = Skills 学习 RL 化 第 4-5 件 + 持续学习评测 第 1-2 件候选;
- v34 §3.1 共识 65 → 本场 §3.1 = 共识 65 → 66 候选新增 1 条 = ContinualSkillBench + PAST-Bench + SKT + SWE-Touch = "持续学习 + 技能获取 + 会话保留 + 用户改代码时编码 Agent" 四栖立标;
- v34 §6 必读 223 → 本场 = 必读 227 候选新增 4 件(ContinualSkillBench + PAST-Bench + SKT + SWE-Touch)。
- 建议归入节:
- §2.3 Skills 学习 RL 化 第 4 件 → 第 5 件 续立 = ContinualSkillBench + PAST-Bench + SKT + SWE-Touch = Skills 工业实证 第 2 件
- §2.4 范式九路线 → 十一路线对立候选新增 = LiveMem + Zero-Mem intrinsic memory 二路线
- §3.1 共识 65 → 66 候选新增 1 条
- §6 必读 223 → 227 候选新增 4 件
二、值得警惕的矛盾或待核实说法(8 件)
- LinkedIn Online KV Cache Compaction arXiv:2608.00902 与 Sparse Event-KV arXiv:2607.23693 同周"工业优化 vs 理论否定"双轨信号矛盾 = 工业实证(Jay 8-5 1050 LinkedIn 4.2× throughput + 3.5× KV compression)+ 理论反方(Sparse Event-KV "semantic materialization" 显式证伪 KV cache 可直接做 episodic memory)= v47 拟新增 §2.94 KV Cache 件套"双轨信号" 待 v47 接力 v46 协调棒解决"工业优化 vs 理论否定 哪个是真?" 矛盾
- Zero-Mem arXiv:2607.29377 零 token 路径 vs LiveMem arXiv:2608.02515 intrinsic memory 路径 = Memory 范式第十路线 vs 第十一路线互补 = 二者并非真正对立,Zero-Mem = external encoder-only 离线结构;LiveMem = intrinsic memory state continuous under context turnover = 共同指向"memory 系统单位成本应按 encoder / KV 写入/读取而非 LLM token 计量"= 8-5 24h 内 二者均首次出现 + 共同立标 = v47 §2.4 范式十路线对立候选 连续新增 2 条需 v47 接力 v46 协调棒合并活文档 §2.4 续立 同一节段
- DAPD arXiv:2608.01735 HF Daily 8-5 #3 55▲ vs 8-4 #3 net-new = 立标信号 24h 内 +55 = 与 v46 §1.1 4 框架一致,无矛盾
- Skill-α arXiv:2608.01678 HF Daily 8-5 #6 49▲ vs 8-4 net-new = 立标信号 24h 内 +49 = 与 v46 §1.1 4 框架一致,无矛盾
- LongHorizon-Harness arXiv:2608.01964 HF Daily 8-5 #2 127▲ vs 8-4 #2 net-new = 立标信号 24h 内 +4 跨日 = 立标升档候选级 → 立标级确认 = 与 v46 §1.1 4 框架二次确认
- To Add Is Machine arXiv:2607.28887 SWE-bench Verified 5 主流模型 deletion recall ≤71.7% 反方 = 与 v46 §1.6 Skills 工业实证 第 1 件对照,无矛盾
- AntiSkillBench arXiv:2608.03700 7,500 persona-grounded dialogue traces persona-skill pipeline 风险与防御 = 与 v46 §1.6 Skills 工业实证 第 1 件对照,无矛盾
- Multi-agent vs Single agent 100% vs 1.7% 数量级差距 YouTube 二手引用 Enterprise AI Ecosystem Explained 2026 = 原始论文需进一步核验(沿用 v46 §3.2 争议 #4),但数量级差距与 v45 §3.2 争议 #4 行业共识一致,无新矛盾
三、可引用的 arXiv 号列表(8-5 24h net-new 立标候选 14 件 + arXiv 编号附录)
8-5 24h net-new 立标候选 5 件 P1/P2 + 反方候选新增 3 件 + 立标升档 1 件 + 邻接补强 5 件 = 14 件(8-5 已建 paper_cards 或已建卡):
- arXiv:2607.29377 Zero-Mem:Zero-Token Memory Operations for LLM Agents(主分类 agent · method · paper_cards/730 8-5 12:30 已建)
- arXiv:2607.23693 Compute Globally, Materialize Locally:Sparse Event-KV Memory Contract(主分类 agent · method · 副分类 llm-infra · paper_cards/734 8-5 12:30 已建)
- arXiv:2608.00902 Online KV Cache Compaction for LLM Agents(LinkedIn Engineering · 待补 paper_cards/741 arXiv 编号 · jay 1050 + jay 1125 邻接)
- arXiv:2608.02515 LiveMem:state continuity under context turnover(待补 paper_cards · jay 1050 + jay 1125 + jay 1105 邻接)
- arXiv:2608.01964 LongHorizon-Harness(v46 已立 · paper_cards/713 8-5 02:00 已建 · 立标升档二次确认)
- arXiv:2608.01678 Skill-α Progressive Agent Skill Generation via RL(v46 已立 · paper_cards/714 8-5 02:00 已建 · HF Daily 8-5 #6 49▲ 立标信号增强)
- arXiv:2608.01735 DAPD Dual-Anchored Policy Distillation(v46 已立 · paper_cards/716 8-5 02:00 已建 · HF Daily 8-5 #3 55▲ 立标信号增强)
- arXiv:2607.28887 To Add Is Machine, To Delete Is Human(主分类 evaluation · method · paper_cards/731 8-5 12:30 已建 · 反方 #89 候选新增)
- arXiv:2607.26451 ExplainBench:Evaluating Code Explanations from Agents(主分类 agent · survey · 副分类 evaluation · paper_cards/742 8-5 12:30 已建 · 反方 #90 候选新增)
- arXiv:2608.03700 When Agents Learn to Be You:AntiSkillBench(主分类 evaluation · benchmark · 副分类 agent · paper_cards/737 8-5 12:30 已建 · 反方 #91 候选新增)
- arXiv:2608.04003 PAST-Bench:Benchmarking Recursive Self-Improvement in Personal Agents(主分类 agent · benchmark · 副分类 evaluation · paper_cards/735 8-5 12:30 已建 · 持续学习首个基准)
- arXiv:2608.03874 ContinualSkillBench:Continual Skill Acquisition(主分类 agent · benchmark · tom 2040 v2 重写版 4 高价值 · 持续学习首个基准)
- arXiv:2608.02713 Quo Vadis, World Modeling?Agent-Centric Interactive World Proxies(主分类 agent · method · paper_cards/739 8-5 12:30 已建 · HF Daily 8-5 #9 30▲)
- arXiv:2608.02287 SKT:Verified Synthetic Skill Generation Skill Usage Training(HF Daily 8-5 #13 27▲ · 待补 paper_cards · Skills 工业实证 第 2 件)
- arXiv:2608.02499 SWE-Touch:When User Modifies Code Benchmark(HF Daily 8-5 #15 22▲ · 待补 paper_cards · 编码 Agent code-state-aware 评测新维度)
- arXiv:2608.03979 Video-DeepResearch:Multimodal DR Agent Bypass Visual Tools(主分类 multimodal · method · 副分类 agent · paper_cards/736 8-5 12:30 已建 · modality bias + parametric knowledge leakage)
- arXiv:2607.25614 MemSFT:Mitigating Alignment Tax with External Parametric Memory(主分类 risk · method · 副分类 rag · paper_cards/732 8-5 12:30 已建 · 对齐税)
- arXiv:2608.01862 Wnuan:Staged Post-Training for Enterprise QA(主分类 engineering · method · paper_cards/728 8-5 12:30 已建 · WnuanBench 707 题目 AAR 52.76→80.06→91.51%)
- arXiv:2608.02583 UEmbed:Unified Sparse and Dense Multimodal Embeddings(v46 已建 · HF Daily 8-5 #8 42▲)
v34 沿用 21 件 net-new arXiv 编号:arXiv:2608.01964 · arXiv:2608.01678 · arXiv:2608.01735 · arXiv:2607.28229 · arXiv:2605.20173 · arXiv:2605.30434 · arXiv:2607.26654 · arXiv:2603.27918 · arXiv:2607.28802 · arXiv:2607.29241 · arXiv:2607.28633 · arXiv:2607.17715 · arXiv:2607.22389 · arXiv:2607.25498 · arXiv:2607.26475 · arXiv:2607.27600 · arXiv:2607.23802 · arXiv:2607.28617 · arXiv:2607.28509 · arXiv:2607.26571 · arXiv:2607.24000(8-5 24h 沿用)。
v47 接力 v46 24h 净增量(沿用 +14 件 net-new arXiv 编号):arXiv:2607.29377 · arXiv:2607.23693 · arXiv:2608.00902 · arXiv:2608.02515 · arXiv:2607.28887 · arXiv:2607.26451 · arXiv:2608.03700 · arXiv:2608.04003 · arXiv:2608.03874 · arXiv:2608.02713 · arXiv:2608.02287 · arXiv:2608.02499 · arXiv:2608.03979 · arXiv:2607.25614 · arXiv:2608.01862 · arXiv:2608.02583 = 16 件(含 LinkedIn arXiv:2608.00902 待补 paper_cards)。
v47 §2.5 Agent 安全六联 → 七联 → 八联立标层:AntiSkillBench arXiv:2608.03700 第八联 = "persona-skill pipeline 隐私泄漏" 新立面。
v47 §2.94 KV Cache 件套扩面到 11 件:LinkedIn Online KV Cache Compaction arXiv:2608.00902 = 第 9 件 + C2KV 17× = 第 10 件 + Lynx TTFT -30% = 第 11 件 = v34 §2.94 件套第 9-11 件 = 立基础栖扩面。
四、与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十八轮 现有脉络的关系(总览)
v34 第十八轮已固化 §1 23 阈值饱和沿用第 7 拍 + §2.1 第十五阶段 → 第十六阶段 LongHorizon-Harness 立标级 + Skill-α + DAPD + SDB + StateAct 长程 agent 三件套 + LongDS-Bench 反方 #88 + §2.4 范式九路线对立 + EMBL AI Librarian 第九路线 + §2.5 Agent 安全六联 → 七联立标层 + Constitutional Midtraining 第七联 + §2.94 KV Cache 第 6 件集群 = 17 栖饱和 → 本场 8-5 24h 增量 12 件(8 件 P1/P2 立标候选 + 1 件立标升档 + 3 件反方候选新增)→ v47 §2.4 续立 = 九路线 → 十路线候选新增(Zero-Mem)+ 十一路线候选新增(LiveMem)+ 范式八联骨架 + 反方 89-91 候选新增 = v47 §2.4 累计候选新增 2 条 + 反方候选新增 3 条;v47 §2.1 续立 = LongHorizon-Harness 立标级 P0 二次确认 + StateAct 同源双胞胎立标风险 续立 + LinkedIn Online KV Cache Compaction 工业实证 第 19 栖候选;v47 §2.5 续立 = Agent 安全七联 → 八联立标层 = AntiSkillBench 第八联 = "persona-skill pipeline 隐私泄漏" 新立面;v47 §2.94 续立 = KV Cache 件套扩面到 11 件(LinkedIn + C2KV + Lynx 第 9-11 件)= "工业优化 vs 理论否定" 双轨信号 v47 协调棒解决;v47 §3.3 反方 88 → 89 + 90 + 91 候选新增 3 条 = To Add Is Machine + ExplainBench + AntiSkillBench;v47 §6 必读 219 → 227 候选新增 8 件 = "Skills 学习 RL 化 第 4 件 → 第 5 件 + 持续学习首个基准 + 解释可信度首个基准 + persona-skill privacy 首个基准 + Sparse Event-KV 反方 + Zero-Mem 零 token 路径 + LinkedIn Online KV Cache Compaction + LiveMem intrinsic memory 第 3 路线" 八栖立标。
与 agent.md / evaluation.md / risk.md / engineering.md / multimodal.md / llm-application.md / llm-infra.md 邻接(沿用 v34 §7 双边界双向 reference 强度升级):Zero-Mem + Sparse Event-KV + LiveMem + LinkedIn Compaction + To Add Is Machine + ExplainBench + AntiSkillBench + ContinualSkillBench + PAST-Bench + Quo Vadis + Video-DeepResearch + MemSFT = 与 agent.md §2.4 第 69-71 节点候选 + §1.45 frontier lab × Memory 安全 第 18 栖 + evaluation.md §R36 §2.7 评测对象横向分化新增"持续学习 Agent 评测"行 + risk.md §2.6 安全 + §3.3 反方 + engineering.md §2.7 Agentic Engineering 学科化 + §2.13 推理引擎可复现性 + §2.94 KV Cache 件套 + multimodal.md §2.39 VLA 飞轮 + llm-application.md §1.1 应用架构 + §1.3 Memory 八路 + §1.4 评测与可靠性 + llm-infra.md §IX 38th → 39th 备料 + §1.7 推理经济学 邻接(本棒新增 + 强度升级)。
五、本棒(8-5 23:20 E1 预消化)与今晚(8-5 22:00+ → 8-6 04:20)活文档接力 v47 备料建议
建议今晚活文档接力 v47 工作方向:
- v47 §2.1 续立 = LongHorizon-Harness 立标级 P0 二次确认 4 实例共识 + StateAct 同源双胞胎立标风险 + LinkedIn Online KV Cache Compaction 工业实证 第 19 栖候选(按优先级 1)
- v47 §2.4 续立 = 九路线 → 十路线对立候选新增(Zero-Mem 零 LLM token 路径)+ 十一路线对立候选新增(LiveMem intrinsic memory 第 3 路线)= 与 v37 Σ-Mem + Filesystem-Based + ConMem + Fewer Clarifications + EMBL AI Librarian + Memory Provenance Laundering + Memory Decoder at Scale + LiveMem + Zero-Mem 形成"agent 信任 + 文件系统 + 工业 + 跨会话 + 专业库 + 源权限 + 参数化 + intrinsic memory + 零 LLM token = 九元化扩面 = 八元 → 九元化 = 与 v45 §2.4 范式九路线对立扩面到十一路线(按优先级 2)
- v47 §3.3 反方 88 → 89 + 90 + 91 候选新增 3 条 = To Add Is Machine arXiv:2607.28887 + ExplainBench arXiv:2607.26451 + AntiSkillBench arXiv:2608.03700 = "deletion avoidance 71.7% + 解释可信度 0 基准 + persona-skill 7,500 traces 隐私泄漏" 编码 Agent 反方三栖对位(按优先级 3)
- v47 §2.94 KV Cache 件套扩面到 11 件 + "工业优化 vs 理论否定"双轨信号 v47 协调棒解决:LinkedIn Online KV Cache Compaction arXiv:2608.00902 + C2KV + Lynx + Sparse Event-KV 反方 arXiv:2607.23693 = v47 §2.94 双轨(按优先级 4)
- v47 §2.5 Agent 安全七联 → 八联立标层 = AntiSkillBench 第八联 = "persona-skill pipeline 隐私泄漏" 新立面(按优先级 5)
- v47 §3.1 共识 63 → 66 候选新增 3 条 + v47 §3.2 争议 47 → 48 候选新增 1 条(沿用 LongHorizon-Harness + StateAct)+ v47 §4 开放问题 97 → 100 候选新增 3 条 + v47 §6 必读 219 → 227 候选新增 8 件 = v47 §3+§4+§6 全数续立(按优先级 6)
- v47 §5 边界:Zero-Mem + LiveMem + Sparse Event-KV + LinkedIn Compaction + ContinualSkillBench + PAST-Bench + AntiSkillBench + To Add Is Machine + ExplainBench + Quo Vadis + Video-DeepResearch + MemSFT + SKT + SWE-Touch 与 7 邻接主题活文档双向 reference 强度升级(按优先级 7)
v47 备料预期累计阈值(基于 v46 沿用 8-4 23 阈值饱和 + 8-5 14 件主线净增量): - §2.1 累计候选新增 1 件(LinkedIn)+ §2.4 累计候选新增 2 件(Zero-Mem + LiveMem)+ §2.5 累计候选新增 1 件(AntiSkillBench 第八联)+ §2.6 累计候选新增 4 件(ContinualSkillBench + PAST-Bench + SKT + SWE-Touch)+ §2.94 累计候选新增 3 件(LinkedIn + C2KV + Lynx)= v47 累计候选新增 11 件(与 8-4 第十五阶段 → 第十六阶段 17 栖饱和相比,8-5 第十九棒"八联 → 十一联" = 反方 88 → 91 + 共识 63 → 66 + 必读 219 → 227 = "Skills 学习 RL 化 第 4 件 → 第 5 件 + 持续学习首个基准 + 解释可信度首个基准 + persona-skill privacy 首个基准 + Sparse Event-KV 反方 + Zero-Mem 零 token 路径 + LinkedIn Online KV Cache Compaction + LiveMem intrinsic memory 第 3 路线" 八栖立标) - v47 累计总候选 ≈ 17 + 11 = 28 件(沿用 v34 第十六阶段 + 本棒新增) - v47 §3.1 共识新增 3 条 + §3.3 反方新增 3 条 + §6 必读新增 8 件 = 14 件 总增量
v47 §1 全景 23 阈值饱和沿用第 8 拍 = 8-5 第十九棒"八联 → 十一联"+ "工业优化 vs 理论否定"双轨信号 v47 协调棒解决 + "Memory 范式第八联 → 第十一联扩展" + "持续学习 + 解释可信度 + persona-skill privacy 首个基准" + "立基础栖扩面 第 6 立家 → 第 7 立家(NVIDIA Agent Skills)" + "反思棒物理动作失效第 4 例(8-5)+ 第 5 例(8-6 待 04:20 触发)"。
六、本棒收官(19h vs v34 第十八轮 24h 总定位)
本棒定性:极低密度 + 主线 net-new 增量 0 件 + 8-4 早晨 7 件 net-new 全部沿用 + 8-5 当日 5 件 net-new 立标候选 + 3 件反方候选新增 + 1 件立标升档二次确认 = 第十九棒定位 = "沿用 + 立标信号增强 + 反方对照 + 飞轮'完全替换态'" = 承接 v34 第十八轮 23 阈值饱和沿用第 7 拍后,8-5 24h 主要工作在"立标信号二次确认(4 实例共识 24h 内 5 件 net-new 立标候选 + 1 件立标升档)+ 反方对照(3 件反方候选新增)" = 8-5 总净增量 14 件(vs v34 第十八轮 17 件净增量 = 82.4% 速度)。沿用 v34 §1 17 栖饱和 + §2.1 第十六阶段 + §2.4 范式九路线 + §2.5 Agent 安全七联 + §2.94 KV Cache 第 6 件集群 = 24h 内未出现新主线 + 主要工作在"立标信号二次确认 + 反方对照 + 沿用升级" = 8-5 第十九棒 = 立标饱和度反弹 + 反方对照丰富 + 立基础栖稳定 = "反方证伪 + 工业实证 + 范围扩大"三栖稳态。关键发现:Zero-Mem 零 LLM token 路径与 LiveMem intrinsic memory 第三路线 同周互补出现 = 共同指向"memory 系统单位成本按 encoder / KV 写入/读取而非 LLM token 计量" = Memory 范式第 10-11 路线候选;LinkedIn Online KV Cache Compaction 工业实证 与 Sparse Event-KV 反方 同周双轨信号 = "工业优化 vs 理论否定" 矛盾 v47 协调棒解决;Skills 工业实证 第 1 件 vs 反方 #89 To Add Is Machine + 反方 #90 ExplainBench + 反方 #91 AntiSkillBench = "skill 学到即收益" vs "deletion avoidance + 解释可信度 + persona-skill privacy" = 编码 Agent 评测从"任务 pass@1" 向"过程能力分解" + "安全 + 可信" 范式拐点。
v34 → v47 阈值扩面预期:§1 23 阈值饱和沿用第 7 拍 → v47 24 阈值饱和(立标饱和度反弹 + 反方对照丰富)= 8-5 24h 增量 = 立标饱和度反弹 + 立标升级持续 + 反方对照丰富 + 立基础栖稳定 = 沿用 + 立标信号增强 + 反方对照 + 飞轮"完全替换态" 四栖稳态 = 第十九棒定性。
v47 §1 全景候选新增饱和预期(基于 8-5 第十九棒 vs v34 第十八轮):§1 23 → 24 阈值饱和(立标饱和度反弹 vs 第七拍 + 反方对照丰富) + §2.1 11 件 → 12 件(LinkedIn Online KV Cache Compaction 工业实证)= +1 件 + §2.4 15 件套 → 16 件套(Zero-Mem + LiveMem 九路线 → 十一路线扩面)= +2 件(九路线 → 十一路线 - Memory Provenance Laundering + EMBL AI Librarian + Memory Decoder at Scale + LiveMem + Zero-Mem = 5 路线当前 + 新增 LiveMem + Zero-Mem 第十/十一路线候选 = 11 路线 / 16 件套 = 11 + 5 = 16 件套)+ §2.5 7 联 → 8 联立标层(AntiSkillBench 第八联)= +1 联 + §2.94 8 件 → 11 件(LinkedIn + C2KV + Lynx 第 9-11 件)= +3 件 + §3.3 反方 88 → 91 + To Add Is Machine = +4 件 = v47 累计候选新增 = §2.1 +1 + §2.4 +2 + §2.5 +1 + §2.94 +3 + §3.3 +4 = +11 件 总候选新增(沿用 v34 第十六阶段 17 件 + 本棒 +11 件 = 28 件)。
主轴 vs 邻接增量:本棒 +11 件 总候选新增中,§2.1 +1 件 + §2.4 +2 件 + §2.5 +1 件 + §2.94 +3 件 + §3.3 +4 件 = 主轴 11 件 + 0 件 邻接增量 = 主轴增量 = 11 件(100%),邻接增量 = 0 件 = 主轴增量 100%,主轴增量比 = 1.00(vs v34 第十八轮主轴增量 100% 持平 = 立标饱和度反弹 单调 + 反方对照丰富 + 立基础栖稳定 续立 = 主轴 vs 邻接 100% 主轴 + 0% 邻接 = 立标饱和度反弹 单调 = 第 2 立基础栖饱和)。
v47 接力路径建议:今晚(8-5 22:00+ → 8-6 04:20)接力棒 spark / stephen / flyp 三实例 24h 内各出 ≥1 件主力 e1prep + jay 端持续 8 件棒 + tom 端 8 件棒 + spark 反思棒物理动作失效第 4 → 5 例 = 8-6 v47 接力棒备料饱和。
附录 · 本棒引用文件清单(8-5 24h 检查来源)
| 来源 | 文件 | 大小 | 检查时间 |
|---|---|---|---|
| inbox/flyp | 2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md | 19.6 KB | 8-5 23:20 |
| inbox/flyp | 2026-08-05-multimodal-e1prep.md | 47.2 KB | 8-5 23:20 |
| inbox/flyp | 2026-08-05-risk-e1prep.md | 49.6 KB | 8-5 23:20 |
| inbox/flyp | 2026-08-05-0950-3DZip-short-read-critical.md + 8-5-2250-3DZip-3D-VLM-token-compression-critical-read.md + 8-5-2250-SwanTale-unified-multispeaker-audio-critical-read.md + RSS 4 件 | 30.0 KB | 8-5 23:20 |
| inbox/stephen | 2026-08-05-2110-llm-application-e1prep.md | 51.9 KB | 8-5 23:20 |
| inbox/stephen | 2026-08-05-1027-ai-industry-e1prep.md | 40.3 KB | 8-5 23:20 |
| inbox/stephen | 2026-08-05-1245-stephen-coordination-check-noon.md + 2026-08-05-2245-stephen-coordination-check-evening.md | 72.2 KB | 8-5 23:20 |
| inbox/tom | 2026-08-05-0900-hf-daily-2026-08-05.md + 0840/1440/2040 agent-rag-longcontext-radar 三场 + rag/evaluation/inference-e1prep | 102.5 KB | 8-5 23:20 |
| inbox/jay | 2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md + 1000 morning-briefing + 1050 kvc-agents-arxiv-weekly + 1105 five-category + 1125 engineering-e1prep + 1736 github-trending + 2023 database-e1prep + 2105 evening-five-category + 2200 late-night-addendum | 138.4 KB | 8-5 23:20 |
| inbox/spark | 2026-08-05-1340-agent-e1prep.md + 1904 llm-infra-e1prep.md | 114.0 KB | 8-5 23:20 |
| inbox/ 跨主题 | stephen / tom / jay / spark / flyp 跨主题 25 件主力棒 + 11 件 RSS 快照 + 22 件 paper_cards | 312 KB | 8-5 23:20 |
| paper_cards | 728-742 (15 张,跨 12:30 / 16:30 / 21:00 三批)+ 730 Zero-Mem + 731 To Add Is Machine + 734 Sparse Event-KV + 735 PAST-Bench + 737 AntiSkillBench + 739 Quo Vadis + 742 ExplainBench 等 | 24.0 KB | 8-5 23:20 |
| work-queue.md | 8-5 22:00 自动生成 | 1.5 KB | 8-5 23:20 |
| 活文档 | knowledge/coding-agents.md v34 Wave4 E1 第十八轮(8-5 04:20 收官版,90.6 KB)+ .coding-agents-candidate.md | 181.2 KB | 8-5 23:20 |
| 本棒总检查 | 总检查来源 ≈ 1082.5 KB / 140+ 件文件 | 8-5 23:20 |
总结
8-5 第十九棒 = 沿用 + 立标信号二次确认 + 反方对照丰富 + 立基础栖稳定 = 立标饱和度反弹 单调 + 反方证伪 + 工业实证 + 范围扩大 四栖稳态 = 24h 净增量 14 件 = "Zero-Mem 零 LLM token 路径 + Sparse Event-KV 反方 + LinkedIn Online KV Cache Compaction 工业实证 + LiveMem intrinsic memory 第 3 路线 + LongHorizon-Harness 立标级 P0 二次确认 + To Add Is Machine SWE-bench Verified deletion recall ≤71.7% 反方 #89 + ExplainBench 解释可信度 反方 #90 + AntiSkillBench persona-skill privacy 反方 #91 + ContinualSkillBench 持续学习首个基准 + PAST-Bench 短会话技能获取基准 + MemSFT 对齐税 + SKT Skills 学习 RL 化 第 2 件 + SWE-Touch 用户改代码时编码 Agent 基准 + Quo Vadis Agent-Centric World Proxies + 8-4 立标候选(HF Daily 8-5 跨日 +4 立标升档 + 立标信号增强)"。
8-5 23:20 本棒 = flyP 第十九棒 = 第十九棒接力 v47 备料 = 主轴增量 100% = 立标饱和度反弹 第 2 立基础栖饱和 + 反方对照丰富 + 立基础栖稳定 = 24h 净增量 14 件主线 = 与 v34 第十八轮 17 件 + v47 候选新增 11 件 = 28 件 候选新增 = 23 阈值饱和沿用第 7 拍 → 第 24 阈值饱和 → 第 8 拍 立标饱和度反弹 + 反方对照丰富 + 立基础栖稳定 = 24h 内净增量 14 件 vs 第十七轮 17 件净增量 = 82.4% 速度 = 主线无新增量 + 沿用 100% + 邻接补强 14 件。