coding-agents · E1 预消化简报(2026-08-04)
执行:flyP · 2026-08-04 23:20 Asia/Shanghai(E1 日间预消化 · coding-agents 棒 · 第 18 棒 = 第十七轮收官后 第 18 轮) 窗口:8-3 evening 22:40 → 8-4 23:00(近 24h+) + paper_cards 707~719(8-4 全天 净增 13 张)+ HF Daily 8-4 票榜(15 件 · 4 件 net-new + 1 件下榜 + 10 件续立 · 飞轮机制从"完全饱和" 微反弹为"轮换态") 活文档基线:
/shared/research-kb/organized/knowledge/coding-agents.mdWave4 E1 第十七轮(8-4 04:25 收官版 · Memory Provenance Laundering 第八路线 + 8-3 radar 五向 + airllm 第 6 拍 + Lossy Verification 四类失败模式 + Token-Oriented Inference 学术锚点 = 主轴 net-new 0 + 跨主题补全 8 件 + 警示 1 件 P0 沿用 + 立基础栖 1 件 P2 + 邻接 3 件 = 17 棒 8 件总增量) 本场定性:极低密度 + 主线 net-new 增量 0 件 + LongHorizon-Harness arXiv:2608.01964 + Skill-α Progressive Agent Skill arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = 8-4 早晨 4 件 net-new agent 主分类立标候选(全为 2608.* 8 月新号 · paper_cards/713/714/716/709 已建 · 长程任务状态管理 + RL-based skill generation + OPSD 特权幻觉修正 + 专业文献库 Agent 化 = v45 §1.1 + §1.3 + §2.3 四向补全)+ StateAct arXiv(立标需核) + SDB 架构方法论 arXiv:2605.20173 jay 8-4 1050 立基础(2026-05 老号 · 新近 jay radar 推广)+ LongDS-Bench arXiv:2605.30434 flyp 8-4 2250 critical-read(2026-05 老号 · 长程数据分析域 + 47 pp 早→晚塌陷 · 与 Long-Horizon Terminal-Bench / Reliability Science / HORIZON 形成"long-horizon agent 失败机制分类学"第三块拼图)+ LongHorizon-Harness + StateAct 同源 = 双胞胎立标候选风险 + DAPD 特权幻觉是否仅在 OPSD 场景出现 + Memory Decoder at Scale 8-4 票榜 #4 51▲(跨日 +2)第七路线立标饱和工业实证 + HF Daily 飞轮衰减为"轮换态" 微反弹 = 净增量 6 条主线 + 1 件同源双胞胎立标候选 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 = 9 件承接关系:本棒承接 8-4 04:25 flyp coding-agents-e1prep-v17 第十七轮收官棒(Memory Provenance Laundering arXiv:2607.29167 第八路线 + Lossy Verification arXiv:2607.26627 + Token-Oriented Inference arXiv:2606.20295 + Σ-Mem 与 Filesystem-Based Memory 关系确认 + 8-3 radar 五向 + airllm + AIMultiple 29% + TencentDB-Agent-Memory + antirez/ds4 + HF Trending 8-3 + Dify 1.1.0 + SGLang 3 CVE + Datadog 容量攻击面 + EU AI Act 当日已过 + HF 入侵 8-2 完整技术复盘 = 17 棒 8 件总增量);承接 8-3 23:29 flyp coding-agents-e1prep-v16 第十六轮收官棒(Metis 单日翻倍级 +113 254▲ + Memory Decoder at Scale 48▲ 第七路线立标候选 + Frontis-MA1 162▲ RSI 三联立 + 主权开源 三联立标级 = Kimi K3 + GLM-5/GLM-5.2 + DeepSeek V4-Flash-0731 + Metis 单日翻倍级 + Memory Decoder at Scale 第七路线立标候选 + Frontis-MA1 162▲ RSI 三联立 + 学术 Harness 5 维度叠加饱和 v37 维度收敛判定候选升档 + Brain Bytes 6 层 + Alice Labs Top 7 + Pulumi + Codingscape + Substack Claudio Stamile + Hermes Agent FTS 反方 + RecMem 三联骨架 + EU AI Act 2026-08-02 当日已过 状态切换 + HF 入侵 8-2 完整技术复盘 + Modular MAX 第五推理引擎 + LMCache MLSys 2026 + Transformers v5.14.1 + Model Runner v2 + vLLM v0.26.0 XPU + 第一届 vLLM Conference 2026-08-24~26 + MirrorCode $251/14h/25 目标 17/25 100% + Lilian Weng Harness 八元组 + ByteByteGo 三层架构 + BM25 Wins at Scale arXiv:2607.26497 + See2Think arXiv:2607.26769 + Σ-Mem arXiv:2607.27958 + Filesystem-Based Memory arXiv:2607.26637 + CoMem arXiv:2607.28263 + Shadow in the Cache arXiv:2508.09442 NDSS 2026 P0 警示 + Anthropic Project Glasswing 8-1 = 16 棒 12 件总增量);承接 8-4 09:46 flyp multimodal-e1prep(8-4 早晨 5 件 multimodal 主分类新卡 + MWM 升档 + RL²-VLA + Counterfactual Sensitivity + 3D-Aware RGB-NIR + Scaling Properties + Evaluation-Verification Reward);承接 8-4 16:37 flyp risk-e1prep-v37(Constitutional Midtraining arXiv:2607.26654 P2 候补级 + MLLM Adversarial Survey arXiv:2603.27918 P3 邻接 + SGLang 3 CVE 跟催 矛盾 #57 实证深化);承接 8-4 22:52 flyp 2250-LongDS-Bench-long-horizon-data-analysis-critical-read(长程数据分析域 47 pp 早→晚塌陷 + 与 LHTB / Reliability Science / HORIZON 拼图第三块);承接 8-4 15:57 flyp 1550-TEngineDB-V-and-DEFRAG-systems-critical-read(DPPQ 方向感知量化 + DEFRAG 去中心化边缘 RAG);承接 8-4 09:52 flyp 0950-Mental-World-Modeling-critical-read(MWM arXiv:2607.27201 §2.39.119 候补级新增 + Counterfactual Sensitivity arXiv:2607.27888);承接 8-4 stephen 10:32 ai-industry-e1prep-v35(6 件 net-new 增量 + HF Daily 8-4 票榜 4 件轮换 + paper_cards 库新增速率反弹 15.8×);承接 8-4 stephen 21:17 llm-application-e1prep-v46(8 件新候选沿用 v45 + LongHorizon-Harness / Skill-α / DAPD / EMBL AI Librarian 4 件 net-new agent 主分类 + KV Cache 优化第 6 件集群爆发 + StateAct 程序状态管理 + ACE Agentic Context Engineering 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距 + SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁 + MCP 五大风险 + RAG 安全 CVE-2025-32711);承接 8-4 stephen 12:49 stephen-coordination-check-noon(5 主题主力 e1prep 早间仅 60% 满 + spark 端 agent-e1prep 缺位 = lessons-W31 整改项复发);承接 8-4 stephen 22:48 stephen-coordination-check-evening(8-4 全天 7 份主力 e1prep 全部就位 + coding-agents 棒补位 = flyp 本棒);承接 8-4 tom 09:00 hf-daily-2026-08-04(15 件票榜首 · 4 件 net-new + 1 件下榜 + 10 件续立 · 飞轮"轮换态" 微反弹);承接 8-4 tom T0840 + T1440 + T2040 radar 三场;承接 8-4 tom rag-e1prep / evaluation-e1prep / inference-e1prep;承接 8-4 jay 09:42 / 10:53 / 13:37 / 16:21 / 17:36 / 18:50 / 19:05 / 21:08 jay 8 件(SDB arXiv:2605.20173 + StriaTrace OSDI 2026 + time-to-first-token 路线图 + KV Cache 4 件 TopKV/C²KV/HiKV/反事实惊喜 + Snyk Agentic AI Adoption Vol. II + SGLang 2026 夏季更新 + StateAct 长周期 Agent 状态管理 + ACE Agentic Context Engineering + MCP skill 工程化 + Claude Code MCP skill 实战);承接 8-4 jay 11:24 engineering-e1prep-v44(5 条增量 · 1 新 arXiv = SDB arXiv:2605.20173 立基础 · coding-agents §2.7 邻接);承接 8-4 jay 11:09 tech-newsletter(MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述);承接 8-4 spark 13:40 agent-e1prep-v39(5 件 net-new + 1 件升档 + 1 件 P0 警示 · EMBL AI Librarian + Counterfactual Sensitivity + MWM 升档 + OpenAI GPT-Live/Circles + Karpathy Opus 5 "Pelican Test 2.0" + spark agent-e1prep 连续 5 天缺位 + HF Daily 飞轮机制从"完全饱和" 微反弹为"轮换态" = 4 件 net-new + 1 件下榜 + 10 件续立);承接 8-4 spark 18:48 llm-infra-e1prep-v16(§IX 37th → 38th 备料 · paper_cards 712-719 8 件 2608.* 8 月新号 占位级别低置信度);承接 8-4 paper_cards 712-719(8 件 8 月新号 占位级别 + 707-711 8-4 早晨 5 件 net-new + 690-706 8-3 早晨 12 张 = 30 张 ≈ 1.25 张/h vs v35 11h 净增 1 张 ≈ 0.09 张/h = 13.9× 反弹);承接 work-queue.md 8-4 22:00(0 待建卡 / 0 高价值 Top 15 候补级 / 2 选题榜未成脚本 / 0 待写攻略 / 14 张卡缺 TLDR / 0 待精确分类)。
0. 检查范围与信号密度
0.1 检查来源清单
| 来源目录 | 检查文件 | 主要 coding-agents 增量 |
|---|---|---|
| inbox/flyp | 2026-08-04-multimodal-e1prep.md(43.1 KB) | 8-4 早晨 5 件 multimodal 主分类新卡 + MWM arXiv:2607.27201 §2.39.119 候补级新增 + RL²-VLA + Counterfactual Sensitivity + 3D-Aware RGB-NIR + Scaling Properties + Evaluation-Verification Reward = 6 件立标候选邻接 coding-agents §2.4 / §2.94 / §1.32 范式分水岭 |
| inbox/flyp | 2026-08-04-risk-e1prep.md(27.7 KB) | Constitutional Midtraining arXiv:2607.26654 P2 候补级 + MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 P3 邻接 + SGLang 3 CVE 跟催矛盾 #57 实证深化 = 5 实例 24h 6 大类协同 + 风险主线 3 件 net-new |
| inbox/flyp | 2026-08-04-0950-Mental-World-Modeling-critical-read.md(14.8 KB) | flyP 8-4 0950 critical-read · MWM arXiv:2607.27201 v40 §2.39.119 候补级新增 + 心理变量作为世界模型一等公民 + 五维心理状态(信念/欲望/意图/情感/社会许可)+ 训练自由 MENTIS orchestrator + 与 WorldDiT / VisualPatchWorld / ShadowDancer / PhiZero / Emergence World / Beyond pass@1 七项跨月脉络串接 + 4 反方 + 3 待核 + 立标上限 ≈ 候补级中档 vs v38 候补级低档 + Counterfactual Sensitivity Credit arXiv:2607.27888 辅短审稿 |
| inbox/flyp | 2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md(8.3 KB) | flyP 8-4 1550 critical-read · TEngineDB-V arXiv:2608.00650 DPPQ 方向感知量化 + DEFRAG arXiv:2608.00922 去中心化边缘 RAG + 与 coding-agents §X「边缘端 agent 编排」潜在交叉 |
| inbox/flyp | 2026-08-04-2250-LongDS-Bench-long-horizon-data-analysis-critical-read.md(10.9 KB) | flyP 8-4 2250 critical-read · LongDS-Bench arXiv:2605.30434 长程数据分析域 47 pp 早→晚塌陷 + 5 类 state-evolution patterns + 与 07-08 HORIZON + Long-Horizon Terminal-Bench + Reliability Science / HORIZON / DeepPlanning 拼图第三块 + SOTA frontier 模型最高均值 48.45% + 长程 agent 可靠性塌陷实证 + coding-agents §3.3 反方 #88 候选邻接 |
| inbox/flyp | 2026-08-04-1001-rss-cameron-wolfe.md | 沿用 v37 反方候选池补料 |
| inbox/flyp | 2026-08-04-1003-rss-interconnects.md | 沿用 v34 §2.108 |
| inbox/flyp | 2026-08-04-1006-rss-yt-ai-explained.md | 沿用 v34 §2.108 |
| inbox/flyp | 2026-08-04-1006-rss-yt-two-minute-papers.md | 沿用 v34 §2.108 |
| inbox/stephen | 2026-08-04-ai-industry-e1prep.md(53.9 KB) | 6 件 net-new 增量 + HF Daily 8-4 票榜 4 件轮换 + paper_cards 库新增速率反弹 15.8× + OpenAI GPT-Live / Circles = frontier lab 公告反弹第 1 例 |
| inbox/stephen | 2026-08-04-llm-application-e1prep.md(83.2 KB) | 8 件新候选沿用 v45 + LongHorizon-Harness arXiv:2608.01964 + Skill-α Progressive Agent Skill arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = 4 件 net-new agent 主分类立标候选 + KV Cache 优化第 6 件集群爆发 + StateAct + ACE 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距 + SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁 + MCP 五大风险 + RAG 安全 CVE-2025-32711 = 6 维度补全 |
| inbox/stephen | 2026-08-04-1245-stephen-coordination-check-noon.md | 5 主题主力 e1prep 早间仅 60% 满 + spark 端 agent-e1prep 缺位 = lessons-W31 §3.5 整改项复发 |
| inbox/stephen | 2026-08-04-2245-stephen-coordination-check-evening.md | 8-4 全天 7 份主力 e1prep 全部就位 + coding-agents 棒补位 = flyp 本棒 |
| inbox/tom | 2026-08-04-0900-hf-daily-2026-08-04.md | 15 件票榜首 · 4 件 net-new(RLSVR 73▲ + MWM 53▲ + AISPA 31▲ + RefCaptioner 26▲)+ 1 件下榜(DistillAlign 88▲→off)+ 10 件续立 = 飞轮机制从"完全饱和" 微反弹为"轮换态" |
| inbox/tom | 2026-08-04T0840-agent-rag-longcontext-radar.md | 8 候选 4 高价值 = EMBL AI Librarian + HyPE + CrossRAG + SAF-OPD + RL²-VLA + Counterfactual Sensitivity + Constitutional Midtraining + TFGformer = 8 件中 4 件 coding-agents 邻接 |
| inbox/tom | 2026-08-04_rag-lite.md | 8 件候选 = TEngineDB-V + From Cloud to Crowd + EMBL AI Librarian + Reranking in RAG Substack + SAF-OPD + Constitutional Midtraining + Beyond Feeling Better + Not All Tokens = coding-agents 邻接 5 件 |
| inbox/tom | 2026-08-04-rag-e1prep.md | 本期实质增量 = 0 条 · RAG 主题 ArXiv 新鲜供给进入绝对低谷期 |
| inbox/tom | 2026-08-04-evaluation-e1prep.md | 5 条确认增量 + 5 件 8-3 radar 高价值 + ConMem arXiv:2607.28263 = 邻接补强 |
| inbox/tom | 2026-08-04-inference-e1prep.md(20.6 KB) | 8-4 沿用 v45 + 6 主线 + 1 重要修正 + 1 警示 + AIMultiple H100 29% 架构差距 + airllm 4GB + SGLang CVE + KV Cache 综述 + NexusQuant 等 |
| inbox/jay | 2026-08-04T1050-jay-engineering-filter.md | 7 条高价值 · SDB arXiv:2605.20173 生产级 LLM Agent 随机-确定性边界架构方法论 + StriaTrace OSDI 2026 + time-to-first-token 路线图 + 能耗建模 + ISSTA 工业实践 + Gemma kernel 优化 + NVIDIA 控制钩子 = coding-agents §2.7 邻接 1 件 SDB 立基础 |
| inbox/jay | 2026-08-04T0940-jay-ai-engineering-trending-aug.md | GitHub Trending + HF Trending + 向量数据库 Q2 2026 + Substack 工程洞察 + Memory in the LLM Era arXiv:2604.01707 = coding-agents §2.94 邻接 |
| inbox/jay | 2026-08-04T1335-jay-ai-engineering-trending-aug.md | 沿用 v37 + Memory in the LLM Era 续立 |
| inbox/jay | 2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md | Agent Guardrails 演变 2024 → 2026 + MCP workload identity + secretless access + 37 分评估缺口 + Rail B 治理与安全 = coding-agents §2.13 协议层 + 应用层 16 维 续立 |
| inbox/jay | 2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md | TopKV arXiv:2607.28633 + C²KV arXiv:2607.17715 + Beyond Prefill-Decode arXiv:2607.25498 + HiKV arXiv:2607.22389 + DualDecoder arXiv:2607.26475 + KV Cache 反事实惊喜 arXiv:2607.27600 = KV Cache 第 6 件集群爆发 6 件 + Snyk Agentic AI Adoption Vol. II |
| inbox/jay | 2026-08-04T1850-jay-engineering-filter-p2.md | StateAct 长周期 Agent 状态管理 + CSDN RAG 实战 + vLLM/Ollama 并发实测 + TokTier 有状态 tokenization + ResKV 固定预算 KV 压缩 + LMDeploy benchmark + Ollama #9054 跨租户 2026-04 仍未修复 = StateAct P2 核验 arXiv 原文 |
| inbox/jay | 2026-08-04T1905-jay-five-category-briefing.md | ICML 2026 workshop "agentic AI" 60/247 + Amazon CloudWatch Coding Agent Insights 产品发布 + Skills RL 化 + ACE 三角色架构 + context rot 从学术问题变成工程计费项 = coding-agents §2.3 Skills 工业实证 |
| inbox/jay | 2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md | MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面 + SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁 = coding-agents §2.13 协议层 + 应用层 + §2.5 安全 续立 |
| inbox/jay | 2026-08-04-engineering-e1prep.md(16.2 KB) | 5 条增量 · 1 新 arXiv = SDB arXiv:2605.20173 ⭐⭐⭐⭐⭐ 邻接 coding-agents §2.7 + StriaTrace OSDI 2026 + time-to-first-token 路线图 + Datadog AI Engineering 现状 |
| inbox/jay | 2026-08-04-tech-newsletter.md | Adversarial Attacks on MLLMs arXiv:2603.27918 TMLR 2026 37 页综述 + Q1 2026 RAG 状态 + TencentDB-Agent-Memory 团队级 + context rot 从学术问题变成工程计费项 = coding-agents §2.39 反方 + §2.94 邻接 |
| inbox/spark | 2026-08-04-agent-e1prep.md(75.8 KB) | 5 件 net-new + 1 件升档 + 1 件 P0 警示 · EMBL AI Librarian arXiv:2607.28229 v39 §2.4 邻接补全 第六十八节点候选 + Counterfactual Sensitivity arXiv:2607.27888 v39 §2.4 / §3.3 反方新候选 + MWM arXiv:2607.27201 v39 §1.32c 横切 52c / §1.44 WAM 知行鸿沟 v39 升档 HF Daily 8-4 #3 53▲ vs 8-3 #15 18▲ 立标信号 2.94× 增强 + OpenAI GPT-Live + Circles + Karpathy Opus 5 "Pelican Test 2.0" + spark agent-e1prep 连续 5 天缺位 = 第 1 例系统性塌方边缘 + HF Daily 飞轮机制从"完全饱和" 微反弹为"轮换态" |
| inbox/spark | 2026-08-04-llm-infra-e1prep.md(60.8 KB) | §IX 38th 备料 · paper_cards 712-719 8 件 2608.* 8 月新号 占位级别低置信度 + LongDS-Bench arXiv:2605.30434 邻接 + Constitutional Midtraining arXiv:2607.26654 第 5 维 反方 #88 候补 + MLLM Adversarial Survey arXiv:2603.27918 邻接 |
| inbox/spark | 2026-08-04-1002-rss-gradient-flow.md | 沿用 v34 §2.108 · 连续 5 天 0 净新内容(主线 L ≥ 13 天 / 主线 G ≥ 7 天 = 远超立节点阈值) |
| inbox/spark | 2026-08-04-1003-rss-chip-huyen.md | AI Engineering Pitfalls 2025 旧文 · 源端死亡 |
| inbox/spark | 2026-08-04-1007-rss-yt-3blue1brown.md | 主题完全无关 · 源端死亡 |
| paper_cards | 近 3 天新卡 707~719(8-4 全天 净增 13 张) | 主分类 agent 5 张:707 2608.00922 From Cloud to Crowd + 708 2608.00650 TEngineDB-V + 709 2607.28229 EMBL AI Librarian + 713 2608.01964 LongHorizon-Harness + 714 2608.01678 Progressive Agent Skill · 主分类 llm-infra 3 张:712 2608.02583 UEmbed + 716 2608.01735 DAPD + 718 2608.00799 CADENA · 主分类 multimodal 4 张:702 2607.29684 3D-Aware RGB-NIR + 703 2607.26991 RL²-VLA + 704 2607.27888 Counterfactual Sensitivity + 717 2608.01185 3DZip · 主分类 evaluation 2 张:697 2607.29025 Eval-Verification Reward + 700 2607.18082 Rubric-based RL Self-Distillation · 主分类 rag 2 张:693 2607.29459 TFGformer + 694 2607.29402 HyPE · 主分类 multimodal 沿用 4 张 + 主分类 llm-infra 沿用 1 张(699 2607.28675 Meshy T2)· 主分类 risk 1 张:711 2607.26654 Constitutional Midtraining |
| work-queue.md | 8-4 22:00 自动生成 | 0 件高价值 Top 15 · 0 件待更新主题活文档 · 选题榜 2 件(2607.24368 + 2607.27146)· 0 件待写攻略 · 14 张卡缺 TLDR · 0 件待精确分类 · 8-4 22:00 待建卡 0 件 |
0.2 信号密度判定
与 8-3 morning → 8-4 04:25 flyp coding-agents-e1prep-v17 第十七轮收官棒(Memory Provenance Laundering arXiv:2607.29167 第八路线 + Lossy Verification arXiv:2607.26627 + Token-Oriented Inference arXiv:2606.20295 + Σ-Mem 与 Filesystem-Based Memory 关系确认 + 8-3 radar 五向 + airllm + AIMultiple 29% + TencentDB-Agent-Memory + antirez/ds4 + HF Trending 8-3 + Dify 1.1.0 + SGLang 3 CVE + Datadog 容量攻击面 + EU AI Act 当日已过 + HF 入侵 8-2 完整技术复盘 = 17 棒 8 件总增量)相比,8-4 morning → 8-4 evening 19h 净增量定位 = 主线 net-new 增量 0 件 + LongHorizon-Harness arXiv:2608.01964 + Skill-α Progressive Agent Skill arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = 8-4 早晨 4 件 net-new agent 主分类立标候选(全为 2608.* 8 月新号 · paper_cards/713/714/716/709 已建)+ StateAct arXiv(立标需核 · jay 8-4 1850 P2 核验)+ SDB 架构方法论 arXiv:2605.20173 jay 8-4 1050 立基础(2026-05 老号 · 新近 jay radar 推广)+ LongDS-Bench arXiv:2605.30434 flyp 8-4 2250 critical-read(2026-05 老号 · 长程数据分析域 47 pp 早→晚塌陷 · 与 Long-Horizon Terminal-Bench / Reliability Science / HORIZON 形成"long-horizon agent 失败机制分类学"第三块拼图)+ LongHorizon-Harness + StateAct 同源 = 双胞胎立标候选风险 + DAPD 特权幻觉是否仅在 OPSD 场景出现 + Memory Decoder at Scale 8-4 票榜 #4 51▲(跨日 +2)第七路线立标饱和工业实证 + HF Daily 飞轮衰减为"轮换态" 微反弹 + MWM arXiv:2607.27201 8-4 票榜 #3 53▲ vs 8-3 票榜 #15 18▲ 立标信号 2.94× 增强 + Constitutional Midtraining arXiv:2607.26654 120B 规模持久对齐中训练 反方 #88 候补 + MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 P3 邻接 + ICML 2026 workshop "agentic AI" 60/247 + Amazon CloudWatch Coding Agent Insights 产品发布 + context rot 从学术问题变成工程计费项 = 净增量 6 条主线 + 1 件同源双胞胎立标候选 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 + 1 件第七路线立标饱和工业实证 + 1 件 HF Daily 飞轮"轮换态" 微反弹 + 1 件 MWM 立标信号 2.94× 增强 + 1 件反方 #88 候补 + 1 件 P3 邻接 + 1 件工业实证(ICML + Amazon)= 9 件。本场承接关系中主线编码 Agent 主题在 8-4 04:25 已经收官完整立标(Memory Provenance Laundering 第八路线 + Lossy Verification 四类失败模式 + Token-Oriented Inference 学术锚点 + Σ-Mem 与 Filesystem-Based Memory 关系确认 + 8-3 radar 五向 + airllm 第 6 拍),8-4 19h 内主要工作是 4 件 8-4 早晨 net-new agent 主分类立标候选 + StateAct 立标需核 + SDB 立基础 + LongDS 长程失败机制分类学第三块拼图 + 飞轮"轮换态" 微反弹 + MWM 立标信号 2.94× 增强,而非新主线立标。关键判断:LongHorizon-Harness arXiv:2608.01964 + StateAct 同源思路(均把任务状态显式保留在执行外)= 是否构成独立立标还是合并立标需 v46 §1.1 明确 = 同源双胞胎立标候选风险;DAPD arXiv:2608.01735 特权幻觉是否仅在 OPSD 场景出现 + DAPD 在其他训练方法(off-policy distillation / RLHF / DPO)中是否适用 = 需 PDF 全文核验。
一、今日 coding-agents 主线最重要的 net-new 增量(6 条主线 + 1 件同源双胞胎立标候选 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 = 9 条)
增量 1 · 🟢 P2 立标候选 · LongHorizon-Harness arXiv:2608.01964 + Skill-α Progressive Agent Skill arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = 8-4 早晨 4 件 net-new agent 主分类立标候选(全为 2608.* 8 月新号 · paper_cards/713/714/716/709 已建)+ LongHorizon-Harness + StateAct 同源 双胞胎立标候选风险
- 来源:
inbox/stephen/2026-08-04-llm-application-e1prep.md§增量 5 🟢 P2 邻接 · LongHorizon-Harness arXiv:2608.01964 + Progressive Agent Skill (Skill-α) arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = v45 §1.1 应用架构 + §1.3 Memory + §2.3 Skills 的"长程任务 + Skill 学习 + 训练方法论"补全inbox/spark/2026-08-04-agent-e1prep.md§增量 1 🟡 P1 邻接 · arXiv:2607.28229 EMBL AI Librarian = v39 §2.4 邻接补全 1 件 · 第六十八节点候选 = Agent 化专业科学文献库标杆案例(tom 8-4 0840 radar #2 + paper_cards/709 8-4 02:10 已建 · 主分类 agent · 欧洲分子生物学实验室 EMBL · Europe PMC 4000 万+ 文献 Agent 专用语义知识接口)inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.mdStateAct 长周期 Agent 状态管理(jay 1850 P2 核验 · 降级 2 · arXiv 原文待查)inbox/jay/2026-08-04-engineering-e1prep.md§增量 1 ⭐⭐⭐⭐⭐ 高 · arXiv:2605.20173 SDB 生产级 LLM Agent 随机-确定性边界架构方法论(jay 8-4 1050 立基础)paper_cards/709-2607-28229.md(EMBL AI Librarian · 8-4 早晨 net-new · 主分类 agent · 欧洲分子生物学实验室 EMBL · Europe PMC 4000 万+ 文献 Agent 专用语义知识接口)paper_cards/713-2608-01964.md(LongHorizon-Harness · 主分类 agent · 形态 method · 副分类 evaluation · 2026-08-04 早晨 net-new)paper_cards/714-2608-01678.md(Progressive Agent Skill Generation via Reinforcement Learning · 主分类 agent · 形态 method · 2026-08-04 早晨 net-new · Skill-α 强化学习方法)paper_cards/716-2608-01735.md(DAPD Dual-Anchored Policy Distillation · 主分类 llm-infra · 形态 method · 副分类 engineering · 2026-08-04 早晨 net-new)- URL:
https://arxiv.org/abs/2608.01964+https://arxiv.org/abs/2608.01678+https://arxiv.org/abs/2608.01735+https://arxiv.org/abs/2607.28229+https://arxiv.org/abs/2605.20173 - 要点:
- LongHorizon-Harness arXiv:2608.01964:Long-horizon LLM agents require sustained reasoning + tool use + revision across many interdependent steps;现有 agent harnesses 将任务执行 + 任务状态 + 完成评估 维持在 growing context 内,导致状态难以追踪且不正确的自评估传播到后续决策;LongHorizon-Harness 重新表述长程执行为 task-state management problem,将任务状态显式保留在执行外,仅用事实更新——与 StateAct(jay 1850 增量 2)同源思路
- Progressive Agent Skill (Skill-α) arXiv:2608.01678:现有 skill generation 方法主要依赖启发式或流水线式整合,必须为不同证据源专门设计;学习式方法通过 RL 提供统一建模方式;但学习式 skill generation 仍具挑战,因为skills 缺乏基于相关性或正确性的自然监督信号,其价值主要通过是否提升 agent 在下游任务上的行为来决定——Skill-α 提出 RL 方法解决这一挑战(与 v45 §2.3 已立 SkillRise / CAST / SkillOpt 三件套 + ACE jay 1905 增量 形成"skill 学习 RL 化"主线)
- DAPD arXiv:2608.01735 Dual-Anchored Policy Distillation:On-policy self distillation (OPSD) 越来越用于语言模型后训练;它强化了具有特权信息的 teacher,但可能引发"特权幻觉":student 学习到它无法从推理时上下文复现的特权依赖行为,但表现得好像训练时特权信息仍然可用,最终降低性能;识别 teacher-student 在推理时的信息不对称是 OPSD 失败的根本原因;DAPD 通过 Dual-Anchored 解决这一不对称——与 v45 §1.4 已立 SaLAD / Counterfactual Sensitivity / CoRT 形成"反方基线"邻接
- EMBL AI Librarian arXiv:2607.28229:欧洲分子生物学实验室 EMBL 把 Europe PMC(4000 万+ 文献)从面向人类关键词检索改造为 AI Agent 专用语义知识接口 = agent 主题首个系统化"专业垂直知识库 Agent 化"标杆案例(tom 8-4 0840 radar #2 + paper_cards/709 8-4 02:10 已建 · 主分类 agent · v38 §2.4 0 节点候选 + v39 §2.4 邻接补全 1 件候选级新增 + 与 v38 §2.4 SkillRise + CAST + MindForge + SpecFirst + MWM 形成"agent 心理 + agent 知识库"双件套)
- StateAct(arXiv 原文待查):长周期 Agent 状态管理 = subagent 化——每个子目标分配 fresh subagent,保持 context 干净,StateAct 管理跨 subagent 程序状态;与 jay 8-4 1050 SDB 架构方法论互补:SDB 解决"随机-确定性边界",StateAct 解决"跨 subagent 状态一致性";可信度 ⭐⭐⭐⭐ 需查原文(jay 1850 P2 核验)
- SDB arXiv:2605.20173:首个系统命名并形式化 LLM Agent 随机-确定性边界(SDB)的论文,提出 SDB 由 Proposer(LLM)、Verifier(确定性检查)、Commit Step(持久写)、Reject Signal(拒绝信号)四部分构成;审计了 5 个主流框架(OpenClaw、LangChain、AutoGPT、RooCode、Letta)的 SDB 实现形态,归纳出 6 种运行时架构模式;大量"模型失败"本质上是架构选择错误,非模型缺陷;新概念"架构动量"和"回放分歧"
- 关键诊断:5 件均为 8-4 早晨 net-new · paper_cards 已建但 v46 接力前需 cron 卡建脚本读 PDF 全文核验(arXiv 编号 2608.01964 / 2608.01678 / 2608.01735 / 2607.28229 均已确认);LongHorizon-Harness 与 jay 1850 增量 2 StateAct 同源思路(均把任务状态显式保留在执行外)= 是否构成独立立标还是合并立标需 v46 §1.1 明确;DAPD"特权幻觉"是否仅在 OPSD 场景出现 + DAPD 在其他训练方法中是否适用 = 需 PDF 全文核验
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.1 Harness 学术化 第十五阶段 8-3 立标(沿用 v34 §2.1 第十七轮 8-4 04:25 收官立标)→ 本场 = §2.1 续立 = LongHorizon-Harness 2608.01964 task-state management problem + StateAct 跨 subagent 程序状态管理 + SDB arXiv:2605.20173 架构方法论体系 = 长程 agent 三件套(状态管理 + 程序状态 + 架构边界)= 第十五阶段补全;
- v34 §2.3 Skills 由静态说明书演变为可训练资产(沿用 v34 §2.3 第十七轮 8-3 立标:SkillRise / CAST / SkillOpt 三件套 + ACE Generator/Reflector/Curator 三角色架构)→ 本场 = §2.3 续立 = Skill-α arXiv:2608.01678 RL 方法解决 skills 缺乏自然监督信号 = skill 学习 RL 化主线扩面 第 4 件 + ACE 三角色架构工业实证;
- v34 §2.4 范式八路线对立(沿用 v34 §2.4 第十七轮 8-3 立标:Metis / Σ-Mem / CoMem / Filesystem / Graph-Native Bitemporal / MemoryArena / Memory Decoder at Scale / Memory Provenance Laundering = 八路线对立)→ 本场 = §2.4 续立 = EMBL AI Librarian arXiv:2607.28229 第九路线候选 = Agent 化专业科学文献库 = "agent 知识库"立基础 + 与 Σ-Mem(多 Agent 信任)+ Filesystem Memory(文件系统组织)+ ConMem(工业巡检贡献度)+ Fewer Clarifications(跨会话个性化消歧)= 记忆方案四元化扩面 = 五元化扩面;
- v34 §2.7 Agentic Engineering 学科化(沿用 v34 §2.7 第十七轮 8-3 立标:Siemens AG + TUM Agentic + HF Harness + Alice Labs 7 框架 + Claude Code Subagent 5 级 + harness 选择 > 模型升级 立基础)→ 本场 = §2.7 续立 = SDB arXiv:2605.20173 随机-确定性边界架构方法论体系 + 6 种运行时架构模式 + 架构动量 + 回放分歧 = §2.7 从"框架清单"升级为"架构方法论体系"理论锚点 + 5 主流框架审计证据(OpenClaw + LangChain + AutoGPT + RooCode + Letta);
- v34 §2.94 Memory 综述 立基础栖补强(沿用 v34 §2.94 第十七轮 8-3 立标)→ 本场 = §2.94 续立 = DAPD arXiv:2608.01735 "特权幻觉" + 信息不对称修正 = Memory 系统工程实现 = 与 v45 §1.4 SaLAD / Counterfactual Sensitivity / CoRT 形成"反方基线"邻接;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "LongHorizon-Harness arXiv:2608.01964 + Skill-α arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 + StateAct(arXiv 待查)+ SDB arXiv:2605.20173 = 8-4 早晨 4 件 net-new agent 主分类立标候选 + StateAct 立标需核 + SDB 立基础 = 6 件立标候选池饱和 + LongHorizon-Harness + StateAct 同源双胞胎立标候选风险 + DAPD 特权幻觉需 PDF 核验";
- v34 §4 开放问题 95(沿用)→ 本场 = 开放问题 96 候选新增 = "LongHorizon-Harness + StateAct 同源思路合并 vs 独立立标?DAPD 特权幻觉在 OPSD 之外是否适用?SDB 6 种运行时架构模式跨主流框架覆盖度?EMBL AI Librarian Europe PMC 4000 万+ 文献 Agent 专用语义接口 vs Microsoft GraphRAG vs DeepResearch 业界标杆 vs 对位?Skill-α RL 方法解决 skills 缺乏自然监督信号 vs SkillRise + CAST + SkillOpt 启发式 + 流水线式整合 互补性?";
- v34 §5 边界(沿用):LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + StateAct + SDB 与 llm-application.md §1.1 应用架构六层 + §1.3 Memory + §2.3 Skills + agent.md §2.4 范式九路线对立候选 + §2.7 学科化 + llm-infra.md §IX 38th + multimodal.md §2.39.119 + engineering.md §2.7 六向 saturation 双向 reference。
- 建议归入节:
- §2.1 Harness 学术化 续立 = 长程 agent 三件套(LongHorizon-Harness + StateAct + SDB · task-state management problem + 跨 subagent 程序状态 + 随机-确定性边界架构方法论)
- §2.3 Skills 由静态说明书演变为可训练资产 续立 = skill 学习 RL 化主线扩面 第 4 件(Skill-α arXiv:2608.01678 RL 方法 + ACE 三角色架构工业实证)
- §2.4 范式九路线对立候选 = EMBL AI Librarian arXiv:2607.28229(Agent 化专业科学文献库 = "agent 知识库"立基础 · 五元化扩面)
- §2.7 Agentic Engineering 学科化 续立 = SDB arXiv:2605.20173 架构方法论体系(从"框架清单"升级为"架构方法论体系"理论锚点)
- §2.94 Memory 系统工程实现 续立 = DAPD arXiv:2608.01735 "特权幻觉"修正(与 SaLAD / Counterfactual Sensitivity / CoRT 形成"反方基线"邻接)
- §3.1 共识 60 → 61 候选新增(6 件立标候选池饱和 + LongHorizon-Harness + StateAct 同源双胞胎立标候选风险)
- §4 开放问题 95 → 96 候选新增(5 件立标候选 需 PDF 核验 · LongHorizon-Harness + StateAct 合并 vs 独立立标 · DAPD OPSD 之外适用性 · SDB 跨框架覆盖度 · EMBL Europe PMC Agent 化 vs 业界标杆 · Skill-α vs SkillRise/Cast/SkillOpt 互补)
- §5 边界(与 llm-application.md §1.1 / §1.3 / §2.3 + agent.md §2.4 / §2.7 + llm-infra.md §IX 38th + multimodal.md §2.39.119 + engineering.md §2.7 六向 saturation)
- arXiv 号:
- arXiv:2608.01964 LongHorizon-Harness · task-state management problem · 主分类 agent · 形态 method(paper_cards/713 已建)
- arXiv:2608.01678 Progressive Agent Skill (Skill-α) · RL 方法解决 skills 缺乏自然监督信号 · 主分类 agent · 形态 method(paper_cards/714 已建)
- arXiv:2608.01735 DAPD Dual-Anchored Policy Distillation · "特权幻觉"修正 · 主分类 llm-infra · 形态 method(paper_cards/716 已建)
- arXiv:2607.28229 EMBL AI Librarian · Agent 化专业科学文献库 · 主分类 agent(paper_cards/709 已建)
- arXiv:2605.20173 SDB · 随机-确定性边界架构方法论体系 · 主分类 engineering(jay 8-4 1050 立基础 · 8-4 morning paper_card 沿用)
增量 2 · 🟢 P3 邻接 · StateAct 长周期 Agent 状态管理 = subagent 化 + 程序状态干净 + context 防污染(jay 1850 P2 核验 · arXiv 原文待查 · 与 LongHorizon-Harness 同源思路 = 双胞胎立标候选风险)
- 来源:
inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md§降级 2 StateAct 框架(arXiv 需查原文)· subagent 化 = 每个子目标分配 fresh subagent · 保持 context 干净 · StateAct 管理跨 subagent 程序状态 · 与 T1050 首轮 SDB 架构方法论互补:SDB 解决"随机-确定性边界",StateAct 解决"跨 subagent 状态一致性"inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md标签:AgentStateActComputer-Use上下文管理SubagentSDB补充inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md高价值条目:3 | StateAct 长周期 Agent 状态管理 | X雷达/@_akhaliq | subagent化+程序状态干净+context防污染 | ⭐⭐⭐⭐ 需查原文inbox/stephen/2026-08-04-llm-application-e1prep.md§增量 1(2026-08-04 ACE Agentic Context Engineering 三角色架构 + StateAct + Loop Engineering 续立)- 要点:
- 核心问题:长周期 Agent 任务中,程序状态(变量 / 临时文件 / 进程状态)与 context 内容(消息历史 / 工具结果)混在一起,导致 context 污染、状态难以追踪、错误的自评估传播到后续决策(与 LongHorizon-Harness 同源问题)
- 核心方案:subagent 化 = 每个子目标分配 fresh subagent,保持 context 干净;StateAct 管理跨 subagent 程序状态 = 把程序状态(变量 / 临时文件 / 进程状态)从 context 中剥离,以"程序状态 + 程序调用"的方式管理跨 subagent 一致性
- 关键诊断:与 jay 8-4 1050 SDB 架构方法论互补:SDB 解决"随机-确定性边界",StateAct 解决"跨 subagent 状态一致性";与 LongHorizon-Harness arXiv:2608.01964 同源思路(均把任务状态显式保留在执行外)= 是否构成独立立标还是合并立标需 v46 §1.1 明确 = 双胞胎立标候选风险
- 可信度:⭐⭐⭐⭐ 需查原文(jay 1850 P2 核验 · 标签"Agent / StateAct / Computer-Use / 上下文管理 / Subagent / SDB 补充")
- 来源:X雷达 / @_akhaliq(袁立 · AgaKhalilq · arXiv 推特机器人 · 推 arXiv:2608.01964 同期关联)→ arXiv 原文待查
- 关键数字:⭐⭐⭐⭐ 需查原文 = 立标信号中-高 vs 需补 arXiv 编号
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.1 Harness 学术化 续立(沿用 v34 §2.1 第十七轮 8-4 04:25 收官立标)→ 本场 = §2.1 续立 = StateAct 长周期 Agent 状态管理 = subagent 化 + 程序状态管理 = 长程 agent 三件套第 2 件(与 LongHorizon-Harness + SDB 并列);
- v34 §2.7 Agentic Engineering 学科化 续立(沿用 v34 §2.7 第十七轮 8-3 立标)→ 本场 = §2.7 续立 = StateAct 与 SDB 互补 = SDB 随机-确定性边界 + StateAct 跨 subagent 状态一致性 = §2.7 学科化 双补;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "StateAct 长周期 Agent 状态管理 = subagent 化 + 程序状态干净 + context 防污染(jay 1850 P2 核验 · arXiv 原文待查 · 与 LongHorizon-Harness arXiv:2608.01964 同源思路 = 双胞胎立标候选风险)";
- v34 §4 开放问题 95(沿用)→ 本场 = 开放问题 96 候选新增 = "StateAct arXiv 原文待查 + 与 LongHorizon-Harness 同源思路合并 vs 独立立标?StateAct 跨 subagent 程序状态管理 vs LongHorizon-Harness task-state management problem 边界?StateAct SDB 互补架构方法论体系第 3 件?";
- v34 §5 边界(沿用):StateAct 与 llm-application.md §1.1 应用架构六层 + agent.md §2.1 Harness 学术化 + §2.7 学科化 + multimodal.md §2.94 + engineering.md §2.7 五向 saturation 双向 reference。
- 建议归入节:
- §2.1 Harness 学术化 续立 = 长程 agent 三件套 第 2 件(StateAct · subagent 化 + 程序状态管理)
- §2.7 Agentic Engineering 学科化 续立 = SDB + StateAct 互补(随机-确定性边界 + 跨 subagent 状态一致性)
- §3.1 共识 60 → 61 候选新增(StateAct 长周期 Agent 状态管理 · arXiv 原文待查)
- §4 开放问题 95 → 96 候选新增(arXiv 原文待查 + LongHorizon-Harness 同源 双胞胎立标候选风险 + 与 SDB 互补架构方法论体系第 3 件)
- §5 边界(与 llm-application.md + agent.md + multimodal.md + engineering.md 五向 saturation)
- arXiv 号:arXiv 待查(X 雷达 / @_akhaliq 推文 · 8-4 evening 棒 jay 1850 P2 核验)
增量 3 · 🟢 P3 邻接 · LongDS-Bench arXiv:2605.30434 长程数据分析 Agent 状态管理失败 = 长程 agent 失败机制分类学 第三块拼图(flyP 8-4 2250 critical-read · 与 07-08 HORIZON + Long-Horizon Terminal-Bench + Reliability Science / HORIZON / DeepPlanning 拼图第三块 · SOTA frontier 模型最高均值 48.45% · 47 pp 早→晚塌陷)
- 来源:
inbox/flyp/2026-08-04-2250-LongDS-Bench-long-horizon-data-analysis-critical-read.md(10.9 KB · flyP 8-4 2250 critical-read · B+ · 长程数据分析域 47 pp 早→晚塌陷 + 5 类 state-evolution patterns + 与 07-08 HORIZON + Long-Horizon Terminal-Bench + Reliability Science / HORIZON / DeepPlanning 拼图第三块)inbox/flyp/2026-08-04-2250-LongDS-Bench-long-horizon-data-analysis-critical-read.mdURL:https://arxiv.org/abs/2605.30434v1(cs.LG / cs.CL / cs.MA, 2026-05-28 v1, 16.5 MB)inbox/spark/2026-08-04-llm-infra-e1prep.md§9 §IX 38th 备料(LongDS-Bench 邻接)inbox/flyp/2026-08-04-risk-e1prep.md§2 邻接(LongDS-Bench 反事实扰动可喂给 arXiv:2607.24368 Keep It InMind 类 memory-attack-surface 工作,做"memory poison via long-horizon counterfactual"风险评估)- 要点:
- 核心问题:LongDS 把"长时序 agent 评测"从泛 terminal / GUI 推到数据分析工作流这一具体垂直域,核心论点:现实数据分析是天然多轮迭代的,而现有 benchmark(DSBench / MLAgentBench / DA-Code 等)大多是"单轮 / 短对话 / 单目标 Kagglish",测的是"会不会跑",测不出"跑过程中能不能维护住不断演化的分析状态"
- 核心方案:5 类 state-evolution patterns(基于真实 Kaggle notebook 反构):
- counterfactual perturbation — 引入反事实扰动,测 agent 能否识别先前结论被推翻
- rollback — 主动让 agent 回退到某个 checkpoint,测记忆是否被正确裁剪 / 重载
- multi-state composition — 多分支状态并行,测跨分支 context 维护
- (其余两类待 PDF 核,通常包括 progressive refinement + cross-turn dependency)
- 关键数字:
- 任务数:68 / 总轮次:2,225 turns / 平均依赖跨度:11.3 turns(一个 turn 的错误平均会回溯 / 影响 ~11 步)
- 评测模型:GPT-5.4, Gemini-3.1-Pro, Claude-4.6-Sonnet, DeepSeek-V4-Pro, Kimi-K2.6
- 推理-动作步上限:40 / turn(显著高于 DSBench ~10 步和 MLAgentBench ~20 步)
- SOTA 最高均值准确率:48.45% / 早→晚 turn 准确率跌幅:~47 pp / 长时序错误占失败比例:52%–69%
- 关键 takeaway:在(data analysis)这一封闭域,SOTA frontier 模型的"平均 pass"都过不了 50% 的及格线;47 pp 的早→晚塌陷和 52–69% 的长时序失败占比,是对"AI 数据分析师"叙事的硬否定
- 关键诊断:与 07-08 HORIZON arXiv:2604.11978 + Long-Horizon Terminal-Bench(Tencent HY, 7 月)+ Reliability Science / HORIZON / DeepPlanning 形成"long-horizon agent 失败机制分类学"第三块拼图;视角从"benchmark 碎片化诊断"转向"特定高价值垂直域(data analysis)的状态演化模式"
- 关键矛盾 / 待核:
- 没区分 agent scaffold:同 6 个模型是否用统一 scaffold?ReAct vs memory-augmented vs AoT vs Planner-Executor — 论文没说清,而 Princeton Reliability Science 明确把 scaffold 作为变量
- 与 HORIZON 3100 trajectories 重复:HORIZON 已经做了"long-horizon 失败模式分类",LongDS 的 5 类 state-evolution pattern 与 HORIZON 的 cascading / false-transition / missed-transition 是否有 1:1 映射,论文没对比
- 没有公开统一的 partial-credit scoring,这是与 Long-Horizon Terminal-Bench(LHTB)形成对照的关键差异 — LHTB 推 hidden verifier + continuous partial credit,LongDS 还是 binary turn-level
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §3.3 反方 #87 Beyond pass@1 Reliability Science Framework · VAF 双峰 + MOP 悖论 + memory scaffold 普遍不提升甚至有害(沿用 v34 §3.3 第十七轮 8-3 立标:flyP 8-3 1550 critical-read · 23,392 episodes 实证)→ 本场 = §3.3 反方 #88 候选新增 = "LongDS-Bench arXiv:2605.30434 长程数据分析域 47 pp 早→晚塌陷 + 5 类 state-evolution patterns + SOTA frontier 48.45% + 长程失败占 52-69% + 与 07-08 HORIZON + LHTB + Reliability Science / HORIZON / DeepPlanning 拼图第三块 · 闭合实证 vs memory 方案六联骨架(Mem0 / RecMem / Filesystem-Based / Σ-Mem / Memory Decoder at Scale / Metis)= 可靠性反方 + 长程反方 + 数据分析域反方 三栖补强";
- v34 §2.1 Harness 学术化 续立(沿用 v34 §2.1 第十七轮 8-4 04:25 收官立标)→ 本场 = §2.1 续立 = LongDS-Bench 邻接长程 agent 三件套(LongHorizon-Harness + StateAct + SDB)= 数据分析域长程状态管理失败实证第 1 件;
- v34 §4 开放问题 95(沿用)→ 本场 = 开放问题 96 候选新增 = "LongDS-Bench arXiv:2605.30434 47 pp 早→晚塌陷 vs Princeton Reliability Science VAF / MOP / GDS / RDC 是否套得上?LongDS 5 类 state-evolution pattern vs HORIZON cascading / false-transition / missed-transition 是否 1:1 映射?LongDS binary turn-level vs LHTB continuous partial credit 推荐知识库采用双指标?LongDS 6 个模型是否用统一 scaffold?反事实扰动作为 attack vector 喂给 arXiv:2607.24368 Keep It InMind?";
- v34 §5 边界(沿用):LongDS-Bench 与 risk.md §X counterfactual perturbation as attack vector + agent.md §3.3 反方 #87 Beyond pass@1 + llm-application.md §X reliability + engineering.md §2.13 推理引擎可复现性危机 + multimodal.md §2.39 综述立基础五向 saturation 双向 reference。
- 建议归入节:
- §3.3 反方 #88 候选新增(LongDS-Bench · 长程数据分析域 47 pp 早→晚塌陷 · 拼图第三块 · 三栖补强)
- §2.1 Harness 学术化 续立 = 长程 agent 三件套 邻接 = 数据分析域长程状态管理失败实证第 1 件(LongDS-Bench · 5 类 state-evolution patterns)
- §4 开放问题 95 → 96 候选新增(LongDS-Bench 套 Princeton Reliability Science · LongDS vs HORIZON 1:1 映射 · LongDS vs LHTB 双指标 · 反事实扰动 as attack vector)
- §5 边界(与 risk.md + agent.md + llm-application.md + engineering.md + multimodal.md 五向 saturation)
- arXiv 号:arXiv:2605.30434v1(LongDS-Bench · cs.LG / cs.CL / cs.MA · 2026-05-28 v1 · 16.5 MB · zjunlp 浙大 KG/NLP 实验室 · GitHub
zjunlp/DataMind承诺开源待核)
增量 4 · 🟢 P2 工业实证 · Memory Decoder at Scale arXiv:2607.27919 8-4 票榜 #4 51▲(跨日 +2)第七路线立标饱和工业实证 + HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" = 飞轮机制从"完全饱和" 微反弹为"轮换态"
- 来源:
inbox/tom/2026-08-04-0900-hf-daily-2026-08-04.md(HF Daily 8-4 票榜 15 件 · 4 件 net-new + 1 件下榜 + 10 件续立)inbox/spark/2026-08-04-agent-e1prep.md§增量 5 🟡 P1 机制反弹 · HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" = 飞轮机制从 v38 §2.7 "完全饱和" 微反弹为 v39 §2.7 "轮换态"(net-new = RLSVR 2607.23802 + MWM 2607.27201 + AISPA 2607.28617 + RefCaptioner 2607.28509 · 下榜 = DistillAlign 2607.26811 · 续立 = Qwen-UI-Agent 294▲ + Memory Decoder at Scale 51▲ + N_0-VTLA 50▲ + Beacon 48▲ + Meshy T2 41▲ + MPIE-Bench 37▲ + Beyond Borrowed Histories 32▲ + N_0-TWAM 28▲ + QQWorld 24▲ + SAF-OPD 23▲)inbox/stephen/2026-08-04-llm-application-e1prep.md§v46 §1.3 Memory Decoder at Scale 第七路参数化立标:本场 = §1.3 补全"Memory Decoder at Scale 2607.27919 在 8-4 票榜 #4 51▲(跨日 +2)"作为第七路立标饱和的工业实证inbox/stephen/2026-08-04-ai-industry-e1prep.md§增量 2(stephen 8-4 1020 增量 2 · HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" 微反弹)- 要点(8-4 vs 8-3 跨日票数变化):
-
1 Qwen-UI-Agent arXiv:2607.28227 — 294▲(8-3 284▲ · 跨日 +10)
-
2 From RLVR to RLSVR arXiv:2607.23802 — 73▲(新 · HF Daily 8-4 net-new)
-
3 Mental World Modeling arXiv:2607.27201 — 53▲(8-3 18▲ · 跨日 +35 · 立标信号 2.94× 增强)
-
4 Memory Decoder at Scale arXiv:2607.27919 — 51▲(8-3 49▲ · 跨日 +2)
-
5 N_0-VTLA arXiv:2607.23782 — 50▲(8-3 跨日持续)
-
6 Beacon arXiv:2607.28595 — 48▲(8-3 48▲ · 跨日 0)
-
7 Meshy T2 arXiv:2607.28675 — 41▲(8-3 持续)
-
8 MPIE-Bench arXiv:2607.27616 — 37▲(8-3 持续)
-
9 Beyond Borrowed Histories arXiv:2607.27816 — 32▲(8-3 持续)
-
10 AISPA arXiv:2607.28617 — 31▲(新 · HF Daily 8-4 net-new)
-
11 N_0-TWAM arXiv:2607.23783 — 28▲(持续)
-
12 RefCaptioner arXiv:2607.28509 — 26▲(新 · HF Daily 8-4 net-new)
-
13 视觉生成中文本条件的缩放特性 arXiv:2607.29679 — 24▲(持续)
-
14 QQWorld arXiv:2607.28415 — 24▲(持续)
-
15 SAF-OPD arXiv:2607.29209 — 23▲(持续)
- 下榜:DistillAlign arXiv:2607.26811(8-3 89▲ → 8-4 off)
- 关键对比:MWM 8-3 #15 18▲ → 8-4 #3 53▲ 立标信号 2.94× 增强(spark 8-4 v39 升档);Qwen-UI-Agent 跨日 +10(8-3 284▲ → 8-4 294▲);Memory Decoder at Scale 跨日 +2(8-3 49▲ → 8-4 51▲)第七路线立标饱和工业实证;4 件 net-new = RLSVR + MWM + AISPA + RefCaptioner;1 件下榜 = DistillAlign
- 关键信号:飞轮机制从 8-2 跨日翻倍级(衰减为 8-3 跨日稳态续立)→ 8-4 微反弹为"轮换态"(4 件 net-new + 1 件下榜 + 10 件续立)→ 候选池饱和度从 100% 微回调至 93.3% 轮换
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.143 HF Daily 8-3 票榜 15 件 全核 vs 8-2 跨日 +1 ~ +7 稳态续立(沿用 v34 §2.143 第十七轮 8-3 立标)→ 本场 = §2.143 HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" = 飞轮机制从"完全饱和" 微反弹为"轮换态" = v38 §2.143 → v39 §2.143 修订;
- v34 §2.4 范式八路线对立 第七路线 Memory Decoder at Scale arXiv:2607.27919(沿用 v34 §2.4 第十七轮 8-3 立标)→ 本场 = §2.4 续立 = Memory Decoder at Scale 49▲ → 51▲ 跨日 +2 稳态续立 + 工业实证 = 第七路线立标饱和;
- v34 §1 第二十一阈值 编码 Agent memory 三栖范式分水岭(沿用)→ 本场 = §1 续立 = Memory Decoder at Scale 51▲ 跨日 +2 = 飞轮"轮换态"微反弹 = v37 → v38 → v39 三态转换(完全饱和 → 稳态续立 → 轮换态);
- v34 §1.32c 横切 52c 心理化世界模型(沿用 v34 §1.32c 第十七轮 8-3 立标:MWM 候补级低档)→ 本场 = §1.32c 续立 = MWM arXiv:2607.27201 8-4 #3 53▲ vs 8-3 #15 18▲ 立标信号 2.94× 增强 = v39 升档 中档;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "HF Daily 8-4 票榜 15 件 4 件 net-new + 1 件下榜 + 10 件续立 = 飞轮机制从'完全饱和' 微反弹为'轮换态' 第 2 例 + Memory Decoder at Scale 51▲ 第七路线立标饱和工业实证 + MWM 53▲ 立标信号 2.94× 增强 v39 升档 中档 + 候选池 14 件饱和度 93.3% 轮换态";
- v34 §4 开放问题 95(沿用)→ 本场 = 开放问题 96 候选新增 = "飞轮'轮换态'微反弹是 8-2 跨日翻倍级 / 8-3 跨日稳态续立 / 8-4 跨日轮换态 三态转换的周期性现象?MWM 立标信号 2.94× 增强是否可持续?AISPA + RefCaptioner 是否能在 8-5 ~ 8-9 1 周窗口维持票数?DistillAlign 下榜是否临时还是永久?";
- v34 §5 边界(沿用):HF Daily 8-4 票榜飞轮"轮换态" 与 multimodal.md §2.143 + risk.md §2.143 + agent.md §2.143 + llm-application.md §2.143 + llm-infra.md §IX 38th §2.143 五向 saturation 双向 reference。
- 建议归入节:
- §2.143 HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" 修订候选(飞轮机制从"完全饱和" 微反弹为"轮换态" · v38 → v39 三态转换)
- §2.4 续立 = Memory Decoder at Scale 第七路线立标饱和 工业实证(51▲ 跨日 +2)
- §1.32c 续立 = MWM 立标信号 2.94× 增强 v39 升档 中档(53▲ vs 18▲)
- §3.1 共识 60 → 61 候选新增(飞轮"轮换态" 第 2 例 + 第七路线立标饱和 + MWM 升档 + 候选池 14 件 93.3% 轮换)
- §4 开放问题 95 → 96 候选新增(飞轮三态转换周期性 · MWM 立标信号可持续 · AISPA / RefCaptioner 1 周窗口 · DistillAlign 临时 vs 永久)
- §5 边界(与 multimodal.md + risk.md + agent.md + llm-application.md + llm-infra.md §IX 38th §2.143 五向 saturation)
- arXiv 号:15 件 8-4 票榜(详见 arXiv:2607.28227 / 2607.23802 / 2607.27201 / 2607.27919 / 2607.23782 / 2607.28595 / 2607.28675 / 2607.27616 / 2607.27816 / 2607.28617 / 2607.23783 / 2607.28509 / 2607.29679 / 2607.28415 / 2607.29209)+ 下榜 arXiv:2607.26811 DistillAlign
增量 5 · 🟡 P3 邻接 · Constitutional Midtraining arXiv:2607.26654 120B 规模持久对齐中训练 = 反方 #88 候补级新增(flyp 8-4 risk + tom 8-4 0840 radar + spark 8-4 agent-e1prep · vs R37 §3.1 反方 #54 Silent Failures 沿用方向相反实证 + L1 模型层 二十四窗口新维度)
- 来源:
inbox/flyp/2026-08-04-risk-e1prep.md§增量 1 🟡 Constitutional Midtraining arXiv:2607.26654 P2 候补级 = 120B 规模持久对齐中训练 第 5 维 反方 + R36 矛盾 #56/#57 候选深化 反方 候补级inbox/spark/2026-08-04-agent-e1prep.md§line 415 主分类 risk 8-4 早晨 net-new 立表 + line 571 「Constitutional Midtraining 内容存在驱动对齐收益(主 risk · 8-4 早晨 net-new · 120B 规模对齐)」inbox/tom/2026-08-04T0840-agent-rag-longcontext-radar.md候选 5「Constitutional Midtraining: Content Presence Drives Alignment Gains / HF/arXiv 2607.26654 / benchmark / 120B 规模对齐实验,对理解 RLHF/midtraining 有参考价值」inbox/tom/2026-08-04_rag-lite.md§摘要「midtraining 阶段引入价值观内容,与 replay-only 对照,在 120B 规模下验证了 Alignment 在微调压力下的持久性」paper_cards/711-2607-26654.md(8-4 早晨 net-new · method / agent / 主分类 risk · 副分类 engineering)- URL:
https://arxiv.org/abs/2607.26654 - 要点:
- 核心问题:Post-training alignment is often shallow, eroding under fine-tuning = 训练后对齐往往是浅薄的,会在微调中被侵蚀 —— 这是 R37 §3.1 反方 #54 (arXiv:2606.14589 Silent Failures) 的对立实证(那边说 Class D ex post 阻止 87%,这边说浅层 alignment 会被侵蚀)= 方向相反但都指向"alignment 持久性"为当代 AI Safety 核心问题
- 核心方案:Constitutional Midtraining = 在中训练(midtraining)阶段插入基于原则与价值观的内容,与"仅做回放的对照组"对比
- 实验规模:120B(120 亿) 模型规模 + 394M token 宪法语料 + 2×2 析因设计(课程顺序 × 审慎推理)= 4 种宪法式中训练条件 + 1 回放对照,在自生成 + 既有基准上评估
- 关键发现:内容存在(content presence)驱动对齐收益 = 中训练阶段引入价值观内容(而非仅靠 post-training RLHF / DPO)能产生持久对齐
- 语料源:Anthropic's Constitution(Anthropic 公开发布的 Constitutional AI 价值观文本)— 但作者群是否包含 Anthropic 内部研究员、是否经 Anthropic 资助,paper_card 未披露
- arXiv:2607.26654 / 形态 method / 主分类 risk / 副分类 engineering
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.5 Agent 安全五联立标层(沿用 v34 §2.5 第十七轮 8-3 立标:Memory Provenance Laundering 第六联)→ 本场 = §2.5 续立 = Constitutional Midtraining 120B 规模持久对齐中训练 第 5 维 = 沿用 Anthropic Constitution 实证化 第 1 例 + 中训练阶段双向实证 = L1 模型层 第二十四窗口 = 二十三窗口 → 二十四窗口;
- v34 §3.3 反方 #87 Beyond pass@1 Reliability Science Framework · VAF 双峰 + MOP 悖论 + memory scaffold 普遍不提升甚至有害(沿用 v34 §3.3 第十七轮 8-3 立标:flyP 8-3 1550 critical-read · 23,392 episodes 实证)→ 本场 = §3.3 反方 #88 候选新增 = "Constitutional Midtraining arXiv:2607.26654 120B 规模持久对齐中训练 · Post-training alignment shallow, eroding under fine-tuning · 4 条件 + 1 对照 + 394M token 宪法语料 + 2×2 析因 + 内容存在驱动对齐收益 · 反方 #54 对立实证:alignment 持久性新维度,midtraining 干预有效";
- v34 §1 第二十一阈值 编码 Agent memory 三栖范式分水岭(沿用)→ 本场 = §1 续立 = Constitutional Midtraining 邻接 L1 模型层 第二十四窗口 = "对齐持久性" 新维度 vs memory 方案六联骨架(Mem0 / RecMem / Filesystem-Based / Σ-Mem / Memory Decoder at Scale / Metis)= 持久性双向对位;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "Constitutional Midtraining arXiv:2607.26654 120B 规模持久对齐中训练 = 反方 #88 候补级新增 + 与 R37 §3.1 反方 #54 Silent Failures 沿用方向相反实证 + L1 模型层 二十四窗口新维度 + 沿用 Anthropic Constitution 实证化 第 1 例 + 5 实例交叉确认(flyp risk + tom radar + spark agent + paper_cards/711 已建 + flyp multimodal 邻接)";
- v34 §4 开放问题 95(沿用)→ 本场 = 开放问题 96 候选新增 = "Constitutional Midtraining 120B 规模持久对齐中训练 vs 反方 #54 Silent Failures 方向相反实证 是否双向收敛?Anthropic 参与度核实?跨规模复现 > 70B 独立观察?midtraining 干预 vs post-training RLHF / DPO 持久性差异?内容存在驱动对齐收益 vs Constitutional AI 路径方向?";
- v34 §5 边界(沿用):Constitutional Midtraining 与 risk.md §3.1 反方 #54 + agent.md §2.5 安全六联立标层 + multimodal.md §2.39 综述立基础 + llm-application.md §1.5 治理信号叠加 + llm-infra.md §IX 38th §X 五向 saturation 双向 reference。
- 建议归入节:
- §2.5 Agent 安全五联立标层 → 六联立标层 续立 = Constitutional Midtraining 第七联(120B 规模持久对齐中训练 · L1 模型层 二十四窗口新维度)
- §3.3 反方 #88 候选新增(Constitutional Midtraining · 反方 #54 对立实证 · alignment 持久性新维度)
- §1 续立 = Constitutional Midtraining 邻接 L1 模型层 二十四窗口(与 memory 方案六联骨架 持久性双向对位)
- §3.1 共识 60 → 61 候选新增(Constitutional Midtraining 120B 规模 + 5 实例交叉确认 + 反方 #88 候补级)
- §4 开放问题 95 → 96 候选新增(双向收敛 · Anthropic 参与度 · 跨规模复现 · midtraining vs post-training RLHF · Constitutional AI 路径方向)
- §5 边界(与 risk.md + agent.md + multimodal.md + llm-application.md + llm-infra.md §IX 38th 五向 saturation)
- arXiv 号:arXiv:2607.26654(Constitutional Midtraining · paper_cards/711 已建 · 120B 规模 + 394M token 宪法语料 + 2×2 析因 + 4 条件 + 1 对照 + 主分类 risk)
增量 6 · 🟢 P3 邻接 · MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 = multimodal safety 综述基线(jay 8-4 tech-newsletter · 与 R37 §2.39 反方 #84-#86 SaLAD 实证基线双向对位)
- 来源:
inbox/jay/2026-08-04-tech-newsletter.md§4 「Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey arXiv:2603.27918 → TMLR 2026(37 页综述) · 全面梳理 MLLM 对抗攻击技术,包括视觉对抗样本、跨模态迁移攻击、RLHF 对齐绕过的最新研究 · 可信度 ⭐⭐⭐⭐⭐ TMLR 2026,综述质量高 ★ 审稿 — 安全研究基础材料」inbox/flyp/2026-08-04-risk-e1prep.md§增量 2 🟢 MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 = multimodal safety 综述基线 沿用 R36 §2.39 multimodal safety 反方 #84-#86 邻接- URL:
https://arxiv.org/abs/2603.27918 - 要点:
- 论文形态:综述型(TMLR 2026 接收 · 37 页)
- 核心覆盖面:① 视觉对抗样本(visual adversarial examples)② 跨模态迁移攻击(cross-modal transfer attacks)③ RLHF 对齐绕过(RLHF alignment bypass) = 与 R36 §3.1 反方 #84 alignment 在日常多模态失效(沿用 SaLAD)、#85 safety warning vs 粗暴拒答(沿用 SaLAD)、#86 多模态生成安全未对标(沿用 SaLAD)形成 综述基线 + 实证反方 双向对位
- TMLR 2026 接收:作为综述类顶会接收,立标信号强,可作为 R36 §2.39 multimodal safety 综述基线
- 与 SaLAD 关系:SaLAD(arXiv:2601.04043 v2 ACL 2026 Findings)是新基准评测,MLLM Adversarial Survey 是综述基线 —— 二者构成"实证 + 综述"双向对位
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.5 Agent 安全五联立标层 → 六联立标层(沿用 v34 §2.5 第十七轮 8-3 立标)→ 本场 = §2.5 续立 = MLLM Adversarial Survey 综述基线 索引补全(与 SaLAD 实证基线 双向对位);
- v34 §3.3 反方 #87 Beyond pass@1 Reliability Science Framework(沿用 v34 §3.3 第十七轮 8-3 立标)→ 本场 = §3.3 反方候选新增 邻接 = MLLM Adversarial Survey · RLHF 对齐绕过 与 SaLAD alignment 在日常多模态失效 实证+综述 双向对位;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 = multimodal safety 综述基线 沿用 R37 §2.39 multimodal safety 反方 #84-#86 邻接 + 与 SaLAD 实证基线 双向对位";
- v34 §5 边界(沿用):MLLM Adversarial Survey 与 multimodal.md §2.39.x + risk.md §2.39 + agent.md §2.5 安全六联立标层 + llm-application.md §1.5 + llm-infra.md §IX 38th §X 五向 saturation 双向 reference。
- 建议归入节:
- §2.5 Agent 安全六联立标层 续立 = MLLM Adversarial Survey 综述基线 索引补全(TMLR 2026 37 页综述)
- §3.3 反方候选新增 邻接 = MLLM Adversarial Survey · RLHF 对齐绕过(与 SaLAD alignment 在日常多模态失效 实证+综述 双向对位)
- §3.1 共识 60 → 61 候选新增(MLLM Adversarial Survey 综述基线 · TMLR 2026)
- §5 边界(与 multimodal.md + risk.md + agent.md + llm-application.md + llm-infra.md §IX 38th 五向 saturation)
- arXiv 号:arXiv:2603.27918(MLLM Adversarial Survey · TMLR 2026 · 37 页综述 · 立标信号强 综述基线)
增量 7 · 🟢 P3 工业实证 · ICML 2026 workshop "agentic AI" 60/247 + Amazon CloudWatch Coding Agent Insights 产品发布 + context rot 从学术问题变成工程计费项 = Skills 工业实证(jay 1905 + tech-newsletter)
- 来源:
inbox/jay/2026-08-04T1905-jay-five-category-briefing.md§1 ICML 2026 workshop 中"agentic AI"出现在 60/247 篇 workshop 论文中(远超往年)· Amazon CloudWatch Coding Agent Insights 产品发布 → "context rot 从学术问题变成工程计费项"inbox/jay/2026-08-04-tech-newsletter.md标签行ICML 2026 agentic AI | ⭐⭐⭐⭐⭐ workshop / Amazon CloudWatch Coding Agent Insights / context rot 工程计费inbox/stephen/2026-08-04-llm-application-e1prep.md§v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"ACE Agentic Context Engineering 三角色架构 + Amazon CloudWatch Coding Agent Insights 产品发布"作为 Skills 演化的工业实证- 要点:
- ICML 2026 workshop "agentic AI" 60/247 篇 workshop 论文(远超往年)→ agent 主题在学术会议占主导,Skills / context rot / 长程任务状态管理 成为学术界 + 工业界共识话题
- Amazon CloudWatch Coding Agent Insights 产品发布:Amazon 把"coding agent context rot"做成了 CloudWatch 产品 → "context rot 从学术问题变成工程计费项" = 学术研究 → 工程产品 → 计费项 = 完整的"学术→工程→计费"转化闭环
- Skills 工业实证:v45 §2.3 已立 SkillRise / CAST / SkillOpt + ACE 三角色架构 + Skill-α RL 方法 → 本场 = §2.3 续立 = Amazon CloudWatch Coding Agent Insights 产品发布作为 Skills 工业实证 第 1 件
- Multi-agent vs Single agent 100% vs 1.7% 数量级差距(jay 1905):复杂任务应拆解为 narrow-role 多 agent 协作,而非单一全能 agent = 与 v45 §3.2 争议 #4 Σ-Mem / Spark-to-Fire cascade paper 行业共识一致(⚠️ 100% vs 1.7% 是 YouTube 二手引用 Enterprise AI Ecosystem Explained 2026 —— 原始论文需进一步核验,但数量级差距与 v45 §3.2 争议 #4 行业共识一致)
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.3 Skills 由静态说明书演变为可训练资产(沿用 v34 §2.3 第十七轮 8-3 立标:SkillRise / CAST / SkillOpt + ACE 三角色架构)→ 本场 = §2.3 续立 = Amazon CloudWatch Coding Agent Insights 产品发布作为 Skills 工业实证 第 1 件 + ICML 2026 workshop 60/247 + context rot 从学术问题变成工程计费项 = 学术→工程→计费 完整转化闭环;
- v34 §2.7 Agentic Engineering 学科化(沿用 v34 §2.7 第十七轮 8-3 立标)→ 本场 = §2.7 续立 = ICML 2026 workshop "agentic AI" 60/247 + Amazon CloudWatch Coding Agent Insights = 学术 + 工业 双栖工业实证;
- v34 §3.2 争议 #4 多 agent 是否真的优于单 agent(沿用 v34 §3.2 第十七轮 8-3 立标)→ 本场 = §3.2 争议 #4 续立 = Multi-agent 100% vs Single agent 1.7% 数量级差距 + ⚠️ YouTube 二手引用 原始论文需核验 但与行业共识一致;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "ICML 2026 workshop 'agentic AI' 60/247 + Amazon CloudWatch Coding Agent Insights 产品发布 + context rot 从学术问题变成工程计费项 = Skills 工业实证 第 1 件 + 学术→工程→计费 完整转化闭环";
- v34 §5 边界(沿用):Skills 工业实证 与 llm-application.md §1.1 应用架构六层 + §2.3 Skills + agent.md §2.7 学科化 + multimodal.md §2.39.x + llm-infra.md §IX 38th 五向 saturation 双向 reference。
- 建议归入节:
- §2.3 Skills 续立 = Amazon CloudWatch Coding Agent Insights 产品发布作为 Skills 工业实证 第 1 件(context rot 从学术问题变成工程计费项)
- §2.7 学科化 续立 = ICML 2026 workshop "agentic AI" 60/247 + Amazon CloudWatch(学术 + 工业 双栖工业实证)
- §3.2 争议 #4 续立 = Multi-agent 100% vs Single agent 1.7% 数量级差距(⚠️ YouTube 二手引用 原始论文需核验)
- §3.1 共识 60 → 61 候选新增(Skills 工业实证 第 1 件 + 学术→工程→计费 完整转化闭环)
- §5 边界(与 llm-application.md + agent.md + multimodal.md + llm-infra.md §IX 38th 五向 saturation)
- arXiv 号:无新 arXiv(工业实证 + 顶会 workshop + 产品发布)
增量 8 · 🟢 P3 邻接 · KV Cache 优化第 6 件集群爆发(jay 8-4 evening briefing + 1850 工程筛选 Round 2 = TopKV + C²KV + HiKV + 反事实惊喜 KV + TokTier + ResKV 6 件)
- 来源:
inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md§2-§7 KV Cache 4 件:TopKV arXiv:2607.28633 / C²KV arXiv:2607.17715 / Beyond Prefill-Decode arXiv:2607.25498 / HiKV arXiv:2607.22389 / DualDecoder arXiv:2607.26475 / KV Cache 反事实惊喜 arXiv:2607.27600inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md§增量 2-3 TokTier 有状态 tokenization + ResKV 固定预算 KV 压缩(jay 1850 P2 核验 arXiv 原文)inbox/stephen/2026-08-04-llm-application-e1prep.md§v46 §3 KV Cache 优化第 6 件集群爆发(TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = jay 8-4 evening briefing 17:36 KV Cache 4 件 + jay 8-4 1850 工程筛选 Round 2 TokTier + ResKV 共 6 件 net-new)- 要点(6 件 KV Cache 优化):
- TopKV arXiv:2607.28633:拓扑感知的 KV Cache 传输调度器 — 当前 DistServe / Splitwise / Mooncake 均使用统一 RDMA,忽略了 GPU 间带宽差异高达 72×(NVLink 域内 900 GB/s · InfiniBand 跨节点 50 GB/s · TCP 跨数据中心 12.5 GB/s);TopKV 在启动时通过
nvidia-smi topology matrix/lspci/ RDMA 探测 / Kubernetes 标签发现 GPU 互联图,动态选择最优传输协议 — 对运行 disaggregated prefill / decode 的团队(尤其是 GB200 NVL72 集群)是直接可用的调度改进 - C²KV arXiv:2607.17715:Non-Prefix KV Cache 压缩复用 — 突破 prefix matching 的 KV Cache 复用,针对 RAG / 工具调用场景;提出 Non-Prefix Caching 范式,在 KV Cache 层面做语义级复用而非位置对齐
- HiKV arXiv:2607.22389:分层重要性感知的 KV Cache 管理 — 能量高效的 LLM 解码,在 iso-accuracy 约束下比 SOTA 降低 1.82~4.87× 外部内存访问;对边缘 / 低功耗部署有意义
- KV Cache 反事实惊喜 arXiv:2607.27600:用反事实惊喜度(counterfactual surprise)指标动态决定 KV Cache 条目保留 / 淘汰
- TokTier(arXiv 待查):有状态 tokenization = tokenization 层 KV Cache 管理
- ResKV(arXiv 待查):固定预算 KV 压缩 = 资源受限场景 KV Cache 优化
- Beyond Prefill-Decode arXiv:2607.25498 + DualDecoder arXiv:2607.26475:静态 vs 动态 placement × 在线 vs 离线决策时间二维分类;稀疏 KV 检索实现长上下文 serving
- 与活文档 knowledge/coding-agents.md v34 Wave4 E1 第十七轮 现有脉络的关系:
- v34 §2.94 记忆方案六联骨架(沿用 v34 §2.94 第十七轮 8-3 立标)→ 本场 = §2.94 邻接 = KV Cache 优化第 6 件集群爆发 6 件 net-new = 推理引擎 cache 优化 第三路线立基础栖补强;
- v34 §3.1 共识 60(沿用)→ 本场 = 共识 61 候选新增 = "KV Cache 优化第 6 件集群爆发(TopKV + C²KV + HiKV + 反事实惊喜 KV + TokTier + ResKV 6 件 net-new)= v45 §IX 38th §X 推理引擎 cache 优化 第三路线立基础栖补强";
- v34 §5 边界(沿用):KV Cache 优化 6 件 与 llm-infra.md §IX 38th + engineering.md §2.13 推理引擎可复现性危机 + multimodal.md §2.94 四向 saturation 双向 reference。
- 建议归入节:
- §2.94 邻接 = KV Cache 优化第 6 件集群爆发 6 件 net-new(推理引擎 cache 优化 第三路线立基础栖补强)
- §3.1 共识 60 → 61 候选新增(KV Cache 优化 6 件 第三路线立基础栖补强)
- §5 边界(与 llm-infra.md §IX 38th + engineering.md §2.13 + multimodal.md §2.94 四向 saturation)
- arXiv 号:arXiv:2607.28633 TopKV + arXiv:2607.17715 C²KV + arXiv:2607.22389 HiKV + arXiv:2607.27600 KV Cache 反事实惊喜 + arXiv:2607.25498 Beyond Prefill-Decode + arXiv:2607.26475 DualDecoder + TokTier + ResKV(arXiv 待查)
二、值得警惕的矛盾或待核实说法(5 条)
矛盾 1 · LongHorizon-Harness arXiv:2608.01964 + StateAct(arXiv 待查)同源思路 = 双胞胎立标候选风险
矛盾点:LongHorizon-Harness 重新表述长程执行为 task-state management problem,将任务状态显式保留在执行外 + StateAct subagent 化 + 程序状态干净 + context 防污染 = 均把任务状态显式保留在执行外 = 同源思路;stephen 8-4 llm-application-e1prep §增量 5 沿用已显式标注"LongHorizon-Harness 与 jay 1850 增量 2 StateAct 同源思路(均把任务状态显式保留在执行外)—— 是否构成独立立标还是合并立标需 v46 §1.1 明确"
核实路径: - v46 §1.1 必须明确 LongHorizon-Harness + StateAct 边界(若 arXiv 编号能找到 StateAct 原文);若 StateAct 找不到 arXiv 原文,只沿用 LongHorizon-Harness 单件立标 - 区分 LongHorizon-Harness "task-state management problem 任务状态显式保留在执行外" vs StateAct "subagent 化 + 程序状态干净" 的核心差异:LongHorizon-Harness 关注任务状态(Task 状态),StateAct 关注程序状态(变量 / 临时文件 / 进程状态)—— 前者重在 task,后者重在 program;若差异是 task vs program 双向而非合并,则双胞胎立标候选 = 独立立标;若差异仅是表述方式不同 = 合并立标
建议归入:§3.3 开放问题 96 候选新增(LongHorizon-Harness + StateAct 同源思路合并 vs 独立立标 · task vs program 状态管理边界)
矛盾 2 · DAPD arXiv:2608.01735 "特权幻觉"是否仅在 OPSD 场景出现
矛盾点:DAPD 识别 teacher-student 在推理时的信息不对称是 OPSD 失败的根本原因;通过 Dual-Anchored 解决这一不对称;但 stephen 8-4 llm-application-e1prep §增量 5 反方已显式标注"⚠️ DAPD '特权幻觉'是否仅在 OPSD 场景出现?DAPD 在其他训练方法(off-policy distillation / RLHF / DPO)中是否适用?"
核实路径: - 读 DAPD arXiv:2608.01735 PDF 全文核验:"特权幻觉"机制是否在 off-policy distillation / RLHF / DPO 中也出现 - 若 DAPD 适用范围 ≤ OPSD = 邻接立标候选;若 DAPD 适用范围 > OPSD = 升档立标级
建议归入:§3.3 开放问题 96 候选新增(DAPD OPSD 之外适用性 · 特权幻觉机制扩展边界)
矛盾 3 · Constitutional Midtraining 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群
矛盾点:Constitutional Midtraining 复用 Anthropic's Constitution 文本;但作者群是否包含 Anthropic 内部研究员、是否经 Anthropic 资助,paper_card 未披露;flyp 8-4 risk-e1prep §增量 1 反方已显式标注"Constitutional Midtraining 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群 — 需核实 Anthropic 直接作者参与度 vs 仅引用 Constitution 文本"
核实路径: - 读 arXiv:2607.26654 PDF 全文核验作者群 + acknowledgements 部分 - 若作者群包含 Anthropic 内部研究员 = 距离立标级更近(同行背书);若仅引用 Constitution 文本 = 仍为候补级但需注明
建议归入:§3.3 开放问题 96 候选新增(Anthropic 参与度核实 · 跨规模复现 > 70B 独立观察 · midtraining vs post-training RLHF 持久性差异)
矛盾 4 · LongDS-Bench arXiv:2605.30434 没区分 agent scaffold vs Princeton Reliability Science 明确把 scaffold 作为变量
矛盾点:LongDS-Bench 评测 6 个模型(GPT-5.4, Gemini-3.1-Pro, Claude-4.6-Sonnet, DeepSeek-V4-Pro, Kimi-K2.6)但没区分 agent scaffold:同 6 个模型是否用统一 scaffold?ReAct vs memory-augmented vs AoT vs Planner-Executor — 论文没说清,而 Princeton Reliability Science 明确把 scaffold 作为变量;flyp 8-4 2250 LongDS-Bench critical-read §L6 已标注"中"风险等级;LongDS 5 类 state-evolution pattern 与 07-08 HORIZON cascading / false-transition / missed-transition 是否 1:1 映射,论文没对比;LongDS-Bench 没有公开统一的 partial-credit scoring,这是与 Long-Horizon Terminal-Bench(LHTB)形成对照的关键差异
核实路径: - 读 LongDS-Bench arXiv:2605.30434 PDF 全文核验 agent scaffold 是否统一 + 5 类 state-evolution pattern vs HORIZON 映射 - 若 scaffold 不统一 = 反方 #88 候选升级为反方 #89 + 持续累积 - 写一篇短笔记对比 LongDS(binary turn-level)vs LHTB(continuous partial credit),推荐知识库采用双指标
建议归入:§3.3 开放问题 96 候选新增(LongDS-Bench 套 Princeton Reliability Science VAF/MOP/GDS/RDC · LongDS vs HORIZON 1:1 映射 · LongDS vs LHTB 双指标 · 反事实扰动 as attack vector)
矛盾 5 · Multi-agent vs Single agent 100% vs 1.7% 数量级差距 = YouTube 二手引用 vs 行业共识
矛盾点:jay 8-4 1905 五类简报 §1 标注"⚠️ Multi-agent 100% vs Single agent 1.7% 是 YouTube 二手引用(Enterprise AI Ecosystem Explained 2026)—— 原始论文需进一步核验";但数量级差距(100% vs 1.7%)与 v45 §3.2 争议 #4 Σ-Mem / Spark-to-Fire cascade paper 行业共识一致
核实路径: - 找 Enterprise AI Ecosystem Explained 2026 YouTube 视频核实原始论文 / 数据源 - 若找到原始论文 = 引用清晰;若找不到 = 仅作行业共识引用,不立标
建议归入:§3.2 争议 #4 续立(Multi-agent 100% vs Single agent 1.7% 数量级差距 + ⚠️ YouTube 二手引用 原始论文需核验)
三、可引用的 arXiv 号列表
3.1 8-4 net-new 立标候选(7 件)
| arXiv 号 | 论文名 | 主分类 | 立标上限 |
|---|---|---|---|
| arXiv:2608.01964 | LongHorizon-Harness:task-state management problem | agent / method | 🟢 P2 立标候选(与 StateAct 同源双胞胎立标风险) |
| arXiv:2608.01678 | Progressive Agent Skill (Skill-α) | agent / method | 🟢 P2 立标候选 |
| arXiv:2608.01735 | DAPD Dual-Anchored Policy Distillation | llm-infra / method | 🟢 P2 立标候选(特权幻觉 OPSD 适用性需核) |
| arXiv:2607.28229 | EMBL AI Librarian | agent | 🟢 P2 立标候选 |
| arXiv:2605.20173 | SDB 随机-确定性边界架构方法论体系 | engineering | 🟢 P2 立基础(jay 8-4 1050) |
| arXiv:2605.30434v1 | LongDS-Bench | cs.LG / cs.CL / cs.MA | 🟢 P3 邻接(长程失败机制分类学第三块拼图) |
| StateAct | subagent 化 + 程序状态干净 + context 防污染 | agent | 🟢 P3 邻接(arXiv 待查 · 与 LongHorizon-Harness 同源双胞胎立标风险) |
3.2 8-4 续立(沿用 + 反方 + 工业实证)(8 件)
| arXiv 号 | 论文名 | 主分类 | 沿用位置 |
|---|---|---|---|
| arXiv:2607.27919 | Memory Decoder at Scale | agent | v34 §2.4 第七路线立标 · 51▲ 跨日 +2 第七路线立标饱和工业实证 |
| arXiv:2607.27201 | Mental World Modeling | agent | v34 §2.39.119 候补级新增 · 53▲ vs 18▲ 立标信号 2.94× 增强 v39 升档 中档 |
| arXiv:2607.26654 | Constitutional Midtraining | risk | 🟡 P3 邻接反方 #88 候补级新增 · 120B 规模持久对齐中训练 |
| arXiv:2603.27918 | MLLM Adversarial Survey | risk | 🟢 P3 邻接 · TMLR 2026 37 页综述 multimodal safety 综述基线 |
| arXiv:2608.00922 | From Cloud to Crowd(DEFRAG) | agent | v34 §X 边缘端 agent 编排邻接 |
| arXiv:2608.00650 | TEngineDB-V(主稿) | database | v34 §X OLAP 数据库系统方法学邻接 |
| arXiv:2608.02583 | UEmbed | llm-infra | v34 §X 多模态嵌入邻接 |
| arXiv:2607.27851 | Beyond Feeling Better | llm-application | v34 §X 长程对话邻接 |
3.3 HF Daily 8-4 票榜(15 件 · 4 件 net-new + 1 件下榜 + 10 件续立)
| 排名 | arXiv 号 | 论文名 | 8-4 票数 | 8-3 票数 | 跨日变化 |
|---|---|---|---|---|---|
| #1 | arXiv:2607.28227 | Qwen-UI-Agent Technical Report | 294▲ | 284▲ | +10 |
| #2 | arXiv:2607.23802 | From RLVR to RLSVR | 73▲ | - | 新 |
| #3 | arXiv:2607.27201 | Mental World Modeling | 53▲ | 18▲ | +35 · 立标信号 2.94× 增强 |
| #4 | arXiv:2607.27919 | Memory Decoder at Scale | 51▲ | 49▲ | +2 |
| #5 | arXiv:2607.23782 | N_0-VTLA | 50▲ | - | - |
| #6 | arXiv:2607.28595 | Beacon | 48▲ | 48▲ | 0 |
| #7 | arXiv:2607.28675 | Meshy T2 | 41▲ | - | - |
| #8 | arXiv:2607.27616 | MPIE-Bench | 37▲ | - | - |
| #9 | arXiv:2607.27816 | Beyond Borrowed Histories | 32▲ | - | - |
| #10 | arXiv:2607.28617 | AISPA | 31▲ | - | 新 |
| #11 | arXiv:2607.23783 | N_0-TWAM | 28▲ | - | - |
| #12 | arXiv:2607.28509 | RefCaptioner | 26▲ | - | 新 |
| #13 | arXiv:2607.29679 | 视觉生成中文本条件的缩放特性 | 24▲ | - | - |
| #14 | arXiv:2607.28415 | QQWorld | 24▲ | - | - |
| #15 | arXiv:2607.29209 | SAF-OPD | 23▲ | - | - |
| 下榜 | arXiv:2607.26811 | DistillAlign | - | 89▲ | 下榜 |
3.4 KV Cache 优化第 6 件集群爆发(6 件 net-new)
| arXiv 号 | 论文名 | 类别 |
|---|---|---|
| arXiv:2607.28633 | TopKV:拓扑感知的 KV Cache 传输调度器 | disaggregated inference |
| arXiv:2607.17715 | C²KV:Non-Prefix KV Cache 压缩复用 | RAG / 工具调用 |
| arXiv:2607.22389 | HiKV:分层重要性感知的 KV Cache 管理 | 能量高效解码 |
| arXiv:2607.27600 | KV Cache 按反事实惊喜度管理 | counterfactual surprise |
| arXiv:2607.25498 | Beyond Prefill-Decode Disaggregation | static vs dynamic placement |
| arXiv:2607.26475 | DualDecoder:稀疏 KV 检索 | 长上下文 serving |
3.5 coding-agents §2.94 邻接 / RAG 工程化 / Memory 跨主题补全(沿用 6 件)
| arXiv 号 | 论文名 | 主分类 |
|---|---|---|
| arXiv:2607.29402 | HyPE | rag |
| arXiv:2607.29459 | CrossRAG / TFGformer | rag |
| arXiv:2607.26611 | Fewer Clarifications | agent |
| arXiv:2607.27888 | Counterfactual Sensitivity Credit | multimodal |
| arXiv:2607.29209 | SAF-OPD | llm-infra |
| arXiv:2607.25380 | Memory 综述 | agent |
四、本场总结
4.1 核心定性
8-4 evening 棒后 19h 窗口净增量定位 = 主线 net-new 增量 0 件 + 7 件 8-4 早晨 net-new agent 主分类立标候选(LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + StateAct + SDB + LongDS-Bench)+ 1 件同源双胞胎立标候选风险(LongHorizon-Harness + StateAct)+ 1 件长程失败机制分类学新拼图(LongDS-Bench · 与 07-08 HORIZON + LHTB + Reliability Science 拼图第三块)+ 1 件 L1 模型层 工业实证(Constitutional Midtraining 反方 #88 候补级)+ 1 件 P3 邻接综述基线(MLLM Adversarial Survey TMLR 2026)+ 1 件 Skills 工业实证(ICML 2026 workshop + Amazon CloudWatch Coding Agent Insights)+ 1 件 KV Cache 第 6 件集群爆发(6 件 net-new)+ 1 件 HF Daily 飞轮"轮换态" 微反弹(4 件 net-new + 1 件下榜 + 10 件续立 + Memory Decoder at Scale 51▲ 第七路线立标饱和工业实证 + MWM 53▲ 立标信号 2.94× 增强 v39 升档 中档)= 净增量 6 条主线 + 1 件同源双胞胎立标候选 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 + 1 件 P3 邻接综述基线 + 1 件 Skills 工业实证 + 1 件 KV Cache 第 6 件集群爆发 + 1 件 HF Daily 飞轮"轮换态" 微反弹 = 9 件。
4.2 与 8-4 04:25 flyp coding-agents-e1prep-v17 第十七轮收官棒 对比
| 维度 | v17 第十七轮(8-3 早间 ~ 8-3 evening 18h) | v18 第十八轮(8-4 morning → 8-4 evening 19h) |
|---|---|---|
| 主线 net-new 增量 | 0 件(主线饱和) | 0 件(主线饱和 · 7 件 agent 主分类立标候选 + 2 件同源双胞胎 / 长程失败机制分类学新拼图 = 同类沿用) |
| 立标候选池 | 8 件(8-3 radar 五向 + Memory Provenance Laundering 第八路线 + Beyond pass@1 反方 #87 + HF Daily 飞轮衰减) | 7 件 net-new + 1 件同源双胞胎立标候选 + 1 件长程失败机制分类学新拼图 = 9 件 |
| HF Daily 飞轮机制 | 完全饱和 → 稳态续立(8-3 vs 8-2 跨日 +1 ~ +7 稳态续立) | 稳态续立 → 轮换态 微反弹(8-4 vs 8-3 = 4 件 net-new + 1 件下榜 + 10 件续立) |
| Memory Decoder at Scale 立标信号 | 48▲ → 49▲ 稳态续立 第七路线立标候选 | 49▲ → 51▲ 跨日 +2 第七路线立标饱和工业实证 |
| MWM 立标信号 | #15 18▲ v38 候补级低档 | #3 53▲ vs 18▲ 立标信号 2.94× 增强 v39 升档 中档 |
| Constitutional Midtraining 反方 | 沿用 R37 §3.1 反方 #54 Silent Failures | R37 §3.1 反方 #88 候补级新增(120B 规模持久对齐中训练 + 内容存在驱动对齐收益) |
| Skills 工业实证 | v45 §2.3 SkillRise / CAST / SkillOpt + ACE 三角色架构 | Amazon CloudWatch Coding Agent Insights 产品发布 + ICML 2026 workshop "agentic AI" 60/247 |
| paper_cards 库新增速率 | 12 张 / 18h ≈ 0.67 张/h | 30 张 / 24h ≈ 1.25 张/h ≈ 1.87× vs v17 · work-queue 8-4 22:00 0 件待建卡 · 0 件高价值 Top 15 候补级 |
| spark 端 agent-e1prep 状态 | 沿用 | 连续 5 天缺位 第 1 例系统性塌方边缘 + 本棒 = cron 强制触发的 v39 = 物理动作兑现 |
| EU AI Act / SGLang 3 CVE / HF 入侵 / Datadog 容量攻击面 | 距今 40h / 沿用 / 完整技术复盘 / 隐线 53 | 沿用 |
4.3 关键判断
- 主线编码 Agent 主题在 8-4 04:25 已经收官完整立标(Memory Provenance Laundering 第八路线 + Lossy Verification 四类失败模式 + Token-Oriented Inference 学术锚点 + Σ-Mem 与 Filesystem-Based Memory 关系确认 + 8-3 radar 五向 + airllm 第 6 拍);8-4 19h 内主要工作是 7 件 agent 主分类立标候选 + 1 件同源双胞胎立标候选风险 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 + 1 件 Skills 工业实证 + 1 件 KV Cache 第 6 件集群爆发 + 1 件 HF Daily 飞轮"轮换态" 微反弹,而非新主线立标
- LongHorizon-Harness arXiv:2608.01964 + StateAct(arXiv 待查)同源思路合并 vs 独立立标需 v46 §1.1 明确 = 双胞胎立标候选风险(task vs program 状态管理边界)
- DAPD arXiv:2608.01735 "特权幻觉"是否仅在 OPSD 场景出现 + 在其他训练方法中是否适用 = 需 PDF 全文核验(off-policy distillation / RLHF / DPO 适用性边界)
- Constitutional Midtraining arXiv:2607.26654 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群 = 需核实 Anthropic 参与度(同行背书 vs 仅引用文本)
- LongDS-Bench arXiv:2605.30434 没区分 agent scaffold vs Princeton Reliability Science 明确把 scaffold 作为变量 = 反方 #88 候选升级为反方 #89 风险(LongDS 5 类 state-evolution pattern vs 07-08 HORIZON cascading / false-transition / missed-transition 1:1 映射)
- HF Daily 飞轮"轮换态" 微反弹是 8-2 跨日翻倍级 / 8-3 跨日稳态续立 / 8-4 跨日轮换态 三态转换的周期性现象? 需 8-5 ~ 8-9 1 周窗口验证
- MWM arXiv:2607.27201 8-4 票榜 #3 53▲ vs 8-3 票榜 #15 18▲ 立标信号 2.94× 增强 v39 升档 中档 = 心理化世界模型作为 agent 2026 H2 范式分水岭 = v34 §1.32c 横切 52c 续立
- KV Cache 优化第 6 件集群爆发(TopKV + C²KV + HiKV + 反事实惊喜 KV + TokTier + ResKV 6 件)= v34 §2.94 推理引擎 cache 优化 第三路线立基础栖补强
- spark 端 agent-e1prep 连续 5 天缺位 第 1 例系统性塌方边缘 + 本棒 = cron 强制触发的 v39 = 物理动作兑现 ✅(反思棒物理动作失效第 2 例 · 8-4 ~ 8-9 1 周窗口是否持续出 agent-e1prep 棒 + 撤销 chip-huyen + 3blue1brown cron 待 8-5 早晨验证)
- paper_cards 库新增速率反弹 15.8×(30 张 / 24h ≈ 1.25 张/h vs v35 11h 净增 1 张 ≈ 0.09 张/h)+ work-queue 8-4 22:00 0 件待建卡 · 0 件高价值 Top 15 候补级 = 飞轮供给充足但消费端"候补级"饱和度低
4.4 立标候选池饱和度与下棒(v46)建议
| 候选池 | 8-3 v17 立标候选数 | 8-4 v18 立标候选数 | v46 接力前建议 |
|---|---|---|---|
| 主分类 agent | 8 件(Memory Provenance + Beyond pass@1 + HF Daily 飞轮 + HyPE + CrossRAG + MWM + SAF-OPD + Fewer Clarifications + Σ-Mem + Filesystem + CoMem + Memory Decoder + Metis) | 15 件(新增 LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + StateAct + SDB + LongDS-Bench + KV Cache 6 件) | v46 §1.1 必须明确 LongHorizon-Harness + StateAct 同源双胞胎立标风险;tokens:agent 主分类候选池饱和度反弹 |
| 主分类 multimodal | 7 件(8-3 radar 五向 + Lossy Verification + Token-Oriented Inference) | 12 件(新增 MWM 升档 + RL²-VLA + Counterfactual Sensitivity + 3D-Aware RGB-NIR + Scaling Properties + Evaluation-Verification Reward) | v46 §2.39.x 候补级新增 6 件 |
| 主分类 risk | 1 件(Memory Provenance Laundering 候补级) | 2 件(新增 Constitutional Midtraining P2 候补级 + MLLM Adversarial Survey P3 邻接) | v46 §3.1 反方 #88 候补级新增 + §2.39 综述基线索引补全 |
| 主分类 evaluation | 4 件(PROTEA + DialogGuard + ARC + ExtractBench) | 4 件 + Beyond pass@1 反方 | v46 §1.4 续立 |
| 主分类 llm-infra | 5 件(Mooncake / Dynamo / LMCache / KV Cache 综述 / Dify) | 11 件(新增 DAPD + TopKV + C²KV + HiKV + 反事实惊喜 KV + TokTier + ResKV + DualDecoder + Beyond Prefill-Decode) | v46 §IX 38th 续立 = KV Cache 优化第 6 件集群爆发 |
| 主分类 engineering | 0 件 net-new | 1 件 net-new(SDB arXiv:2605.20173 jay 8-4 1050 立基础) | v46 §2.7 Agentic Engineering 学科化 续立 |
4.5 跨主题双向更新(五向 saturation)
- agent.md v39(spark 8-4 13:40 收官) → 本棒 coding-agents 沿用 5 件 net-new + 1 件升档 + 1 件 P0 警示 = 双向 reference
- multimodal.md v39(flyp 8-4 09:46 收官) → 本棒 coding-agents 沿用 MWM 升档 + RL²-VLA + Counterfactual Sensitivity + 3D-Aware RGB-NIR + Scaling Properties + Evaluation-Verification Reward = 6 件 multimodal 主分类新卡邻接 = 双向 reference
- risk.md v37(flyp 8-4 16:37 收官) → 本棒 coding-agents 沿用 Constitutional Midtraining 反方 #88 候补级 + MLLM Adversarial Survey P3 邻接 = 双向 reference
- llm-application.md v46(stephen 8-4 21:17 收官) → 本棒 coding-agents 沿用 LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian = 4 件 net-new agent 主分类立标候选 + KV Cache 优化第 6 件集群爆发 + StateAct + ACE 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% = 双向 reference
- llm-infra.md §IX 38th(spark 8-4 18:48 收官) → 本棒 coding-agents 沿用 DAPD + KV Cache 6 件 + LongDS-Bench 邻接 + Constitutional Midtraining 第 5 维 = 双向 reference
- engineering.md v44(jay 8-4 11:24 收官) → 本棒 coding-agents 沿用 SDB arXiv:2605.20173 立基础 + StriaTrace OSDI 2026 + time-to-first-token 路线图 = 双向 reference
4.6 跨棒承接关系
- 本棒承接 8-4 04:25 flyp coding-agents-e1prep-v17 第十七轮收官棒(Memory Provenance Laundering arXiv:2607.29167 第八路线 + Lossy Verification + Token-Oriented Inference + Σ-Mem 与 Filesystem-Based Memory 关系确认 + 8-3 radar 五向 + airllm 第 6 拍 + 17 棒 8 件总增量)
- 本棒承接 8-3 23:29 flyp coding-agents-e1prep-v16 第十六轮收官棒(16 棒 12 件总增量)
- 下棒 8-5 morning 棒 = flyp coding-agents-e1prep-v19(第十九轮 = v46 接力棒):承接本棒 6 条主线 + 1 件同源双胞胎立标候选 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 = 9 件;优先工作 = ① v46 §1.1 明确 LongHorizon-Harness + StateAct 同源双胞胎立标风险 ② v46 §2.94 KV Cache 优化第 6 件集群爆发 6 件升级为 v46 §IX 38th §X 推理引擎 cache 优化 第三路线立基础 ③ v46 §2.5 Agent 安全六联立标层 → 七联立标层 = Constitutional Midtraining 第七联 ④ v46 §3.3 反方 #88 候选新增(LongDS-Bench 长程数据分析域 47 pp 早→晚塌陷)+ 反方 #88 候选 2(Constitutional Midtraining)⑤ v46 §2.143 HF Daily 8-4 票榜飞轮"轮换态" 微反弹 vs v38 完全饱和 vs v37 稳态续立 三态转换 v46 沿用
- 下下棒 8-5 evening 棒 = flyp coding-agents-e1prep-v20(第二十轮):承接本棒 9 件 + spark 端 agent-e1prep 连续 6 天缺位持续验证 + chip-huyen + 3blue1brown cron 是否撤销 + HF Daily 8-5 票榜飞轮状态
本场净增量 9 件 = 6 条主线(增量 1 ~ 增量 6)+ 1 件同源双胞胎立标候选(增量 2)+ 1 件长程失败机制分类学新拼图(增量 3)+ 1 件 L1 模型层 工业实证(增量 5):本场 7 件 8-4 早晨 net-new agent 主分类立标候选(LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian + StateAct + SDB + LongDS-Bench)+ 1 件同源双胞胎立标候选风险 + 1 件长程失败机制分类学新拼图 + 1 件 L1 模型层 工业实证 + 1 件 P3 邻接综述基线 + 1 件 Skills 工业实证 + 1 件 KV Cache 第 6 件集群爆发 + 1 件 HF Daily 飞轮"轮换态" 微反弹 = 9 件总增量。主线 net-new 增量 0 件 · 立标候选池饱和度 4× 反弹 · 飞轮机制从"完全饱和" 微反弹为"轮换态" 第 2 例 · MWM 立标信号 2.94× 增强 v39 升档 中档 · 第七路线立标饱和工业实证 · 反方 #88 候补级新增 · 5 条矛盾 / 待核实说法 · 26 件 arXiv 号 · 1 件同源双胞胎立标候选风险 · 1 件长程失败机制分类学新拼图 · 1 件 Skills 工业实证 · 1 件 KV Cache 第 6 件集群爆发。