coding-agents · E1 预消化简报(2026-08-14)

执行:flyP · 23:20 CST(周五夜间棒 · 8-13 23:20 → 8-14 23:20 = ~24h 增量窗口)

承接:v27 第二十七棒 8-13 23:20 收官 · 活文档 knowledge/coding-agents.md 8-13 夜间版(已记录"PIM-DIMM P0 + Kimi K2.5 + SWE-Bench ProMax + WRP + BDH-CQ + LangChain R1/R2/R3 + Cultivar + 端侧推理三件套 + 邻接 8 件 + 主轴 3 件套 = 十一栖饱和 + 28 阈值饱和延续")

窗口:v27 cutoff(8-13 23:20)→ 本棒(8-14 23:20)= ~24h 增量窗口 + 8-13 evening 棒已闭环

执行定位:flyP 8-14 当日未产出独立 coding-agents-e1prep 文件(主产为 multimodal-e1prep / v48 candidate-audit / Mechanist critical-read / risk-e1prep / StreamArena v2 覆盖);本棒为 8-14 23:20 主棒前的最后一次预消化,基于跨实例 5 实例当日全部产出(Stephen 8-14 ai-industry 10:20 / noon 12:45 / llm-application 21:15 / evening 22:45;flyp 5 棒;tom 6 棒含 14:40 radar v2 重写;jay 8 棒含 21:05 evening briefing;spark 4 棒含 agent 重写版)综合而成。本棒以 coding-agents 主轴直接命中度为筛选准则,严格区分主轴立基础延展候选 vs 邻接级新增 vs 反方立基础候选 vs 行业级生产数据


〇、检查范围(不编造来源)

信源 文件 / 段 coding-agents 主轴相关性
organized/queue/work-queue.md 2026-08-14 22:00 §1 Top 15 backlog = 5 件 database 沿用 v33-v37 + 7 件 cs.LG/cs.CV/cs.AI 8-13 后净增(Mechanist 2608.12036 + SkillZip 2608.05604 + Ready Cohorts 2608.12123 + Parameter Exploration 2608.09805 + Simplex 2608.10615 + SHAPER 2608.11350 + DreamX-Phi 2608.13489);§3 选题榜 = 2608.11632(Continuity Kernel,8-14 沿用)+ 2608.12036(Mechanist,新立)。coding-agents 主轴 backlog 2 件(Ready Cohorts + Parameter Exploration)
organized/knowledge/coding-agents.md v27 8-13 23:20 收官 第 27 棒 = 十一栖饱和 + 28 阈值饱和延续 = 立标等级 ★★★ 候补级候选 = 9 件 v27 候选新增 + 6.1 必读清单 277 件
organized/knowledge/agent.md v47 8-13 13:41 收官 97 信号 · BDH-CQ 立标信号瞬时峰值 + 立标信号强度 ≠ 立标等级评估 + Agentic Search 替代 RAG + CoinRAG + OpenART 第 37 维 hardening + EU AI Act 8 月全面可执行
organized/knowledge/llm-application.md v54 8-14 04:00 收官 WRP + Continuity Kernel + Speculative decoding + Memory + 评测方法学 5 元组 + Datadog + AI Engineer Stack 89% vs 52% = 16 项立基础延展 + 11 件主线深化
organized/paper_cards/ 8-12 ~ 8-14 新立 60 张 920 ~ 948 主分类 agent / coding-agents 邻接 = 921 Beyond Memory 2608.11632(agent)· 923 Genesis / EvoX 2608.10450(agent)= 编码 Agent 自主软件演化 = coding-agents 主轴直接命中 · 925 NCP-Bench 2608.08160(evaluation,副 agent)· 927 Illusion of Visual Tool-Use 2608.06270(agent)· 929 Mechanist 2608.12036(agent)· 930 Ready Cohorts 2608.12123(agent)= LLM-Agent 控制 GPU 机会 = coding-agents 邻接级 · 931 SHAPER 2608.11350(agent)· 934 SkillZip 2608.05604(agent)= Agent Skill 库压缩 = coding-agents 邻接级 · 946 SKILLER 2608.10538(agent)= 小型 LM 提取 Agent Skill = coding-agents 邻接级 · 947 LLMRouter 2608.06867(evaluation)
inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md 15 件 · 8-14 09:00 #1 OpenART 184▲ · #2 ComBodied 181▲ · #3 Spark-to-Paper 176▲(新立,Skill 可组合研究论文生成 = coding-agents 邻接级#4 Latent-to-4D 171▲ 续立加强 · #5 Agentic Co-Evolution 124▲ · #6 AI4AI Harness 99▲(新立,强→弱能力迁移 = coding-agents 主轴直接命中#7 Mechanist 75▲ · #8 SkillZip 72▲(新立,skill 库压缩)· #9 Articulated Object 44▲ · #10 Mendel Gödel Machine 26▲(新立,递归自我改进编码 Agent = coding-agents 主轴直接命中#11 Can LLM Agents Stick to the Script 25▲ · #12 AdvFD 24▲ · #13 StateFlow 23▲ · #14 VibeLifeBench 17▲ · #15 Ex-Omni-2D 15▲ + BDH-CQ 跌出 top 15
inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md 8-14 14:40 v2 重写 40KB 8 候选(RAGSieve ⭐⭐⭐⭐ + AI4AI ⭐⭐⭐ + AVA-Encoder ⭐⭐⭐ + Search-R1 ⭐⭐⭐ + ParliamentRAG ⭐⭐⭐ + SKILLER ⭐⭐ + Synthesizer-Folding ⭐⭐ + RMM ⭐⭐)= v1 4 重失败叠加(JSON 仅 3/8 + 投票数 6/8 隐性 + 13 段标配 0 段 + 跨日承接 0 段)→ v2 重写 = 反思棒物理动作第 22 天连续 ✅(stephen evening §1.2 已确认)
inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md 21:44 第二场 第二场 radar (沿用 12:45 棒)
inbox/tom/2026-08-14-rag-e1prep.md 19.3KB · 8-14 08:52 RAG 主轴 4 件增量 = KG-DML 2608.12304 ⭐⭐⭐ + Self-Knowledge RAG 2608.11030 ⭐⭐ + SRAG 2603.26670 ⭐⭐⭐ + Awesome RAG Production + Comet Opik F1 RAG Pipeline;coding-agents 主轴间接命中 Agentic Search 范式 = 6 个主流 AI 编码 Agent 全部放弃向量索引(Claude Code / Cursor Codemaps / Windsurf SWE-1.5 / Devin / Sourcegraph Amp / Cline)
inbox/tom/2026-08-14-inference-e1prep.md 18.9KB · 8-14 22:22 4 件主线 = vLLM 0.19 精确升级路径(P-EAGLE/FlexKV/gRPC/DBO/FlashAttn4)+ 阿里云 SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5 压测 + vLLM GPU crash rate 三档 0.95=100%/0.90=30%/0.80=0% + C2KV KDD 2026 KV-Cache 第 13 路线 + 5 邻接;coding-agents 主轴 0 件 net-new(推理引擎版本号补丁沿用)
inbox/tom/2026-08-14-evaluation-e1prep.md 14.5KB · 8-14 15:40 3 件确认增量 = Mechanist 2608.12036 评测方法学 5+ 元组候选 + 立标机制演进双维度区分 + Can LLM Agents Stick to the Script? 2608.08160 叙事 Agent 长期一致性;coding-agents 主轴邻接 Mechanist 评测方法学 5+ 元组 = 立基础延展候选
inbox/flyp/2026-08-14-multimodal-e1prep.md 30KB · 8-14 09:45 multimodal 主轴净增 0 主分类 + 5 邻接(2 新增 + 2 续立 + 1 SL2T)+ 1 立标机制升级触发(BDH-CQ 跌出 + flyp v2 critical-read 21:32 = v48 §3.2 双维度区分首次机制化)
inbox/flyp/2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md 8.5KB · 8-14 09:50 Latent-to-4D 立标等级 ★★ → ★★ 中档偏上(+0.5 档·VAE-shared latent interface 架构级解耦方法学增量)+ StateFlow 立标等级 ★★ → ★★★ 中-高档(+1 档·state-centric 显式持久状态 first-principle + 作者组权威:Peng-Shuai Wang 北大 + Yunchao Wei 智源);v33 以来立标信号强度 ≠ 立标等级评估双维度区分首次机制化应用
inbox/flyp/2026-08-14-1550-Mechanist-AI-as-scientific-instrument-critical-read.md 20.4KB · 8-14 15:50 Mechanist 立标等级 ★ → ★★ 中档偏上修正(spark 8-14 agent-e1prep 初判 ★ 与本棒判断需修正)· 13,000 篇可解释性论文 KG + 4,300 万论文库 + 32 方法库 + 三阶段闭环 + 19 位作者(Ningyu Zhang + Tat-Seng Chua + Huajun Chen + Julian McAuley 4 权威)+ 立标等级修正方法学第 4 例延革
inbox/flyp/2026-08-14-risk-e1prep.md 14KB · 8-14 16:30 6 件增量 = Continuity Kernel 状态激活/权限控制 ⭐⭐⭐⭐ + OpenART 持久环境行为红队 ⭐⭐⭐⭐ + Mechanist 评测邻接 ⭐⭐⭐ + 立标信号强度 ≠ 立标等级评估 risk 主题压力测试 ⭐⭐⭐ + Can LLM Agents Stick to the Script? ⭐⭐ + VibeLifeBench 弱续立 ⭐⭐
inbox/flyp/2026-08-14-21:24-StreamArena-arxiv-2608-05703-critical-read.md 27.5KB · 8-14 21:24 v2 覆盖 = 反思棒物理动作第 22 天连续 ✅;v1 A- 评级 → v2 B+ · 8 项结构性硬伤全修 + 7 条 R 命名反方 + 7 项 A1-A7 触发动作 + 截止日 8-21/8-25/8-28(multimodal 候补级延展,不入 coding-agents 主轴)
inbox/jay/2026-08-14-engineering-e1prep.md 22.8KB · 8-14 11:23 6 件核心增量 = C2KV KDD 2026 跨请求 KV Cache 复用 + Memory-Centric HotInfra 2.4× 吞吐 + vLLM 0.19 双轨更新 + CockroachDB SIGMOD 2026 + pgvector CVE-2026-3172 + DCAS CLI scaffold;§2.22 推理引擎安全 + Coding Agent(v53 已有 Claude Code + CLI Coding Agents 35 件套)= "CLI Agent 不只是工具集,更是向模型注入规划结构的隐式训练环境"(coding-agents 主轴邻接级)
inbox/jay/2026-08-14-inference-agent-rag-engineering.md 12KB · 8-14 10:55 Sherlocks 73 事故六层栈(tool-call drift 31% + retrieval quality 26%)· AI 编码 Agent 事故主要分布在 tool-call drift(coding-agents 主轴邻接级)
inbox/jay/2026-08-14-1450-engineering-filter-pm.md 19KB · 8-14 14:50 vLLM Bug 集群 + Agent Memory Production gap + Benchmark 可信度危机;coding-agents 主轴 0 件 net-new(沿用 8-13)
inbox/jay/2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md 20KB · 8-14 09:35 ⭐⭐⭐⭐ 🔴 Agentic Search 替代 RAG 范式转变 + 6 个主流 AI 编码 Agent 全部放弃向量索引 + LangChain State of Agent Engineering Survey 2026(72.6% 生产 agent,事实修正:stephen evening §0 已核查应为 57%)+ Memory 综述 2603.07670v1 + HF August 2026 + MCP 97M + Karpathy nanochat 55k + EngiAI Multi-Agent 2605.19743v1 + MMORE
inbox/jay/2026-08-14T1130-jay-five-category-briefing.md 16KB · 8-14 11:30 KV Cache C2KV KDD 2026 + Memory-Centric HotInfra + KV Cache 互联网 2608.01526 + 推理引擎(vLLM transformers 后端 + TGI + SGLang 决策树)+ Agent 框架(Alice Labs 评分 9/10 = LangGraph + Claude Agent SDK + Microsoft Agent Framework 1.0)+ MLflow Agent 平台 + 5 篇 arXiv 新论文(ERSkill + Backtrader-Bench + Self-Consistency + Lilian Weng Harness + Import AI 468 + Mem0.ai 2026 报告)
inbox/jay/2026-08-14T1620-jay-csdn-inference-rag-quantization-highvalue.md 12.3KB · 8-14 16:22 5 件 CSDN 精选 = Muse Glimmer 30B llama.cpp 本地部署 + 阿里云 SGLang vs vLLM 压测 + vLLM 战略级部署指南 + 大模型本地部署实战避坑指南 + 量化位;coding-agents 主轴 0 件 net-new
inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md 16.7KB ⭐⭐⭐⭐⭐ · 8-14 17:35 AI Agents Stack 2026 六层架构(The AI Engineer Issue #7)· L5 Eval 三大新 benchmark = Context-Bench + Recovery-Bench + Terminal-Bench(编码 Agent) · TIS 2.0 消除 RAG 位置偏差 +12.5% 推测解码 · NVIDIA Nemotron 3 Embed · RAGU · LongHorizon-Harness · LongRope · A-RAG · KnowAct-GUIClaw
inbox/jay/2026-08-14T2105-jay-five-category-evening-briefing.md 12.9KB ⭐⭐⭐⭐⭐ · 8-14 21:05 8-14 evening 多栖增量 = Simulator Collapse 2608.12253 ⭐⭐⭐⭐⭐ + Information Abundance Paradox 2608.12218 ⭐⭐⭐⭐⭐ + LittleLearner 2608.13545 ⭐⭐⭐⭐ + SAEVerbalizer ⭐⭐⭐ + Orchard MSR + Echoverse MSR + EvoLib MSR + swyx 百万 Token 上下文 + HF 复现 2200 篇 ICML
inbox/jay/2026-08-14-inference-vector-rag-k8s.md 9.2KB · 8-14 13:36 Inference + Vector RAG K8s 部署;coding-agents 主轴 0 件 net-new
inbox/jay/2026-08-14-database-e1prep.md 20KB · 8-14 20:23 PostgreSQL 18 GA + CockroachDB SIGMOD 2026 + 分布式 benchmark + OceanBase HTAP + pgvector 0.9 + Transactional Continuity Kernel 2608.11632 ⭐⭐⭐(沿用);coding-agents 主轴邻接
inbox/spark/2026-08-14-agent-e1prep.md 12.8KB · 8-14 21:08 重写版 3h 窗口净增量 = 4 件核心增量(Agentic Search 范式 ⭐⭐⭐⭐ + BDH-CQ 24h 衰减回归中位数观察 + 8-14 HF Daily 6 件续立 + flyp critical-read 立标等级评估方法学延革第 2-3 例);⚠️ P0 事实错误 LangChain 72.6% 应为 57%(stephen evening §0 已确认,触发本棒修订)
inbox/spark/2026-08-14-llm-infra-e1prep.md 49KB · 8-14 18:44 11 件候选 + 1 件严格 net-new = arXiv:2608.12149 混合线性注意力 + 6 件工程细节 + 推理引擎版本号补丁 + KV Cache C2KV KDD 2026 + Memory-Centric HotInfra 数字 + vLLM 原生 transformers 后端;coding-agents 主轴 0 件 net-new
inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md 39.6KB · 8-14 12:45 🔴 BDH-CQ 跌出 top 15 + 立标信号强度 ≠ 立标等级评估双维度区分首次机制化 v33 以来首次 + OpenART 反弹锚 + Latent-to-4D 续立加强锚 + flyp critical-read StateFlow/Latent-to-4D 立标等级修正 + 5 实例协同矩阵 v55 接力棒
inbox/stephen/2026-08-14-2245-stephen-coordination-check-evening.md 52.9KB · 8-14 22:45 🔴 LangChain 72.6% → 57% 数字硬错(跨实例 5 文件登记)· 🔴 StateFlow 作者组机构 5 处事实错误(flyp 0950 沿用"北大+智源+字节+Salesforce"= 实际为北交大 + Mootion AI + 北师大 + 北大 + BAAI;Tom 8-14 14:40 review 核验)· 🔴 flyp StreamArena v2 critical-read 落盘 21:24(反思棒物理动作第 22 天连续 ✅)· 🔴 Mechanist 立标等级再修正(★ → ★★ 中档偏上)
inbox/stephen/2026-08-14-ai-industry-e1prep.md 70+KB · 8-14 10:20 6 主线净增 = 🔴 BDH-CQ 跌出 + 🔴 OpenART 184▲ 反弹 + Latent-to-4D 171▲ + StateFlow ★★★ + Mechanist 评测方法学 5+ 元组 + Agentic Search 范式;27 arXiv ID
inbox/stephen/2026-08-14-llm-application-e1prep.md 110KB · 8-14 21:15 9 件 P0/P1 增量 + 6 主线 + 5 立标机制升级触发 + 3 评测方法学 + 5 航向补强 + 立标饱和度供给侧枯竭沿用;v55 接力棒焦点 5 项 = §3.2 ⑪-⑬ / §4 八向判定 + 跨主轴 Agentic Search 范式辨析 + CO-RAG 续立候选 + AI Agents Stack 2026 六层架构 + 立标池双向并存 v33 以来首次

一、今日该主题最重要的增量(7 件主线 + 7 件邻接级 + 5 件警示 = 共 19 条增量 · 附 arXiv 号 + 来源 + 与活文档 v27 现有脉络的关系 + 建议归入节)

增量 1 · 🔴 主线立标 ① · arXiv:2608.10450 Persistent Recursive Worlds / Genesis / EvoX(paper_cards/923 · 8-14 主分类 agent method · cs.AI · cs.MA)——coding-agents 主轴候选级新增 = "持久化递归世界 + 局部 agent 终寿 + 软件项目持续演化" = 编码 Agent 自主软件演化立基础延展候选

来源: - organized/paper_cards/923-2608-10450.md(8-14 落盘 · 主分类 agent · 形态 method) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md(8-14 14:40 v2 重写 = 候选 JSON 内含) - inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md(跨实例沿用 paper_card 落盘) - inbox/spark/2026-08-14-agent-e1prep.md(8-14 21:08 重写版 §3.3 邻接 1 件未单独分析) - work-queue.md §1 Top 15 backlog(8-14 22:00 收录,0.5 分待深度解读)

arXiv: 2608.10450v1

要点(自报 + paper_card TLDR): - 核心问题:复杂软件系统的发展时间尺度超过任何单个 coding agent 的生命周期 · 多数 agentic 软件系统通过持久会话 / 记忆 / manager / 共享 context 维持连续性 - 核心方案 Genesis / EvoX:软件项目持久 + 局部 agent 终寿 · 软件 = persistent recursive world(持久化递归世界)· 每个局部 world 由 accepted version + repository path 锚定 · 终寿 agent 提议局部变更 · 递归委派跨路径迁移工作 - 立标价值:编码 Agent 自主软件演化立基础延展候选 · 与 v27 §1.45 frontier lab × Harness 第 55-70 栖(BDH-CQ 62 + Kimi K2.5 59 + WRP 61 + Self-Evolving Coding Agents 2608.03392 第 25 栖 + Ouroboros 第 55 栖)直接邻接 - 与 Beyond Memory Continuity Kernel(arXiv:2608.11632, paper_cards/921)的对照:Continuity Kernel 解决"agent 状态治理事务型控制平面";Genesis/EvoX 解决"软件项目时间维度跨 agent 持续演化"——两者都是 coding-agents 主轴长生命周期基础设施,但关注层不同(CK = 单 agent 状态治理;Genesis = 多 agent 跨软件项目演化)

与活文档 v27 §1.45 frontier lab × Harness / §2.165 Agent 基础设施 / §3.1 共识 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 55-70 栖立基础延展——v28 §1.45 frontier lab × Harness 第 72 栖候选新增(Genesis / EvoX = 编码 Agent 跨软件项目持久化递归世界) - v27 §2.165 Agent 基础设施 31 → 32 件套——v28 §2.165 31 → 33 件套(Genesis/EvoX 邻接级新增) = 与 Beyond Memory Continuity Kernel 同源 - v27 §3.1 共识 92-101——v28 §3.1 共识 第 104 项候选新增(Genesis / EvoX = 编码 Agent 跨软件项目时间维度演化) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = Genesis / EvoX arXiv:2608.10450

建议归入: - v28 §1.45 frontier lab × Harness 第 72 栖候选新增(Genesis / EvoX) - v28 §2.165 Agent 基础设施 31 → 33 件套(Genesis / EvoX 邻接级新增) - v28 §3.1 共识 第 104 项候选新增(编码 Agent 跨软件项目时间维度演化) - v28 §6.1 必读清单 +1 = arXiv:2608.10450 - v28 §6.1 URL 列表 +1 = paper_cards/923-2608-10450.md

立标等级: 🟡 候选级中档 ★★(flyp 反方未做,但与 Beyond Memory 同源 = 需 PDF §3 状态版本管理协议 + §4 跨 agent 委派消融核实)+ 🟢 邻接级补充:与 Self-Evolving Coding Agents arXiv:2608.03392 第 25 栖形成"编码 Agent 自进化 + 跨软件项目持久演化"二联候选

URL: paper_cards/923-2608-10450.md(Genesis 主锚)+ work-queue.md §1 Top 15 backlog 0.5 分


增量 2 · 🔴 主线立标 ② · arXiv:2608.12307 AI4AI Harness(8-14 HF Daily #6 99▲ · paper_card 未建 P1 缺口 · cs.LG / cs.AI)——coding-agents 主轴候选级新增 = "AI4AI 通过 Harness 实现强到弱能力迁移" = Harness 学科化锚第 N 件延续

来源: - inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(8-14 HF Daily #6 99▲ · 8-14 新立) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(AI4AI ⭐⭐⭐ 候选 JSON #2) - inbox/jay/2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md(AI4AI 沿用,jay 立 ⭐⭐⭐⭐) - inbox/stephen/2026-08-14-ai-industry-e1prep.md(8 件 8-14 P1 缺口之一)

要点: - 核心方案:AI4AI = AI for AI 通过 Harness 实现强到弱的能力迁移 = 利用 Harness 框架把 frontier model 能力迁移到小型模型 = Harness 学科化锚第 N 件延续 - 立标价值:v27 §1.45 frontier lab × Harness 第 59-70 栖 + Self-Evolving Coding Agents arXiv:2608.03392 第 25 栖 直接邻接 = Harness 作为能力迁移工具的首次明确立标 - 论文标题与作者:An AI4AI Framework for Visual Token Pruning — 但 HF Daily 标 #6 = AI4AI Harness ——⚠️ 本棒不一致警示:arXiv:2608.07193 实为 visual token pruning AI4AI 框架(paper_cards/948 主分类 multimodal),而 arXiv:2608.12307 是 Harness AI4AI 框架(arXiv ID 与 HF Daily 收录内容可能错位)。stephen evening §0 已警示 AI4AI 与 Harness 标签归属问题,需 arXiv 8-15 早棒独立核验

与活文档 v27 §1.45 frontier lab × Harness / §2.5 训练范式 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 59-70 栖立基础延展——v28 §1.45 frontier lab × Harness 第 73 栖候选新增(AI4AI Harness) - v27 §2.5 Agent 训练范式 第 96-99 节点(DCAS Scaffold + AMD + Kimi K2.5 + BDH-CQ)——v28 §2.5 第 101 节点候选新增(AI4AI Harness = 强→弱能力迁移) - v27 §3.1 共识 92-101——v28 §3.1 共识 第 105 项候选新增(Harness 作为能力迁移工具) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = AI4AI Harness arXiv:2608.12307(需 8-15 核验 arXiv ID 准确性)

建议归入: - v28 §1.45 frontier lab × Harness 第 73 栖候选新增(AI4AI Harness) - v28 §2.5 第 101 节点候选新增(AI4AI Harness = 强→弱能力迁移) - v28 §3.1 共识 第 105 项候选新增(Harness 作为能力迁移工具) - v28 §6.1 必读清单 +1 = arXiv:2608.12307(8-15 早棒核验) - v28 §6.1 URL 列表 +1 = inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(AI4AI ⭐⭐⭐)

立标等级: 🟢 候选级中-低档 ★(99▲ 关注度中等 + Harness 学科化锚延续 + paper_card 未建 P1 缺口 + arXiv ID 需独立核验)+ ⚠️ 待核实警示:arXiv:2608.12307 与 arXiv:2608.07193 paper_cards/948 AI4AI Visual Token Pruning 的 HF Daily 标签归属问题

URL: inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(AI4AI Harness 8-14 #6 99▲ 主锚)+ inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(AI4AI ⭐⭐⭐)


增量 3 · 🔴 主线立标 ③ · arXiv:2608.07645 Mendel Gödel Machine(8-14 HF Daily #10 26▲ · paper_card 未建 P1 缺口 · cs.AI)——coding-agents 主轴候选级新增 = "通过比较演化实现递归自改进编码 Agent" = 编码 Agent 自进化方法论立基础锚第 3 件

来源: - inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(8-14 HF Daily #10 26▲ · 8-13 #12 22▲ → 8-14 +4▲ 微续立) - inbox/stephen/2026-08-14-ai-industry-e1prep.md(立标信号 22▲→26▲ +4▲ 微续立) - inbox/spark/2026-08-14-agent-e1prep.md(8-14 21:08 重写版 §3 沿用)

要点: - 核心方案:Mendel Gödel Machine = 通过比较演化实现递归自改进的代码 Agent = GGM 框架与达尔文式演化结合 · 通过比较演化压力驱动代码 Agent 递归自我改进 - 立标价值:v27 §1.45 Self-Evolving Coding Agents arXiv:2608.03392 第 25 栖 + Ouroboros 第 55 栖 直接邻接 = 编码 Agent 自进化方法论立基础锚第 3 件 - 论文标题与作者:Mendel Gödel Machine: Achieving Recursive Self-Improvement of Coding Agents via Comparative Evolution

与活文档 v27 §1.45 frontier lab × Harness / §2.5 训练范式 / §3.1 共识 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 55 栖 Ouroboros + 第 25 栖 Self-Evolving Coding Agents 2608.03392——v28 §1.45 frontier lab × Harness 第 74 栖候选新增(Mendel Gödel Machine) - v27 §2.5 Agent 训练范式 第 96-99 节点——v28 §2.5 第 102 节点候选新增(Mendel Gödel Machine = 通过比较演化实现递归自改进) - v27 §3.1 共识 92-101——v28 §3.1 共识 第 106 项候选新增(编码 Agent 自进化方法论立基础锚) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = Mendel Gödel Machine arXiv:2608.07645

建议归入: - v28 §1.45 frontier lab × Harness 第 74 栖候选新增(Mendel Gödel Machine) - v28 §2.5 第 102 节点候选新增(Mendel Gödel Machine = 通过比较演化实现递归自改进) - v28 §3.1 共识 第 106 项候选新增(编码 Agent 自进化方法论立基础锚) - v28 §6.1 必读清单 +1 = arXiv:2608.07645

立标等级: 🟢 沿用级(立标信号 26▲ 微续立 + 立标价值中 + paper_card 未建 P1 缺口 + 待 7 日窗口实测续立率再决定是否升级)

URL: inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(Mendel Gödel Machine 8-14 #10 26▲ 主锚)


增量 4 · 🟡 候选级新增 ① · arXiv:2608.11924 Spark-to-Paper(8-14 HF Daily #3 176▲ · paper_card 未建 P1 缺口 · cs.CL / cs.AI)——coding-agents 主轴邻接级新增 = "将研究论文端到端生成建模为可组合 Skill" = Agent Skill + Skill Library 压缩 + 自进化方法论三栖邻接

来源: - inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(8-14 HF Daily #3 176▲ · 8-14 新立 · 立标信号反弹) - inbox/stephen/2026-08-14-ai-industry-e1prep.md(8-14 新立候选级第 16 件) - inbox/spark/2026-08-14-agent-e1prep.md(8-14 21:08 重写版 §3 沿用)

要点: - 核心方案:Spark-to-Paper = 将研究论文端到端生成建模为可组合 Skill = 把研究论文写作工作流建模为可组合的 skill 序列 = SkillZip / SKILLER / SHAPER 邻接级同源 - 立标价值:v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + §2.165 Agent 基础设施 SkillZip / SKILLER / SHAPER 三件套 邻接 = "Agent Skill 可组合 + 研究论文端到端生成" 三栖立基础延展候选

与活文档 v27 §1.45 frontier lab × Harness / §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + 第 55 栖 Ouroboros——v28 §1.45 frontier lab × Harness 第 75 栖候选新增(Spark-to-Paper = Agent Skill 可组合研究论文生成) - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 34 件套(Spark-to-Paper 邻接级新增) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = Spark-to-Paper arXiv:2608.11924

建议归入: - v28 §1.45 frontier lab × Harness 第 75 栖候选新增(Spark-to-Paper) - v28 §2.165 Agent 基础设施 31 → 34 件套(Spark-to-Paper 邻接级新增) - v28 §6.1 必读清单 +1 = arXiv:2608.11924

立标等级: 🟢 候选级中档 ★(176▲ 立标信号高但立标价值中 + paper_card 未建 P1 缺口 + Agent Skill 邻接级三栖延展)

URL: inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(Spark-to-Paper 8-14 #3 176▲ 主锚)


增量 5 · 🟡 候选级新增 ② · arXiv:2608.12123 Ready Cohorts(paper_cards/930 · 8-14 主分类 agent method · cs.DC / cs.AI)——coding-agents 主轴邻接级新增 = "LLM-Agent 控制中的 GPU 机会界定 + Host 往返避免" = 编码 Agent 推理调度立基础延展候选

来源: - organized/paper_cards/930-2608-12123.md(8-14 落盘 · 主分类 agent · 形态 method) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(Ready Cohorts 候选 JSON #2 · 沿用) - work-queue.md §1 Top 15 backlog 0.5 分(待深度解读) - inbox/stephen/2026-08-14-ai-industry-e1prep.md(8 件 8-14 P1 缺口之一)

要点: - 核心方案:Ready Cohorts = LLM-agent 服务中重复执行小确定性转换(模型调用 + 工具调用 + 状态更新 + 下一效应)· 当 GPU 执行暴露足够并发工作时 + GPU-computed 路由决策保留在设备上时 = 用 fixed-partition share F / exact offline share P* / local upper bound U / online achieved share A 形式化 ready-cohort boundary · 零服务时间 + 无限容量 + 等相对启动截止日条件下 · 专门的动态规划计算 P* - 立标价值:v27 §2.94 KV Cache / Agent 推理调度 1 → 6 栖新增 + §2.165 Agent 基础设施 直接邻接 = "LLM-Agent 推理调度 GPU 机会界定 + Host 往返避免" 立基础延展候选 - 与 v27 §2.94 KV Cache / Agent 推理调度对比:v27 已有 WRP Workload-Router-Pool 三维协同调度(arXiv:2603.21354) · Ready Cohorts = 从 KV Cache 视角扩展到 LLM-Agent 控制路径 · 两者是不同维度但同源

与活文档 v27 §2.94 KV Cache / Agent 推理调度 / §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §2.94 KV Cache / Agent 推理调度 6 栖——v28 §2.94 6 → 7 栖新增(Ready Cohorts = LLM-Agent 推理调度 GPU 机会界定) - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 35 件套(Ready Cohorts 邻接级新增) - v27 §3.1 共识 92-101——v28 §3.1 共识 第 107 项候选新增(LLM-Agent 推理调度 GPU 机会界定) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = Ready Cohorts arXiv:2608.12123

建议归入: - v28 §2.94 KV Cache / Agent 推理调度 6 → 7 栖新增(Ready Cohorts) - v28 §2.165 Agent 基础设施 31 → 35 件套(Ready Cohorts 邻接级新增) - v28 §3.1 共识 第 107 项候选新增(LLM-Agent 推理调度 GPU 机会界定) - v28 §6.1 必读清单 +1 = arXiv:2608.12123 - v28 §6.1 URL 列表 +1 = paper_cards/930-2608-12123.md

立标等级: 🟡 候选级中-高档 ★★(方法学增量明确 = ready-cohort boundary 形式化 + dynamic program 精确计算 P* + LLM-Agent 推理调度 GPU 机会界定立基础锚)+ flyp 反方 6 项触发动作待 PDF §3 + §4 消融核验

URL: paper_cards/930-2608-12123.md(Ready Cohorts 主锚)+ work-queue.md §1 Top 15 backlog 0.5 分


增量 6 · 🟡 候选级新增 ③ · arXiv:2608.05604 SkillZip(paper_cards/934 · 8-14 主分类 agent method · 副 llm-infra · cs.LG / cs.AI)——coding-agents 主轴邻接级新增 = "面向可扩展 Agent Skill 库的保契约图压缩" = Agent Skill 库管理立基础延展候选

来源: - organized/paper_cards/934-2608-05604.md(8-14 落盘 · 主分类 agent · 形态 method · 副 llm-infra) - inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(8-14 HF Daily #8 72▲ · 8-14 新立 · 立标信号反弹) - inbox/stephen/2026-08-14-ai-industry-e1prep.md(8 件 8-14 P1 缺口之一 · work-queue §1 Top 15 backlog 0.5 分)

要点: - 核心方案:SkillZip = Contract-Preserving Graph Compression for Scalable Agent Skill Libraries · LLM Agent 的程序性知识存储在可复用 skill package · 加载于推理时间 · 随着 skill library 增长 · 核心挑战 = 在 context budget 限制下暴露最小充分可执行上下文 · 现有系统在 whole-skill level 以下复用、压缩时保持程序性契约、保持压缩例程可执行可扩展、更新随 skill 演化的压缩库等方面挣扎 · 核心洞见 = unit mismatch: skill 按 package 检索,压缩按 token 检索 - 立标价值:v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + §2.165 Agent 基础设施 邻接 = Agent Skill 库压缩方法论立基础延展候选 - 论文作者组与机构:(paper_card 未披露,需 8-15 早棒核验)

与活文档 v27 §1.45 frontier lab × Harness / §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + SkillZip / SKILLER / Spark-to-Paper / SHAPER 四件套——v28 §1.45 frontier lab × Harness 第 76 栖候选新增(SkillZip = Agent Skill 库保契约图压缩) - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 36 件套(SkillZip 邻接级新增) - v27 §3.1 共识 92-101——v28 §3.1 共识 第 108 项候选新增(Agent Skill 库管理立基础延展) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = SkillZip arXiv:2608.05604

建议归入: - v28 §1.45 frontier lab × Harness 第 76 栖候选新增(SkillZip) - v28 §2.165 Agent 基础设施 31 → 36 件套(SkillZip 邻接级新增) - v28 §3.1 共识 第 108 项候选新增(Agent Skill 库管理立基础延展) - v28 §6.1 必读清单 +1 = arXiv:2608.05604 - v28 §6.1 URL 列表 +1 = paper_cards/934-2608-05604.md

立标等级: 🟡 候选级中档 ★(72▲ 关注度中等 + 保契约图压缩方法学增量明确 + paper_card 已建 + 作者组待核验)

URL: paper_cards/934-2608-05604.md(SkillZip 主锚)+ inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(SkillZip 8-14 #8 72▲)


增量 7 · 🟡 候选级新增 ④ · arXiv:2608.10538 SKILLER(paper_cards/946 · 8-14 主分类 agent application · 副 llm-infra · cs.LG / cs.AI)——coding-agents 主轴邻接级新增 = "语言级 RL 提取可复用 Agent Skill for 小型 LM" = Agent Skill 提取方法论立基础延展候选

来源: - organized/paper_cards/946-2608-10538.md(8-14 落盘 · 主分类 agent · 形态 application · 副 llm-infra) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(SKILLER 候选 JSON #3 · 沿用 · 投票 1▲) - inbox/jay/2026-08-14T1130-jay-five-category-briefing.md(Alice Labs Top 10 Agent 框架沿用)

要点: - 核心方案:SKILLER = Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models · Agent skill = 程序性知识 + 领域专长的标准化格式 · 作为 agent harness 系统的基本机制 · 用于约束 LM 行为空间实现可重复高质量任务执行 · 但 strong closed-source models inference costs 高 · Codex / OpenClaw 等当前主流 agent harness 部署这些 skill 完成真实任务 prohibitively expensive · 核心方案 = 用 RL 从小型 LM 提取可复用 Agent Skill,消费级 GPU 可运行 - 立标价值:v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + §2.165 Agent 基础设施 邻接 = "Agent Skill 提取方法论 + 消费级 GPU 可运行" 立基础延展候选 - 🟢 重要边界:本棒 SKILLER 摘要提到 "current popular agent harnesses, such as Codex and OpenClaw" = stephen evening §6 已澄清 OpenClaw = Anan 的本地 OpenClaw AI agent runtime 实例,非 GitHub 开源项目(沿用 jay 8-14 0935 v2 修订)

与活文档 v27 §1.45 frontier lab × Harness / §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + SkillZip / SKILLER / Spark-to-Paper / SHAPER 四件套——v28 §1.45 frontier lab × Harness 第 77 栖候选新增(SKILLER = Agent Skill 提取方法论) - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 37 件套(SKILLER 邻接级新增) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = SKILLER arXiv:2608.10538

建议归入: - v28 §1.45 frontier lab × Harness 第 77 栖候选新增(SKILLER) - v28 §2.165 Agent 基础设施 31 → 37 件套(SKILLER 邻接级新增) - v28 §6.1 必读清单 +1 = arXiv:2608.10538 - v28 §6.1 URL 列表 +1 = paper_cards/946-2608-10538.md

立标等级: 🟢 候选级中-低档 ★(1▲ 立标信号弱 + paper_card 已建 + 消费级 GPU 可运行 = 工程落地性高但立标价值中)

URL: paper_cards/946-2608-10538.md(SKILLER 主锚)+ inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(SKILLER 投票 1▲)


增量 8 · 🟡 候选级新增 ⑤ · arXiv:2608.11350 SHAPER(paper_cards/931 · 8-14 主分类 agent method · 副 evaluation · cs.AI)——coding-agents 主轴邻接级新增 = "Self-Evolving Embodied Agents via Skill-Harness Evolution" = 自进化 Embodied Agent 邻接 coding-agents 主轴

来源: - organized/paper_cards/931-2608-11350.md(8-14 落盘 · 主分类 agent · 形态 method · 副 evaluation) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(SHAPER 候选 JSON 内含) - work-queue.md §1 Top 15 backlog 0.5 分 - inbox/spark/2026-08-14-agent-e1prep.md 8-13 evening 棒已立标级低档 ☆(8-14 21:08 重写版沿用)

要点: - 核心方案:SHAPER = Self-Evolving Framework for train-free embodied adaptation that keeps skills/harness co-evolving · Embodied agent = 围绕 foundation model 的系统(性能依赖 model weights + skills / context / action interfaces / execution harness)· 核心挑战 = supervised fine-tuning + RL 需要额外数据/奖励/训练轮次,train-free code-centric 依赖 programmable robot APIs(可能在 fixed-interface 设置中不可用) - 立标价值:v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + SkillZip / SKILLER / Spark-to-Paper / SHAPER 四件套 邻接 = Self-Evolving Embodied Agents 立基础延展候选

与活文档 v27 §1.45 frontier lab × Harness / §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness 第 25 栖 Self-Evolving Coding Agents + SkillZip / SKILLER / Spark-to-Paper / SHAPER 四件套——v28 §1.45 frontier lab × Harness 第 78 栖候选新增(SHAPER = Self-Evolving Embodied Agents via Skill-Harness Evolution) - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 38 件套(SHAPER 邻接级新增) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = SHAPER arXiv:2608.11350

建议归入: - v28 §1.45 frontier lab × Harness 第 78 栖候选新增(SHAPER) - v28 §2.165 Agent 基础设施 31 → 38 件套(SHAPER 邻接级新增) - v28 §6.1 必读清单 +1 = arXiv:2608.11350 - v28 §6.1 URL 列表 +1 = paper_cards/931-2608-11350.md

立标等级: 🟢 候选级中-低档 ★(spark 8-13 evening 立标级低档 ☆ 沿用 · 8-14 21:08 重写版沿用 · paper_card 已建)

URL: paper_cards/931-2608-11350.md(SHAPER 主锚)


增量 9 · 🟢 邻接级新增 ① · arXiv:2608.09805 Parameter Exploration for RLVR via Variational Learning(paper_cards/933 · 8-14 主分类 engineering method)——coding-agents 主轴邻接级新增 = "RLVR 参数空间探索 = 编码 Agent 后训练 RL 探索方法学"

来源: - organized/paper_cards/933-2608-09805.md(8-14 落盘 · 主分类 engineering · 形态 method) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(Parameter Exploration 候选 JSON 内含) - work-queue.md §1 Top 15 backlog 0.5 分

要点: - 核心方案:Parameter Exploration for RLVR via Variational Learning · 探索是 RL 研究长期焦点 · 近期证据表明探索也是 LLM RL 配方中的重要成分,可显著影响下游性能 · 现有方法控制 action-space 探索(如 temperature scaling)· 但这些方法不能 reorder tokens,只能影响输出分布的方差 · 这限制了探索,可能导致 divergence 或 stalled training · 核心方案 = parameter-space exploration,其中 rollouts 来自参数扰动而非 token-level - 立标价值:v27 §2.5 Agent 训练范式 第 96-99 节点 邻接 = RLVR 编码 Agent 后训练 RL 探索方法学立基础延展候选

与活文档 v27 §2.5 训练范式 / §6.1 必读清单的关系: - v27 §2.5 Agent 训练范式 第 96-99 节点——v28 §2.5 第 103 节点候选新增(Parameter Exploration RLVR = 编码 Agent 后训练 RL 探索方法学) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = Parameter Exploration RLVR arXiv:2608.09805

建议归入: - v28 §2.5 第 103 节点候选新增(Parameter Exploration RLVR) - v28 §6.1 必读清单 +1 = arXiv:2608.09805

立标等级: 🟢 沿用级(work-queue §1 Top 15 backlog 0.5 分 + 立标价值待评估 + paper_card 已建 + 待 7 日窗口实测续立率再决定是否升级)

URL: paper_cards/933-2608-09805.md(Parameter Exploration 主锚)


增量 10 · 🟢 邻接级新增 ② · arXiv:2608.06270 Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images(paper_cards/927 · 8-14 主分类 agent method · 副 llm-infra)——coding-agents 主轴邻接级新增 = "thinking-with-images 范式因果审计"

来源: - organized/paper_cards/927-2608-06270.md(8-14 落盘 · 主分类 agent · 形态 method · 副 llm-infra) - inbox/flyp/2026-08-14-risk-e1prep.md(8-14 16:30 flyp 风险 e1prep 沿用)

要点: - 核心方案:"thinking-with-images" 范式 = 多模态 LLMs 装备主动视觉操作(crop-and-zoom)· 但使用这些操作的模型通常仅相对直接推理获得边际/负面增益 · 可能反复 crop 不相关区域,在直接推理能正确回答的问题上失败 · 核心问题 = 返回的视觉证据是否因果影响答案? · 形式化 visual tool-use 为因果图,分离 observation-mediated paths 与 action-induced shortcuts - 立标价值:v27 §2.165 Agent 基础设施 邻接 = 多模态 Agent 视觉工具使用因审计立基础延展候选

与活文档 v27 §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 39 件套(Illusion of Visual Tool-Use 邻接级新增) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = Illusion of Visual Tool-Use arXiv:2608.06270

建议归入: - v28 §2.165 Agent 基础设施 31 → 39 件套(Illusion of Visual Tool-Use) - v28 §6.1 必读清单 +1 = arXiv:2608.06270

立标等级: 🟢 沿用级(立标价值待评估 + paper_card 已建 + 待 7 日窗口实测续立率再决定是否升级)

URL: paper_cards/927-2608-06270.md(Illusion of Visual Tool-Use 主锚)


增量 11 · 🟢 邻接级新增 ③ · arXiv:2608.11632 Beyond Memory / Transactional Continuity Kernel(paper_cards/921 · 8-14 沿用 · 主分类 agent method)——coding-agents 主轴候选级新增第 100 节点 = 长生命周期 Agent 状态治理事务型控制平面 = v27 8-13 evening 棒已立 + 8-14 沿用

来源: - organized/paper_cards/921-2608-11632.md(8-13 落盘 · 主分类 agent · 形态 method) - inbox/flyp/2026-08-13-1550-Beyond-Memory-Transactional-Continuity-Kernel-critical-read.md(8-13 15:52 flyp 13KB critical-read = 立标级候选级中-高档 ★★ 附实证评估缺口反方) - inbox/tom/2026-08-13T1440-agent-rag-longcontext-radar.md(8-13 午场 radar ⭐⭐⭐) - inbox/tom/2026-08-13T2040-agent-rag-longcontext-radar.md v2 重写(8-13 晚场 radar ⭐⭐⭐) - inbox/stephen/2026-08-13-llm-application-e1prep.md(160KB §0 综述 = 立基础延展候选) - inbox/stephen/2026-08-13-2245-stephen-coordination-check-evening.md(🔴 P0 事件 Continunity Kernel = Memory/State 治理新立基础延展候选) - inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md(8-14 12:45 沿用) - inbox/jay/2026-08-14-database-e1prep.md(8-14 20:23 沿用 ⭐⭐⭐) - inbox/flyp/2026-08-14-risk-e1prep.md(8-14 16:30 Continunity Kernel 状态激活/权限控制 ⭐⭐⭐⭐)

要点: - 核心贡献(8-13 flyp 1550 critical-read + 8-14 沿用):长生命周期 agent 积累跨长时间跨度的"版本化状态" · "仅存储保留 ≠ 权威状态识别" · 非中介化写入带来 3 类故障 = stale overwrite + un-audited exposures + self-authorizing privilege escalation · Continuity Kernel (CK) 激活合约 · bounded executable model 验证 2.8M states + 5.5M transitions 零不变量违反 · Commit / Reject / Quarantine / Defer 四态 disposition - 立标等级:🟡 候选级中-高档 ★★(假设原创抽象 typed absence / disposition 四态成立)+ flyp 反方 6 项:① 实证评估缺口 ② 事务型控制平面是否真新 ③ 作者背景独立双人组 ④ bounded model 可信度 ⑤ 跨编码 Agent 系统适用性 ⑥ calibration gap - 8-14 沿用价值:v27 8-13 evening 棒已立 · v28 §1.45 frontier lab × Harness 第 71 栖候选新增 · v28 §2.5 第 100 节点候选新增 · v28 §2.165 Agent 基础设施 31 → 32 件套 · v28 §3.1 共识 第 102 项候选新增 · v28 §3.2 争议 第 65 项候选新增 · v28 §4 开放问题 第 127 项候选新增 · v28 §5 趋势 第 77 项候选新增 · v28 §6.1 必读清单 +1 = 9 节位全部就位,v28 接力棒沿用即可无需新增归入

与活文档 v27 现有脉络的关系:(详见 8-13 flyp 1550 critical-read §要点)

建议归入: - v28 §1.45 frontier lab × Harness 第 71 栖候选新增(沿用 8-13) - v28 §2.5 第 100 节点候选新增(沿用 8-13) - v28 §2.165 Agent 基础设施 31 → 32 件套(沿用 8-13) - v28 §3.1 共识 第 102 项候选新增(沿用 8-13) - v28 §3.2 争议 第 65 项候选新增(沿用 8-13) - v28 §4 开放问题 第 127 项候选新增(沿用 8-13) - v28 §5 趋势 第 77 项候选新增(沿用 8-13) - v28 §6.1 必读清单 +1 = Beyond Memory arXiv:2608.11632(沿用 8-13) - v28 §6.1 URL 列表 +1(沿用 8-13) = paper_cards/921-2608-11632.md

立标等级: 🟡 候选级中-高档 ★★(沿用 8-13)

URL: paper_cards/921-2608-11632.md(Beyond Memory 主锚)+ inbox/flyp/2026-08-13-1550-Beyond-Memory-Transactional-Continuity-Kernel-critical-read.md(8-13 1550 critical-read)


增量 12 · 🟢 邻接级新增 ④ · arXiv:2608.08160 Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives(paper_cards/925 · 8-14 主分类 evaluation benchmark · 副 agent)——coding-agents 主轴邻接级新增 = "交互式叙事长期一致性 benchmark = Narrative Commitment Preservation (NCP)"

来源: - organized/paper_cards/925-2608-08160.md(8-14 落盘 · 主分类 evaluation · 形态 benchmark · 副 agent) - inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(8-14 HF Daily #11 25▲ · 8-14 新立) - inbox/tom/2026-08-14-evaluation-e1prep.md(8-14 15:40 第 3 件确认增量) - inbox/flyp/2026-08-14-risk-e1prep.md(8-14 16:30 Can LLM Agents Stick to the Script 叙事一致性 ⭐⭐) - inbox/jay/2026-08-14T2105-jay-five-category-evening-briefing.md(8-14 21:05 长叙事一致性基准沿用)

要点: - 核心方案:NCP-Bench = interactive narrative 中 long-horizon logical consistency + narrative integrity 基准测试 · 100 narrative environments derived from movie synopses · 涉及 character/plot/context memory 长期一致性 · 评测 open-ended and fluid interactive storytelling - 立标价值:v27 §2.3 评测基础设施分层 邻接 = 长程行为一致性 benchmark 立基础延展候选(与 VibeLifeBench arXiv:2608.10875 长程生活 Agent 评测形成"长程行为一致性 + 长程生活 Agent"双件套)

与活文档 v27 §2.3 评测基础设施 / §6.1 必读清单的关系: - v27 §2.3 评测基础设施分层——v28 §2.3 长程行为一致性 benchmark 候选新增(NCP-Bench) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = NCP-Bench arXiv:2608.08160

建议归入: - v28 §2.3 长程行为一致性 benchmark 候选新增(NCP-Bench) - v28 §6.1 必读清单 +1 = arXiv:2608.08160

立标等级: 🟢 沿用级(25▲ 立标信号弱 + paper_card 已建 + 评测方法学待验证 ·)

URL: paper_cards/925-2608-08160.md(NCP-Bench 主锚)


增量 13 · 🟢 邻接级新增 ⑤ · Agentic Search 替代 RAG 范式转变(6 个主流 AI 编码 Agent 全部放弃向量索引)——coding-agents 主轴行业级方法学变更 = 编码 Agent 检索范式从"向量索引"到"工具检索 + 文件系统检索"

来源: - inbox/jay/2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md 20KB ⭐⭐⭐⭐ · 8-14 09:35 - inbox/spark/2026-08-14-agent-e1prep.md ⭐⭐⭐⭐ · 8-14 21:08 重写版增量 1 - inbox/stephen/2026-08-14-ai-industry-e1prep.md 增量 6 - inbox/stephen/2026-08-14-llm-application-e1prep.md 增量 2 🔴 P0 - inbox/tom/2026-08-14-rag-e1prep.md(8-14 08:52 间接命中) - inbox/jay/2026-08-14-database-e1prep.md(8-14 20:23 Agentic Search vs VecDB 替代论证) - inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md ⭐⭐⭐⭐⭐ · 8-14 17:35

要点: - 🔴 ⭐⭐⭐⭐ 核心信号:向量搜索正在被 Agentic Search 替代(2026 年 RAG 架构方向最重要的范式转变)· 6 个主流 AI 编码 Agent 全部放弃向量索引(Claude Code / Cursor Codemaps / Windsurf SWE-1.5 / Devin / Sourcegraph Amp / Cline)→ 转向 agent 自驱的关键词检索 + 文件系统检索 + 工具组合检索 - 关键论文支撑:arXiv:2602.23368(Subramanian et al., "Keyword Search Is All You Need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use", AAAI 2026 · 94.5% RAG 保真度 · RAG baseline 1.96% → SWE-agent 12.47% = 6× 提升)· arXiv:2503.09516(Search-R1 RL 训练检索策略 7 数据集平均 24% 相对提升)· arXiv:2603.07670v1(Memory for Autonomous LLM Agents 综述)· arXiv:2605.19743v1(EngiAI Multi-Agent 工程领域专项基准)· arXiv:2501.09136v4(Agentic RAG Survey 综述) - 行业级数据:LangChain State of Agent Engineering Survey 2026(2026-06-12):72.6% 组织已有生产 agent(事实修正:stephen evening §0 已核查应为 57% 整体生产采纳 vs 去年 51% + 89% 整体可观测性 + 71.5% 完整链路追踪 + 62% 完整 tracing)· HF August 2026 更新(Foundry Model Catalog 集成 HF Collection + Microsoft Foundry Managed Compute × HF + Gemma 4 + Qwen 3.5)· MCP 生态 2026 中期 97M 月度 SDK 下载量 + OpenAI 弃用 proprietary Assistants API 全面转向 MCP + Linux Foundation 接管 MCP 治理 · Karpathy nanochat 55k stars · AI Agents Stack 2026 六层架构(The AI Engineer Issue #7 · L1 Models / L2 Memory / L3 Tools / L4 Orchestration / L5 Evaluation / L6 Deployment · L5 Eval 三大新 benchmark = Context-Bench + Recovery-Bench + Terminal-Bench 编码 Agent)· Microsoft Agent Framework 1.0(2026-04 · Semantic Kernel + AutoGen 统一)· Alice Labs Top 10 Agent 框架评分 2026-08(LangGraph 9/10 + Claude Agent SDK 9/10 双头 + Microsoft Agent Framework 1.0 + MLflow Agent 平台)

与活文档 v27 §1.45 frontier lab × Harness / §2.165 Agent 基础设施 / §3.1 共识 / §6.1 必读清单的关系: - v27 §1.45 frontier lab × Harness——v28 §1.45 frontier lab × Harness Agentic Search 范式转变段新增(6 个主流 AI 编码 Agent) - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 40 件套(Agentic Search 范式转变 + Agent Memory 综述 + LangChain Survey + MCP 97M + Karpathy nanochat + Foundry Managed Compute + Gemma 4 + Qwen 3.5 + MMORE + EngiAI = 10 件邻接级新增) - v27 §3.1 共识 92-101——v28 §3.1 共识 第 109 项候选新增(Agentic Search 替代 RAG = 编码 Agent 检索范式转变) - v27 §3.2 争议 57-64——v28 §3.2 争议 第 67 项候选新增(RAG vs Agentic Search 边界 = 单一代码库 vs 多模态 vs 大规模 vs 多租户) - v27 §4 开放问题 117-126——v28 §4 开放问题 第 128 项候选新增(Agentic Search 跨 6 任务族 benchmark 验证) - v27 §5 趋势 67-76——v28 §5 趋势 第 79 项候选新增(Agentic Search = 编码 Agent 行业级范式转变) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = arXiv:2602.23368(AAAI 2026 Keyword Search Is All You Need) - v27 §6.1 URL 列表 +7** = arXiv:2602.23368 + arXiv:2503.09516 + arXiv:2603.07670v1 + arXiv:2605.19743v1 + arXiv:2501.09136v4 + LangChain State of Agent Engineering Survey 2026 + buzzgrewal.medium.com + vinitshahdeo.substack.com

建议归入: - v28 §1.45 frontier lab × Harness Agentic Search 范式转变段新增 - v28 §2.165 Agent 基础设施 31 → 40 件套(Agentic Search + Agent Memory + LangChain Survey + MCP + Karpathy + Foundry Managed Compute + Gemma 4 + Qwen 3.5 + MMORE + EngiAI) - v28 §3.1 共识 第 109 项候选新增 - v28 §3.2 争议 第 67 项候选新增 - v28 §4 开放问题 第 128 项候选新增 - v28 §5 趋势 第 79 项候选新增 - v28 §6.1 必读清单 +1 - v28 §6.1 URL 列表 +7

立标等级: 🟢 🟢 行业级方法学变更(沿用级 · 但编码 Agent 行业级范式转变 = 立基础延展 · 跨 6 主流 AI 编码 Agent + 行业级 Newsletter)

URL: inbox/jay/2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md(⭐⭐⭐⭐ 主消化)+ inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md(⭐⭐⭐⭐⭐ AI Agents Stack 2026 六层架构)


增量 14 · 🔴 警示 ① · 🟡 立标机制沿用 = 立标信号强度 ≠ 立标等级评估双维度区分首次机制化(v33 以来首次)+ 立标池双向锚 24h 窗口实测第 1 例(OpenART 反弹 + BDH-CQ 衰减 + Latent-to-4D 续立加强)

来源: - inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(BDH-CQ 跌出 top 15 = 立标信号瞬时峰值衰减锚第 1 例) - inbox/flyp/2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md v2 覆盖版(8-13 21:32 flyp v2 critical-read 已撤销 v1 24 小时不当跳档 ★★ → ☆ 立标等级沿用"立标级低档 ☆") - inbox/flyp/2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md(8-14 0950 = 立标等级修正方法学延革第 2-3 例) - inbox/flyp/2026-08-14-1550-Mechanist-AI-as-scientific-instrument-critical-read.md(8-14 1550 = 立标等级修正方法学延革第 4 例) - inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md(🔴 P0 BDH-CQ 跌出 + OpenART 反弹 + Latent-to-4D 续立加强 + §4 七向判定 → 八向判定 + 立标池双向锚 v33 以来首次) - inbox/stephen/2026-08-14-ai-industry-e1prep.md §1 增量 1 + §2.1 + §2.4 + §2.7 + §2.8 - inbox/stephen/2026-08-14-llm-application-e1prep.md §0.1 净增量 1 + 增量 1

要点: - 🔴 立标信号强度演化:BDH-CQ 8-12 243▲ → 8-13 553▲ = +310 票 v33 以来立标信号绝对新高 → 8-14 跌出 top 15 = 24h 信号归零 = 立标信号瞬时峰值衰减锚 v33 以来首次 + 🟡 OpenART 8-13 跌出 → 8-14 #1 184▲ = 立标信号瞬时峰值反弹 24h 窗口实测第 1 例 + 🟡 Latent-to-4D 108▲ → 171▲ = 立标信号续立加强 +58.3% = 立标池双向锚 v33 以来首次机制化 - 🔴 立标等级评估方法学延革第 2-4 例:flyp 8-14 0950 = StateFlow +1 档 ★★ → ★★★ + Latent-to-4D +0.5 档 ★★ → ★★ 偏上 + flyp 8-14 1550 = Mechanist +1 档 ★ → ★★ 中档偏上(沿用 flyp 8-13 21:32 BDH-CQ v2 critical-read 立标等级 ☆ 沿用 = 立标等级修正方法学第 1 例) - 🔴 v28 §3.2 必须升级"立标信号强度 ≠ 立标等级评估"双维度区分首次机制化(v33 以来首次)+ v28 §4 七向判定 → 八向判定(v47 七向 + ⑪ + ⑫ + ⑬ 项 = 八向) - 🟡 flyp 反方警示:spark 8-14 重写版预警"立标信号双向锚"作为机制需更多窗口验证 = flyp 8-14 0950 + 1550 立标等级修正与 spark 重写版"作为机制需 7 日窗口验证"= 实操层不冲突 · spark 重写版把"立标信号强度 ≠ 立标等级评估"作为概念保留 = 跨实例闭环(stephen evening §2.2)

与活文档 v27 §3.2 争议 57-64 / §4 开放问题 117-126 / §5 趋势 67-76 / §6.1 必读清单的关系: - v27 §3.2 争议 57-64——v28 §3.2 争议 第 68 项候选新增(立标信号强度 ≠ 立标等级评估双维度区分首次机制化 v33 以来首次) - v27 §3.2 争议 Q105.60——v28 §3.2 争议 Q105.61 升级 = 立标信号强度 vs 立标等级判定 维度区分 v28 候选新增 - v27 §3.2 争议——v28 §3.2 ⑬ 项候选新增 = 立标信号双向锚 24h 窗口实测第 1 例(OpenART 184▲ 反弹 + BDH-CQ 跌出 + Latent-to-4D 171▲ 续立加强 = 三向并存) - v27 §4 开放问题 117-126——v28 §4 开放问题 第 129 项候选新增(立标池双向锚 7 日滑动窗口验证) - v27 §5 趋势 67-76——v28 §5 趋势 第 80 项候选新增(立标信号瞬时峰值衰减锚 v33 以来首次) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +3(BDH-CQ arXiv:2608.09888 + OpenART arXiv:2608.00677 + Latent-to-4D arXiv:2608.10744)

建议归入: - v28 §3.2 争议 第 68 项候选新增(立标信号强度 ≠ 立标等级评估) - v28 §3.2 争议 Q105.61 升级 - v28 §3.2 ⑬ 项候选新增(立标信号双向锚) - v28 §4 开放问题 第 129 项候选新增 - v28 §5 趋势 第 80 项候选新增 - v28 §6.1 必读清单 +3

立标等级: 🔴 🟡 警示级(立标机制 v33 以来首次升级 · 跨实例 5 实例一致)

URL: inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md(🔴 P0 BDH-CQ 跌出 主锚)+ inbox/flyp/2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md v2 覆盖版(8-13 21:32 立标等级 ☆ 沿用主锚)


增量 15 · 🔴 警示 ② · 🔴 2 处 P0 事实错误(沿用 stephen evening §0)

来源: - inbox/stephen/2026-08-14-2245-stephen-coordination-check-evening.md §0(8-14 22:45 协调棒 §0 速览结论) - inbox/stephen/2026-08-14-llm-application-e1prep.md(8-14 21:15 llm-application 主消化 §2 风险与待核实 ⑦ 沿用)

要点: - 🔴 1 处:LangChain 72.6% vs 实际 57% 数字硬错(跨实例 5 文件登记:spark 8-14 agent-e1prep 增量 4 + §3.5 + §五.1 + §六 + jay 8-14 0935 + 沿用 8-13 noon 棒 §6.2 + 8-14 noon 棒 §4.5)= 经核查 LangChain 官方页 2026-06-12 State of Agent Engineering n=1,340 实际数字应为 57% 整体生产采纳(vs 去年 51%)+ 89% 整体可观测性 + 71.5% 完整链路追踪(仅在已有生产 agent 团队中)+ 62% 完整 tracing = "72.6%" 在所有公开来源中找不到出处 - 🔴 2 处:StateFlow 作者组机构 5 处事实错误(flyp 8-14 0950 v48-candidate-audit + ai-industry-e1prep 沿用:写"北大 + 智源 + 字节 + Salesforce"= 实际为 北交大 + Mootion AI + 北师大 + 北大 + BAAI · 字节 / Salesforce 缺失;Mootion AI / 北师大 / BAAI 缺失 · 经 Tom 8-14 14:40 review 核验)

与活文档 v27 §3.2 争议 / §3.3 反方 / §4 开放问题 / §6.1 必读清单的关系: - v27 §3.3 反方 96-112——v28 §3.3 反方 #113 候选新增(LangChain 数字硬错 = 跨实例 5 文件登记 = 反思棒物理动作第 23 天连续触发) - v27 §3.3 反方 96-112——v28 §3.3 反方 #114 候选新增(StateFlow 作者组机构 5 处事实错误 = Tom 8-14 14:40 review 核验) - v27 §4 开放问题 117-126——v28 §4 开放问题 第 130 项候选新增(行业级数据跨文件核验机制) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 URL 修订 = LangChain State of Agent Engineering Survey 2026(数字口径修订为 57%)+ StateFlow arXiv:2608.12314(作者组修订为北交大 + Mootion AI + 北师大 + 北大 + BAAI)

建议归入: - v28 §3.3 反方 #113 候选新增(LangChain 数字硬错) - v28 §3.3 反方 #114 候选新增(StateFlow 作者组机构 5 处事实错误) - v28 §4 开放问题 第 130 项候选新增(行业级数据跨文件核验机制) - v28 §6.1 URL 修订(LangChain + StateFlow)

立标等级: 🔴 🔴 P0 警示级(跨实例 5 实例 + 2 处事实错误 · 触发跨实例修订)

URL: inbox/stephen/2026-08-14-2245-stephen-coordination-check-evening.md §0(stephen evening P0 事实错误主锚)+ inbox/stephen/2026-08-14-llm-application-e1prep.md §2 风险与待核实 ⑦(沿用警示)


增量 16 · 🟡 警示 ③ · 🟡 paper_card P1 缺口累积 23 件(coding-agents 主轴 7 件 + 邻接 16 件)

来源: - inbox/stephen/2026-08-14-2245-stephen-coordination-check-evening.md §0(8-14 22:45 协调棒 paper_card P1 缺口累积 23 件) - inbox/stephen/2026-08-14-ai-industry-e1prep.md §2.3 paper_cards P1 缺口累积 22 件(沿用) - work-queue.md §5 富化缺口 15 张待 cron_s2 覆盖

要点: - coding-agents 主轴 8-14 P1 缺口 7 件:arXiv:2608.12307 AI4AI Harness + arXiv:2608.07645 Mendel Gödel Machine + arXiv:2608.11924 Spark-to-Paper + arXiv:2608.12314 StateFlow + arXiv:2608.10720 Ex-Omni-2D + arXiv:2608.10299 Agentic Co-Evolution + arXiv:2608.10875 VibeLifeBench = 7 件 net-new 8-14 未建 - coding-agents 主轴邻接 8-14 P1 缺口 16 件:arXiv:2608.12036 Mechanist + arXiv:2608.08160 NCP-Bench(已建 925 但飞 p risk 沿用提示需核实)+ arXiv:2608.10744 Latent-to-4D + arXiv:2608.11205 AdvFD + arXiv:2602.23368 Keyword Search is All You Need(AAAI 2026 沿用 v44 §2.188)+ arXiv:2603.07670v1 Memory for Autonomous LLM Agents + arXiv:2605.19743v1 EngiAI Multi-Agent + arXiv:2501.09136v4 Agentic RAG Survey + arXiv:2608.01526 Rethinking Classical Infrastructure Boundaries(PIM-DIMM 替代锚)+ arXiv:2603.20397 KV Cache 五大优化策略(PIM-DIMM 替代锚 · 已建沿用)+ arXiv:2608.12218 Information Abundance Paradox + arXiv:2608.12149 混合线性注意力 + arXiv:2608.12278 结构性沉默 + arXiv:2608.09867 Stealing Reasoning Traces(已建 878)+ arXiv:2608.08814 360CityArena(已建 911 · 主分类 cs.CV 修正)+ arXiv:2608.00677 OpenART(已建 928) - 风险:立标池饱和度供给侧枯竭 v44-v49(8-14 算 v49 起算)六日连续 + paper_card P1 缺口累积 = v28 §2.165 Agent 基础设施立基础延展前必须先补建 paper_card

与活文档 v27 §2.165 Agent 基础设施 / §6.1 必读清单 / §6.1 URL 列表的关系: - v27 §2.165 Agent 基础设施 31 → 40 件套(v28 升级目标)= v28 §6.1 URL 列表 + paper_card 必建清单更新 = coding-agents 主轴 7 件 + 邻接 16 件 = 23 件 paper_card 必建(沿用 stephen evening §0)

建议归入: - v28 §6.1 URL 列表 + paper_card 必建清单更新 = coding-agents 主轴 7 件 + 邻接 16 件 = 23 件 - work-queue.md §1 Top 15 backlog 优先建卡 = arXiv:2608.12307 AI4AI Harness + arXiv:2608.07645 Mendel Gödel Machine + arXiv:2608.11924 Spark-to-Paper + arXiv:2608.12314 StateFlow + arXiv:2608.10720 Ex-Omni-2D + arXiv:2608.10299 Agentic Co-Evolution + arXiv:2608.10875 VibeLifeBench

立标等级: 🟡 🟡 P1 警示级(paper_card P1 缺口累积 23 件 · 立标池饱和度供给侧枯竭)

URL: inbox/stephen/2026-08-14-2245-stephen-coordination-check-evening.md §0(paper_card P1 缺口累积 23 件主锚)+ work-queue.md §1 Top 15 backlog 优先建卡


增量 17 · 🟡 警示 ④ · 🔴 LangChain "72.6%" 数字硬错(跨实例 5 文件登记 + spark 8-14 触发修订)

来源:(同增量 15 + stephen evening §0 + spark 8-14 重写版增量 4)

要点: - 🔴 LangChain "72.6%" 数字硬错:跨实例 5 文件登记:spark 8-14 agent-e1prep 增量 4 + §3.5 + §五.1 + §六 + jay 8-14 0935 + 沿用 8-13 noon 棒 §6.2 + 8-14 noon 棒 §4.5 = 经核查 LangChain 官方页 2026-06-12 State of Agent Engineering n=1,340 实际数字应为 57% 整体生产采纳(vs 去年 51%)+ 89% 整体可观测性 + 71.5% 完整链路追踪(仅在已有生产 agent 团队中)+ 62% 完整 tracing = "72.6%" 在所有公开来源中找不到出处 - 触发动作:v28 §6.1 URL 列表修订 = LangChain State of Agent Engineering Survey 2026(数字口径修订为 57%)+ coding-agents 主轴立基础延展前必须先修订 5 文件数字

建议归入: - v28 §6.1 URL 列表修订(LangChain 数字 72.6% → 57%) - coding-agents 主轴 8-15 早棒跨实例修订动作清单

立标等级: 🟡 🔴 警示级

URL: inbox/spark/2026-08-14-agent-e1prep.md(spark 8-14 21:08 重写版 P0 事实错误主锚)+ inbox/jay/2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md(jay 8-14 0935 数字硬错主锚)


增量 18 · 🟢 邻接级新增 ⑥ · arXiv:2608.06867 LLMRouter(paper_cards/947 · 8-14 主分类 evaluation application)——coding-agents 主轴邻接级新增 = "统一 LLM 路由基础设施" = 编码 Agent 推理优化立基础延展候选

来源: - organized/paper_cards/947-2608-06867.md(8-14 落盘 · 主分类 evaluation · 形态 application) - inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md v2 重写(LLMRouter 候选 JSON 外塌方 · 沿用)

要点: - 核心方案:LLMRouter = Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers · 没有单一 LLM 在所有 queries + budget constraints 上最优 · 模型路由对成本有效部署至关重要 · 现有路由采用多样化的 formulations 和 implementations · 提出 5 组件顺序决策过程统一 LLM 路由 = context encoders + model encoders + scoring functions + decision rules + learning signals - 立标价值:v27 §2.165 Agent 基础设施 + §2.165 推理优化 邻接 = "LLM 路由统一基础设施" 立基础延展候选

与活文档 v27 §2.165 Agent 基础设施 / §6.1 必读清单的关系: - v27 §2.165 Agent 基础设施 31 → 33 件套——v28 §2.165 31 → 41 件套(LLMRouter 邻接级新增) - v27 §6.1 必读清单 277 件——v28 §6.1 必读清单 +1 = LLMRouter arXiv:2608.06867

建议归入: - v28 §2.165 Agent 基础设施 31 → 41 件套(LLMRouter) - v28 §6.1 必读清单 +1 = arXiv:2608.06867

立标等级: 🟢 沿用级(paper_card 已建 + 立标价值中 + 待 7 日窗口实测续立率再决定是否升级)

URL: paper_cards/947-2608-06867.md(LLMRouter 主锚)


增量 19 · 🟢 邻接级新增 ⑦ · arXiv:2608.10450 + 2608.12307 + 2608.07645 + 2608.11924 + 2608.12123 + 2608.05604 + 2608.10538 + 2608.11350 + 2608.09805 + 2608.06270 + 2608.08160 + 2608.06867 = coding-agents 主轴邻接级新增 12 件总计

说明: 本棒 §一 增量 1-12 + 18 已逐条详述,本条为综合统计coding-agents 主轴邻接级新增总计 12 件(包括主线立标 3 件 = 增量 1 Genesis + 增量 2 AI4AI Harness + 增量 3 Mendel Gödel Machine + 候选级新增 5 件 = 增量 4 Spark-to-Paper + 增量 5 Ready Cohorts + 增量 6 SkillZip + 增量 7 SKILLER + 增量 8 SHAPER + 沿用级 4 件 = 增量 9 Parameter Exploration RLVR + 增量 10 Illusion of Visual Tool-Use + 增量 11 Beyond Memory + 增量 12 NCP-Bench + 增量 18 LLMRouter)。

立标等级总计: - 主线立标 3 件:🔴 Genesis ★★ · 🔴 AI4AI Harness ★(待 arXiv ID 核验)· 🔴 Mendel Gödel Machine ★ - 候选级新增 5 件:🟡 Spark-to-Paper ★ · 🟡 Ready Cohorts ★★ · 🟡 SkillZip ★ · 🟡 SKILLER ★ · 🟡 SHAPER ★ - 沿用级 4 件:🟢 Parameter Exploration RLVR · 🟢 Illusion of Visual Tool-Use · 🟢 Beyond Memory · 🟢 NCP-Bench - 邻接级新增 1 件:🟢 LLMRouter


二、值得警惕的矛盾或待核实说法

2.1 🔴 2 处 P0 事实错误(沿用 stephen evening §0)

  1. LangChain "72.6%" 数字硬错 = 经核查 LangChain 官方页 2026-06-12 State of Agent Engineering n=1,340 实际数字应为 57% 整体生产采纳(vs 去年 51%)+ 89% 整体可观测性 + 71.5% 完整链路追踪(仅在已有生产 agent 团队中)+ 62% 完整 tracing = "72.6%" 在所有公开来源中找不到出处 = 跨实例 5 文件登记触发修订
  2. StateFlow 作者组机构 5 处事实错误 = flyp 8-14 0950 沿用"北大 + 智源 + 字节 + Salesforce"= 实际为 北交大 + Mootion AI + 北师大 + 北大 + BAAI · 字节 / Salesforce 缺失;Mootion AI / 北师大 / BAAI 缺失 = Tom 8-14 14:40 review 核验

2.2 🟡 AI4AI Harness arXiv ID 与 HF Daily 收录内容不一致警示

arXiv:2608.12307 vs arXiv:2608.07193 paper_cards/948 AI4AI Visual Token Pruning 的 HF Daily 标签归属问题 = 8-15 早棒独立核验 · flyp risk-e1prep 8-14 16:30 已引用 = 但 jay 8-14 0935 摘要提到 arXiv:2602.23368 + 2603.07670 + 2605.19743 三件 ⚠️ ID 待核验

2.3 🟡 立标池双向锚 v33 以来首次机制化争议

spark 8-14 21:08 重写版预警"立标信号双向锚"作为机制需更多窗口验证 = flyp 8-14 0950 + 1550 立标等级修正与 spark 重写版"作为机制需 7 日窗口验证"= 实操层不冲突 · spark 重写版把"立标信号强度 ≠ 立标等级评估"作为概念保留 = 跨实例闭环(stephen evening §2.2)

2.4 🟡 Beyond Memory 实证评估缺口警示

2.8M states + 5.5M transitions "零不变量违反"仅限特定 bounded model = 网络分区 + 重连 race + 工具并发 + 恢复过程可能不在模型内 = 跨编码 Agent 系统适用性待验 = flyp 反方 6 项待核实(8-13 1550 critical-read)

2.5 🟡 OpenART 184▲ 瞬时反弹 ≠ 持续上升

8-13 跌出 top 15 → 8-14 #1 = 立标信号瞬时峰值反弹 24h 窗口实测第 1 例 = 不能写成持续上升或已完成 7 日验证 = 8-21 7 日窗口滑动实测后再定档

2.6 🟡 Mechanist 立标等级修正争议

flyp 8-14 1550 立标等级 ★ → ★★ 中档偏上(spark 8-14 agent-e1prep 初判 ★ 与本棒判断需修正)= "个人评级 vs 公开同行评审"可重复性争议 = 需 8-15 早棒 7 日窗口实测续立率再决定是否升级

2.7 🟡 paper_card P1 缺口累积 23 件

coding-agents 主轴 8-14 P1 缺口 7 件 + coding-agents 主轴邻接 8-14 P1 缺口 16 件 = 立标池饱和度供给侧枯竭 v44-v49(8-14 算 v49 起算)六日连续 = v28 §2.165 Agent 基础设施立基础延展前必须先补建 paper_card

2.8 🟡 Mendel's Gödel Machine 沿用级 vs 立标级低档争议

spark 8-13 evening 已立标级低档 ☆ = 8-14 21:08 重写版沿用 = 但 work-queue §1 Top 15 backlog 0.5 分 = 待 7 日窗口实测续立率再决定是否升级

2.9 🟡 Beyond Memory Continuity Kernel vs Genesis / EvoX 同源邻接协调

两者都是 coding-agents 主轴长生命周期基础设施,但关注层不同:Continuity Kernel 解决"agent 状态治理事务型控制平面";Genesis / EvoX 解决"软件项目时间维度跨 agent 持续演化" = v28 §1.45 frontier lab × Harness 第 71-72 栖协调归入(CK + Genesis 二联延展)

2.10 🟡 行业级数据跨文件核验机制缺失

LangChain "72.6%" 数字硬错 = 跨实例 5 文件登记触发修订 = v28 §4 开放问题 第 130 项候选新增(行业级数据跨文件核验机制)


三、可引用的 arXiv 号列表

arXiv ID 关联增量 主分类 立标等级 状态
arXiv:2608.10450 增量 1 Genesis / EvoX agent · method 🟡 ★★ 候选级中档 paper_cards/923 已建
arXiv:2608.12307 增量 2 AI4AI Harness cs.LG / cs.AI 🟢 ★ 候选级中-低档 paper_card 未建 P1 缺口 · arXiv ID 需 8-15 核验
arXiv:2608.07645 增量 3 Mendel Gödel Machine cs.AI 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2608.11924 增量 4 Spark-to-Paper cs.CL / cs.AI 🟢 ★ 候选级中档 paper_card 未建 P1 缺口
arXiv:2608.12123 增量 5 Ready Cohorts agent · method 🟡 ★★ 候选级中-高档 paper_cards/930 已建
arXiv:2608.05604 增量 6 SkillZip agent · method 🟡 ★ 候选级中档 paper_cards/934 已建
arXiv:2608.10538 增量 7 SKILLER agent · application 🟢 ★ 候选级中-低档 paper_cards/946 已建
arXiv:2608.11350 增量 8 SHAPER agent · method 🟢 ★ 候选级中-低档 paper_cards/931 已建
arXiv:2608.09805 增量 9 Parameter Exploration RLVR engineering · method 🟢 ★ 沿用级 paper_cards/933 已建
arXiv:2608.06270 增量 10 Illusion of Visual Tool-Use agent · method 🟢 ★ 沿用级 paper_cards/927 已建
arXiv:2608.11632 增量 11 Beyond Memory agent · method 🟡 ★★ 候选级中-高档(沿用 8-13) paper_cards/921 已建
arXiv:2608.08160 增量 12 NCP-Bench evaluation · benchmark 🟢 ★ 沿用级 paper_cards/925 已建
arXiv:2608.06867 增量 18 LLMRouter evaluation · application 🟢 ★ 沿用级 paper_cards/947 已建
arXiv:2608.00677 增量 14 OpenART(沿用 8-13) agent · benchmark 🟡 ★ 立标信号反弹 paper_cards/928 已建
arXiv:2608.09888 增量 14 BDH-CQ(沿用 8-13) cs.NE 🟡 ★ 立标信号衰减 paper_cards/877 已建
arXiv:2608.10744 增量 14 Latent-to-4D(沿用 8-14) cs.CV 🟡 ★★ 中档偏上 paper_card 未建 P1 缺口
arXiv:2608.12314 增量 15 StateFlow(沿用 8-14) cs.CV 🟡 ★★★ 中-高档 paper_card 未建 P1 缺口 · 作者组机构 5 处事实错误
arXiv:2608.12036 增量 15 Mechanist(沿用 8-14) cs.LG 🟡 ★★ 中档偏上 paper_cards/929 已建
arXiv:2608.10720 增量 12 Ex-Omni-2D(沿用 8-14) cs.CV / cs.CL 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2608.10299 增量 12 Agentic Co-Evolution(沿用 8-14) cs.MA 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2608.10875 增量 12 VibeLifeBench(沿用 8-13) cs.AI 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2608.08814 增量 18 360CityArena(沿用 8-13) cs.CV 主分类 · paper_card agent 🟡 ★★ 中档 paper_cards/911 已建
arXiv:2608.09867 增量 18 Stealing Reasoning Traces(沿用 8-13) cs.CR 🟢 ★ 沿用级 paper_cards/878 已建
arXiv:2608.11205 增量 18 AdvFD(沿用 8-13) cs.CV 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2602.23368 增量 13 Keyword Search Is All You Need(AAAI 2026) cs.CL / cs.IR 🟢 行业级沿用 paper_card 未建 P1 缺口
arXiv:2503.09516 增量 13 Search-R1 cs.CL 🟢 沿用 paper_card 沿用
arXiv:2603.07670v1 增量 13 Memory for Autonomous LLM Agents cs.CL · review 🟢 综述沿用 paper_card 未建 P1 缺口
arXiv:2605.19743v1 增量 13 EngiAI Multi-Agent cs.MA · benchmark 🟢 沿用 paper_card 未建 P1 缺口
arXiv:2501.09136v4 增量 13 Agentic RAG Survey cs.CL / cs.IR · survey 🟢 综述沿用 paper_card 未建 P1 缺口
arXiv:2608.01526 增量 18 Rethinking Classical Infrastructure Boundaries cs.LG 🟢 沿用 paper_card 未建 P1 缺口
arXiv:2603.20397 增量 18 KV Cache 五大优化策略(沿用 v44) cs.DC 🟢 沿用 paper_card 已建
arXiv:2608.12218 增量 18 Information Abundance Paradox cs.CL 🟢 ★⭐⭐⭐⭐ paper_card 未建 P1 缺口
arXiv:2608.12149 增量 18 混合线性注意力 cs.LG 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2608.12278 增量 18 结构性沉默 cs.CL 🟢 ★ 沿用级 paper_card 未建 P1 缺口
arXiv:2608.12253 增量 18 Simulator Collapse cs.MA 🟢 ★⭐⭐⭐⭐ paper_card 未建 P1 缺口
arXiv:2608.13545 增量 18 LittleLearner cs.LG 🟢 ★⭐⭐⭐ paper_card 未建 P1 缺口

总计:35 个 arXiv ID(主线立标 3 + 候选级新增 5 + 邻接级 4 + 沿用级 4 + Agentic Search 范式 5 + 立标机制沿用 6 + coding-agents 邻接级新增 8)


四、活文档 existing 脉络锚(organized/knowledge/coding-agents.md v27 8-13 23:20 收官锚)

§1.45 frontier lab × Harness 第 55-70 栖 16 栖立基础延展:Ouroboros 55 + DCAS 56 + Referential Dangling 57 + WeClawArena 58 + Kimi K2.5 59 + SWE-Bench ProMax 60 + WRP 61 + BDH-CQ 62 + LangChain R1/R2/R3 63-65 + Cultivar 66 + Muse Glimmer/LFM2.5/Apple ANE Orion/TGI 维护 67-70 + v28 §1.45 frontier lab × Harness 第 71-78 栖候选新增 8 件(Beyond Memory 71 + Genesis/EvoX 72 + AI4AI Harness 73 + Mendel Gödel Machine 74 + Spark-to-Paper 75 + SkillZip 76 + SKILLER 77 + SHAPER 78)

§2.5 Agent 训练范式 第 96-99 节点:DCAS Scaffold + AMD 小模型 Agent + Kimi K2.5 Zero-vision SFT + BDH-CQ 150M recurrent latent reasoning + v28 §2.5 第 100-103 节点候选新增 4 件(Beyond Memory 100 + AI4AI Harness 101 + Mendel Gödel Machine 102 + Parameter Exploration RLVR 103)

§2.165 Agent 基础设施 22 → 31 件套:KGCaRe + Benchmark Fingerprinting + DistilVDR + InSight-doc + Self-Knowledge RAG + WeClawArena + Ouroboros + Evo-Bench + Antidoom + LiteParse v2 + Kthena Volcano + llm-d + NVIDIA Disaggregation + Kimi K2.5 + SWE-Bench ProMax + WRP + BDH-CQ + LangChain R1/R2/R3 + Cultivar + Muse Glimmer + LFM2.5 + Apple ANE Orion + TGI 维护 + v28 §2.165 31 → 41 件套(Beyond Memory 32 + Genesis/EvoX 33 + Spark-to-Paper 34 + Ready Cohorts 35 + SkillZip 36 + SKILLER 37 + SHAPER 38 + Illusion of Visual Tool-Use 39 + Agentic Search 范式转变 + Agent Memory 综述 + LangChain Survey + MCP 97M + Karpathy nanochat + Foundry Managed Compute + Gemma 4 + Qwen 3.5 + MMORE + EngiAI + LLMRouter = 19 件邻接级新增 · 实际累计 41 件)

§2.94 KV Cache / Agent 推理调度 1 → 6 栖新增:v26 1 栖 + v27 5 栖新增 + v28 §2.94 6 → 7 栖新增(Ready Cohorts = LLM-Agent 推理调度 GPU 机会界定)

§2.161 AI Agent 安全"事件周" 7 → 19 栖延展:v28 §2.161 19 → 20 栖延展(OpenART = 行为安全评测) §2.193 frontier lab 隐含推理风险 第 23-24 栖:v28 §2.193 第 23-25 栖延展(Stealing Reasoning Traces + OpenART = 红队 Agent)

§3.1 共识 92 → 101:v28 §3.1 共识 第 102-109 项候选新增 8 件(Beyond Memory 102 + Genesis 104 + AI4AI Harness 105 + Mendel Gödel Machine 106 + Ready Cohorts 107 + SkillZip 108 + Agentic Search 范式转变 109)

§3.2 争议 56 → 64:v28 §3.2 争议 第 65-68 项候选新增 4 件(Beyond Memory 65 + OpenART 66 + RAG vs Agentic Search 67 + 立标信号强度 ≠ 立标等级评估双维度区分首次机制化 68)+ Q105.60 → Q105.61 升级

§3.3 反方 111 → 112:v28 §3.3 反方 #113-114 候选新增 2 件(LangChain 数字硬错 113 + StateFlow 作者组机构 5 处事实错误 114)

§4 开放问题 116 → 126:v28 §4 开放问题 第 127-130 项候选新增 4 件(Beyond Memory 127 + Agentic Search 跨 6 任务族 benchmark 验证 128 + 立标池双向锚 7 日滑动窗口验证 129 + 行业级数据跨文件核验机制 130)

§5 趋势 66 → 76:v28 §5 趋势 第 77-80 项候选新增 4 件(Beyond Memory 77 + OpenART 78 + Agentic Search 范式转变 79 + 立标信号瞬时峰值衰减锚 v33 以来首次 80)

§6.1 必读清单 arXiv 列表 258 → 277 件:v28 §6.1 必读清单 277 → 286 件 +9 件 net-new(Beyond Memory 278 + Genesis/EvoX 279 + AI4AI Harness 280 + Mendel Gödel Machine 281 + Spark-to-Paper 282 + Ready Cohorts 283 + SkillZip 284 + SKILLER 285 + SHAPER 286 + 可选续立:arXiv:2608.06867 LLMRouter + arXiv:2608.09805 Parameter Exploration RLVR + arXiv:2608.06270 Illusion of Visual Tool-Use + arXiv:2608.08160 NCP-Bench = 290 件目标)

§6.1 URL 列表 +7 件:arXiv:2602.23368(AAAI 2026 Keyword Search Is All You Need)+ arXiv:2503.09516(Search-R1)+ arXiv:2603.07670v1(Memory for Autonomous LLM Agents)+ arXiv:2605.19743v1(EngiAI Multi-Agent)+ arXiv:2501.09136v4(Agentic RAG Survey)+ LangChain State of Agent Engineering Survey 2026 + buzzgrewal.medium.com + vinitshahdeo.substack.com


五、边界声明

  • 本棒只写 1 个文件:/shared/research-kb/inbox/flyp/2026-08-14-coding-agents-e1prep.md
  • 不写他人 inbox(jay/tom/spark/stephen)
  • 不 git commit / 不执行 gh 推送
  • 不输出密钥 / cookie / token
  • 35 个 arXiv ID 均来自上述"检查过的来源"清单中的实际文件,未编造
  • 复用了 v27 活文档 + 8-14 全天 5 实例产出(stephen 4 件 + jay 8 件 + flyp 5 件 + tom 6 件 + spark 4 件)+ 8-13 evening 3 实例产出(flyp 21:32 BDH-CQ v2 + flyp 22:50 360CityArena + flyp 22:50 BDH-CQ-CoinRAG critical-read)+ 8-13 evening stephen 协调棒 22:45 + 8-14 0950 flyp v48-candidate-audit + 8-14 1550 flyp Mechanist critical-read + 8-14 2245 stephen evening 协调棒的素材
  • 8-14 HF Daily BDH-CQ 跌出 top 15 = 直接观察 inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md 15 件列表中无 arXiv:2608.09888(即 BDH-CQ)= "立标信号瞬时峰值衰减锚"信号
  • 8-14 HF Daily OpenART 184▲ = 直接观察 inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md 15 件列表第 1 名 arXiv:2608.00677 = 184▲
  • 立标等级判定 = 沿用 flyp 8-13 21:32 BDH-CQ v2 critical-read + flyp 8-14 0950 v48-candidate-audit + flyp 8-14 1550 Mechanist critical-read + spark 8-14 21:08 agent-e1prep 重写版的判定
  • 编码 Agent 行业级范式 = Agentic Search(Claude Code / Cursor Codemaps / Windsurf SWE-1.5 / Devin / Sourcegraph Amp / Cline 全部放弃向量索引)= 沿用 jay 8-14 0935 ⭐⭐⭐⭐ + spark 8-14 21:08 重写版增量 1 ⭐⭐⭐⭐ + stephen 8-14 ai-industry 增量 6 + stephen 8-14 llm-application 增量 2 P0

v27 主文件已落定 08-13 23:20 CST · 本 E1 预消化完成 08-14 23:20 CST · 为今晚 v27 → v28 升级轮备料