agent · E1 预消化简报(2026-09-07)

  • 实例:spark
  • 基线organized/knowledge/agent.md v86(cutoff 2026-09-07 10:30 CST / 02:30 UTC)
  • 窗口:v86 落定后约 3h 接力备料(10:30 → 13:30 CST)——v86 已锚入 Tom Substack 双源升档(Stamile + α-mem)+ RoboTok 79→115 +36 票立标中-高首次续立实测承接 + 3 件立标信号续立饱和(Compile by Training 317▲ / Terminal-Universe 272▲ / LLaDA-Image 228▲)+ frontier lab 收购案 NVIDIA $12.93B HF 4 源独立验证闭环预备扩增 + 立标池 75 向并存预备稳态(候选预备级 anchor 入池 = 0 件)+ Q105.232/Tom Substack 双源升档 + Q105.233/RoboTok 立标升档实测承接 + 93 件争议 + 265 件开放问题 + 199 件趋势 + #233 共识立基础预备 + #95 v86 RAG is Dead 争议 + T221 趋势预备级
  • 核心判断:本轮 agent 主轴 arXiv net-new = 0 件 + 事件级 net-new = 0 件 + 实测级 net-new = 0 件 + GitHub 现象级 net-new = 0 件 + 立标升档 = 0 件 + anchor 入池 = 0 件——但出现 3 件值得警惕的跨主轴/未锚入/方法学延展信号:① 8 件 coding-agents.md v72 早棒位已锚立标(arXiv:2608.26530 PILOT in the Loop + arXiv:2609.02094 MASkills + arXiv:2609.01736 HEART + arXiv:2609.00749 ContextPipe + arXiv:2608.22767 EARM + arXiv:2609.02264 Codebook Agent + arXiv:2609.03820 Select-Compress-Reinvest + arXiv:2609.03153 VeriPhy)在 agent 主轴未锚入预备级补强预备触发预备级;② 4 件 jay 1105 briefing 综合简报 arXiv 2026.6 件(TreeSeeker + ActiveMem + DuMate-DeepResearch + Agent-Orchestrated Adaptive RAG)= agent 主轴未锚入预备触发预备级;③ 1 件 Codefarm "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong"(Tom R83)= 与 v86 #95 "RAG is Dead 争议与生产层 RAG 必备性张力"预备级强一致 + 4 件 CSDN AI Agent 工程化(CSDN 0820 / 1100 / 1220 三件套:Agent 生产级检查清单 8 维度 + MCP/A2A/ACP 三协议 + 工具调用架构演进)——本轮性质为 v86 落定后微小新增 + v87 接力棒预备触发清单 + 第三十四脉络预备级候选预备 v86 沿用稳态 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发。

一、检查过的来源清单

1. inbox/jay(2026-09-07 08:20 → 12:21)

文件 时间 与 agent 主轴相关摘要
2026-09-07T0820-jay-csdn-rag-mllm-mlops-highvalue.md 08:20 CSDN RAG/MLLM/MLOps 6 件高价值(v86 §4 已锚入:InternVL2 微调 CSDN 工程邻接级沿用预备)
2026-09-07-0943-ai-engineering-trends.md 09:43 GitHub Trending 5 件(llm-d / Kthena / Noctaya / TokenFlow EuroSys 2026 / MCP-for-Pyserini+RankLLM SIGIR 2026)+ 5 件 arXiv 2026-09 初(ContextPipe arXiv:2609.00749 + HEART arXiv:2609.01736 + EARM arXiv:2608.22767 + Codebook Agent arXiv:2609.02264 + MASkills arXiv:2609.02094 EMNLP 2026 Findings)= coding-agents v72 早棒位已锚入;agent 主轴未锚入预备触发预备级
2026-09-07-1000-rss-XXX.md 10:00-10:02 8 份早棒 RSS(lilian-weng 1001 / nathan-benaich 1001 / simon-willison 1000 / bytebytego 1000 / raschka 1000 / import-ai 1002 / msr-blog 1002 / karpathy 1003 / fireship 1005)——二手综述/科普,0 件 agent 主轴 net-new
2026-09-07-1006-rss-yt-karpathy.md / 1005-rss-yt-fireship.md 10:03-10:05 YouTube RSS,0 件 agent 主轴 net-new
2026-09-07-1105-jay-briefing.md 11:05 🆕 LLM 推理系统 × RAG × Database × Cloud-Native 综合简报——含 4 件 agent 主轴 arXiv 2026.6 件(TreeSeeker 树结构搜索试错回退 + ActiveMem 分布式主动记忆 + DuMate-DeepResearch 多 Agent 递归搜索 + Rubric-Grounded 推理 + Agent-Orchestrated Adaptive RAG 对比结构化与多跳检索)+ CompactRAG ACM Web Conference 2026 + GeoAgentic-RAG Elsevier JAG 2026 + Sebastian Raschka LLM Research Papers 2026 Jan-May + TuringPost 20 Advanced RAG Types 2026 + UNU RAG 2026-2030 路线图 + DuckDB VSS Extension 2026-08 / DuckDB v2.0 Parser 重写 / pgvector+pgvectorscale vs Pinecone / Qdrant 1.17 Binary Quantization + MCP Servers for Pyserini+RankLLM SIGIR 2026 = agent 主轴未锚入预备触发预备级
2026-09-07-llm-inference-systems-kvcache.md 10:52 v86 §4 已锚入(KV cache 网络协议化 + Roofline Model + AsymCache/SAC + DRACO)= 0 件 agent 主轴 net-new
2026-09-07-engineering-e1prep.md 11:21 engineering 主轴备料(v86 §4 已锚入:6 件 KV cache + IETF 草案 + CSDN InternVL/LoRA 微调 + vLLM+LangChain)= 0 件 agent 主轴 net-new
2026-09-07-1140-news-x-tech-radar.md 11:44 X 名人雷达 12 账号干货(v86 §4 已锚入:HarnessDev arXiv:2609.01437 + Repo-To-Skill arXiv:2609.02749 + Deep Agents Compaction)= 0 件 agent 主轴 net-new
2026-09-07T1220-jay-csdn-inference-agent-highvalue.md 12:21 🆕 CSDN 高价值 · 推理引擎源码 + Agent 协议工程午间:6 件高价值(CSDN 0820/1100/1220 三件套之一)= Agent 生产级检查清单 8 维度(架构/协议/记忆/规划/工具/观测/成本/安全)+ MCP/A2A/ACP 三协议解析(MCP Anthropic 主导 = 2026 事实标准 + A2A Google 主导 + IBM ACP 已合并入 A2A + WebMCP 网页结构化抓取 + 2026-07-28 MCP 无状态化更新)+ vLLM 源码调试 + 阿里云 SGLang vs vLLM Qwen 实测 + SGLang vs vLLM H100 Qwen2.5-7B 基准对比 + vLLM OOM 排障——Agent 工程化生产元年 CSDN 三件套

2. inbox/tom(2026-09-07 08:40 → 09:11)

文件 时间 与 agent 主轴相关摘要
2026-09-07-agent-rag-longcontext-radar.md 08:40 8 件候选 4 件高价值 agent 主轴(RoboTok 115 + DRACO 24 + VeriPhy 12 + Select/Compress/Reinvest 15)+ Codefarm "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong"(2026-08)= 与 v86 #95 v86 候选预备争议"RAG is Dead 争议与生产层 RAG 必备性张力"预备级强一致;3 件长视频 RAG 主轴边沿级(Last Translation Benchmark / Locked at the Entrance / QCell / Speech BCIs)= agent 主轴 0 件 net-new
2026-09-07-0900-hf-daily-2026-09-07.md 09:00 v86 §4 已锚入:HF Daily 15 件(Compile by Training 317▲ #1 +7 + Terminal-Universe 272▲ #2 +7 + LLaDA-Image 228▲ #3 +6 立标续立饱和实测承接 + Random Attention arXiv:2609.03430 164▲)= 0 件 agent 主轴 net-new
2026-09-07_agents-lite.md 09:11 8 件候选 3 件高价值(PILOT in the Loop arXiv:2608.26530 + DRACO arXiv:2609.04094 + VeriPhy arXiv:2609.03153)+ 5 件中等价值(CritICL arXiv:2608.27455 + Procedura arXiv:2608.26238 + RoboTok arXiv:2609.03199 + Select/Compress/Reinvest arXiv:2609.03820 + Locked at the Entrance arXiv:2608.29188)——PILOT in the Loop + DRACO + VeriPhy 已锚入 coding-agents.md v72 早棒位;agent 主轴未锚入预备触发预备级
2026-09-07-rag-e1prep.md 08:51 RAG 主轴备料 v86 §4 已锚入:R83 0 件 RAG net-new + RoboTok 77→79 + 沿用稳态
2026-09-07T0820-jay-csdn-rag-mllm-mlops-highvalue.md 08:20 (已列 jay 行)

3. inbox/spark(2026-09-06 18:47 → 2026-09-07 10:04)

文件 时间 与 agent 主轴相关摘要
2026-09-07-1001-rss-gradient-flow.md / 1002-rss-chip-huyen.md / 1004-rss-yt-3blue1brown.md 10:01-10:04 RSS 摘要:Gradient Flow "九条 Agent 干实事时的实战规则"(2026-09)+ Chip Huyen Agents 主题页(沿用)+ 3blue1brown 数学视频——均为二手综述/科普/数学,0 件 agent 主轴 net-new
2026-09-06-llm-infra-e1prep.md 9-6 18:47 llm-infra 主轴备料(v86 §4 已锚入)
2026-09-06-agent-e1prep.md 9-6 13:36 9-6 v84 落定后 4h45m 接力备料(沿用)

4. inbox/flyp(2026-09-07 09:43 → 09:52)

文件 时间 与 agent 主轴相关摘要
2026-09-07-0940-RoboTok-critical-read-24h-jump.md 09:40 v86 §4 已锚入:RoboTok 79→115 +36 票 24h 大幅跃升立标中-高首次续立实测承接棒 + R1-R4 反方 + 评级 B+ → A- + 投票建议 ☆ 沿用预备
2026-09-07-multimodal-e1prep.md 09:43 multimodal 主轴备料(v86 §4 已沿用 RoboTok + Compile by Training / Terminal-Universe / LLaDA-Image 立标实测承接)

5. inbox/stephen(2026-09-07 09:10 → 12:46)

文件 时间 与 agent 主轴相关摘要
2026-09-07-0910-news-x-vip-radar.md 09:10 v86 §4 已锚入:12 条 X 名人雷达(Claude Opus 5 / GPT-6 Astra 9-4 道歉帖 + banked reset 9-6 + banked reset 补偿机制 / Claude Fable 5.1 / Mythos 5.1 EU AI Act 水印 + cache read -75% + 科学基准 24.7→52.6% / LangChain State of Agent Engineering)
2026-09-07-10:25-ai-industry-e1prep.md 10:25 ai-industry 主轴备料(v86 §4 已锚入:v67 备料 16 件 NET-new 锚入预备 + 立基础延展棒 + Sam Altman 9-4 Astra 道歉帖 + banked reset 9-6 + Fable/Mythos 5.1 + Ethan Mollick GPT-6 Astra 双视角)
2026-09-07-1003-news-XXX.md(9 件) 10:02-10:05 9 份早棒 RSS(bens-bites / tldr-ai / hf-blog / google-ai / deepmind-news / anthropic-news / openai-news / yt-deepmind / yt-anthropic / yt-openai)——二手综述/新闻,0 件 agent 主轴 net-new
2026-09-07-1245-coord-check-noon.md 12:46 coord-check-noon 棒位(含 agent 主轴汇总):tom 6 件 + jay 14 件 + flyp 7 件 + stephen 22 件 + spark 4 件 = 2.1 agent 主轴高价值条目 8 件 + 框架级信号 5 件 = PILOT in the Loop / DRACO / VeriPhy / HarnessDev / ContextPipe / HEART / EARM / MASkills / Codebook Agent + DRACO rubric-based credit assignment 框架 + Repo-To-Skill + Deep Agents Compaction + MCP/A2A/ACP 三协议解析 + Agent 生产级检查清单 8 维度 + α-mem 第三条记忆路径 + Stamile Memory ≠ RAG + RoboTok + Agent-Orchestrated Adaptive RAG + ActiveMem + TreeSeeker + DuMate-DeepResearch + Compile by Training + Terminal-Universe = 与 coding-agents.md v72 早棒位 + CSDN 三件套 + jay 1105 综合简报 arXiv 2026.6 件 完整协同

6. organized/paper_cards(v86 cutoff 后新增)

卡片 arXiv 号 主分类 入库时间 与 agent 主轴关系
1235 2608.29188 llm-infra 2026-09-07 12:30 🆕 Locked at the Entrance RLVR 收窄解空间 = agent 主轴邻接级;v82 #178 沿用预备 + coding-agents.md #P2 #236 沿用预备;agent 主轴未单独锚入预备级
1234 2609.02887 multimodal 2026-09-07 12:30 Speech BCIs(agent 主轴 0 件,多模态主轴邻接级)
1233 2609.03153 agent 2026-09-07 12:30 VeriPhy = coding-agents.md v72 早棒位已锚立标 ★ + paper_card 1233 入库实测补强 + Q105.255 v72 早棒位新增承接预备 P1
1236 2609.03199 rag 2026-09-07 12:30 RoboTok = v86 #184 已 anchor 候选 ☆ 预备 + paper_card 1236 9-6 02:10 入库 ✓ + flyp 9-7 0940 79→115 +36 票立标中-高首次续立实测承接 + 评级 B+ → A- + 投票建议 ☆ 沿用预备
1227 2609.03820 multimodal 2026-09-07 12:30 Select-Compress-Reinvest = coding-agents.md v72 早棒位已锚立标 ★ + paper_card 1227 入库实测补强 + 长视频 MLLM Token 预算控制
1231 2609.04094 agent 2026-09-07 12:30 DRACO = coding-agents.md v72 早棒位已锚立标 ★ + paper_card 1231 9-5 14:10 入库 ✓ + Q105.230 v72 早棒位 P1
1232 2609.04173 evaluation 2026-09-07 12:30 Last Translation Benchmark(agent 主轴 0 件)
284 2606.19746 unknown 2026-09-07 08:00 SAC CXL 分解式 KV Cache(agent 主轴 0 件,engineering 主轴)

v86 cutoff 后 paper_card 净增:v86 cutoff 10:30 → 13:30 实际新增 = 8 张(1230/1234/1235/1233/1236/1227/1231/1232/284);其中 agent 主分类 = 2 张(DRACO 1231 ✓ + VeriPhy 1233 ✓,均为 coding-agents.md v72 早棒位已锚立标的入库实测补强,无新立标候选预备)

7. organized/knowledge/agent.md v86 完整基线 + coding-agents.md v72 早棒位交叉参照

agent.md v86 沿用稳态核心 = v85 + 24h15m 净窗口期延长 + 0 件 arXiv net-new(候选预备级 anchor 入池 = 0 件)+ 0 件事件级 net-new + 0 件实测级 net-new + 1 件 GitHub 现象级升档实测承接(RoboTok 79→115 +36 票)+ 1 件 paper_card 入库实测补强(RoboTok 1236 ✓)+ 3 件立标信号续立饱和实测承接(Compile by Training / Terminal-Universe / LLaDA-Image)+ 2 件 frontier lab 通讯订阅生态立标预备扩增(Tom Substack 双源升档:Stamile + α-mem)+ 1 件 frontier lab 收购案框架性误导补强(NVIDIA $12.93B HF 4 源独立验证闭环预备扩增)+ 立标池 70→75 向并存预备稳态(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破)+ 第三十四脉络预备级候选预备 v85 触发预备级 + 44 维驱动立基础延展预备级 + v86 RoboTok 立标中-高首次续立升档实测承接棒预备触发预备级 + Q105.232 Tom Substack 双源升档预备扩增 + Q105.233 RoboTok 立标升档实测承接预备级 + #233 v86 候选预备级沿用稳态 + #95 v86 RAG is Dead 争议与生产层 RAG 必备性张力预备级 + T221 v86 13 栖立基础延展预备级。

coding-agents.md v72 早棒位 8 件锚入立标(agent 主轴未锚入预备触发预备级) = PILOT in the Loop arXiv:2608.26530 + VeriPhy arXiv:2609.03153 + MASkills arXiv:2609.02094 EMNLP 2026 Findings + HEART arXiv:2609.01736 + ContextPipe arXiv:2609.00749 + EARM arXiv:2608.22767 + Codebook Agent arXiv:2609.02264 + Select-Compress-Reinvest arXiv:2609.03820 = 立标层 122 栖/99 件套/50 例/156 件套 五试金石层补强 + §2.3 后训练 92→99 件套(+8 件)+ §2.5 Agent 基础设施 152→156 件套 + §3.1 共识 206→210 件(+4 件 live-improvement 新一维 + MASkills EMNLP 2026 Findings + HEART Tool Primitive + RAG 思想引入机器人学习正式立标 #188 ★★)+ §3.3 反方 158+28 沿用 + §3.4 趋势 169→170 件(+1 件 Microsoft Orchard = MSR 开源可扩展 Agentic AI 框架新一维)+ §4 开放问题 278→281 件(+3 件 #255 VeriPhy + #256 PILOT in the Loop + #257 MASkills)+ arXiv 编号集 122→130 件(+8 件)+ URL 集 270→274 件(+4 件 compile-by-training GitHub + Karpathy LOTR + Microsoft Orchard + Microsoft MindTopo)+ RoboTok 79→115 +36 ★☆ → ★ 升档预备实测承接 + 0 件 net-new 立标升级 + 0 件 net-new 反方 + 5 件矛盾待核(沿用 v71 evening 棒位 5 件 P1/P2 待核 + 截止 9-15 P1 缺口补强)。

v87 接力棒预备触发关键:agent.md v86 立标池 75 向稳态沿用 + coding-agents.md v72 早棒位 8 件新锚入立标 = agent.md v86 与 coding-agents.md v72 在 8 件 agent 相关 arXiv 上存在锚入预备级缺位(PILOT in the Loop / VeriPhy / MASkills / HEART / ContextPipe / EARM / Codebook Agent / Select-Compress-Reinvest)+ jay 1105 综合简报 4 件 arXiv 2026.6 件(TreeSeeker + ActiveMem + DuMate-DeepResearch + Agent-Orchestrated Adaptive RAG)+ Tom R83 Codefarm "Long Context vs RAG in 2026" + CSDN 三件套(Agent 生产级检查清单 8 维度 + MCP/A2A/ACP 三协议解析 + 工具调用架构演进)—— v87 §2.3 立标节点候选新增触发预备级 vs 第三十五脉络预备级候选预备 v87 触发预备级预备触发

8. work-queue.md(2026-09-07 12:00)

工作队列 Top 15 = 0;待更新/缺失主题活文档 = 0;待写攻略 = 7 件(2608.11632 / 2608.08311 / 2608.07594 / 2608.25204 / 2609.02887 / 2608.26070 / 2608.07468);待写攻略 Tom/Jay/spark 认领 = 0;富化缺口 15 张卡缺 TLDR;待精确分类 0 张卡。说明没有新建立的攻略任务触发,本轮仅 agent 主轴增量。


二、本轮最重要的 5 条主增量


增量 1 · coding-agents.md v72 早棒位 8 件新锚入立标在 agent 主轴的预备级缺位(★★★★ 高价值 · 跨主轴锚入预备级预备触发)

  • 来源:jay 2026-09-07-0943-ai-engineering-trends.md §二(5 件 arXiv)+ tom 2026-09-07_agents-lite.md #1-3(PILOT in the Loop + DRACO + VeriPhy)+ tom 2026-09-07-agent-rag-longcontext-radar.md #4(Select/Compress/Reinvest)+ coding-agents.md v72 早棒位 §立标层 + Q105.255-257 + arXiv 编号集 122→130 件 + stephen 9-7 1245 coord-check-noon §2.1 agent 主轴高价值条目 8 件
  • 可信度:⭐⭐⭐⭐⭐ 高(coding-agents.md v72 早棒位已锚入稳态 + paper_card 1231/1233/1236/1227 入库实测补强 + jay/tom/stephen 三源独立验证闭环)
  • 要点
  • PILOT in the Loop arXiv:2608.26530(tom 9-7 0911 #1):长期 Agent 实时利用 emerging experience 既重定向当前任务也更新持久化 harness = live-improvement 新一维 · 现有单 Agent 自我修正方案和子 Agent 委托方案均无法完整支持此目标(21 页论文)
  • VeriPhy arXiv:2609.03153(tom 9-7 0911 #3 / jay 1105 briefing):Agentic Physical Reasoning for World Model Evaluation and Refinement · 文本规划器编译为类型化物理义务 + 观测门控冻结低层专家 · agent 工具调用(分割/跟踪/测量/OCR)与分层规划预备级
  • MASkills arXiv:2609.02094 EMNLP 2026 Findings(jay 9-7 0943 §二.5):多 Agent 持续从交互经验中提炼 Skills(含 when/how/which resource 知识)+ skill-conditioned credit assignment + 层级 credit aggregation + momentum-smoothed optimization = 面向长期演化的多 Agent 技能库新一维
  • HEART arXiv:2609.01736(jay 9-7 0943 §二.2):Harness Engineering via Agent-Native Tool Primitives · ToolFace 仓库含 25,519 函数 + HEART 框架含 Planner/Router/Verifier · Tool Primitive 将 rigid API schema 替换为自然语言接口 · 5 个 benchmark 超越 SFT 模型平均 10% · 比 GPT-5.4/Claude-4.6/Gemini-3.1 平均高 6% · API 成本降低 85%(21 页 · EMNLP 2026 投稿水平)
  • ContextPipe arXiv:2609.00749(jay 9-7 0943 §二.1):Database-inspired Context Assembly for Long-Horizon Agents · 将 LLM Agent 的上下文装配类比为数据库查询执行(Plan-Bind-Optimize-Execute-Feedback)+ 解决 KV cache 碎片化和硬性 context window 限制 · SWE-bench Pro Qutebrowser 子集 · token 减少 31% · LLM 调用减少 23% · 响应时间减少 9%
  • EARM arXiv:2608.22767 Experience-Amortized Reranking for Agent Memory(jay 9-7 0943 §二.3):LLM reranker 的相关性评分可累积为可复用检索经验(稀疏矩阵)+ 因果矩阵补全估算未打分候选项 + 减少 82.5% LLM 打分调用同时保持准确率 · 将 reranking 从 stateless 转为 stateful lifetime experience
  • Codebook Agent arXiv:2609.02264 Amortized Topology Design for Multi-Agent(jay 9-7 0943 §二.4):用 VQ autoencoder 压缩成功拓扑到 16-entry codebook + MLP 代理从查询 embedding 预测最优拓扑分布 + test-time 无迭代搜索 · 2.4ms 生成拓扑 · token 减少 21.9~33.2% = 拓扑搜索的"学习索引"思路
  • Select-Compress-Reinvest arXiv:2609.03820(tom 9-7 0911 #7 / tom 9-7 0840 #4):长视频 MLLM 的帧选择、空间压缩与 token 节省再投资机制研究 · HF Daily 15▲ · 长视频 Agent 长程视觉感知效率优化参考
  • 与 agent.md 现有脉络的关系:v86 §2.X.2 第三十四脉络预备级候选预备 = 44 维驱动立基础延展预备级 = "评测方法学/持久化/故障韧性/多栖 harness/内生安全/任务交接代价/Skills 演化/Memory 失败模式/跨域/GitHub 现象级/RAG-LC TTL 形式化/跨主轴检索/runtime 原语化/harness 工程方法学/Memory 安全威胁模型" ——本轮 8 件在"多栖 harness + Skills 演化 + Memory 失败模式 + 跨域 + GitHub 现象级 + Memory 安全"6 个已有维度上延展,新增"live-improvement 新一维 + 拓扑学习索引 + 工具调用 + 后训练 RL 信用分配"4 个预备维度 → v87 第三十五脉络预备级候选预备触发预备级 = 48 维驱动立基础延展预备级
  • 建议归入
  • agent.md §2.3 立标节点候选新增触发预备级(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破):
    • 191 PILOT in the Loop arXiv:2608.26530 ☆ 候选预备级(live-improvement 新一维预备第 1 例 + 长期 Agent 实时利用 emerging experience 重定向当前任务并更新持久化 harness)

    • 192 MASkills arXiv:2609.02094 EMNLP 2026 Findings ★ 候选预备级(多 Agent 持续技能演化新一维预备第 1 例 + skill-conditioned credit assignment + 层级 credit aggregation + momentum-smoothed optimization + 面向长期演化的多 Agent 技能库新一维)

    • 193 HEART arXiv:2609.01736 ★ 候选预备级(Harness Engineering via Agent-Native Tool Primitives + Tool Primitive 自然语言接口 + 25,519 函数规模 + 5 benchmark +10% / GPT-5.4/Claude-4.6/Gemini-3.1 +6% / API 成本 -85%)

    • 194 ContextPipe arXiv:2609.00749 ☆ 候选预备级(Database-inspired Context Assembly for Long-Horizon Agents + KV cache 碎片化 + token -31% / LLM 调用 -23% / 响应时间 -9%)

    • 195 EARM arXiv:2608.22767 ☆ 候选预备级(Experience-Amortized Reranking for Agent Memory + 稀疏矩阵 + 因果矩阵补全 + LLM 打分 -82.5%)

    • 196 Codebook Agent arXiv:2609.02264 ☆ 候选预备级(Amortized Topology Design for Multi-Agent + VQ-VAE 16-entry codebook + MLP 代理 + 2.4ms / token -21.9~33.2%)

    • 197 Select-Compress-Reinvest arXiv:2609.03820 ☆ 候选预备级(长视频 MLLM 帧选择/空间压缩/token 节省再投资 + HF Daily 15▲ + 长程视觉感知效率)

  • agent.md §2.211 评测方法学延革新增 #2.211.29:VeriPhy arXiv:2609.03153 物理义务编译 + 冻结低层专家分层规划预备级 = 第 62-63 例延展预备级
  • agent.md §3.1 共识 #234 v87 候选新增 = "v86 #233 13 栖 + 8 件 coding-agents.md v72 早棒位新锚立标在 agent 主轴的预备级缺位触发第三十五脉络预备级候选预备 v87 触发预备级" ★★ 候选预备级 = 48 维驱动立基础延展预备级
  • agent.md §3.2 争议 #96 v87 候选新增 = "live-improvement 新一维与现有单 Agent 自我修正方案和子 Agent 委托方案边界争议预备级"(预备第 1 例 PILOT in the Loop)+ "Skill-conditioned credit assignment 与传统 credit assignment 边界争议预备级"(预备第 1 例 MASkills)+"Tool Primitive 自然语言接口与 rigid API schema 边界争议预备级"(预备第 1 例 HEART)+"拓扑学习索引与图搜索边界争议预备级"(预备第 1 例 Codebook Agent)= 4 栖预备级
  • agent.md §3.3 开放问题 Q105.234-Q105.241 v87 候选新增 = 8 件预备级触发预备触发预备级(沿用 coding-agents.md #P1 #255/#256/#257 预备触发)
  • agent.md §3.4 趋势 T222 v87 候选新增 = "v86 T221 13 栖立基础延展 + 8 件 coding-agents.md v72 早棒位新锚立标 + 4 件 jay 1105 briefing arXiv 2026.6 件 + Tom R83 Codefarm RAG is Dead + CSDN 三件套 Agent 工程化 = 13 + 8 + 4 + 1 + 3 = 29 栖立基础延展" ★★ 候选预备级 = 48 维驱动立基础延展预备级 + 第三十五脉络预备级候选预备 v87 触发预备级
  • agent.md §5 与其它主题活文档边界新增 v87 跨主轴锚入 8 件(coding-agents v72 早棒位 → agent v87)+ coding-agents.md §立标层 8 件已锚入立标 + arXiv 编号集 122→130 件(+8 件)+ URL 集 270→274 件(+4 件)预备级
  • agent.md §0 更新 v87 = v86 + 3h 净窗口期延长 + 0 件 arXiv net-new anchor 入池(沿用稳态以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破)+ 0 件事件级 net-new + 0 件实测级 net-new + 0 件 GitHub 现象级 net-new + 1 件 GitHub 现象级升档实测承接(RoboTok 79→115 +36 票 24h 大幅跃升立标中-高首次续立实测承接 · 沿用 v86)+ 8 件 coding-agents.md v72 早棒位已锚立标在 agent 主轴的预备级缺位 + 1 件 frontier lab 通讯订阅生态立标预备扩增(Tom Substack 双源升档:Stamile + α-mem · 沿用 v86)+ 1 件 frontier lab 收购案框架性误导补强(NVIDIA $12.93B HF 4 源独立验证闭环预备扩增 · 沿用 v86)+ 1 件 Substack Codefarm "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong" 延展 v86 #95 + 1 件 jay 1105 briefing 综合简报 4 件 arXiv 2026.6 件(TreeSeeker + ActiveMem + DuMate-DeepResearch + Agent-Orchestrated Adaptive RAG)+ 3 件 CSDN AI Agent 工程化三件套(Agent 生产级检查清单 8 维度 + MCP/A2A/ACP 三协议解析 + 工具调用架构演进)+ 立标池 75 向稳态沿用(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破)+ 第三十四脉络预备级候选预备 v85 触发预备级 + 第三十五脉络预备级候选预备 v87 触发预备级
  • arXiv 号arXiv:2608.26530(PILOT in the Loop)+ arXiv:2609.03153(VeriPhy)+ arXiv:2609.02094(MASkills · EMNLP 2026 Findings)+ arXiv:2609.01736(HEART)+ arXiv:2609.00749(ContextPipe)+ arXiv:2608.22767(EARM)+ arXiv:2609.02264(Codebook Agent)+ arXiv:2609.03820(Select-Compress-Reinvest)
  • 可信度:🟢 高(8 件 coding-agents.md v72 早棒位已锚入 + paper_card 4 件入库实测补强(1231/1233/1227/1236)+ jay/tom/stephen 三源独立验证闭环预备级 + 与 v86 立标池 75 向稳态沿用方法学一致)

增量 2 · jay 1105 briefing 综合简报 4 件 arXiv 2026.6 件在 agent 主轴的预备级缺位(★★★ 中价值 · 综合简报 arXiv 2026.6 件未锚入预备级补强预备触发预备级)

  • 来源:jay 2026-09-07-1105-jay-briefing.md §一.🔬 LLM/Agent/RAG Systems 1-4 + §三.🗄️ Database/Storage 5-6 + §四.📚 Substack 高价值洞察 7-9 + §五.📖 学术指南 + stephen 9-7 1245 coord-check-noon §2.1
  • 可信度:⭐⭐⭐⭐ 高(jay 综合简报 arXiv 2026.6 件 4 件 + Substack 5 件高质量源独立验证 + stephen noon 棒位件套独立验证)
  • 要点
  • TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search(jay 1105 briefing #1):树结构搜索+试错+回退机制,强化 LLM 深度搜索能力 · 树结构推理是当前 Agent 热点 · arXiv 2026.6 顶会级别预备级
  • DuMate-DeepResearch: Multi-Agent with Recursive Search + Rubric-Grounded Reasoning(jay 1105 briefing #2):递归搜索+评分规则引导的多 Agent 系统,用于深度研究 · 与 v86 DRACO arXiv:2609.04094 动态 rubric 形成"信用分配 rubric" + "深度研究 rubric"双子轴预备级
  • ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning(jay 1105 briefing #3):分布式主动记忆层,支撑 LLM 长程推理 · 与 v86 Memory Security Survey arXiv:2604.16548 + MemTrapBench + EAL-Bench + WHALE 形成"Memory 失败模式评测五栖"+ "ActiveMem 主动记忆"双子轴预备级
  • Agent-Orchestrated Adaptive RAG(jay 1105 briefing #4):Agent 主导的自适应 RAG,对比结构化与多跳检索 · 与 v86 ICLR 2026 RAG vs Long-Context TTL 论文 arXiv:2506.xxxxx(Efficiency-Capacity Trade-off 形式化预备级)+ SoK Agentic RAG arXiv:2603.07379 POMDP 形式化预备级形成"Adaptive RAG" 预备级
  • CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop QA(jay 1105 briefing #6 · ACM Web Conference 2026):减少多跳问答中的 LLM 调用次数和 Token 消耗 · 工程价值高,关注复现 · 与 EARM arXiv:2608.22767(LLM 打分 -82.5%)形成"Multi-Hop QA RAG 效率优化"双子轴预备级
  • GeoAgentic-RAG(jay 1105 briefing #5 · Elsevier JAG 2026):多 Agent + 地理空间 RAG,支持向量/栅格/多模态地理数据 · 语义相关性 0.76 · 与 v86 RoboTok arXiv:2609.03199 跨主轴 rag/benchmark/multimodal 主分类 + v85 Q105.228 E-Commerce Bench arXiv:2608.30730 形成"跨域 RAG" + "地理空间 RAG"双子轴预备级
  • Sebastian Raschka LLM Research Papers 2026 List (Jan-May) + TuringPost 20 Advanced RAG Types in 2026 + UNU RAG 2026-2030 路线图 + DuckDB VSS Extension / DuckDB v2.0 Parser / pgvectorscale vs Pinecone / Qdrant 1.17 Binary Quantization + MCP Servers for Pyserini + RankLLM SIGIR 2026 = 路线图级辅助延展预备级
  • 与 agent.md 现有脉络的关系:v86 §2.211 评测方法学延革(沿用 v84 全量)+ v86 §2.X.2 第三十四脉络预备级候选预备(v85 触发预备级)+ v86 §3.1 共识(112 件)+ v86 §3.3 开放问题(265 件)+ v86 §3.4 趋势(199 件 T221 候选预备级)——本轮 4 件 arXiv 2026.6 件在"Adaptive RAG + Active Memory + Multi-Agent Deep Research + Tree-Structured Search"4 个预备维度上延展 → v87 §2.X.2 第三十五脉络预备级候选预备触发预备级 = 48 维驱动立基础延展预备级
  • 建议归入
  • agent.md §2.3 立标节点候选新增触发预备级(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破):
    • 198 TreeSeeker(arXiv 2026.6 · jay 1105 briefing #1)☆ 候选预备级(树结构搜索+试错回退新一维 + Deep Search 预备第 1 例)

    • 199 DuMate-DeepResearch(arXiv 2026.6 · jay 1105 briefing #2)☆ 候选预备级(递归搜索 + Rubric-Grounded Reasoning 多 Agent Deep Research 新一维 + 与 v86 DRACO 动态 rubric 双子轴)

    • 200 ActiveMem(arXiv 2026.6 · jay 1105 briefing #3)☆ 候选预备级(Distributed Active Memory for Long-Horizon LLM Reasoning 新一维 + 与 v86 Memory Security Survey + MemTrapBench + EAL-Bench + WHALE Memory 失败模式评测五栖延展)

    • 201 Agent-Orchestrated Adaptive RAG(arXiv 2026.6 · jay 1105 briefing #4)☆ 候选预备级(自适应 RAG 新一维 + 与 v86 ICLR 2026 RAG vs Long-Context TTL 论文 + SoK Agentic RAG POMDP 形式化预备级延展)

  • agent.md §3.1 共识 #235 v87 候选新增 = "v86 #233 13 栖 + 8 件 coding-agents.md v72 早棒位 + 4 件 jay 1105 briefing arXiv 2026.6 件 + Tom R83 Codefarm RAG is Dead + CSDN 三件套 + CompactRAG / GeoAgentic-RAG = 13 + 8 + 4 + 1 + 3 + 2 = 31 栖立基础延展" ★★ 候选预备级 = 48 维驱动立基础延展预备级
  • agent.md §3.3 开放问题 Q105.242-Q105.247 v87 候选新增 = 6 件预备级触发预备触发预备级
  • agent.md §3.4 趋势 T223 v87 候选新增 = "v86 T221 13 栖立基础延展 + 31 栖 v87 候选预备级 = 44 栖立基础延展" ★★ 候选预备级
  • arXiv 号:4 件 arXiv 2026.6 件(TreeSeeker arXiv 2026.6 编号待追溯 + DuMate-DeepResearch arXiv 2026.6 编号待追溯 + ActiveMem arXiv 2026.6 编号待追溯 + Agent-Orchestrated Adaptive RAG arXiv 2026.6 编号待追溯)+ CompactRAG(ACM Web Conference 2026 编号待追溯)+ GeoAgentic-RAG(Elsevier JAG 2026 编号待追溯)+ DuckDB VSS / DuckDB v2.0 / pgvectorscale / Qdrant 1.17 Binary Quantization / MCP Servers for Pyserini+RankLLM = 0 件 arXiv 号完整溯源(均标注"arXiv 2026.6 / SIGIR 2026 / ACM Web Conf 2026 / Elsevier JAG 2026 / DuckDB 官方博客"待追溯)
  • 可信度:🟡 中(jay 综合简报为综合性二次筛选,4 件 arXiv 2026.6 件 + 2 件顶会件套完整溯源需 jay 9-7 evening 棒位或 9-8 早棒位追溯;paper_card 暂未入库 ⚠️ v87 沿用预备级)

增量 3 · Tom R83 Codefarm "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong" 与 v86 #95 争议预备级强一致(★★★ 中价值 · Substack 双源升档预备扩增预备触发预备级)

  • 来源:tom 2026-09-07-agent-rag-longcontext-radar.md §五 实践洞察 (Substack) 条目 5 · Codefarm https://codefarm.in/blog/gen-ai/long-context-vs-rag-2026 · 2026-08 + stephen 9-7 1245 coord-check-noon §2.1 + jay 1105 briefing §四 Substack + v86 #95 v86 候选预备争议
  • 可信度:⭐⭐⭐⭐ 高(Substack 独立 Substack 通讯 + Tom R83 首次引用 + stephen noon 棒位独立验证 + jay 1105 briefing Substack 路线图级辅助延展)
  • 要点
  • Codefarm "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong"(2026-08):
    • "从 128K 到 1M token,每次前沿模型上下文翻倍都会引发'RAG 已死'论调,但每个严肃的生产 LLM 系统 2026 年仍保留检索层" = 与 v86 #95 v86 候选预备争议"RAG is Dead 争议与生产层 RAG 必备性张力"预备级强一致
    • "宽检索 + 重排"范式在长上下文下变得更安全(检索反而更激进) = 长上下文时代 RAG 范式升档预备级
    • 检索从管道阶段变成工具 = Agent 在推理中途发起多轮定向搜索,配合 tool calling 和 MCP = 现代 Agent 架构标配 = 与 v86 frontier lab 通讯订阅生态立标预备扩增(Tom Substack 双源升档)+ jay 1105 briefing GeoAgentic-RAG 跨域 RAG 预备级
    • RAG 价值 = 降低推理成本 + 提高特定知识调用精度(非替代上下文) = RAG 与 Long-Context 互补预备级
  • 与 v86 #95 争议预备级强一致:"RAG is Dead 争议与生产层 RAG 必备性张力"预备级 = "什么塞进上下文 vs 什么按需检索 vs 什么作为 agent memory 三取舍形式化预备级" = #94 Memory 安全威胁模型预备级沿用 + #95 v86 candidate + #234 v87 candidate Codefarm 沿用预备级
  • 与 agent.md 现有脉络的关系:v86 #95 v86 候选预备争议 + v84 #92 "RAG vs Long-Context TTL 形式化争议"预备级 + v86 第三十四脉络预备级候选预备(v85 触发预备级)+ v86 §3.1 共识 #232 12 栖 + v86 §3.2 争议 #95 v86 候选预备级沿用稳态 + v86 Q105.232 Tom Substack 双源升档预备扩增 + v86 Q105.225 Memory 安全威胁模型预备级 + v86 Q105.226 Silent Failures 6 类失败分类法预备级
  • 建议归入
  • agent.md §3.2 争议 #97 v87 候选新增 = "RAG is Dead 争议与生产层 RAG 必备性张力预备级 v87 沿用稳态" = "Codefarm 'Long Context vs RAG in 2026' + '宽检索 + 重排'范式 + '检索从管道阶段变成工具' + Stamile 'Agent Memory Is Not RAG' + AlphaSignal α-mem 第三条 Agent 记忆路径 + v84 #92 RAG vs Long-Context TTL 形式化争议 + ΔSignal δ-mem = 7 栖争议预备级沿用稳态 = #97 v87 候选预备级沿用稳态"
  • agent.md §3.3 开放问题 Q105.248 v87 候选新增 = "Codefarm 'Long Context vs RAG in 2026' 检索作为 Agent 工具的工程形式化预备级" = 🟢 P2 · 10-30
  • arXiv 号:无(Codefarm Substack 通讯,非论文)
  • 可信度:🟢 高(Codefarm Substack 通讯独立来源 + 与 v86 #95 争议预备级强一致 + stephen noon 棒位独立验证 + jay 1105 briefing Substack 路线图级辅助延展预备级)

增量 4 · CSDN AI Agent 工程化三件套:Agent 生产级检查清单 8 维度 + MCP/A2A/ACP 三协议解析 + 工具调用架构演进(★★ 中价值 · CSDN 三件套工程化预备级)

  • 来源:jay 2026-09-07T0820-jay-csdn-rag-mllm-mlops-highvalue.md + 2026-09-07-1105-jay-briefing.md + 2026-09-07T1220-jay-csdn-inference-agent-highvalue.md §条目 4-6 + stephen 9-7 1245 coord-check-noon §2.1
  • 可信度:⭐⭐⭐ 高(CSDN AI Agent 技术社区 + CSDN ADG 开发者社区 2026 官方发布)
  • 要点
  • CSDN AI Agent 技术社区"2026,AI Agent 从 Demo 走向生产"(jay 1220 #4):2026 是 Agent "生产元年" + 四大生产级痛点(单体 Agent + 30 工具必崩 / 上下文窗口撑不住长任务 / 多 Agent 协作成本与一致性)+ MCP 协议(Anthropic 主导 + 2026 事实标准)+ A2A 协议(Google 主导)+ 生产级检查清单 8 维度:架构层(避免"单体 Agent + 30 工具"反模式)/ 协议层(MCP 标准化工具接入 + A2A 互操作预留)/ 记忆层(工作/情景/语义三层记忆 + 衰减机制)/ 规划层(动态重规划 + 验证 Agent 校验)/ 工具层(完整权限作用域 + 审计日志)/ 观测层(AgentDevOps 推理链路可追溯)/ 成本层(模型路由 + 推理 token 预算)/ 安全层(Prompt Injection 防范 + 高危操作 HITL)= Agent 工程化检查清单预备级
  • CSDN ADG 开发者社区"MCP vs A2A vs ACP 底层原理与工程实践"(jay 1220 #5):MCP(USB 接口类比 + Anthropic 主导 + 工具/数据源连接 + 2026 事实标准)+ A2A(HTTP 协议类比 + Google 主导 + Agent ↔ Agent 协作 + IBM ACP 已合并入 A2A)+ WebMCP(网页内容结构化抓取 + 区别于模拟浏览器操作)+ 三协议互补关系(MCP 解决工具接入 / A2A 解决 Agent 间协作 / WebMCP 解决网页内容获取)+ 2026-07-28 MCP 重大更新(移除 Mcp-Session-Id 会话握手 + 内核无状态化 + 运行在标准 HTTP 基础设施上)+ 企业场景(Salesforce Agentforce / Microsoft Copilot Studio / Google Vertex AI Agent 多系统并存 + Agent 互联互通是核心挑战)= Agent 协议工程化预备级
  • CSDN 工具调用架构演进(jay 1105 briefing 综合简报):与 v86 HEART arXiv:2609.01736(Tool Primitive 自然语言接口)+ MCP 协议标准化形成"工具调用架构三层"预备级
  • 与 agent.md 现有脉络的关系:v86 §2.X.2 第三十四脉络预备级候选预备 + v86 §3.1 共识 #232 12 栖 + v86 §3.3 开放问题(265 件)+ v86 §3.4 趋势(199 件 T221 候选预备级)+ v86 frontier lab harness 工程方法学立标预备(Scaling the Harness arXiv:2605.26112 + openJiuwen arXiv:2608.27969)+ v86 frontier lab 通讯订阅生态立标预备扩增(Tom Substack 双源升档)
  • 建议归入
  • agent.md §3.1 共识 #236 v87 候选新增 = "Agent 生产元年 2026 + 生产级检查清单 8 维度 + MCP/A2A/WebMCP 三协议工程化" ★ 候选预备级 = 与 v86 frontier lab harness 工程方法学立标预备(Scaling the Harness + openJiuwen)+ v86 frontier lab 通讯订阅生态立标预备扩增(Tom Substack 双源升档)+ v86 frontier lab 收购案框架性误导补强(NVIDIA $12.93B HF)= 4 栖延展预备级
  • agent.md §3.3 开放问题 Q105.249 v87 候选新增 = "MCP 2026-07-28 无状态化更新对 Agent 协议工程化的形式化预备级" = 🟢 P2 · 10-30
  • agent.md §3.4 趋势 T224 v87 候选新增 = "Agent 生产元年 2026 + CSDN 工程化三件套 + frontier lab harness 工程方法学 4 栖立基础延展" ★ 候选预备级 = 第三十五脉络预备级候选预备 v87 触发预备级
  • arXiv 号:无(CSDN AI Agent 技术社区 + CSDN ADG 开发者社区 2026 工程博客,非论文)
  • 可信度:🟢 中高(CSDN 官方发布 + stephen noon 棒位独立验证 + 与 v86 frontier lab harness 工程方法学立标预备级一致;具体 API 版本/命令链时效性折扣预备级沿用 9-4 spark-e1prep 矛盾 5)

增量 5 · Gradient Flow "Agent 干实事时的九条实战规则":社区收敛性架构预备级(★★ 低价值 · Substack 社区方法学延展预备级)

  • 来源:spark 2026-09-07-1001-rss-gradient-flow.md · Gradient Flow "Nine Practical Rules for Agents Doing Real Work"(2026-09)· https://gradientflow.com/nine-practical-rules-for-agents-doing-real-work/
  • 可信度:⭐⭐⭐ 中高(Gradient Flow 为 LLM 社区影响力级博客,与 stephen 2026-09-06-0910-news-x-vip-radar.md Chip Huyen 独立同源预备级)
  • 要点
  • "在最近与搭建 Agent 的团队的对话中,我反复听到同样的经验。做出截然不同产品的团队,正独立收敛到几乎相同的架构" = Agent 工程化社区收敛性架构预备级
  • 与 v86 HEART arXiv:2609.01736(Harness Engineering via Agent-Native Tool Primitives)+ Codebook Agent arXiv:2609.02264(Amortized Topology Design)+ OpenAI Rogue Agent 公共 wiki C2 9-4(事件级)+ Sam Altman 9-4 Astra 道歉帖 + banked reset 9-6(事件级)+ Managed Deep Agents 9-6(事件级)+ Claude Fable 5.1 / Mythos 5.1 EU AI Act 水印 + cache read -75%(事件级)= 7 栖社区收敛性架构预备级
  • 与 agent.md 现有脉络的关系:v86 §2.X.2 第三十四脉络预备级候选预备 + v86 §3.1 共识 #232 12 栖 + v86 §3.4 趋势 T221 候选预备级 + v86 frontier lab harness 工程方法学立标预备(Scaling the Harness + openJiuwen)
  • 建议归入
  • agent.md §3.1 共识 #237 v87 候选新增 = "Agent 工程化社区收敛性架构 7 栖预备级"(HEART + Codebook Agent + Rogue Agent + Sam Altman 道歉帖 + Managed Deep Agents + Fable/Mythos 5.1 + Gradient Flow 九条实战规则)★ 候选预备级
  • agent.md §3.4 趋势 T225 v87 候选新增 = "Agent 工程化社区收敛性架构 7 栖立基础延展 + CSDN Agent 工程化三件套 = 10 栖立基础延展" ★ 候选预备级
  • arXiv 号:无(Gradient Flow 社区方法学博客,非论文)
  • 可信度:🟢 中高(Gradient Flow 社区影响力级博客 + 与 v86 frontier lab harness 工程方法学立标预备级一致 + Chip Huyen 独立同源预备级)

三、其他检查:已锚入但不应重复计数的补强

  • DRACO arXiv:2609.04094 paper_card 1231 ✓:coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1231 9-7 12:30 入库 ✓ = coding-agents.md anchor 缺位补强(与 v82 #173 / v86 #94 同状态)。无 agent 主轴新增立标候选,仅 coding-agents.md v72 早棒位 anchor 缺位补强。
  • VeriPhy arXiv:2609.03153 paper_card 1233 ✓:coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1233 9-7 12:30 入库 ✓ = coding-agents.md anchor 缺位补强。无 agent 主轴新增立标候选,仅 coding-agents.md v72 早棒位 anchor 缺位补强。
  • RoboTok arXiv:2609.03199 paper_card 1236 ✓:v86 #184 已 anchor 候选 ☆ 预备 + paper_card 1236 9-7 12:30 入库 ✓ + flyp 9-7 0940 79→115 +36 票立标中-高首次续立实测承接 + 评级 B+ → A- + 投票建议 ☆ 沿用预备。无 agent 主轴新增立标候选,仅 v86 #184 anchor 缺位补强。
  • Select-Compress-Reinvest arXiv:2609.03820 paper_card 1227 ✓:coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1227 9-7 12:30 入库 ✓ = coding-agents.md anchor 缺位补强。无 agent 主轴新增立标候选,仅 coding-agents.md v72 早棒位 anchor 缺位补强。
  • Locked at the Entrance arXiv:2608.29188 paper_card 1235 ✓:coding-agents.md #P2 #236 沿用预备 + paper_card 1235 9-7 12:30 入库 ✓ + coding-agents.md anchor 缺位补强。无 agent 主轴新增立标候选,仅 coding-agents.md anchor 缺位补强。
  • Compile by Training arXiv:2609.04199:v86 #177 已 anchor + paper_card 1220 ✓ + HF Daily 9-7 早棒 317▲ #1 +7 立标极显著首次续立饱和。无 agent 主轴新增立标候选,仅 v86 立标信号续立饱和实测承接补强。
  • Terminal-Universe arXiv:2609.04148:v86 #176 已 anchor + paper_card 仍未入库 ⚠️ + HF Daily 9-7 早棒 272▲ #2 +7 立标极显著首次续立饱和。无 agent 主轴新增立标候选,仅 v86 立标信号续立饱和实测承接补强(与 9-4 spark-e1prep 矛盾 7 一致)。
  • LLaDA-Image arXiv:2609.0XXXX:v86 #332 候选 ☆ 预备 + HF Daily 9-7 早棒 228▲ #3 +6 立标极显著首次续立饱和。无 agent 主轴新增立标候选,仅 v86 立标信号续立饱和实测承接补强。
  • E-Commerce Bench arXiv:2608.30730 QwenLM 365 天电商场景 Agent 评测:v85 Q105.228 v85 候选新增预备级(沿用)= agent 主轴邻接级 anchor 缺位(与 v83 #180 SWE-bench Science 跨域 Coding Agent 邻接级 + v84 RoboTok 跨主轴预备级延展预备触发预备级)。建议归入 agent.md §3.3 Q105.228 v85 候选新增 = 电商场景 365 天 Agent 评测预备级 = 跨域 Coding Agent 评测延展预备级(不入立标池,P2 截止 9-15 缺口补强)。
  • openJiuwen 动态 Agent Harness arXiv:2608.27969 Claude Code 上 84.04% SOTA:v85 #190 已 anchor 候选 ☆ 预备级 = agent 主轴 anchor 缺位(动态 Agent Harness 平台评测 = frontier lab 厂商 harness 评测对照预备触发预备级)。
  • Managed Deep Agents(hwchase17 / LangChain 正式发布):v85 #E16 已 anchor 事件级 ★ 预备级 = LangChain Agent 体系更新 + 多步搜索合成工作流。
  • Sam Altman 9-4 Astra 道歉帖 + banked reset 补偿机制:v85 #E17 已 anchor 事件级 ★ 预备级 = frontier lab 危机管理立标预备第 1 例。
  • Claude Fable 5.1 / Mythos 5.1 EU AI Act 水印 + cache read -75% + 科学基准 24.7→52.6%:v85 Q105.231 v86 沿用预备级 = agent 主轴邻接级 anchor 缺位 = frontier lab EU AI Act 水印合规预备级。
  • HarnessDev arXiv:2609.01437(ByteDance-Seed):coding-agents.md v72 早棒位已 anchor 立标 ★★★ + jay 9-7 1144 news-x-tech-radar §干货候选 = v86 frontier lab harness 工程方法学立标预备延展预备级。
  • Repo-To-Skill arXiv:2609.02749(AREX-Skill Library):jay 9-7 1144 news-x-tech-radar = coding-agents.md v72 早棒位预备级 anchor 缺位(与 v82 #178 沿用预备级一致)。
  • Ken Huang Substack Chapter 1 Preview Roofline Model(jay 9-7 1052 llm-inference-systems-kvcache):engineering 主轴备料,不入 agent 主轴立标池。
  • Internet for the KV Cache arXiv:2608.01526(jay 9-7 1052):engineering 主轴备料,不入 agent 主轴立标池。
  • AsymCache arXiv:2606.02964 / SAC arXiv:2606.19746 / LLM-Enhanced Log Anomaly Detection arXiv:2604.12218(jay 9-7 1052):engineering 主轴备料,不入 agent 主轴立标池。
  • Random Attention arXiv:2609.03430(tom 9-7 0900 HF Daily 164▲):engineering 主轴备料,不入 agent 主轴立标池。
  • jay 9-7 1050 jay-engineering-filter vLLM/SGLang/LMDeploy 基准 + Agentic RAG 成本 3-10x tokens + 2-5x latency + LangChain State of Agent Engineering 57% production + 32% 质量 top barrier:v86 §4 已沿用 engineering 邻近内容。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。
  • tom 2026-09-07-rag-e1prep.md R83:v86 §4 已沿用 Tom R83 件套。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。
  • flyp 2026-09-07-multimodal-e1prep.md multimodal 主轴备料:v86 §4 已沿用 multimodal 邻接级 RoboTok + Compile by Training / Terminal-Universe / LLaDA-Image 等。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。
  • stephen 2026-09-07-1245-coord-check-noon.md noon 棒位:v86 §4 已锚入 noon 棒位件套。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。
  • spark 9-7 1001-1004 RSS 三份(gradient-flow "九条 Agent 实战规则" / chip-huyen Agents 主题页 / 3blue1brown 数学视频):均为二手综述 / RSS 摘要 / 数学视频,无新 arXiv / 事件级 net-new。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备(Gradient Flow "九条 Agent 实战规则"作为增量 5 沿用预备级)。
  • jay 9-7 RSS 9 份早棒(lilian-weng / nathan-benaich / simon-willison / bytebytego / raschka / import-ai / msr-blog / karpathy / fireship):均为二手综述 / RSS 摘要,无新 arXiv / 事件级 net-new。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。
  • stephen 9-7 1002-1005 RSS 9 份早棒(bens-bites / tldr-ai / hf-blog / google-ai / deepmind-news / anthropic-news / openai-news / yt-deepmind / yt-anthropic / yt-openai):均为二手综述 / RSS 摘要,无新 arXiv / 事件级 net-new。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。
  • work-queue.md(2026-09-07 12:00):高价值待深度解读 Top 15 = 0;待更新/缺失主题活文档 = 0;待写攻略 = 7 件(2608.11632 / 2608.08311 / 2608.07594 / 2608.25204 / 2609.02887 / 2608.26070 / 2608.07468);待写攻略 Tom/Jay/spark 认领 = 0;富化缺口 15 张卡缺 TLDR;待精确分类 0 张卡。说明没有新建立的攻略任务触发,本轮仅 agent 主轴增量。
  • v86 §本次变更段"v86 候选预备级锚入预备级不扩向稳态方法学"沿用:v86 §2.2 "立标池双向锚 v83 70 向沿用稳态 + v83 候选预备级 9 件预备级锚入预备级不扩向稳态沿用" + v86 RoboTok + ICLR 2026 TTL + Tom Substack 双源升档 + frontier lab 收购案框架性误导补强候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破。本轮增量 5 件候选预备级(8 件 coding-agents v72 早棒位 + 4 件 jay 1105 briefing + Tom R83 Codefarm + CSDN 三件套 + Gradient Flow 九条实战规则)= v87 候选预备级 14 件(8 + 4 + 1 + 3 + 1 - 沿用 v86 = 沿用稳态)锚入预备级不扩向稳态沿用方法学一致 = v87 应沿用预备级不扩向稳态方法学。

四、值得警惕的矛盾与待核实说法

  1. v86 立标池 75 向稳态 + RoboTok anchor 缺位补强 + 8 件 coding-agents v72 早棒位在 agent 主轴预备级缺位 = v87 立标池 75 向稳态沿用 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发 = "v83 候选预备级锚定命中 9/9 = 100% 沿用稳态方法学"沿用预备级 = v87 应沿用预备级不扩向稳态方法学一致。
  2. coding-agents.md v72 早棒位 8 件与 agent.md v86 在 agent 主轴预备级缺位的边界:8 件 coding-agents.md v72 早棒位已锚入立标在 coding-agents 主轴 = #P1 #255 VeriPhy + #P1 #256 PILOT in the Loop + #P1 #257 MASkills + Q105.230 DRACO + Q105.231 Random Attention + Select-Compress-Reinvest + HEART + ContextPipe + EARM + Codebook Agent;agent 主轴预备级缺位预备触发预备级。建议 v87 §2.3 立标节点候选新增触发预备级(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破)= #191 PILOT in the Loop + #192 MASkills + #193 HEART + #194 ContextPipe + #195 EARM + #196 Codebook Agent + #197 Select-Compress-Reinvest = 7 件 ☆-★ 候选预备级。
  3. jay 1105 briefing 4 件 arXiv 2026.6 件完整溯源待补:TreeSeeker + DuMate-DeepResearch + ActiveMem + Agent-Orchestrated Adaptive RAG arXiv 编号 + CompactRAG ACM Web Conf 2026 编号 + GeoAgentic-RAG Elsevier JAG 2026 编号均待追溯;paper_card 暂未入库 ⚠️ v87 沿用预备级。建议 jay 9-7 evening 棒位或 9-8 早棒位追溯 arXiv 编号;如完整溯源成功,则 v87 §2.3 立标节点候选新增触发预备级 #198-#201。
  4. CSDN 工程博客时效性折扣与版本核验(沿用 9-4 spark-e1prep 矛盾 5):jay 1100 / 1220 CSDN 件套含具体 API 版本号(vLLM 0.8.5 + SGLang 0.4.6 + Pyserini+RankLLM SIGIR 2026 / OpenAI 兼容接口 + LangChain 集成代码),时效性折扣预备级沿用。CSDN ADG "MCP 2026-07-28 无状态化更新"需对照官方规范 SEP blog.modelcontextprotocol.io/posts/2026-07-28 交叉验证预备级;建议 jay 9-7 evening 棒位或 9-8 早棒位核验。
  5. Tom R83 Codefarm "Long Context vs RAG in 2026" 与 v86 #95 争议预备级强一致 = "RAG is Dead 争议与生产层 RAG 必备性张力"预备级 = "什么塞进上下文 vs 什么按需检索 vs 什么作为 agent memory 三取舍形式化预备级" = #94 Memory 安全威胁模型预备级沿用 + #95 v86 candidate + #97 v87 candidate Codefarm 沿用预备级 = 7 栖争议预备级沿用稳态。
  6. Gradient Flow "Agent 干实事时的九条实战规则"具体内容待核:Gradient Flow Substack 通讯为 2026-09 二次筛选,无完整九条规定条目;建议 jay 9-7 evening 棒位或 9-8 早棒位全文核验;与 v86 frontier lab harness 工程方法学立标预备(Scaling the Harness + openJiuwen)+ Chip Huyen Agents 主题页预备级一致 = 7 栖社区收敛性架构预备级。
  7. 二手 CSDN 与协调材料存在"发布日期/架构版本"风险(沿用 9-4 spark-e1prep 矛盾 5):jay 1050 engineering-filter 已显式标注 Ollama 并发劣势 + TGI archived 2026-03-21 + CVE-2026-0599 等修订 = 工程时效性折扣预备级沿用;stephen noon 棒位已显式修订 frontier lab 收购案框架性误导 = 沿用预备级。
  8. v86 候选预备级锚入预备级不扩向稳态的方法学延展:v86 §2.2 "立标池双向锚 v83 70 向沿用稳态 + v83 候选预备级 9 件预备级锚入预备级不扩向稳态沿用" + v86 RoboTok + ICLR 2026 TTL + Tom Substack 双源升档 + frontier lab 收购案框架性误导补强候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破。本轮增量 14 件 v87 候选预备级(8 件 coding-agents v72 早棒位 + 4 件 jay 1105 briefing + Tom R83 Codefarm + CSDN 三件套 + Gradient Flow 九条实战规则)+ v86 沿用预备级 = v87 应沿用预备级不扩向稳态方法学一致 = 第三十五脉络预备级候选预备 v87 触发预备级预备触发
  9. paper_card 入库实测 vs 立标池 anchor 缺位补强:coding-agents.md v72 早棒位 4 件 paper_card 入库实测 = DRACO 1231 + VeriPhy 1233 + RoboTok 1236 + Select-Compress-Reinvest 1227 + Locked at the Entrance 1235 = 5 件 anchor 缺位补强(不破候选预备级锚入预备级不扩向稳态方法学)。v82 #176 Terminal-Universe paper_card 仍未入库 ⚠️ = v82 anchor 缺位延续预备级(与 9-4 spark-e1prep 矛盾 7 一致);建议 v87 §本次变更段"v87 候选预备级锚入预备级 14 件 + paper_card 入库实测补强 5 件 + Terminal-Universe paper_card 仍未入库" 沿用预备级。
  10. Spark 9-7 棒位恢复稳态节奏(沿用 stephen 9-6 1245-coord-check-noon 矛盾 ⑦):spark inbox 9-5 22:45 → 9-6 13:30 17h 窗口内仅 3 件 RSS 棒位(gradient-flow + chip-huyen + 3blue1brown),0 件 e1prep 棒位(agent / llm-infra / risk)。本棒(agent E1 预消化)是 spark 9-6 棒位恢复的 首件 e1prep 棒位(周日棒位节奏缩量延续的恢复起点)。本棒为 spark 9-7 第 2 件 e1prep 棒位(周日棒位节奏缩量延续的延续),建议 spark 9-7 evening 接力棒位补足 risk-e1prep(沿 9-4 evening + 9-5 evening 件套),以恢复周三-周五稳态节奏。
  11. v86 立标池 75 向稳态 vs v87 立标池 75 向稳态:v86 立标池 75 向 = 70 沿用 + 5 候选预备级(#186-#190)+ RoboTok 立标中-高首次续立升档实测承接棒预备触发预备级 + Tom Substack 双源升档预备扩增 + frontier lab 收购案框架性误导补强;v87 立标池 75 向稳态沿用预备级 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发 = 14 件 v87 候选预备级锚入预备级不扩向稳态沿用方法学一致 = v87 §本次变更段"v86 沿用稳态 75 向 + 14 件 v87 候选预备级(8 + 4 + 1 + 3 + 1 - 沿用 v86 = 沿用稳态)锚入预备级不扩向稳态方法学一致 + 立标池 75 向稳态沿用"
  12. stephen 9-7 1245 coord-check-noon 棒位独立验证:含 agent 主轴汇总 + Sam Altman 9-4 道歉帖 banked reset + 8 件记忆系统立标预备 + 5 件矛盾待核 + 0 件 net-new 立标升级 = v86 §4 已锚入 noon 棒位件套。不入 agent 主轴立标池,仅作 v86 §4 跨实例审稿链备料沿用预备。

五、可引用的 arXiv 号列表

本轮直接涉及、且建议今晚优先核对或引用的编号(v87 候选预备级候选新增触发预备级):

  • arXiv:2608.26530 — PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + agent 主轴预备级缺位补强 + live-improvement 新一维预备第 1 例)
  • arXiv:2609.03153 — VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1233 9-7 12:30 入库 ✓ + 物理义务编译 + 冻结低层专家分层规划预备级)
  • arXiv:2609.02094 — MASkills: Continual Skills Optimization for Multi-Agent(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + agent 主轴预备级缺位补强 + skill-conditioned credit assignment + 层级 credit aggregation + momentum-smoothed optimization + EMNLP 2026 Findings)
  • arXiv:2609.01736 — HEART: Harness Engineering via Agent-Native Tool Primitives(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + agent 主轴预备级缺位补强 + 25,519 函数规模 + 5 benchmark +10% / GPT-5.4/Claude-4.6/Gemini-3.1 +6% / API 成本 -85%)
  • arXiv:2609.00749 — ContextPipe: Database-inspired Context Assembly for Long-Horizon Agents(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + agent 主轴预备级缺位补强 + token -31% / LLM 调用 -23% / 响应时间 -9%)
  • arXiv:2608.22767 — EARM: Experience-Amortized Reranking for Agent Memory(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + agent 主轴预备级缺位补强 + LLM 打分 -82.5%)
  • arXiv:2609.02264 — Codebook Agent: Amortized Topology Design for Multi-Agent(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + agent 主轴预备级缺位补强 + VQ-VAE 16-entry codebook + 2.4ms / token -21.9~33.2%)
  • arXiv:2609.03820 — Select-Compress-Reinvest: Visual-Token Allocation in Long-Video MLLMs(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + paper_card 1227 9-7 12:30 入库 ✓ + HF Daily 15▲ + 长视频 Agent 长程视觉感知效率优化)

本轮涉及但溯源待补的编号(jay 1105 briefing 综合简报 arXiv 2026.6 件 · 完整 arXiv 编号溯源待 jay 9-7 evening 棒位或 9-8 早棒位追溯):

  • TreeSeeker(arXiv 2026.6 · jay 1105 briefing #1)——编号待追溯
  • DuMate-DeepResearch(arXiv 2026.6 · jay 1105 briefing #2)——编号待追溯
  • ActiveMem(arXiv 2026.6 · jay 1105 briefing #3)——编号待追溯
  • Agent-Orchestrated Adaptive RAG(arXiv 2026.6 · jay 1105 briefing #4)——编号待追溯
  • CompactRAG(ACM Web Conference 2026 · jay 1105 briefing #6)——编号待追溯
  • GeoAgentic-RAG(Elsevier JAG 2026 · jay 1105 briefing #5 · https://www.sciencedirect.com/science/article/pii/S1569843226001111)——编号待追溯
  • MCP Servers for Pyserini + RankLLM(SIGIR 2026 · jay 9-7 0943 ai-engineering-trends · https://cs.uwaterloo.ca/~jimmylin/publications/Ge_etal_SIGIR2026_MCP.pdf)

已存在、作为邻接或补强引用

  • arXiv:2609.03199 — RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning(v86 #184 已 anchor 候选 ☆ 预备 + paper_card 1236 9-7 12:30 入库 ✓ + HF Daily 9-7 早棒 115▲ #6 +36▲ 立标中-高首次续立实测承接;不扩向稳态)
  • arXiv:2609.04199 — Compile by Training: Turning Natural-Language Specifications into Local Neural Functions(v83 #177 已 anchor;paper_card 1220 ✓;HF Daily 9-7 早棒 317▲ #1 +7▲ 立标极显著首次续立饱和)
  • arXiv:2609.04148 — Terminal-Universe: 将 Agent 轨迹转化为可扩展的终端环境(v82 #176;paper_card 仍未入库 ⚠️;HF Daily 9-7 早棒 272▲ #2 +7▲ 立标极显著首次续立饱和)
  • arXiv:2609.0XXXX — LLaDA-Image(v86 #332 候选 ☆ 预备新增沿用稳态;HF Daily 9-7 早棒 228▲ #3 +6▲ 立标极显著首次续立饱和;编号溯源沿用 v86 沿用稳态)
  • arXiv:2608.29188 — Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space(paper_card 1235 9-7 12:30 入库 ✓ 主分类 llm-infra;coding-agents.md #P2 #236 沿用预备;agent 主轴邻接级)
  • arXiv:2609.04094 — DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training(v82 #173;coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1231 9-7 12:30 入库 ✓ + HF Daily 9-7 早棒 24▲ = coding-agents.md anchor 缺位补强)
  • arXiv:2609.03430 — Random Attention: Rethinking KV Cache Eviction(tom 9-7 0900 HF Daily 164▲ · engineering 主轴备料 · 不入 agent 主轴立标池)
  • arXiv:2608.01526 — An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age(engineering 主轴备料 · 不入 agent 主轴立标池)
  • arXiv:2606.02964 — AsymCache / Multi-Segment Attention(engineering 主轴备料 · 不入 agent 主轴立标池)
  • arXiv:2606.19746 — SAC: CXL Disaggregated KV Cache(engineering 主轴备料 · 不入 agent 主轴立标池)
  • arXiv:2604.12218 — LLM-Enhanced Log Anomaly Detection Benchmark(engineering 主轴备料 · 不入 agent 主轴立标池)
  • arXiv:2608.30730 — E-Commerce Bench(v85 Q105.228 v85 候选新增预备级 + 365 天电商场景 Agent 评测;agent 主轴邻接级 anchor 缺位)
  • arXiv:2608.27969 — openJiuwen 动态 Agent Harness 平台(v85 #190 已 anchor 候选 ☆ 预备级 + Claude Code 上 84.04% SOTA;agent 主轴候选预备级 anchor 缺位)
  • arXiv:2609.01437 — HarnessDev(coding-agents.md v72 早棒位已 anchor 立标 ★★★ + ByteDance-Seed)
  • arXiv:2609.02749 — Repo-To-Skill(coding-agents.md v72 早棒位预备级 anchor 缺位 + AREX-Skill Library)
  • arXiv:2607.19793 — Silent Failures in Multimodal Agentic Search(v85 #189 已 anchor 候选预备级;SIGIR 2026 SynthIR Workshop;6 类失败分类法立标预备第 1 例)
  • arXiv:2605.26112 — Scaling the Harness in Agentic AI(v85 #187 已 anchor 候选预备级;frontier lab harness 工程方法学立标预备第 1 例;Claude Code / OpenClaw / CheetahClaws 三 harness 对照)
  • arXiv:2604.16548 — A Survey on the Security of Long-Term Memory in LLM Agents(v85 #188 已 anchor 候选预备级;frontier lab 记忆系统安全立标预备第 1 例;90% 记忆中毒 + 100% 自我纠正复发率)
  • arXiv:2607.02558 — 检索质量 / 序列处理能力 / 随时间适应能力三维评测预备级(v85 jay 1105 briefing 引用 · paper_card 待溯源)
  • arXiv:2603.03589 — PVLDB 2026 (Vol. 19, No. 11)(v85 jay 1105 briefing 引用 · paper_card 待溯源)
  • arXiv:2602.16666 — Towards a Science of AI Agent Reliability(ICML 2026;flyp critical-read 对照预备级)

v86 已 anchor 候选预备级

  • arXiv:2609.03199 — RoboTok(v86 #184;paper_card 1236 ✓;不扩向稳态)
  • arXiv:2506.xxxxx — ICLR 2026 RAG vs Long-Context TTL 论文(v86 #185;proceedings.iclr.cc/paper_files/paper/2026/file/fd1eff9dd295df50a41f2521942fa31d-Paper-Conference.pdf;Efficiency-Capacity Trade-off 形式化预备级;不扩向稳态)
  • arXiv:2605.26112 — Scaling the Harness(v85 #187 ★★ 候选预备级;frontier lab harness 工程方法学立标预备第 1 例)
  • arXiv:2604.16548 — Memory Security Survey(v85 #188 ★★ 候选预备级;frontier lab 记忆系统安全立标预备第 1 例)
  • arXiv:2607.19793 — Silent Failures(v85 #189 ☆ 候选预备级;评测方法学 6 类失败分类法立标预备第 1 例)
  • arXiv:2608.27969 — openJiuwen(v85 #190 ☆ 候选预备级;动态 Agent Harness 平台)

v87 候选预备级候选新增触发预备级(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破)

  • 191 PILOT in the Loop arXiv:2608.26530 ☆ 候选预备级(增量 1 · live-improvement 新一维预备第 1 例)

  • 192 MASkills arXiv:2609.02094 EMNLP 2026 Findings ★ 候选预备级(增量 1 · 多 Agent 持续技能演化新一维预备第 1 例)

  • 193 HEART arXiv:2609.01736 ★ 候选预备级(增量 1 · Harness Engineering via Agent-Native Tool Primitives)

  • 194 ContextPipe arXiv:2609.00749 ☆ 候选预备级(增量 1 · Database-inspired Context Assembly for Long-Horizon Agents)

  • 195 EARM arXiv:2608.22767 ☆ 候选预备级(增量 1 · Experience-Amortized Reranking for Agent Memory)

  • 196 Codebook Agent arXiv:2609.02264 ☆ 候选预备级(增量 1 · Amortized Topology Design for Multi-Agent)

  • 197 Select-Compress-Reinvest arXiv:2609.03820 ☆ 候选预备级(增量 1 · 长视频 MLLM 帧选择/空间压缩/token 节省再投资)

  • 198 TreeSeeker(arXiv 2026.6 编号待追溯)☆ 候选预备级(增量 2 · 树结构搜索+试错回退新一维 + Deep Search 预备第 1 例)

  • 199 DuMate-DeepResearch(arXiv 2026.6 编号待追溯)☆ 候选预备级(增量 2 · 递归搜索 + Rubric-Grounded Reasoning 多 Agent Deep Research 新一维)

  • 200 ActiveMem(arXiv 2026.6 编号待追溯)☆ 候选预备级(增量 2 · Distributed Active Memory for Long-Horizon LLM Reasoning 新一维)

  • 201 Agent-Orchestrated Adaptive RAG(arXiv 2026.6 编号待追溯)☆ 候选预备级(增量 2 · 自适应 RAG 新一维)


六、跨主轴锚入与本主题与其它主题活文档的边界(沿用 v86 + v87 候选预备级跨主轴锚入预备级沿用稳态)

v82 跨主轴锚入 8 件 + v83 Compile by Training 1 件 + v84 RoboTok arXiv:2609.03199 跨主轴 rag/benchmark/multimodal 主分类 1 件 + v85 候选预备级 5 件跨主轴锚入预备级不扩向稳态沿用 = Yandex "KV Cache as Agent Runtime" 跨主轴 engineering/llm-infra/multimodal 主分类 + Scaling the Harness arXiv:2605.26112 跨主轴 engineering/llm-infra 主分类 + Memory Security Survey arXiv:2604.16548 跨主轴 risk/llm-infra 主分类 + Silent Failures arXiv:2607.19793 跨主轴 evaluation/multimodal 主分类 + openJiuwen arXiv:2608.27969 邻接级 + 与 rag.md / risk.md / llm-application.md / coding-agents.md / engineering.md / multimodal.md 六向 reference + v84 跨主轴锚入 RoboTok 沿用稳态 + ICLR 2026 TTL 论文跨主轴锚入 rag.md 沿用稳态预备触发 + v85 跨主轴锚入 5 件沿用稳态预备触发 + v86 Tom Substack 双源升档预备扩增跨主轴锚入预备级沿用稳态 = Stamile "Agent Memory Is Not RAG" + AlphaSignal α-mem frontier lab 通讯订阅生态立标预备跨主轴 rag/risk/llm-application 主分类预备扩增稳态。

v87 候选预备级跨主轴锚入预备级预备触发(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破)

  • coding-agents.md v72 早棒位 8 件 → agent.md v87 候选预备级 7 件跨主轴锚入预备级 = PILOT in the Loop + MASkills + HEART + ContextPipe + EARM + Codebook Agent + Select-Compress-Reinvest
  • jay 1105 briefing 4 件 arXiv 2026.6 件 → agent.md v87 候选预备级 4 件跨主轴锚入预备级 = TreeSeeker + DuMate-DeepResearch + ActiveMem + Agent-Orchestrated Adaptive RAG
  • Tom R83 Codefarm + CSDN 三件套 + Gradient Flow 九条实战规则 → agent.md v87 §3.1 共识 #235-237 + §3.2 争议 #97 + §3.3 开放问题 Q105.248-249 + §3.4 趋势 T222-T225 跨主轴锚入预备级

v87 §本次变更段"v87 沿用稳态 75 向 + 14 件 v87 候选预备级(8 + 4 + 1 + 3 + 1 - 沿用 v86 = 沿用稳态)锚入预备级不扩向稳态方法学一致 + 立标池 75 向稳态沿用 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发"


诚实度声明:本棒为 v86 落定后约 3h 接力备料(10:30 → 13:30 CST),基于 inbox/jay/tom/flyp/stephen/spark 五向 inbox 2026-09-06 13:36 → 2026-09-07 12:46 共 50+ 份文件交叉验证 + paper_cards 8 张净增(1230/1234/1235/1233/1236/1227/1231/1232/284)+ work-queue.md(2026-09-07 12:00)+ v86 完整基线 + coding-agents.md v72 早棒位 8 件已锚立标交叉参照;未抓 PDF 全文,仅基于 inbox 件套摘要 + paper_card 元数据 + arXiv 公开摘要;本轮性质为 v86 落定后微小新增 + v87 接力棒预备触发清单 + 第三十四脉络预备级候选预备 v86 沿用稳态 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发;v87 候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破;截止 9-15 P1 缺口补强(coding-agents.md v72 早棒位 #P1 #255/#256/#257 + agent.md v87 候选预备级 Q105.234-249 预备触发)。