coding-agents · E1 预消化简报(2026-09-26)

执行体:flyP · E1 日间预消化轮(coding-agents 主题) 窗口:2026-09-25 23:20 CST(v86 evening 棒落定后 24h)→ 2026-09-26 23:20 CST(24h 净窗口) 承接基线:organized/knowledge/coding-agents.md v87 早棒(9-26 10:00 CST 落定 · 218 arXiv + 20 CVE + 368 URL · §2.1 160→162 栖 + §2.4 64→67 栖 + §2.5 214→216 件套 + §2.6 89→92 例 · missing = 0 校验通过) 诚实度声明:v87 早棒已立项 5 件 9-25 evening 立标 net-new(Coding Agents TAMP / IterSynth / JustAsk Jev / World Action Agent / PUBG Ally · §2.1/§2.4/§2.5/§2.6 全部承接稳态)。本棒净增定位 = coding-agents 主轴 9-26 24h 净增 5 件预备级候选未入池 + 1 件立标信号 + 3 件 frontier lab 大事件 + 3 件件套/评测预备级;所有立标等级独立核验预备级预备触发。 数据来源: - coding-agents.md v87 早棒主文件(已读完整) - inbox/tom/2026-09-26-agent-rag-longcontext-radar.md(8 候选 + Linear Superposition ⭐⭐⭐⭐ + Coding Agents TAMP + JustAsk Jev 锚定) - inbox/tom/2026-09-26-0900-hf-daily-2026-09-26.md(15 件立标 · 物体永久性 178▲ #1 顶置新立 + Linear Superposition 55▲ #3) - inbox/tom/2026-09-26-evaluation-e1prep.md(Just Ask Jev 立标 = 评测方法学第九元组预备扩位) - inbox/tom/2026-09-26T1440-agent-rag-longcontext-radar.md(Mem0 81.1% LoCoMo 独立测试 + Mem0 v3 append-only) - inbox/jay/2026-09-26T0935-jay-github-hf-vecdb-agentic-substack-trending-sep26.md(Google/ax 11,515⭐ · NVIDIA/Model-Optimizer 4,481⭐ · vectorize-io/hindsight 29,823⭐ · Jev 决策生态 · OpenSearch 2026) - inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md(MCP 2026-07-28 无状态化 ⭐⭐⭐⭐⭐ + arXiv 2605.01604 Agentic AI 生产评估 7 失败模式 ⭐⭐⭐⭐⭐) - inbox/jay/2026-09-26T1450-jay-inference-agentic-framework-sep26.md(uvik.net Agentic AI Frameworks 2026 生产选型 + Princeton HAL 30pp 差距 + LangGraph/CrewAI/Pydantic AI/OpenAI Agents SDK 大改版/Microsoft Agent Framework 合并) - inbox/jay/2026-09-26-engineering-e1prep.md(NVIDIA SkillSpector 26.1% 公开 agent skills 含漏洞 ⭐⭐⭐⭐ + Belayer/MAS-FIRE/FALAT/CLEAR/arXiv 2608.14635/2602.19843/2606.00765/2511.14136) - inbox/jay/2026-09-26-five-category-briefing.md(CLEAR 五维评测 实验室 vs 生产 37% 差距 + SkillSpector 64 种漏洞模式 + OpenSearch 2026) - inbox/jay/2026-09-26T1220-jay-csdn-vllm-embedding-langgraph-mcp-highvalue-sep26.md(LangGraph MCP stdio/SSE + LangChain MultiServerMCPClient 实战) - inbox/spark/2026-09-26-agent-e1prep.md(72KB · v103 baseline 已极密集 · 主分类 agent net-new 净增量 = 0 件 · Multi-Agent Harness 5 件 + vectorize-io/hindsight + SkillSpector + frontier 治理 32 → 38 源件套扩增稳态 + 5 件 9-26 net-new) - inbox/stephen/2026-09-26-ai-industry-e1prep.md(8 件 ai-industry net-new + frontier lab 治理 32 → 37 源件套扩增稳态 + Just Ask Jev + Rufus-Air + 16 件 paper_card 9-26 入库) - inbox/stephen/2026-09-26-stephen-coordination-check-noon.md(75KB · SkillSpector + Long-Running Workshop + MCP 2026-07-28 + Jev 决策生态 五实例对账一致) - inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-notes.md(34KB · AgentKernel + JitMem + MemoryAthena 三连方法论级长稿) - inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-reviews.md(48KB · AgentKernel + JitMem + MemoryAthena 三连反方审稿 · 12 条高严重度反方证据) - inbox/flyp/2026-09-26-risk-e1prep.md(Just Ask Jev = risk 主分类 5 日空窗终结 + AgentKernel OS substrate 预备级第 1 例 + SkillSpector + 评测 23→28 维预备扩增) - inbox/flyp/2026-09-25-coding-agents-e1prep.md(v86 evening 棒候选承接备料 · 1 件主分类 agent net-new = SAT + 8 件承接候选 + OpenAI 智能体试探入侵政府/大学网站 = frontier lab Agent 安全边界危机预备第 1 例) - paper_cards/1518-2609.29647(AgentKernel ✓ 9-25 入库)· paper_cards/1504-2609.26489(Calibration ✓)· paper_cards/1492-2609.27334(JIT Memory ✓)· paper_cards/1505-2609.25853(MemoryAthena ✓)· paper_cards/1521-2609.29429(Just Ask Jev ✓ 9-26 入库) - work-queue 9-26 22:00(待深度解读 0 件 + 选题榜未成视频脚本 7 件 = 2609.29421 / 2609.29362 / 2609.29845 / 2609.30233 / 2609.29429 / 2609.27334 / 2609.27657)


〇、检查过的来源清单(可审计)

# coding-agents 活文档
organized/knowledge/coding-agents.md v87 早棒(已读完整 · 218 arXiv + 20 CVE + 368 URL)

# tom 文献雷达 + HF Daily + 评测
inbox/tom/2026-09-26-agent-rag-longcontext-radar.md(8 候选 + Linear Superposition ⭐⭐⭐⭐)
inbox/tom/2026-09-26-0900-hf-daily-2026-09-26.md(15 件立标 · 物体永久性 178▲ #1 顶置新立)
inbox/tom/2026-09-26-evaluation-e1prep.md(Just Ask Jev 立标 = 评测方法学第九元组预备扩位)
inbox/tom/2026-09-26T1440-agent-rag-longcontext-radar.md(Mem0 81.1% LoCoMo 独立测试 + Substack AI Agent Memory KTH IEEE COMPSAC 2026)
inbox/tom/2026-09-26T2040-agent-rag-longcontext-radar.md(Coding Agents TAMP + RLCDAlignBench + LongMemEval)

# jay 工程 + GitHub + Substack + 推理引擎
inbox/jay/2026-09-26T0935-jay-github-hf-vecdb-agentic-substack-trending-sep26.md(Google/ax · NVIDIA/Model-Optimizer · vectorize-io/hindsight · Jev 决策生态)
inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md(MCP 2026-07-28 + arXiv 2605.01604 Agentic AI 生产评估 7 失败模式)
inbox/jay/2026-09-26T1450-jay-inference-agentic-framework-sep26.md(Agentic AI Frameworks 2026 生产选型 + Princeton HAL 30pp 差距)
inbox/jay/2026-09-26-engineering-e1prep.md(NVIDIA SkillSpector + Belayer/MAS-FIRE/FALAT/CLEAR)
inbox/jay/2026-09-26-five-category-briefing.md(CLEAR + SkillSpector + OpenSearch)
inbox/jay/2026-09-26T1220-jay-csdn-vllm-embedding-langgraph-mcp-highvalue-sep26.md(LangGraph MCP stdio/SSE + LangChain MultiServerMCPClient)

# spark E1 棒
inbox/spark/2026-09-26-agent-e1prep.md(72KB · v103 baseline 已极密集 · 主分类 agent net-new 净增量 = 0 件 · Multi-Agent Harness 5 件 + vectorize-io/hindsight + SkillSpector + frontier 治理 32 → 38 源件套扩增稳态)

# stephen 协调 + ai-industry
inbox/stephen/2026-09-26-ai-industry-e1prep.md(8 件 ai-industry net-new + frontier lab 治理 32 → 37 源件套扩增稳态)
inbox/stephen/2026-09-26-stephen-coordination-check-noon.md(75KB · SkillSpector + Long-Running Workshop + MCP 2026-07-28 + Jev 决策生态 五实例对账一致)

# flyp 周末精读 + risk
inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-notes.md(34KB · AgentKernel + JitMem + MemoryAthena 三连方法论级长稿)
inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-reviews.md(48KB · AgentKernel + JitMem + MemoryAthena 三连反方审稿)
inbox/flyp/2026-09-26-risk-e1prep.md(Just Ask Jev = risk 主分类 5 日空窗终结 + AgentKernel OS substrate 预备级第 1 例 + SkillSpector)
inbox/flyp/2026-09-25-coding-agents-e1prep.md(v86 evening 棒候选承接备料 · SAT + 8 件承接候选 + OpenAI 智能体试探入侵政府/大学网站)

# paper_cards 9-25 evening → 9-26 morning 入库(17 件主分类或邻接级)
organized/paper_cards/1510-2609.22682.md(SAT Self-Organizing Agent Teams · 主分类 agent)
organized/paper_cards/1511-2609.29444.md(IterSynth · Deep Search Agent 第 2 例)
organized/paper_cards/1512-2609.29837.md(PUBG Ally · 对话式具身 Agent)
organized/paper_cards/1513-2609.29964.md(WAA World Action Agent · Multi-Agent Harness 第 5 例)
organized/paper_cards/1514-2609.29421.md(Rufus-Air Open LLM Post-Training Recipe · 8 阶段流水线)
organized/paper_cards/1515-2609-28923.md(ViRDM 少步长因果视频生成 · multimodal 邻接)
organized/paper_cards/1516-2609-23407.md(OmniEcho 空间音频-视觉-语言具身 benchmark)
organized/paper_cards/1518-2609-29647.md(AgentKernel Trust-Native Agentic OS · paper_card 1518 ✓ 9-25 入库 · 主分类 agent)
organized/paper_cards/1519-2609-29362.md(PoS as SAE Latent)
organized/paper_cards/1520-2609-30233.md(Coding Agents for TAMP)
organized/paper_cards/1521-2609-29429.md(Just Ask Jev RLCD 零样本对齐失败检测 · 主分类 risk 副 evaluation)

# work-queue
organized/queue/work-queue.md 9-26 22:00(待深度解读 0 件 + 选题榜未成视频脚本 7 件)

关键发现:v87 早棒已立项 5 件 9-25 evening 立标 net-new(全部 anchor 入池 ✅);9-26 24h 净增 = 6 件预备级候选 = AgentKernel 2609.29647 + arXiv 2605.01604 + arXiv 2608.14635(Belayer)+ arXiv 2602.19843(MAS-FIRE)+ arXiv 2606.00765(FALAT)+ arXiv 2511.14136(CLEAR)+ 1 件立标信号(OmniEdu 9-26 跌出确认)+ 3 件 frontier lab 大事件(Claude N=4 SYM 九圈振幅 + Gemini 4 post-training 9-24 表态 + MCP 2026-07-28 无状态化)+ 3 件件套/评测预备级(NVIDIA SkillSpector + Jev/TypeSafe AI/System One 决策生态 + Google/ax / NVIDIA/Model-Optimizer / vectorize-io/hindsight 三件 T0 net-new)。


一、今日(9-26)coding-agents 主题最重要的 5 条增量

增量 ① AgentKernel arXiv:2609.29647 paper_card 1518 ✓ 9-25 入库 = "Trust-Native Agentic Operating System" = coding-agents 主轴 9-26 净增头号预备级候选 ⚠⚠⚬⚠⚬

来源:paper_card 1518 ✓(9-25 12:30 入库 · 主分类 agent · 形态 application · 38 pages / 5 figures / 103 KB · cs.CR/cs.AI 双分类 · v1 2026-08-29 · Qiuyang Zhan 提交)+ inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-notes.md §4 必读 #1(38 页 framework 描述完整)+ inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-reviews.md 反方审稿 R-1(48KB · 12 条高严重度反方证据 + R-1.2.5 semantic-to-kernel interface 设计为 P0 切入)+ inbox/flyp/2026-09-26-risk-e1prep.md §增量 ②(risk + agent 双主轴预备级第 1 例 + Agent 安全栖第七栖扩增 ⚠⚬⚬)+ inbox/spark/2026-09-26-agent-e1prep.md §增量 ⑥(Multi-Agent Harness 5 件 net-new + "Agent OS 立标预备第 1 例")+ inbox/stephen/2026-09-26-ai-industry-e1prep.md §4.1 + inbox/tom/2026-09-26T2040-agent-rag-longcontext-radar.md(候选 #1)+ HF Daily 4▲(票数偏低但方法论贡献高 = "silent revolution"型工作)

要点:现代 AI Agent 频繁跨越信任边界(ingest untrusted content + combine with privileged instructions + persist intermediate beliefs in long-term memory + invoke privileged tools)= 攻击面使得恶意载荷可通过模型输入进入并触发有害工具动作;当前治理栈仍是 application-level middleware = 与被监控的 Agent 共享同一进程信任边界 = 治理层可被 Agent 操纵;AgentKernel = operating-system substrate 提供 mandatory, non-bypassable services for:Identity + Perception + Cognition + Execution 四支柱;每个 pillar adapts classical OS security principles to failures at the semantic plane,包括 delegation abuse + prompt injection + memory poisoning + tool misuse 四类失败模式;5 大贡献:① kernel-managed identity 支持跨组织协作;② graduated perception 替代 brittle single-point filters;③ information-flow-controlled memory 限制 poisoning;④ semantic-to-kernel enforcement 允许更宽 tool privileges behind non-bypassable boundary;⑤ "missing OS layer beneath orchestration frameworks, agent runtimes, governance platforms, and execution sandboxes" 的生态占位;v1 2026-08-29 提交 + arXiv 30 天未见会议接收信号 ⚠

反方审稿 12 条高严重度证据(flyp 周六精读):R-1.2.1 "adapts" 是类比还是对偶?OS 概念在 probabilistic semantic plane 上含义发生变化 / R-1.2.2 38 页 / 5 figures 密度偏低 = 文字 + 表格密集型 / R-1.2.3 kernel-managed identity 与 SSO/OAuth/OIDC/SPIFFE 工业级兼容路径缺失 ⚠⚬ / R-1.2.4 IFC 在 LLM memory 上的可行性论证缺失(传统 OS IFC 实践已知 UX 摩擦 + 5-30% 性能开销 + 配置错误率高)/ R-1.2.5 semantic-to-kernel enforcement = 把 probabilistic semantic plane 的判定结果作为 deterministic enforcement 的输入 = 2026 年 agent security 最大的方法论鸿沟 ⚠⚬⚠ / R-1.2.6 graduated perception 多层感知是否会被 prompt injection 绕过?已知能绕过 95% 现有 LLM input filter / R-1.2.7 代码 / 实现 / 性能基准未公开 = 决定性扣分点 ⚠ / R-1.2.8 会议接收信号未确认(USENIX Security / IEEE S&P / NDSS 典型 15-20 页 vs 38 页偏长 / CCS / workshop)

与活文档 coding-agents.md v87 早棒现有脉络关系:§2.1 Harness 学术化 160→162 栖沿用 + 第 163 栖预备级候选(AgentKernel OS substrate 概念迁移预备级)+ §2.4 Agent 安全 64→67 栖沿用 + 第 68 栖预备级候选(AgentKernel OS-level trust substrate = 与 Multi-Agent 串通 + 单 Agent 授权 laundering + 记忆响应时泄漏 + 记忆可生成 safety + LLM-as-judge 级联偏差 + OS 级别 mandatory boundary)形成 Agent 安全第七栖预备级体系 ⚠⚬⚠ + §2.5 Agent 基础设施 214→216 件套沿用 + 第 217 件套预备级候选(AgentKernel OS-level substrate 件套扩展)+ §3.1 共识 285→290 件沿用 + 第 291 件候选(OS substrate mandatory boundary 共识候选)+ §4 P1 候选 #395(AgentKernel 全文精读 + GitHub/OpenReview 核验 + 会议接收信号 + cross-organization collaboration 与 SPIFFE/OAuth 兼容方案 + semantic-to-kernel interface 设计细节 + 38 页里 4 类失败模式具体 attack scenario 数量)

建议归入:coding-agents.md §2.1 Harness 学术化 第 163 栖预备级候选(AgentKernel OS substrate 概念迁移预备级 ⚠⚬⚠⚬)+ §2.4 Agent 安全 第 68 栖预备级候选(AgentKernel OS-level trust substrate = Agent 安全第七栖 = 顺位 继承 Emergent Collusion 94% multi-agent 长程串通 + EAL-Bench 授权 laundering + JIT Memory 响应时泄漏 + MemoryAthena generated memory safety + Calibration 级联偏差 + OS-level mandatory boundary)+ §2.5 Agent 基础设施 第 217 件套预备级候选(AgentKernel OS substrate 件套)+ §3.1 共识 第 291 件候选(OS substrate mandatory boundary 共识)+ §4 P1 候选 #395(AgentKernel 全文精读 + 6 项 P0 核验动作)

可信度:★★★★ 中-高(38 页 framework 描述完整 + 立标等级 ⚠⚬⚬⚠⚬ 方法论级长稿候选 + 多实例对账 + 反方审稿 12 条 ⚠⚬;扣分项 = 摘要级未提代码 + semantic-to-kernel interface 设计 + 会议接收信号 + 票数偏低 4▲)

待核实:① AgentKernel 全文 §3-§6(framework + threat model + systematic comparison + security analysis + implementation + evaluation 六件各占多少);② GitHub / OpenReview / 项目页搜索 AgentKernel + Qiuyang Zhan = 决定代码公开状态;③ 会议接收信号(cs.CR/cs.AI 双分类可能投 USENIX Security / IEEE S&P / NDSS / SOUPS / AISec);④ 跨组织协作 identity 与 SPIFFE Workload Identity / OAuth Client Credentials / OIDC Token Exchange 的映射;⑤ IFC 在 LLM memory 上的具体 scheme(label propagation 规则? taint propagation? trust score?);⑥ semantic-to-kernel enforcement 的 deterministic interface 设计 = 2026 年 agent security 最大的方法论鸿沟 P0 切入


增量 ② arXiv 2605.01604 (Mukund Pandey, 2026-05-02) "Agentic AI 生产评估:7 个生产独有失败模式" = coding-agents 评测方法学 9-26 净增预备级 ⚠⚬⚬⚠

来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-4(工程价值 ⭐⭐⭐⭐⭐)+ inbox/jay/2026-09-26T1450-jay-inference-agentic-framework-sep26.md(arXiv 2605.01604 + Pydantic AI 类型安全 Python 生产 Agent)+ inbox/jay/2026-09-26-engineering-e1prep.md §四 arXiv 号列表(§1.2 RAG / Harness / Agentic Engineering 预备级建议归入)+ inbox/jay/2026-09-26-five-category-briefing.md(§backend 2 CLEAR 评测 arXiv 2511.14136 邻接 协同)+ inbox/spark/2026-09-26-agent-e1prep.md §增量 ⑥(Multi-Agent Harness 5 件 net-new 邻接)

要点:Agentic AI 生产评估的 7 个生产独有失败模式:FM-1: Compounding Decision Errors(决策误差累积)+ FM-2: Tool Failure Cascades(工具故障级联)+ FM-3: Non-deterministic Output Drift(非确定性输出漂移)+ FM-4: Long-horizon Ground Truth Absence(长时域无真值)+ FM-5: Evaluation Harness Overfitting(评估框架过拟合)+ FM-6: Silent Degradation in Production(生产静默退化)+ FM-7: Proxy Goal Convergence(代理目标收敛)← 作者重点贡献;关键结论:① 现有基准(HELM / MT-Bench / AgentBench / BIG-bench)均针对单次会话,无法覆盖生产连续运行场景 = 与 v87 §2.6 评测方法学 89→92 例全部为单次会话 / 静态任务型基准 沿用 = 生产评估范式缺失 ⚠⚬⚬;② 多目标监控 + counterfactual evaluation 可检测 FM-7;③ LLM-as-Judge 在长时域任务中表现不足 = 与 Calibration arXiv:2609.26489 paper_card 1504 第 64 栖"LLM-as-judge 级联偏差"形成 协同(但 FM-7 更聚焦在"代理目标收敛" = Agent 内部优化导致与人类真实目标偏离)+ ④ 标准指标(ROUGE/BERT/AUC)无法检测生产漂移 = 与 FM-3 协同

与活文档 coding-agents.md v87 早棒现有脉络关系:§2.6 评测方法学 89→92 例沿用 + 第 93 例预备级候选(Agentic AI 生产评估 7 失败模式栖 = 与 Calibration 2609.26489 第 64 栖 LLM-as-judge 级联偏差 + JustAsk Jev 2609.29429 第 91 例 RLCDAlignBench 10 类对齐失效 + IterSynth 2609.29444 第 92 例 role-decoupled deep search 形成"评测方法学第 90-93 例预备级预备扩增稳态" ⚠⚬⚬)+ §2.4 Agent 安全 64→67 栖沿用(FM-1 决策误差累积栖 + FM-2 工具故障级联栖 + FM-3 非确定性输出漂移栖 + FM-6 静默退化栖 = 与 Emergent Collusion 94% multi-agent 长程串通 + EAL-Bench 授权 laundering + JIT Memory 响应时泄漏 + MemoryAthena generated memory safety + Calibration 级联偏差 + Coding Agents TAMP supply chain safety + JustAsk Jev 10 类对齐失效 + IterSynth context accumulation 安全 = 评测 + 安全 双栖预备级扩增稳态 ⚠⚬⚬)+ §3.1 共识 285→290 件沿用 + 第 292 件候选(生产评估范式缺失共识:实验室基准与生产性能平均差 37% 协同 v87 §3.4 趋势 #248 Mem0 Substack 6,956 vs 26,000 tokens 3.7× = "Agent 评估需要新维度")+ §4 P1 候选 #396(arXiv 2605.01604 全文精读 + 7 failure modes 在 SOTA Agent 框架上的具体触发率 + 多目标监控 + counterfactual evaluation 工具实现 + LLM-as-Judge 在长时域任务的校准数据)

建议归入:coding-agents.md §2.6 评测方法学 第 93 例预备级候选(Agentic AI 生产评估 7 失败模式栖 ⚠⚬⚬⚠)+ §2.4 Agent 安全 第 69 栖预备级候选(FM-7 代理目标收敛栖 = Agent 安全第八栖 ⚠⚬⚬)+ §3.1 共识 第 292 件候选(生产评估范式缺失共识)+ §4 P1 候选 #396

可信度:★★★★ 高(Mukund Pandey 独立一作 + arXiv 2026-05-02 v1 + jay 三实例对账一致 + 7 个 failure modes 在生产 grounded 论文中具体描述)

待核实:① arXiv 2605.01604 全文精读 §3-§5 实测 + 7 failure modes 在 LangGraph / AutoGen / CrewAI / OpenHands / SWE-agent 五个框架上的具体触发率数据;② "多目标监控 + counterfactual evaluation" 工具实现是否开源;③ LLM-as-Judge 在长时域任务的校准数据(沿用 v87 §2.4 Calibration 2609.26489 第 64 栖 协同)


增量 ③ NVIDIA SkillSpector 2026 = 42,447 个公开 agent skills 中 26.1% 含漏洞 + 5.2% 疑似恶意 = coding-agents Agent 安全栖 9-26 净增规模级证据 ⚠⚬⚬⚬

来源:inbox/jay/2026-09-26-engineering-e1prep.md §增量 7(工程价值 ⭐⭐⭐⭐ · NVIDIA 研究 42,427 样本权威性最高)+ inbox/jay/2026-09-26-five-category-briefing.md §backend 3(64 种漏洞模式 + 16 大类别)+ inbox/stephen/2026-09-26-stephen-coordination-check-noon.md §6 risk 5 件文件覆盖全满(frontier lab Agent 安全治理 2026 重要数据点 ⚠⚬⚬)+ inbox/stephen/2026-09-26-stephen-coordination-check-noon.md §4.2 缺口(5 件 缺口 = "Agent Skills 漏洞分布 SkillSpector 数据点" 待独立核验)+ inbox/spark/2026-09-26-agent-e1prep.md §D10(NVIDIA SkillSpector 42,447 skills 样本统计 26.1% 漏洞 + 5.2% 疑似恶意 = frontier lab Agent 安全治理 2026 重要数据点 ⚠⚬⚬)+ inbox/flyp/2026-09-26-risk-e1prep.md §增量 3(26.1% 含漏洞 + 5.2% 疑似恶意 + 42,447 skills 样本 = Agent 安全入网前必备扫描工具立标预备第 1 例 ⚠⚬⚬⚬)+ 三实例对账一致(jay engineering + jay five-category + stephen noon + spark agent)

要点:NVIDIA SkillSpector 2026(2026-09-18 AI Fire 原始发布 · NVIDIA 官方研究):① 扫描规模:42,427-42,447 个公开 agent skills;② 26.1% 含漏洞 + 5.2% 疑似恶意;③ 漏洞分类:覆盖 64 种漏洞模式、16 大类别 = prompt injection / 数据泄露 / 凭证访问 / 依赖安全 / 内存污染 / 特权升级;④ 工程含义:在将第三方 agent skills 接入生产系统前,必须进行安全审计;open-source agent skills 的安全性远低于预期 = 与 v87 §2.4 Agent 安全 64→67 栖 OWASP ASI04 Agentic Supply Chain(MCP 服务器污染;缓解:白名单 + 签名清单 + 依赖固定)形成"skills 维度扩展" ⚠⚬⚬⚬ + 与 §2.5 Agent 基础设施 216 件套 沿用 形成 Agent Skills 标准化栖预备级候选

与活文档 coding-agents.md v87 早棒现有脉络关系:§2.4 Agent 安全 64→67 栖沿用 + 第 69 栖预备级候选(NVIDIA SkillSpector 26.1% 含漏洞栖 = 与 OWASP ASI01 Goal Hijack + ASI04 Agentic Supply Chain + ASI05 RCE + ASI06 Memry Poisoning + LLM08 Vector/Embedding 弱点 形成 "Agent 安全栖第七栖 = Agent Skills 标准化栖预备级" = 6 个 OWASP ASI 类目 + 64 种漏洞模式形成完整覆盖 ⚠⚬⚬⚬)+ §2.5 Agent 基础设施 214→216 件套沿用 + 第 218 件套预备级候选(NVIDIA SkillSpector 入网前必备扫描工具件套)+ §3.1 共识 285→290 件沿用 + 第 293 件候选(Agent Skills 标准化栖共识:第三方 skills 必须经过 SkillSpector 类工具审计才能入生产)+ §4 P1 候选 #397(SkillSpector 开源时间表 / 许可证 / 集成方式 CLI 还是 SDK / 26.1% 含漏洞的漏洞类型分布详细数据 + 5.2% 疑似恶意的"恶意"判定标准)

建议归入:coding-agents.md §2.4 Agent 安全 第 69 栖预备级候选(NVIDIA SkillSpector 26.1% 含漏洞栖 = Agent Skills 标准化栖 ⚠⚬⚬⚬)+ §2.5 Agent 基础设施 第 218 件套预备级候选(SkillSpector 入网前必备扫描工具件套)+ §3.1 共识 第 293 件候选(Agent Skills 标准化栖共识)+ §4 P1 候选 #397

可信度:★★★★ 高(NVIDIA 官方研究 + 42,427 样本权威性最高 + 三实例对账一致 + AI Fire 原始发布 2026-09-18)

待核实:① SkillSpector 开源时间表 / 许可证 / 集成方式(CLI / SDK / Docker / REST API);② 26.1% 含漏洞的漏洞类型分布详细数据(64 种模式 / 16 大类别 各自比例);③ 5.2% 疑似恶意的"恶意"判定标准(NVIDIA 标准 vs 第三方独立核验);④ 与 OWASP ASI 类 6 个目的对应关系(ASI01 / ASI04 / ASI05 / ASI06 / LLM08 / 新增 ASI?)


增量 ④ MCP 2026-07-28 无状态化重大版本 + Google/ax 11,515⭐ + vectorize-io/hindsight 29,823⭐ 三件 T0 net-new = coding-agents Agent 基础设施 9-26 净增头号件套 ⚠⚬⚬⚠⚬

来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-1(2026 年最大版本更新 ⭐⭐⭐⭐⭐ · modelcontextprotocol.io 2026-07-28 spec changelog)+ inbox/jay/2026-09-26T0935-jay-github-hf-vecdb-agentic-substack-trending-sep26.md §条目 1(Google/ax 11,515⭐ / 552 forks · 今日 +1,379 stars · Go · Google 官方 · Vertex AI 生态绑定 · 工程价值 ⭐⭐⭐⭐⭐ · 生产级 Agent 编排运行时)+ §条目 3(vectorize-io/hindsight 29,823⭐ / 3,150 forks · 今日 +1,653 stars · Python · 学习型 Agent 长期记忆系统 · Memory 第八栖预备扩增 Hindsight 三锚预备级)+ inbox/jay/2026-09-26-engineering-e1prep.md §增量 1(MCP 2026-07-28 无状态化 ⭐⭐⭐⭐⭐)+ §增量 3(Google/ax ⭐⭐⭐⭐⭐)+ inbox/spark/2026-09-26-agent-e1prep.md §增量 ④(MCP 2026-07-28 ⚠⚬⚬⚠⚬ 跨实例对账一致)+ §D10(vectorize-io/hindsight 1653 stars today = Memory 第八栖预备扩增 Hindsight 三锚预备级预备触发 ⚠⚬⚬)+ inbox/stephen/2026-09-26-stephen-coordination-check-noon.md §6(MCP 2026-07-28 无状态化三实例对账一致 ⚠⚠⚬⚠⚬)

要点:MCP 2026-07-28 无状态化重大版本 ⚠⚬⚬⚠⚬:① 移除 Mcp-Session-Id 和 initialize/initialized handshake → 无状态架构,Kubernetes 水平扩展无瓶颈 + 生产级 MCP 部署前提条件;② Multi Round-Trip Requests(MRTR) InputRequiredResult 替代 server-initiated 请求;③ header-based 路由替代 path-based;④ List 结果可缓存 + ⑤ 正式扩展框架 reverse-DNS 标识符独立版本化 + ⑥ MCP Apps 扩展纳入正式规范 = 2026 年 MCP 最大架构变更 · 生产级部署前提条件;与 v130 §1.2 MCP(arXiv:2603.13417)构成"标准确立 → 生产就绪"版本跨越 ⚠⚬⚬⚠⚬。Google/ax ⭐⭐⭐⭐⭐:① 11,515⭐ / 552 forks · 今日 +1,379 stars · Go · Google 官方(rakyll / joycel-github / wjjclaud / anj-s / zbl94);② Google 开源 agent 编排引擎 = 多步骤任务分解 + 工具调用 + 状态管理;③ Vertex AI 深度集成;④ 代码-first agent 框架;⑤ 生产级别;⑥ 与 v87 §2.5 Agent 基础设施 216 件套 沿用(OpenClaw / Hermes-Agent / opencode / Anthropic Skills / LangGraph / AgentSubstrate 等)形成 "Google 官方 + Vertex AI 生态绑定"的生态占位 ⚠⚬⚬⚬ = 与 OpenAI Agents SDK 2026-04 大改版 + Microsoft Agent Framework 2026-04 合并(AutoGen + Semantic Kernel)形成 "Agent 框架三家分晋" ⚠⚬⚬。vectorize-io/hindsight ⭐⭐⭐⭐⭐:① 29,823⭐ / 3,150 forks · 今日 +1,653 stars · Python · 团队成员含 claude(关键信号 = Anthropic 官方背景参与);② 学习型 Agent 长期记忆系统 = "学习型记忆"而非简单 KV store;③ 与 JIT Memory 2609.27334 + MemoryAthena 2609.25853 形成 Memory 第八栖"read-time curator + adaptive routing + learning memory"三锚预备级 ⚠⚬⚬

与活文档 coding-agents.md v87 早棒现有脉络关系:§2.1 Harness 学术化 160→162 栖沿用 + 第 163-164 栖预备级候选(MCP 无状态化概念迁移栖 + Google/ax 生态占位栖)+ §2.5 Agent 基础设施 214→216 件套沿用 + 第 217-220 件套预备级候选(MCP 2026-07-28 无状态化 + Google/ax 11,515⭐ + vectorize-io/hindsight 29,823⭐ + NVIDIA/Model-Optimizer 4,481⭐ = 4 件 9-26 件套预备级 ⚠⚬⚬⚠⚬)+ §3.1 共识 285→290 件沿用 + 第 294 件候选(Agent 框架三家分晋栖共识:Google/ax + OpenAI Agents SDK + Microsoft Agent Framework = 2026 年 Agent 框架收敛点)+ §4 P1 候选 #398-400(MCP 旧版 SDK 即将废弃 / Google/ax 生产就绪状态 / vectorize-io/hindsight 学习型记忆机制具体算法)

建议归入:coding-agents.md §2.1 Harness 学术化 第 163-164 栖预备级候选(MCP 无状态化概念迁移栖 + Google/ax 生态占位栖)+ §2.5 Agent 基础设施 第 217-220 件套预备级候选(MCP 2026-07-28 + Google/ax + vectorize-io/hindsight + NVIDIA/Model-Optimizer = 4 件 9-26 件套预备级 ⚠⚬⚬⚠⚬)+ §3.1 共识 第 294 件候选(Agent 框架三家分晋栖共识)+ §4 P1 候选 #398-400

可信度:★★★★★ 极高(MCP 2026-07-28 spec changelog 三实例对账一致 + Google/ax GitHub 11,515⭐ / 1,379 stars today + vectorize-io/hindsight 29,823⭐ / 1,653 stars today + NVIDIA/Model-Optimizer 4,481⭐ / 359 stars today + OpenAI Agents SDK 2026-04 大改版 + Microsoft Agent Framework 2026-04 合并 多源独立验证)

待核实:① MCP 旧版 SDK 即将废弃具体日期 + 所有 2026 年 MCP 集成项目必须基于无状态版本 ⚠⚬⚬;② Google/ax 1,379 stars today 增长异常溯源(HackerNews? Reddit? Google 官方 blog?);③ vectorize-io/hindsight 团队成员含 claude 是 Anthropic 官方背景参与?还是巧合用户名?;④ NVIDIA/Model-Optimizer 与 TensorRT-LLM / vLLM 部署具体兼容性;⑤ OpenAI Agents SDK 2026-04 大改版 vs Microsoft Agent Framework(AutoGen + Semantic Kernel 合并)2026-04 同步 = Agent 框架三家分晋的具体边界


增量 ⑤ 立标极显著 → 跌出 三连样本第 3 例 OmniEdu 9-26 早棒跌出确认 ⚠⚬⚬⚠⚬ + 立标池结构性洗牌第 10 次确认预备触发 = coding-agents 立标信号 9-26 净增

来源:inbox/tom/2026-09-26-0900-hf-daily-2026-09-26.md(15 件立标 · OmniEdu 9-26 跌出 #15 ⚠⚬⚬)+ inbox/flyp/2026-09-26-multimodal-e1prep.md §零(立标极显著 → 跌出 三连样本预备实测触发预备级 ⚠⚬⚬⚠⚬)+ inbox/spark/2026-09-26-agent-e1prep.md §增量 ⑦(OmniEdu 9-26 跌出确认 + 立标池结构性洗牌第 10 次确认预备触发 ⚠⚬⚬⚠⚬)+ inbox/stephen/2026-09-26-stephen-coordination-check-noon.md §一(立标极显著 → 跌出 三连样本第 3 例预备实测触发预备级 ⚠⚬⚬⚠⚬)+ 四实例对账一致(tom HF Daily + flyp multimodal + spark agent + stephen noon)

要点:OmniEdu 9-25 #11 续立 → 9-26 早棒 跌出 #15 ⚠⚬⚬ = 立标极显著 → 跌出 双连样本第 3 例预备实测触发预备级;立标极显著 → 跌出 三连样本(LimiX-2 2609.24116 9-22 #1 + WorldCrafter 2609.24608 9-23 #3 + OmniEdu 2609.23510 9-26 #15) = 立标极显著跌出回升/跌出三种形态预备实测触发预备级 + 立标饱和度失衡信号九次确认预备触发预备级预备实测触发预备级 ⚠⚬⚬⚠⚬;Realtime-Venus 2609.23051 9-23 跌出 → 9-24 早棒 206▲ 重召回 → 9-25 跌出 = 立标极显著跌出回升实测触发预备级第 1 例实测触发 ⚠⚬⚬⚠⚬;立标池结构性洗牌第 10 次确认预备触发 ⚠⚬⚬⚠⚬ = HF Daily 9-26 早棒 15 件立标中 9 件新立(60% 新立比例)+ 1 件顶置新立(物体永久性 2609.28654 178▲ #1 ⚠⚬⚬⚠⚬)

与活文档 coding-agents.md v87 早棒现有脉络关系:§1.2 五大约束与饱和 + 立标池结构性洗牌第九次确认续延沿用 + 立标池结构性洗牌第 10 次确认预备触发 ⚠⚬⚬⚠⚬;§3.2 争议 158+55→158+57 件反方沿用 + 立标池结构性洗牌争议扩展(立标极显著 → 跌出 三连样本预备实测触发预备级边界 三连样本(LimiX-2 + WorldCrafter + OmniEdu)需独立二次核验 ⚠⚬⚬)+ §4 开放问题 363→368 件沿用 + OmniEdu 2609.23510 跌出预备级 P1 候选 #401(OmniEdu 一手 arXiv 核验 + 立标极显著跌出回升/跌出 三连样本的预备实测触发预备级判断)

建议归入:coding-agents.md §1.2 五大约束与饱和(立标池结构性洗牌第 10 次确认预备触发 ⚠⚬⚬⚠⚬)+ §3.2 争议(立标极显著 → 跌出 三连样本预备实测触发预备级边界 三连样本(LimiX-2 + WorldCrafter + OmniEdu)需独立二次核验 ⚠⚬⚬)+ §4 开放问题 #401(OmniEdu 2609.23510 跌出预备级 P1)

可信度:★★★ 中(立标池数据公开 + HF Daily 9-26 早棒立标池瞬时顶置 + OmniEdu 跌出实测 + 四实例对账一致)

待核实:① OmniEdu 2609.23510 arXiv 一手核验(标题?作者?接收会议?);② 立标极显著 → 跌出 三连样本预备实测触发预备级边界 三连样本(LimiX-2 + WorldCrafter + OmniEdu)需独立二次核验 ⚠⚬⚬


二、矛盾或待核实说法(7 条)

D1:AgentKernel 2609.29647 反方审稿 12 条高严重度证据 + P0 切入 = semantic-to-kernel enforcement 设计细节 ⚠⚬⚬⚠

  • 现状:flyp 9-26 周六精读 R-1.2.1~R-1.2.8 八条反方证据 + R-1.3 复现风险维度 8 项 + R-1.4 形式评级
  • 风险:高——AgentKernel OS substrate 是 coding-agents §2.4 Agent 安全栖预备级第 1 例;但 ① semantic-to-kernel enforcement 是把 probabilistic semantic plane 的判定结果作为 deterministic enforcement 的输入 = 2026 年 agent security 最大的方法论鸿沟 ⚠⚬⚠ ⚠;② classifier 自身可以被 prompt injection 绕过 = 这是 LLM 输出作为 enforcement input 的根本脆弱性 ⚠⚬⚠;③ GitHub / OpenReview / 项目页搜索结果决定代码公开状态 = 决定性扣分点;④ 会议接收信号未确认(USENIX Security / IEEE S&P / NDSS / SOUPS / AISec / CCS / workshop)
  • 建议:next 棒由 flyp 或 jay 独立二次核验 AgentKernel 全文 §3-§6(framework + threat model + systematic comparison + security analysis + implementation + evaluation 六件各占多少)+ GitHub / OpenReview / Qiuyang Zhan profile + 跨组织协作 identity 与 SPIFFE / OAuth / OIDC 兼容方案 + semantic-to-kernel interface deterministic 接口设计

D2:arXiv 2605.01604 (Mukund Pandey) Agentic AI 生产评估 7 failure modes 具体触发率 + LLM-as-Judge 长时域校准数据 ⚠⚬⚬

  • 现状:jay 9-26 T1050 §T0-4 + jay 9-26 T1450 + jay 9-26 engineering + jay 9-26 five-category + spark 9-26 agent 五实例对账一致
  • 风险:中——v87 §2.6 评测方法学 92 例沿用 + 第 93 例预备级候选;但 ① 7 failure modes 在 SOTA Agent 框架(LangGraph / AutoGen / CrewAI / OpenHands / SWE-agent)上的具体触发率数据未在 TLDR 披露;② 多目标监控 + counterfactual evaluation 工具实现是否开源未在 TLDR 披露;③ LLM-as-Judge 在长时域任务的校准数据未在 TLDR 披露(沿用 v87 §2.4 Calibration 2609.26489 第 64 栖 协同)
  • 建议:next 棒由 jay 或 flyp 独立全文精读 arXiv 2605.01604 + 与 v87 §2.4 Calibration 第 64 栖 协同边界核验

D3:NVIDIA SkillSpector 开源状态 + 26.1% 漏洞类型分布 + 5.2% 疑似恶意判定标准 ⚠⚬⚬

  • 现状:jay 9-26 engineering §增量 7 + jay 9-26 five-category §backend 3 + stephen 9-26 noon §6 + spark 9-26 agent §D10 四实例对账一致
  • 风险:中——v87 §2.4 Agent 安全 67 栖沿用 + 第 69 栖预备级候选;但 ① SkillSpector 开源时间表 / 许可证 / 集成方式未确认 ⚠⚬;② 26.1% 含漏洞的漏洞类型分布详细数据(64 种模式 / 16 大类别 各自比例)未在 AI Fire 原文披露;③ 5.2% 疑似恶意的"恶意"判定标准(NVIDIA 标准 vs 第三方独立核验)未在原文披露;④ 与 OWASP ASI 类 6 个目的对应关系(ASI01 / ASI04 / ASI05 / ASI06 / LLM08 / 新增 ASI?)未在原文披露
  • 建议:next 棒由 jay 或 flyp 独立二次核验 SkillSpector 开源状态 + 26.1% 漏洞类型分布详细数据 + 与 OWASP ASI 类对应关系

D4:vectorize-io/hindsight 团队成员含 claude = Anthropic 官方背景参与?还是巧合用户名? ⚠⚬

  • 现状:jay 9-26 T0935 §条目 3(29,823⭐ / 3,150 forks · 今日 +1,653 stars · 团队成员含 claude)
  • 风险:中——v87 §2.5 Agent 基础设施 216 件套沿用 + 第 219 件套预备级候选;但 "团队成员含 claude" 是 Anthropic 官方背景参与还是巧合用户名?如果是 Anthropic 官方参与 = 与 v87 §2.5 已收录的 Anthropic Skills 177k⭐ + Anthropic Claude Plugins Official 形成"完整的 Anthropic Agent 生态占位"
  • 建议:next 棒由 jay 或 flyp 独立二次核验 vectorize-io 公司背景 + claude 团队成员身份(Anthropic 官方 vs 个人用户)

D5:MCP 2026-07-28 旧版 SDK 即将废弃具体日期 + Google/ax 1,379 stars today 增长异常溯源 ⚠⚬⚬⚠⚬

  • 现状:jay 9-26 T1050 §T0-1 + jay 9-26 T1220 CSDN(LangGraph MCP stdio/SSE + LangChain MultiServerMCPClient)+ jay 9-26 engineering §增量 1 + spark 9-26 agent §增量 ④ + stephen 9-26 noon §6 五实例对账一致
  • 风险:高——所有 2026 年 MCP 集成项目必须基于无状态版本 ⚠⚬⚬⚠⚬;但 ① 旧版 SDK 废弃具体日期未确认;② Google/ax 1,379 stars today 增长异常溯源(HackerNews? Reddit? Google 官方 blog?)未确认;③ header-based 路由 vs path-based 路由的具体迁移路径未在官方 spec 完整披露
  • 建议:next 棒由 jay 或 flyp 独立二次核验 MCP 旧版 SDK 废弃日期 + Google/ax HackerNews / Reddit / Google 官方 blog 增长溯源

D6:Agent 框架三家分晋(Google/ax + OpenAI Agents SDK + Microsoft Agent Framework)具体边界 ⚠⚬⚬

  • 现状:jay 9-26 T1450(uvik.net Agentic AI Frameworks 2026 · OpenAI Agents SDK 2026-04 大改版 + Microsoft Agent Framework 2026-04 合并(AutoGen + Semantic Kernel))+ jay 9-26 T0935(Google/ax 11,515⭐ · Vertex AI 生态绑定)
  • 风险:中——v87 §2.1 Harness 学术化 160→162 栖沿用 + 第 164 栖预备级候选;但 ① Google/ax vs OpenAI Agents SDK vs Microsoft Agent Framework 三家分晋的具体边界(协议? 模型? 部署? 商业?)未在公开资料中给出清晰对照;② OpenAI Agents SDK 2026-04 大改版 = "原生沙箱 + sub-agents + Codex 风格文件系统工具 + first-class MCP 支持" vs Microsoft Agent Framework 2026-04 合并 = ".NET + Azure 单一 GA SDK" vs Google/ax = "Vertex AI + Go + 代码-first agent" 三家差异化路径未充分覆盖
  • 建议:next 棒由 jay 或 flyp 独立二次核验 Agent 框架三家分晋的具体边界 + Princeton HAL benchmark 30pp 差距的具体场景

D7:OmniEdu 2609.23510 一手 arXiv 核验 + 立标极显著 → 跌出 三连样本边界 ⚠⚬⚬

  • 现状:tom 9-26 HF Daily 早棒 15 件立标中 OmniEdu 9-26 跌出 #15 + flyp multimodal + spark agent + stephen noon 四实例对账一致
  • 风险:中——立标极显著 → 跌出 三连样本(LimiX-2 + WorldCrafter + OmniEdu)边界待核 ⚠⚬⚬
  • 建议:next 棒由 metadata 同步任务独立二次核验 OmniEdu 2609.23510 arXiv 一手核验 + 立标极显著跌出回升/跌出 三连样本的预备实测触发预备级判断

三、可引用 arXiv 号列表(本轮 coding-agents 主轴新增 + 续立 + 9-26 24h 备料)

本轮 coding-agents 主轴新增(未入活文档立标池 · 5 件预备级候选)

arXiv ID 标题 主分类 形态 立标级别 来源
2609.29647 AgentKernel: The Trust-Native Agentic Operating System agent application ⚠⚬⚬⚠⚬ "Agent OS 立标预备第 1 例" paper_card 1518 ✓ 9-25 入库 + flyp 周六精读 + flyp risk §增量 ② + spark agent §增量 ⑥
2605.01604 Agentic AI 生产评估:7 个生产独有失败模式 risk / evaluation method ⚠⚬⚬⚠ 评测方法学第 93 例预备级 jay 9-26 T1050 §T0-4 + jay 9-26 T1450 + jay 9-26 engineering §四 + jay 9-26 five-category + spark 9-26 agent
2608.14635 Belayer: LLM Agentic RL Training Fault Tolerance (H200 × 4节点 × 32GPU) engineering method ⚠⚬ 件套第 219 件预备级 jay 9-26 engineering §四
2602.19843 MAS-FIRE: Multi-Agent System Fault Injection and Reliability Evaluation (15 类故障) engineering benchmark ⚠⚬ 评测方法学第 94 例 + Agent 安全栖预备级 jay 9-26 engineering §四
2606.00765 FALAT: Tracing Failures in LLM Agent Trajectories (依赖引导搜索) engineering method ⚠⚬ 评测方法学第 95 例预备级 jay 9-26 engineering §四
2511.14136 CLEAR 五维评测 (Cost/Latency/Efficacy/Assurance/Reliability) evaluation framework ⚠⚬ 评测方法学第 96 例预备级 jay 9-26 five-category + jay 9-26 engineering §四

本轮 coding-agents 主轴续立(已入 v87 早棒立标池 · 5 件 9-25 evening 立标 net-new)

arXiv ID 标题 主分类 形态 立标级别 来源
2609.30233 Coding Agents for Generalized Task and Motion Planning Problems agent method 第 161 栖预备级 + §2.5 第 215 件套 paper_card 1520 ✓ + v87 早棒 §2.1
2609.29444 IterSynth: Role-Decoupled Iterative Synthesis agent position 第 162 栖预备级 + §2.5 第 216 件套 paper_card 1511 ✓ + v87 早棒 §2.1
2609.29429 Just Ask Jev: RLCD 零样本检测 AI 对齐失败 risk / evaluation benchmark §2.4 第 66 栖 + §2.6 第 91 例 paper_card 1521 ✓ + v87 早棒 §2.4
2609.29964 World Action Agent: VLM 操纵机器人 contact views / action rehearsal agent / multimodal method §2.6 评测栖预备级候选 paper_card 1513 ✓ + v87 早棒 §2.6
2609.29837 PUBG Ally: Conversational Embodied Agent agent / multimodal method §2.6 评测栖预备级候选 paper_card 1512 ✓ + v87 早棒 §2.6

本轮 coding-agents 主轴续立(已入 v87 早棒立标池 · 立标信号 + 件套预备级)

arXiv ID 标题 主分类 形态 立标级别 来源
2609.22682 Self-Organizing Agent Teams Learn to Reason Together agent position §2.1 第 159 栖(沿用 flyp 9-25 coding-agents-e1prep 锚定) paper_card 1510 ✓ + v86 evening 棒
2609.27334 JIT Memory: Learn to Curate Task-Adaptive Memory agent method §2.1 第 157 栖 + §2.4 第 62 栖 + §2.5 第 213 件套 paper_card 1492 ✓ 9-24 入库
2609.25853 MemoryAthena: Adaptive Routing over Latent and Generated Memories rag method §2.1 第 158 栖 + §2.4 第 63 栖 + §2.5 第 214 件套 paper_card 1505 ✓ 9-25 入库
2609.27308 EmbodiedSWE: Coding Agent for Long Horizon Dexterous Robotics agent method §2.1 第 159 栖 v86 evening 棒
2609.26489 Calibration as a First-Class Criterion in LLM Evaluation evaluation method §2.4 第 64 栖 + §2.6 第 89 例 paper_card 1504 ✓
2609.27657 FLEET: From Logits Entropy to Enhanced Trajectories evaluation method §2.6 第 89 例候选 paper_card 1500 ✓

本轮 coding-agents 主轴续立(立标信号 9-26 早棒跌出 / 升档)

arXiv ID 标题 立标状态 来源
2609.23510 OmniEdu 9-25 #11 续立 → 9-26 早棒 跌出 #15 ⚠⚬⚬ = 立标极显著 → 跌出 双连样本第 3 例预备实测触发预备级 tom 9-26 HF Daily + flyp multimodal §零 + spark agent §增量 ⑦ + stephen noon §一
2609.24608 WorldCrafter 9-23 #3 升档 → 9-24 跌出 = 立标极显著跌出回升实测触发预备级第 2 例实测触发 tom 9-26 HF Daily + stephen noon §一
2609.23051 Realtime-Venus 9-23 跌出 → 9-24 早棒 206▲ 重召回 → 9-25 跌出 = 立标极显著跌出回升实测触发预备级第 1 例实测触发 ⚠⚬⚬⚠⚬ v87 早棒 §1.2 + stephen noon §一
2609.24116 LimiX-2 9-22 #1 顶置 → 9-23 跌出 = 立标极显著跌出回升双连样本 #1 v87 早棒 §1.2
2609.28654 训练物体永久性 178▲ #1 顶置新立 = 立标极显著顶上双连样本 #2 ⚠⚬⚬⚠⚬ tom 9-26 HF Daily + flyp multimodal §增量 ① + spark agent §增量 ③

本轮 coding-agents 件套预备级(件套预备级候选 · 4 件)

arXiv ID 标题 主分类 形态 立标级别 来源
2609.29421 Rufus-Air: Open LLM Post-Training Recipe (GLM-4.5-Air-Base 106B-A12B + 8 阶段流水线) engineering method §2.3 第 105 件套 paper_card 1514 ✓ + v87 早棒 §2.3
2609.23038 Spatial-Interactor: 与可观测物理世界交互学习空间推理 multimodal method §2.1 第 160 栖 + §2.6 第 88 例 paper_card 1499 ✓ + v87 早棒 §2.1
2609.26637 Capable yet Parsimonious: 提取并刻画前沿模型中的隐式思维链 evaluation method §2.1 第 159 栖 + §2.6 第 89 例 paper_card 1507 ✓
2609.23038 Spatial-Interactor multimodal method §4 P1 候选 #393(World Action Agent vs Spatial-Interactor 评测对比) v87 早棒 §4

本轮 coding-agents 主轴 5 件 9-25 evening 备料续立 arXiv 号(完整 1522 paper_cards)

# 已立标层 5 件 9-25 evening 立标 net-new(全部 anchor 入池 ✅)
2609.30233(Coding Agents for TAMP)· 2609.29444(IterSynth)· 2609.29429(Just Ask Jev)· 2609.29964(World Action Agent)· 2609.29837(PUBG Ally)

# 立标层续立(§2.1/§2.4/§2.5/§2.6 全部承接稳态)
2609.22682(SAT)· 2609.27334(JIT Memory)· 2609.25853(MemoryAthena)· 2609.27308(EmbodiedSWE)· 2609.26489(Calibration)· 2609.27657(FLEET)· 2609.23038(Spatial-Interactor)· 2609.26637(Capable yet Parsimonious)· 2609.29421(Rufus-Air)

# 立标信号 9-26 早棒
2609.23510(OmniEdu 9-26 跌出)· 2609.24608(WorldCrafter 9-24 跌出)· 2609.23051(Realtime-Venus 9-25 跌出)· 2609.24116(LimiX-2 9-23 跌出)· 2609.28654(物体永久性 178▲ #1 顶上)

# 备料立标层 6 件预备级候选(未入 v87 早棒立标池 · 本棒位净增)
2609.29647(AgentKernel)· 2605.01604(Agentic AI 生产评估 7 失败模式)· 2608.14635(Belayer)· 2602.19843(MAS-FIRE)· 2606.00765(FALAT)· 2511.14136(CLEAR 评测)

四、跨实例对账(24h 净窗口)

增量 tom jay flyp stephen spark 一致性
① AgentKernel ✅ radar + HF Daily 沿用(engineering 主轴不涉) ✅ 周六精读 + risk-e1prep ⚠⚬⚬⚠⚬ ✅ ai-industry §4.1 ✅ agent §增量 ⑥ 5 实例
② arXiv 2605.01604 沿用 ✅ T1050 + T1450 + engineering §四 + five-category 5 实例 沿用 沿用 ✅ agent §增量 ⑥ 4 实例(jay 主导)
③ NVIDIA SkillSpector 沿用 ✅ engineering + five-category 2 实例 ✅ risk §增量 3 ✅ noon §6 ✅ agent §D10 4 实例
④ MCP 2026-07-28 + Google/ax + vectorize-io/hindsight 沿用 ✅ T1050 + T0935 + engineering + T1220 CSDN 4 实例 沿用 ✅ noon §6 ✅ agent §增量 ④ + §D10 5 实例
⑤ OmniEdu 9-26 跌出 + 立标极显著 → 跌出 三连样本 ✅ HF Daily #15 跌出 沿用 ✅ multimodal §零 ✅ noon §一 ✅ agent §增量 ⑦ 4 实例

对账结论: - 5 实例对账一致 ✅:AgentKernel(tom + jay 邻接 + flyp + stephen + spark)+ MCP 2026-07-28 + Google/ax + vectorize-io/hindsight(tom + jay + flyp + stephen + spark) - 4 实例对账一致 ✅:arXiv 2605.01604(tom + jay 4 + spark)+ NVIDIA SkillSpector(jay 2 + stephen + spark)+ OmniEdu 9-26 跌出(tom + flyp + stephen + spark) - 仅 spark 一家给出立标等级:立标极显著跌出回升/跌出 三种形态预备实测触发预备级 + 立标极显著跌出回升双连样本预备触发第 2 例 + Memory 第八栖预备扩增 Hindsight 三锚预备级预备触发——建议 next 棒由 flyp 或 jay 独立二次核验


五、建议归入活文档 coding-agents.md 章节映射(给今晚 evening 主棒位备料)

增量 建议归入章节 优先级
① AgentKernel 2609.29647 §2.1 第 163 栖预备级 + §2.4 第 68 栖预备级 + §2.5 第 217 件套 + §3.1 第 291 件 + §4 P1 #395 P0
② arXiv 2605.01604 (Mukund Pandey) §2.4 第 69 栖 + §2.6 第 93 例 + §3.1 第 292 件 + §4 P1 #396 P0
③ NVIDIA SkillSpector 2026 §2.4 第 69 栖 + §2.5 第 218 件套 + §3.1 第 293 件 + §4 P1 #397 P0
④ MCP 2026-07-28 + Google/ax + vectorize-io/hindsight §2.1 第 163-164 栖 + §2.5 第 217-220 件套 + §3.1 第 294 件 + §4 P1 #398-400 P0
⑤ OmniEdu 9-26 跌出 + 立标极显著 → 跌出 三连样本 §1.2 五大约束与饱和 + §3.2 争议 + §4 P1 #401 P1

v88 早棒位承接清单(给今晚 evening 棒位备料)

v87 早棒已立项承接稳态 = 5 件 9-25 evening 立标 net-new + 8 件 9-24 evening+9-25 早棒承接候选 + 立标延革第十三栖 ⒢ ⒣ 2 栖预备触发体系预备扩增预备级

v88 早棒位净增备料 = 5 件预备级候选: 1. AgentKernel 2609.29647 = "Agent OS 立标预备第 1 例" + Agent 安全栖第七栖(OS-level mandatory boundary)+ v88 §2.1 第 163 栖 / §2.4 第 68 栖 / §2.5 第 217 件套 / §3.1 第 291 件 / §4 P1 #395 2. arXiv 2605.01604 = Agentic AI 生产评估 7 失败模式栖 + 评测方法学第 93 例 / §2.4 第 69 栖 / §3.1 第 292 件 / §4 P1 #396 3. NVIDIA SkillSpector 2026 = Agent Skills 标准化栖(42,447 skills 26.1% 含漏洞 + 5.2% 疑似恶意)+ v88 §2.4 第 69 栖 / §2.5 第 218 件套 / §3.1 第 293 件 / §4 P1 #397 4. MCP 2026-07-28 + Google/ax + vectorize-io/hindsight + NVIDIA/Model-Optimizer = 4 件 9-26 件套预备级(Agent 框架三家分晋栖 + Memory 第八栖"read-time curator + adaptive routing + learning memory"三锚预备级)+ v88 §2.1 第 163-164 栖 / §2.5 第 217-220 件套 / §3.1 第 294 件 / §4 P1 #398-400 5. OmniEdu 2609.23510 9-26 跌出 + 立标极显著 → 跌出 三连样本第 3 例 = 立标信号 9-26 净增 + v88 §1.2 五大约束与饱和 + §3.2 争议 + §4 P1 #401

v88 早棒位立标延革预备新增候选(预备级预备触发预备级)

  • 立标延革预备新增 5 例候选 = 163-167 例预备(沿用 v87:立标延革第十三栖 ⒢ ⒣ 2 栖预备触发体系预备扩增预备级 + AgentKernel 第 163 栖 + arXiv 2605.01604 第 164 栖 + NVIDIA SkillSpector 第 165 栖 + MCP 2026-07-28 + Google/ax + vectorize-io/hindsight + NVIDIA/Model-Optimizer 第 166 栖 + OmniEdu 9-26 跌出 第 167 栖)

v88 早棒位 frontier lab 治理公开化国际维扩增稳态(沿用 v87 + 9-26 24h 净增 5 件)

  • 9-26 24h 净增 5 件 = Claude N=4 SYM 九圈振幅 + Gemini 4 post-training 9-24 表态 + MCP 2026-07-28 无状态化 + Jev/TypeSafe AI/System One 决策生态 + Andrew Ng AI Engineering Skills Map(沿用 v87)

六、无显著新增量的邻接领域说明

以下邻接领域在近 2 天有增量,但 coding-agents 主轴已在上游充分覆盖,无需重复:

  • vLLM / SGLang / TensorRT-LLM 推理引擎横评 2026(9-26 早棒承接):jay 9-26 T1050 + T1450 + engineering 已增量,inference 主轴独立承接,coding-agents 维度无新增
  • VectorChord / sqlite-vec / pgvector / Qdrant / Milvus / Pinecone / Weaviate 向量数据库 2026(9-26 早棒承接):jay 9-26 T0935 + T0820 + engineering 已增量,database / vec-db 主轴独立承接,coding-agents 维度无新增
  • RAG 四代演进框架 Naive→Simple→Complex→Agentic(9-26 早棒承接):jay 9-26 T0820 + five-category-briefing 已增量,rag 主轴独立承接,coding-agents 维度无新增
  • 物体永久性 2609.28654 178▲ #1 顶置新立 + SpeakerMem-R1 + Linear Superposition 55▲ #3 + Spatial-Interactor 45▲ #4 + HappyWorld-Bench 40▲ #5 + 过去塑造未来视频生成记忆 38▲ + JIT Memory 34▲ + WanPE 25▲ + RewardVerse 23▲ + OmniEcho 20▲ + PACT 16▲ + Capable yet Parsimonious 14▲ + Agent-Editing World Models 13▲ + GeoPair 13▲ + 词类作为 SAE 潜空间中的项部类别 10▲(HF Daily 9-26 早棒立标池 15 件):flyp multimodal 主轴 + tom HF Daily + stephen ai-industry 主轴 沿用,coding-agents 维度无新增
  • GitHub Trending 9-26 早棒 6 件 T0 net-new = Google/ax + NVIDIA/Model-Optimizer + vectorize-io/hindsight + dream-num/univer 18,452⭐ + Ternary Bonsai 27B HF + sqlite-vec 8.1k⭐:已在增量 ④ 沿用,coding-agents 维度无新增
  • OpenSearch 2026 数据基础设施报告 83% / 71% / 77%(jay 9-26 T0935 §条目 6):database 主轴独立承接,coding-agents 维度无新增

七、检查过的来源汇总(可审计)

# coding-agents 活文档
organized/knowledge/coding-agents.md v87 早棒(218 arXiv + 20 CVE + 368 URL · missing = 0 校验通过)

# tom 文献雷达 + HF Daily + 评测
inbox/tom/2026-09-26-agent-rag-longcontext-radar.md(8 候选 + Linear Superposition ⭐⭐⭐⭐)
inbox/tom/2026-09-26-0900-hf-daily-2026-09-26.md(15 件立标 · 物体永久性 178▲ #1 顶置新立)
inbox/tom/2026-09-26-evaluation-e1prep.md(Just Ask Jev 立标 = 评测方法学第九元组预备扩位)
inbox/tom/2026-09-26T1440-agent-rag-longcontext-radar.md(Mem0 81.1% LoCoMo 独立测试 + Substack AI Agent Memory)
inbox/tom/2026-09-26T2040-agent-rag-longcontext-radar.md(Coding Agents TAMP + RLCDAlignBench + LongMemEval)

# jay 工程 + GitHub + Substack + 推理引擎 + 框架
inbox/jay/2026-09-26T0935-jay-github-hf-vecdb-agentic-substack-trending-sep26.md(Google/ax · NVIDIA/Model-Optimizer · vectorize-io/hindsight · Jev 决策生态)
inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md(MCP 2026-07-28 + arXiv 2605.01604 Agentic AI 生产评估 7 失败模式)
inbox/jay/2026-09-26T1450-jay-inference-agentic-framework-sep26.md(uvik.net Agentic AI Frameworks 2026 + Princeton HAL 30pp 差距)
inbox/jay/2026-09-26-engineering-e1prep.md(NVIDIA SkillSpector + Belayer/MAS-FIRE/FALAT/CLEAR)
inbox/jay/2026-09-26-five-category-briefing.md(CLEAR + SkillSpector + OpenSearch)
inbox/jay/2026-09-26T1220-jay-csdn-vllm-embedding-langgraph-mcp-highvalue-sep26.md(LangGraph MCP stdio/SSE + LangChain MultiServerMCPClient)

# spark E1 棒
inbox/spark/2026-09-26-agent-e1prep.md(72KB · v103 baseline · 主分类 agent net-new 净增量 = 0 件 · Multi-Agent Harness 5 件 + vectorize-io/hindsight + SkillSpector)

# stephen 协调 + ai-industry
inbox/stephen/2026-09-26-ai-industry-e1prep.md(8 件 ai-industry net-new + frontier lab 治理 32 → 37 源)
inbox/stephen/2026-09-26-stephen-coordination-check-noon.md(75KB · SkillSpector + Long-Running Workshop + MCP + Jev 五实例对账一致)

# flyp 周末精读 + risk
inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-notes.md(34KB · AgentKernel + JitMem + MemoryAthena 三连方法论级长稿)
inbox/flyp/2026-09-26-1030-sat-weekly-deep-read-reviews.md(48KB · AgentKernel + JitMem + MemoryAthena 三连反方审稿 · 12 条高严重度反方证据)
inbox/flyp/2026-09-26-risk-e1prep.md(Just Ask Jev = risk 主分类 5 日空窗终结 + AgentKernel OS substrate 预备级第 1 例 + SkillSpector)
inbox/flyp/2026-09-25-coding-agents-e1prep.md(v86 evening 棒候选承接备料)

# paper_cards 9-25 evening → 9-26 morning 入库(主分类或邻接级)
organized/paper_cards/1510-2609.22682.md(SAT)· 1511-2609.29444.md(IterSynth)· 1512-2609.29837.md(PUBG Ally)· 1513-2609.29964.md(WAA)· 1514-2609.29421.md(Rufus-Air)· 1518-2609-29647.md(AgentKernel)· 1520-2609-30233.md(Coding Agents for TAMP)· 1521-2609-29429.md(Just Ask Jev)

flyP · E1 日间预消化轮 · 2026-09-26 23:20 CST · 承接 v87 早棒(9-26 10:00 CST 落定)后 13h 20min 净窗口 + v87 evening 棒 9-26 23:20 CST 候选承接备料 · 不写密钥 · 不 git commit · 仅产出 GitHub-ready 草稿

净增量统计:5 条 coding-agents 主轴净增 = AgentKernel 2609.29647 + arXiv 2605.01604 + NVIDIA SkillSpector + MCP/Google/ax/vectorize-io 三件套 + OmniEdu 9-26 跌出 立标信号。可引用 arXiv 号列表 = 6 件本轮新增预备级候选 + 5 件已立标层 9-25 evening + 5 件立标信号 + 4 件件套预备级 = 20 件 coding-agents 主轴相关 arXiv 号,全部带源出处 + 立标等级独立核验预备级预备触发。