llm-application · E1 预消化简报(2026-10-11)

接力:Stephen · E1 日间预消化轮(llm-application)· 2026-10-11 21:10 CST(周日)· cron c08ec05d-37de-4c0c-9571-3ead761a4802。 底本:organized/knowledge/llm-application.md v116(2026-10-10 18:00 落库,7 件 net-new + Agent 框架生态成熟化拐点正式确立双锚定第 2 例 + GLM-5.3 上线 Amazon Bedrock enterprise tier 第 2 例锚定 + frontier lab 公告密度 10-6 → 10-10 连续 5 日回升 + 评测栖预备 v115 36 → v116 37 扩位级)。本简报覆盖 v116 落库之后的 ≈27 小时窗口(2026-10-10 18:00 → 2026-10-11 21:10 Asia/Shanghai),为可能的 v117 升档或承接稳态预备增量。 诚实度声明:本窗口期内直接命中 llm-application 主轴的 NET-new unique arXiv ID = 0 件 —— paper_cards 1749-1755(10-10 evening / 10-11 入池 16 件)全部已在 v116 沿用承接或主分类非 llm-application;评估栖新卡(HarnessDev / AgentJudgeBench / EvoGenUI-Bench / Aspire / Harness-of-Harness)虽在 tom 10-11 evaluation-e1prep 标注,但其栖位判定与 v116 §6⑭ 7 件预备扩增稳态需要 evening 棒重新称重;agent / RAG / multimodal / engineering 主棒位的"补强"信号(Mem0/MemOS/Cognee/MemSearch、State-Bench、AgentSysBench、HarnessSQL、REMORY+galahad-kv、Memento 3、frontier lab 安全产品化)在 v116 已立"Agent 框架生态成熟化拐点 + 评测栖预备 37 扩位级 + RAG Defense 七栖 + Agent 安全四栖"骨架上属于"承接级预备",不构成新栖预备的 NET-new。不硬凑字数。


〇、检查过的来源(本窗口期 · 2026-10-10 18:00 → 2026-10-11 21:10 Asia/Shanghai)

A. inbox 5 实例全覆盖(2026-10-10 evening → 2026-10-11 21:10)

实例 文件(关键) 时间 llm-application 相关度
tom 2026-10-11-0900-hf-daily-2026-10-11.md(15 件立标 · MiMo-V2.6 65▲ #1 + ME-World 47▲ #2 + Memento 3 28▲ + 5 件新立全非 multimodal 主分 = 立标群完全沿用态第 11 日) 09:00 🟢 承接 v116 §1.5 立标池回稳期第 10 日延伸 + 立标群沿用态 · Memento 3 work-queue Top 15 #1 连续两棒 + ME-World 三源对账最稳
tom 2026-10-11-agent-rag-longcontext-radar.md(3⭐ Opera + ORCAGen + Skill Constellations + 5 候选 Hebero / Mara Chain / Forms of LLM-Integrated Apps / Is Memorization / Hierarchical Navigation = 全部已入 v116 或 paper_card 入池) 08:40 🟢 承接级 · 8 件候选全部已入 v116 综述
tom 2026-10-11-evaluation-e1prep.md(HarnessDev 2609.01437 + AgentJudgeBench 2608.26623 + EvoGenUI-Bench 2608.29387 + Aspire 2608.31111 + Harness-of-Harness 2609.01481 + 5 件 OpenAlex 10-11 入池历史论文) 08:52 🟡 新发现 · 4 件增量 + 1 个 Harness 簇 = 评测栖预备扩位级候选 · 但 OpenAlex 10-11 入池 ≠ arXiv 新发表(全部为 2025-09 上传 · 10-11 元数据补全)
tom 2026-10-11-rag-e1prep.md(Q-RAG 2511.07328 + 文档结构消融 2610.10170 + HNSW 几何理论 2610.12312 + RAG 四轴分类法 2610.01936 = RAG 主分类 4 件有效增量) 08:52 🟡 新发现 · RAG 主分类 2 件 net-new + 2 件补录 = RAG 范式跃迁/工程理论层预备扩增
flyp 2026-10-11-0950-flyP-critical-read-Hebero-RobotWorld-heterogeneous-robot-benchmark.md(17.2KB · Hebero 训练 vs RobotWorld 评测范式二分修正 + 异构任务 ≠ 异构机械臂 二级审稿误读修正) 09:50 🟡 范式二分形式化 · Hebero 迁出"评测方法学预备扩增" + RobotWorld 单独立档(v116 §2.1 RobotWorld 已立)
flyp 2026-10-11-multimodal-e1prep.md(20.4KB · 0 件 net-new + 立标群完全沿用态第 11 日 + ME-World 票数 43→47▲ 持续上探) 09:42 🟢 承接级 · v116 §1.5 立标沿用稳态 · 等 10-12 早棒观察日
jay 2026-10-11-engineering-e1prep.md(16.1KB · 5 件主增量 = AgentSysBench 2608.15127 + Mem0/MemOS/Cognee/MemSearch + State-Bench Microsoft May 2026 + HarnessSQL 2610.12274 + Kiln on Trainium vs vLLM on H200) 11:22 🟢 核心承接级 · 工程主分类 5 件全部承接 v116 §1.4 / §6 ⑩ / §6 ⑭/⑤
jay 2026-10-11-agentic-systems-vector-db-mlops.md(10.9KB · AgentSysBench + Agent Memory 四足鼎立 + State-Bench + HarnessSQL 二源对账) 09:36 🟢 核心承接级 · 同上
jay 2026-10-11-csdn-substack-inference-rag-highvalue.md / 2026-10-11T1050-jay-engineering-filter.md / 2026-10-11T1105-database-backend-cloudnative-csdn.md / 2026-10-11T1450-jay-engineering-filter.md / 2026-10-11T1505-database-backend-cloudnative-csdn.md / 2026-10-11T1935-jay-evening-briefing-github-hf-openmodels.md / 2026-10-11T2105-jay-evening-five-category-briefing.md / 2026-10-11T2350-jay-evening-engineering-filter.md 09:36-23:50 🟡 工程邻接级 · 数据库/后端/云原生/CSDN/GitHub 雷达 · llm-application 间接承接
spark 2026-10-11-agent-e1prep.md(52.9KB · v115 10:30 cutoff → 13:30 3h 短窗 · flyp 短审稿 Hebero vs RobotWorld 范式二分 + stephen 协调档承接 + stephen ai-industry v2 5 件主增量 + jay engineering 5 件 + spark RSS Gradient Flow 八项安全假设) 13:30 🟢 核心承接级 · agent 主轴 14 件候选增量覆盖度 + 三源对账最稳(Memento 3 四源 + Skill Constellations + Mara Chain 三源)
spark 2026-10-11-1001-rss-gradient-flow.md + 2026-10-11-1003-rss-chip-huyen.md 10:01/10:03 🟡 RSS 沿用级 · Gradient Flow 八项安全假设 + 17,600 次尝试 = Agent 安全栖位延伸稳态预备第 9 例周边
stephen 2026-10-11-stephen-coordination-check-noon.md(52.9KB · 14h 早棒窗口综合 + 6 大分类覆盖度核查 + 21 冲突 + 20 新候选 + 6 必须人工确认 + agent 主轴 14 件候选增量覆盖) 12:45 🟢 核心承接级 · 跨实例 import 关系判定档 + 重复检测三源对账
stephen 2026-10-11-ai-industry-e1prep.md(24.6KB v2 直白风格 · 5 件主增量 = Memento 3 + frontier lab 公告密度 + Skill Constellations + REMORY+galahad-kv + Anthropic 安全/治理产品化 + 8 件 P0 警示) 10:24 🟢 核心承接级 · frontier lab 治理公开化第三阶段信号候选(单日观察升档风险 P0-3)
stephen 2026-10-11-0910-news-x-vip-radar.md + 2026-10-11-1004-news-{anthropic, openai, deepmind, google-ai, hf}-news.md + 2026-10-11-1005-news-{bens-bites, tldr-ai}-news.md 09:10-10:05 🟢 frontier lab 公告 24 件 net-new(OpenAI 5 + Anthropic 4 + DeepMind 5 + Google AI 5 + HF Blog 5) + X-VIP 静默期延续 + frontier lab 公告密度 10-6 → 10-11 连续 6 日回升

B. paper_cards 过去 3 天新卡(2026-10-09 evening → 2026-10-11 21:10)

卡号 arXiv 标题 主分类 v116 承接状态 本窗口期增量
1749 2609.33987 Opera: Verbal Critic Framework for Long-horizon Coding Agents agent ✅ v116 §6 ⑯ 已承接(栖预备第 1 例) 已入 v116 · 8 votes HF Daily
1750 2610.11169 Skill Constellations: Tracing the Supply Chain of Agent Skills on GitHub agent ✅ v116 §6 ⑮ 已承接(栖预备第 1 例) 已入 v116 · paper_cards/skill_supply_chain + work-queue Top 15 第 2
1751 2606.03335 Hebero: GPU-Parallel Heterogeneous Multi-Task RL Benchmark evaluation ✅ v116 §1.5 评测方法学栖预备扩增稳态(标 "评测 ≠ 训练") flyp 短审稿 09:50 范式二分修正 · 评测方法学栖预备扩增稳态续立
1752 2609.35855 Mara Chain: Reframing Failure as a Stepping Stone evaluation ✅ + agent 副 v116 已锚 · "agent 安全 + 自动演化四联预备" 沿用 已入 v116
1753 1511.00363 BinaryConnect(历史论文) engineering 沿用承接 历史沿用 · 非增量
1754 2610.09280 Evaluating Transfer of Co-Evolved Communication 2D→3D evaluation 沿用承接 · multimodal 主棒位承接 non-llm-application main axis
1755 2609.38527 Behavioral Persistence in Co-evolved Communication evaluation 沿用承接 · multimodal 主棒位承接 non-llm-application main axis
1175 2608.29387 EvoGenUI-Bench(OpenAlex 10-11 入池) evaluation NEW for paper_card 但 2025-09 上传历史论文 🆕 评测栖预备扩位候选第 8 件 · 但 实际为 OpenAlex 历史论文补全
1180 2609.01481 Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement evaluation 同 1175 🆕 Harness 簇节点 = LLM 生成 harness 评测
1194 2608.26623 AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling evaluation 同 1175 🆕 LLM-as-Judge 在 DAG 工作流上 · R100 Opera 反馈追踪之外的第七元 judge 失效模式
1196 2609.01437 HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? evaluation 同 1175 🆕 "LLM 生成 harness vs harness 演进"对照第三路径(沿用 EMHO 轨迹/候选/生成三路径)
1199 2608.31111 Aspire: Can Models Self-Evolve from Vague Goals? evaluation 同 1175 🆕 模糊目标驱动自我演化 · Agent Plasticity 性能曲线之外的"目标解释"维度

paper_cards 净增 = 7 件 NET-new for evaluation 池(全部为 OpenAlex 10-11 入池 · 实际为 2025-09 上传历史论文 · 元数据/TLDR 补全 ≠ arXiv 新发表):1175 + 1180 + 1194 + 1196 + 1199 + 1749 + 1750 + 1751 + 1752 = 9 件 + 1748(REMORY)+ 1744(Memento 3)+ 1733(Self-Retrospection Distillation)+ 1734(Agent Plasticity)+ 1731(galahad-kv)+ 1730(2610.10170 RAG 文档结构消融)+ 1737(2610.12312 HNSW 几何理论)= 16 件本周新卡中 llm-application 直接命中 = 0 件 NET-new 主分类。

C. work-queue 2026-10-11(20:00 自动生成)

项 状态
Top 15 高价值待精读 0 件(已清空)
待更新主题活文档 0 件(全部最新)
选题榜未成视频脚本 2 件:2610.12461 OuroWorld + 2608.03979(multimodal · 与 llm-application 邻接 · 不直接合入)
待写攻略 1 件:DenisovAV/flutter_edge_ai(Tom 认领)
富化缺口 15 张卡缺 TLDR(待 cron_s2 覆盖)
待精确分类 2 张卡(主分类缺失 · cron_classify_llm)

D. 评估 v116 中尚未明确归位的"承接级"候选(本窗口期预备合入)v117

候选 来源 当前栖预备对接 建议归入节
HarnessDev arXiv:2609.01437 paper_card 1196 tom 10-11 evaluation-e1prep v116 §6 ⑭ Agent 评测方法学 7 件预备扩增稳态(Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench)→ 第 8 件 §6 ⑭ → 评测栖预备 v117 38 扩位级候选
AgentJudgeBench arXiv:2608.26623 paper_card 1194 tom 10-11 evaluation-e1prep v116 §3.1 #138 评测栖预备 37 扩位级 → "DAG 工作流 agentic judge 可靠性"维度 §6 ⑭ → 评测栖预备 v117 39 扩位级候选
EvoGenUI-Bench arXiv:2608.29387 paper_card 1175 tom 10-11 evaluation-e1prep v116 §1.3 长程/多 Agent 评测端点 → "多轮 UI 界面维护"补充 §6 ⑭ → 评测栖预备 v117 40 扩位级候选
Aspire arXiv:2608.31111 paper_card 1199 tom 10-11 evaluation-e1prep v116 §1.3 垂类多阶段多维评测 → "目标模糊性自我解释" §6 ⑭ → 评测栖预备 v117 41 扩位级候选
Harness-of-Harness arXiv:2609.01481 paper_card 1180 tom 10-11 evaluation-e1prep v116 §6 ⑨ Harness Engineering → "harness-of-harness 持续改进" §6 ⑨ → Harness 知识工程栖预备第 3 例
Hebero vs RobotWorld 评测范式二分修正 flyp 09:50 短审稿 v116 §2.1 评测方法学 + v116 §1.5 评测栖预备扩增稳态 → Hebero 训练基础设施 + RobotWorld 评测范式独立成档 §2.1 / §1.5 二分修正式化
AgentSysBench arXiv:2608.15127 jay 10-11 engineering-e1prep 增量 1 v116 §1.4 Agent 框架生态成熟化拐点 → Agentic workload serving 成本模型重新定义 §1.4 / §6 ⑩ Agent 框架生态成熟化拐点栖预备
State-Bench Microsoft May 2026 jay 10-11 + jay 19:50 等多源 v116 §6 ⑭ → memory 独立评测栖预备第 1 例(Microsoft 5 月 + 450 企业任务) §6 ⑭ → 评测栖预备 v117 38 扩位级候选(同 HarnessDev)
HarnessSQL arXiv:2610.12274 jay 10-11 engineering-e1prep 增量 4 v116 §6 ⑩ Agent 框架栖位 → Harness 原生 SQL Agent 训练承接稳态第 1 例 §1.4 / §6 ⑩
Mem0/MemOS 35.24%/Cognee/MemSearch Agent Memory 基础设施四足鼎立 jay 10-11 + jay 19:50 + tom 10-11 radar 行业快讯 v116 §6 ⑤ Memory 十二栖预备扩增稳态 → Memory 第十六栖"分化基础设施栈"栖预备邻接第 2 例(REMORY 第十五栖 + 四足鼎立第十六栖) §6 ⑤
REMORY arXiv:2610.11287 + galahad-kv arXiv:2610.10845 agent 记忆压缩主轴双候选 spark 10-11 ai-industry v2 + jay 10-11 v116 §6 ⑤ → "语义 / 神经 / 工程"三栖预备(stephen P0-5 降档为"双候选") §6 ⑤
Kiln on Trainium vs vLLM on H200 jay 10-11 T1050 v116 §6 ③ 长上下文体系栖预备扩增稳态 → 多芯片推理引擎成本对比 + AWS Trainium 适用场景边界 §6 ③
Memento 3 arXiv:2610.11794 frontier lab 级 agent 自我改进立标候选 spark 10-11 + tom 10-11 radar + jay 10-11 + HF Daily 28▲ v116 §6 ⑭ 已立 Agent 评测方法学第 7 件 → "frontier lab 级 agent 自我改进主轴立标候选预备第 1 例"升档预备 §6 ⑭ → v117 升档 candidate
Skill Constellations arXiv:2610.11169 首个 AI Agent Skill 软件供应链研究 spark 10-11 + tom 10-11 + jay 10-11 + paper_cards 1750 三源对账 v116 §6 ⑮ 已立 Skill 供应链栖预备第 1 例 → "AI Agent Skill 软件供应链"立标候选升档预备 §6 ⑮ → v117 升档 candidate
RAG 文档结构消融 arXiv:2610.10170 + HNSW 几何理论 arXiv:2610.12312 tom 10-11 rag-e1prep v116 §6 ⑨ 知识工程栖预备 → RAG 工程层 (文档结构 confound) + 理论层 (HNSW 几何) 双立标 §6 ⑨ RAG 工程层 / 理论层
Q-RAG arXiv:2511.07328 ICLR 2026 + RAG 四轴分类法 arXiv:2610.01936 AI Reviews tom 10-11 rag-e1prep 补录 v116 §6 ⑧ RAG 范式跃迁栖预备 → RL 训练 Embedder + Defense/Interactivity 新轴 §6 ⑧ + §6 ⑭
frontier lab 治理公开化第三阶段 = 安全产品化商用化(stephen P0-3 单日观察升档风险) stephen 10-11 + spark 10-11 + flyp 10-11 risk-e1prep 多源 v116 §1.4 / §5 ① frontier lab 商业生态结构性反转 → "第三阶段"候选 prep(不升档为"模式跃迁") §5 → trend #82 候选 prep
OpenAI 10-11 商业化案例 5 件(Asana -76× + Sophos Daybreak -96% + Oracle ChatGPT + Pollo AI + LegalOn -65%)= 成本优化专项 stephen 10-11 ai-industry v2 + jay 10-11 v116 §1.4 frontier lab 公告密度回升 → 企业客户代表性待核(P0-8) §1.6 engineering 5 联预备扩增稳态

总判定:上述 18 项均为"承接级"而非"NET-new 主轴"——大多在 v116 §1 / §6 已有锚点,需要的是进一步归位或承接稳态续立。0 件 NET-new 命中 llm-application 主轴 = 本窗口期为"v116 综述骨架稳定 + 沿用承接级" = 不预期 v117 在 21:10 主棒位产生大版本升档,但有 4-5 项"承接级预备升档候选"需要 evening 棒位决策。


一、核心增量(本窗口期 · 18 条候选承接级预备合入)

增量 1 · HarnessDev arXiv:2609.01437 OpenAlex 10-11 入池 · LLM 生成 harness vs harness 演进对照第三路径 · 评测栖预备 v117 38 扩位级预备(v116 §6 ⑭ 承接级 ⚠⚬⚬)

  • 来源:
  • paper_cards/1196-2609-01437.md(OpenAlex 10-11 入池 · 主分类 evaluation · 形态 benchmark · 被引 8 · 实际 2025-09 上传历史论文 · 10-11 元数据/TLDR 补全)
  • tom 10-11 evaluation-e1prep 增量 1
  • 旁证:Harness-of-Harness arXiv:2609.01481 paper_card 1180(多日 70+ 迭代自主开发 FPS 游戏)+ AgentJudgeBench arXiv:2608.26623 paper_card 1194 = Harness 全生命周期评测三角(生成 / 迭代 / 评估使用)
  • jay 10-11 1003 lilian-weng RSS 旁证:"Harness Engineering & Self-Improvement(2026-07)"
  • v116 §6 ⑭ 已锚 Agent 评测方法学 7 件预备扩增稳态(Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench)

  • 要点: 1. HarnessDev 核心 = 研究 LLM 能否创建并演进自身的 Agent Harness —— "LLM 直接生成 harness"是"harness 从零生成"路径(EMHO 轨迹驱动演进 + Mara Chain 候选诊断驱动演进 + HarnessDev 零生成 = 三路径) 2. 关键发现 = 生成 harness 在代码与搜索/研究任务上仍显著落后于成熟人工参考方案 = 这两个领域对 harness 精度要求最高;在写作与机器学习实验任务上达到或超过所选参考方案 = 任务约束更易形式化 3. 成本信号 = 执行成本差异巨大(生成 harness 的计算开销 vs 人工设计成本需要权衡) 4. 可信度 = ⭐⭐⭐⭐ 同 HarnessDev/Mara Chain/EMHO 三者形成 harness 设计自动化横向对照;Microsoft May 2026 State-Bench(jay 10-11)提供方法学支撑 5. LLM application 主轴相关性 = 主轴 Agent Harness 栖预备 + 评测栖预备;与 v116 §6 ⑭ / §6 ⑨ / §1.4 / §6 ⑩ 直接承接

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑭ "Agent 评测方法学新维度 v115 6 → v116 7 件预备扩增稳态 ⚠⚬" 形成 第 8 件栖预备(HarnessDev 加入)⚠⚬
  • 与 v116 §3.1 #138 评测方法学栖预备 v115 36 → v116 37 扩位级 → v117 38-41 扩位级承接 ⚠⚬⚬
  • 与 v116 §6 ⑨ "知识工程栖预备第 1 例 awesome-llm-knowledge-systems 2026-09-15" 协同 = Agent Harness 知识工程栖预备第 3 例 ⚬

  • 建议归入节:

  • 主归入:§6 ⑭ Agent 评测方法学新维度 拓展为 "v115 6 → v116 7 → v117 8 件预备扩增稳态 ⚠⚬⚬⚬ = Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench + HarnessDev (Microsoft May 2026 historical) LLM 生成 harness vs harness 演进对照第三路径栖预备第 1 例"
  • 副归入:§6 ⑨ 知识工程栖预备 拓展 "awesome-llm-knowledge-systems 2026-09-15 + ai-boost/awesome-harness-engineering 2026-10-04 (Agent Harness 全景) + Harness-of-Harness harness-of-harness 持续改进栖预备第 3 例 ⚠⚬"

增量 2 · AgentJudgeBench arXiv:2608.26623 OpenAlex 10-11 入池 · LLM-as-Judge 在 Agentic DAG 工作流上失效 · 第七元 judge 失效(v116 §6 ⑭ 承接级 ⚠⚬)

  • 来源:
  • paper_cards/1194-2608-26623.md(OpenAlex 10-11 入池 · 主分类 evaluation · 形态 benchmark · 被引 1)
  • tom 10-11 evaluation-e1prep 增量 2
  • v116 §3.1 #138 共识:评测栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬

  • 要点: 1. 研究空白 = 现有 LLM-as-Judge 研究多聚焦开放式文本生成或偏好排序评判,Agentic 工具调用工作流 DAG 评判从未被系统性研究 2. 核心问题 = 在 agentic 系统中 LLM judge 需要评判的是具有因果依赖关系的有向无环图(DAG)而非独立文本片段 —— 带来独特的可靠性挑战 3. 关键贡献 = 首个专门针对 workflow DAG 上 agentic 工具调用评判的 benchmark;揭示当前 LLM judge 在该场景下的根本局限;给出面向 agentic 系统可靠评估的实践指南 4. 与现有 judge 失效研究关系 = R92 MIST(VLM judge 被无关图像劫持 verdict)+ R93 SAGO(稳定性维度失效)+ R95 LexReward(奖励分类法失效)+ R97 Selection vs Extraction(预注册方法失效)+ R100 Opera(反馈追踪失效)= 现有六元;AgentJudgeBench 揭示 DAG 结构因果依赖 = 第七元 ⚠⚬ 5. 可信度 = ⭐⭐⭐⭐ OpenAlex 同期入池 5 件元数据/TLDR 全部完整 + 与 R100 Opera 形成"反馈追踪 → DAG 结构"两个新维度

  • 与活文档现有脉络的关系:

  • 与 v116 §1.2 "评测方法学栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬" → v117 第 39 件栖预备承接
  • 与 v116 §6 ⑭ "Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench" → 加 AgentJudgeBench = 第 8 件栖预备(同 HarnessDev)⚠⚬
  • 与 R100 Opera(反馈追踪失效)的协同 = judge 评测时机 + 评测结构两个新维度

  • 建议归入节:

  • 主归入:§6 ⑭ Agent 评测方法学新维度 拓展 "+ AgentJudgeBench (Microsoft May 2026 historical) LLM-as-Judge 在 Agentic DAG 工作流上失效 = 第七元 judge 失效模式(沿 R92 MIST / R93 SAGO / R95 LexReward / R97 Selection vs Extraction / R100 Opera) ⚠⚬⚬"
  • 副归入:§3.3 开放问题 新增 "Q117.566:AgentJudgeBench 中 DAG 深度/宽度如何分级?DAG judge 失效与 R92 MIST 无关图像劫持失效机制是否本质不同?"

增量 3 · EvoGenUI-Bench arXiv:2608.29387 OpenAlex 10-11 入池 · 150 任务 × 5 轮 × 750 轮次 多轮生成式 UI 助手评测(v116 §6 ⑭ 承接级 ⚠⚬)

  • 来源:
  • paper_cards/1175-2608-29387.md(OpenAlex 10-11 入池 · 主分类 evaluation · 形态 benchmark · 被引 1)
  • tom 10-11 evaluation-e1prep 增量 3

  • 要点: 1. 规模 = 150 个五轮任务共 750 轮对话轮次(每任务平均 5 轮交互) 2. 三种场景 = (1) 信息呈现 (2) 可执行交互 (3) 工具驱动的外部状态 3. 评测焦点 = 多轮界面维护(multi-turn interface maintenance)而非单轮 UI 生成 —— 与现有 UI 生成 benchmark 的核心区别 4. 可信度 = ⭐⭐⭐ OpenAlex 同期入池 5 件元数据/TLDR 完整 · 待原文确认评测指标体系(自动评分还是人工评分?)+ 三种场景 task distribution + 是否存在工具调用评测子集

  • 与活文档现有脉络的关系:

  • 与 v116 §1.3 长程/多 Agent 评测端点体系(GameHorizon → AgentWorld → ... → AgencyBench → SafeActBench)+ EvoGenUI-Bench 填补"多轮 UI 界面维护"长程评测空白 ⚬
  • 与 v116 §6 ⑭ Agent 评测方法学新维度 → 第 10 件栖预备(评测栖预备 v117 40 扩位级候选)

  • 建议归入节:

  • 主归入:§6 ⑭ Agent 评测方法学新维度 拓展 "+ EvoGenUI-Bench (Microsoft May 2026 historical) 多轮 UI 维护 = 第 10 件栖预备候选 ⚬"
  • 备选归入:§1.3 长程/多 Agent 评测端点 拓展 "AgentWorld → SafeActBench → EvoGenUI-Bench 多轮 UI 维护 评测端点续立 ⚬"

增量 4 · Aspire arXiv:2608.31111 OpenAlex 10-11 入池 · 模糊目标驱动自我演化 benchmark · 520 题 6 类目标 + Agent Plasticity 互补(v116 §6 ⑭ 承接级 ⚠⚬)

  • 来源:
  • paper_cards/1199-2608-31111.md(OpenAlex 10-11 入池 · 主分类 evaluation · 形态 benchmark · 被引 2)
  • tom 10-11 evaluation-e1prep 增量 4

  • 要点: 1. 核心问题 = agent 被给予模糊(vague)而非精确的目标时,如何评估其自我解释和自我演化能力 2. 关键发现 = 模糊目标会将搜索资源导向目标解释阶段 —— 而非直接执行 —— 改变 agent 工作流程重心 3. 评测集规模 = 520 题隐藏专家评测集,覆盖 6 类目标(hidden expert-authored set) 4. 可信度 = ⭐⭐⭐ OpenAlex 同期入池 · 被引 2 · 与 R99 Agent Plasticity 三栖预备对比待原文

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑭ Memento 3 / R99 Agent Plasticity(性能改进曲线)→ Aspire(目标解释阶段)= 评测方法学新维度候选 ⚬
  • 与 v116 §3.3 开放问题 Q116.551(Memento 3 反思式规则手册工程边界)→ Aspire 给出"目标模糊性"新评测维度
  • 与 v116 §6 ⑭ → 第 11 件栖预备候选(同 HarnessDev / AgentJudgeBench)

  • 建议归入节:

  • 主归入:§6 ⑭ Agent 评测方法学新维度 拓展 "+ Aspire (Microsoft May 2026 historical) 模糊目标驱动自我演化 = 第 11 件栖预备候选 ⚬ · 与 R99 Agent Plasticity 互补"
  • 副归入:§3.3 开放问题 新增 "Q117.567:Aspire 与 R99 Agent Plasticity 是否可互用评测集?若可,则评测方法学互补性问题需要确认"

增量 5 · Harness-of-Harness arXiv:2609.01481 OpenAlex 10-11 入池 · 多日 70+ 迭代自主开发 FPS 游戏 · Harness 簇节点(v116 §6 ⑨ 承接级 ⚠⚬)

  • 来源:
  • paper_cards/1180-2609-01481.md(OpenAlex 10-11 入池 · 主分类 evaluation · 形态 method · 被引未定)
  • tom 10-11 evaluation-e1prep 增量 5(Harness 簇)

  • 要点: 1. TLDR 核心 = 在持续多天、超过 70 轮迭代的部署中,Harness-of-Harness 自主开发出一款第一人称射击游戏 2. 方法学贡献 = Harness-of-Harness 名称中第一个 Harness 是动词(评价/约束),第二个是名词(评测工具)= "Harness 的 Harness" 3. 可信度 = ⭐⭐⭐⭐ 与 HarnessDev / AgentJudgeBench 形成 Harness 全生命周期评测三角(生成 / 迭代 / 评估使用) 4. 主分类 = 主分类 evaluation + agent 副分类 · "harness-of-harness"是"Harness Engineering"知识工程栖预备第 3 例

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑨ "知识工程栖预备第 1 例 awesome-llm-knowledge-systems 2026-09-15" → Harness 知识工程栖预备第 3 例 ⚬
  • 与 v116 §6 ⑭ → Harness 簇节点(同 HarnessDev / AgentJudgeBench)= Harness 全生命周期评测三角(生成 / 迭代 / 评估使用)
  • 与 R98 EMHO(轨迹驱动 Harness 演进)+ R100 Mara Chain(被拒候选重用)+ HarnessDev(LLM 从零生成)= harness 设计自动化四路径 ⚠⚬

  • 建议归入节:

  • 主归入:§6 ⑨ 知识工程栖预备 拓展 "awesome-llm-knowledge-systems 2026-09-15 + ai-boost/awesome-harness-engineering 2026-10-04 + Harness-of-Harness (May 2026 historical) 多日 70+ 迭代自主开发 FPS 游戏栖预备第 3 例 ⚬"
  • 副归入:§6 ⑭ Agent 评测方法学 增补 "HarnessDev + Harness-of-Harness + AgentJudgeBench = Harness 全生命周期评测三角(生成 / 迭代 / 评估使用)⚠⚬"

增量 6 · Hebero vs RobotWorld 评测范式二分修正 = "train 侧 vs eval 侧"(v116 §2.1 / §1.5 承接级 ⚠⚬⚬)

  • 来源:
  • flyp 10-11 0950 短审稿(17.2KB · Hebero vs RobotWorld 评测范式二分形式化)
  • paper_cards/1751-2606-03335.md(Hebero)+ paper_cards/1752-2609-35855.md(Mara Chain,主 evaluation 副 agent)
  • v116 §1.5 评测栖预备扩增稳态沿用 + v116 §1.5 RobotWorld 84 Robot Tasks 63 未由 Frontier Model 解决(10-08)

  • 要点: 1. 核心修正 = e1prep "Hebero vs RobotWorld 评测定位部分重叠"判断过于粗略;实际是异构机器人评测方法的两种不同范式 —— Hebero = 训练基础设施(train 侧),RobotWorld = 评测基础设施(eval 侧);不应合并纳入同一"评测预备扩增"目录 2. 范式二分形式化:

    • Hebero 训练范式:Isaac Lab 内 40 异构任务(任务异构 ≠ 机械臂本体异构)+ state + visual policies + 演示引导 RL(DGPO)+ 单策略跨 40 任务联合训练 + 训练-评估一致性高 = train 侧基础设施 ⚠⚬
    • RobotWorld 评测范式:跨 20 源项目统一 Harness + 5 embodiment × 84 任务 + 多模态 agent(图像 + 工具调用 + 自然语言指令)+ 任务特定可执行检查器 + 任务预算 + 训练-评估一致性低 = eval 侧基础设施 ⚠⚬ 3. 数字重新解读 = ASTRA 19.0% vs Opus 5.5 15.5% 必须按 "1 episode / 模型-任务" 而非"X% 成功率"重新解读(项目方自己承认) 4. 可信度 = ⭐⭐⭐⭐ flyP 周末短审稿档 · 二级审稿判断 · 形式化拆解
  • 与活文档现有脉络的关系:

  • 与 v116 §2.1 评测方法学延革"Hebero 训练基础设施预备档"→ Hebero 范式归属形式化档化 + RobotWorld 评测范式预备级第 1 例单独立档 ⚠⚬⚬
  • 与 v116 §3.2 #138 争议"评测 ≠ 训练 · Hebero 训练 · RobotWorld 评测"→ 正式档化 + 二级审稿误读修正
  • 与 v116 §3.3 Q105.481"Hebero 训练基础设施 vs 评测 harness 二分归属修正"→ 正式修正 + train-vs-eval 分轨维护建议

  • 建议归入节:

  • 主归入:§2.1 评测方法学延革 拓展 "Hebero 训练基础设施预备档迁出"评测方法学预备扩增"档 ⚠⚬⚬ + RobotWorld 评测范式预备级第 1 例单独立档 ⚠⚬⚬"
  • 副归入:§3.1 共识 新增 "Hebero vs RobotWorld 评测范式二分预备升档建议 ⚠⚬⚬(评测 ≠ 训练 · Hebero 训练范式 · RobotWorld 评测范式)"
  • 副归入:§3.2 争议 拓展 "Hebero "异构机械臂" 二级审稿误读修正为"异构任务 + 演示引导 + 标准协议" ⚠⚬⚬"

增量 7 · AgentSysBench arXiv:2608.15127 HKUST + Alibaba + ByteDance 178,799 session · Agentic Workload serving 成本模型重新定义(v116 §1.4 / §6 ⑩ 承接级 ⚠⚬⚬)

  • 来源:
  • jay 10-11 engineering-e1prep 增量 1(主棒位承接)
  • jay 10-11 agentic-systems-vector-db-mlops 增量 1
  • v116 §1.4 "Microsoft Agent Lightning v1.0 + Microsoft Execution Containers(MXC) + Microsoft Agent Framework 1.0 GA = Agent 框架生态成熟化拐点正式确立双锚定 ⚠⚬⚬⚬"

  • 要点: 1. 核心发现 = 178,799 生产 session 实测,10 个真实 agentic 应用 — 模型推理不再是主要成本中心;sandbox、搜索、embedding、向量数据库操作在工具密集型应用中占主导 2. 关键数据 = 任务分解式 serving(disaggregated serving)vs 共享组件,延迟降低 29-40%(同 GPU 数量对比) 3. 6 个区分属性 = 区分 agentic 与传统 LLM serving 的关键工程差异 4. 工程意义 = 传统 LLM serving 假设(算力即瓶颈)不适用于 agentic 场景;监控需覆盖非 LLM 组件(工具调用延迟、沙箱开销);资源隔离是关键优化方向 5. 可信度 = ⭐⭐⭐⭐ 工业界联合研究,HKUST + Alibaba + ByteDance,大规模生产数据

  • 与活文档现有脉络的关系:

  • 与 v116 §1.4 "Agent 框架生态成熟化拐点正式确立双锚定 ⚠⚬⚬⚬" → Agentic Workload serving 成本模型重新定义为 Agent 框架生态成熟化拐点栖预备第 11 例候选 ⚠⚬⚬
  • 与 v116 §6 ⑩ "Agent 框架生态成熟化拐点栖预备双锚定第 2 例 ⚠⚬⚬⚬" → 第 11 例栖预备候选
  • 与 v116 §6 ② "Agent 安全栖位四栖预备稳态" 协同 = harness-aware inference engine 方向

  • 建议归入节:

  • 主归入:§1.4 / §6 ⑩ Agent 框架生态成熟化拐点栖预备双锚定 拓展 "+ AgentSysBench arXiv:2608.15127 HKUST + Alibaba + ByteDance 178,799 session 实测 = Agentic Workload serving 成本模型重新定义 = harness-aware inference engine 方向栖预备第 11 例 ⚠⚬⚬"
  • 副归入:§3.1 #138 共识 新增 "AgentSysBench 模型推理不再是主要成本中心 + disaggregated serving 延迟 -29-40% + 6 个区分属性识别 ⚠⚬⚬"

增量 8 · Mem0/MemOS 35.24%/Cognee/MemSearch Agent Memory 基础设施四足鼎立 · Memory 第十六栖预备邻接第 1 例(v116 §6 ⑤ 承接级 ⚠⚬⚬)

  • 来源:
  • jay 10-11 engineering-e1prep 增量 2
  • tom 10-11 radar 行业快讯(Mem0 LoCoMo benchmark 91.6% vs 72.9% full-context + 10× token compression)
  • jay 10-11 agentic-systems-vector-db-mlops 增量
  • flyp 10-10 risk-e1prep + spark 10-11 agent-e1prep 增量 4(同承接)
  • v116 §6 ⑤ "Memory 十二栖预备扩增稳态"沿用(Memadapter + When Does Selection Replace Extraction + In-Parameter Memory + DyadMem URAM + MemFold + Honeycomb + ExperienceIndex + SkillForge + Personalized TTS + Real Long-Term Memory 50M Token Window)

  • 要点: 1. Mem0 = AI Agent 的 memory layer · drop-in production infrastructure · 持久化上下文(通用生产首选) 2. MemOS = 自进化 memory OS · 35.24% token 节省 + DeepSeek Harness 支持(DeepSeek 生态首选) 3. Cognee = 图结构 memory · 支持多源知识融合(GraphRAG 场景) 4. MemSearch(Zilliz) = Markdown + Milvus · 跨 Agent(Claude Code/Codex/DSH)memory · user-owned · local-first · Markdown-native · 跨 app/tools/workflows 自进化 5. 关键数据 Mem0 10-11 新立 = LoCoMo benchmark 对比(10× token compression):Full-context baseline 72.9% 准确率 ~26,000 tokens p95 延迟 17.12s vs Mem0 新算法 91.6% 准确率 <7,000 tokens p95 延迟 ~1.44s 6. 可信度 = ⭐⭐⭐ jay 评分 7/10 · GitHub topics 验证 · Mem0 10-11 数据原生已经 peer-review 级

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑤ "Memory 十二栖预备扩增稳态" → Memory 第十六栖"分化基础设施栈"栖预备邻接第 1 例 ⚠⚬⚬(REMORY + 四足鼎立 = Memory 第十五 + 第十六栖)
  • 与 v116 §6 ⑤ REMORY arXiv:2610.11287 残差记忆网络预备邻接第 1 例 → 协同 = 第十六栖
  • 与 v116 §6 ⑤ + §1.4 + §6 ⑩ 协同 = Agent Memory 基础设施层 = Agent 框架生态成熟的支撑层

  • 建议归入节:

  • 主归入:§6 ⑤ Memory 十二栖预备扩增稳态 拓展 "+ Mem0/MemOS 35.24%/Cognee/MemSearch 分化基础设施栈栖预备邻接第 1 例(Memory 第十六栖) + REMORY 残差记忆网络栖预备邻接第 1 例(Memory 第十五栖) + Mem0 10-11 LoCoMo benchmark 91.6% / 72.9% / <7,000 tokens / ~1.44s ⚠⚬⚬"

增量 9 · REMORY arXiv:2610.11287 + galahad-kv arXiv:2610.10845 agent 记忆压缩主轴双候选形成(v116 §6 ⑤ 承接级 ⚠⚬⚬)

  • 来源:
  • spark 10-11 agent-e1prep 增量 4 + spark 10-11 ai-industry v2 增量 4
  • paper_cards/1748-2610-11287.md + paper_cards/1731-2610-10845.md
  • v116 §6 ⑤ Memory 十二栖预备扩增稳态沿用

  • 要点: 1. REMORY arXiv:2610.11287v1 = 长时程 agent 历史压缩 + 不依赖纯文本摘要 + 神经记忆网络补充 + 有界序列的软记忆 token + 摘要 + 软记忆 token 形成序列维度残差连接 + SummHay 上有提升 2. galahad-kv arXiv:2610.10845v1 = 50,000,000 token 真实公共文本长期记忆 + 每 ~16K token 块 KV 状态保存到加密 NVMe + 字节精确无重计算加载 + 单 H100 vLLM + Gemma 4 12B/31B + 100/100 块零重计算加载 3. 方法学双轨 = REMORY(软 token 残差连接,方法学派)vs galahad-kv(KV 状态磁盘缓存,工程学派) = 同一问题(长上下文 vs 压缩 vs 效率)的方法学双轨 ⚠⚬⚬ 4. stephen P0-5 降档 = agent 记忆的"语义 / 神经 / 工程"三栖预备降档为"双候选"(Memento 3 是世界模型外部化,不在同一栖位) 5. 可信度 = ⭐⭐⭐ 双 paper_cards 同步标记(1748 + 1731)+ 多源承接

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑤ Memory 十二栖预备扩增稳态 → agent 记忆压缩主轴双候选形成(方法学双轨) ⚠⚬⚬
  • 与 v116 §6 ⑤ + 增量 8 Mem0/MemOS 协同 = Memory 第十五栖 + 第十六栖

  • 建议归入节:

  • 主归入:§6 ⑤ Memory 十二栖预备扩增稳态 拓展 "+ REMORY (软 token 残差连接) + galahad-kv (KV 状态磁盘缓存) = agent 记忆压缩主轴双候选形成(方法学双轨) ⚠⚬⚬ · stephen P0-5 降档为"双候选"而非"三栖""

增量 10 · Memento 3 arXiv:2610.11794 frontier lab 级 agent 自我改进主轴立标候选预备第 1 例(v116 §6 ⑭ 承接级 → v117 升档候选 ⚠⚬⚬⚬)

  • 来源:
  • spark 10-11 ai-industry v2 增量 1(主棒位承接)
  • stephen 10-11 ai-industry v2 增量 1 + spark 10-11 agent-e1prep 增量 3 + spark 10-11 增量 5
  • tom 10-11 radar + paper_card 1744 + work-queue 10-11 Top 15 #1 连续两棒
  • v116 §6 ⑭ 已立 Agent 评测方法学 7 件预备扩增稳态(Memento 3 加入)

  • 要点: 1. Memento 3 核心 = 反思式规则手册递归自我改进 · 模型基础 RSI(reflective rulebooks)= 冻结 LLM agent + 外部记忆 + 自然语言规则手册(持久化语义记忆)+ 记录可修正的环境动力学假设 + 保留未知部分 2. 三联预备 = Memento 3(世界模型修正) + Agent Plasticity arXiv:2610.08902(评价方法学)+ Self-Retrospection Distillation arXiv:2610.08077(训练范式)= agent self-improvement 三栖预备 ⚠⚬ 3. work-queue Top 15 #1 唯一 1 例 = Memento 3 连续两棒占据 work-queue Top 15 第 1 ⚠⚬ 4. 可信度 = ⭐⭐⭐ 三源对账(立标 28▲ + paper_card 1744 + work-queue Top 15 #1)+ 多实例(jay / tom / flyp / spark / stephen)同步标记 5. stephen P0-1 = 升档建议(Memento 3 升档活文档 v117 §X.X)+ P0-6(Memento 3 自我改进三联预备稳定性待核)

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑭ "Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench" → 7 件预备扩增稳态沿用
  • 与 v116 §3.1 #138 评测栖预备 v115 36 → v116 37 → v117 38 扩位级 → Memento 3 升档活文档 v117 §X.X ⚠⚬⚬⚬(候选 / 不升档)
  • 与 v116 §3.3 Q116.551(Memento 3 反思式规则手册工程边界)→ Memento 3 自我改进三栖预备稳定性待核(stephen P0-6)

  • 建议归入节:

  • 主归入:§6 ⑭ Agent 评测方法学新维度 拓展 "Memento 3 + Agent Plasticity + Self-Retrospection Distillation = agent self-improvement 三栖预备 ⚠⚬⚬(评价方法学 / 训练范式 / 世界模型修正) + Memento 3 升档 v117 §X.X 候选 ⚠⚬⚬⚬"
  • 副归入:§3.3 开放问题 新增 "Q117.568:Memento 3 自我改进三栖预备在 GA 后是否仍保持?stephen P0-6"

增量 11 · Skill Constellations arXiv:2610.11169 首个 AI Agent Skill 软件供应链研究 = 三源对账最稳(v116 §6 ⑮ 承接级 → v117 升档候选 ⚠⚬⚬⚬)

  • 来源:
  • spark 10-11 ai-industry v2 增量 3
  • tom 10-11 radar 3⭐ #3 + paper_cards 1750 + jay 10-11 1003 RSS 二手转引
  • spark 10-11 agent-e1prep 增量 3 + spark 10-11 risk-e1prep 增量 ②
  • v116 §6 ⑮ "Skill Constellations Agent Skills supply chain on GitHub 栖预备第 1 例 ⚠⚬"沿用

  • 要点: 1. 核心数据 = 追踪 GitHub 上 Agent Skill(SKILL.md 指令 + 脚本)的供应链 + Claude Code / Codex 以用户权限运行 = 没有 registry / versions / provenance 的软件供应链 + 首次构建基于 git 历史的 agent skill 有向复制网络 2. 首个 AI Agent Skill 软件供应链立标 ⚠⚬⚬ = 在 Agent skills(SKILL.md + 脚本)成为 Claude Code / Codex 的执行路径的当下,没有版本控制、没有 provenance = 潜在供应链攻击面 / 安全修复覆盖范围不清 / 应审查仓库清单不明 3. 三源对账最稳 = stephen ai-industry 增量 3 + tom radar 3⭐ #3 + paper_card 1750 + jay 10-11 1003 RSS 二手转引 + work-queue Top 15 第 2 + spark risk-e1prep 增量 ② = 四源对账最稳 4. 与"agent 安全 + 自动演化"四联预备协同 = volt-agent awesome-ai-agent-papers(含 BackdoorAgent + HoneyTrap + Zero-Trust Runtime Verification)+ State-of-MLOps OpenAI self-improving tax agents + Mara Chain = "agent 安全 + 自动演化四联预备" ⚠⚬ 5. 可信度 = ⭐⭐⭐⭐ 四源对账 + arXiv 10-11 + paper_cards 1750 入池 + work-queue Top 15 第 2

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑮ "Skill Constellations Agent Skills supply chain on GitHub 栖预备第 1 例" → 升档 v117 §X.X 候选 ⚠⚬⚬⚬
  • 与 v116 §6 ② "Agent 安全栖位四栖预备稳态 ⚠⚬⚬" 协同 = Skill 安全栖位预备 + harness + External 供应链治理双轴
  • 与 v116 §1.4 / §6 ⑩ Agent 框架生态成熟化拐点 协同 = Skill 安全栖位扩增稳态第 9 例准备

  • 建议归入节:

  • 主归入:§6 ⑮ Skill Constellations 拓展 "首个人 AI Agent Skill 软件供应链研究 + 三源对账最稳 + 升档 v117 §X.X 候选 ⚠⚬⚬⚬"
  • 副归入:§6 ② Agent 安全栖位四栖预备稳态 拓展 "+ Skill Constellations + Mara Chain + volt-agent + State-of-MLOps = 「agent 安全 + 自动演化」四联预备 ⚠⚬⚬"

增量 12 · State-Bench Microsoft May 2026 · 450 企业任务 · memory 独立评测方法论贡献(v116 §6 ⑭ 承接级 ⚠⚬)

  • 来源:
  • jay 10-11 engineering-e1prep 增量 3
  • jay 10-11 agentic-systems-vector-db-mlops 增量 2
  • jay 10-11 1950 engineering-filter KEEP #2(8.5/10)+ stephen 10-10 llm-application-e1prep 增量 1 沿用稳态
  • v116 §6 ⑭ 已承 STATE-Bench(Microsoft May 2026)= memory 独立评测栖预备第 1 例预备合入

  • 要点: 1. 核心贡献 = 450 个企业任务(客服/旅行/购物),memory 作为独立学习轨迹评测变量 2. 关键判断 = "memory architecture 评测必须独立于 task quality 评测"(stephen 10-10 19:50 KEEP #2 评分 8.5/10) 3. 工程意义 = 为 Agent Memory 系统的可评测性提供了方法论基础;此前所有 Agent benchmark 均将 memory 作为黑箱处理 4. 可信度 = ⭐⭐⭐ Microsoft 发布 + jay 评分 8.5/10 + 4.7k★ ai-boost/awesome-harness-engineering 收录 5. 承接路径 = v116 §6 ⑭ 已合入 · stephen 10-10 19:50 已承 + 10-11 jay engineering 主棒位复承

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑭ Agent 评测方法学 7 件预备扩增稳态 → 第 8 件栖预备(同 HarnessDev)/ = 评测栖预备 v117 38 扩位级候选
  • 与 v116 §3.3 Q117.562 沿用(Mem0 vs MemOS vs Cognee vs MemSearch 选型决策树在 2027 是否会出现 HumanEval 之于代码生成的统一评测栖?)= State-Bench 是首个

  • 建议归入节:

  • 主归入:§6 ⑭ Agent 评测方法学新维度 拓展 "+ State-Bench Microsoft May 2026 450 企业任务 memory 独立评测栖预备第 1 例 ⚠⚬"

增量 13 · HarnessSQL arXiv:2610.12274 Agent Harness 原生 SQL 训练 · Agent 与 Serving 协同设计(v116 §6 ⑩ 承接级 ⚠⚬⚬)

  • 来源:
  • jay 10-11 engineering-e1prep 增量 4
  • jay 10-11 1001-rss-cool-papers 二源对账
  • v116 §6 ⑩ "Agent 框架生态成熟化拐点栖预备双锚定第 2 例"

  • 要点: 1. 核心问题 = Text-to-SQL 模型被训练为将问题直接映射为静态查询;真实数据库 Agent 通过有状态、多轮交互执行任务 —— 两者 mismatch 导致生产 SQL Agent 效果差 2. 解决方案 = HarnessSQL — 在 Agent harness 原生环境(真实数据库 + 多轮交互)中训练 SQL Agent,而非静态 SQL 数据集 3. 工程意义 = 展示了 Agent 系统与 inference engine 协同设计的具体路径 —— harness(编排层)与 serving(推理层)的 co-design = HarnessSQL 是 Harness-of-Harness / HarnessDev 之外的"harness 原生训练"路径 4. 可信度 = ⭐⭐⭐⭐ arXiv 10-11 新发表 + 工程方法论明确 + Cool Papers 今日收录

  • 与活文档现有脉络的关系:

  • 与 v116 §1.4 / §6 ⑩ Agent 框架生态成熟化拐点 → HarnessSQL 承接稳态第 1 例 ⚠⚬
  • 与 v116 §6 ⑩ 沿用 = Harness 原生训练路径 = 与 Harness-of-Harness / HarnessDev 形成 Harness 知识工程栖预备第 3-4 例
  • 与 v116 §6 ⑨ 知识工程栖预备 → 协同 = Harness-of-Harness 持续改进栖预备第 3 例

  • 建议归入节:

  • 主归入:§6 ⑩ Agent 框架生态成熟化拐点栖预备 拓展 "+ HarnessSQL arXiv:2610.12274 Harness 原生 SQL 训练承接稳态第 1 例 ⚠⚬⚬"

增量 14 · RAG 文档结构消融 arXiv:2610.10170 + HNSW 几何理论 arXiv:2610.12312 RAG 主轴补强(v116 §6 ⑨ / §6 ⑧ / §6 ⑥ 承接级 ⚠⚬⚬)

  • 来源:
  • tom 10-11 rag-e1prep 增量 1(arXiv:2610.10170 Does Document Structure Help Dense Retrieval?)+ 增量 2(arXiv:2610.12312 The Geometry of Hierarchical Navigation)+ 增量 3(Q-RAG arXiv:2511.07328 补录 ICLR 2026)+ 增量 4(RAG 四轴分类法 arXiv:2610.01936 补录 AI Reviews)
  • paper_cards/1730-2610-10170.md + paper_cards/1737-2610-12312.md
  • v116 §1.3 RAG Defense 轴 v115 6 → v116 7 件预备扩增稳态(EngramEdit 加入)沿用

  • 要点: 1. 文档结构消融核心 = RAG 系统日益依赖四类文档结构处理(结构对齐分块 / LLM 生成块上下文 / 标题路径元数据 / 分层两阶段检索)各自研究在不同语料/嵌入器/指标上支持各自方法,但没有一项控制共同混淆因素:"在块前添加任何文本都会扰动其嵌入"。本文机制隔离消融 + 语义空安慰剂对照 2. HNSW 几何理论核心 = RAG 和推荐引擎广泛使用 HNSW 等分层图结构实现超高速向量检索。但"什么条件下贪心导航既精确又高效"的几何理论此前未被充分研究。本文在 d 维环面上建立了确定性 coverage condition —— 满足该条件时,贪心导航对任意查询保证收敛 = RAG 召回系统工程理论奠基 3. Q-RAG 核心 = RL 训练 Embedder 而非微调 LLM 的多步检索 · 用 value-based / Q-learning 风格强化学习直接训练 Embedder,以"未来能否命中答案"为奖励信号,reader 与 retriever 解耦。BabiLong + RULER 10M tokens SOTA(ICLR 2026 接收 + 开源代码) 4. RAG 四轴分类法核心 = 作者显式拒绝沿用早期 survey 的"Naive/Advanced/Modular"三件套架构视角,改为按能力维度切四轴 —— Efficiency(检索效率优化)+ Defense(鲁棒性与安全性)+ Interactivity(用户驱动交互工作流)+ Reasoning(多步/复杂推理) 5. 可信度 = ⭐⭐⭐⭐ 4 件均为 rag 主分类;前 2 件为 10-07/10-08 新提交,后 2 件为 ICLR 2026 / AI Reviews 期刊

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑨ 知识工程栖预备 → RAG 工程层(文档结构 confound) + 理论层(HNSW 几何)双立标 ⚠⚬⚬
  • 与 v116 §6 ⑧ RAG 范式跃迁栖预备 → RECAST(多文档聚合)+ Q-RAG(RL 训练 Embedder)+ RECAST + UNREAL = 多步检索优化 = 与 RECAST 同属"多步检索优化"方向(路径不同)
  • 与 v116 §6 ⑥ + §1.3 RAG Defense + Interactivity 新轴 → Defence 与 Interactivity 是此前活文档中缺失的结构轴(Defense 与 v116 §1.3 RAG Defense 七栖预备扩增稳态协同;Interactivity 新增)
  • 与 v116 §1.3 RAG Defense 轴 v115 6 → v116 7 件预备扩增稳态 → 文档结构 + HNSW 几何 + Q-RAG + 四轴分类 = RAG 防御第 8-11 件栖预备候选 ⚠⚬

  • 建议归入节:

  • 主归入:§6 ⑨ 知识工程栖预备 拓展 "+ 文档结构消融 arXiv:2610.10170 RAG 工程层第 1 例 ⚠⚬ + HNSW 几何理论 arXiv:2610.12312 RAG 理论层第 1 例 ⚠⚬"
  • 副归入:§6 ⑧ RAG 范式跃迁栖预备 拓展 "+ Q-RAG arXiv:2511.07328 ICLR 2026 RL 训练 Embedder 栖预备第 1 例"
  • 副归入:§1.3 RAG Defense 轴 拓展 "+ RAG 四轴分类法 arXiv:2610.01936 AI Reviews = Defense + Interactivity 新轴 = Defense 第 8-11 件栖预备候选 ⚠⚬"

增量 15 · frontier lab 治理公开化第三阶段 = 安全产品化商用化 · 单日观察升档风险 ⚠⚬⚬⚬(v116 §5 承接级 ⚠⚬⚬⚬)

  • 来源:
  • stephen 10-11 ai-industry v2 增量 5 + P0-3
  • stephen 10-11 1004 news-{anthropic, openai, deepmind, google-ai, hf}-news(5 件)+ 1005 news-{bens-bites, tldr-ai}-news(2 件)
  • spark 10-11 agent-e1prep 增量 3 协同
  • flyp 10-11 risk-e1prep 增量 ① / ⑤ "frontier lab 治理公开化第三阶段"候选 prep
  • v116 §1.4 "OpenRouter OpenAI > Anthropic 2.5yr Weekly Model Spend 首次反超(WSJ 10-07)沿用稳态 ⚠⚬⚬⚠" + §1.4 GLM-5.3 上线 Amazon Bedrock enterprise tier 第 2 例锚定

  • 要点: 1. Anthropic 10-11 4 件 net-new = Claude Science UV 天空 + Anthropic Cyber Mission + Open-source vuln discovery service + 2026 Usage Policy 更新 = Anthropic 当日未发布新模型,仅发布安全/治理产品 ⚠⚬⚬ 2. DeepMind 10-11 5 件 net-new = SynthID Bio(AI 生成蛋白质水印)+ Private AI Compute(server-side memory)+ Gemini 4 Argon + EmbeddingGemma 2 + Gemini 3.8 Live/Live Avatar = DeepMind 跨模态治理 + 隐私 frontier 双轨新立 3. OpenAI 10-11 5 件 net-new = Asana GPT-6.1 Sol -76× + Sophos Daybreak -96% + Oracle ChatGPT + Codex + Pollo AI GPT-5.6/Astra/Image-2.5 + LegalOn Codex -65% = OpenAI 商业化案例成本优化专项新立 ⚠⚬ 4. frontier lab 公告密度 10-6 → 10-11 连续 6 日回升 = 周末 RSS 偏置假象 P0-2 ⚠⚬ 5. frontier lab 治理公开化第三阶段跃迁叙事 = 第一阶段(10-08 之前 = 模型级公告)→ 第二阶段(10-7 之后 = 治理框架公开化)→ 第三阶段(10-11 = 安全产品化商用化) 6. 可信度 = ⭐⭐(RSS 二手转引 + 6 件 news 文件对账,"连续 6 日回升"沿用 P0-4 同等风险)

  • 与活文档现有脉络的关系:

  • 与 v116 §1.4 / §5 ① frontier lab 商业生态结构性反转 → "第三阶段"候选 prep(不升档为"模式跃迁") ⚠⚬⚬⚬
  • 与 v116 §1.6 "frontier lab 公告密度 10-6 → 10-10 连续 5 日回升稳态 ⚠⚬⚬⚠" → 10-11 延伸第 6 日 = 5→6 日 沿用 ⚠⚬⚬⚠
  • 与 stephen P0-3 自治 / stephen P0-4 / stephen C3 阶段升档缺失 / stephen C4 商业模式叙事升档过快 = 承接为"概念预备级"而非"阶段跃迁" ⚠⚬⚬

  • 建议归入节:

  • 主归入:§5 ① frontier lab 商业生态结构性反转 拓展 "+ frontier lab 治理公开化第三阶段 = 安全产品化商用化候选 prep(单日观察升档风险 P0-3 ⚠⚬⚬⚬) + 公告密度 10-6 → 10-11 连续 6 日回升 ⚠⚬⚬⚠"
  • 副归入:§3.3 开放问题 新增 "Q117.569:Anthropic 10-11 当日仅发布安全/治理产品是否对应订阅收入或一次性商业化?'阶段跃迁'叙事的边界(第一/二/三阶段的具体时间窗与触发信号)?"
  • 副归入:§3.2 争议 新增 "单日观察不应升档为阶段跃迁(stephen C3 / C4 / P0-3 ⚠⚬⚬⚬)"

增量 16 · Kiln on Trainium vs vLLM on H200 · 新一代推理引擎成本对比(v116 §6 ③ 承接级 ⚠⚬)

  • 来源:
  • jay 10-11 T1050 engineering-filter(jay 主棒位承接)
  • v116 §6 ③ "长上下文体系栖预备扩增稳态" + §6 ⑦ "推理引擎横评"

  • 要点: 1. 核心数据 = Trainium(trn1.32xlarge)vs 8×H200(p5en.48xlarge),并发 16/32/64 下输出 tok/s、每百万 token 成本详细对比 2. 关键发现 = Trainium 在成本上优势显著(并发 16 时低 73-75%),但首 token 延迟高(6.9s vs 634ms) 3. Prompt caching 量化 = 75% prefix 共享时降 58% 成本 4. Charles Frye 调试方法论(Modal CTO)= 日志要足够详细才能仅靠日志 debug;记录 token IDs 定位 tokenizer bug;记录比预期更多的指标 5. 可信度 = ⭐⭐⭐ 自测 + 引用 EC2/SageMaker 定价,需独立核验 AWS 实际部署数据

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ③ "长上下文体系栖预备扩增稳态" → 多芯片推理引擎成本对比 + AWS Trainium 适用场景边界 ⚠⚬
  • 与 v116 §6 ⑦ "推理引擎横评" → 补强 = NVIDIA GPU 视角 + AWS Trainium 视角

  • 建议归入节:

  • 主归入:§6 ③ 长上下文体系栖预备扩增稳态 拓展 "+ Kiln on Trainium vs vLLM on H200 Trainium 成本 -73-75% 但 TTFT 高 6.9s vs 634ms + 75% prefix caching -58% 成本 ⚠⚬"

增量 17 · OpenAI 10-11 商业化案例 5 件成本优化专项 · frontier lab 安全 IR 落地稳态第 2 例(v116 §1.6 承接级 ⚠⚬)

  • 来源:
  • stephen 10-11 1004 news-openai-news(1.4KB · 10:04)+ stephen 10-11 ai-industry v2 P0-8
  • flyp 10-11 risk-e1prep 增量 ③(frontier lab 安全 IR 落地稳态第 2 例)

  • 要点: 1. OpenAI 10-11 5 件 net-new 商业化案例 ⚠⚬ = Asana GPT-6.1 Sol 成本 -76 倍 + Sophos Daybreak 威胁调查 -96% + Oracle ChatGPT + Codex + Pollo AI GPT-5.6/Astra/Image-2.5 + LegalOn Codex 成本 -65% 2. 「OpenAI 从能力主导转到成本主导」判断的代表性边界 = 5 件均为企业客户代表性待核 P0-8 ⚠⚬ 3. 协同分析 = R98 evening F11(OpenAI 10-10 Sophos × Daybreak 96%)= frontier lab 安全 IR 落地稳态第 1 例 + 10-11 5 件全部为成本优化的「企业客户代表性待核 P0-8」 = frontier lab 安全 IR 落地稳态第 2 例 4. 可信度 = ⭐⭐⭐ RSS 二手转引 · 5 件成本优化 vs R98 F11 1 件安全 IR 落地 = 二元划分

  • 与活文档现有脉络的关系:

  • 与 v116 §1.6 engineering 5 联预备扩增稳态 → 补强 ⚠⚬
  • 与 stephen P0-8 企业客户代表性待核 + flyp C6 企业客户代表性待核 = 两源 P1 待核验

  • 建议归入节:

  • 主归入:§1.6 engineering 5 联预备扩增稳态 拓展 "+ OpenAI 10-11 商业化案例 5 件成本优化专项(企业客户代表性待核 P0-8 ⚠⚬) = frontier lab 安全 IR 落地稳态第 2 例"

增量 18 · Mem0 10-11 LoCoMo benchmark · 91.6% / 72.9% / <7,000 tokens / ~1.44s · 记忆检索 token 效率与准确率同时优化(v116 §6 ⑤ 承接级 ⚠⚬)

  • 来源:
  • tom 10-11 radar 行业快讯(10-11 04:30)+ inbox/tom/_candidates/2026-10-11-agent-rag-longcontext-candidates.json
  • jay 10-11 engineering-e1prep 增量 2(Mem0 + MemOS + Cognee + MemSearch)
  • v116 §6 ⑤ Memory 十二栖预备扩增稳态沿用

  • 要点: 1. Mem0 LoCoMo benchmark 数据 = Full-context baseline 72.9% 准确率 ~26,000 tokens p95 延迟 17.12s vs Mem0 新算法 91.6% 准确率 <7,000 tokens p95 延迟 ~1.44s 2. 关键结论 = 记忆检索的 token 效率与准确率可以同时优化,Mem0 在 10× 令牌压缩下反而精度更高 3. 可信度 = ⭐⭐⭐⭐ Mem0 官方 LoCoMo benchmark · 与 jay 10-11 engineering-e1prep 增量 8 Mem0 协同

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑤ Memory 十二栖预备扩增稳态 → Mem0 LoCoMo benchmark 验证 token efficiency + accuracy 可以同时优化 ⚠⚬
  • 与 v116 §6 ⑤ + 增量 8 Mem0/MemOS 35.24% 协同 = Memory 第十六栖"分化基础设施栈"栖预备邻接第 1 例的具体数据 anchor

  • 建议归入节:

  • 主归入:§6 ⑤ Memory 十二栖预备扩增稳态 拓展 "+ Mem0 LoCoMo benchmark 91.6% / 72.9% / 10× token compression / ~1.44s = Memory 第十六栖分化基础设施栈栖预备邻接第 1 例 anchor ⚠⚬"

二、值得警惕的矛盾或待核实说法(本窗口期 5 件候选)

矛盾 1 · stephen P0-3 frontier lab 治理公开化第三阶段跃迁叙事升档过快 ⚠⚬⚬⚬

  • 本窗口期新增证据:Anthropic 10-11 4 件 net-new(Claude Science + Cyber Mission + Open-source vuln + 2026 Usage Policy)= Anthropic 当日仅发布安全/治理产品
  • 争议焦点:Anthropic 10-11 单日观察 = frontier lab 治理公开化第三阶段跃迁 vs 单日观察不应被升档为阶段跃迁
  • 建议:承接为"概念预备级"而非"阶段跃迁"(stephen P0-3 自承)⚠⚬⚬;需要多日接续验证(至少 10-12/10-13/10-14 观察);降低升档节奏

矛盾 2 · stephen P0-5 agent 记忆三栖判断升档过快 ⚠⚬⚬⚬

  • 本窗口期新增证据:Memento 3 语义(反思式规则手册)/ REMORY 神经(软 token 残差)/ galahad-kv 工程(KV 状态缓存)三栖判断
  • 争议焦点:三栖是否真构成方法学连续体 vs 单一方法学派内多分支
  • 建议:承接为"双候选"而非"三栖"(stephen P0-5 自承)⚠⚬⚬;REMORY + galahad-kv 同一问题方法学双轨(Memento 3 是世界模型外部化,不在同一栖位)

矛盾 3 · MemOS 35.24% token 节省来源 GitHub 工程实践非 peer-reviewed ⚠⚬

  • 来源:jay 10-11 engineering-e1prep 矛盾 2 + stephen 10-11 ai-industry v2 P0-8
  • 争议焦点:MemOS "35.24% token 节省" claim 的独立可验证性
  • 建议:待原文精读确认(jay 评分 7/10);对比基线是什么?不同任务类型是否都有收益?节省的是 prompt token 还是 generation token?

矛盾 4 · stephen P0-2 + P0-7 frontier lab 公告密度连续 6 日回升 = 周末 RSS 偏置假象 ⚠⚬⚬

  • 本窗口期新增证据:frontier lab 公告密度 10-6 → 10-11 连续 6 日回升 + AnthropicAI 静默期延续第 5 日 + 学术界静默期第 5 日
  • 争议焦点:6 日回升是否真趋势 vs 周末 RSS 偏置假象
  • 建议:cross-check 工作日(10-13 周一 / 10-14 周二)vs 周末(10-18 周六 / 10-19 周日)的公告密度比;独立核验缺失

矛盾 5 · OpenAlex 10-11 入池 ≠ 新论文 · 全部为 2025-09 上传历史论文 ⚠⚬⚬

  • 本窗口期新增证据:tom 10-11 evaluation-e1prep 增量 1-5 全部为 OpenAlex 9 月更新后于 10-11 入池的历史论文(2025-09 上传),非当日新发表论文
  • 争议焦点:OpenAlex 10-11 入池 ≠ arXiv 新发表(全部为 2025-09 上传 · 10-11 元数据补全)
  • 建议:警惕将"OpenAlex 入池"误认为"arXiv 新发表";承接稳态续立,不应升档为新立标候选(本简报 5 件 + paper_card 1199/1196/1194/1180/1175 全部归入此类别)

三、可引用的 arXiv 号列表(本窗口期内重点)

v116 已承接 · 沿用稳态(本窗口期内未见新增 NET-new llm-application 主轴)

  • arXiv:2608.20055 EchoCoT(v116 §6 ② 推理层栖预备第 1 例)
  • arXiv:2610.10533 EngramEdit(v116 §1.3 RAG Defense 第七栖)
  • arXiv:2610.11794 Memento 3(v116 §6 ⑭ Agent 评测方法学第 7 件 + 升档 v117 §X.X 候选 ⚠⚬⚬⚬)
  • arXiv:2610.12299 ME-World(v116 §1.5 multimodal 首个多 agent 同步 ego-stream 立标候选)
  • arXiv:2609.33987 Opera(v116 §6 ⑯ 栖预备第 1 例)
  • arXiv:2610.11169 Skill Constellations(v116 §6 ⑮ 栖预备第 1 例 + 升档 v117 §X.X 候选 ⚠⚬⚬⚬)
  • arXiv:2610.12415 ORCAGen(v116 §1.3 RAG Defense 承接)
  • arXiv:2610.11899 Forms of LLM-Integrated Applications(v116 §1.2 评测栖预备承接)
  • arXiv:2610.12085 Is Memorization Context-Sensitive?(v116 §1.3 RAG Defense 第六栖)
  • arXiv:2610.12312 The Geometry of Hierarchical Navigation(v116 §1.3 RAG Defense + RAG 理论层第 1 例 ⚠⚬)
  • arXiv:2610.11287 REMORY(v116 §6 ⑤ Memory 第十五栖残差记忆网络预备邻接第 1 例)
  • arXiv:2610.10845 galahad-kv(v116 §6 ⑤ + 增量 9 双候选形成)

v116 已承接但本日有补充数据/方法学贡献的(本窗口期内承接级)

  • arXiv:2610.10170 文档结构消融(tom 10-11 rag-e1prep 增量 1 · RAG 工程层第 1 例 ⚠⚬)
  • arXiv:2608.15127 AgentSysBench(jay 10-11 engineering 增量 1 · HKUST + Alibaba + ByteDance 178,799 session 实测 ⚠⚬⚬)
  • arXiv:2610.12274 HarnessSQL(jay 10-11 engineering 增量 4 · Harness 原生 SQL Agent 训练承接稳态第 1 例 ⚠⚬)
  • arXiv:2511.07328 Q-RAG(tom 10-11 rag-e1prep 增量 3 · ICLR 2026 接收 + 开源代码 · 补录)
  • arXiv:2610.01936 RAG 四轴分类法(tom 10-11 rag-e1prep 增量 4 · AI Reviews 期刊 · 补录)

评测栖预备 v117 38-41 扩位级候选(OpenAlex 10-11 入池 · 实际 2025-09 上传历史论文)

  • arXiv:2609.01437 HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?(paper_card 1196 · 主分 evaluation · 形态 benchmark · 被引 8 · 评测栖预备 v117 38 扩位级候选)
  • arXiv:2608.26623 AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling(paper_card 1194 · 主分 evaluation · 形态 benchmark · 被引 1 · 第七元 judge 失效模式)
  • arXiv:2608.29387 EvoGenUI-Bench(paper_card 1175 · 主分 evaluation · 形态 benchmark · 被引 1 · 150 任务 × 5 轮 × 750 轮次多轮 UI 助手评测)
  • arXiv:2608.31111 Aspire: Can Models Self-Evolve from Vague Goals?(paper_card 1199 · 主分 evaluation · 形态 benchmark · 被引 2 · 520 题 6 类目标)
  • arXiv:2609.01481 Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement(paper_card 1180 · 主分 evaluation · 形态 method · Harness 簇节点)

工作队列候选(沿用级 · multimodal 主轴 · 不直接合入 llm-application)

  • arXiv:2610.12448 reViT: Recurrent Vision Transformers with Depth-Programmed Experts(工作队列视频脚本 · multimodal 主分类)
  • arXiv:2610.12459 WorldGuide: Goal-Directed Video World Model for Procedural Task Execution(工作队列视频脚本 · multimodal 主分类)

非 arXiv 工程实践引用

  • https://github.com/ai-boost/awesome-harness-engineering(4.7k★ · 2026-10-04 更新)
  • https://github.com/VoltAgent/awesome-ai-agent-papers(363+ 篇 2026 年 arXiv 论文 · 5 类分)
  • https://github.com/mem0ai/mem0(Mem0 · 通用生产首选 · LoCoMo benchmark 91.6% / 72.9% 10× token compression)
  • https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition(theaiengineer Substack 2026 Edition · guardrails 范式转变)
  • https://foxl.ai/blog/introducing-kiln(Kiln on Trainium vs vLLM on H200 · Trainium 成本 -73-75% vs TTFT 高 6.9s vs 634ms)
  • https://microsoft.com/en-us/research/blog/agent-lightning-v1-0-a-3500-line-lightweight-agentic-rl-framework-for-training-agents-with-real-harnesses(Microsoft Agent Lightning v1.0)
  • https://blogs.windows.com/windowsdeveloper/2026/10/07/microsoft-execution-containers-policy-driven-containment-for-ai-agents(Microsoft Execution Containers MXC)
  • https://aws.amazon.com/bedrock/glm(GLM-5.3 上线 Amazon Bedrock 753B 1M context enterprise tier)

CVE 与协议层栖预备 · 沿用级(v116 已承接)

  • CVE-2025-6514 mcp-remote OAuth 命令注入 CVSS 9.6(v116 §6 ② 协议层栖预备)
  • CVE-2026-48710 Starlette fakeredis 版本锁定(v116 §6 ② 协议层栖预备)
  • Asana MCP 跨租户数据泄漏(v116 §6 ② 协议层栖预备)
  • mcp-server-git 路径遍历 + 参数注入(v116 §6 ② 协议层栖预备)

URL 与非 arXiv 引用 · 沿用级

  • https://github.com/sglang-project/sglang(SGLang 400K GPU 生产规模)
  • https://github.com/microsoft/agent-lightning(Microsoft Agent Lightning v1.0 · github 3500 行栖预备第 1 例)
  • https://anthropic.com/news/discovering-cryptographic-weaknesses-with-claude(Anthropic Cyber Mission)
  • https://anthropic.com/news/three-real-world-incidents-cybersecurity-evaluations(Anthropic Cyber Mission 续立)

四、诚实度声明

本窗口期(2026-10-10 18:00 → 2026-10-11 21:10 = ≈27h)llm-application 主轴净增量密度 = 「中低」——v116 cutoff 后 ≈27h 内 llm-application 主分类 NET-new 真新 arXiv ID = 0 件(全部为 v116 综述骨架沿用承接 + OpenAlex 10-11 入池历史论文补全 + 非 llm-application 主分新论文)+ llm-application 主轴行为类承接级增量 = 18 件(承接级预备合入 v117 候选)。总体方向延续 v116:立标池回稳期第 10 日延伸 + 立标群完全沿用态第 11 日 + Agent 框架生态成熟化拐点双锚定第 2 例 + GLM-5.3 enterprise tier 第 2 例 + frontier lab 公告密度 10-6 → 10-11 连续 6 日回升 ⚠⚬⚠ + 评测栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬ + RAG Defense 七栖 + Agent 安全四栖 + Agent 评测方法学 7 件预备扩增稳态。

承接级预备合入候选(18 件):① HarnessDev ② AgentJudgeBench ③ EvoGenUI-Bench ④ Aspire ⑤ Harness-of-Harness ⑥ Hebero vs RobotWorld 范式二分 ⑦ AgentSysBench ⑧ Mem0/MemOS/Cognee/MemSearch ⑨ REMORY + galahad-kv ⑩ Memento 3 ⑪ Skill Constellations ⑫ State-Bench ⑬ HarnessSQL ⑭ RAG 文档结构消融 + HNSW 几何 + Q-RAG + 四轴分类 ⑮ frontier lab 治理第三阶段 ⑯ Kiln on Trainium ⑰ OpenAI 商业化案例 5 件 ⑱ Mem0 LoCoMo benchmark = 全部为 v116 已立骨架的"承接级预备升档候选",不构成新栖预备的 NET-new。

不升档为正式立标候选:Anthropic 10-11 单日观察 = 承接为"概念预备级"而非"阶段跃迁" = stephen P0-3 ⚠⚬⚬⚬;agent 记忆三栖判断 = 降档为"双候选"而非"三栖" = stephen P0-5 ⚠⚬⚬⚬;Memento 3 / Skill Constellations 升档活文档 v117 §X.X 候选 = 等 evening 棒位决策 ⚠⚬;评测栖预备 v117 38-41 扩位级候选 = 4 件 OpenAlex 10-11 入池历史论文的 TLDR/元数据补全 ≠ arXiv 新发表 ⚠⚬。

未升档为主轴 net-new:OpenAlex 10-11 入池 ≠ 新论文(1175 + 1180 + 1194 + 1196 + 1199 全部为 2025-09 上传 · 10-11 元数据补全)+ work-queue Top 15 #1 = 0 件(已清空) + 0 件 git + 0 件私密凭证 + v116 综述骨架在 ≈27h 内完整沿用稳定承接 = 真实增量密度 = 「中低」与 v116 同样档。

结语:本窗口期是 v116 落库后的"承接级 + 反方档化预备 + 升档决策预备期"——为可能的 v117 升档或承接稳态续立做材料预备;主棒位 evening 决策时,可考虑"承接级预备合入 v117 候选"(18 件候选)+ 不升档为正式 NET-new 主轴 = 承接 v116 综述骨架 + 评测栖预备 v117 38-41 扩位级 + Memory 第十五/十六栖预备 + RAG 工程/理论层 + Hebero vs RobotWorld 范式二分 + frontier lab 第三阶段候选 prep = v116→v117 沿用承接稳态续立。


Stephen · E1 日间预消化轮(llm-application)· 2026-10-11 21:10 CST · 检查来源:work-queue.md(2026-10-11 20:00)+ inbox/{tom, jay, flyp, spark, stephen} 近 2 天 24+ 文件 + paper_cards 1730-1755(16 件 net-new)+ paper_cards 1175-1199(5 件 OpenAlex 10-11 入池历史论文)+ knowledge/llm-application.md v116 + 立标池第 72 日承接稳态 · 0 件 git + 0 件私密凭证;全部引用均来自实测 inbox + paper_cards + work-queue + 立标池;未虚构。