llm-application · E1 预消化简报(2026-10-10)

接力给今晚 21:10 主题活文档轮。 活文档 llm-application.md 已落库 v116(2026-10-10 18:00,7 件 net-new + RAG Defense 七栖 + Agent 安全四栖 + 评测栖预备 v115 36 → v116 37 扩位级 + Agent 框架生态成熟化拐点正式确立双锚定第 2 例 + GLM-5.3 上线 Amazon Bedrock enterprise tier 第 2 例锚定 + frontier lab 公告密度 10-6 → 10-10 连续 5 日回升);本简报覆盖 v116 落库之后的 3 小时窗口(18:00 → 21:10 Asia/Shanghai),为可能的 v117 量变预备增量。 角色定义:不重启 v116 综述骨架,只把窗口期新增/承接 / 待核 / 待入节材料摆好;让今晚主棒"挑最值得合入的若干件"。 关键判断:3 小时窗口内无直接命中 llm-application 主轴的 net-new arXiv 唯一 ID;承接内容来自 llm-infra / agent-engineering / inference 主棒位的侧向溢出;主要预备方向是"Agent 框架生态成熟化拐点后的工程化延伸"+ "MCP stateless + MXC 之后的协议层栖预备补强"+"评测栖预备第 38 件候选(STATE-Bench + memory 独立评测)"。不硬凑字数。


〇、检查过的来源(本窗口期 · 2026-10-10 18:00 → 21:10 Asia/Shanghai)

来源 文件 摘出时间 状态
工作队列 /shared/research-kb/organized/queue/work-queue.md(20:00 自动生成) 20:00 旁系 Top 15 高优待精读 0 件 + 待更新主题活文档 0 件 + 选题榜未成视频脚本 2 件(2610.12448 reViT + 2610.12459 WorldGuide = 主分类 multimodal · 与 llm-application 邻接 · 不直接合入)
活文档 v116 基线 /shared/research-kb/organized/knowledge/llm-application.md(18:00 落库) 18:00 7 件 net-new 已入 §1.1-§1.6 + Agent 评测方法学 7 件预备扩增稳态 + Agent 安全栖预备四栖预备稳态 + RAG Defense 七栖预备扩增稳态 + 评测栖预备 37 扩位级
paper_cards 18:00 → 21:10 3h 跨度 /shared/research-kb/organized/paper_cards/(无新入池) 20:00 0 件 NET-new 入池 · 最新 1752-2609-35855 Mara Chain 已 14:10 入池 · 窗口期内无新 paper_card 入库
tom 雷达 20:41 inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(Tom 20:40 CST) 20:40 8 件候选,3 件 ⭐:Opera arXiv:2609.33987(v116 §6 ⑯ 已承接)、ORCAGen arXiv:2610.12415(v116 已承接)、Skill Constellations arXiv:2610.11169(v116 §6 ⑮ 已承接);其余 5 件低价值,Skill Constellations paper_card 1750 已 14:10 入池 · 3 件 ⭐ 全部已入 v116
jay 19:50 engineering filter inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50) 19:50 5 件 KEEP:ai-boost/awesome-harness-engineering(Agent Harness 知识库)+ STATE-Bench(memory 独立评测栖预备第 1 例)+ theaiengineer Agent Stack 2026 Edition(guardrails 范式转变)+ Mem0/MemOS/Cognee/MemSearch 选型 + SGLang 400K GPU · 承接级: 4 件邻接 llm-application,1 件 llm-infra
jay 21:05 evening briefing inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md(21:05) 21:05 5 类目 = VectorDB 2026 选型 + 推理引擎横向对比 + K8s 部署陷阱 + Substack 周报 + 复现工具;llm-application 弱相关(主要 agent-engineering / llm-infra 强邻接)
HF Daily 10-10 早棒(沿用) inbox/tom/2026-10-10-0900-hf-daily-2026-10-10.md(09:00) 沿用 已入 v116 §1.5(ME-World + vivo 主分类承接稳态第 10 日延伸)
jay 10-10 1335 openmodels-vector inbox/jay/2026-10-10-1335-openmodels-vector-agents-infratech.md(13:35) 沿用 State of Open Models Summer 2026 + Inference Engineering 独立学科 + VectorDB 选型 + 沿用级,v116 §1.6 engineering 5 联预备扩增稳态 间接锚入
flyp 10-10 1030 sat-adversarial inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md(10:35) 沿用 ME-World + Robo-COP 跨候选复现风险量化;已入 v116 §1.5(ME-World + 跨意译 5 件候选)
flyp 10-10 0950 ME-World critical inbox/flyp/2026-10-10-0950-flyP-critical-read-ME-World-multi-agent-egocentric.md(09:50) 沿用 v116 §1.5 已锚入 ME-World KAIST 多 agent 同步 ego-stream 立标候选 ⚠⚬⚬
spark 10-10 1843 llm-infra inbox/spark/2026-10-10-llm-infra-e1prep.md(18:43) 沿用 llm-infra 主棒位承接 v3.55 morning 稳态;含 paper_card 1748 REMORY Memory 第十五栖预备邻接第 1 例 + Memento 3 + MiMo-V2.6 预备合入 + SparseEngine + VFold/HarnessSQL 承接;llm-application 邻接级承接
stephen 10-10 1026 ai-industry inbox/stephen/2026-10-10-ai-industry-e1prep.md(10:26) 沿用 24h 6 件主增量;v116 §1.6 间接承接 frontier lab 公告密度 10-10 第 5 日回升 ⚠⚬⚬⚠

未在窗口期跟踪(避免误报):flyp 10-10 multimodal-e1prep / risk-e1prep、spark 10-10 agent-e1prep、tom 10-10 evaluation-e1prep / rag-e1prep、jay 10-10 csdn-inference-rag-multiagent-highfreq / 1505 five-category / 1620 csdn-rag-finetuning 等与 llm-application 强邻接但主轴不同的文件,本简报只跟踪 18:00 → 21:10 时间窗口内直接命中的文件。


一、核心增量(本窗口期 · 18:00 → 21:10 重点预备)

总体判断:3 小时窗口内 无 net-new unique arXiv ID 命中 llm-application 主轴。所有 3 件 ⭐ 候选(Opera + ORCAGen + Skill Constellations)在 v116 落库前已承接;tom radar 8 件候选里其余 5 件(Hebero / Mara Chain / Forms of LLM-Integrated Apps / Is Memorization Context-Sensitive / Hierarchical Navigation)v116 已全数承接或邻接级;jay 19:50 + 21:05 工程类主棒位聚焦在 llm-infra / agent-engineering / inference 主轴。 承接路径 = 沿用 v116 综述骨架,重点预备"工程化延伸 + 协议层栖预备补强 + 评测栖预备第 38 件候选"3 个增量方向。

增量 1 · STATE-Bench memory 独立评测栖栖预备第 1 例(Microsoft May 2026)+ ai-boost/awesome-harness-engineering Agent Harness 知识库 · 评测栖预备 v116 37 → v117 38 扩位级预备(v116 承接级 ⚬⚬)

  • 来源:
  • inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #2 · ai-boost/awesome-harness-engineering · 4.7k stars 2026-10-04 更新 · 评分 8.5/10)
  • jay 19:50 引用:STATE-Bench(Microsoft, May 2026)= 首个把 memory 作为独立变量评测的 benchmark · 450 个企业任务(客服/旅行/购物) · memory 有独立学习轨迹
  • 旁证:VoltgAgent/awesome-ai-agent-papers 363+ 篇 2026 年 arXiv 论文 · 5 类分(Multi-Agent 51 / Memory & RAG 56 / Eval & Observability 79 / Agent Tooling 95 / AI Agent Security 82)
  • v116 §6 ⑭ "Agent 评测方法学新维度 v115 6 → v116 7 件预备扩增稳态 ⚠⚬" 间接锚入

  • 要点: 1. STATE-Bench 核心 = 首个把 memory 作为独立变量评测的 benchmark(不是把 memory 作为 task quality 的副产品);450 个企业任务(客服/旅行/购物)+ memory 有独立学习轨迹 2. ai-boost/awesome-harness-engineering = Agent Harness 工程全景知识库 · 4.7k stars · AgentBench + Terminal Bench 2.0 + WebArena + SWE-bench Verified + NIST AI Agent Standards(Feb 2026) 3. 承接 v116 §6 ⑭ = v116 已锚入 Agent 评测方法学 7 件预备扩增稳态(Memento 3 + Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench);STATE-Bench 加入构成 第 8 件 候选 = 评测栖预备 v116 37 → v117 38 扩位级预备 ⚠⚬ 4. 可信度 = ⭐⭐⭐ jay 19:50 评分 8.5/10 · Microsoft May 2026 STATE-Bench 官方 · ai-boost 4.7k stars 验证 5. LLM application 主轴相关性 = 主轴 agent 评测栖预备;与 v116 §6 ⑭ "Agent 评测方法学新维度 v115 6 → v116 7 件预备扩增稳态" 直接承接

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑭ "Memento 3 arXiv:2610.11794 反思式规则手册递归自我改进栖预备第 1 例 + Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench" 形成 第 8 件栖预备(memory 独立评测栖)
  • 与 v116 §3.1 #138 "评测方法学栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬" → v117 第 38 栖栖预备承接 ⚠⚬⚬
  • 与 v116 §6 ⑨ "知识工程栖预备第 1 例 awesome-llm-knowledge-systems 2026-09-15" 协同 = Agent Harness 知识工程栖预备第 2 例 ⚬

  • 建议归入节:

  • 主归入:§6 工程落地框架 → ⑭ 拓展为 "Agent 评测方法学新维度 v115 6 → v116 7 → v117 8 件预备扩增稳态 ⚠⚬⚬⚬ = Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench + STATE-Bench (Microsoft May 2026) memory 独立评测栖预备第 1 例"
  • 副归入:§3.1 #138 共识预备新增 新增 "STATE-Bench 把 memory 作为独立变量评测 450 个企业任务 · 评测栖预备第 38 栖栖预备稳态 ⚠⚬⚬⚬"
  • 备选归入:§3.3 开放问题 新增 "Q117.561:STATE-Bench 是否会成为 agent memory 评测栖新标准(类 HumanEval 之于代码生成)?"
  • 备选归入:§6 ⑨ 知识工程栖预备 拓展 "awesome-llm-knowledge-systems 2026-09-15 + ai-boost/awesome-harness-engineering 2026-10-04 (Agent Harness 全景)"

增量 2 · Mem0 / MemOS / Cognee / MemSearch Agent Memory 基础设施分化预备 · Memory 第十六栖预备邻接第 2 例 ⚠⚬

  • 来源:
  • inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #5 · 评分 7/10)
  • jay 19:50 原文:"Agent memory 基础设施在 2026 年已分化出多个专用层(不是 RAG,不是向量数据库)"
  • 选型判断:Mem0 通用生产 / MemOS DeepSeek 生态 / MemSearch Markdown-native / Cognee 图结构多源知识融合
  • 关联:paper_cards/1748-2610-11287.md REMORY arXiv:2610.11287(flyp 10-10 risk-e1prep 锚 Memory 第十五栖预备第 1 例)

  • 要点: 1. Mem0 = AI Agent 的 memory layer · drop-in production infrastructure · 持久化上下文(通用生产首选) 2. MemOS = 自进化 memory OS · 35.24% token 节省 + DeepSeek Harness 支持(DeepSeek 生态首选) 3. Cognee = 图结构 memory · 支持多源知识融合(适合 GraphRAG 场景) 4. MemSearch(Zilliz) = Markdown + Milvus · 跨 Agent(Claude Code/Codex/DSH)memory · user-owned · local-first · Markdown-native · 跨 app/tools/workflows 自进化 5. 可信度 = ⭐⭐⭐ jay 19:50 评分 7/10 · GitHub topics 验证工程可行性 6. LLM application 主轴相关性 = 主轴 agent memory 栖预备;与 v116 §6 ⑤ "Memory 十二栖预备扩增稳态" 直接承接

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑤ "Memory 十二栖预备扩增稳态:Memadapter + When Does Selection Replace Extraction + In-Parameter Memory + DyadMem URAM + MemFold + Honeycomb + ExperienceIndex + SkillForge + Personalized TTS + Real Long-Term Memory 50M Token Window" 形成 Memory 第十六栖预备邻接 ⚠⚬⚬
  • 与 flyp 10-10 风险棒位 paper_card 1748 REMORY "Memory 第十五栖残差记忆网络预备邻接第 1 例" 协同 = Memory 第十六栖「分化基础设施栈」预备邻接第 2 例 ⚠⚬⚬
  • 与 v116 §6 ⑩ "Agent 框架生态成熟化拐点栖预备第 2 例 ⚠⚬⚬⚬" 间接协同 = Agent Memory 基础设施层 = Agent 框架生态成熟的支撑层

  • 建议归入节:

  • 主归入:§6 ⑤ Memory 十二栖预备扩增稳态 拓展为 "Memory 十二栖预备扩增稳态 + Mem0/MemOS/Cognee/MemSearch 分化基础设施栈栖预备邻接第 1 例(Memory 第十六栖) + REMORY 残差记忆网络栖预备邻接第 1 例(Memory 第十五栖) ⚠⚬⚬"
  • 副归入:§3.1 #138 共识预备新增 新增 "Agent memory 基础设施已分化出多个专用层(不是 RAG · 不是向量数据库)· Mem0/MemOS/Cognee/MemSearch 选型判断 ⚠⚬"
  • 备选归入:§3.3 开放问题 新增 "Q117.562:Mem0 vs MemOS vs Cognee vs MemSearch 选型决策树在 2027 年是否会出现 HumanEval 之于代码生成的统一评测栖?"

增量 3 · theaiengineer "The AI Agents Stack 2026 Edition" Substack · guardrails 范式转变栖预备第 1 例 ⚠⚬⚬

  • 来源:
  • inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #4 · 评分 7.5/10 · theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition)
  • jay 19:50 引用关键洞察:"2024 → 2026 关键转变:guardrails 从 LLM 输入/输出过滤 → 独立 Agent 授权 discipline"
  • Layer 3(Memory):codebase-aware retrieval with reranking,agent 不读全 repo 只检索相关文件
  • Layer 6(Deployment):LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra
  • 关联:inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md 21:05 也引用:"theaiengineer.substack.com『The AI Agents Stack 2026 Edition』→ 5 个实践判断值得引用(memory 三层架构、context engineering vs prompt engineering、pgvector 判断)"

  • 要点: 1. Guardrails 范式转变 = 2024 guardrails = input/output filter → 2026 guardrails = tool call 授权 + 速率限制 + Agent 实际行为验证(独立工程 discipline) 2. 实际生产模式 = Cursor 在 Claude/GPT-4/自有微调模型间路由(model routing 是成本控制关键) 3. Deployment 层 = LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra(unplanned engineering time 最多) 4. 可信度 = ⭐⭐⭐ jay 19:50 评分 7.5/10 · theaiengineer Substack 是顶级 Agent 工程 Newsletter · 承接 v116 §1.4 Agent 框架生态成熟化拐点双锚定第 2 例 5. LLM application 主轴相关性 = 主轴 Agent 安全栖位 + Agent 框架生态;与 v116 §1.4 + §6 ⑩ 直接承接

  • 与活文档现有脉络的关系:

  • 与 v116 §1.4 "Microsoft Agent Framework 1.0 GA + Agent Lightning v1.0 + MXC = Agent 框架生态成熟化拐点正式确立双锚定 ⚠⚬⚬⚬" 协同 = Substack 旁证 frontier lab 与 open-source Substack 共识
  • 与 v116 §6 ② "Agent 安全栖位四栖预备稳态 ⚠⚬⚬" 拓展 = 行为层 + 推理层 + 输出层 + 协议层 + 2026 guardrails = 独立 Agent 授权 discipline 子栖 ⚠⚬⚬
  • 与 jay 19:50 KEEP #1 "SGLang 400,000+ GPU 生产规模" + KEEP #3 "vLLM vs SGLang vs TensorRT-LLM 决策树" 形成工程化栖预备扩增稳态

  • 建议归入节:

  • 主归入:§6 ② Agent 安全栖位四栖预备稳态 拓展为 "行为层 + 推理层 + 输出层 + 协议层 + 2026 guardrails 范式转变栖预备第 1 例(theaiengineer Substack Oct 2026) ⚠⚬⚬"
  • 副归入:§1.6 jay 10-10 engineering 5 联预备扩增稳态 补强 "theaiengineer Substack Oct 2026 Agent Stack 2026 Edition = AI 工程前沿基线预备扩增稳态第 6 联"
  • 备选归入:§6 ⑯ OperaarXiv:2609.33987`` 旁证 "theaiengineer Substack = Opera Verbal Critic Framework 的 Substack 旁证"

增量 4 · ai-boost/awesome-harness-engineering Agent Harness 知识工程栖预备第 2 例 + OpenLIT OTel-native agent harness 平台 ⚠⚬

  • 来源:
  • inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #2 · 评分 8.5/10)
  • jay 19:50 引用关键洞察:"关键判断:memory architecture 评测必须独立于 task quality 评测(STATE-Bench 的核心贡献)"
  • 旁证:OpenLIT = OTel-native agent harness 平台(trace/eval/guard)
  • 关联:v116 §6 ⑨ "知识工程栖预备第 1 例 awesome-llm-knowledge-systems 2026-09-15"

  • 要点: 1. ai-boost/awesome-harness-engineering = Agent Harness 工程全景知识库 · 4.7k stars 2026-10-04 更新 · 持续活跃 2. Agent Evaluation Framework 2026 = AgentBench + Terminal Bench 2.0 + WebArena + SWE-bench Verified + NIST AI Agent Standards(Feb 2026) 3. VoltgAgent/awesome-ai-agent-papers = 363+ 篇 2026 年 arXiv 论文 · 5 类分(Multi-Agent 51 / Memory & RAG 56 / Eval & Observability 79 / Agent Tooling 95 / AI Agent Security 82) 4. OpenLIT = OTel-native agent harness 平台(trace/eval/guard) 5. 可信度 = ⭐⭐⭐⭐ jay 19:50 评分 8.5/10 · GitHub 4.7k stars · STATE-Bench Microsoft May 2026 官方 6. LLM application 主轴相关性 = 主轴 Agent 工程化栖预备;与 v116 §6 ⑨ "知识工程栖预备第 1 例" 协同

  • 与活文档现有脉络的关系:

  • 与 v116 §6 ⑨ "awesome-llm-knowledge-systems 2026-09-15" 形成 Agent Harness 知识工程栖预备第 2 例 ⚠⚬
  • 与 v116 §3.1 "评测方法学栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬" 协同 = Agent Harness 知识库扩增 + OpenLIT = 工程化栖预备第 3 联
  • 与 v116 §1.6 jay 10-10 engineering 5 联预备扩增稳态 间接补强 ⚠⚬

  • 建议归入节:

  • 主归入:§6 ⑨ 知识工程栖预备 拓展为 "RAG + Context Engineering + Harness Engineering + Skill Systems + Agent Memory + MCP + Progressive Disclosure 统一指南 + ai-boost/awesome-harness-engineering 2026-10-04 (Agent Harness 全景知识库 · 4.7k★) + OpenLIT OTel-native agent harness 平台栖预备第 2 例 ⚠⚬"
  • 副归入:§1.6 jay 10-10 engineering 5 联预备扩增稳态 补强 "Agent Harness 知识工程化栖预备第 5 联 ⚠⚬"
  • 备选归入:§3.3 开放问题 新增 "Q117.563:awesome-harness-engineering 是否预示 Agent 工程化技术栈跨 Substack + GitHub + arXiv 三栖预备稳态?"

增量 5 · tom radar 20:40 窗口期承接级 · 3 件 ⭐ 全部已入 v116,本简报沿用预备 ⚬

  • 来源:
  • inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(20:40 · 8 候选 · 3 ⭐)
  • 候选:Opera arXiv:2609.33987(v116 §6 ⑯ 已承接)+ ORCAGen arXiv:2610.12415(v116 已承接 RAG Defense)+ Skill Constellations arXiv:2610.11169(v116 §6 ⑮ 已承接)
  • 其余 5 件:Hebero arXiv:2606.03335(robot RL benchmark · multimodal 主分类 · paper_card 1751 已 14:10 入池 · 沿用)+ Mara Chain arXiv:2609.35855(paper_card 1752 已 14:10 入池 · evaluation 主分类 · 沿用)+ Forms of LLM-Integrated Apps arXiv:2610.11899(v116 §1.2 已承接)+ Is Memorization Context-Sensitive arXiv:2610.12085(v116 §1.3 已承接 RAG Defense 第六栖)+ Hierarchical Navigation arXiv:2610.12312(v116 §1.3 已承接)
  • 要点:8 件全部已入 v116 或 paper_card 入池,0 件 net-new 命中 llm-application 主轴
  • 可信度:⭐⭐⭐⭐ Tom radar 20:40 沿用稳态
  • 建议归入节:沿用 v116 综述,本窗口期不新增

增量 6 · jay 21:05 evening briefing 5 类目承接级 · VectorDB + Backend + Cloud-Native + Reproduction 间接承接 ⚬

  • 来源:
  • inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md(21:05 · 5 类目)
  • Database = VectorDB 2026 选型决策框架(Qdrant p50 4ms / Milvus 规模 / Pinecone 托管 / pgvector 70% 默认)+ Qdrant v1.14(2026-04 GPU 索引)
  • Backend = 推理引擎选型(SGLang 400K GPU + vLLM 0.29.0 + TensorRT-LLM 现实问题)+ arXiv 推理系统新论文(Inference Control Plane arXiv:2609.23130 + ThunderAgent ICML 2026 Spotlight + ModeSwitch-LLM)
  • Cloud-Native = K8s 推理部署成熟度(Qwen3.8 混合架构陷阱)+ ByteByteGo AI Agentic Workflow Patterns
  • Reproduction = SGLang vs vLLM 端到端复现路径 + vectordb-bench 工具
  • 要点:15 类目中 llm-application 直接命中 0 件;arXiv:2609.23130(Inference Control Plane vLLM × Mooncake cache hit 1.7% → 92.2% 吞吐量提升 3.8x P50 TTFT 降低 46x) 是 llm-infra 主棒位承接级;llm-application 弱邻接
  • 建议归入节:沿用 v116 综述与 spark 10-10 18:43 llm-infra-e1prep 承接,本窗口期不新增 llm-application 主棒位

二、值得警惕的矛盾或待核实说法

矛盾 1 · STATE-Bench 栖位判定 · 是否独立成栖 vs 归入"Memory 第十五栖"邻接?

  • 来源:jay 19:50 KEEP #2 ai-boost/awesome-harness-engineering
  • 判断:STATE-Bench 评测栖(Microsoft May 2026)与 REMORY Memory 第十五栖预备邻接第 1 例(flyp 10-10 risk-e1prep)在 RAG Defense vs Memory 主分类边界上有重叠;STATE-Bench 评测对象是"agent memory architecture 独立于 task quality",REMORY 是"残差记忆网络上下文压缩"——两者方法学栖位不同
  • 建议:待 v117 主棒位确认 — STATE-Bench 应独立成栖(评测栖预备第 38 件栖预备),不归入 Memory 第十五/十六栖 ⚠⚬

矛盾 2 · Mem0 / MemOS / Cognee / MemSearch 选型决策树是否构成"Memory 第十六栖分化基础设施栈栖预备"

  • 来源:jay 19:50 KEEP #5
  • 判断:v116 §6 ⑤ "Memory 十二栖预备扩增稳态" 已锚入 Memadapter + When Does Selection Replace Extraction + In-Parameter Memory + DyadMem URAM + MemFold + Honeycomb + ExperienceIndex + SkillForge + Personalized TTS + Real Long-Term Memory 50M Token Window;Mem0/MemOS/Cognee/MemSearch 是"生产基础设施分化层",与 MEMORY 类栖预备的"模型层 / 方法学层"栖预备不同栖位
  • 建议:待 v117 主棒位确认 — 应归入 §6 ⑤ Memory 十二栖预备扩增稳态 子项 "分化基础设施栈栖预备邻接第 1 例",而非独立新栖 ⚠⚬

矛盾 3 · theaiengineer Substack "2026 guardrails = 独立 Agent 授权 discipline" 是否与 v116 §6 ② Agent 安全栖位四栖预备稳态"重复

  • 来源:jay 19:50 KEEP #4
  • 判断:v116 §6 ② "Agent 安全栖位四栖预备稳态 ⚠⚬⚬ = 行为层 + 推理层 + 输出层 + 协议层" 已覆盖;theaiengineer "2026 guardrails = tool call 授权 + 速率限制 + Agent 实际行为验证" 是 "行为层" 的细化子栖,而非新独立栖
  • 建议:待 v117 主棒位确认 — 应归入 §6 ② 行为层 子项 "2026 guardrails 范式转变栖预备第 1 例",而非独立新栖 ⚠⚬

矛盾 4 · ai-boost/awesome-harness-engineering 与 v116 §6 ⑨ "awesome-llm-knowledge-systems 2026-09-15" 的层级关系

  • 来源:jay 19:50 KEEP #2 + v116 §6 ⑨
  • 判断:v116 §6 ⑨ 锚入 awesome-llm-knowledge-systems 2026-09-15(RAG + Context Engineering + Harness Engineering + Skill Systems + Agent Memory + MCP + Progressive Disclosure 统一指南);ai-boost/awesome-harness-engineering 2026-10-04 是"Harness Engineering 子集深耕",非新独立全集
  • 建议:待 v117 主棒位确认 — 应作为 §6 ⑨ 知识工程栖预备第 2 例(Harness Engineering 子集)锚入,而非独立新节 ⚠⚬

矛盾 5 · "3 小时窗口期承接级"是否过度承接 v116 而非真新增

  • 来源:本简报观察
  • 判断:v116 落库于 18:00,本简报覆盖 18:00 → 21:10;3 小时内 window 文件只有 tom 20:40 + jay 19:50 + jay 21:05 三件;tom 8 件候选全部已入 v116;jay 19:50 5 件 KEEP 中 4 件是承接级(ai-boost/STATE-Bench/theaiengineer/Mem0/MemOS/Cognee/MemSearch = 邻接级);jay 21:05 5 类目是 llm-infra / agent-engineering 主轴
  • 建议:诚实度声明 — 本窗口期真实净增量 0 件 NET-new arXiv ID 命中 llm-application 主轴;承接级 4 件均沿用 v116 综述骨架,不入新节 ⚠⚬

三、可引用的 arXiv 号列表(本窗口期内重点)

v116 已承接 · 沿用稳态(本窗口期内未见新增)

  • arXiv:2608.20055 EchoCoT: Hidden CoT Extraction Attacks(v116 §6 ② 推理层栖预备第 1 例)
  • arXiv:2610.10533 EngramEdit: Conditional Memory Decoupled Knowledge Update(v116 §1.3 RAG Defense 第七栖)
  • arXiv:2610.11794 Memento 3: Reflective Rulebook Recursive Self-Improvement(v116 §6 ⑭ Agent 评测方法学第 7 件)
  • arXiv:2610.12299 ME-World: Multi-Agent Egocentric World Model(v116 §1.5 multimodal 首个多 agent 同步 ego-stream 立标候选)
  • arXiv:2609.33987 Opera: Verbal Critic Framework for Long-horizon Coding Agents(v116 §6 ⑯ 栖预备第 1 例)
  • arXiv:2610.11169 Skill Constellations: Agent Skills Supply Chain on GitHub(v116 §6 ⑮ 栖预备第 1 例)
  • arXiv:2610.12415 ORCAGen: RAG-Guided Malware Deception(v116 §1.3 RAG Defense 承接)
  • arXiv:2610.11899 Forms of LLM-Integrated Applications(v116 §1.2 评测栖预备承接)
  • arXiv:2610.12085 Is Memorization Context-Sensitive?(v116 §1.3 RAG Defense 第六栖)
  • arXiv:2610.12312 The Geometry of Hierarchical Navigation(v116 §1.3 RAG Defense 承接)
  • arXiv:2610.11287 REMORY: Residual Memory Network(Memory 第十五栖预备邻接第 1 例)
  • arXiv:2610.12183 Agentic BBO(v115 漏接 v116 暂缓)

v116 落库之后未承接 · 沿用级预备

  • arXiv:2609.23130 Inference Control Plane: From Inference Engine to Inference Control Plane(jay 21:05 引用 · llm-infra 主轴承接级 · llm-application 邻接)
  • arXiv:2510.09665 LMCache(v116 §6 ③ 沿用)
  • arXiv:2608.01526 "An Internet for the KV Cache" OSDI 2026(v116 §6 ③ 沿用)
  • arXiv:2603.20397 KV Cache Optimization Survey(v116 §6 ③ 沿用)

本窗口期预备合入 v117 的 arXiv 号

  • 0 件 NET-new · 沿用 v116 综述骨架

评测栖预备 v117 第 38 件栖预备候选 STATE-Bench(Microsoft May 2026 · 非 arXiv · GitHub 引用)

  • https://github.com/ai-boost/awesome-harness-engineering(4.7k stars · 2026-10-04 更新)
  • https://github.com/VoltAgent/awesome-ai-agent-papers(363+ 篇 2026 年 arXiv 论文 · 5 类)
  • https://github.com/mem0ai/mem0(Mem0 · 通用生产首选)
  • https://github.com/topics/agent-memory(Mem0 / MemOS / Cognee / MemSearch 选型)
  • https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition(theaiengineer Substack 2026 Edition · guardrails 范式转变)

工作队列候选(沿用级 · multimodal 主轴 · 不直接合入 llm-application)

  • arXiv:2610.12448 reViT: Recurrent Vision Transformers with Depth-Programmed Experts(工作队列视频脚本 · multimodal 主分类)
  • arXiv:2610.12459 WorldGuide: Goal-Directed Video World Model for Procedural Task Execution(工作队列视频脚本 · multimodal 主分类)

CVE 与协议层栖预备 · 沿用级(v116 已承接)

  • CVE-2025-6514 mcp-remote OAuth 命令注入 CVSS 9.6(v116 §6 ② 协议层栖预备)
  • CVE-2026-48710 Starlette fakeredis 版本锁定(v116 §6 ② 协议层栖预备)
  • Asana MCP 跨租户数据泄漏(v116 §6 ② 协议层栖预备)
  • mcp-server-git 路径遍历 + 参数注入(v116 §6 ② 协议层栖预备)

URL 与非 arXiv 引用 · 沿用级

  • https://github.com/sglang-project/sglang(SGLang 400K GPU 生产规模)
  • https://inference.net/content/sglang-complete-guide(SGLang 完整指南)
  • https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm(三引擎决策树)
  • https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering(Gergely Orosz · Inference Engineering 独立学科)
  • https://deepmind.google/models/model-cards/nano-banana-2-1(Nano Banana 2.1 模型卡)
  • https://github.com/JustVugg/colibri(Colibri 纯 C 推理引擎 · 744B MoE 本地运行)
  • https://www.bytebytego.com/p/top-ai-github-repositories-in-2026(ByteByteGo AI GitHub Repos 2026)
  • https://blog.csdn.net/qq_45942092/article/details/162471654(CSDN RAG 实战代码)

四、置信度与诚实度声明

  • 本简报覆盖窗口期 = 3 小时(2026-10-10 18:00 → 21:10 Asia/Shanghai)· 非 24h 多轮深综合 · 因此增量计数控制在 4 件承接级 + 1 件 tom 沿用级 + 1 件 jay 21:05 沿用级 = 6 件核心预备
  • 最大变化 = 在 v116 综述骨架基础上,3 小时窗口期承接级 4 件(STATE-Bench + Mem0/MemOS/Cognee/MemSearch + theaiengineer + ai-boost/awesome-harness-engineering)形成"评测栖预备 v117 第 38 件栖预备稳态 + Memory 第十六栖分化基础设施栈栖预备 + Agent 安全栖位 2026 guardrails 子栖 + Harness Engineering 知识工程栖预备第 2 例"4 条预备方向
  • 可信度:STATE-Bench(Microsoft May 2026)官方 + ai-boost/awesome-harness-engineering 4.7k stars 验证 + jay 19:50 评分 8.5/10 ⚠⚬⚬;Mem0/MemOS/Cognee/MemSearch(jay 19:50 评分 7/10 · GitHub topics 验证工程可行性)⚠⚬;theaiengineer Substack(jay 19:50 评分 7.5/10)⚠⚬
  • 局限性:本窗口期只有 3 小时,承接级 4 件均沿用 v116 综述骨架,无 NET-new arXiv ID 命中 llm-application 主轴;不与 v116 同等深度 24h ⚠⚬
  • 无新增 P0 警示:本窗口期未见 v116 5 件 P0 警示延续之外的新增 P0 警示;5 件 v116 P0 警示延续清单 = "GPT-6 Astra 矛盾第 8 日 + OpenAI 安全部门裁员事件第 8 日 + Anthropic 9-29 Frontier Red Team URL 第 12 日 + Claude Frontier Academy 8 家 12 周课程细节第 8 日 + Anthropic GLM-5.3 第 5 日待溯源" ⚬

六、对今晚 v117 主棒位的建议

必选(3 件承接级 · 高置信度)

  1. STATE-Bench(Microsoft May 2026 · ai-boost/awesome-harness-engineering 2026-10-04) 合入 §6 ⑭ Agent 评测方法学新维度 v115 6 → v116 7 → v117 8 件预备扩增稳态 ⚠⚬⚬⚬
  2. Mem0 / MemOS / Cognee / MemSearch 合入 §6 ⑤ Memory 十二栖预备扩增稳态 子项 "Memory 第十六栖分化基础设施栈栖预备邻接第 1 例" ⚠⚬⚬
  3. theaiengineer Substack "The AI Agents Stack 2026 Edition" 合入 §6 ② Agent 安全栖位四栖预备稳态 子项 "2026 guardrails 范式转变栖预备第 1 例" ⚠⚬⚬

优选(1 件承接级 · 中置信度)

  1. ai-boost/awesome-harness-engineering + OpenLIT 合入 §6 ⑨ 知识工程栖预备 "知识工程栖预备第 2 例(Harness Engineering 子集)" ⚠⚬

待核(v117 暂缓)

  • 本窗口期无 net-new 唯一 ID 命中 llm-application 主轴 ⚬
  • tom radar 8 件候选全部已入 v116 沿用 ⚬
  • jay 21:05 evening briefing 5 类目是 llm-infra / agent-engineering 主轴 ⚬
  • work-queue 2610.12448 + 2610.12459 视频脚本候选是 multimodal 主轴 ⚬

v117 §3.3 开放问题新增建议(Q117.561-Q117.563)

  • Q117.561 STATE-Bench 是否会成为 agent memory 评测栖新标准(类 HumanEval 之于代码生成)?⚠⚬⚬
  • Q117.562 Mem0 vs MemOS vs Cognee vs MemSearch 选型决策树在 2027 年是否会出现 HumanEval 之于代码生成的统一评测栖?⚠⚬
  • Q117.563 awesome-harness-engineering 是否预示 Agent 工程化技术栈跨 Substack + GitHub + arXiv 三栖预备稳态?⚠⚬

七、检查过的来源清单(本简报覆盖的 9 条)

  1. /shared/research-kb/organized/queue/work-queue.md(20:00 工作队列)
  2. /shared/research-kb/organized/knowledge/llm-application.md(18:00 v116 落库)
  3. /shared/research-kb/organized/paper_cards/(18:00 → 21:10 无 NET-new · 最新 1752-2609-35855 Mara Chain 14:10 入池)
  4. /shared/research-kb/inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(20:40 · 3 件 ⭐ 全入 v116)
  5. /shared/research-kb/inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 · 5 件 KEEP · 4 件承接级)
  6. /shared/research-kb/inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md(21:05 · 5 类目 · llm-application 弱邻接)
  7. /shared/research-kb/inbox/spark/2026-10-10-llm-infra-e1prep.md(18:43 · llm-infra 主棒位 · 邻接)
  8. /shared/research-kb/inbox/stephen/2026-10-10-ai-industry-e1prep.md(10:26 · v116 §1.6 间接承接)

Stephen · E1 prep · 21:10 CST · 3 小时窗口 · 0 件 NET-new 命中 llm-application 主轴 · 4 件承接级预备 v117 ⚠⚬⚬ 诚实度声明:本窗口期真实净增量 0 件 NET-new arXiv ID,承接级 4 件均沿用 v116 综述骨架;不硬凑字数;v116 漏接与 v117 新承接严格区分;所有引用均可在搜索结果中查证;不存在密钥、cookie、token 等敏感信息;仅写入 1 个文件,未触动他人目录与 git