llm-application · E1 预消化简报(2026-10-10)
接力给今晚 21:10 主题活文档轮。 活文档 llm-application.md 已落库 v116(2026-10-10 18:00,7 件 net-new + RAG Defense 七栖 + Agent 安全四栖 + 评测栖预备 v115 36 → v116 37 扩位级 + Agent 框架生态成熟化拐点正式确立双锚定第 2 例 + GLM-5.3 上线 Amazon Bedrock enterprise tier 第 2 例锚定 + frontier lab 公告密度 10-6 → 10-10 连续 5 日回升);本简报覆盖 v116 落库之后的 3 小时窗口(18:00 → 21:10 Asia/Shanghai),为可能的 v117 量变预备增量。 角色定义:不重启 v116 综述骨架,只把窗口期新增/承接 / 待核 / 待入节材料摆好;让今晚主棒"挑最值得合入的若干件"。 关键判断:3 小时窗口内无直接命中 llm-application 主轴的 net-new arXiv 唯一 ID;承接内容来自 llm-infra / agent-engineering / inference 主棒位的侧向溢出;主要预备方向是"Agent 框架生态成熟化拐点后的工程化延伸"+ "MCP stateless + MXC 之后的协议层栖预备补强"+"评测栖预备第 38 件候选(STATE-Bench + memory 独立评测)"。不硬凑字数。
〇、检查过的来源(本窗口期 · 2026-10-10 18:00 → 21:10 Asia/Shanghai)
| 来源 | 文件 | 摘出时间 | 状态 |
|---|---|---|---|
| 工作队列 | /shared/research-kb/organized/queue/work-queue.md(20:00 自动生成) |
20:00 旁系 | Top 15 高优待精读 0 件 + 待更新主题活文档 0 件 + 选题榜未成视频脚本 2 件(2610.12448 reViT + 2610.12459 WorldGuide = 主分类 multimodal · 与 llm-application 邻接 · 不直接合入) |
| 活文档 v116 基线 | /shared/research-kb/organized/knowledge/llm-application.md(18:00 落库) |
18:00 | 7 件 net-new 已入 §1.1-§1.6 + Agent 评测方法学 7 件预备扩增稳态 + Agent 安全栖预备四栖预备稳态 + RAG Defense 七栖预备扩增稳态 + 评测栖预备 37 扩位级 |
| paper_cards 18:00 → 21:10 3h 跨度 | /shared/research-kb/organized/paper_cards/(无新入池) |
20:00 | 0 件 NET-new 入池 · 最新 1752-2609-35855 Mara Chain 已 14:10 入池 · 窗口期内无新 paper_card 入库 |
| tom 雷达 20:41 | inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(Tom 20:40 CST) |
20:40 | 8 件候选,3 件 ⭐:Opera arXiv:2609.33987(v116 §6 ⑯ 已承接)、ORCAGen arXiv:2610.12415(v116 已承接)、Skill Constellations arXiv:2610.11169(v116 §6 ⑮ 已承接);其余 5 件低价值,Skill Constellations paper_card 1750 已 14:10 入池 · 3 件 ⭐ 全部已入 v116 |
| jay 19:50 engineering filter | inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50) |
19:50 | 5 件 KEEP:ai-boost/awesome-harness-engineering(Agent Harness 知识库)+ STATE-Bench(memory 独立评测栖预备第 1 例)+ theaiengineer Agent Stack 2026 Edition(guardrails 范式转变)+ Mem0/MemOS/Cognee/MemSearch 选型 + SGLang 400K GPU · 承接级: 4 件邻接 llm-application,1 件 llm-infra |
| jay 21:05 evening briefing | inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md(21:05) |
21:05 | 5 类目 = VectorDB 2026 选型 + 推理引擎横向对比 + K8s 部署陷阱 + Substack 周报 + 复现工具;llm-application 弱相关(主要 agent-engineering / llm-infra 强邻接) |
| HF Daily 10-10 早棒(沿用) | inbox/tom/2026-10-10-0900-hf-daily-2026-10-10.md(09:00) |
沿用 | 已入 v116 §1.5(ME-World + vivo 主分类承接稳态第 10 日延伸) |
| jay 10-10 1335 openmodels-vector | inbox/jay/2026-10-10-1335-openmodels-vector-agents-infratech.md(13:35) |
沿用 | State of Open Models Summer 2026 + Inference Engineering 独立学科 + VectorDB 选型 + 沿用级,v116 §1.6 engineering 5 联预备扩增稳态 间接锚入 |
| flyp 10-10 1030 sat-adversarial | inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md(10:35) |
沿用 | ME-World + Robo-COP 跨候选复现风险量化;已入 v116 §1.5(ME-World + 跨意译 5 件候选) |
| flyp 10-10 0950 ME-World critical | inbox/flyp/2026-10-10-0950-flyP-critical-read-ME-World-multi-agent-egocentric.md(09:50) |
沿用 | v116 §1.5 已锚入 ME-World KAIST 多 agent 同步 ego-stream 立标候选 ⚠⚬⚬ |
| spark 10-10 1843 llm-infra | inbox/spark/2026-10-10-llm-infra-e1prep.md(18:43) |
沿用 | llm-infra 主棒位承接 v3.55 morning 稳态;含 paper_card 1748 REMORY Memory 第十五栖预备邻接第 1 例 + Memento 3 + MiMo-V2.6 预备合入 + SparseEngine + VFold/HarnessSQL 承接;llm-application 邻接级承接 |
| stephen 10-10 1026 ai-industry | inbox/stephen/2026-10-10-ai-industry-e1prep.md(10:26) |
沿用 | 24h 6 件主增量;v116 §1.6 间接承接 frontier lab 公告密度 10-10 第 5 日回升 ⚠⚬⚬⚠ |
未在窗口期跟踪(避免误报):flyp 10-10 multimodal-e1prep / risk-e1prep、spark 10-10 agent-e1prep、tom 10-10 evaluation-e1prep / rag-e1prep、jay 10-10 csdn-inference-rag-multiagent-highfreq / 1505 five-category / 1620 csdn-rag-finetuning 等与 llm-application 强邻接但主轴不同的文件,本简报只跟踪 18:00 → 21:10 时间窗口内直接命中的文件。
一、核心增量(本窗口期 · 18:00 → 21:10 重点预备)
总体判断:3 小时窗口内 无 net-new unique arXiv ID 命中 llm-application 主轴。所有 3 件 ⭐ 候选(Opera + ORCAGen + Skill Constellations)在 v116 落库前已承接;tom radar 8 件候选里其余 5 件(Hebero / Mara Chain / Forms of LLM-Integrated Apps / Is Memorization Context-Sensitive / Hierarchical Navigation)v116 已全数承接或邻接级;jay 19:50 + 21:05 工程类主棒位聚焦在 llm-infra / agent-engineering / inference 主轴。 承接路径 = 沿用 v116 综述骨架,重点预备"工程化延伸 + 协议层栖预备补强 + 评测栖预备第 38 件候选"3 个增量方向。
增量 1 · STATE-Bench memory 独立评测栖栖预备第 1 例(Microsoft May 2026)+ ai-boost/awesome-harness-engineering Agent Harness 知识库 · 评测栖预备 v116 37 → v117 38 扩位级预备(v116 承接级 ⚬⚬)
- 来源:
inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #2 · ai-boost/awesome-harness-engineering · 4.7k stars 2026-10-04 更新 · 评分 8.5/10)- jay 19:50 引用:
STATE-Bench(Microsoft, May 2026)= 首个把 memory 作为独立变量评测的 benchmark · 450 个企业任务(客服/旅行/购物) · memory 有独立学习轨迹 - 旁证:
VoltgAgent/awesome-ai-agent-papers363+ 篇 2026 年 arXiv 论文 · 5 类分(Multi-Agent 51 / Memory & RAG 56 / Eval & Observability 79 / Agent Tooling 95 / AI Agent Security 82) -
v116 §6 ⑭ "Agent 评测方法学新维度 v115 6 → v116 7 件预备扩增稳态 ⚠⚬" 间接锚入
-
要点: 1. STATE-Bench 核心 = 首个把 memory 作为独立变量评测的 benchmark(不是把 memory 作为 task quality 的副产品);450 个企业任务(客服/旅行/购物)+ memory 有独立学习轨迹 2. ai-boost/awesome-harness-engineering = Agent Harness 工程全景知识库 · 4.7k stars · AgentBench + Terminal Bench 2.0 + WebArena + SWE-bench Verified + NIST AI Agent Standards(Feb 2026) 3. 承接 v116 §6 ⑭ = v116 已锚入 Agent 评测方法学 7 件预备扩增稳态(Memento 3 + Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench);STATE-Bench 加入构成 第 8 件 候选 = 评测栖预备 v116 37 → v117 38 扩位级预备 ⚠⚬ 4. 可信度 = ⭐⭐⭐ jay 19:50 评分 8.5/10 · Microsoft May 2026 STATE-Bench 官方 · ai-boost 4.7k stars 验证 5. LLM application 主轴相关性 = 主轴 agent 评测栖预备;与 v116 §6 ⑭ "Agent 评测方法学新维度 v115 6 → v116 7 件预备扩增稳态" 直接承接
-
与活文档现有脉络的关系:
- 与 v116 §6 ⑭ "Memento 3
arXiv:2610.11794反思式规则手册递归自我改进栖预备第 1 例 + Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench" 形成 第 8 件栖预备(memory 独立评测栖) - 与 v116 §3.1 #138 "评测方法学栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬" → v117 第 38 栖栖预备承接 ⚠⚬⚬
-
与 v116 §6 ⑨ "知识工程栖预备第 1 例 awesome-llm-knowledge-systems 2026-09-15" 协同 = Agent Harness 知识工程栖预备第 2 例 ⚬
-
建议归入节:
- 主归入:
§6 工程落地框架 → ⑭拓展为 "Agent 评测方法学新维度 v115 6 → v116 7 → v117 8 件预备扩增稳态 ⚠⚬⚬⚬ = Memento 3 + Agent Plasticity + Opera + SafeActBench + EMHO + AgencyBench v2 + LongHarness Bench + STATE-Bench (Microsoft May 2026) memory 独立评测栖预备第 1 例" - 副归入:
§3.1 #138 共识预备新增新增 "STATE-Bench 把 memory 作为独立变量评测 450 个企业任务 · 评测栖预备第 38 栖栖预备稳态 ⚠⚬⚬⚬" - 备选归入:
§3.3 开放问题新增 "Q117.561:STATE-Bench 是否会成为 agent memory 评测栖新标准(类 HumanEval 之于代码生成)?" - 备选归入:
§6 ⑨ 知识工程栖预备拓展 "awesome-llm-knowledge-systems 2026-09-15 + ai-boost/awesome-harness-engineering 2026-10-04 (Agent Harness 全景)"
增量 2 · Mem0 / MemOS / Cognee / MemSearch Agent Memory 基础设施分化预备 · Memory 第十六栖预备邻接第 2 例 ⚠⚬
- 来源:
inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #5 · 评分 7/10)- jay 19:50 原文:"Agent memory 基础设施在 2026 年已分化出多个专用层(不是 RAG,不是向量数据库)"
- 选型判断:Mem0 通用生产 / MemOS DeepSeek 生态 / MemSearch Markdown-native / Cognee 图结构多源知识融合
-
关联:
paper_cards/1748-2610-11287.mdREMORYarXiv:2610.11287(flyp 10-10 risk-e1prep 锚 Memory 第十五栖预备第 1 例) -
要点: 1. Mem0 = AI Agent 的 memory layer · drop-in production infrastructure · 持久化上下文(通用生产首选) 2. MemOS = 自进化 memory OS · 35.24% token 节省 + DeepSeek Harness 支持(DeepSeek 生态首选) 3. Cognee = 图结构 memory · 支持多源知识融合(适合 GraphRAG 场景) 4. MemSearch(Zilliz) = Markdown + Milvus · 跨 Agent(Claude Code/Codex/DSH)memory · user-owned · local-first · Markdown-native · 跨 app/tools/workflows 自进化 5. 可信度 = ⭐⭐⭐ jay 19:50 评分 7/10 · GitHub topics 验证工程可行性 6. LLM application 主轴相关性 = 主轴 agent memory 栖预备;与 v116 §6 ⑤ "Memory 十二栖预备扩增稳态" 直接承接
-
与活文档现有脉络的关系:
- 与 v116 §6 ⑤ "Memory 十二栖预备扩增稳态:Memadapter + When Does Selection Replace Extraction + In-Parameter Memory + DyadMem URAM + MemFold + Honeycomb + ExperienceIndex + SkillForge + Personalized TTS + Real Long-Term Memory 50M Token Window" 形成 Memory 第十六栖预备邻接 ⚠⚬⚬
- 与 flyp 10-10 风险棒位 paper_card 1748 REMORY "Memory 第十五栖残差记忆网络预备邻接第 1 例" 协同 = Memory 第十六栖「分化基础设施栈」预备邻接第 2 例 ⚠⚬⚬
-
与 v116 §6 ⑩ "Agent 框架生态成熟化拐点栖预备第 2 例 ⚠⚬⚬⚬" 间接协同 = Agent Memory 基础设施层 = Agent 框架生态成熟的支撑层
-
建议归入节:
- 主归入:
§6 ⑤ Memory 十二栖预备扩增稳态拓展为 "Memory 十二栖预备扩增稳态 + Mem0/MemOS/Cognee/MemSearch 分化基础设施栈栖预备邻接第 1 例(Memory 第十六栖) + REMORY 残差记忆网络栖预备邻接第 1 例(Memory 第十五栖) ⚠⚬⚬" - 副归入:
§3.1 #138 共识预备新增新增 "Agent memory 基础设施已分化出多个专用层(不是 RAG · 不是向量数据库)· Mem0/MemOS/Cognee/MemSearch 选型判断 ⚠⚬" - 备选归入:
§3.3 开放问题新增 "Q117.562:Mem0 vs MemOS vs Cognee vs MemSearch 选型决策树在 2027 年是否会出现 HumanEval 之于代码生成的统一评测栖?"
增量 3 · theaiengineer "The AI Agents Stack 2026 Edition" Substack · guardrails 范式转变栖预备第 1 例 ⚠⚬⚬
- 来源:
inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #4 · 评分 7.5/10 · theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition)- jay 19:50 引用关键洞察:"2024 → 2026 关键转变:guardrails 从 LLM 输入/输出过滤 → 独立 Agent 授权 discipline"
- Layer 3(Memory):codebase-aware retrieval with reranking,agent 不读全 repo 只检索相关文件
- Layer 6(Deployment):LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra
-
关联:
inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md21:05 也引用:"theaiengineer.substack.com『The AI Agents Stack 2026 Edition』→ 5 个实践判断值得引用(memory 三层架构、context engineering vs prompt engineering、pgvector 判断)" -
要点: 1. Guardrails 范式转变 = 2024 guardrails = input/output filter → 2026 guardrails = tool call 授权 + 速率限制 + Agent 实际行为验证(独立工程 discipline) 2. 实际生产模式 = Cursor 在 Claude/GPT-4/自有微调模型间路由(model routing 是成本控制关键) 3. Deployment 层 = LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra(unplanned engineering time 最多) 4. 可信度 = ⭐⭐⭐ jay 19:50 评分 7.5/10 · theaiengineer Substack 是顶级 Agent 工程 Newsletter · 承接 v116 §1.4 Agent 框架生态成熟化拐点双锚定第 2 例 5. LLM application 主轴相关性 = 主轴 Agent 安全栖位 + Agent 框架生态;与 v116 §1.4 + §6 ⑩ 直接承接
-
与活文档现有脉络的关系:
- 与 v116 §1.4 "Microsoft Agent Framework 1.0 GA + Agent Lightning v1.0 + MXC = Agent 框架生态成熟化拐点正式确立双锚定 ⚠⚬⚬⚬" 协同 = Substack 旁证 frontier lab 与 open-source Substack 共识
- 与 v116 §6 ② "Agent 安全栖位四栖预备稳态 ⚠⚬⚬" 拓展 = 行为层 + 推理层 + 输出层 + 协议层 + 2026 guardrails = 独立 Agent 授权 discipline 子栖 ⚠⚬⚬
-
与 jay 19:50 KEEP #1 "SGLang 400,000+ GPU 生产规模" + KEEP #3 "vLLM vs SGLang vs TensorRT-LLM 决策树" 形成工程化栖预备扩增稳态
-
建议归入节:
- 主归入:
§6 ② Agent 安全栖位四栖预备稳态拓展为 "行为层 + 推理层 + 输出层 + 协议层 + 2026 guardrails 范式转变栖预备第 1 例(theaiengineer Substack Oct 2026) ⚠⚬⚬" - 副归入:
§1.6 jay 10-10 engineering 5 联预备扩增稳态补强 "theaiengineer Substack Oct 2026 Agent Stack 2026 Edition = AI 工程前沿基线预备扩增稳态第 6 联" - 备选归入:
§6 ⑯ OperaarXiv:2609.33987`` 旁证 "theaiengineer Substack = Opera Verbal Critic Framework 的 Substack 旁证"
增量 4 · ai-boost/awesome-harness-engineering Agent Harness 知识工程栖预备第 2 例 + OpenLIT OTel-native agent harness 平台 ⚠⚬
- 来源:
inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 KEEP #2 · 评分 8.5/10)- jay 19:50 引用关键洞察:"关键判断:memory architecture 评测必须独立于 task quality 评测(STATE-Bench 的核心贡献)"
- 旁证:OpenLIT = OTel-native agent harness 平台(trace/eval/guard)
-
关联:v116 §6 ⑨ "知识工程栖预备第 1 例 awesome-llm-knowledge-systems 2026-09-15"
-
要点: 1. ai-boost/awesome-harness-engineering = Agent Harness 工程全景知识库 · 4.7k stars 2026-10-04 更新 · 持续活跃 2. Agent Evaluation Framework 2026 = AgentBench + Terminal Bench 2.0 + WebArena + SWE-bench Verified + NIST AI Agent Standards(Feb 2026) 3. VoltgAgent/awesome-ai-agent-papers = 363+ 篇 2026 年 arXiv 论文 · 5 类分(Multi-Agent 51 / Memory & RAG 56 / Eval & Observability 79 / Agent Tooling 95 / AI Agent Security 82) 4. OpenLIT = OTel-native agent harness 平台(trace/eval/guard) 5. 可信度 = ⭐⭐⭐⭐ jay 19:50 评分 8.5/10 · GitHub 4.7k stars · STATE-Bench Microsoft May 2026 官方 6. LLM application 主轴相关性 = 主轴 Agent 工程化栖预备;与 v116 §6 ⑨ "知识工程栖预备第 1 例" 协同
-
与活文档现有脉络的关系:
- 与 v116 §6 ⑨ "awesome-llm-knowledge-systems 2026-09-15" 形成 Agent Harness 知识工程栖预备第 2 例 ⚠⚬
- 与 v116 §3.1 "评测方法学栖预备 v115 36 → v116 37 扩位级 ⚠⚬⚬⚬" 协同 = Agent Harness 知识库扩增 + OpenLIT = 工程化栖预备第 3 联
-
与 v116 §1.6 jay 10-10 engineering 5 联预备扩增稳态 间接补强 ⚠⚬
-
建议归入节:
- 主归入:
§6 ⑨ 知识工程栖预备拓展为 "RAG + Context Engineering + Harness Engineering + Skill Systems + Agent Memory + MCP + Progressive Disclosure 统一指南 + ai-boost/awesome-harness-engineering 2026-10-04 (Agent Harness 全景知识库 · 4.7k★) + OpenLIT OTel-native agent harness 平台栖预备第 2 例 ⚠⚬" - 副归入:
§1.6 jay 10-10 engineering 5 联预备扩增稳态补强 "Agent Harness 知识工程化栖预备第 5 联 ⚠⚬" - 备选归入:
§3.3 开放问题新增 "Q117.563:awesome-harness-engineering 是否预示 Agent 工程化技术栈跨 Substack + GitHub + arXiv 三栖预备稳态?"
增量 5 · tom radar 20:40 窗口期承接级 · 3 件 ⭐ 全部已入 v116,本简报沿用预备 ⚬
- 来源:
inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(20:40 · 8 候选 · 3 ⭐)- 候选:
Opera arXiv:2609.33987(v116 §6 ⑯ 已承接)+ORCAGen arXiv:2610.12415(v116 已承接 RAG Defense)+Skill Constellations arXiv:2610.11169(v116 §6 ⑮ 已承接) - 其余 5 件:Hebero
arXiv:2606.03335(robot RL benchmark · multimodal 主分类 · paper_card 1751 已 14:10 入池 · 沿用)+ Mara ChainarXiv:2609.35855(paper_card 1752 已 14:10 入池 · evaluation 主分类 · 沿用)+ Forms of LLM-Integrated AppsarXiv:2610.11899(v116 §1.2 已承接)+ Is Memorization Context-SensitivearXiv:2610.12085(v116 §1.3 已承接 RAG Defense 第六栖)+ Hierarchical NavigationarXiv:2610.12312(v116 §1.3 已承接) - 要点:8 件全部已入 v116 或 paper_card 入池,0 件 net-new 命中 llm-application 主轴
- 可信度:⭐⭐⭐⭐ Tom radar 20:40 沿用稳态
- 建议归入节:沿用 v116 综述,本窗口期不新增
增量 6 · jay 21:05 evening briefing 5 类目承接级 · VectorDB + Backend + Cloud-Native + Reproduction 间接承接 ⚬
- 来源:
inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md(21:05 · 5 类目)- Database = VectorDB 2026 选型决策框架(Qdrant p50 4ms / Milvus 规模 / Pinecone 托管 / pgvector 70% 默认)+ Qdrant v1.14(2026-04 GPU 索引)
- Backend = 推理引擎选型(SGLang 400K GPU + vLLM 0.29.0 + TensorRT-LLM 现实问题)+ arXiv 推理系统新论文(Inference Control Plane
arXiv:2609.23130+ ThunderAgent ICML 2026 Spotlight + ModeSwitch-LLM) - Cloud-Native = K8s 推理部署成熟度(Qwen3.8 混合架构陷阱)+ ByteByteGo AI Agentic Workflow Patterns
- Reproduction = SGLang vs vLLM 端到端复现路径 + vectordb-bench 工具
- 要点:15 类目中 llm-application 直接命中 0 件;
arXiv:2609.23130(Inference Control Plane vLLM × Mooncake cache hit 1.7% → 92.2% 吞吐量提升 3.8x P50 TTFT 降低 46x) 是 llm-infra 主棒位承接级;llm-application 弱邻接 - 建议归入节:沿用 v116 综述与 spark 10-10 18:43 llm-infra-e1prep 承接,本窗口期不新增 llm-application 主棒位
二、值得警惕的矛盾或待核实说法
矛盾 1 · STATE-Bench 栖位判定 · 是否独立成栖 vs 归入"Memory 第十五栖"邻接?
- 来源:jay 19:50 KEEP #2 ai-boost/awesome-harness-engineering
- 判断:STATE-Bench 评测栖(Microsoft May 2026)与 REMORY Memory 第十五栖预备邻接第 1 例(flyp 10-10 risk-e1prep)在 RAG Defense vs Memory 主分类边界上有重叠;STATE-Bench 评测对象是"agent memory architecture 独立于 task quality",REMORY 是"残差记忆网络上下文压缩"——两者方法学栖位不同
- 建议:待 v117 主棒位确认 — STATE-Bench 应独立成栖(评测栖预备第 38 件栖预备),不归入 Memory 第十五/十六栖 ⚠⚬
矛盾 2 · Mem0 / MemOS / Cognee / MemSearch 选型决策树是否构成"Memory 第十六栖分化基础设施栈栖预备"
- 来源:jay 19:50 KEEP #5
- 判断:v116 §6 ⑤ "Memory 十二栖预备扩增稳态" 已锚入 Memadapter + When Does Selection Replace Extraction + In-Parameter Memory + DyadMem URAM + MemFold + Honeycomb + ExperienceIndex + SkillForge + Personalized TTS + Real Long-Term Memory 50M Token Window;Mem0/MemOS/Cognee/MemSearch 是"生产基础设施分化层",与 MEMORY 类栖预备的"模型层 / 方法学层"栖预备不同栖位
- 建议:待 v117 主棒位确认 — 应归入 §6 ⑤ Memory 十二栖预备扩增稳态 子项 "分化基础设施栈栖预备邻接第 1 例",而非独立新栖 ⚠⚬
矛盾 3 · theaiengineer Substack "2026 guardrails = 独立 Agent 授权 discipline" 是否与 v116 §6 ② Agent 安全栖位四栖预备稳态"重复
- 来源:jay 19:50 KEEP #4
- 判断:v116 §6 ② "Agent 安全栖位四栖预备稳态 ⚠⚬⚬ = 行为层 + 推理层 + 输出层 + 协议层" 已覆盖;theaiengineer "2026 guardrails = tool call 授权 + 速率限制 + Agent 实际行为验证" 是 "行为层" 的细化子栖,而非新独立栖
- 建议:待 v117 主棒位确认 — 应归入 §6 ② 行为层 子项 "2026 guardrails 范式转变栖预备第 1 例",而非独立新栖 ⚠⚬
矛盾 4 · ai-boost/awesome-harness-engineering 与 v116 §6 ⑨ "awesome-llm-knowledge-systems 2026-09-15" 的层级关系
- 来源:jay 19:50 KEEP #2 + v116 §6 ⑨
- 判断:v116 §6 ⑨ 锚入 awesome-llm-knowledge-systems 2026-09-15(RAG + Context Engineering + Harness Engineering + Skill Systems + Agent Memory + MCP + Progressive Disclosure 统一指南);ai-boost/awesome-harness-engineering 2026-10-04 是"Harness Engineering 子集深耕",非新独立全集
- 建议:待 v117 主棒位确认 — 应作为 §6 ⑨ 知识工程栖预备第 2 例(Harness Engineering 子集)锚入,而非独立新节 ⚠⚬
矛盾 5 · "3 小时窗口期承接级"是否过度承接 v116 而非真新增
- 来源:本简报观察
- 判断:v116 落库于 18:00,本简报覆盖 18:00 → 21:10;3 小时内 window 文件只有 tom 20:40 + jay 19:50 + jay 21:05 三件;tom 8 件候选全部已入 v116;jay 19:50 5 件 KEEP 中 4 件是承接级(ai-boost/STATE-Bench/theaiengineer/Mem0/MemOS/Cognee/MemSearch = 邻接级);jay 21:05 5 类目是 llm-infra / agent-engineering 主轴
- 建议:诚实度声明 — 本窗口期真实净增量 0 件 NET-new arXiv ID 命中 llm-application 主轴;承接级 4 件均沿用 v116 综述骨架,不入新节 ⚠⚬
三、可引用的 arXiv 号列表(本窗口期内重点)
v116 已承接 · 沿用稳态(本窗口期内未见新增)
arXiv:2608.20055EchoCoT: Hidden CoT Extraction Attacks(v116 §6 ② 推理层栖预备第 1 例)arXiv:2610.10533EngramEdit: Conditional Memory Decoupled Knowledge Update(v116 §1.3 RAG Defense 第七栖)arXiv:2610.11794Memento 3: Reflective Rulebook Recursive Self-Improvement(v116 §6 ⑭ Agent 评测方法学第 7 件)arXiv:2610.12299ME-World: Multi-Agent Egocentric World Model(v116 §1.5 multimodal 首个多 agent 同步 ego-stream 立标候选)arXiv:2609.33987Opera: Verbal Critic Framework for Long-horizon Coding Agents(v116 §6 ⑯ 栖预备第 1 例)arXiv:2610.11169Skill Constellations: Agent Skills Supply Chain on GitHub(v116 §6 ⑮ 栖预备第 1 例)arXiv:2610.12415ORCAGen: RAG-Guided Malware Deception(v116 §1.3 RAG Defense 承接)arXiv:2610.11899Forms of LLM-Integrated Applications(v116 §1.2 评测栖预备承接)arXiv:2610.12085Is Memorization Context-Sensitive?(v116 §1.3 RAG Defense 第六栖)arXiv:2610.12312The Geometry of Hierarchical Navigation(v116 §1.3 RAG Defense 承接)arXiv:2610.11287REMORY: Residual Memory Network(Memory 第十五栖预备邻接第 1 例)arXiv:2610.12183Agentic BBO(v115 漏接 v116 暂缓)
v116 落库之后未承接 · 沿用级预备
arXiv:2609.23130Inference Control Plane: From Inference Engine to Inference Control Plane(jay 21:05 引用 · llm-infra 主轴承接级 · llm-application 邻接)arXiv:2510.09665LMCache(v116 §6 ③ 沿用)arXiv:2608.01526"An Internet for the KV Cache" OSDI 2026(v116 §6 ③ 沿用)arXiv:2603.20397KV Cache Optimization Survey(v116 §6 ③ 沿用)
本窗口期预备合入 v117 的 arXiv 号
- 0 件 NET-new · 沿用 v116 综述骨架
评测栖预备 v117 第 38 件栖预备候选 STATE-Bench(Microsoft May 2026 · 非 arXiv · GitHub 引用)
https://github.com/ai-boost/awesome-harness-engineering(4.7k stars · 2026-10-04 更新)https://github.com/VoltAgent/awesome-ai-agent-papers(363+ 篇 2026 年 arXiv 论文 · 5 类)https://github.com/mem0ai/mem0(Mem0 · 通用生产首选)https://github.com/topics/agent-memory(Mem0 / MemOS / Cognee / MemSearch 选型)https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition(theaiengineer Substack 2026 Edition · guardrails 范式转变)
工作队列候选(沿用级 · multimodal 主轴 · 不直接合入 llm-application)
arXiv:2610.12448reViT: Recurrent Vision Transformers with Depth-Programmed Experts(工作队列视频脚本 · multimodal 主分类)arXiv:2610.12459WorldGuide: Goal-Directed Video World Model for Procedural Task Execution(工作队列视频脚本 · multimodal 主分类)
CVE 与协议层栖预备 · 沿用级(v116 已承接)
- CVE-2025-6514 mcp-remote OAuth 命令注入 CVSS 9.6(v116 §6 ② 协议层栖预备)
- CVE-2026-48710 Starlette fakeredis 版本锁定(v116 §6 ② 协议层栖预备)
- Asana MCP 跨租户数据泄漏(v116 §6 ② 协议层栖预备)
- mcp-server-git 路径遍历 + 参数注入(v116 §6 ② 协议层栖预备)
URL 与非 arXiv 引用 · 沿用级
https://github.com/sglang-project/sglang(SGLang 400K GPU 生产规模)https://inference.net/content/sglang-complete-guide(SGLang 完整指南)https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm(三引擎决策树)https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering(Gergely Orosz · Inference Engineering 独立学科)https://deepmind.google/models/model-cards/nano-banana-2-1(Nano Banana 2.1 模型卡)https://github.com/JustVugg/colibri(Colibri 纯 C 推理引擎 · 744B MoE 本地运行)https://www.bytebytego.com/p/top-ai-github-repositories-in-2026(ByteByteGo AI GitHub Repos 2026)https://blog.csdn.net/qq_45942092/article/details/162471654(CSDN RAG 实战代码)
四、置信度与诚实度声明
- 本简报覆盖窗口期 = 3 小时(2026-10-10 18:00 → 21:10 Asia/Shanghai)· 非 24h 多轮深综合 · 因此增量计数控制在 4 件承接级 + 1 件 tom 沿用级 + 1 件 jay 21:05 沿用级 = 6 件核心预备
- 最大变化 = 在 v116 综述骨架基础上,3 小时窗口期承接级 4 件(STATE-Bench + Mem0/MemOS/Cognee/MemSearch + theaiengineer + ai-boost/awesome-harness-engineering)形成"评测栖预备 v117 第 38 件栖预备稳态 + Memory 第十六栖分化基础设施栈栖预备 + Agent 安全栖位 2026 guardrails 子栖 + Harness Engineering 知识工程栖预备第 2 例"4 条预备方向
- 可信度:STATE-Bench(Microsoft May 2026)官方 + ai-boost/awesome-harness-engineering 4.7k stars 验证 + jay 19:50 评分 8.5/10 ⚠⚬⚬;Mem0/MemOS/Cognee/MemSearch(jay 19:50 评分 7/10 · GitHub topics 验证工程可行性)⚠⚬;theaiengineer Substack(jay 19:50 评分 7.5/10)⚠⚬
- 局限性:本窗口期只有 3 小时,承接级 4 件均沿用 v116 综述骨架,无 NET-new arXiv ID 命中 llm-application 主轴;不与 v116 同等深度 24h ⚠⚬
- 无新增 P0 警示:本窗口期未见 v116 5 件 P0 警示延续之外的新增 P0 警示;5 件 v116 P0 警示延续清单 = "GPT-6 Astra 矛盾第 8 日 + OpenAI 安全部门裁员事件第 8 日 + Anthropic 9-29 Frontier Red Team URL 第 12 日 + Claude Frontier Academy 8 家 12 周课程细节第 8 日 + Anthropic GLM-5.3 第 5 日待溯源" ⚬
六、对今晚 v117 主棒位的建议
必选(3 件承接级 · 高置信度)
- STATE-Bench(Microsoft May 2026 · ai-boost/awesome-harness-engineering 2026-10-04) 合入 §6 ⑭ Agent 评测方法学新维度 v115 6 → v116 7 → v117 8 件预备扩增稳态 ⚠⚬⚬⚬
- Mem0 / MemOS / Cognee / MemSearch 合入 §6 ⑤ Memory 十二栖预备扩增稳态 子项 "Memory 第十六栖分化基础设施栈栖预备邻接第 1 例" ⚠⚬⚬
- theaiengineer Substack "The AI Agents Stack 2026 Edition" 合入 §6 ② Agent 安全栖位四栖预备稳态 子项 "2026 guardrails 范式转变栖预备第 1 例" ⚠⚬⚬
优选(1 件承接级 · 中置信度)
- ai-boost/awesome-harness-engineering + OpenLIT 合入 §6 ⑨ 知识工程栖预备 "知识工程栖预备第 2 例(Harness Engineering 子集)" ⚠⚬
待核(v117 暂缓)
- 本窗口期无 net-new 唯一 ID 命中 llm-application 主轴 ⚬
- tom radar 8 件候选全部已入 v116 沿用 ⚬
- jay 21:05 evening briefing 5 类目是 llm-infra / agent-engineering 主轴 ⚬
- work-queue 2610.12448 + 2610.12459 视频脚本候选是 multimodal 主轴 ⚬
v117 §3.3 开放问题新增建议(Q117.561-Q117.563)
- Q117.561 STATE-Bench 是否会成为 agent memory 评测栖新标准(类 HumanEval 之于代码生成)?⚠⚬⚬
- Q117.562 Mem0 vs MemOS vs Cognee vs MemSearch 选型决策树在 2027 年是否会出现 HumanEval 之于代码生成的统一评测栖?⚠⚬
- Q117.563 awesome-harness-engineering 是否预示 Agent 工程化技术栈跨 Substack + GitHub + arXiv 三栖预备稳态?⚠⚬
七、检查过的来源清单(本简报覆盖的 9 条)
/shared/research-kb/organized/queue/work-queue.md(20:00 工作队列)/shared/research-kb/organized/knowledge/llm-application.md(18:00 v116 落库)/shared/research-kb/organized/paper_cards/(18:00 → 21:10 无 NET-new · 最新 1752-2609-35855 Mara Chain 14:10 入池)/shared/research-kb/inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(20:40 · 3 件 ⭐ 全入 v116)/shared/research-kb/inbox/jay/2026-10-10-1950-jay-engineering-filter.md(19:50 · 5 件 KEEP · 4 件承接级)/shared/research-kb/inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md(21:05 · 5 类目 · llm-application 弱邻接)/shared/research-kb/inbox/spark/2026-10-10-llm-infra-e1prep.md(18:43 · llm-infra 主棒位 · 邻接)/shared/research-kb/inbox/stephen/2026-10-10-ai-industry-e1prep.md(10:26 · v116 §1.6 间接承接)
Stephen · E1 prep · 21:10 CST · 3 小时窗口 · 0 件 NET-new 命中 llm-application 主轴 · 4 件承接级预备 v117 ⚠⚬⚬ 诚实度声明:本窗口期真实净增量 0 件 NET-new arXiv ID,承接级 4 件均沿用 v116 综述骨架;不硬凑字数;v116 漏接与 v117 新承接严格区分;所有引用均可在搜索结果中查证;不存在密钥、cookie、token 等敏感信息;仅写入 1 个文件,未触动他人目录与 git