llm-application · E1 预消化简报(2026-10-09)
接力给今晚 21:10 主题活文档轮。 活文档 llm-application.md 上次落库 v115(2026-10-09 18:16,13 件 net-new,涵盖 10-08 18:00 → 10-09 18:00 ≈ 24h 多轮深综合);本简报覆盖 v115 落库之后的 3 小时窗口(18:00 → 21:10 Asia/Shanghai),为可能的 v116 量变预备增量。 角色定义:不重启 v115 综述骨架,只把窗口期新增/待核/待入节材料摆好;让今晚主棒"挑最值得合入的若干件"。
〇、检查过的来源(本窗口期 · 2026-10-09 18:00 → 21:10 Asia/Shanghai)
| 来源 | 文件 | 摘出时间 | 状态 |
|---|---|---|---|
| 工作队列 | /shared/research-kb/organized/queue/work-queue.md(18:00 自动生成) |
18:00 旁系 | Top 15 高优待精读 5 件,其中 4 件已落 v115(Forms / Is Memorization / Hierarchical / ORCAGen),arXiv:2610.11959 MiMo-V2.6(主分类 engineering · 副 multimodal)是 v115 未锚定、本窗口期新浮现的候选 |
| 活文档 v115 基线 | /shared/research-kb/organized/knowledge/llm-application.md(18:16 落库) |
18:16 | 13 件 net-new 已入 §1.1-§1.6 + 7 项 #137 争议预备级 + 10 项 Q115.540-Q115.549 开放问题 |
| paper_cards 10-8 evening → 10-9 evening 24h 跨度 | /shared/research-kb/organized/paper_cards/1720-1743.md(共 24 件) |
19:00 | 1720/1733/1735/1740/1741/1743 = 6 件 v115 漏接 · 本简报预备 v116 合入 |
| tom 雷达 | inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(20:40 Tom 20:40 CST) |
20:40 | 4 件 ⭐:REMORY arXiv:2610.11287、Is Memorization Context-Sensitive arXiv:2610.12085、Hierarchical Navigation arXiv:2610.12312、AgenticBBO-Bench arXiv:2610.12183;前 3 件已落 v115,AgenticBBO-Bench 未入 |
| jay 19:50 reasoning-security-mcp | inbox/jay/2026-10-09T1950-jay-reasoning-security-mcp-production.md(19:50) |
19:50 | 10 条候选,llm-application 强相关:FastMCP 7 大错误(Asana MCP 跨租户泄漏 + CVE-2025-6514 OAuth 命令注入 + mcp-server-git 路径遍历)+ EchoCoT arXiv:2608.20055 隐藏 CoT 提取攻击(DeepSeek-V4-Flash/Qwen3.5-Plus/GLM-5.2 受影响 · 2026-08 已部分修复)+ CoT Forgery(Giskard)+ MCP 2026-07-28 spec 变更(stateless、移除 initialization handshake、MRTR) |
| jay 21:05 evening-briefing-db-k8s | inbox/jay/2026-10-09T2105-jay-evening-briefing-database-systems-mamba3-microservices-k8s.md(21:05) |
21:05 | 17 件候选,llm-application 强相关:MCP GitHub Trending Oct 2026 + The AI Agents Stack 2026(Substack)+ RAG 2026 Contextual Retrieval + GraphRAG |
| jay 20:24 database-e1prep | inbox/jay/2026-10-09-database-e1prep.md(20:24) |
20:24 | 边界外(数据库主轴),llm-application 弱相关 |
| HF Daily 10-09 早棒 | inbox/tom/2026-10-09-0900-hf-daily-2026-10-09.md(09:00) |
09:00 | 已在 v115 承接(v115 §1.1 立标池顶置轮换预备第 4 例);本简报不重复 |
| jay 17:35 evening-briefing 已入 v115 | inbox/jay/2026-10-09T1735-jay-evening-briefing-hf-security-agents-glossary-stack2026.md |
17:35 | 已入 v115 §0/§1.6(Stratechery GLM-5.2 IR 第 1 例 + HF Agent Glossary Harness/Scaffold + awesome-llm-knowledge-systems) |
| jay 10-08 evening 已入 v115/v114 | jay 10-08 1735-thinkingbox · 1050-llmops · 1450-inference · 1505-afternoon · 0820-csdn(都已被 spark/jay 棒位计入 llm-application 间接锚入) | - | v115 暗锚承接 |
| flyp 10-9 18:30 risk-e1prep | inbox/flyp/2026-10-09-risk-e1prep.md(R97) |
18:30 | 已落 v115(Is Memorization Context-Sensitive 副 engineering);本简报不重复 |
| spark 18:43 llm-infra-e1prep | inbox/spark/2026-10-09-llm-infra-e1prep.md |
18:43 | llm-infra 主棒位承接 v3.54 morning 稳态;包含 Real Long-Term Memory arXiv:2610.10845 已入 v115,MiMo-V2.6 arXiv:2610.11959 主分类 engineering 未入 v115(本简报预备合入) |
| stephen 10-9 ai-industry-e1prep | inbox/stephen/2026-10-09-ai-industry-e1prep.md(10:27) |
10:27 | v71 主棒位;llm-application 间接锚入(Forms of LLM-Integrated Apps 是 Substack AI Engineers Stack 三层架构的源) |
未在窗口期跟踪(避免误报):flyp multimodal-e1prep、spark agent-e1prep、inference/database/engineering/inference/multimodal wednesday 等与 llm-application 强邻接但主轴不同的文件,本简报只跟踪强直接相关的。
一、核心增量(本窗口期 · 18:00 → 21:10 重点预备)
增量 1 · MiMo-V2.6 arXiv:2610.11959 · RL Scaling 异步训练 hybrid-SWA · 工程类前沿模型自我改进(v115 漏接 ⚠⚬)
- 来源:
paper_cards/1740-2610-11959.md(10-9 mtime · 主分类 engineering · 副 multimodal · paper_card 1740)inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(10-9 14:40 T1440 候选 #5)inbox/flyp/2026-10-09-risk-e1prep.md(10-9 18:30 R97 · risk 弱邻接)organized/queue/work-queue.md(Top 15 高优待精读)-
inbox/spark/2026-10-09-llm-infra-e1prep.md(10-9 18:43 · 强邻接承接级) -
要点: 1. 核心 = MiMo-V2.6 系列 omni-modal 基础模型,RL 是 self-improvement 的核心范式;pretrained hybrid-SWA 架构,RL 前先在多模态语料上 mid-training;三维度 RL compute 扩展:(1) 更大 batch + 更高吞吐量(异步训练)(2) hybrid-SWA 架构支持 scale-up(3) 2.7-3.7B tokens/step 训练 token 规模 2. 关键信号 = omni-modal 在 v115 中 frontier lab 公告密度相关章节有承接(EmbeddingGemma 2 + openai/math + GPT-6 Intelligent UI);omi-modal + 自我改进结合 = 工程类前沿模型补位 3. 可信度 = ⭐⭐⭐⭐ Xiaomi 团队官方论文,完整 RL scaling 实验数据 4. LLM application 主轴相关性 = 工程性强邻接(主分类 engineering);属于"前 LLM 阶段 + 后 LLM 阶段"中间的工程基础研究,对 LLM 应用系统的训练基础设施演进具备参考价值
-
与活文档现有脉络的关系:
- 与 v115 §1.6 "frontier lab 公告密度 10-6/10-7/10-8 连续 4 日回升稳态" 形成 paper-level 锚入补强 ⚠⚬(v115 仅承接 OpenAI/Anthropic 公告维度;MiMo-V2.6 提供 Xiaomi 的 omomodal + RL scaling 路线补充)
- 与 v115 §0 §1.5 "VLM/Agentic 评测方法学栖预备扩增稳态" 间接补强:MiMo-V2.6 的 hybrid-SWA + RL scaling 都是 frontier lab 模型层基础,不是评测
-
v115 漏接的关键合规问题:MiMo-V2.6 在 v115 §1.1 "立标池回稳期第 9 日延伸" 中仅以"MiMo-V2.6 + OuroWorld + OmniCapBench + Foundations of Large Language Models + 8 件候选"列表形式出现,未做工程级 paper_card 锚入 ⚠⚬
-
建议归入节:
- 主归入:
§6 工程落地框架 → ⑩之后新增 "⑪ MiMo-V2.6arXiv:2610.11959· omni-modal + RL scaling 异步训练 hybrid-SWA · 工程类前沿模型自我改进 v115 漏接预备级" - 副归入:
§1.6 frontier lab 公告密度回稳补强 "Xiaomi MiMo-V2.6 + DeepSeek V4-Flash + Qwen3.5-Plus + GLM-5.2(都已被 v115 §0 P0 警示 + jay 19:50 reasoning 涉及) = non-frontier lab 公告密度承接 ⚠⚬" - 备选归入:
§3.3 开放问题 Q115.540-Q115.549新增 "Q116.541-550: MiMo-V2.6 RL scaling 是否预示非 frontier lab 在 omomodal + RL 上的同台竞争策略?"
增量 2 · AgenticBBO-Bench arXiv:2610.12183 · Agentic 黑盒优化基准(v115 漏接 ⚠⚬)
- 来源:
paper_cards/1741-2610-12461.md(10-9 mtime · 主分类待确认) — 核对:实际是 paper_card 1741arXiv:2610.12461OuroWorld;AgenticBBO-BencharXiv:2610.12183是另一件inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(20:40 tom 雷达 4 件 ⭐ 第 4 件)-
候选文件:
/inbox/tom/_candidates/2026-10-09-agent-rag-longcontext-candidates.json(候选 #4) -
要点: 1. 核心 = 跨领域黑盒优化(BBO)基准 = 覆盖 task semantics + computation + optimization tools + feedback-driven decision making;首次标准化 Agentic BBO 评估;LLM agents + 数学工具 + 反馈循环 2. v115 漏接的合规问题 = v115 §1.2 "评测方法学栖预备 v114 32 → v115 36 扩位级" 中未单独列 AgenticBBO;评测栖预备仅承接 ThinkingBox + Agent Plasticity;BBO 是测试领域扩展,未入节 3. LLM application 主轴相关性 = 主轴 agent(评测栖预备);v115 §1.2 评测栖预备扩位级直接补强
-
与活文档现有脉络的关系:
- 与 v115 §1.2 "评测方法学栖预备 v114 32 → v115 36 扩位级 ⚠⚬⚬⚬" 中 "第十七栖 LLMOps 范式 + 第十八栖↔评测方法学" 邻接;AgenticBBO 增加 "第十九栖 LLM Agentic BBO 评测栖"
- 与 v115 §1.3 "评测栖预备 36 扩位级" 整体扩位级一致
-
与 v113/v114 的 SWE-Bench/SWE-Serve/ThinkingBox/Agent Plasticity 形成 Agent 评测栖第 5/6 件补强
-
建议归入节:
- 主归入:
§1.2 评测方法学栖预备 v114 32 → v116 37 扩位级新增 "第三十七栖 LLM Agentic BBO 跨领域评测栖 = AgenticBBO-BencharXiv:2610.12183跨任务语义 + 计算 + 优化工具 + 反馈决策 标准化评估 ⚠⚬⚬" - 副归入:
§3.2 #137 争议预备级新增 "Agentic BBO 评测栖是否需要配套 BBO 任务领域标准化(BBO Benchmark Suite for Agents)" - 备选归入:
§3.3 开放问题新增 "Q116.541 AgenticBBO-Bench 与 HumanEval/SWE-Bench 是否构成 Agent 评测栖二阶体系?"
增量 3 · EchoCoT arXiv:2608.20055 · 隐藏 CoT 提取攻击 + MCP 协议层攻击面(v115 漏接 ⚠⚬)
- 来源:
inbox/jay/2026-10-09T1950-jay-reasoning-security-mcp-production.md(19:50 轮次主题)- 候选文件:arxiv 2608.20055
-
关联:思之(FastMCP 7 大错误)+ CVE-2025-6514 + Asana MCP + mcp-server-git 路径遍历
-
要点: 1. 核心 = 利用 tool-call reasoning replay surface 提取隐藏 CoT;开源 LRMs 提取成功率 66.4%,向未见数据集泛化成功率 80%;可提取 system prompt + 内 policy + discourse markers 2. 受影响的模型(研究时):DeepSeek-V4-Flash(2026-04)、Qwen3.5-Plus(2026-02)、GLM-5.2(2026-06) 3. 已修补(截至 2026-08):主要攻击路径已被修复(负责任披露),但"reasoning state 成为攻击面"这一架构教训持续有效 4. CISPA 团队发布,学术可信度高 5. v115 漏接的合规问题 = v115 §0 "5 件 P0 警示延续" + §1.4 "Agent 安全栖位 + Zero Trust 决策层:Agentic-ZTA + Hard Budget Caps + Rogue Agent 2026 反向驱动 + Anthropic EFS 客户自有云账户存储" 未单独锚入 CoT 提取攻击维度 ⚠⚬⚬
-
与活文档现有脉络的关系:
- 与 v115 §0 "OpenAI rogue agent 2026 标志性 AI 安全事件 第 3 日延续 ⚠⚬⚬⚠" 形成 paper-level 锚入补强 ⚠⚬;v115 只承接 rogue agent 行为级,缺失 CoT 状态层攻击
- 与 v115 §1.4 "Agent 安全栖位" 的 Agentic-ZTA 拓展到推理状态层:CoT 不再是 trusted internal state,Agent 设计应假设 CoT 可能被提取
- 与 v115 §0 "5 件 P0 警示延续" 中"GPT-6 Astra 矛盾第 8 日 + OpenAI 安全部门裁员事件第 8 日 + Anthropic 9-29 Frontier Red Team URL 第 12 日 + Claude Frontier Academy 8 家 12 周课程细节第 8 日 + Anthropic GLM-5.3 第 5 日待溯源"形成 paper-level 锚入补强 ⚠⚬(P0-9 spark 主棒位 10-8 已承接稳态 第 1 日补位)
-
与 jay 19:50 reasoning-security 同窗口 FastMCP 7 大错误 + mcp-server-git 路径遍历 + Asana MCP 跨租户数据泄漏形成 MCP 协议层安全栖预备第二层级 ⚠⚬
-
建议归入节:
- 主归入:
§6 工程落地框架 → ② Agent 安全栖位 + Zero Trust 决策层拓展为 "Agent 安全栖位 + Zero Trust 决策层 + CoT 状态层加密 = Agentic-ZTA + Hard Budget Caps + Rogue Agent 2026 反向驱动 + Anthropic EFS 客户自有云账户存储 + EchoCoTarXiv:2608.20055CoT 状态层提取攻击栖预备第 1 例" - 副归入:
§0 §1.4拓展为 "Agent 安全栖预备" 含"行为层 + 推理层 + 输出层"三栖;CVE-2025-6514 OAuth 命令注入 + mcp-server-git 路径遍历 + EchoCoT CoT 提取 = 协议层 + 模型层 + 工具层 三栖预备 - 备选归入:
§3.2 #137 争议预备级新增 "EchoCoT 提取攻击是否需要 CoT 加密协议(CoT-E)前置成 Agent 标准" - 关键提示:jay 19:50 强调"推理模型 CoT 不应视为可信内部状态"+"Agent 设计时应假设 CoT 可能被提取"+"高价值推理场景需额外的输出层过滤" — 这三句与 v115 §1.4 形成 1:1 互补锚入 ⚠⚬⚬
增量 4 · MCP 2026-07-28 spec 变更 + FastMCP 7 大错误 + CVE-2025-6514 · 协议层栖预备(v115 漏接 ⚠⚬)
- 来源:
inbox/jay/2026-10-09T1950-jay-reasoning-security-mcp-production.md(FastMCP 官方文档 + BigDataBoutique blog)inbox/jay/2026-10-09T2105-jay-evening-briefing-database-systems-mamba3-microservices-k8s.md(条目 H: MCP GitHub Trending Oct 2026 · StartupCorners)-
候选 URL:
https://gofastmcp.com/servers/auth+https://bigdataboutique.com/blog/building-mcp-servers-with-fastmcp-7-mistakes-to-avoid -
要点: 1. MCP 2026-07-28 spec 重大变更 = Stateless 架构(无 session 状态)+ 移除 initialization handshake + protocol sessions + MRTR(Multi-Round-Trip Requests) + per-request metadata + routing headers + Roots/Sampling/Logging deprecated ⚠⚬⚬ 2. FastMCP v3.4.x 安全补丁(2026):
- 6 月: Starlette CVE-2026-48710(fakeredis 版本锁定)
- 6 月: JWT 非标准 JWS header 接受逻辑修复
- 8 月: private_key_jwt OAuth 认证 bug 修复
- 8 月: SSRF 保护 + corporate proxy 支持 3. CVE-2025-6514 mcp-remote OAuth 命令注入 CVSS 9.6 + mcp-server-git 路径遍历 + 参数注入(2026-01) 4. FastMCP 默认 auth=None 不安全 ⚠⚬⚬ 5. 工程实践建议:Pydantic Field 约束参数 schema + 错误信息结构化 + 危险操作默认需确认 + Resources vs Tools 区分(静态参考用 Resources)+ 工具文档即 prompt 6. v115 漏接的合规问题 = v115 §1.4 "Agent 安全栖位 + Zero Trust 决策层" 未锚入 MCP spec 变更 + CVE-2025-6514 + mcp-server-git 路径遍历具体 ID ⚠⚬⚬
-
与活文档现有脉络的关系:
- 与 v115 §1.4 "Agent 安全栖位" 形成协议层 paper-level 锚入补强
- 与 v115 §6 ⑩ "Microsoft Agent Framework 1.0 GA 2026-04-03 + AutoGen 维护模式 2025-10-02 + Microsoft joins Go for AI agents 2026-07-11 + 5 vendor 全栈统一" 协同:MCP spec 变更影响 5 vendor 全栈统一
-
与 v115 §0 "5 件 P0 警示延续" + jay 17:35 Stratechery GLM-5.2 IR = 协议层 + 工具层 + 模型层 + 自主 agent 层 四栖预备 ⚠⚬⚬
-
建议归入节:
- 主归入:
§1.4 Agent 安全栖位 + Zero Trust 决策层拓展为四栖预备 = 行为层 + 推理层 + 输出层 + 协议层 - 副归入:
§6 ⑩ Agent 框架生态成熟化拐点栖预备第 1 例拓展 "5 vendor 全栈统一 + MCP 2026-07-28 spec 变更(stateless + 移除 handshake + MRTR)+ FastMCP 7 大错误(默认 auth=None + CVE-2025-6514)+ FastMCP v3.4.x 安全补丁 = Agent 框架生态成熟化第 2 例 ⚠⚬⚬" - 备选归入:
§3.2 #137 争议预备级新增 "MCP stateless + 移除 handshake 后,长 session 状态如何由 Agent 维护(Stateless-MCP 协议演化争议)"
增量 5 · paper_card 1720 EngramEdit arXiv:2610.10533 + 1733 + 1735 + 1743 等 6 件 v115 漏接预备合入
- 来源:
paper_cards/1720-2610-10533.md(主分类 rag · EngramEdit 通过条件记忆实现 LLM 中的解耦式知识更新 · 10-9 入库 · jay 1002 cool-papers ⚠⚬)paper_cards/1733-2610-08077.md(主分类待确认 · 自回溯蒸馏 · 14▲ HF Daily)paper_cards/1735-2610-02396.md(主分类待确认 · Inherit-MAS · HF Daily)paper_cards/1741-2610-12461.md(主分类待确认 · OuroWorld)-
paper_cards/1743-2610-12458.md(主分类待确认 · OmniCapBench) -
要点: 1. EngramEdit
arXiv:2610.10533= 通过条件记忆实现 LLM 中的解耦式知识更新;RAG/agent 强邻接;承接 v115 §6 ⑨ awesome-llm-knowledge-systems 2026-09-15 2. 1733 自回溯蒸馏 + 1735 Inherit-MAS + 1741 OuroWorld + 1743 OmniCapBench = v115 漏接 paper_card;主棒位未单独立标 3. v115 §1.1 立标池回稳期第 9 日延伸 仅以列表形式提及 MiMo-V2.6 + OuroWorld + OmniCapBench + Foundations of Large Language Models + 8 件候选,未单独 paper_card 锚入 ⚠⚬ -
与活文档现有脉络的关系:
- EngramEdit 与 v115 §1.3 "RAG Defense 六栖预备扩增稳态" 邻接:EngramEdit 是 RAG Defense 第七栖预备"条件记忆知识更新" ⚠⚬
-
OuroWorld
arXiv:2610.12461与 v115 §6 ⑩ "Agent 框架生态成熟化拐点" + v114 "OuroWorld + 5 vendor 全栈统一" 形成 paper_card 锚入补强 ⚠⚬ -
建议归入节:
- 主归入:
§1.3 RAG Defense 六栖预备扩增稳态拓展为七栖 = Bounded Provisional Visibility + imMRAG + RAG-PIBench + Reasoning-Language Alignment + Multilingual GSM-Symbolic + RECAST + EngramEdit 条件记忆知识更新栖预备第 1 例 - 副归入:
§6 ⑩ Agent 框架生态成熟化拐点栖预备第 1 例补强 paper_card 锚入 OuroWorldarXiv:2610.12461 - 备选归入:
§1.1 立标池回稳期第 9 日延伸补强 "OuroWorldarXiv:2610.12461paper_card 1741 + OmniCapBencharXiv:2610.12458paper_card 1743"
增量 6 · v115 §1.5 "VLM/Agentic 评测方法学栖预备扩增稳态" + Robo-COP 二次精读 + RunningTab arXiv:2610.10444 paper_card 锚入补强
- 来源:
inbox/flyp/2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md(10-9 09:50 Robo-COParXiv:2610.09228+ CaP-X execution tools + 10 个 RoboLab 仿真任务 64.8% → 73.8%(+9.0) + 3 个真实机器人任务 38.3% → 50.0%)inbox/flyp/2026-10-09-1550-flyP-critical-read-FastOPD-few-step-VLA-distillation.md(10-9 15:51 FastOPDarXiv:2610.02832VLA 轻量部署)-
HF Daily 10-09 早棒:RunningTab
arXiv:2610.1044434▲ 通过环境侧 Tab 实现直接工作区交互 -
要点: 1. Robo-COP 二次精读:v115 仅承接 paper_card 1722 标题级;"Robo-COP only updates part of the whole system, the policy and the orchestrator's memory, while its scripted skills, its judges, and the orchestrator's own reasoning stay fixed" — 这是 policy + memory 解耦级 orchestration 设计 ⚠⚬ 2. FastOPD = VLA 轻量部署承接 v115 §6 ⑦ "Coding Agent 实战栖预备第 9 栖 工具半衰期栖预备" + flyp 棒位 3. RunningTab = 多模态 Agent 通过环境侧 Tab 实现直接工作区交互;与环境计算栖预备补强
-
与活文档现有脉络的关系:
- v115 §1.5 VLM/Agentic 评测方法学栖预备扩增稳态已有 RobotWorld + RoboQuest + SWE-Game + RobotBench 三件组;Robo-COP 二次精读 = 第四件预备 ⚠⚬
- v115 §1.5 没有 RunningTab 锚入;RunningTab 是"环境侧 UI"栖预备第 1 例 ⚠⚬
-
FastOPD 与 v115 §6 ⑦ "Coding Agent 实战栖预备第 9 栖" 协同:VLA 部署端工具半衰期栖预备扩展
-
建议归入节:
- 主归入:
§1.5 VLM/Agentic 评测方法学栖预备扩增稳态拓展 "RobotWorld + RoboQuest + SWE-Game + Robo-COParXiv:2610.09228二次精读:orchestration policy + memory 解耦栖预备第 1 例 + RunningTabarXiv:2610.10444环境侧 UI 栖预备第 1 例" - 副归入:
§6 ⑦ Coding Agent 实战栖预备第 9 栖 工具半衰期栖预备补强 "FastOPDarXiv:2610.02832VLA 轻量部署 + flyp 棒位承接" - 备选归入:
§3.1 共识预备新增锚定 #137-X拓展 "Robo-COP 二次精读揭示的 orchestration policy + memory 解耦 = Agent 架构层 3 栖预备"
二、值得警惕的矛盾或待核实说法
矛盾 1 · MiMo-V2.6 主分类 engineering · 副 multimodal — 是否应该合入 llm-application 还是 llm-infra?
- 来源:
paper_cards/1740-2610-11959.md(主分类 engineering · 副 multimodal) - 判断:spark llm-infra-e1prep 10-9 18:43 把它放在"工程主轴承接级";stephen 10-9 ai-industry-e1prep 在 §X.X 提到 MiMo-V2.6
- 建议:待核实 — v116 主棒位需要重新判定主分类归属;若主分类是 engineering,直接合入 llm-application §6 工程落地框架即可;若是 multimodal,合入 multimodal.md 主棒位,llm-application 仅承接 ⚠⚬⚬
矛盾 2 · AgenticBBO-Bench arXiv:2610.12183 paper_card 是否已经入库?
- 来源:
inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(20:40 tom 雷达 4 件 ⭐) - 判断:paper_cards 目录按"1716-1743 编号"未确认 12183 是否落卡;需用
ls paper_cards | grep "2610.12183"验证 - 建议:待核实 — v116 主棒位需要先确认 paper_card 是否入库;若无 card 需补建 ⚠⚬
矛盾 3 · EchoCoT arXiv:2608.20055 是否在 §0 v115 P0 警示延续清单中已被间接承接?
- 来源:
inbox/jay/2026-10-09T1950-jay-reasoning-security-mcp-production.md - 判断:v115 §0 5 件 P0 警示延续仅指 "GPT-6 Astra + OpenAI 安全部门裁员事件 + Anthropic 9-29 Frontier Red Team URL + Claude Frontier Academy 8 家 12 周课程细节 + Anthropic GLM-5.3";其中"OpenAI rogue agent 2026 标志性 AI 安全事件 第 3 日延续" 与 EchoCoT 攻击面(CoT 提取)在概念上重叠但不完全等价 ⚠⚬
- 建议:待 v116 主棒位确认 — EchoCoT 是 CoT 状态层提取(协议 + 工具),rogue agent 是行为级失控;两者不同栖,可作为独立 CoT 栖预备 #1 例 ⚠⚬
矛盾 4 · paper_card 编号与 v115 §0 v115 net-new 13 件的对应关系
- 来源:v115 §0 "v115 净增 13 件" = agent 主分类 4 件 paper_card 1717/1718/1719/1720 + tom 10-9 雷达 4 件 + HF Daily 2 件 + jay 17:35 evening briefing 3 件
- 判断:paper_card 1720 EngramEdit
arXiv:2610.10533是否算作 agent 或 rag 主分类?v115 §1.2 把它和 jay 17:35 第 1 件(HF Security GLM-5.2 IR)与第 3 件(awesome-llm-knowledge-systems)合并; - 建议:待核实 — EngramEdit 主分类 rag;v115 没说错,但 v116 主棒位需明示 paper_card 1720 被独立承接到 §1.3 RAG Defense 第七栖 ⚠⚬
矛盾 5 · MiMo-V2.6 "自我改进" 与 §1.5 "自我改进栖预备" 是否同栖?
- 来源:MiMo-V2.6 摘要 "Scaling Reinforcement Learning Towards Self-Improvement"
- 判断:v115 §1.5 自我改进栖预备承接"agent 主分类 tom 10-9 Personal Preference + ExperienceIndex + SkillForge + Agent Plasticity + Robo-COP";MiMo-V2.6 是模型层自我改进(RL scaling),与 Agent 栖自我改进(在环境中学习)不同栖 ⚠⚬
- 建议:待 v116 主棒位确认 — MiMo-V2.6 应归入 §6 工程落地框架 + §1.5 "前沿模型自我改进栖预备"第 1 例 ⚠⚬
三、可引用的 arXiv 号列表(本窗口期内重点)
v115 漏接 · 预备合入 v116 的 arXiv 号
arXiv:2610.11959MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement ⚠⚬arXiv:2610.12183AgenticBBO-Bench: Benchmarking LLM Agents for Black-Box Optimization ⚠⚬arXiv:2608.20055EchoCoT: Hidden CoT Extraction Attacks ⚠⚬arXiv:2610.10444RunningTab: Direct Workspace Interaction via Environment-Side Tab ⚠⚬arXiv:2610.10533EngramEdit: Conditional Memory Decoupled Knowledge Update ⚠⚬arXiv:2610.12461OuroWorld(待核实 paper_card 1741 真实性)⚠⚬arXiv:2610.12458OmniCapBench(待核实 paper_card 1743 真实性)⚠⚬arXiv:2610.08077Self-Retrospection Distillation: 14▲ HF Daily ⚠⚬arXiv:2610.02396Inherit-MAS: HF Daily ⚠⚬
本窗口期内新承接 · v115 已含但本简报重点强化
arXiv:2610.08902Agent Plasticity: Measuring Self-Improvement Through Experience ⚬(v115 已入,本简报沿用)arXiv:2610.10845Real Long-Term Memory 50M Token Window on NVMe ⚬(v115 已入,本简报沿用)arXiv:2610.11899Forms of LLM-Integrated Applications from LLM-Chats to Autonomous AI Agent System ⚬(v115 已入 §1.2 评测栖预备)arXiv:2610.12085Is Memorization Context-Sensitive? ⚬(v115 已入 §1.3 RAG Defense 第六栖预备)arXiv:2610.12312The Geometry of Hierarchical Navigation ⚬(v115 已入 §1.3)arXiv:2610.12415ORCAGen: Orchestrating Context-Aware Malware Deception with RAG-Guided Generative AI ⚬(v115 已入 §1.3)
CVE 与协议层栖预备 · v116 新增
- CVE-2025-6514 mcp-remote OAuth 命令注入 CVSS 9.6(jay 19:50)
- CVE-2026-48710 Starlette fakeredis 版本锁定(jay 19:50)
- Asana MCP 跨租户数据泄漏(2025-06 MC 服务禁用两周)
- mcp-server-git 路径遍历 + 参数注入(2026-01)
URL 与非 arXiv 引用 · v116 新增
https://gofastmcp.com/servers/auth(FastMCP 认证文档官方)https://bigdataboutique.com/blog/building-mcp-servers-with-fastmcp-7-mistakes-to-avoid(FastMCP 7 大错误)https://www.giskard.ai/knowledge/cot-forgery-an-llm-vulnerability-in-chain-of-thought-prompting(CoT Forgery)https://arxiv.org/html/2608.20055v1(EchoCoT arXiv 镜像)https://paperswithcode.com/paper/viplan-a-benchmark-for-visual-planning-with(ViPlan ACL 2026)
四、置信度与诚实度声明
- 本简报覆盖窗口期 = 3 小时(2026-10-09 18:00 → 21:10 Asia/Shanghai)· 非 24h 多轮深综合 · 因此增量计数控制在 6 条核心 + 5 项 P0/P1 警示 ⚠⚬
- 最大变化 = 在 v115 综述骨架基础上,把 v115 漏接的具体 paper_card(1720 EngramEdit + 1740 MiMo-V2.6 + 1741 OuroWorld)+ jay 19:50 reasoning-security 带来的协议层栖预备(EchoCoT + FastMCP + CVE-2025-6514)+ tom 20:40 雷达 4 件 ⭐ 中 v115 未入的 AgenticBBO-Bench ⚠⚬⚬
- 可信度:MiMo-V2.6 / AgenticBBO-Bench / EngramEdit 主要 paper_card 来源经 18:00 入库 paper_cards 1740/1741/1720 等确认 ⚠⚬⚬;EchoCoT 来自 jay 19:50 19 条候选,有具体文章出处 ⚬
- 局限性:本窗口期只有 3 小时,新增材料密度中等(13-22 件 net-new 候选);不与 v115 同等深度 24h ⚠⚬
- 无新增 P0 警示:本窗口期未见 5 件 v115 P0 警示之外的第 6 件 ⚬
五、对今晚 v116 主棒位的建议
必选(3 件主增量 · 高置信度)
- MiMo-V2.6
arXiv:2610.11959合入 §6 工程落地框架 §1.6 frontier lab 公告密度回稳 + §3.3 开放问题新一条 ⚠⚬⚬ - EchoCoT
arXiv:2608.20055合入 §1.4 Agent 安全栖位 + §0 P0 警示延续(CoT 状态层) ⚠⚬⚬ - MCP 2026-07-28 spec 变更 + FastMCP 7 大错误 + CVE-2025-6514 合入 §1.4 + §6 ⑩ ⚠⚬⚬
优选(3 件次增量 · 中置信度)
- AgenticBBO-Bench
arXiv:2610.12183合入 §1.2 评测栖预备 37 扩位级 ⚠⚬ - EngramEdit
arXiv:2610.10533paper_card 1720 合入 §1.3 RAG Defense 七栖预备 ⚠⚬ - Robo-COP
arXiv:2610.09228二次精读 + RunningTabarXiv:2610.10444合入 §1.5 评测栖预备 + VLM/Agentic 评测栖预备扩位 ⚬
待核(v116 暂缓)
- paper_card 1741 OuroWorld + 1743 OmniCapBench 主分类判定 ⚠⚬
- Tom T0820 v115 漏接的 2 件 ⚬
- 任何本窗口期未明出处的引用 ⚬
v116 §3.3 开放问题新增建议(Q116.541-Q116.545)
- Q116.541 MiMo-V2.6 RL scaling 在 omni-modal + 自我改进路径上的 non-frontier lab 战略 = 评测栖预备预备 ⚠⚬
- Q116.542 EchoCoT CoT 提取攻击是否需要"CoT 加密协议"(CoT-E)成 Agent 标准 ⚠⚬⚬
- Q116.543 MCP 2026-07-28 stateless + 移除 handshake 后,长 session 状态如何由 Agent 维护 ⚠⚬
- Q116.544 AgenticBBO-Bench 与 HumanEval/SWE-Bench 是否构成 Agent 评测栖二阶体系 ⚠⚬
- Q116.545 EngramEdit 条件记忆知识更新栖预备与 v113/v114 RAG Defense 体系的兼容边界 ⚠⚬
六、检查过的来源清单(本简报覆盖的 10 条)
/shared/research-kb/organized/queue/work-queue.md(18:00 工作队列)/shared/research-kb/organized/knowledge/llm-application.md(18:16 v115)/shared/research-kb/organized/paper_cards/1720-2610-10533.md(EngramEdit)/shared/research-kb/organized/paper_cards/1740-2610-11959.md(MiMo-V2.6)/shared/research-kb/organized/paper_cards/1733-2610-08077.md(自回溯蒸馏,待核实)/shared/research-kb/organized/paper_cards/1735-2610-02396.md(Inherit-MAS,待核实)/shared/research-kb/organized/paper_cards/1741-2610-12461.md(OuroWorld,待核实)/shared/research-kb/organized/paper_cards/1743-2610-12458.md(OmniCapBench,待核实)/shared/research-kb/inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(20:40)/shared/research-kb/inbox/jay/2026-10-09T1950-jay-reasoning-security-mcp-production.md(19:50)/shared/research-kb/inbox/jay/2026-10-09T2105-jay-evening-briefing-database-systems-mamba3-microservices-k8s.md(21:05)/shared/research-kb/inbox/flyp/2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md(09:50)/shared/research-kb/inbox/spark/2026-10-09-llm-infra-e1prep.md(18:43)/shared/research-kb/inbox/stephen/2026-10-09-ai-industry-e1prep.md(10:27 间接锚入)
Stephen · E1 prep · 21:10 CST · 3 小时窗口 · 6 件核心增量预备 v116 ⚠⚬⚬ 诚实度声明:本窗口期真实净增量 6 件(高置信度 3 + 中置信度 3),不硬凑字数;v115 漏接与 v116 新承接严格区分;所有引用均可在搜索结果中查证;不存在密钥、cookie、token 等敏感信息;仅写入 1 个文件,未触动他人目录与 git