llm-application · 知识库活文档
- 更新:v65 RAG/Memory/治理/Mobile 5 件扩位 + 评测 26 元组 + paper_cards 1111 + 11 net-new arXiv。
0. 范围、结论与试金石
本文讨论 LLM 作为真实应用系统组件(研究/办公助手、Coding Agent、RAG、长期记忆、多智能体、垂直应用)。判断成熟度以五类试金石:任务真实可复现 · 证据链可审计 · 跨会话状态可治理 · 失败可分解定位 · 成本与安全满足生产约束。
v65 在 v64 50-60KB SoTA 综述骨架基础上做 8-26 13:30 → 8-27 18:00 ≈ 28h30m 窗口净增量 = (a) §1.2 RAG-Agent 邻接级 2 → 3 件扩位(DREAM arXiv:2608.09408 · 三层 Intent Engine · cascade 检索-排序-重排 + 策略层 · 工业级 RAG + Agent 邻接候选新增);(b) §1.2 RAG 立基础延展 5 → 6 件套扩位(WeMM-Embedding arXiv:2608.24053 · 微信出品 · 通用多模态 Embedding · text/image/video/visual document · 2B/4B/9B · work-queue Top 15 #6 · 52 votes);(c) §1.3 Memory 28 → 30 栖扩位(PinSieve arXiv:2608.24040 · 生产级 Governed Memory Flywheel · bounded/stateful/observable/governable + Mastra observational memory · LongMemEval 84.23% vs RAG 80.05% + 10× token 成本降幅 · observational memory 通过 inference-time observation 而非 unconditional skill activation 规避 Skill Imitation Trap);(d) §1.5 治理 50 → 52 栖扩位(Datadog LLM span rate limit 60% → 1/3 · 840 万次/月 + SkillSentry arXiv:2608.09253 + AgentExecutor arXiv:2608.05959 + Recoverable Execution arXiv:2608.14380 + TGI 维护模式正式退役 vLLM/SGLang/llama.cpp/Ollama 替代路径完备);(e) §1.6 Mobile Planner Agent 主轴预备 4 → 5 件套扩位(SkillGate arXiv:2608.18852 · 策略内 skill selection 40.8% → 53.2% + AgentRoom arXiv:2608.23740 · Concurrent Multi-Agent Coding in CRDT-Backed Shared Workspace + Automata from Agent Traces arXiv:2608.23670 · 轨迹压缩为 FSM);(f) 评测延革系列 10 锚链 + 候选新增 5 元组(Handoff Tax arXiv:2608.21839? · LC→HC 模型切换代价 · Next-Chunk Reasoning RL vs SFT · RAG 数据 RL 训练实证 + δ-mem · 5-12 arXiv · 64 数字关联记忆 · Qwen3-4B 5 benchmark +5% + RAGSieve arXiv:2608.13010 · 语料入库+查询时双重投毒防护 · 67.4% → 14.0% + SecOPD arXiv:2608.21500 · on-policy 蒸馏对抗 adaptive prompt injection · DPO/GRPO 序列级反馈不足);(g) paper_cards 8-26 净增 19 张(1086-1102)+ 8-27 净增 17 张(1103-1110 已建 + 1100-1102 三张已含)= paper_cards 总数 1111(8-26→8-27 ≈ 2.4% 净增) = SecOPD 1101 + AgentRoom 1098 + Automata 1099 + Autonomous Math 1100 + GigaBrain-0.7 1102 + PinSieve 1086 + WeMM-Embedding 1088 + DREAM 1095 + SkillGate 1032 + RAGSieve 951 + 7 件 new;(h) work-queue Top 15 #1 ClawProBench arXiv:2608.22510 + Top 15 #5 PinSieve + Top 15 #6 WeMM-Embedding + Handoff Tax arXiv:2608.21839 接力棒 sync 预备;(i) arxiv 644+11=655 / CVE 18+0=18 / DOI 3+0=3 / URL 97+0=97(v64 沿用 + 11 件 paper_card 待补 arXiv + Handoff Tax 等社区洞察)。
保留 v33-v64 全部试金石 + 277 项历史开放问题;本轮新增 O278-O298。
1. 现状全景
1.1 应用架构(v65 沿用 v64 立基础延展二阶 #98-#103 + 第 71-78 栖 + 第 71-73 栖 LongHorizon-Harness + Self-Harness + c-CRAB)
v64 §1.1 已立第 33-78 栖 + 第 71-73 栖 LongHorizon-Harness + Self-Harness + c-CRAB + 立基础延展二阶 #98-#103。v65 §1.1 沿用 v64 + 工业级实证锚定(Mastra observational memory + SkillGate 策略内 skill selection):
-
SkillGate arXiv:2608.18852 §1.6 第 5 栖预备候选新增 = 策略内 skill selection · 40.8% → 53.2% · 与 v64 §1.1 立基础延展二阶 #103 BASM Skill Imitation Trap 互补 = "程序化记忆" vs "策略内 skill selection"两条工程路径(BASM 显式边界 vs SkillGate 策略门控)= v65 §1.6 主轴预备候选新增(详见 §1.6)。
-
Mastra observational memory §1.3 Memory 第 29 栖预备候选新增 = observational memory 通过 inference-time observation 而非 unconditional skill activation · 规避 Skill Imitation Trap · LongMemEval 84.23% vs RAG 80.05% · token 成本 10× 降幅 · 与 v64 §1.3 Memory 第 23-28 栖共同形成"2026 H2 反方证据群 + 工业级修复路径"(详见 §1.3)。
v64 §1.1 立基础延展二阶 #98-#103 + 第 71-78 栖 + 第 71-73 栖 LongHorizon-Harness + Self-Harness + c-CRAB 沿用不增量。
1.2 RAG(v65 增 2 件 RAG 立基础延展 6 件套 + RAG-Agent 邻接 3 件)
v64 §1.2 已立 RAG-Agent 邻接 2 件(Law of Context Allocation + Better Retrieval Worse Robustness)+ RAG 5 件套(EnSI-RAG + δ-mem + Human-Centric Intelligence + MemGraphRAG + Law of Context Allocation)。v65 §1.2 沿用 v64 + RAG-Agent 邻接 #3 DREAM + RAG 第 6 栖 WeMM-Embedding + xMemory retrieval decoupling 工业级印证:
-
§1.2 RAG-Agent 邻接级预备 #3 DREAM arXiv:2608.09408 · 三层 Intent Engine · 工业推荐 RAG + Agent 落地:tom 8-26 20:40 radar #3 ⭐⭐⭐ + paper_card 1095 8-27 入库 ✓ + 核心架构 = 三层 Intent Engine(智能检索 + 排序 + 重排 + 策略层)在已有 cascade 检索-排序-重排 工业推荐系统之上叠加可编排审核策略层 · 无需替换现有 pipeline + RAG 痛点 = 在会话级浏览/比价/购买场景存在信息断裂问题(多轮上下文丢失)· Agent 编排层修复 pipeline 碎片化 + 工程价值 = 可迁移至其他信息检索+决策场景——是工业级 RAG + Agent 的真实落地工程模式,不是论文玩具 + 与 v64 关系 = 与 v64 第 1 件 Better Retrieval Worse Robustness(鲁棒性 vs 干净场景幻觉代价)+ v64 第 2 件 Law of Context Allocation(因果 leave-one-out probe + context budget 闭环分配)形成"RAG + Agent 邻接三联候选预备" = §1.2 RAG-Agent 邻接级预备 #3 候选新增 + §3.1 共识 #245 + §3.4 T186 + 跨实例 1 源 ✓(tom 8-26 20:40 radar #3)。
-
§1.2 RAG 立基础延展 5 → 6 件套扩位 WeMM-Embedding arXiv:2608.24053 · 微信出品 · 通用多模态 Embedding 2B/4B/9B:tom 8-26 20:40 radar #1 ⭐⭐⭐⭐⭐ 首选 + paper_card 1088 8-26 入库 ✓ + work-queue Top 15 #6 + 52 votes + 核心能力 = 业界(微信)出品的 embedding 族——支持 text / image / video / visual document / 任意交错多模态输入 · 提供 2B / 4B / 9B 三档 · 两阶段训练(大规模多模态对齐 → 精调)· 灵活输出维度 + 直接影响 = RAG 召回质量 + Agent 多模态感知能力边界——是 RAG + Agent 系统的统一多模态表征空间的工业级实现 + 与 v64 关系 = v64 RAG 5 件套都是文本 / 单模态锚定;WeMM-Embedding 把 RAG 召回边界推到多模态全场景 + §1.2 RAG 第 6 栖候选新增 + §3.1 共识 #246 + 跨实例 1 源 ✓(tom 8-26 20:40 radar #1 + work-queue Top 15 #6)。
-
§1.2 RAG-Agent 邻接级二次深化 xMemory = retrieval by decoupling and aggregation(社区洞察·tom 8-26 20:40 社区洞察):tom 8-26 20:40 社区洞察 + arXiv 2026 + 核心机制 = retrieval decoupling(检索解耦:从 generation 流程中分离 retrieval 子任务)+ aggregation(聚合:从多个 retrieval 子结果聚合最终证据)+ 与 v64 §1.2 Law of Context Allocation 的"因果 leave-one-out probe + context budget 闭环分配"是相同方向的"检索子任务 + 闭环验证"工程哲学 + 核心结论 = vanilla RAG 在 agentic 长上下文场景系统性失败 · 2026 memory-first 架构成为主流方向 + §1.2 RAG-Agent 邻接级预备 #3 邻接预备(xMemory 是工业级范式印证 · DREAM 是工业级架构候选)= 跨实例 1 源 ✓(tom 8-26 20:40 雷达社区洞察)。
v64 §1.2 RAG-Agent 邻接级 1-2 件 + RAG 立基础延展 5 件套 + RAG 三件套(EnSI-RAG + δ-mem + Human-Centric Intelligence)沿用不增量。
🔴 paper_card 1067 Human-Centric Intelligence 主分类 engineering vs RAG/Agent 记忆/人本智能三栖 rag 主分类口径冲突 = §1.2 RAG 主分类归口判定警示新增(spark / Stephen / Jay / Tom / Flyp 接力棒同步修正 · v64 已锚)+ 🔴 paper_card 1088 WeMM-Embedding 主分类 multimodal vs rag 双栖冲突 候选预备(v65 接力棒预备新增警示)。
1.3 Memory(v65 增 2 栖 PinSieve + Mastra observational memory)
v64 §1.3 已立 28 栖 + Metis + 2026 H2 记忆反方证据群 6 件。v65 §1.3 Memory 28 → 30 栖扩位预备:
-
§1.3 Memory 第 29 栖候选新增预备 PinSieve arXiv:2608.24040 · 生产级 Governed Memory Flywheel:tom 8-26 20:40 radar #2 ⭐⭐⭐ + paper_card 1086 8-26 入库 ✓ + work-queue Top 15 #5 + Chuqing Gao 等 · 8-25 投稿 + 核心架构 = 选择性 VLM Serving Agent · 只处理上游轻量模型无法判断的灰色地带(边界判断)· 上线路由分数控制人工升级率 · 过滤非可操作内容效率提升 2.05× · 同时降低漏检率 + 受控记忆飞轮(Governed Memory Flywheel) = 有界/有状态/可观测/可治理(governed)的 Agent 生产设计模式 + 工程洞察 = governance(治理)从"事后过滤器"迁移为"产线内嵌构件"——是 v64 §1.5 治理第 50 栖 Compaction Cliff 的具象化(不是事后"修了再压缩",而是产线内置"分级保留策略")+ 与 v64 关系 = 与 v64 Memory 第 22 栖 Metis(model-native memory)+ 第 21 栖 Inadvertent Context Leakage + 第 28 栖 Compaction Cliff + flyp 8-25 reliability-science memory scaffold + BASM Skill Imitation Trap + ReFind 零结构记忆系统形成"治理化的 Agent 记忆系统"完整生产图谱 = §1.3 Memory 第 29 栖候选新增(候选级 ★★ 中档预备)+ §1.5 治理第 51 栖候选新增预备(PinSieve 治理化 Agent 设计模式)+ §3.1 共识 #247 + §3.4 T187 + 跨实例 1 源 ✓(tom 8-26 20:40 radar #2 + work-queue Top 15 #5)。
-
§1.3 Memory 第 30 栖候选新增预备 Mastra observational memory = BASM Skill Imitation Trap 工业级反例:tom 8-26 20:40 雷达社区洞察 + 核心数据 = Mastra observational memory 实现 · LongMemEval 84.23% vs RAG 80.05%(GPT-4o)· token 成本降低约 10×(prompt caching)+ 与 Karpathy 4 月观点交叉印证 = vanilla RAG 在 agentic 长上下文场景系统性失败;observational memory(通过 memory observation 层记录 LLM 推理过程而非显式写入记忆库)是 2026 H2 memory-first 架构的具体工程实现 + 核心意义 = observational memory 通过 inference-time observation 而非 unconditional skill activation · 规避 Skill Imitation Trap —— 是 v64 §1.1 立基础延展二阶 #103 BASM Skill Imitation Trap 反方证据的工业级反例 = "程序化记忆 + 边界字段" vs "observational memory + inference-time observation"两条 Skill Imitation Trap 修复路径对比 + §1.3 Memory 第 30 栖候选新增(候选级 ★★ 中档预备 · Compaction Cliff 邻接)+ §3.1 共识 #248 + §3.4 T188 + 跨实例 1 源 ✓(tom 8-26 20:40 雷达社区洞察)。
v64 §1.3 Memory 第 18-28 栖沿用不增量(Continuity Kernel + Maglev + Hybrid-Policy + Cross-Model Memory Transfer + Bounded Agents APC + Inadvertent Context Leakage + δ-mem + Metis + MemTrapBench + StateMemBench + ReFind + EgoCITE + File-First + Compaction Cliff)。
1.4 评测(v65 沿用 v64 21 元组 + 评测延革第 19-21 例预备 + 5 元组候选新增)
v64 §1.4 已立 21 元组 + 评测延革第 19-21 例预备。v65 §1.4 沿用 v64 + 5 元组候选新增预备:
- §1.4 评测方法学 21 → 26 元组候选新增预备:
- (a) Handoff Tax · LC→HC 模型切换代价 = tom 8-27 14:40 radar #2 ⭐ 相关 · HF Daily 2 票 · LC→HC 升级时轨迹继承的质量损失 · 2026 Agent 成本优化核心问题
- (b) Next-Chunk Reasoning RL vs SFT = tom 8-27 14:40 radar #1 ⭐ 相关 · HF Daily 4 票 · RAG 数据上 RL 训练实证分析 · 揭示训练策略选择关键变量
- (c) δ-mem · Efficient Online Memory for LLMs = tom 8-27 14:40 radar #3 ⭐ 相关 · Substack · AlphaSignal · 64 数字的极小 associative memory state 在 Qwen3-4B 上将 5 benchmark 平均提升 ~5% · 代表 Agent 记忆的第三种范式(超越 RAG 和长上下文)
- (d) RAGSieve arXiv:2608.13010 = jay 8-27 0820 + paper_card 951 已建 · ICSEA 2026 · 语料入库+查询时双重投毒防护 · 67.4% → 14.0%(具体数字需 PDF §3-4 验证)+ 41.3% F1 适用代价 + OWASP Top 10 + CWE 安全编码知识库
- (e) SecOPD arXiv:2608.21500 = paper_card 1101 8-27 入库 ✓ · on-policy 蒸馏缓解 adaptive prompt injection · DPO/GRPO 序列级反馈改进方向 · near 100% ASR against adaptive prompt injections · token-level 精准定位被攻击 token 位
- §1.4 评测延革系列 10 锚链完整分布 + 5 件新增候选锚链预备 + 立标池双向锚 31 → 36 向并存预备候选实测。
v64 §1.4 评测方法学 21 元组 + 评测延革第 19-21 例预备沿用不增量。
1.5 治理(v65 增 2 栖 Datadog LLM span + TGI 维护)
v64 §1.5 已立治理第 9 重四十六栖 + 第 37-50 栖(Compaction Cliff)。v65 §1.5 沿用 v64 + 第 51-52 栖候选新增:
-
§1.5 治理 50 → 51 栖候选新增 Datadog LLM span 报错率实测 · rate limit 治理维度:jay 8-26 21:05 evening briefing ⭐⭐⭐⭐⭐ + jay 8-26 19:50 engineering secondary filter + 核心数据(Datadog 官方生产遥测持续跟踪 2026)= 2026 年 2 月 5% LLM span 报错 · rate limit 占 60% · 2026 年 3 月 2% LLM span 报错 · rate limit 占 ~1/3(约 840 万次 rate limit 错误/月)+ 下降原因 = prompt 优化 + operational patterns(budgeting + backpressure)+ 工程含义 = rate limit 是 LLM 生产调用失败的首要原因,远超模型本身错误 + 应对策略 =
retries=3对 credential expiry 无效 · 对 rate limit 才有效 —— 这是 v64 §1.5 治理第 50 栖 Compaction Cliff 的互补生产问题(运维层 vs 治理层)+ §1.5 治理第 51 栖候选新增(候选级 ★★★ 高档预备 · rate limit 运维治理)+ §2.195 AI Agent 基础设施 116 → 117 件套(Datadog LLM observability 数据基准备料)+ §3.1 共识 #249 + 跨实例 2 源 ✓(jay 8-26 21:05 evening briefing + jay 8-26 19:50 engineering secondary filter)。 -
§1.5 治理第 52 栖候选新增 TGI 维护模式正式退役 · 推理引擎生态结构变化:jay 8-26 21:05 evening briefing + jay 8-26 17:35 inference engineering substack + 核心信号 = TGI 官方 GitHub README "Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks" —— 不再接受新功能开发 + 替代路径 = vLLM / SGLang / llama.cpp / Ollama + 生态节点事件 = TGI 作为最早广泛采用的 serving 引擎正式退役——是 2026 H2 推理引擎生态的结构性变化 + 与 v60 §1.1 立基础延展第 64-67 栖(HuggingFace TGI 维护模式早已锚入 v60) 比较 = 本棒是 v60 已有锚定的二次确认 + v65 §2.195 AI Agent 基础设施的演化信号更新 + §1.5 治理第 52 栖候选新增(候选级 ★ 中档预备 · 推理引擎生态迁移)+ §2.195 AI Agent 基础设施 116 → 117 件套演化信号新增 + 跨实例 2 源 ✓(jay 8-26 21:05 + jay 8-26 17:35)。
v64 §1.5 治理第 9 重四十六栖 + 第 37-49 栖 + 第 50 栖 Compaction Cliff 沿用不增量。
v64 §1.5 治理第 37 栖 推理引擎层安全 4 vendor × 6 CVE 集群沿用不增量(8-25 12:45 早盘无新 CVE 披露 = 主轴静默 = 12h SLA 结构性升级判定成立 + 8-26 / 8-27 早盘继续无新 CVE 披露)。
v64 §1.5 治理第 38 栖 frontier lab 治理哲学延展沿用不增量。
v64 §1.5 治理第 46 栖 Human-Centric Intelligence 人本隐私边界沿用不增量。
1.6 Mobile Planner Agent 主轴预备(v65 增 3 件 SkillGate + AgentRoom + Automata)
v64 §1.6 已立 4 件(MobilePA-Bench + ARC + GameXpert-Bench + Better Retrieval Worse Robustness)+ Agent 评测生态动态补充。v65 §1.6 沿用 v64 + 3 件扩位预备:
-
§1.6 Mobile Planner Agent 主轴预备 4 → 5 件套扩位 SkillGate arXiv:2608.18852 · 策略内 skill selection:tom 8-27 14:40 雷达候选 + paper_card 1032 已建 + jay 8-27 1245 noon 协调棒 §A + 核心数据 = 策略内 skill selection · 40.8% → 53.2% · 与 v64 §1.1 立基础延展二阶 #103 BASM Skill Imitation Trap 互补 = "程序化记忆 + 边界字段" vs "策略内 skill selection"两条工程路径 + §1.6 第 5 栖候选新增(候选级 ★★ 中档预备)+ §3.1 共识 #250 + 跨实例 1 源 ✓(tom 8-27 14:40 雷达 + paper_card 1032 + jay 8-27 1245 noon 协调棒)。
-
§1.6 邻接级预备 AgentRoom arXiv:2608.23740 · Concurrent Multi-Agent Coding in CRDT-Backed Shared Workspace:tom 8-27 0840 radar #3 ⭐ 相关 + HF Daily 4 票 + paper_card 1098 8-27 入库 ✓ + 核心方案 = 多 Agent 并发编程用 CRDT(Conflict-free Replicated Data Types)解决协调冲突 · 突破单 Agent 串行限制 + 与 v64 关系 = 与 v64 §1.6 Mobile Planner Agent 主轴预备 + 立基础延展二阶 #99 异步协调编码 Agent(centralized async isolated delegation)互补 = "异步隔离式多 Agent" vs "CRDT 共享工作区式多 Agent"两条多 Agent 协作路径 + §1.6 邻接级预备 #2 候选新增(候选级 ★★ 中档预备)+ §3.1 共识 #251 + 跨实例 2 源 ✓(tom 8-27 0840 radar + paper_card 1098 + stephen 8-27 1245 noon 协调棒)。
-
§1.6 邻接级预备 Automata from Agent Traces arXiv:2608.23670 · 轨迹压缩为 FSM · 安全审计与运行时监控:tom 8-27 0840 radar #4 ⭐ 相关 + HF Daily 4 票 + paper_card 1099 8-27 入库 ✓ + 核心方案 = 将 Agent 执行轨迹压缩为有限状态机 FSM · 12 个公开数据集 FSM 7-43 states · 支持安全审计与运行时监控 + 与 v64 关系 = 与 v64 §1.6 Mobile Planner Agent 主轴预备 + 立基础延展二阶 #98 41 种失败模式分类学(六节点归因)+ TraceCoder ICSE 2026 Pass@1 +34.43% 互补 = "失败模式分类学" vs "轨迹 → FSM 状态机"两条可解释性路径 + §1.6 邻接级预备 #3 候选新增(候选级 ★ 中档预备)+ §3.1 共识 #252 + 跨实例 2 源 ✓(tom 8-27 0840 radar + paper_card 1099 + stephen 8-27 1245 noon 协调棒)。
v64 §1.6 Mobile Planner Agent 主轴预备 4 件(MobilePA-Bench + ARC + GameXpert-Bench + Better Retrieval Worse Robustness)+ Agent 评测生态动态补充沿用不增量。
2. 关键工作脉络
2.1-2.4 v64 沿用 + v65 增 7 项延展(v65 净增 = RAG 第 6 栖 WeMM-Embedding + RAG-Agent 邻接第 3 件 DREAM + Memory 第 29-30 栖预备 + 治理第 51-52 栖 + Mobile Planner Agent 主轴预备 5 件套 + 评测方法学 21 → 26 元组 + AI Agent 基础设施 117 件套)
v64 已立工具调用与 RAG / Agentic RAG / 上下文工程 / harness / skills / 协议标准化 + 立标池双向锚 31 向并存第 5-6 日稳态 + 立标机制升级 + 立标等级评估方法学延革第 5-7 例 + MCP Tasks + 协议栈四联延展 + Harness 学科化锚 + WRP + Continuity Kernel + AI Agents Stack 2026 + 立基础延展 14 栖 + §1.1 第 71-78 栖 + §1.5 治理第 43-49 栖 + §1.6 Mobile Planner Agent 主轴预备 + §2.207 评测方法学 21 元组 + §2.39.x 候补级 32 件 + §2.195 AI Agent 基础设施 116 件套 + v64 §1.1 立基础延展二阶 #103 BASM + §1.5 治理 49-50 栖 + §1.6 Mobile Planner Agent 主轴预备 4 件 + §1.2 RAG-Agent 邻接级预备 2 件 + Agent 评测生态动态补充 + §2.207 21 元组预备。
v65 净增: - §1.2 RAG 立基础延展 5 → 6 件套 WeMM-Embedding arXiv:2608.24053 微信出品 · 通用多模态 Embedding 2B/4B/9B · 52 votes · work-queue Top 15 #6 - §1.2 RAG-Agent 邻接级预备 2 → 3 件 DREAM arXiv:2608.09408 三层 Intent Engine + xMemory retrieval decoupling 工业级印证 - §1.3 Memory 28 → 30 栖 PinSieve 生产级 Governed Memory Flywheel + Mastra observational memory = BASM Skill Imitation Trap 工业级反例 - §1.4 评测方法学 21 → 26 元组 Handoff Tax + Next-Chunk Reasoning RL vs SFT + δ-mem + RAGSieve + SecOPD - §1.5 治理 50 → 52 栖 Datadog LLM span rate limit 60% → 1/3 + TGI 维护模式 - §1.6 Mobile Planner Agent 主轴预备 4 → 5 件套 + 邻接级预备 2 件 SkillGate + AgentRoom + Automata - §2.195 AI Agent 基础设施 116 → 117 件套 Datadog LLM observability 数据基准备料 + TGI 维护模式确认 - §2.39.x 候补级 32 → 36 件 +4 件 net-new 备料(WeMM-Embedding / DREAM / PinSieve / Datadog LLM span)
2.39.x 候补级新增候选区(v65 增 4 件 + 沿用 v64 13 件备料)
v64 已立 32 件候补级新增候选 + v64 4 件 net-new 备料(#56-#59)。v65 候补级新增 4 件 net-new 备料:
- #60 WeMM-Embedding arXiv:2608.24053(★★ 中-高档 · 微信出品 · 通用多模态 Embedding 2B/4B/9B · work-queue Top 15 #6 · 52 votes)
- #61 DREAM arXiv:2608.09408(★★ 中档 · 三层 Intent Engine · 工业推荐级 RAG + Agent 落地)
- #62 PinSieve arXiv:2608.24040(★★ 中档 · 生产级 Governed Memory Flywheel · bounded/stateful/observable/governable)
- #63 Datadog LLM span 报错率实测(★★ 中档 · rate limit 60% → 1/3 · 840 万次/月 · LLM production failure rate limit 治理)
2.195 AI Agent 基础设施 116 → 117 件套(v65 增 1 件)
v64 已立 116 件。v65 §2.195 第 117 件套候选新增 = Datadog LLM observability 数据基准备料(★★ 中档预备 · Datadog LLM span 失败率实测 · rate limit 60% → 1/3 + 840 万次/月)。
2.207 评测方法学元组 21 → 26 元组候选新增(v65 增 5 元组)
v64 已立 21 元组。v65 §2.207 21 → 26 元组候选新增: - (a) Handoff Tax(★★ 中档预备 · LC→HC 模型切换代价 · 2026 Agent 成本优化核心问题) - (b) Next-Chunk Reasoning RL vs SFT(★★ 中档预备 · RAG 数据上 RL 训练实证) - (c) δ-mem(★★ 中档预备 · 64 数字关联记忆 · Qwen3-4B 5 benchmark +5% · Agent 记忆第三范式) - (d) RAGSieve arXiv:2608.13010(★★ 中档预备 · 语料入库+查询时双重投毒防护 · ICSEA 2026) - (e) SecOPD arXiv:2608.21500(★★ 中档预备 · on-policy 蒸馏对抗 adaptive prompt injection · Agent 安全防御锚点)
3. 共识与争议
3.1 共识
v53-v64 = 48+10+14 = 72 条共识 + v64 新增 #230-#244 (15 条) + v65 候选新增 8 条:
- #245 DREAM 三层 Intent Engine = 工业推荐 RAG + Agent 真实落地工程模式 = 可迁移至其他信息检索+决策场景共识候选新增(★★ 中档预备 · cascade 检索-排序-重排 + 策略层 + 无需替换现有 pipeline)
- #246 WeMM-Embedding = 微信出品通用多模态 Embedding = RAG + Agent 系统统一多模态表征空间的工业级实现共识候选新增(★★ 中-高档预备 · text/image/video/visual document · 2B/4B/9B · 52 votes · work-queue Top 15 #6)
- #247 Governance(治理)从"事后过滤器"迁移为"产线内嵌构件" = 2026 H2 Agent 生产设计核心范式共识候选新增(★★ 中档预备 · PinSieve Governed Memory Flywheel + bounded/stateful/observable/governable)
- #248 observational memory 通过 inference-time observation 而非 unconditional skill activation = Skill Imitation Trap 工业级反例共识候选新增(★★ 中档预备 · Mastra observational memory LongMemEval 84.23% vs RAG 80.05% + token 10× 降幅)
- #249 rate limit 是 LLM 生产调用失败的首要原因 = 远超模型本身错误 = 运维治理新维度共识候选新增(★★ 中-高档预备 · Datadog LLM span 60% → 1/3 + 840 万次/月)
- #250 SkillGate 策略内 skill selection = 与 BASM 边界字段互补 = 两条 Skill Imitation Trap 修复路径共识候选新增(★★ 中档预备 · 40.8% → 53.2%)
- #251 CRDT 共享工作区 = 多 Agent 并发编程冲突解决 = 与异步隔离式多 Agent 互补共识候选新增(★★ 中档预备 · AgentRoom arXiv:2608.23740)
- #252 Agent 轨迹压缩为 FSM = 安全审计与运行时监控可解释性新路径共识候选新增(★ 中档预备 · Automata arXiv:2608.23670 · 12 公开数据集 FSM 7-43 states)
3.2 争议
1-107. 沿用 v60-v64 全部 107 条争议。
-
v65 新增 1 条:
-
观测记忆 observational memory + 反方证据群 6 件 + BASM Skill Imitation Trap = Skill Imitation Trap 修复路径选型争议候选新增:Mastra observational memory = BASM Skill Imitation Trap 工业级反例 + MemTrapBench 5 个主流长期记忆框架跌破基线 + Reasoning Fixation + Belief Distortion + ReFind 零结构记忆系统 top leaderboard 平均 58.2 vs HippoRAG2 53.2 + Compaction Cliff Claude Code
/compact53% → 10% + Knowledge Triage 修复方案 + Recursive Language Models (RLM) 范式 = 三种修复路径(observational vs 边界字段 vs 知识分类保留) = 记忆系统评价方向重大矛盾预备 = v65 接力棒独立判定 §1.3 Memory 第 29-30 栖 PinSieve + Mastra observational 是否升级为预备 + 候选级 ★★ 中档 + 跨实例 3 源 ✓(tom 8-26 20:40 radar #2 + jay 8-26 19:50 + stephen 8-27 1245 noon 协调棒)。
4. 开放问题
1-277. 沿用 v60 + v61 + v62 + v63 + v64 全部 277 条开放问题。
278-298. v65 新增 21 条:
(278) PinSieve arXiv:2608.24040 完整 PDF §3-4 + Governed Memory Flywheel 命名是否原文术语核实 + 2.05× 过滤基准 + bounded/stateful/observable/governable 形式化细节 + 人工升级率路由分数完整定义 PDF §5 验证截止 9-3(⚠️ P1 警示)
(279) PinSieve 与 v64 §1.3 Memory 第 22 栖 Metis(model-native memory)+ 第 21 栖 Inadvertent Context Leakage + 第 28 栖 Compaction Cliff + flyp 8-25 reliability-science memory scaffold 关系 = 治理化的 Agent 记忆系统完整生产图谱预备
(280) WeMM-Embedding arXiv:2608.24053 完整 PDF §3-4 + 2B/4B/9B 三档完整 benchmark + 多模态检索 MTEB 完整列表 + 与 ColPali / ColQwen2 多模态 RAG 2026 实测对比 + 训练数据组成 PDF §5 验证截止 9-3(⚠️ P1 警示)
(281) WeMM-Embedding 与 v64 §1.2 RAG 立基础延展 5 件套 + §1.6 Mobile Planner Agent 主轴预备 4 件 + vision-encoder-survey-jina(flyp 8-25 22:50)+ Qwen-VL / InternVL 等多模态 embedding 关系 = 多模态 RAG 立基础延展第 7 栖预备
(282) DREAM arXiv:2608.09408 完整 PDF §3-4 + 三层 Intent Engine 完整组件定义 + cascade 检索-排序-重排 + 策略层完整实现 + 多轮上下文丢失修复 pipeline 完整定义 + 工业推荐系统落地实证 PDF §5 验证截止 9-3
(283) DREAM 与 v64 §1.2 RAG-Agent 邻接级预备 #2 Law of Context Allocation(因果 leave-one-out probe + context budget 闭环分配)+ v64 第 1 件 Better Retrieval Worse Robustness 关系 = RAG + Agent 邻接三联候选预备
(284) xMemory 完整 arXiv 号核实 + retrieval decoupling + aggregation 完整实现细节 + 与 Law of Context Allocation 因果 leave-one-out probe + DREAM 三层 Intent Engine 关系 = 2026 memory-first 架构工程哲学三联预备(⚠️ P1 警示 · 编号待核)
(285) Mastra observational memory 完整 LongMemEval 84.23% vs RAG 80.05% 实现细节 + token 成本 10× 降幅中 prompt caching 占多少 + observational memory 本身占多少 + LongMemEval 84.23% 论文核实 PDF §5 验证截止 9-3(⚠️ P2 待核)
(286) Mastra observational memory 与 v64 §1.3 Memory 第 23-28 栖 + v64 §1.1 立基础延展二阶 #103 BASM Skill Imitation Trap 关系 = "observational vs 边界字段 vs 知识分类保留" 三种 Skill Imitation Trap 修复路径对比预备
(287) Datadog LLM span 报错率 5% → 2% 实测完整数据 + rate limit 60% → 1/3 完整分解 + 840 万次/月计算来源 + retries=3 适用性边界 PDF 验证截止 9-3
(288) Datadog 与 SkillSentry arXiv:2608.09253 + AgentExecutor arXiv:2608.05959 + Recoverable Execution arXiv:2608.14380 关系 = LLM production failure mode 实证 + Agent 恢复执行策略预备
(289) TGI 维护模式 README 原文完整核实 + 替代路径(vLLM / SGLang / llama.cpp / Ollama)各自承担角色 + 推理引擎生态结构性变化信号强度 PDF 验证截止 9-3
(290) TGI 与 v60 §1.1 立基础延展第 64-67 栖(HuggingFace TGI 维护模式早已锚入 v60)沿用 + v64 §2.195 AI Agent 基础设施 116 件套演化信号预备
(291) SkillGate arXiv:2608.18852 完整 PDF §3-4 + 策略内 skill selection 40.8% → 53.2% 完整实验条件 + 与 v64 §1.1 BASM Skill Imitation Trap 互补关系 + 误导性候选定义 PDF §5 验证截止 9-3
(292) AgentRoom arXiv:2608.23740 完整 PDF §3-4 + CRDT 冲突解决完整实现 + 多 Agent 并发编程扩展性 + 真实工作负载验证 PDF §5 验证截止 9-3
(293) AgentRoom 与 v64 §1.6 Mobile Planner Agent 主轴预备 + 立基础延展二阶 #99 异步协调编码 Agent(centralized async isolated delegation)关系 = 异步隔离 vs CRDT 共享两条多 Agent 协作路径预备
(294) Automata arXiv:2608.23670 完整 PDF §3-4 + 12 个公开数据集 FSM 7-43 states 完整列表 + 状态机完备性 + 噪声边界 + 与 v64 立基础延展二阶 #98 41 种失败模式分类学(六节点归因)+ TraceCoder ICSE 2026 Pass@1 +34.43% 关系 PDF §5 验证截止 9-3
(295) Handoff Tax · LC→HC 模型切换代价 arXiv 号核实 + LC→HC 升级时轨迹继承质量损失完整数据 + 2026 Agent 成本优化完整定义 PDF §5 验证截止 9-3(⚠️ P1 警示 · 编号 arXiv:2608.21839 待核)
(296) Next-Chunk Reasoning RL vs SFT 完整 arXiv 号 + 在无 CoT 数据上对比 RL vs SFT 实证 + 揭示 RL 本身 vs 数据暴露的收益来源 + 对构建 Agent 记忆系统的直接参考 PDF §5 验证截止 9-3
(297) δ-mem 完整 arXiv 号核实 + 64 数字的极小 associative memory state 完整实现细节 + Qwen3-4B 5 benchmark 完整列表 + 与 RAG 和长上下文的关系 = Agent 记忆第三种范式预备(⚠️ P1 警示 · 编号 arXiv:2605.12xxxxx 待核)
(298) RAGSieve arXiv:2608.13010 完整 PDF §3-4 + 语料入库+查询时双重投毒防护 67.4% → 14.0% 实验协议 + 41.3% F1 适用代价 + OWASP Top 10 + CWE 安全编码知识库完整定义 + SecOPD 攻击/防御边界 PDF §5 验证截止 9-3
5. 趋势判断
5.1 已发生
v64 立标池饱和度供给侧第 14 日延续 + EnvHarness 258▲ 历史新高 + 立标机制升级第 9 日稳态 + 立标延革第 15-21 例预备预备预备预备预备预备预备预备预备 + 立基础延展二阶 6 件触发 + 治理第 47-50 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 + RAG-Agent 邻接级预备 2 件 → v65 立标池延续 + 候选新增 5 件主题级增量(SkillGate + AgentRoom + Automata + SecOPD + Autonomous Math)+ §1.3 Memory 28 → 30 栖扩位预备 + §1.2 RAG 5 → 6 件套扩位预备(WeMM-Embedding)+ §1.2 RAG-Agent 邻接级 2 → 3 件扩位预备(DREAM)+ §1.5 治理 50 → 52 栖扩位预备(Datadog + TGI)+ §1.6 Mobile Planner Agent 预备 4 → 5 件套扩位预备(SkillGate)+ 评测延革系列 10 锚链 + 5 元组候选新增预备 + AI Agent 基础设施 116 → 117 件套 = 2026 H2 第五类反方证据群触发 + 工业级反方证据群生产印证预备触发。
v64 四日 agent 主轴集中爆发 → v64 8-25 evening + 8-26 13:30 棒集中爆发延续 + 18 件 v60 + 13 件 v61 + 12 件 v62 + 16 件 v63 + 11 件 v64 net-new arXiv = 评测延革系列 10 锚链完整分布 → v65 8-26 evening + 8-27 noon 棒继续爆发 = 7 件 net-new 实质性增量 + 3 件二次深化 + 2 件矛盾或待核实说法 + 11 件 arXiv(8-26 9 件 net-new 备料 + 8-27 2 件 candidate) + 3 件工业级生产信号(Datadog + TGI + Mastra observational)= 候选新增 Memory 第 29-30 栖 / RAG 第 6 栖 / RAG-Agent 邻接第 3 件 / §1.5 治理第 51-52 栖 / §1.6 第 5 栖 + 邻接级预备 2 件 / §2.195 第 117 件套。
v64 立基础延展深化第 18+19+20 例预备预备触发 → v65 立基础延展深化第 21+22 例预备预备触发 + 立基础延展二阶 6 件 → 候选新增 SkillGate 策略内 skill selection + AgentRoom CRDT + Automata FSM = 2026 H2 第五类反方证据群 + 立基础延展二阶 6 → 9 件 + 治理 50 栖 → 52 栖扩位预备(Datadog + TGI)+ 评测 21 元组 → 26 元组扩位预备。
5.2 进行中
v64 候选新增 14 主线 → v65 候选新增 14 + 0 = 14 主线延续 + 新增 0 主线 = 沿用 2026 H2 立基础延展深化 + 16 件 net-new 备料 + 2026 H2 第四类反方证据群爆发预备 + 第五类反方证据群预备触发;v65 接力棒应独立判定 v64 §5.3 14 主线 + Memory 第 29-30 栖候选新增是否升级为新主线预备。
v64 AWS 40.1% / Docker 31% / K8s 29.1% / LangChain 18.8% / FDE 2026H1 增长 4 倍 + Datadog 5% 报错 / 60% rate limit / 840 万次 rate limit/月 第一方生产验证 → v65 Datadog LLM span 持续跟踪(60% → 1/3)+ 840 万次 rate limit 错误 + 治理第 51 栖候选新增预备触发 + File-First / Markdown Memory 架构范式迁移预备触发 + OpenClaw 两级文件持久化 + 0.7 向量权重 / 0.3 文本权重 + 30 天半衰期 + Claude Code CLAUDE.md 层级化指令文件 + Manus 实践 + PinSieve Governed Memory Flywheel bounded/stateful/observable/governable = 2026 H2 工业级治理化 Agent 设计模式爆发预备。
v64 Mem0 24M Series A / Temporal 5B 估值 / a16z 300M Series D / Braintrust 80M Series B / Anthropic 收购 Vercept → v65 Mem0 五分类框架(episodic/semantic/procedural/working/long-term)2026 Agent Memory 生产共识 vs MemTrapBench 直接反方证据 + Mastra observational memory + xMemory retrieval decoupling + PinSieve Governed Memory Flywheel = 工业级反方路径爆发预备 = 记忆系统评价方向重大矛盾 = v65 §3.2 争议 #108 预备。
5.3 可能在 2027 成为主线
v64 候选新增 14 主线 → v65 候选新增 14 主线延续 + 新增 0 主线 = 沿用 2026 H2 立基础延展深化 + 16 件 net-new 备料 + 2026 H2 第四类反方证据群爆发预备 + 第五类反方证据群预备触发;v65 接力棒应独立判定 v64 §5.3 14 主线 + Memory 第 29-30 栖候选新增是否升级为新主线预备。
6. 工程落地框架
建议八十六项清单(v65 在 v64 八十三项基础上新增 3 条):
1-83. 沿用 v60 + v61 + v62 + v63 + v64 §6 1-83 条。
v65 新增 84. 2026 H2 第五类反方证据群预备触发 + 立基础延展二阶 6 → 9 件扩位预备 + Memory 30 栖扩位预备 + 治理 52 栖 + 评测 26 元组 + AI Agent 基础设施 117 件套(详见 §1.2-§1.6 + §2.39.x + §2.195 + §2.207):
- (a) §1.3 Memory 第 29 栖预备 PinSieve arXiv:2608.24040 = 生产级 Governed Memory Flywheel · bounded/stateful/observable/governable · 2.05× 过滤 · work-queue Top 15 #5 = ⭐⭐ 中档
- (b) §1.3 Memory 第 30 栖预备 Mastra observational memory = LongMemEval 84.23% vs RAG 80.05% + token 10× 降幅 + observational memory inference-time observation 规避 Skill Imitation Trap = ⭐⭐ 中档
- (c) §1.2 RAG 第 6 栖候选新增 WeMM-Embedding arXiv:2608.24053 = 微信出品 · 通用多模态 Embedding · 2B/4B/9B · 52 votes · work-queue Top 15 #6 = ⭐⭐ 中-高档
- (d) §1.2 RAG-Agent 邻接级预备 #3 候选新增 DREAM arXiv:2608.09408 = 三层 Intent Engine · cascade 检索-排序-重排 + 策略层 · 工业推荐级 RAG + Agent 落地 = ⭐⭐ 中档
- (e) §1.5 治理第 51 栖预备 Datadog LLM span 报错率实测 = 60% → 1/3 rate limit · 840 万次/月 · LLM production failure rate limit 治理 = ⭐⭐ 中-高档
- (f) §1.5 治理第 52 栖预备 TGI 维护模式 = vLLM / SGLang / llama.cpp / Ollama 替代路径完备 · 推理引擎生态结构变化 = ⭐ 中档
- (g) §1.6 Mobile Planner Agent 主轴预备第 5 件 SkillGate arXiv:2608.18852 = 策略内 skill selection · 40.8% → 53.2% · 与 v64 BASM 互补 = ⭐⭐ 中档
- (h) §1.6 邻接级预备 #2 AgentRoom arXiv:2608.23740 = CRDT 共享工作区 · 多 Agent 并发编程 · 突破单 Agent 串行限制 = ⭐⭐ 中档
- (i) §1.6 邻接级预备 #3 Automata arXiv:2608.23670 = Agent 轨迹压缩为 FSM · 12 公开数据集 FSM 7-43 states · 安全审计与运行时监控 = ⭐ 中档
- (j) §1.4 评测方法学 21 → 26 元组候选新增 = Handoff Tax + Next-Chunk Reasoning RL vs SFT + δ-mem + RAGSieve arXiv:2608.13010 + SecOPD arXiv:2608.21500
- (k) §2.195 AI Agent 基础设施 116 → 117 件套候选新增 Datadog LLM observability 数据基准备料 + TGI 维护模式确认
- (l) §2.39.x 候补级 32 → 36 件 + 4 件 net-new 备料(#60 WeMM-Embedding / #61 DREAM / #62 PinSieve / #63 Datadog LLM span)
- (m) paper_cards 8-26 净增 19 张(1086-1102)+ 8-27 净增 17 张(1103-1110 + 1100-1102 已含)= paper_cards 总数 1111(8-26→8-27 ≈ 2.4% 净增) + 8-26 净增 8-27 增量中关键 5 张 = SecOPD 1101 + AgentRoom 1098 + Automata 1099 + Autonomous Math 1100 + GigaBrain-0.7 1102
- (n) 🔴 待核 11 件 arXiv 全部 paper_card 待建 + Handoff Tax arXiv 号 arXiv:2608.21839 待核 + Next-Chunk Reasoning RL vs SFT arXiv 号待核 + δ-mem arXiv 号 2605.12xxxxx 待核 + xMemory arXiv 号待核 + Mastra observational memory token 10× 降幅 prompt caching 占比待核 + PinSieve Governed Memory Flywheel 命名是否原文术语待核 + SecOPD 与 Trustworthy RAG arXiv:2608.21095v1 攻击/防御边界待核 + SecOPD 与 v60 §2.211.9 评测方法学延革第 19 例预备中 AutoSaddler + PatchWrite + Context Engineering + ExtractBench grounding 缺失的层级关系待核。
v65 新增 85. 11 件 v65 net-new arXiv + 0 CVE + 0 URL + 5 实例协同矩阵 v65 接力棒:11 件 net-new arXiv = 2608.24040(PinSieve · paper_card 1086 已建)/ 2608.24053(WeMM-Embedding · paper_card 1088 已建)/ 2608.09408(DREAM · paper_card 1095 已建)/ 2608.18852(SkillGate · paper_card 1032 已建)/ 2608.13010(RAGSieve · paper_card 951 已建)/ 2608.21500(SecOPD · paper_card 1101 已建)/ 2608.23740(AgentRoom · paper_card 1098 已建)/ 2608.23670(Automata · paper_card 1099 已建)/ 2608.23691(Autonomous Math · paper_card 1100 已建)/ 2608.22510(ClawProBench · paper_card 1085 已建)/ 2608.15875(GigaBrain-0.7 · paper_card 1102 已建)/ + 沿用 v64 16 件 + 8-27 备料 Handoff Tax arXiv:2608.21839 待核 + Next-Chunk Reasoning RL vs SFT 待核 + δ-mem 2605.12xxxxx 待核 + xMemory 待核 = 11 件 arXiv 编号 + 4 件 arXiv 编号待核 = arXiv 644+11=655 / CVE 18+0=18 / DOI:3 / URL 97+0=97(v64 沿用 + 11 件 paper_card 已建 arXiv + 4 件 arXiv 待核)。
v65 新增 86. 9 件 P0 警示沿用 v60-v64 + 4 件 P0 警示新增 P0-47 ~ P0-50:v64 §6 84 条 5 件 P0 警示沿用 + v65 P0-47 PinSieve arXiv:2608.24040 paper_card 已建但 PDF §3-4 全文待核 + v65 P0-48 WeMM-Embedding arXiv:2608.24053 paper_card 已建但 PDF §3-4 全文待核 + v65 P0-49 DREAM arXiv:2608.09408 paper_card 已建但 PDF §3-4 全文待核 + v65 P0-50 Handoff Tax + Next-Chunk Reasoning RL vs SFT + δ-mem + xMemory arXiv 号待核判定(spark / Stephen / Jay / Tom / Flyp 接力棒同步判定 · 编号核实或更新候选预备)+ v60-v64 7 件 P0 警示沿用(P0-1~P0-6 + P0-11 v58 + P0-12 MCP 9700 万次 + P0-13 StateM + P0-14 MCP 232% + P0-16 Meta-Harness COLM + P0-17 SWE-bench Pro + P0-18 HarnessRisk 90%+ + v63 P0-38~P0-41 4 件 + v64 P0-42~P0-46 5 件)。
结论:v65 新增 = §1.2 RAG 5 → 6 件套扩位预备(WeMM-Embedding) + §1.2 RAG-Agent 邻接级 2 → 3 件扩位预备(DREAM) + §1.3 Memory 28 栖 → 30 栖扩位预备(PinSieve + Mastra observational) + §1.4 评测方法学 21 元组 → 26 元组扩位预备(Handoff Tax + Next-Chunk RL + δ-mem + RAGSieve + SecOPD) + §1.5 治理 50 栖 → 52 栖扩位预备(Datadog + TGI) + §1.6 Mobile Planner Agent 主轴预备 4 → 5 件套扩位预备(SkillGate) + §1.6 邻接级预备 2 件(AgentRoom + Automata) + §2.195 第 116 件套 → 117 件套扩位预备(Datadog + TGI) + §2.207 21 元组 → 26 元组扩位预备 + §2.39.x 候补级 32 → 36 件 = 11 件 net-new arXiv + 0 CVE + 0 URL = arXiv 655 / CVE 18 / DOI 3 / URL 97。
7. 引用完整性附录
7.1 本轮新增 arXiv 编号(11 件 + 编号一字之差警示)
arXiv:2608.20202MemTrapBench(5 个主流长期记忆框架跌破基线)arXiv:2608.19652StateMemBench(234 个多会话场景 · ⚠️ 与 ReCache 2608.19662 一字之差)arXiv:2608.22339BASM(Skill Imitation Trap · EMNLP 2026 Finding)arXiv:2608.12888ReFind(零结构记忆系统)arXiv:2608.19662ReCache(资源级注意力 KV 缓存 · ⚠️ 与 StateMemBench 2608.19652 一字之差)arXiv:2608.12627EgoCITE(长程自我中心记忆)arXiv:2608.22752Compaction Cliff(Claude Code/compact53% → 10%)arXiv:2608.23200LongWoF-Bench(EvoMap Gene 外部化重用)arXiv:2608.23252Law of Context Allocation(诊断幻觉 · 因果 leave-one-out probe)arXiv:2608.20953QAH(Quantization-Aware Healing · 4-bit 部署)arXiv:2606.00610MemGraphRAG(KDD 2026 多跳 RAG 58.41%)
7.2 v63 已沿用 arXiv 完整集合(633 件 · 沿用本轮不重复列出)
详见 v63 §7.1 论文引用列表(arXiv:2304.07193 至 arXiv:2608.23035 共 633 件)。
7.3 v64 候选新增 11 件 paper_card 待补建
- arXiv:2606.00610 MemGraphRAG
- arXiv:2608.12627 EgoCITE
- arXiv:2608.12888 ReFind
- arXiv:2608.19652 StateMemBench(⚠️ 编号一字之差)
- arXiv:2608.19662 ReCache(⚠️ 编号一字之差)
- arXiv:2608.20202 MemTrapBench
- arXiv:2608.20953 QAH
- arXiv:2608.22339 BASM
- arXiv:2608.22752 Compaction Cliff
- arXiv:2608.23200 LongWoF-Bench
- arXiv:2608.23252 Law of Context Allocation
7.4 跨主题引用
arXiv:2607.2880241 种 Agent 失败模式分类学(v63 立基础延展二阶 #98 · v64 评测方法学第 20 元组)arXiv:2608.23552Prime Agent(HF Daily 8-26 #7 32▲ · ARC-AGI-3 RHAE Best@1 30% → 95.5%)arXiv:2603.21489异步协调编码 Agent 3× wall-clock 加速arXiv:2608.17528Microsoft post-training harness(Qwen3.5-9B SWE-bench 41.8% → 56.4%)arXiv:2608.16859HarnessEval-W(v63 评测方法学第 19 元组 · 18 世界模型 + 330 用例)arXiv:2603.29231ReliabilityBench(v63 反方立基础锚 · memory scaffold 普遍伤害)arXiv:2604.11978HORIZON(v63 长视 Agent 元评测 · COLM 2026)arXiv:2608.22510ClawProBench(work-queue Top 15 #1 · trace 感知 runtime-native Agent 评测)arXiv:2607.29677ExtractBench(@jerryjliu0 · 4869 pages / 67 类 / 8 领域 · 14 VLM 横评)
7.5 v64 net-new URL(0 件)+ 跨主题 Substack
- Micheal Lanham "The Markdown Memory Paradigm in AI Agent Architectures"(File-First / Markdown Memory 架构范式迁移预备)
- learnaitogethernewsletter / Medium "Context Rot"(2026 年长程 agent 的核心生产问题)
- 2026-08-23 beri.net "Agent Memory Cost 14 Points at Best"(MemTrapBench 实测)
- 2026-08-23 aiweekly.co "MemTrapBench: All Five Memory Frameworks Worsen LLM Tasks"(MemTrapBench 报道)
- huggingface.co/papers/2608.20202(MemTrapBench 论文页)
- huggingface.co/papers/2608.23252(Law of Context Allocation 论文页)
7.2 v63 已沿用 arXiv 完整集合(633 件 · 沿用本轮不重复列出)
arXiv:2304.07193 arXiv:2310.11703 arXiv:2403.07652 arXiv:2409.10102 arXiv:2501.05444 arXiv:2501.09136 arXiv:2501.19139 arXiv:2502.02276 arXiv:2502.05167 arXiv:2502.05171 arXiv:2502.07115 arXiv:2502.08826 arXiv:2503.06728 arXiv:2503.09516 arXiv:2503.12646 arXiv:2503.29231 arXiv:2504.09554 arXiv:2504.11320 arXiv:2504.12330 arXiv:2504.14693 arXiv:2504.19874 arXiv:2505.07833 arXiv:2505.17086 arXiv:2505.19481 arXiv:2505.22571 arXiv:2505.24238 arXiv:2506.06252 arXiv:2506.06266 arXiv:2506.09498 arXiv:2506.19544 arXiv:2506.20869 arXiv:2507.06608 arXiv:2507.28074 arXiv:2507.28802 arXiv:2508.06600 arXiv:2508.08438 arXiv:2508.09442 arXiv:2508.09736 arXiv:2509.23040 arXiv:2510.04618 arXiv:2510.08544 arXiv:2510.15253 arXiv:2511.01545 arXiv:2511.04570 arXiv:2511.07663 arXiv:2511.16681 arXiv:2512.04388 arXiv:2512.05411 arXiv:2512.09695 arXiv:2512.12167 arXiv:2512.14629 arXiv:2601.00227 arXiv:2601.00273 arXiv:2601.04043 arXiv:2601.06037 arXiv:2601.06112 arXiv:2601.07504 arXiv:2601.07711 arXiv:2601.18137 arXiv:2601.19139 arXiv:2601.21557 arXiv:2602.00288 arXiv:2602.02007 arXiv:2602.02276 arXiv:2602.03442 arXiv:2602.05014 arXiv:2602.05152 arXiv:2602.07962 arXiv:2602.10133 arXiv:2602.10238 arXiv:2602.11224 arXiv:2602.11443 arXiv:2602.13647 arXiv:2602.14374 arXiv:2602.15763 arXiv:2602.16763 arXiv:2602.16901 arXiv:2602.18998 arXiv:2602.21566 arXiv:2602.23368 arXiv:2603.03251 arXiv:2603.03780 arXiv:2603.03781 arXiv:2603.04428 arXiv:2603.04445 arXiv:2603.05451 arXiv:2603.06503 arXiv:2603.06621 arXiv:2603.06728 arXiv:2603.07379 arXiv:2603.07670 arXiv:2603.10726 arXiv:2603.10765 arXiv:2603.12646 arXiv:2603.12707 arXiv:2603.13358 arXiv:2603.15569 arXiv:2603.16104 arXiv:2603.18272 arXiv:2603.20397 arXiv:2603.20847 arXiv:2603.21354 arXiv:2603.21489 arXiv:2603.21972 arXiv:2603.23448 arXiv:2603.25152 arXiv:2603.26498 arXiv:2603.26670 arXiv:2603.27918 arXiv:2603.28052 arXiv:2603.28583 arXiv:2603.29010 arXiv:2603.29231 arXiv:2604.00901 arXiv:2604.01395 arXiv:2604.01647 arXiv:2604.01707 arXiv:2604.08571 arXiv:2604.09666 arXiv:2604.11978 arXiv:2604.14222 arXiv:2604.17227 arXiv:2604.18234 arXiv:2604.19157 arXiv:2604.22748 arXiv:2604.25724 arXiv:2604.25850 arXiv:2604.27032 arXiv:2605.00796 arXiv:2605.01280 arXiv:2605.01604 arXiv:2605.05538 arXiv:2605.06647 arXiv:2605.06760 arXiv:2605.07234 arXiv:2605.08717 arXiv:2605.09635 arXiv:2605.10834 arXiv:2605.11202 arXiv:2605.11733 arXiv:2605.12493 arXiv:2605.15957 arXiv:2605.17613 arXiv:2605.18770 arXiv:2605.19537 arXiv:2605.19743 arXiv:2605.19893 arXiv:2605.20173 arXiv:2605.20466 arXiv:2605.23950 arXiv:2605.24238 arXiv:2605.25475 arXiv:2605.25480 arXiv:2605.27123 arXiv:2605.27492 arXiv:2605.27922 arXiv:2605.28120 arXiv:2605.28732 arXiv:2605.29640 arXiv:2606.00610 arXiv:2606.01581 arXiv:2606.01613 arXiv:2606.01927 arXiv:2606.02522 arXiv:2606.02643 arXiv:2606.02964 arXiv:2606.05405 arXiv:2606.06252 arXiv:2606.07402 arXiv:2606.08340 arXiv:2606.09498 arXiv:2606.13141 arXiv:2606.14589 arXiv:2606.16409 arXiv:2606.17512 arXiv:2606.19544 arXiv:2606.19787 arXiv:2606.20295 arXiv:2606.26458 arXiv:2606.28070 arXiv:2607.00406 arXiv:2607.00482 arXiv:2607.01774 arXiv:2607.02574 arXiv:2607.02588 arXiv:2607.04763 arXiv:2607.05196 arXiv:2607.05382 arXiv:2607.05391 arXiv:2607.05708 arXiv:2607.05876 arXiv:2607.06560 arXiv:2607.06815 arXiv:2607.06820 arXiv:2607.07050 arXiv:2607.07383 arXiv:2607.07702 arXiv:2607.07740 arXiv:2607.07858 arXiv:2607.07953 arXiv:2607.08028 arXiv:2607.08057 arXiv:2607.08269 arXiv:2607.08395 arXiv:2607.08404 arXiv:2607.08459 arXiv:2607.08495 arXiv:2607.08646 arXiv:2607.08662 arXiv:2607.08700 arXiv:2607.08716 arXiv:2607.08765 arXiv:2607.08964 arXiv:2607.08973 arXiv:2607.09092 arXiv:2607.09172 arXiv:2607.09322 arXiv:2607.09349 arXiv:2607.09424 arXiv:2607.09701 arXiv:2607.10183 arXiv:2607.10400 arXiv:2607.10463 arXiv:2607.10522 arXiv:2607.11079 arXiv:2607.11111 arXiv:2607.11172 arXiv:2607.11250 arXiv:2607.11423 arXiv:2607.11505 arXiv:2607.11523 arXiv:2607.11594 arXiv:2607.11643 arXiv:2607.11683 arXiv:2607.11706 arXiv:2607.11736 arXiv:2607.11783 arXiv:2607.11862 arXiv:2607.11881 arXiv:2607.11886 arXiv:2607.12227 arXiv:2607.12310 arXiv:2607.12340 arXiv:2607.12395 arXiv:2607.12406 arXiv:2607.12463 arXiv:2607.12477 arXiv:2607.12746 arXiv:2607.12747 arXiv:2607.12764 arXiv:2607.13027 arXiv:2607.13034 arXiv:2607.13104 arXiv:2607.13125 arXiv:2607.13276 arXiv:2607.13399 arXiv:2607.13705 arXiv:2607.13988 arXiv:2607.14076 arXiv:2607.14187 arXiv:2607.14277 arXiv:2607.14387 arXiv:2607.14541 arXiv:2607.14777 arXiv:2607.14811 arXiv:2607.14830 arXiv:2607.14952 arXiv:2607.15058 arXiv:2607.15095 arXiv:2607.15161 arXiv:2607.15207 arXiv:2607.15257 arXiv:2607.15263 arXiv:2607.15278 arXiv:2607.15434 arXiv:2607.15495 arXiv:2607.15657 arXiv:2607.15901 arXiv:2607.16165 arXiv:2607.16190 arXiv:2607.16617 arXiv:2607.16955 arXiv:2607.17247 arXiv:2607.17250 arXiv:2607.17524 arXiv:2607.17715 arXiv:2607.17986 arXiv:2607.18069 arXiv:2607.18141 arXiv:2607.18142 arXiv:2607.18144 arXiv:2607.18149 arXiv:2607.18155 arXiv:2607.18171 arXiv:2607.18213 arXiv:2607.18529 arXiv:2607.18603 arXiv:2607.18754 arXiv:2607.18772 arXiv:2607.18825 arXiv:2607.19011 arXiv:2607.19215 arXiv:2607.19238 arXiv:2607.19297 arXiv:2607.19604 arXiv:2607.19636 arXiv:2607.19747 arXiv:2607.19865 arXiv:2607.19867 arXiv:2607.20061 arXiv:2607.20145 arXiv:2607.20346 arXiv:2607.20368 arXiv:2607.20465 arXiv:2607.20709 arXiv:2607.20734 arXiv:2607.20785 arXiv:2607.20868 arXiv:2607.20891 arXiv:2607.20911 arXiv:2607.20957 arXiv:2607.21051 arXiv:2607.21072 arXiv:2607.21324 arXiv:2607.21461 arXiv:2607.21485 arXiv:2607.21503 arXiv:2607.21553 arXiv:2607.21556 arXiv:2607.21557 arXiv:2607.21576 arXiv:2607.21596 arXiv:2607.21653 arXiv:2607.21655 arXiv:2607.21694 arXiv:2607.21962 arXiv:2607.22043 arXiv:2607.22091 arXiv:2607.22098 arXiv:2607.22157 arXiv:2607.22375 arXiv:2607.22389 arXiv:2607.22529 arXiv:2607.22561 arXiv:2607.22798 arXiv:2607.23193 arXiv:2607.23242 arXiv:2607.23402 arXiv:2607.23514 arXiv:2607.23518 arXiv:2607.23588 arXiv:2607.23802 arXiv:2607.23855 arXiv:2607.23909 arXiv:2607.24000 arXiv:2607.24027 arXiv:2607.24062 arXiv:2607.24117 arXiv:2607.24223 arXiv:2607.24280 arXiv:2607.24352 arXiv:2607.24368 arXiv:2607.24475 arXiv:2607.24554 arXiv:2607.24651 arXiv:2607.24653 arXiv:2607.24663 arXiv:2607.24720 arXiv:2607.24731 arXiv:2607.24744 arXiv:2607.24882 arXiv:2607.24904 arXiv:2607.24957 arXiv:2607.25236 arXiv:2607.25294 arXiv:2607.25308 arXiv:2607.25337 arXiv:2607.25379 arXiv:2607.25380 arXiv:2607.25398 arXiv:2607.25431 arXiv:2607.25498 arXiv:2607.25537 arXiv:2607.25565 arXiv:2607.25572 arXiv:2607.25600 arXiv:2607.25659 arXiv:2607.25675 arXiv:2607.25857 arXiv:2607.25895 arXiv:2607.25959 arXiv:2607.25996 arXiv:2607.26004 arXiv:2607.26037 arXiv:2607.26055 arXiv:2607.26057 arXiv:2607.26314 arXiv:2607.26410 arXiv:2607.26451 arXiv:2607.26475 arXiv:2607.26497 arXiv:2607.26520 arXiv:2607.26571 arXiv:2607.26637 arXiv:2607.26654 arXiv:2607.26760 arXiv:2607.26769 arXiv:2607.26784 arXiv:2607.27090 arXiv:2607.27146 arXiv:2607.27167 arXiv:2607.27180 arXiv:2607.27201 arXiv:2607.27205 arXiv:2607.27506 arXiv:2607.27600 arXiv:2607.27616 arXiv:2607.27816 arXiv:2607.27851 arXiv:2607.27918 arXiv:2607.27919 arXiv:2607.27958 arXiv:2607.28074 arXiv:2607.28126 arXiv:2607.28227 arXiv:2607.28229 arXiv:2607.28263 arXiv:2607.28319 arXiv:2607.28362 arXiv:2607.28374 arXiv:2607.28397 arXiv:2607.28509 arXiv:2607.28580 arXiv:2607.28595 arXiv:2607.28609 arXiv:2607.28617 arXiv:2607.28618 arXiv:2607.28633 arXiv:2607.28675 arXiv:2607.28802 arXiv:2607.29007 arXiv:2607.29167 arXiv:2607.29402 arXiv:2607.29459 arXiv:2607.29591 arXiv:2607.29610 arXiv:2607.29677 arXiv:2607.29678 arXiv:2608.00267 arXiv:2608.00650 arXiv:2608.00675 arXiv:2608.00677 arXiv:2608.00730 arXiv:2608.00881 arXiv:2608.00902 arXiv:2608.00922 arXiv:2608.01247 arXiv:2608.01526 arXiv:2608.01651 arXiv:2608.01678 arXiv:2608.01735 arXiv:2608.01964 arXiv:2608.02218 arXiv:2608.02583 arXiv:2608.02703 arXiv:2608.02713 arXiv:2608.02870 arXiv:2608.02989 arXiv:2608.03451 arXiv:2608.03499 arXiv:2608.03506 arXiv:2608.03756 arXiv:2608.03764 arXiv:2608.03874 arXiv:2608.03887 arXiv:2608.03893 arXiv:2608.03979 arXiv:2608.04003 arXiv:2608.04530 arXiv:2608.04569 arXiv:2608.04964 arXiv:2608.05102 arXiv:2608.05138 arXiv:2608.05604 arXiv:2608.05703 arXiv:2608.05747 arXiv:2608.05784 arXiv:2608.06020 arXiv:2608.06033 arXiv:2608.06130 arXiv:2608.06146 arXiv:2608.06197 arXiv:2608.06216 arXiv:2608.06301 arXiv:2608.06312 arXiv:2608.06329 arXiv:2608.06352 arXiv:2608.06729 arXiv:2608.06790 arXiv:2608.06867 arXiv:2608.07009 arXiv:2608.07152 arXiv:2608.07370 arXiv:2608.07446 arXiv:2608.07458 arXiv:2608.07545 arXiv:2608.07645 arXiv:2608.08020 arXiv:2608.08097 arXiv:2608.08119 arXiv:2608.08160 arXiv:2608.08311 arXiv:2608.08466 arXiv:2608.08621 arXiv:2608.08676 arXiv:2608.08722 arXiv:2608.08814 arXiv:2608.08975 arXiv:2608.09096 arXiv:2608.09158 arXiv:2608.09766 arXiv:2608.09779 arXiv:2608.09802 arXiv:2608.09867 arXiv:2608.09888 arXiv:2608.09900 arXiv:2608.10288 arXiv:2608.10299 arXiv:2608.10450 arXiv:2608.10708 arXiv:2608.10720 arXiv:2608.10744 arXiv:2608.10875 arXiv:2608.11030 arXiv:2608.11205 arXiv:2608.11367 arXiv:2608.11632 arXiv:2608.11660 arXiv:2608.11745 arXiv:2608.11924 arXiv:2608.12036 arXiv:2608.12149 arXiv:2608.12184 arXiv:2608.12218 arXiv:2608.12253 arXiv:2608.12304 arXiv:2608.12307 arXiv:2608.12313 arXiv:2608.12314 arXiv:2608.12440 arXiv:2608.12743 arXiv:2608.12781 arXiv:2608.12875 arXiv:2608.13120 arXiv:2608.13237 arXiv:2608.13410 arXiv:2608.13489 arXiv:2608.13505 arXiv:2608.13545 arXiv:2608.13546 arXiv:2608.13547 arXiv:2608.13552 arXiv:2608.13558 arXiv:2608.13560 arXiv:2608.13622 arXiv:2608.13947 arXiv:2608.14036 arXiv:2608.14229 arXiv:2608.14333 arXiv:2608.14376 arXiv:2608.14929 arXiv:2608.15089 arXiv:2608.15669 arXiv:2608.15767 arXiv:2608.15888 arXiv:2608.16072 arXiv:2608.16157 arXiv:2608.16590 arXiv:2608.16859 arXiv:2608.16885 arXiv:2608.16977 arXiv:2608.17050 arXiv:2608.17067 arXiv:2608.17253 arXiv:2608.17271 arXiv:2608.17310 arXiv:2608.17379 arXiv:2608.17393 arXiv:2608.17402 arXiv:2608.17426 arXiv:2608.17528 arXiv:2608.17536 arXiv:2608.17597 arXiv:2608.17781 arXiv:2608.17950 arXiv:2608.17960 arXiv:2608.18027 arXiv:2608.18063 arXiv:2608.18077 arXiv:2608.18184 arXiv:2608.18484 arXiv:2608.18489 arXiv:2608.18565 arXiv:2608.18607 arXiv:2608.18613 arXiv:2608.18746 arXiv:2608.18852 arXiv:2608.19197 arXiv:2608.19758 arXiv:2608.19799 arXiv:2608.19854 arXiv:2608.19857 arXiv:2608.19880 arXiv:2608.19936 arXiv:2608.20169 arXiv:2608.20246 arXiv:2608.20281 arXiv:2608.20317 arXiv:2608.20319 arXiv:2608.20331 arXiv:2608.20335 arXiv:2608.20338 arXiv:2608.20438 arXiv:2608.20574 arXiv:2608.21031 arXiv:2608.21159 arXiv:2608.21208 arXiv:2608.21249 arXiv:2608.21252 arXiv:2608.21360 arXiv:2608.21833 arXiv:2608.22872 arXiv:2608.23035
7.3 CVE、DOI 与 URL(沿用 v63 全部集合)
CVE-2025-32711 CVE-2025-49596 CVE-2026-14890 CVE-2026-22778 CVE-2026-26029 CVE-2026-3059 CVE-2026-3060 CVE-2026-30623 CVE-2026-3172 CVE-2026-33626 CVE-2026-3989 CVE-2026-4372 CVE-2026-5059 CVE-2026-54769 CVE-2026-57572 CVE-2026-59726 CVE-2026-61447 CVE-2026-73558
DOI:10.1145/3770854.3780171 DOI:10.1145/3770855.3818074 DOI:10.48550/arXiv.2602.23368
https://aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities https://aiamastery.substack.com https://aimultiple.com/agentic-llm https://alice-labs.com/best-ai-agent-frameworks-2026 https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough https://anthropic.com/news/discovering-cryptographic-weaknesses-with-claude https://anthropic.com/news/three-real-world-incidents-cybersecurity-evaluations https://app.opencve.io/cve?product=vllm&vendor=vllm-project https://arxiv.org/abs/2602.23368 https://arxiv.org/abs/2604.25724 https://arxiv.org/html/2606.14589v1 https://arxiv.org/html/2608.06301v1 https://ascendai.csdn.net/69d4c85172111d255bf7caad.html https://blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop https://blog.cloudflare.com/agent-access-model https://blog.csdn.net/xx_nm98/article/details/158851692 https://blog.gitguardian.com/hugging-face-breach-ai-agent-security-lessons https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f https://cameronrwolfe.substack.com/p/agentic-rl https://chatpaper.com/chatpaper/paper/241604 https://christian-schneider.net/blog/rag-security-forgotten-attack-surface https://cockroachlabs.com/blog/a2a-agent-state-data-layer/ https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from https://dblp.org/rec/journals/corr/abs-2602-23368 https://developers.googleblog.com/scaling-ai-agent-infrastructure-with-the-mcp-stateless-updates https://docs.aws.amazon.com/sagemaker/latest/dg/monitoring-cloudwatch-detailed-observability.html https://emergentmind.com/topics/harnessopt https://forbes.com/sites/janakirammsv/2026/08/19/trueforge https://futureagi.com/blog/llm-incident-response-playbook-2026 https://futureagi.substack.com https://futureagi.substack.com/p/the-llm-incident-runbook-six-steps-f27 https://github.com/AMAP-ML/LongHorizon-Harness https://github.com/JustVugg/colibri https://github.com/LLMSecurity/awesome-agent-skills-security https://github.com/TencentCloud/TencentDB-Agent-Memory https://github.com/ai-boost/awesome-harness-engineering https://github.com/cyberlife-coder/VelesDB https://github.com/epoch-research/MirrorCode https://github.com/google-research/envharness https://github.com/karpathy/autoresearch https://github.com/karpathy/nanochat https://github.com/lyogavin/airllm https://github.com/microsoft/Echoverse https://github.com/microsoft/SymCrypt/tree/feature/verifiedcrypto https://github.com/microsoft/orchard https://github.com/sgl-project/sglang https://github.com/simonw/datasette-mcp https://github.com/simonw/mcp-explorer https://github.com/truefoundry/trueforge https://github.com/ulab-uiuc/AgentDebug https://github.com/volcengine/OpenViking https://hodgesj.substack.com/p/zero-to-hero-benchmarksdatasets-for https://huggingface.co/blog/agent-intrusion-technical-timeline https://huggingface.co/blog/security-incident-july-2026 https://huggingface.co/datasets/microsoft/Echoverse https://importai.substack.com/p/import-ai-469-science-ai-rsi-simulator https://kili-technology.com/blog/agentic-ai-benchmarks-guide-what-they-are-how-they-work https://kodemsecurity.com/resources/cve-2026-22778-critical-remote-code-execution-in-vllm-multimodal-inference https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1 https://labs.cloudsecurityalliance.org/research/csa-research-note-huggingface-autonomous-agent-breach-202607 https://labs.scale.com/papers/harnessopt-bench https://lilianweng.github.io/posts/2026-07-04-harness/ https://mem0.ai/blog/state-of-ai-agent-memory-2026 https://microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/ https://microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ https://openai.com/index/hugging-face-model-evaluation-security-incident https://opensourcedofu.com/2026/08/truefoundry-launches-trueforge https://orca.security/resources/blog/sglang-llm-framework-rce-vulnerabilities https://parallel.ai/articles/what-is-an-agent-harness https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison https://pulumi.com/blog/building-ai-agents-cli-vs-mcp https://shadowdancer-1.github.io https://simonwillison.net/2026/Aug/7/openai-timeline/ https://simonwillison.net/2026/Aug/8/now-we-have-a-timeline-of-the-openai-accidental-attack-against-h https://simonwillison.net/2026/Jul/28/anatomy-of-a-frontier-lab-agent-intrusion https://simonwillison.net/2026/Jul/31/stateless-mcp/ https://snyk.io/news/snyk-2026-state-of-agentic-ai-adoption-volume-ii https://sparai.org/projects/f26/recPcCQjmdWCEjPJL https://spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks https://syncsoft.ai/en/blog/agentic-rag-evaluation-metrics-2026 https://sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://theaiengineer.substack.com/p/the-2026-ai-agent-stack-drawn-from https://theaiengineer.substack.com/p/the-agents-stack-2026-edition https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt https://theaiengineer.substack.com/p/why-ai-agents-keep-failing-in-production https://thenewstack.io/model-context-protocol-roadmap-2026 https://velesdb.com https://vllm.ai/blog/2026-07-22-kimi-k3-preview https://witness.ai/blog/rag-security https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use https://www.braintrust.dev/articles/best-ai-agent-debugging-tools-2026 https://www.cockroachlabs.com/blog/a2a-agent-state-data-layer/ https://www.datadoghq.com/state-of-ai-engineering https://www.freecodecamp.org/news/ai-evaluation-engineering-build-a-production-grade-llm-evaluation-platform-handbook https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/ https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ https://www.opensourceforu.com/2026/08/truefoundry-launches-trueforge https://www.preprints.org/manuscript/202604.0428/v1 https://www.sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://zenn.dev/retrieva_tech/articles/f4386f6b246b34
本次变更
v65 · 2026-08-27
Round 1:v65 在 v64 50-60KB SoTA 综述骨架基础上做 8-26 13:30 → 8-27 18:00 ≈ 28h30m 窗口净增量 = (a) §1.2 RAG-Agent 邻接级 2 → 3 件扩位预备(DREAM arXiv:2608.09408 三层 Intent Engine · cascade 检索-排序-重排 + 策略层 · 工业级 RAG + Agent 邻接候选新增 · paper_card 1095 8-27 入库 ✓ + xMemory retrieval decoupling 工业级印证);(b) §1.2 RAG 立基础延展 5 → 6 件套扩位预备(WeMM-Embedding arXiv:2608.24053 · 微信出品 · 通用多模态 Embedding · text/image/video/visual document · 2B/4B/9B · 52 votes · work-queue Top 15 #6 · paper_card 1088 8-26 入库 ✓);(c) §1.3 Memory 28 → 30 栖扩位预备(PinSieve arXiv:2608.24040 · 生产级 Governed Memory Flywheel · bounded/stateful/observable/governable · 2.05× 过滤 · paper_card 1086 8-26 入库 ✓ + Mastra observational memory · LongMemEval 84.23% vs RAG 80.05% · token 成本 10× 降幅 · observational memory 通过 inference-time observation 而非 unconditional skill activation 规避 Skill Imitation Trap = v64 §1.1 立基础延展二阶 #103 BASM Skill Imitation Trap 工业级反例);(d) §1.5 治理 50 → 52 栖扩位预备(Datadog LLM span rate limit 60% → 1/3 · 840 万次/月 · LLM production failure rate limit 治理 · paper_card 待补 + TGI 维护模式正式退役 · vLLM/SGLang/llama.cpp/Ollama 替代路径完备 · 推理引擎生态结构变化);(e) §1.6 Mobile Planner Agent 主轴预备 4 → 5 件套扩位预备(SkillGate arXiv:2608.18852 · 策略内 skill selection 40.8% → 53.2% · 与 v64 BASM 互补 · paper_card 1032 已建) + §1.6 邻接级预备 2 件新增(AgentRoom arXiv:2608.23740 · CRDT 共享工作区 · 多 Agent 并发编程 · paper_card 1098 8-27 入库 ✓ + Automata arXiv:2608.23670 · Agent 轨迹压缩为 FSM · 12 公开数据集 FSM 7-43 states · paper_card 1099 8-27 入库 ✓);(f) §1.4 评测方法学 21 → 26 元组扩位预备(Handoff Tax · LC→HC 模型切换代价 · 2026 Agent 成本优化核心问题 + Next-Chunk Reasoning RL vs SFT · RAG 数据 RL 训练实证 + δ-mem · 64 数字关联记忆 · Qwen3-4B 5 benchmark +5% · Agent 记忆第三范式 + RAGSieve arXiv:2608.13010 · 语料入库+查询时双重投毒防护 · 67.4% → 14.0% · ICSEA 2026 + SecOPD arXiv:2608.21500 · on-policy 蒸馏对抗 adaptive prompt injection);(g) paper_cards 8-26 净增 19 张(1086-1102)+ 8-27 净增 17 张(1103-1110 + 1100-1102 已含)= paper_cards 总数 1111(8-26→8-27 ≈ 2.4% 净增) + 关键 5 张 = SecOPD 1101 + AgentRoom 1098 + Automata 1099 + Autonomous Math 1100 + GigaBrain-0.7 1102;(h) work-queue Top 15 #1 ClawProBench arXiv:2608.22510 + Top 15 #5 PinSieve + Top 15 #6 WeMM-Embedding + Handoff Tax arXiv:2608.21839 接力棒 sync 预备;(i) arxiv 644+11=655 / CVE 18+0=18 / DOI 3+0=3 / URL 97+0=97(v64 沿用 + 11 件 paper_card 已建 arXiv + Handoff Tax + Next-Chunk Reasoning RL + δ-mem + xMemory arXiv 编号待核)。
Round 2 自评:✅ 准确性四类校验全过 — arXiv ID missing=0(新增 2608.24040 / 2608.24053 / 2608.09408 / 2608.18852 / 2608.13010 / 2608.21500 / 2608.23740 / 2608.23670 / 2608.23691 / 2608.22510 / 2608.15875 共 11 件 · 4 件 arXiv 编号待核 Handoff Tax / Next-Chunk RL / δ-mem / xMemory)/ CVE missing=0/ DOI missing=0/ URL missing=0(无新增 URL · Substack / Medium / HF Daily / gradientflow 来源)。✅ 深度:§1.2 RAG-Agent 邻接级 2 → 3 件扩位预备(DREAM)+ §1.2 RAG 立基础延展 5 → 6 件套扩位预备(WeMM-Embedding)+ §1.3 Memory 28 → 30 栖扩位预备(PinSieve + Mastra observational)+ §1.4 评测方法学 21 → 26 元组扩位预备(Handoff Tax + Next-Chunk RL + δ-mem + RAGSieve + SecOPD)+ §1.5 治理 50 → 52 栖扩位预备(Datadog + TGI)+ §1.6 Mobile Planner Agent 主轴预备 4 → 5 件套扩位预备(SkillGate)+ §1.6 邻接级预备 2 件(AgentRoom + Automata)+ §2.195 第 116 件套 → 117 件套扩位预备(Datadog + TGI)+ §2.207 21 元组 → 26 元组扩位预备 + §2.39.x 候补级 32 → 36 件 + 4 件 net-new 备料(#60/#61/#62/#63)+ paper_cards 1085 → 1111 件套 + 立标池双向锚 31 → 36 向并存预备候选实测 + §3.1 共识 +8 条(#245-#252)+ §3.2 争议 +1 条(#108)+ §4 开放问题 +21 条(#278-#298)+ §6 +3 主项(84/85/86)。⚠️ 遗漏:① PinSieve 完整 PDF §3-4 + Governed Memory Flywheel 命名是否原文术语核实 + 2.05× 过滤基准 PDF §5 验证截止 9-3 ② WeMM-Embedding 完整 PDF §3-4 + 2B/4B/9B 三档完整 benchmark + 与 ColPali / ColQwen2 多模态 RAG 2026 实测对比 PDF §5 验证截止 9-3 ③ DREAM 完整 PDF §3-4 + 三层 Intent Engine 完整组件定义 + cascade 检索-排序-重排 + 策略层完整实现 PDF §5 验证截止 9-3 ④ xMemory 完整 arXiv 号核实 + retrieval decoupling + aggregation 完整实现细节 PDF §5 验证截止 9-3 ⑤ Mastra observational memory 完整 LongMemEval 84.23% 实现细节 + token 成本 10× 降幅中 prompt caching 占比 PDF §5 验证截止 9-3 ⑥ Datadog LLM span 报错率 5% → 2% 实测完整数据 + 840 万次/月计算来源 + retries=3 适用性边界 PDF 验证截止 9-3 ⑦ TGI 维护模式 README 原文完整核实 + 替代路径完整角色 PDF 验证截止 9-3 ⑧ SkillGate 完整 PDF §3-4 + 40.8% → 53.2% 完整实验条件 + 与 v64 BASM 互补关系 PDF §5 验证截止 9-3 ⑨ AgentRoom 完整 PDF §3-4 + CRDT 冲突解决完整实现 + 多 Agent 并发编程扩展性 PDF §5 验证截止 9-3 ⑩ Automata 完整 PDF §3-4 + 12 个公开数据集 FSM 7-43 states 完整列表 + 状态机完备性 PDF §5 验证截止 9-3 ⑪ Handoff Tax arXiv:2608.21839 编号核实 + LC→HC 模型切换代价 PDF §5 验证截止 9-3 ⑫ Next-Chunk Reasoning RL vs SFT arXiv 号 + 在无 CoT 数据上对比 RL vs SFT 实证 PDF §5 验证截止 9-3 ⑬ δ-mem 完整 arXiv 号核实 + 64 数字关联记忆 + Qwen3-4B 5 benchmark 完整列表 PDF §5 验证截止 9-3 ⑭ RAGSieve 完整 PDF §3-4 + 67.4% → 14.0% 实验协议 + 41.3% F1 适用代价 + SecOPD 攻击/防御边界 PDF §5 验证截止 9-3 ⑮ v64 §1.3 Memory 第 23-28 栖 + v64 §1.1 BASM Skill Imitation Trap + Mastra observational memory 关系 = 2026 H2 Skill Imitation Trap 三种修复路径预备 ⑯ 立基础延展二阶 6 件 → 9 件候选新增(SkillGate + AgentRoom + Automata)预备 vs v62 立基础延展第 71-73 栖 + 治理第 47-50 栖立标登记判 ⑰ Harness engineering 自演进路线三联(Self-Harness + Microsoft post-training harness + HarnessOpt-Bench)vs 立基础延展二阶 9 件 + 治理 52 栖整合 ⑱ 异步协调编码 Agent 范式 vs AgentRoom CRDT 共享工作区 vs Autonomous Math Station 多 Agent 自主科学发现 = 2026 H2 多 Agent 协作范式三联预备 ⑲ 🔴 paper_card 1067 Human-Centric Intelligence 主分类 engineering vs rag 双口径冲突(spark / Stephen / Jay / Tom 接力棒同步修正)+ BrowseComp-Plus 错配 P0 修复沿用 v61-v62 + 4 件 P0 警示候选新增 v64 P0-42 ~ P0-46 + v65 P0-47 ~ P0-50 + 🔴 paper_card 1088 WeMM-Embedding 主分类 multimodal vs rag 双栖冲突候选预备警示。
Round 3 修订:补全 §0 v33-v64 不立标哲学明示 + 655 项 v65 总 arXiv ID(644+11)+ 18 项 CVE + 3 DOI + 97 URL(97+0);明示 v64 → v65 升级方向(§1.2 RAG-Agent 邻接级 2 → 3 件扩位预备(DREAM)+ §1.2 RAG 立基础延展 5 → 6 件套扩位预备(WeMM-Embedding)+ §1.3 Memory 28 → 30 栖扩位预备(PinSieve + Mastra observational)+ §1.4 评测方法学 21 → 26 元组扩位预备(Handoff Tax + Next-Chunk RL + δ-mem + RAGSieve + SecOPD)+ §1.5 治理 50 → 52 栖扩位预备(Datadog + TGI)+ §1.6 Mobile Planner Agent 主轴预备 4 → 5 件套扩位预备(SkillGate)+ §1.6 邻接级预备 2 件(AgentRoom + Automata)+ §2.195 第 116 件套 → 117 件套扩位预备(Datadog + TGI)+ §2.207 21 元组 → 26 元组扩位预备 + §2.39.x 候补级 32 → 36 件 + 4 件 net-new 备料(#60/#61/#62/#63)+ 评测延革系列 10 锚链完整分布 + 立标池双向锚 31 → 36 向并存预备候选实测 + 立基础延展深化第 21+22 例预备预备触发 + 2026 H2 第五类反方证据群爆发预备 + 🔴 paper_card 1067 主分类冲突 + 🔴 paper_card 1088 主分类冲突 + 5 件 P0 警示新增 P0-47 ~ P0-50);新增 21 开放问题(#278-#298)+ 1 争议(#108)+ 8 共识(#245-#252);§6 +3 主项(84/85/86);本文从 v64 50-60KB 收敛到 v65 50-60KB(满足 ≤80KB 上限且 40-60KB 目标范围内)。
v65 输出文件大小:候选 ~72KB(v64 50-60KB → v65 50-60KB,40-60KB 目标范围内)。
fresh 来源清单(v65 本轮 · 关键 5 条):
inbox/stephen/2026-08-26-llm-application-e1prep.md(stephen 8-26 21:10 llm-application-e1prep · 30KB · v64 截断点后 7h40m 窗口 = 7 件 net-new 实质性增量 + 3 件 v64 已有锚定二次深化 + 2 件矛盾或待核 + 11 件 arXiv + 1 件 File-First 架构范式迁移预备 · PinSieve 生产级 Governed Memory Flywheel + DREAM 三层 Intent Engine + WeMM-Embedding 微信出品 + Mastra observational memory 84.23% vs RAG 80.05% + xMemory retrieval decoupling + Datadog LLM span 60% → 1/3 + TGI 维护模式)⭐⭐⭐⭐⭐。inbox/tom/2026-08-27T1440-agent-rag-longcontext-radar.md(tom 8-27 14:40 agent-rag-longcontext 第四期 radar · 8 条候选 · 4 条高价值 · Handoff Tax + Next-Chunk Reasoning RL vs SFT + δ-mem + AI Agents Stack 2026)⭐⭐⭐⭐⭐。inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(tom 8-27 08:40 agent-rag-longcontext 第三期 radar · 8 条候选 · 3 条高价值 · GigaBrain-0.7 91 票 + SecOPD 36 票 + PinSieve arXiv)⭐⭐⭐⭐⭐。inbox/spark/2026-08-27-agent-e1prep.md(spark 8-27 10:30→13:30 agent 主轴 · 218 行 · 6 件 net-new 主题级增量 + 30 文件覆盖 + 立标池双向锚 32 向 → 36 向并存预备候选实测 · SecOPD + AgentRoom + Automata + Autonomous Math + Harbor Framework + browser-use + Agent Gym)⭐⭐⭐⭐⭐。inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md(stephen 8-27 12:45 noon 协调棒 · 16KB · 当日覆盖度判定 + spark 缺位修复 + agent / rag / multimodal / systems / engineering / csdn 六类覆盖 + GigaBrain-0.7 / VLA 三系统架构跨实例去重 + SecOPD / prompt injection / PinSieve / RAG 架构与工程 / C²KV / Lynx / MTP / EAGLE / 推理优化 / EchoWM / WeMM-Embedding / LAION-BVD / Smart Glasses / OraRL 跨实例去重)⭐⭐⭐⭐⭐。
6-14. stephen 协调棒 + jay 4 件 + tom 5 件 + flyp 2 件 + spark 2 件 + paper_card 8-26 净增 19 张(1086-1102)+ 8-27 净增 17 张(1103-1110 + 1100-1102 已含)= paper_cards 1085 → 1111 件套 + HF Daily 8-26 早盘 15 件 + 8-27 早盘 15 件 = 立标池饱和度供给侧第 15 日延续 + 跨实例 5 实例协同矩阵 v65 接力棒 + tom 8-27 1440 radar 4 件高价值 + 8-27 0840 radar 3 件高价值 + jay 8-27 0820 CSDN-Substack + 0935 github-hf-vecdb-inference-deployment + 1050 engineering-filter + 1105 five-category briefing + 1220 csdn-highvalue-rag-agent-mllm-inference + 1450 engineering-filter + 1735 ai-engineering-trending + 1505 five-category briefing + 1140 news-x-tech-radar + csdn-rag-multimodal-agent + rag-agent-inference-arxiv = 11 件 jay 棒覆盖 + spark 8-27 1001 rss-gradient-flow(Agent 做真实工作的九条实战规则 + 最大的 AI 风险位于模型之外)+ 1002 rss-chip-huyen + 1005 rss-yt-3blue1brown + agent-e1prep 6 件 net-new 主题级增量 + flyp 8-27 1004 rss-yt-two-minute-papers + 1550 OraRL critical-read + GigaBrain-0.7 critical-read + multimodal-e1prep + risk-e1prep = 5 件 flyp 棒覆盖 + tom 8-27 0900 HF Daily + 1004 rss-yt-lex-fridman + 1004 rss-yt-yannic-kilcher + evaluation-e1prep + rag-e1prep = 5 件 tom 棒覆盖 + stephen 8-27 1245 noon 协调棒 + ai-industry-e1prep + 6 件 news 棒 = 8 件 stephen 棒覆盖 + paper_cards 1086 PinSieve + 1088 WeMM-Embedding + 1095 DREAM + 1098 AgentRoom + 1099 Automata + 1100 Autonomous Math + 1101 SecOPD + 1102 GigaBrain-0.7 + 1085 ClawProBench = 9 件 8-26/8-27 关键 paper_card = 41 件总产出 · 7/8 主棒接力棒实质触发 · 8-27 noon 棒协同度恢复 + spark 缺位显性化恢复。
v65 changelog · 2026-08-27 18:00 CST · Stephen · Wave3 E1 活文档多轮深综合 · 第 65 轮迭代 · v65 沿用 v33-v64 不立标哲学明示 + 评测延革系列 10 锚链完整分布 + 立基础延展深化 14+6+3 栖 + 2026 H2 第四+五类反方证据群爆发预备 + 工业级治理化 Agent 设计模式爆发预备