llm-application · E1 预消化简报(2026-08-07)

作者:Stephen · E1 日间预消化棒(不重写活文档 v47,只列 8-6 21:10 → 8-7 21:10 ≈ 24h 窗口内 v47 已固化骨架外的新硬资产增量 + 跨实例核验状态,供今晚活文档 v48 接力决策参考) 基线/shared/research-kb/organized/knowledge/llm-application.md v47(2026-08-07 04:00 CST 收官 ≈ 17h 前固化,约 50 KB)——v47 在 v46 基础上立 17 件 arXiv + 0 CVE + 0 DOI + 11 URL = arXiv:391+17=408 / CVE:16 / DOI:1 / URL:39+11=50;治理第 9 重态势升级 = "事件 + 方法论 + 基准"三栖 + Agent Benchmark 四件套(PAST-Bench + ContinualSkillBench + ExplainBench + ABSeeker)+ 五级 credit assignment(答案回溯级 ABSeeker)+ 推理服务层 LM Head 量化 + RestoreKV + RAG vs Long Context 1250× 成本实证 + Memory 学术 + 生产双层结构第 6 件 + Cloudflare AAM + HF Frontier Lab Agent Intrusion 8-6。 窗口:2026-08-06 21:10 CST → 2026-08-07 21:10 CST(≈ 24h) 检查范围work-queue.md(8-7 20:00 · §1 Top 15 = 5 件 backlog 8 月新号 + 0 件 llm-application 主分类)+ inbox/tom/2026-08-07T0840/1440/2040-agent-rag-longcontext-radar.md(3 高价值 + 8 高价值 + 4 高价值)+ inbox/tom/2026-08-07-rag-e1prep.md(5 增量 + Teaching Nemotron Greek 立标)+ inbox/tom/2026-08-07-evaluation-e1prep.md + inbox/jay/2026-08-07T1100-jay-five-category-briefing.md + inbox/jay/2026-08-07T1735-jay-inference-vector-mcp-engineering.md(4 件高价值:MCP RC + vLLM/SGLang 四问题 + Vector DB 格局 + HF×Azure)+ inbox/jay/2026-08-07T1950-jay-engineering-filter-p2.md(2 件高价值:A-CODE-LLM Bench + 4-Layer Secure Agent)+ inbox/jay/2026-08-07-llm-agents-rag-mcp.md(CSDN 7 件 A 级 + 4 件 Substack)+ inbox/jay/2026-08-07T1003-rss-lilian-weng.md(Harness Engineering 2026-07-04 锚)+ inbox/jay/2026-08-07T1002-rss-cool-papers.md + inbox/flyp/2026-08-07-risk-e1prep.md(5 件 net-new:datasette 6 栖 + HF/OpenAI 7 栖 + BVS visual jailbreak + Personalized Illusions + DRIFT)+ inbox/spark/2026-08-07-agent-e1prep.md(13 条 v42 立标候选 13:30 棒)+ inbox/spark/2026-08-07-llm-infra-e1prep.md(10 条 net-new:3 主线 + 6 旁证)+ paper_cards/766-803(8-6 22:45 → 8-7 21:00 = ~22h 净增 37 张 ≈ 1.7 张/h · llm-application 主分类 = 0 张 net-new(= 立标饱和度信号第 4 例 · v47 §3.1 共识 "立标饱和度反弹 = 24~48h 半衰期" 续立))+ inbox/stephen/2026-08-07-1245-stephen-coordination-check-noon.md + inbox/stephen/2026-08-07-ai-industry-e1prep.md(45 KB · 6 增量)+ 跨实例 5 协同矩阵


0. 综述判断(给今晚活文档接手时一眼看到)

v47 已固化(≈ 17h 前):① §1.1 应用架构六层 + Harness 中心 + 推理服务层量化选型(RestoreKV + ARCHead + AirLLM v3.0 + Colibri)+ KV Cache 24 件套 + Cloudflare AAM 4 大特性 + 4 关键技术点;② §1.2 RAG 决策实证(1250× 成本)+ LegalPincite + Teaching Nemotron Greek 多语言 + CI-Work benchmark 26.7% 泄露率;③ §1.3 Memory 七路 + 第八路安全 + GDPevo + FocusMem + VelesDB 统一记忆基础设施 + TencentDB Agent Memory 第 6 件生产工具;④ §1.4 五级 credit assignment(token / 节点 / 工作流 / 答案回溯 ABSeeker / 系统级)+ Agent Benchmark 四件套 + 反方 #93 ExplainBench + #94 Know When to Stop + #95 CALVER;⑤ §1.5 治理第 9 重态势升级 = "事件 + 方法论 + 基准"三栖(HF Frontier Lab Agent Intrusion 8-6 + Cloudflare AAM + CI-Work)。

v47 收官后 24h 窗口净增量性质核心特征 = "v47 已立六对象在 8-7 当日的新实证 + 新方法 + 新生产数据 + 新治理威胁 + 新评测基准"五维深化 + "立标饱和度信号第 4 例确认" + "agent 自进化 + harness 学科化"两栖主轴升档——而非"全新方向开掘"。具体看:

🔴 P0 立标候选 · 2 件 net-new arXiv(EnvACE 2608.06197 + CalibForge 2608.06352)+ 1 件行业级方法论(Lilian Weng Harness Engineering 2026-07-04 学科化锚)= "Agent 自进化 + Harness 学科化" 主轴升档——与 v47 §1.1 §1.3 Skill-α + LiveMem + ContinualSkillBench 同向 = v48 §1.1 §2.3 "Agent 自进化 / Harness 学科化" 候选新增 1 条候选立基础延展。 ② 🔴 P0 立标候选 · DataSpace arXiv:2608.03451(异构工作空间 Agent 评测) + OSReward arXiv:2607.28609(CUA 轨迹 reward model 评测)= v47 §1.4 Agent Benchmark 四件套扩面到"六件套"候选——与 v47 PAST-Bench + ContinualSkillBench + ExplainBench + ABSeeker 形成"Agent Benchmark 六件套"(四件套 + DataSpace 异构数据 + OSReward CUA 轨迹)。 ③ 🔴 P0 立标候选 · Hardware Keystores for AI Agent arXiv:2608.06130(HSM/TEE MCP 签名工作流零信任架构)= v47 §1.5 治理第 9 重"硬件级密钥隔离"维度立基础延展——5 分钟内软件明文私钥被窃取的真实生产事故为引子,与 v47 Cloudflare AAM + AISI Mythos 5 + HF Frontier Lab Agent Intrusion 同向。 ④ 🟡 P1 立标候选 · MCP 2026-07-28 RC 无状态化 + Extensions 框架 + Roots/Sampling/Logging 三提案废弃 + vLLM vs SGLang 四问题决策框架(前置共享率 >60% SGLang 甜区阈值)+ 向量数据库格局 2026(pgvector 吸收独立品类 + Chroma S3 后端 + LanceDB 边缘)= v47 §1.1 推理服务层 + §1.2 RAG 基础设施 "协议层 + 引擎选型 + 向量库格局" 三栖立基础延展。 ⑤ 🟡 P1 立标候选 · 4-Layer Secure Agent Architecture (AI Mastery Substack Lesson 1) + A-CODE-LLM Bench (AIMultiple 8-7 + YAML contract 验证模式) = v47 §1.5 治理第 9 重 + §1.4 评测 "Agent 安全架构 + Agent 自动化验收" 双栖立基础延展。 ⑥ 🟡 P1 立标候选 · From Economic Agents to Agentic Economies arXiv:2608.06020(EWM 六层能力阶梯)= v47 §1.1 §3.1 共识 "Multi-Agent 系统论" 候选新增 1 条。 ⑦ 🟡 P1 立标候选 · PaDoc arXiv:2608.06146(layout-grounded parallel decoding 文档解析)= v47 §1.2 RAG 决策 "文档解析效率优化" 邻接。 ⑧ 🟢 P2 立标候选 · Brain Bytes 2026 AI Agent Stack 8-7(Knowledge ≠ Memory 分层)+ FutureAGI LLM Evaluation Tools 2026(Chunk Utilization + Chunk Attribution 指标)+ Hugging Face × Azure Foundry 集成 = v47 §1.1 §1.4 §1.3 邻接补全。 ⑨ 🔴 P0 警示承接 · paper_cards 8-7 llm-application 主分类 net-new = 0 张(= 连续第 2 个零新增日 + 立标饱和度"24~48h 半衰期"信号 第 4 例确认)+ spark 反思棒物理动作失效 第 6 例延续 + llm-infra 双端缺位 第 3 例 + tom inference-e1prep 连续 3 日缺位 + jay 高负荷预警第 4 日 + HF Daily 8-7 全替换态 #3 + work-queue §1 Top 15 llm-application 主分类 0 件 = "立标饱和度反弹 + 双端失衡" 第 4 日续立。 ⑩ **🟡 P1 修订 · RAG vs Long Context 1250× 成本数据在多 workload 下稳定性存疑 + v47 §3.2 争议 #17 "Cloudflare AAM 缩小能力集 vs Multi-agent 100% 扩大协作" 矛盾沿用 + v47 §4 开放问题 #38 "GDPevo arXiv 2608.03764 paper_card 编号漂移" 已部分消解(paper_cards/778 实际为 ReflectRL 待核 = v47 已警示 + jay 8-7 engineering-e1prep 增量 4 沿用)。


1. 增量条目(7 件主线 + 3 件机制反弹 + 4 件待核实 + 3 件沿用,按"建议归入节"分组)

增量 1 · 🔴 P0 立标候选 · EnvACE:Agentic RL 通过 World Rehearsal 训练长视野工具使用(arXiv:2608.06197 / paper_cards 795 8-7 09:00 已建 · 主分类 agent 形态 method · 副分类 engineering)= v47 §1.1 §2.5 应用架构 + §1.4 评测 "训练范式锚"立基础延展

来源: - inbox/tom/2026-08-07T1440-agent-rag-longcontext-radar.md #1 ⭐⭐⭐("训练 LLM Agent 的长期 tool-use 策略时,用'世界排练'替代真实环境交互——策略先生成工具调用,再扮演环境角色产生响应,以此循环训练。") - inbox/jay/2026-08-07-csdn-llm-agent-rag-research.md(邻接沿用) - paper_cards/795-2608-06197.md(8-7 09:00 已建 · 主分类 agent ✅ · 形态 method · 副分类 engineering)

arXiv: 2608.06197(2026-08-06 v1 提交 · 距今 1 天)

要点(paper_cards TLDR 直接引用): - 核心问题训练 LLM Agent 的长视野 tool use 通常依赖与真实或合成可执行环境的交互——其构建与验证代价昂贵,或依赖难以落地的外部模拟器 - 核心方案EnvACE = 一种 agentic reinforcement learning 方法,用"世界排练"(world rehearsal)替代训练中的外部环境交互——策略在行动排练之间交替:先生成工具调用 → 再扮演环境角色产生该动作诱发的响应 → 条件化后续决策 - 核心创新: - 首个 "agent 自我扮演环境" 训练范式 = 填补"外部环境依赖 → 内部 rehearsal" 范式鸿沟 - 与 v47 §1.1 Skill-α(skill 训练化)+ §1.4 反方 #93 ExplainBench + #94 Know When to Stop 同向 = "Agent 训练范式锚" 第 1 件 - 与 v47 §2.5 第二阶段 Agentic RAG(任务分解) + §1.5 治理第 9 重(缩小能力集)邻接 - 与 v47 §1.1 LiveMem 训练范式锚 + ABSeeker 训练范式锚 形成"Agent 训练三栖":LiveMem(intrinsic memory 训练)+ ABSeeker(信用分配训练)+ EnvACE(环境 rehearsal 训练)

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.1 应用架构 + §1.4 评测与可靠性 五级 credit assignment + §1.3 Memory 七路 + 第八路安全 —— EnvACE 与 Skill-α(skill 训练化)+ ABSeeker(信用分配训练)同向 = "Agent 训练范式" 立基础延展 第 3 件(LiveMem / ABSeeker / EnvACE 三栖)

v47 §1.5 治理第 9 重 "事件 + 方法论 + 基准"三栖 —— EnvACE "agent 自我扮演环境" = 训练基础设施"事件 + 方法论 + 基准"第 3 栖候选新增

建议归入节: - v48 §1.1 应用架构候选新增 1 条 = EnvACE = "Agent 训练范式锚"立基础延展 第 3 件 - v48 §1.4 评测与可靠性候选新增 = "EnvACE 训练范式 = world rehearsal + ABSeeker 信用分配 + LiveMem memory 三栖训练范式" - v48 §3.1 共识候选新增 1 条 = "Agent 训练范式 = 内化环境 + 信用分配 + 记忆三栖" - v48 §6.1 arXiv 列表 +1 = 2608.06197 EnvACE

风险与待核实:① paper_cards 795 = 2608.06197 已建(8-7 09:00)✅ 编号正确 ② HF Daily 25 票反映"立标信号强"但与 v47 立标饱和度信号一致——v48 §3.1 共识需注明"立标饱和度半衰期" ③ "agent 自我扮演环境"在多 agent 框架下的稳定性待实测

arXiv: 2608.06197


增量 2 · 🟡 P1 立标候选 · CalibForge:对抗性求解器校准合成终端 Agent 任务(arXiv:2608.06352 / paper_cards 796 8-7 09:00 已建 · 主分类 agent 形态 method)= v47 §1.4 评测 + §1.1 §2.3 Skill-α "任务合成方法论"立基础延展

来源: - inbox/tom/2026-08-07T1440-agent-rag-longcontext-radar.md #3 ⭐⭐("训练终端 Agent 需要可执行、可验证且难度适中的任务。CalibForge 用异质求解器池的输出来校准候选任务——多求解器校准针对分歧,对比校准针对'强过弱不过'的关系,自动合成高质量训练任务。") - paper_cards/796-2608-06352.md(8-7 09:00 已建 · 主分类 agent ✅ · 形态 method)

arXiv: 2608.06352(2026-08-07 提交 · 距今 14h)

要点(paper_cards TLDR 直接引用): - 核心问题训练 terminal agents 需要可执行且可验证的任务——不仅可解,还要对学习具有适当难度可执行验证确立可行性,但不揭示任务相对于给定求解器设置的行为 - 核心方案CalibForge = 一种自主 terminal-task 合成系统使用验证的求解器行为通过对抗性求解器校准修订候选任务。两种校准模式:多求解器校准(multi-solver calibration) 针对异质求解器池中的分歧对比求解器校准(contrastive solver calibration) 针对指定的强过/弱不过关系 - 核心创新: - 首个 "用求解器行为反向校准任务难度" 合成范式 = 填补"任务合成 → 训练难度" 闭环 - 与 v47 §1.1 Skill-α(skill RL 训练化)+ ContinualSkillBench(skill 进化评测)形成"技能训练 + 技能评测 + 任务合成"三栖闭环 - 与 v47 §1.4 Agent Benchmark 四件套 + 反方 #93-#95 邻接

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.1 Skill-α + ContinualSkillBench + PAST-Bench + ABSeeker —— CalibForge 与 Skill-α + ContinualSkillBench 同向 = "Agent 训练任务合成" 立基础延展 第 1 件

v47 §1.4 Agent Benchmark 四件套 —— CalibForge 作为任务合成方法论 = "benchmark 反向" 立基础延展

建议归入节: - v48 §1.1 Skill-α 沿用 + §1.4 评测与可靠性候选新增 = CalibForge = "Agent 训练任务合成方法论锚" - v48 §3.1 共识候选新增 1 条 = "Agent 训练 = 任务合成(CalibForge)+ 信用分配(ABSeeker)+ 记忆(LiveMem)+ 技能(Skill-α)四栖闭环" - v48 §6.1 arXiv 列表 +1 = 2608.06352 CalibForge

风险与待核实:① "异质求解器池"中求解器来源(开源 vs 闭源)影响任务合成的偏倚——需 v48 §4 开放问题候选新增 1 条 ② "对抗性校准"是否会引入 solver-specific 偏倚

arXiv: 2608.06352


增量 3 · 🔴 P0 立标候选 · Lilian Weng《面向自我改进的 Harness Engineering》2026-07-04:RSI 从 I. J. Good 1965 概念到 Harness Engineering 现实路径 = v47 §1.1 §2.3 "Harness Engineering 学科化"立基础延展

来源: - inbox/jay/2026-08-07-1003-rss-lilian-weng.md主帖 = 2026-07-04 Harness Engineering for Self-Improvement = "递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将'超级智能机器'定义为能在所有方面超越人类的……") - inbox/jay/2026-08-07-ai-engineering-weekly.md(沿用 + 与 LongHorizon-Harness + SkillOpt + Self-Evolving Coding Agents 同向) - inbox/jay/2026-08-07-llm-agents-rag-mcp.md §四 S4("Agent Harness = scaffolding that wraps LLM with tools/history/context"概念锚 · 300+ 工程师访谈数据) - inbox/jay/2026-08-07T1950-jay-engineering-filter-p2.md(2 件高价值:4-Layer Secure Agent + A-CODE-LLM Bench = "Harness = scaffolding" 邻接)

arXiv: 无 arXiv(Lilian Weng Lil'Log 博客长文 · 2026-07-04 发布)

要点(直接引用自 jay 8-7 1003 RSS + 概念延伸): - 核心命题面向自我改进的 Harness Engineering = 递归自我改进(Recursive Self-Improvement, RSI)的现实工程路径 = "harness(工具/上下文/历史的脚手架)"是 Agent 在多次执行中逐步改进行为的关键载体 - 历史锚:RSI 概念可追溯至 I. J. Good(1965)——"超级智能机器"定义为"能在所有方面超越人类";Lilian Weng 2026-07-04 文章将这一概念首次系统化为"Harness Engineering"现实路径 - 核心方法论: - Harness = scaffolding that wraps LLM with tools/history/context - RSI = 通过更新 harness 让 agent 跨会话/跨任务改进行为(vs Self-Evolving Coding Agents 的 6 维度更新 · Harness 是其中最核心的"框架级"维度) - 3 类 harness 元素:工具协议(tool protocols)/ 上下文工程(context engineering)/ 持久化记忆(persistent memory)—— 与 v47 §1.45 frontier lab × Harness 第 22-24 栖 + v47 §2.24 多层记忆基底 邻接 - 概念辨析(jay 8-7 llm-agents-rag-mcp §四 S4 沿用): - Context Engineering = curating optimal tokens during LLM inference - Agent Harness = scaffolding that wraps LLM with tools/history/context - Agent = LLM with tools in an agentic loop - Workflow = predefined code paths - 意义 = 首次系统性梳理"Context Engineering / Agent Harness / Agent / Workflow" 四元组边界 = 知识库术语锚

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.1 应用架构(OpenAI ChatGPT Agent 三层 + Lilian Weng Harness Engineering 八元组 + 三 design patterns 已立)—— Lilian Weng 2026-07-04 文章是 v47 §1.1 "Harness Engineering 八元组" 的"系统性方法论延伸"立基础延展

v47 §1.3 Memory 七路 + LiveMem —— Lilian Weng Harness Engineering = "persistent memory" 维度立基础延展

v47 §1.4 五级 credit assignment + ABSeeker + §3.1 共识 —— Lilian Weng Harness Engineering 与 ABSeeker 同向 = "Harness + 信用分配训练" 立基础延展。

建议归入节: - v48 §1.1 应用架构候选新增 = Lilian Weng Harness Engineering = "Harness Engineering 学科化" 立基础锚 第 1 件 - v48 §3.3 开放问题候选新增 1 条 = "Context Engineering / Agent Harness / Agent / Workflow 四元组边界待知识库明确" - v48 §5 边界更新 1 条 = Lilian Weng Harness Engineering = llm-application.md / agent.md / engineering.md 三栖交叉

风险与待核实:① Lilian Weng 文章为博客长文(无 arXiv),与 v47 已立 Cloudflare AAM(无 arXiv 行业级方法论)同样需要 v48 §6.1 引用完整性沿用 URL 类 ② "Harness 八元组"与"harness 元素 3 类"(工具协议/上下文工程/持久化记忆)的对应关系需复检

arXiv: 无(Lilian Weng Lil'Log 博客长文 · 2026-07-04)


增量 4 · 🔴 P0 立标候选 · DataSpace:异构工作空间数据 Agent 评测基准(arXiv:2608.03451 / paper_cards 未建 P1 缺口)+ OSReward:CUA 轨迹 reward model 基准(arXiv:2607.28609 / paper_cards 802 已建 · 主分类 evaluation 形态 benchmark)= v47 §1.4 Agent Benchmark 四件套扩面到"六件套"

来源: - inbox/tom/2026-08-07T2040-agent-rag-longcontext-radar.md #1 ⭐⭐⭐("DataSpace 提出 410 项跨语言分析任务,覆盖 CSV、JSON、SQLite、Markdown、PDF 共 15.01 GB 多样化证据源。数据 Agent 须从异构工件中产出可验证的表格结果——将检索、结构化查询和开放分析统一评测,是目前最接近真实 RAG+Agent 工作流的评测套件。") - inbox/tom/2026-08-07T1440-agent-rag-longcontext-radar.md #2 ⭐⭐(OSReward · "CUA(Browser/Web Agent)评测体系缺口被明确揭示,对 Agent 评测工程化有直接指导意义。") - paper_cards/802-2607-28609.md(8-7 09:00 已建 · 主分类 evaluation ✅ · 形态 benchmark · 副分类 agent) - paper_cards 2608.03451 ⚠️ 未建(P1 缺口首位)

arXiv: 2608.03451(2026-08-03 提交)+ 2607.28609(2026-07-29 提交)

要点(直接引用自 tom 8-7 1440/2040 radar + paper_cards TLDR): - DataSpace arXiv:2608.03451: - 核心问题:现有 RAG / Agent 评测基准多为单一模态(纯文本 / 单一数据库),异构工作空间数据源评测缺口 - 核心方案410 项跨语言分析任务 + 15.01 GB 多样化证据源(CSV / JSON / SQLite / Markdown / PDF)+ 数据 Agent 从异构工件产出可验证表格结果 - 核心创新: - 首个异构数据源 RAG+Agent 评测基准 = 填补"RAG 评测与 Agent 评测交叉缺口" - 与 v47 §1.2 RAG 形态扩展 + §1.4 Agent Benchmark 四件套 同向 - OSReward arXiv:2607.28609: - 核心问题Computer-Using Agent (CUA) 轨迹验证(任务完成判断)无法靠人工扩展——研究者转向 VLM 作为裁判,但裁判可靠性长期未受检验 - 核心方案OSReward = 高质量基准 + 系统性评估 VLM judge 在 CUA 轨迹上的可靠性 - 核心创新: - 首个 "CUA 轨迹 + VLM-as-Judge 可靠性" 评测基准 = 填补 Browser/Web Agent 评测缺口 - 与 v47 §1.4 Agent Benchmark 四件套 + 反方 #93 ExplainBench 同向 = "评测节点" 补强 - 与 FutureAGI Substack "LLM Evaluation Tools 2026" Chunk Utilization / Chunk Attribution 指标同向

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.4 Agent Benchmark 四件套(PAST-Bench + ContinualSkillBench + ExplainBench + ABSeeker)+ 反方 #93-#95 —— DataSpace + OSReward 与四件套 + 反方同向 = "Agent Benchmark 六件套"立基础延展 第 5-6 件

v47 §1.2 RAG 决策 + Vector DB Q1 2026 benchmark + §1.3 Memory 七路 —— DataSpace 与"异构数据源"邻接 = "RAG+Agent 异构数据评测" 立基础延展

建议归入节: - v48 §1.4 评测与可靠性扩面 = DataSpace + OSReward = "Agent Benchmark 六件套"立基础延展 第 5-6 件 - v48 §3.1 共识候选新增 1 条 = "Agent Benchmark = 自进化(PAST-Bench)+ Skill 进化(ContinualSkillBench)+ 解释可信(ExplainBench)+ 信用分配(ABSeeker)+ 异构数据(DataSpace)+ CUA 轨迹(OSReward)六件套" - v48 §6.1 arXiv 列表 +2 = 2608.03451 DataSpace(P1 缺口首位 · 待建卡)+ 2607.28609 OSReward(已建 ✅) - v48 §4 开放问题候选新增 1 条 = "DataSpace 410 任务跨语言稳定性 + OSReward VLM-as-Judge 可靠性在多 VLM 下稳定性"

风险与待核实:① DataSpace arXiv:2608.03451 paper_cards 未建(P1 缺口首位 · paper_cards 766 → 803 = 37 张净增中无此 ID)——v48 §6 待建卡 ② OSReward paper_cards 802 = 2607.28609 已建 ✅

arXiv: 2608.03451 + 2607.28609


增量 5 · 🔴 P0 立标候选 · Hardware Keystores for AI Agent:MCP 签名工作流的零信任架构(arXiv:2608.06130 / paper_cards 未建 P1 缺口)= v47 §1.5 治理第 9 重 "硬件级密钥隔离"维度立基础延展

来源: - inbox/tom/2026-08-07T2040-agent-rag-longcontext-radar.md #3 ⭐⭐("针对 AI Agent 执行加密操作(签名 Git commits、API 认证)时私钥泄露风险,提出用硬件密钥库(HSM/TEE)替代软件明文存储,实现零信任 MCP 签名工作流。论文引用真实生产事故:框架私钥在 5 分钟内通过邮件注入被窃取。") - inbox/jay/2026-08-07T1735-jay-inference-vector-mcp-engineering.md #1 MCP 2026-07-28 RC 规范更新(传输层无状态化 + Extensions 框架 · 邻接)

arXiv: 2608.06130(2026-08-06 v1 提交 · 距今 1 天)

要点(直接引用自 tom 8-7 2040 radar): - 核心问题AI Agent 执行加密操作(签名 Git commits、API 认证) 时存在私钥泄露风险——软件明文存储的私钥在生产事故中5 分钟内通过邮件注入被窃取 - 核心方案用硬件密钥库(HSM/TEE)替代软件明文存储——实现零信任 MCP 签名工作流 - 核心创新: - 首个 "AI Agent + 硬件密钥库" 零信任架构 = 填补"软件私钥 → 硬件密钥库" 工程鸿沟 - 与 v47 §1.5 治理第 9 重 "事件 + 方法论 + 基准"三栖 同向 = "硬件密钥隔离" 第 4 栖候选新增(前 3 栖 = Cloudflare AAM 缩小能力集 / HF Frontier Lab Agent Intrusion ambient authority / CI-Work benchmark 26.7% 泄露率) - 与 v47 §1.5 §3.2 争议 #9 "CLI 工具调用 vs MCP 工具调用上下文成本" 邻接 = "MCP 签名工作流 = 治理 = 基础设施问题"

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.5 治理信号叠加第 9 重 = 平台级 MCP/RAG/Agent Access 安全态势(MCP 五大风险 + RAG CVE-2025-32711 + Cloudflare AAM + HF Frontier Lab Agent Intrusion + CI-Work)—— Hardware Keystores = "硬件级密钥隔离" 第 4 栖候选新增

v47 §3.2 争议 #9 + #11 "PRISM 外部 runtime 安全层" —— Hardware Keystores 与 PRISM 同向 = "外部 runtime 安全层 + ambient authority 监控 + 硬件密钥隔离" 三栖防护。

建议归入节: - v48 §1.5 治理信号叠加 候选新增 1 条 = Hardware Keystores = "AI Agent 加密操作硬件级密钥隔离" = 第 9 重"事件 + 方法论 + 基准 + 硬件密钥隔离"四栖 - v48 §3.1 共识候选新增 1 条 = "AI Agent 安全 = 软件(PRISM)+ 协议(MCP RC 无状态化)+ ambient authority 监控(HF Frontier Lab)+ 硬件密钥隔离(HSM/TEE)四栖防护" - v48 §6.1 arXiv 列表 +1 = 2608.06130 Hardware Keystores

风险与待核实:① paper_cards 未建(P1 缺口)—— v48 §6 待建卡 ② "5 分钟通过邮件注入被窃取" 真实事故细节待核(哪个框架、哪个版本)③ HSM/TEE 部署成本(云厂商 vs 自建)对中小 Agent 团队的可及性

arXiv: 2608.06130


增量 6 · 🟡 P1 立标候选 · MCP 2026-07-28 RC 规范更新 + vLLM vs SGLang 四问题决策框架 2026 中期 + 向量数据库格局 2026(pgvector 吸收 + Chroma S3 + LanceDB 边缘)= v47 §1.1 推理服务层 + §1.2 RAG 基础设施 "协议 + 引擎 + 向量库"三栖立基础延展

来源: - inbox/jay/2026-08-07T1735-jay-inference-vector-mcp-engineering.md(4 件高价值): - #1 MCP 2026-07-28 RC 规范更新(传输层无状态化 + Extensions 框架 + Roots/Sampling/Logging 正式废弃) - #2 vLLM vs SGLang 生产选型四问题决策框架(前置共享率 >60% SGLang 甜区阈值 + 结构化输出 Schema 复用 + vLLM 3500 tok/s > SGLang 2800 tok/s + SGLang 80ms TTFT < vLLM 150ms + V1 引擎调度器重构) - #3 向量数据库格局 2026(pgvector 吸收独立品类 + Chroma S3/GCS 后端 + 查询感知冷数据分层 + collection forking + LanceDB 边缘 + Notion 从 Pinecone 迁回 pgvector) - #4 Hugging Face × Microsoft Azure Foundry 模型即服务一体化部署(数千 HF 模型一键部署 + A100/H100/MI300X 加速器 + Microsoft Build 2026 公告)

要点(直接引用自 jay T1735): - MCP 2026-07-28 RC:① 传输层无状态化(移除有状态连接维护,降低 MCP 服务器长连接资源消耗)② Extensions 框架(MCP Apps、MCP Tasks,将协议从单一工具调用扩展为应用生命周期管理)③ 正式废弃 Roots、Sampling、Logging 三个早期提案 → 无状态化使 MCP 服务器更适合无服务(Serverless)环境和 Sidecar 部署模式 - vLLM vs SGLang 四问题决策框架选 vLLM(模型覆盖最广 + Blackwell 原生支持 + 成熟 Eagle3 推测解码 + OpenAI 兼容 API)vs 选 SGLang(前置共享率 >60% · RAG 文档/系统提示重复场景 + 多轮 Agent 管道 + 结构化输出 Schema 重复调用)vs TensorRT-LLM(峰值吞吐量最高但需编译)vs TGI(Hugging Face 生态首选)= 首次有工程社区共识形成"不是非此即彼,而是按负载特征选型"的框架 - 向量数据库格局 2026"Vector DB 独立品类 hype 已过"——Notion 等早期客户已从 Pinecone 迁回 pgvector;50M 向量以下场景 pgvector 成为合理默认;Milvus 42k+ GitHub stars 仍是亿级规模开源首选;Chroma 2026 新特性:S3/GCS 对象存储后端 + 查询感知冷数据分层 + collection forking;LanceDB 定位边缘/嵌入式零服务器场景;对 95% 的 AI 应用团队:选 pgvector + 更好 embedding/chunking 策略 > 换向量数据库 - HF × Azure Foundry:Azure Foundry Model Catalog 引入 Hugging Face Collection;数千个 HF 模型一键部署;支持 A100/H100/MI300X 加速器;运行时由 Microsoft 构建和 CVE 扫描;统一 Foundry endpoint + Playground;第一方 Azure Monitor 指标

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.1 推理服务层(vLLM/SGLang + SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + vLLM-ascend 0.11.0)—— jay T1735 四问题框架 = v47 §1.1 "推理引擎选型" 沿用 + 候选新增 "四问题决策框架"作为 v48 立基础延展

v47 §1.2 RAG 决策 + Vector DB Q1 2026 benchmark + pgvectorscale 471 QPS —— jay T1733 向量数据库格局 2026 = v47 §1.2 "向量库格局"沿用 + 候选新增 "pgvector 吸收独立品类 + Chroma S3 + LanceDB 边缘" 三栖立基础延展

v47 §1.5 治理第 9 重 + MCP 五大风险 —— MCP 2026-07-28 RC 无状态化 = v47 §1.5 "MCP 协议层治理加压" 沿用 + 候选新增 "Extensions 框架"作为 v48 §3.2 争议 #9 "CLI 工具调用 vs MCP 工具调用" 修订

建议归入节: - v48 §1.1 应用架构 + 推理服务层候选新增 = vLLM vs SGLang 四问题决策框架 = "前置共享率 >60% SGLang 甜区阈值"立基础延展 - v48 §1.2 RAG 决策 + Vector DB 候选新增 = "向量数据库格局 2026 = pgvector 吸收独立品类 + Chroma S3 + LanceDB 边缘"立基础延展 - v48 §1.5 治理信号叠加候选新增 = MCP 2026-07-28 RC 无状态化 + Extensions 框架 = "协议层治理加压"立基础延展 - v48 §3.1 共识候选新增 1 条 = "推理引擎选型 = 负载特征驱动(前置共享率 + 结构化输出 + 模型数 + 硬件)" - v48 §3.1 共识候选新增 1 条 = "向量库格局 = commodity layer · 选 pgvector > 选 embedding/chunking" - v48 §3.2 争议 #9 修订 = "MCP 工具调用 = 无状态化 + Extensions 框架 = 治理基础设施问题" - v48 §6.2 URL 列表 +2 = simonwillison.net/2026/Jul/31/stateless-mcp(已沿用)+ huggingface.co/blog + Azure Foundry 公告

风险与待核实:① Notion 从 Pinecone 迁回 pgvector 案例缺乏官方确认——v48 §4 开放问题候选新增 ② MCP RC 正式版发布时间 ③ Chroma S3 后端 production maturity

arXiv: 无(协议规范 + 厂商博客 + 工程实测数据)


增量 7 · 🟡 P1 立标候选 · 4-Layer Secure Agent Architecture(AI Mastery Substack Lesson 1)+ A-CODE-LLM Bench(AIMultiple 8-7)+ From Economic Agents to Agentic Economies arXiv:2608.06020 + PaDoc arXiv:2608.06146 = v47 §1.5 治理第 9 重 + §1.4 评测 + §1.1 应用架构 "Agent 安全架构 + 评测 + 多 Agent + 文档解析" 四栖立基础延展

来源: - inbox/jay/2026-08-07T1950-jay-engineering-filter-p2.md(2 件高价值): - #1 A-CODE-LLM Bench(AIMultiple · ~3,500 次自动化验证 · Task 6 Helpdesk 含 RBAC + 状态机 + 数据隔离(未授权返回 404 而非 403)+ 时序回复系统 + YAML contract 验证模板 + 隔离环境 + 心跳看门狗) - #2 4-Layer Secure Agent Architecture(AI Mastery Substack Lesson 1 · L4 Security → L3 Tools → L2 Memory → L1 LLM · layer order is policy-as-code · Prompt injection = authorization failure · PermissionError 映射为 blocked · 最小权限工具注册 · 有界会话内存 · Pydantic 入站验证) - inbox/tom/2026-08-07T2040-agent-rag-longcontext-radar.md #4 From Economic Agents to Agentic Economies(arXiv:2608.06020 · EWM 六层能力阶梯 · 自适应 LLM 驱动的异质性 Agent 体系 · paper_cards 未建 P1 缺口) - inbox/tom/2026-08-07T1440-agent-rag-longcontext-radar.md #4 PaDoc(arXiv:2608.06146 · layout-grounded parallel decoding · 文档解析效率 · paper_cards 797 已建 · 主分类 multimodal · 形态 method · 邻接 rag)

arXiv: 2608.06020(2026-08-05 提交)+ 2608.06146(2026-08-06 提交)

要点(直接引用自 jay T1950 + tom 1440/2040 radar): - 4-Layer Secure Agent:① L4 Security → L3 Tools → L2 Memory → L1 LLM(layer order is policy-as-code 不可随意调换)② Prompt injection = authorization failure(不是"坏回复质量"而是权限提升攻击)③ 最小权限工具注册(按 SecurityContext.permissions 过滤可用工具)④ 有界会话内存(max_turns 滑动窗口)⑤ Pydantic 入站验证 + regex/RBAC L4 + L3 权限检查的三段式错误处理 - A-CODE-LLM Bench:① Task 6 Helpdesk:FastAPI + Vite + RBAC + 状态机 + 数据隔离(未授权返回 404 而非 403)+ 时序回复系统 ② YAML contract 验证(后端部署到隔离环境后对照 canonical YAML 断言 · 覆盖 happy path + 错误处理 400/403/409)③ 双模式(Adaptive vs Strict)④ 实时 token 追踪(input / output / cached 分开计量)⑤ TASK.md 文档化(每个任务独立 GitHub 文档) - From Economic Agents to Agentic Economies arXiv:2608.06020:① EWM 六层能力阶梯(从固定规则 Agent 到自适应 LLM 驱动的异质性 Agent 体系)② 市场中交互、适应、共同演化(从内部产生经济动态)③ Multi-Agent 系统论候选新增 - PaDoc arXiv:2608.06146:① layout-grounded parallel decoding(将预测布局作为分支结构 · 共享页面表征 · 区域充分性假设下推导出基于共享表征的条件解码)② 保留全页上下文的同时去除区域间依赖(vs 串行自回归 vs 两阶段 crop-based)

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.5 治理第 9 重 = 平台级 MCP/RAG/Agent Access 安全态势 —— 4-Layer Secure Agent = v47 §1.5 "AI Agent 访问控制架构"候选新增 = 与 Cloudflare AAM + Hardware Keystores 形成"治理基础设施三栖"。

v47 §1.4 Agent Benchmark 四件套 + 反方 #93-#95 —— A-CODE-LLM Bench = v47 §1.4 "Agent 自动化验收"候选新增 第 7 件 = 与 PAST-Bench + ContinualSkillBench + ExplainBench + ABSeeker + DataSpace + OSReward 形成"Agent Benchmark 七件套"。

v47 §1.1 应用架构 + Multi-agent 100% vs 1.7% —— From Economic Agents to Agentic Economies = v47 §3.1 共识 "Multi-Agent 系统论"候选新增 = EWM 六层能力阶梯作为"多 Agent 演进路径"立基础延展。

v47 §1.2 RAG 决策 + LegalPincite 法律段落级 —— PaDoc = v47 §1.2 "文档解析效率优化"邻接 = 与 LegalPincite 形成"法律 RAG 评测 + 文档解析效率"双栖。

建议归入节: - v48 §1.5 治理信号叠加候选新增 = 4-Layer Secure Agent = "AI Agent 访问控制架构"立基础延展 第 4 栖 - v48 §1.4 评测与可靠性扩面 = A-CODE-LLM Bench = "Agent 自动化验收"立基础延展 第 7 件 = Agent Benchmark 七件套 - v48 §1.1 应用架构 + §3.1 共识候选新增 = From Economic Agents to Agentic Economies = "Multi-Agent 系统论 · EWM 六层能力阶梯" - v48 §1.2 RAG 决策邻接 = PaDoc = "文档解析效率优化" - v48 §6.1 arXiv 列表 +2 = 2608.06020(未建 P1 缺口)+ 2608.06146(已建 ✅ 邻接 multimodal 主分类)

风险与待核实:① 4-Layer Secure Agent 为 Substack 课程输出(无 arXiv)—— v48 §6.2 URL 沿用 ② A-CODE-LLM Task 6 GitHub 文档 + CSV 数据包是否完整可下载——v48 §4 待核实 ③ EWM 六层能力阶梯在 v47 Multi-agent 100% vs 1.7% 实证下的位置待定义

arXiv: 2608.06020 + 2608.06146


增量 8 · 🟢 P2 邻接补全 · Brain Bytes 2026 AI Agent Stack 8-7(Knowledge ≠ Memory 分层)+ FutureAGI LLM Evaluation Tools 2026(Chunk Utilization + Chunk Attribution 指标)+ Hugging Face × Azure Foundry 集成 = v47 §1.1 §1.4 §1.3 邻接补全

来源: - inbox/jay/2026-08-07-llm-agents-rag-mcp.md §四 S4 沿用 Brain Bytes("knowledge 和 memory 已分离为两个独立架构问题")+ §S3 沿用 300+ 工程师访谈数据 - inbox/tom/2026-08-07T1440-agent-rag-longcontext-radar.md §Substack Future AGI · The Complete Guide to LLM Evaluation Tools in 2026(RAG 评测核心指标:Chunk Utilization / Chunk Attribution(知识块实际使用率)/ Context Relevance / Sufficiency(检索完整度)· Agent 评测:Galileo / Arize AI 等平台已将 RUM(幻觉率)/ QA 准确率 / 多模态一致性纳入实时监控) - inbox/jay/2026-08-07T1735-jay-inference-vector-mcp-engineering.md #4 Hugging Face × Microsoft Azure Foundry(Azure Foundry Model Catalog 引入 Hugging Face Collection · Microsoft Build 2026 公告)

要点(直接引用自 jay 8-7 12:21 + tom 1440 + jay T1735): - Brain Bytes:① Knowledge 和 Memory 已分离为两个独立架构问题,不再是同一层 ② RAG 失败的瓶颈往往不是向量数据库本身,而是检索质量(chunk 选取、排序、上下文覆盖率)③ LongMemEval 基础长上下文检索在大窗口下表现良好——"把检索当作评测问题,而非基础设施问题" ④ Agent 记忆架构三层:对话历史(Postgres)→ 超上下文限制后加向量搜索 → 跨会话学习时才引入 Agentic Memory Management - Future AGI 评测指标:① Chunk Utilization(知识块实际使用率)② Chunk Attribution(检索完整度)③ RUM(幻觉率)④ QA 准确率多模态一致性 - HF × Azure Foundry:① 数千个 HF 模型一键部署到底层 Foundry Managed Compute ② 支持 A100/H100/MI300X 加速器运行时由 Microsoft 构建和 CVE 扫描统一 Foundry endpoint + Playground第一方 Azure Monitor 指标按部署计费标签模型每周刷新

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §1.1 应用架构 + §1.3 Memory 七路 + 第八路安全 —— Brain Bytes "Knowledge ≠ Memory 分层" = v47 §1.3 Memory 学术 + 生产双层结构第 6 件(TencentDB Agent Memory)邻接 = "Knowledge ≠ Memory" 沿用为方法论锚。

v47 §1.2 RAG 决策 + §1.4 评测 + 反方 #93-#95 —— Future AGI Chunk Utilization + Chunk Attribution = v47 §1.2 "RAG 决策实证" 沿用 + §1.4 评测方法学候选新增 = "RAG 评测指标"立基础延展。

v47 §1.1 推理服务层 + 供应链 CVE 治理 —— HF × Azure Foundry = v47 §1.1 推理服务层沿用 + 候选新增 "模型即服务一体化" = 国产化部署 + HF×Azure Foundry 双栖

建议归入节: - v48 §1.3 Memory 邻接 = Brain Bytes "Knowledge ≠ Memory 分层" = 方法论锚沿用 - v48 §1.2 RAG 决策 + §1.4 评测候选新增 = Future AGI Chunk Utilization + Chunk Attribution = "RAG 评测指标"立基础延展 - v48 §1.1 推理服务层候选新增 = HF × Azure Foundry = "模型即服务一体化"立基础延展 - v48 §6.2 URL 列表 +3 = codingwithroby.substack.com(Brain Bytes)+ futureagi.substack.com(Future AGI)+ Microsoft Build 2026 + Hugging Face Blog

风险与待核实:① Brain Bytes 为 Substack 行业作者(无 arXiv)—— v48 §6.2 URL 沿用 ② Future AGI 评测指标定义需原文确认 ③ HF × Azure Foundry 计费模型透明度

arXiv: 无(Substack + 厂商博客 + 工程实践)


增量 9 · 🔴 P0 警示承接 · paper_cards 8-7 llm-application 主分类 net-new = 0 张(= 连续第 2 个零新增日 + 立标饱和度"24~48h 半衰期"信号 第 4 例确认)+ HF Daily 8-7 全替换态 v33 以来第 3 例 + 立标信号与 work-queue 33% 收敛 + work-queue §1 Top 15 llm-application 主分类 0 件

来源: - paper_cards/766 → 803(8-6 22:45 → 8-7 21:00 = ~22h 净增 37 张 ≈ 1.7 张/h · llm-application 主分类 = 0 张 net-new · 与 spark llm-infra-e1prep §0 警示"立标饱和度半衰期信号 第 4 例"同向) - inbox/tom/2026-08-07-0900-hf-daily-2026-08-07.md(15 件 100% 净换手率 · v33 以来第 3 例 · 5/15 件与 work-queue §1 重叠 = 立标信号 33% 收敛) - inbox/stephen/2026-08-07-1245-stephen-coordination-check-noon.md §1.1 + §2.1(spark 反思棒物理动作失效 第 5 例警示承接 + llm-infra 双端缺位 第 3 例 + tom inference-e1prep 连续 3 日缺位 + jay 高负荷预警第 4 日) - work-queue.md(§1 Top 15 = 5 件 backlog 8 月新号 · llm-application 主分类 0 件)

要点: - 立标饱和度半衰期信号第 4 例:v47 §3.1 共识"立标饱和度反弹 = 24~48h 半衰期" 信号第 4 例确认——paper_cards llm-application 主分类 8-7 净增 0 张 = 连续第 2 个零新增日 - HF Daily 8-7 全替换态 #3:v33 7-26 / v40 8-6 / v41 8-7 连续 3 例确认 "每日重抓 + arXiv 强供给"机制持续验证 - 立标信号 33% 收敛:HF Daily 15 件与 work-queue §1 Top 15 重叠 5 件 = 立标信号从 v40 之前的高发散收敛到 33% 稳定区 - work-queue §1 Top 15 llm-application 主分类 0 件:8 月 backlog 池已饱和 · 立标信号与 backlog 池饱和度不匹配

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §3.1 共识 #11 "立标饱和度反弹 = 24~48h 半衰期" 信号 第 4 例续立 + §5.2 进行中 "评测方法学需要自我审计" 沿用。

v47 §4 开放问题 #33-#38 警示承接 + 候选新增 1 条 = "立标饱和度反弹到第 4 例 · 论文供给进入相对低谷期 · 工程数据持续积累"。

建议归入节: - v48 §3.1 共识 #11 沿用 + 修订 = 立标饱和度反弹"24~48h 半衰期" 信号 第 4 例续立 - v48 §4 开放问题候选新增 1 条 = "HF Daily 8-7 全替换态 #3 + paper_cards llm-application 主分类 0 张 = 立标供给进入相对低谷期 · 工程数据持续积累" - v48 §5.2 进行中沿用 = "评测方法学需要自我审计 + 立标饱和度监控"

风险与待核实:① 立标饱和度信号是否在 v48 之后仍持续——v48 §5.2 待观察 ② work-queue backlog 池饱和度 ~50% 高位续立是否合理


增量 10 · 🟡 P1 修订 · v47 §3.2 争议 #17 "Cloudflare AAM 缩小能力集 vs Multi-agent 100% 扩大协作" + v47 §4 开放问题 #38 "GDPevo arXiv 2608.03764 paper_card 编号漂移" 部分消解(GDPevo paper_cards 778 实际为 ReflectRL 待核 = v47 已警示 + jay 8-7 engineering-e1prep 增量 4 沿用)+ RAG vs Long Context 1250× 成本数据稳定性待核实

来源: - v47 §3.2 争议 #17(沿用)+ v47 §4 开放问题 #38(沿用 + jay 8-7 engineering-e1prep 增量 4 ReflectRL arXiv:2608.03972 实证 = paper_cards/762-2608-03972 = ReflectRL 而非 GDPevo = v47 警示"GDPevo paper_cards 762 = ReflectRL"已部分消解) - inbox/tom/2026-08-07T0840-agent-rag-longcontext-radar.md §Substack 沿用 RAG vs Long Context 1250× 成本数据

要点: - 争议 #17 修订:Cloudflare AAM 缩小能力集 vs Multi-agent 100% 扩大协作——v47 已立化解(Cloudflare AAM 适用于单 Agent 部署;Multi-agent 适用于 cross-domain 复杂任务——两者针对不同场景)——本棒 4-Layer Secure Agent(L4 Security → L3 Tools → L2 Memory → L1 LLM)+ Hardware Keystores(HSM/TEE MCP 签名工作流)= "缩小能力集" 立场进一步实证 - 开放问题 #38 部分消解:v47 警示"GDPevo arXiv 2608.03764 paper_cards 实际未建卡,可能 paper_cards 762-2608-03972 = ReflectRL 而非 GDPevo"——jay 8-7 engineering-e1prep 增量 4 确认 ReflectRL arXiv:2608.03972 = paper_cards 762 沿用 = "从 Golden Negative Trajectories 学习推理" ≠ GDPevo——GDPevo paper_card 状态仍待复检(v47 §4 #38 沿用) - RAG vs Long Context 1250× 成本数据稳定性:v47 §4 #34 已立"Wire Blog RAG vs Long Context 1250× 成本数据在多 workload / 多模型 / 多上下文长度下是否稳定?数据来源 PDF 待精读"——本棒 v47 沿用,无新增精读

与活文档 knowledge/llm-application.md v47 现有脉络的关系: v47 §3.2 争议 #17 + #11(PRISM 等外部 runtime 安全层是否成为 harness 标准组件)+ §4 开放问题 #38 —— v48 §3.2 + §4 沿用,无新增精读

建议归入节: - v48 §3.2 争议 #17 沿用 + 修订 = "缩小能力集" 立场由 4-Layer Secure Agent + Hardware Keystores 进一步实证 - v48 §4 开放问题 #38 沿用 = GDPevo paper_card 状态待复检 - v48 §4 开放问题 #34 沿用 = RAG vs Long Context 1250× 成本数据稳定性待精读

风险与待核实:① 4-Layer Secure Agent(L4 Security → L3 Tools → L2 Memory → L1 LLM)与 Cloudflare AAM 4 大特性(短暂性 / 机器速度 / 提示词非边界 / 跨跳组合权限)的对应关系待复检 ② Hardware Keystores 真实事故细节待核


2. 矛盾 / 待核实清单(4 条)

  1. DataSpace arXiv:2608.03451 paper_cards 未建(P1 缺口首位)——paper_cards 766 → 803 = 37 张净增中无此 ID——建议 v48 §6 待建卡首位
  2. GDPevo arXiv:2608.03764 paper_card 编号漂移已部分消解(paper_cards/762-2608-03972 = ReflectRL 而非 GDPevo)——v47 §4 #38 沿用,GDPevo paper_card 状态仍待复检
  3. From Economic Agents to Agentic Economies arXiv:2608.06020 paper_cards 未建(P1 缺口)——v48 §6 待建卡
  4. Hardware Keystores for AI Agent arXiv:2608.06130 paper_cards 未建(P1 缺口)+ 5 分钟通过邮件注入被窃取真实事故细节待核(哪个框架、哪个版本)——v48 §4 开放问题候选新增 1 条

3. 可引用 arXiv 号列表(8 件 net-new + 4 件沿用)

arXiv 论文 / 主题 主分类 状态 建议归入节
2608.06197 EnvACE(Agentic RL via World Rehearsal · 训练范式锚 第 3 件) agent ✅ paper_cards 795 已建 ✅ §1.1 应用架构 + §1.4 评测"训练范式锚"
2608.06352 CalibForge(对抗性求解器校准合成终端任务) agent ✅ paper_cards 796 已建 ✅ §1.1 Skill-α + §1.4 评测"任务合成方法论"
2608.03451 DataSpace(异构工作空间数据 Agent 评测 · 410 任务 / 15.01 GB 多样化证据源) ⚠️ 待核 paper_cards 未建 P1 缺口 §1.4 Agent Benchmark 扩面 第 5 件
2607.28609 OSReward(CUA 轨迹 reward model 评测 · VLM-as-Judge 可靠性) evaluation ✅ paper_cards 802 已建 ✅ §1.4 Agent Benchmark 扩面 第 6 件
2608.06130 Hardware Keystores for AI Agent(MCP 签名工作流零信任架构 · HSM/TEE) ⚠️ 待核 paper_cards 未建 P1 缺口 §1.5 治理第 9 重"硬件密钥隔离"第 4 栖
2608.06020 From Economic Agents to Agentic Economies(EWM 六层能力阶梯 · Multi-Agent 系统论) ⚠️ 待核 paper_cards 未建 P1 缺口 §1.1 §3.1 共识"Multi-Agent 系统论"
2608.06146 PaDoc(layout-grounded parallel decoding 文档解析 · 主分类 multimodal 邻接 rag) multimodal ✅ paper_cards 797 已建 ✅ §1.2 RAG 决策邻接"文档解析效率"
2608.05139 Skill-Native LLM(SkillOpt MSR 邻接 · 长视野推理基准测试与训练的技能熵) ⚠️ 待核 paper_cards 未建 P1 缺口(spark 8-7 agent-e1prep 沿用) §1.1 §2.3 Skills RL 化邻接
2608.03972 ReflectRL(Golden Negative Trajectories 推理 · paper_cards 762 实际归属 = v47 §4 #38 部分消解) ⚠️ 待核 paper_cards 762 沿用 §1.4 评测与可靠性邻接"RL 推理后训练"
2608.03506 CALVER(因果推理中投票失效的符号验证 · v47 已立反方 #95) ⚠️ 沿用 paper_cards 761 沿用 ✅ §1.4 反方 #95 沿用

总计7 件 net-new arXiv(2608.06197 + 2608.06352 + 2608.03451 + 2607.28609 + 2608.06130 + 2608.06020 + 2608.06146)+ 1 件沿用(2608.05139 Skill-Native LLM)+ 2 件 v47 已立(2608.03972 ReflectRL + 2608.03506 CALVER)


4. v48 预消化关键议题

v47 → v48 面临的核心问题是:v47 已立六对象在 8-7 当日落地的新实证 + 新方法 + 新生产数据 + 新治理威胁 + 新评测基准五维深化 + "立标饱和度信号第 4 例" 警示

  1. EnvACE + Lilian Weng Harness Engineering + Skill-α 三栖立基础延展 → v48 §1.1 应用架构候选新增——"Agent 训练范式 = 内化环境(EnvACE)+ 信用分配(ABSeeker)+ 记忆(LiveMem)+ Harness 学科化(Lilian Weng)+ 技能(Skill-α)五栖"
  2. DataSpace + OSReward → v48 §1.4 Agent Benchmark 七件套——PAST-Bench + ContinualSkillBench + ExplainBench + ABSeeker + DataSpace + OSReward + A-CODE-LLM Bench = 七件套
  3. Hardware Keystores → v48 §1.5 治理第 9 重"事件 + 方法论 + 基准 + 硬件密钥隔离"四栖——Cloudflare AAM + HF Frontier Lab Agent Intrusion + CI-Work benchmark + Hardware Keystores = 四栖
  4. 4-Layer Secure Agent + A-CODE-LLM Bench + FutureAGI 评测指标 → v48 §1.4 + §1.5 评测与治理双栖——"Agent 自动化验收 + Chunk Utilization/Chunk Attribution 指标"立基础延展
  5. MCP 2026-07-28 RC 无状态化 + vLLM vs SGLang 四问题 + 向量库格局 2026 → v48 §1.1 §1.2 §1.5 协议 + 引擎 + 向量库三栖——"推理引擎选型 = 负载特征驱动 + 向量库 = commodity layer + 协议 = 无状态化"
  6. paper_cards 8-7 llm-application 主分类 net-new = 0 张 → v48 §3.1 共识"立标饱和度半衰期"信号 第 4 例续立——论文供给进入相对低谷期 · 工程数据持续积累
  7. From Economic Agents to Agentic Economies → v48 §1.1 §3.1 共识"Multi-Agent 系统论"候选新增——EWM 六层能力阶梯作为多 Agent 演进路径立基础延展

5. 检查过的来源清单(汇总)

来源 主要 llm-application 增量
inbox/tom/2026-08-07T0840-agent-rag-longcontext-radar.md Self-Evolving Coding Agents 2608.03392 + FinanceHarness 2607.27853 + Teaching Nemotron Greek 2608.05138(已建 ✅)
inbox/tom/2026-08-07T1440-agent-rag-longcontext-radar.md 🔴 EnvACE 2608.06197(已建 ✅)+ 🟡 OSReward 2607.28609(已建 ✅)+ 🟡 CalibForge 2608.06352(已建 ✅)+ 🟡 PaDoc 2608.06146(已建 ✅ multimodal)+ Substack Future AGI 评测指标
inbox/tom/2026-08-07T2040-agent-rag-longcontext-radar.md 🔴 DataSpace 2608.03451(未建 P1 缺口)+ Nemotron Greek 2608.05138 沿用 + 🔴 Hardware Keystores 2608.06130(未建 P1 缺口)+ 🟡 From Economic Agents 2608.06020(未建 P1 缺口)+ MASS + Continual Learning in Transition + Substack Brain Bytes
inbox/tom/2026-08-07-rag-e1prep.md Teaching Nemotron Greek(新增 ✅)+ LegalPincite(确认升级)+ RAG 框架生态 + 向量数据库基准 + VelesDB
inbox/tom/2026-08-07-evaluation-e1prep.md GDPevo + NOLLI + OneDayAgent + Skill-Native LLM 邻接
inbox/jay/2026-08-07T1735-jay-inference-vector-mcp-engineering.md 🟡 MCP 2026-07-28 RC + vLLM vs SGLang 四问题 + 向量数据库格局 2026 + HF × Azure Foundry
inbox/jay/2026-08-07T1950-jay-engineering-filter-p2.md 🟡 A-CODE-LLM Bench + 🟡 4-Layer Secure Agent
inbox/jay/2026-08-07-llm-agents-rag-mcp.md 🔴 Lilian Weng Harness Engineering(主帖)+ CSDN LangGraph + RAG + MCP + Substack 4 件
inbox/jay/2026-08-07-engineering-e1prep.md ReflectRL 2608.03972 沿用 + CALVER 2608.03506 沿用
inbox/jay/2026-08-07T1003-rss-lilian-weng.md Harness Engineering 2026-07-04 学科化锚
inbox/jay/2026-08-07-ai-engineering-weekly.md Self-Evolving Coding Agents + LongHorizon-Harness + SkillOpt + OpenMLE/Frontis-MA1 邻接
inbox/flyp/2026-08-07-risk-e1prep.md datasette 1.0a38 SQL 注入(6 栖)+ HF/OpenAI 联合模型串通(7 栖)+ BVS visual jailbreak + Personalized Illusions + DRIFT 邻接
inbox/spark/2026-08-07-agent-e1prep.md Self-Evolving Coding Agents + ABSeeker + Lilian Weng Harness + AI Agent 安全 7 栖 + MSR EvoLib/Orchard/Echoverse + GDPevo + FinanceHarness + K-EXAONE 2.0 + Skill-Native LLM 邻接
inbox/spark/2026-08-07-llm-infra-e1prep.md LLM serving 6 件 arXiv + Multi-Agent serving 策略驱动运行时 + Agent 弹性内存 + Verified Tool Calls + Beyond Component Testing + Beyond Solution-Centric Search + ReflectRL
paper_cards/766 → 803 8-6 22:45 → 8-7 21:00 = 22h 净增 37 张 ≈ 1.7 张/h · llm-application 主分类 0 张 net-new = 立标饱和度信号 第 4 例
work-queue.md §1 Top 15 = 5 件 backlog + 0 件 llm-application 主分类 · 立标信号与 backlog 池饱和度不匹配

6. 总结

  • 本棒定位:E1 日间预消化棒(不重写 v47,只列 8-6 21:10 → 8-7 21:10 ≈ 24h 窗口内 v47 已固化骨架外的新硬资产增量 + 跨实例核验状态,供今晚活文档 v48 接力决策参考)
  • 本棒增量核心7 件 net-new arXiv(EnvACE + CalibForge + DataSpace + OSReward + Hardware Keystores + From Economic Agents + PaDoc)+ 1 件行业级方法论(Lilian Weng Harness Engineering 2026-07-04)+ 2 件 Substack + 4 件工程数据(MCP RC + vLLM/SGLang + 向量库格局 + HF×Azure)+ 1 件警示承接(立标饱和度信号 第 4 例)= 共 15 条 net-new 增量
  • 涉及 arXiv 号:7 件 net-new(2608.06197 + 2608.06352 + 2608.03451 + 2607.28609 + 2608.06130 + 2608.06020 + 2608.06146)+ 1 件沿用(2608.05139 Skill-Native LLM)+ 2 件 v47 已立(2608.03972 ReflectRL + 2608.03506 CALVER)
  • 数量级评估:v47 已固化骨架在 8-7 当日落地新实证 + 新方法 + 新生产数据 + 新治理威胁 + 新评测基准五维深化——立标饱和度信号第 4 例确认 + 双端失衡(agent / llm-infra)警示延续 + 论文供给零增量 + 工程数据持续积累
  • 本棒判断中密度偏上——核心主线 = "Agent 训练范式(EnvACE + Lilian Weng Harness Engineering)+ Agent Benchmark 扩面(DataSpace + OSReward + A-CODE-LLM Bench)+ 治理基础设施深化(Hardware Keystores + 4-Layer Secure Agent)+ 协议 + 引擎 + 向量库三栖(MCP RC + vLLM/SGLang + 向量库格局)+ Multi-Agent 系统论(From Economic Agents)"——立标饱和度信号第 4 例确认 = 论文供给进入相对低谷期 + 工程数据持续积累 + 5 实例协同(tom 7 件 + jay 16 件 + spark 2 件 + flyp 1 件 + stephen 2 件 = 28 件主力棒 + paper_cards 37 张净增)

Stephen · E1 预消化轮 · 2026-08-07 21:10 CST · 7 件 net-new arXiv + 1 件行业级方法论 + 2 件 Substack + 4 件工程数据 + 1 件警示承接 = 15 条 net-new 增量 · 涉及 arXiv:2608.06197 / 2608.06352 / 2608.03451 / 2607.28609 / 2608.06130 / 2608.06020 / 2608.06146 + 2608.05139 沿用 + 2608.03972 / 2608.03506 v47 已立