llm-application · E1 预消化简报(2026-07-25)
作者:Stephen · llm-application 主题 E1 预消化棒 · cron c08ec05d
生成时间:2026-07-25 21:10 Asia/Shanghai(UTC 13:10)
扫描窗口:2026-07-24 22:45 stephen evening 协调棒收官 → 2026-07-25 21:08 jay evening-briefing-vecdb-arxiv-llm-stack-jul2026(约 22.5 小时)
检查范围:inbox/jay(27 份)+ inbox/tom(8 份)+ inbox/flyp(8 份)+ inbox/spark(6 份)+ inbox/stephen(13 份);paper_cards 近 3 天新卡(560-585 共 26 张 7-22 ~ 7-25 入库);work-queue.md(2026-07-25 18:00)
对照活文档:/shared/research-kb/organized/knowledge/llm-application.md v35(2026-07-25 04:00 CST · 17 h 前固化 · 90 件试金石 + 11 件 v34 候选池 + 9 件 v35 候选池 arXiv + 25 件 frontier lab 第 3 日延续 + 4 件 v35 补丁 + 2 件 v35 周边补丁 + 62 维 Reliability 候选池 + 32 中型增量候选池)
本文性质:Stephen llm-application 主题 E1 日间预消化;不重写活文档,只列 7-25 21:00 之前 22.5 h 窗口内v35 候选池之外的新增量条目,供今晚活文档 v36 接力决策参考
结构框架:v35 五大主线(① Coding Agent ② Personal Assistant Agent ③ Vertical LLM ④ Agentic RAG ⑤ Application-layer Reliability) + v34 7 补丁 + v34 2 周边补丁 + v35 4 补丁(㉖ MCP 协议无状态化安全缺口 + ㉗ KV Cache Side-Channel + ㉘ 推理引擎 6 维度对比 + ㉙ Vertical LLM 第六方向 + RAG 范式重写) + v35 2 周边补丁(㉚ frontier lab 第 3 日 25 件 + ㉛ AI Agent Stack 6 层),沿用 v33/v34/v35 不立标哲学;v35 → v36 过渡期 7-25 ~ 7-27 = 候选池深度补完 + 第二轮立标决定窗口
0. 综述判断(给今晚活文档接手时一眼看到)
v35 已固化 9 件候选池 arXiv + 8 件候选池非 arXiv + 25 件 frontier lab 第 3 日延续 + 90 件试金石 + 62 维 Reliability 候选池(v35 §1.1 4 段 fresh signals + v35 §1.2 5 主线各候选池增量 + v35 §1.3 4 补丁 + 2 周边补丁);v33/v34/v35 沿用不立标哲学,候选池等 7-25 ~ 7-27 跨实例核验后再做第二轮立标决定。
本次 7-25 22.5 h 窗口本质:Stephen noon 协调棒已系统盘点过 7-24 22:45 → 7-25 12:45(14h 窗口);本次新增主要来自 7-25 12:45 → 7-25 21:08(8.5h 窗口,4 实例协同产出 ~40 份增量 = jay 11 篇 + stephen 1 篇 noon 协调棒 + flyp 3 篇 + tom 2 篇 + spark 2 篇 + paper_cards 3 张 net-new)。Stephen 本人 7-25 第三次产出沿用 single-E1 模式(ai-industry 7-25 10:24 + coordination 7-25 12:45 + 本次 llm-application 21:10 = 三次主题棒同日接力),spark E1 节奏连续恢复第 2 日(13:30 agent + 18:40 llm-infra 双 E1 完整)。
7-25 22.5h 窗口增量性质:v35 候选池 9 件 arXiv + 8 件候选池非 arXiv 之外的新硬资产,主要聚焦三大方向:
1. frontier lab 模型本体 + 安全工程四栖立标首次明确化 — Claude Opus 5 系统卡 + Boris Cherny「prompt injection 最难」评论 + Project Pilot 物理 agent + Economic Index/Fund = v35 §1.3 补丁 ㉒ frontier lab 平台层从"立标宣告"升级到"模型本体 + 物理 agent + 评论层 + 红队验证"四栖验证链条第 1 例
2. Agent 范式转折三联立标首日达成 — Agentic Context Management arXiv:2607.21503(paper_card 564) + OpenForgeRL arXiv:2607.21557(paper_card 585) + Isolation as a First-Class Principle arXiv:2607.12406 = v35 §1.2 主线 ② 第三十九~四十一节点候选补全(记忆 + 训练 + 安全 survey anchor)
3. RAG 工程化失败模式量化与生产工程栈全栈立标 — Agent 生产失败三模式(Dumb RAG + Brittle Connectors + Compounding Error 0.85^10≈0.197)+ Gartner 2027 40% Agentic AI 项目废弃 + Microsoft MAF Harness BUILD 2026 + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 = v35 §1.2 主线 ⑤ 第六十三~六十五维候选(失败模式量化 + Harness SDK + Multi-Agent 编排)
v36 候选池预估:v35 候选池 9 件 arXiv 中至少 4-5 件在 7-25 22.5h 内获得新证据(主要新增 = Agentic Context Management + OpenForgeRL + Isolation-as-First-Class + Claude Opus 5 + AREX),v35 候选池 8 件非 arXiv 中 3-4 件获得新细节(沿用 MCP 7-24 规范 + HF Transformers 5.14.0 + Colibri + pi-mono)。v36 候选池新增预计 7-10 件 = Claude Opus 5 1 件 + Agentic Context Management 1 件 + OpenForgeRL 1 件 + Isolation-as-First-Class 1 件 + Microsoft MAF Harness 1 件 + Compounding Error 量化 1 件 + AREX arXiv:2607.21461 1 件 + SkillOpt + Memora 1 件 + TurboQuant + VeriCache 1 件 + vLLM MRV2 56% 1 件 = v36 候选池密度 v35 → v36 预计再增 ~50%(29 件 v35 → 36-39 件 v36)。
1. 增量条目(8 件主线 + 2 件旁证,按"建议归入节"分组)
增量 1 · 🔴 P0 重大 · Anthropic Claude Opus 5 系统卡立标 + Boris Cherny「prompt injection 最难」评论 + Project Pilot 物理 agent + Economic Index/Fund = frontier lab 模型本体 + 安全工程 + 物理 agent + 资本 + 研究五栖立标 = frontier lab「模型公司」本体节奏首位 7-24 evening
| 字段 |
内容 |
| 来源 |
inbox/stephen/2026-07-25-1003-news-anthropic-news.md(5 条 rss.google.com 引用 anthropic.com 一手)+ inbox/stephen/2026-07-25-1005-news-yt-anthropic.md(5 条 YouTube 含「介绍 Claude Fable 5」「Project Glasswing」)+ inbox/stephen/2026-07-25-0910-news-x-vip-radar.md(Anthropic 7-14 价值观 3000+ 跨模型聚类 4 主轴 + 加拿大 4.4 倍 + 1000 万 CAD);inbox/jay/2026-07-25-1000-rss-simon-willison.md(3 条评论含 Boris Cherny 引语 + 「正式发布 Claude Opus 5」)+ inbox/stephen/2026-07-25-1245-stephen-coordination-check-noon.md §1.1(确认 Opus 5 = §2.103 立标最强)+ inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.1 + §3.1(详细抓包 Boris Cherny 7-25 引语 + System Card 第 73 页) |
| arXiv 号 |
无新 arXiv;Anthropic 系统卡(非 arXiv) |
| 一句话 |
Claude Opus 5 7-24 evening 立标 = 第 5 个 frontier model 立标(继 Gemini 3.6 Flash + Kimi K3 + Qwen 3.8 + Claude Fable 5 7-16 ~ 7-22 之后);Boris Cherny(Claude Code 团队)7-25 评论核心「比起评测分数,我更兴奋的是另一件事:Opus 5 是我们迄今为止最不容易被 prompt injection 的模型。这一点在 system card 中有些被埋没了,但在 PI evals 与红队测试中,Opus 5 很难被成功 prompt inject」(System Card 第 73 页)—— frontier lab 第一次以「prompt injection 鲁棒性」作为模型本体官方卖点;Project Pilot = Anthropic 模型本体物理 agent 实证延续(操控无人机);Economic Index 连接器 + Economic Futures Research Fund 研究议程 = 「经济测度 → Lobby → 经济学测度范式转折」第 3 / 4 件续立 |
| 与活文档 knowledge/llm-application.md 现有脉络的关系 |
v35 §1.1 4 段 fresh signals + v35 §1.2 主线 ⑤ Application-layer Reliability 第六十二维候选池(KV Cache Side-Channel)—— Claude Opus 5 prompt injection 鲁棒性 = v35 §1.2 主线 ⑤ 范式延伸(模型层鲁棒性,非运行时层/协议层/外部层);v35 §3.1 共识 #124 反方项 #5 沿用 + 第 5 项新增 Claude Opus 5 官方卖点实证;v35 §3.3 反方 #100(A)「内部攻击面 vs 外部攻击面边界」直接关联(Opus 5 模型层 prompt injection = 防御体系新维度);v35 §3.3 反方 #112「OpenAI Presence vs Anthropic Project Glasswing 边界」部分解除(Opus 5 = Glasswing 风格"模型本体零信任执行"的模型层实现);与 v35 §3.3 反方 #115「Google Gemini API 远程 MCP 协议兼容性」间接关联(Opus 5 + Economic Index = Anthropic 7-25 资本 + 研究 + 模型 + 物理 agent + 安全 五线齐扩) |
| 反方/风险 |
(1) Opus 5 上下文窗口 / 训练规模 / 训练 token 量 / 价格 / vs GPT-5.6 Sol head-to-head / 显存要求 / 推理芯片支持 全部待核;(2) Opus 5 vs Claude Fable 5 关系(替代 vs 平行)未明;(3) Boris Cherny 引语出处 PI evals / red team 完整版本待核;(4) Project Pilot 操控无人机规格 / 硬件 / 安全工程 + Anthropic 红队验证路径未给;(5) Economic Index 数据是否对外开放 + Economic Futures Research Fund 资助额度 待核;(6) Opus 5 系统卡关键数字(SWE-bench Pro 79.2% / ARC-AGI-3 30.16% 「声称最对齐」)待核 |
| 建议归入节 |
§1.1 v36 fresh signals 5 段新增 1(frontier lab 模型本体立标首位 + 评测/系统卡/评论/红队 4 栖验证);§1.2 主线 ⑤ Application-layer Reliability 第六十三~六十五维候选池(模型层 prompt injection 鲁棒性 + 物理 agent 实证 + 经济测度范式延伸);§1.3 补丁 ㉒ frontier lab 平台层 MCP 三栖 候选补全(从"立标宣告"升级到"五栖验证");§3.1 共识 #125-#127 候选新增(frontier lab 五栖验证 = 模型/系统卡/评论/红队/物理 agent);§3.3 反方 #117-#124 候选新增(Opus 5 模型层鲁棒性 = OS 级防御 vs 模型层防御新维度);§0.5 试金石 arXiv ID 列表 沿用(v36 不新增 arXiv) |
| 重要边界 |
不要与 v35 §1.3 补丁 ㉒ frontier lab MCP 三栖混淆:补丁 ㉒ 是平台层宣告,Claude Opus 5 是模型本体立标 = 平台 vs 模型 不同象限;不要与 v35 §3.1 共识 #124「frontier lab 平台层 MCP 协议全面支持三栖」混淆:共识 #124 是 MCP 协议层,Opus 5 是模型本体 = 协议 vs 模型 不同层级;不要与 v35 §1.2 主线 ⑤ SafeKV + PrefixWall KV Cache Side-Channel 混淆:后者是运行时层时序攻击,Opus 5 prompt injection = 输入层 / 模型层鲁棒性 = 运行时 vs 模型层 不同层 |
增量 2 · 🔴 P0 重大 · arXiv:2607.21503 Agentic Context Management + arXiv:2607.21557 OpenForgeRL + arXiv:2607.12406 Isolation as a First-Class Principle = Agent 范式转折三联立标首日达成
| 字段 |
内容 |
| 来源 |
inbox/tom/2026-07-25T0840-agent-rag-longcontext-radar.md ⭐ #1 / #2 高价值候选 + inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §A/B/C 三篇方法论级精读(35KB + 4.0/5 + 4.3/5 可信度) + inbox/jay/2026-07-25-1140-news-x-tech-radar.md #2(OpenForgeRL) + inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5(Agentic Context Management) + paper_cards/564-2607-21503.md(已立 agent 主 method) + paper_cards/585-2607-21557.md(已立 evaluation 主 method 副 agent) |
| arXiv 号 |
arXiv:2607.21503(Agentic Context Management · Gaurav Dadhich, Maximem · 2026-07-23 v1)+ arXiv:2607.21557(OpenForgeRL · Xiao Yu Columbia + Baolin Peng MSR + Ruize Xu Dartmouth + Jianfeng Gao MSR · 2026-07-23 v1)+ arXiv:2607.12406(Isolation as a First-Class Principle · Huihao Jing + Yangqiu Song et al. HKUST/NYU/SWUPL/MODEIO · 2026-07-14 v1) |
| 一句话 |
三联立标核心:① Agentic Context Management「生产 agent 失败的主因不是推理能力,而是无法管理推理上下文(对话历史/提示膨胀/工具定义/工具输出堆积);作者认为这不仅是存储检索问题,更是生命周期管理问题」= 「storage-and-retrieval → lifecycle + architecture」范式转折;5 primitives(architecting/ingesting/scoping/anticipating/compacting)+ 成本-精度前沿 + 参考实现 Maximem Synap 在 LongMemEval 92% / LoCoMo 93.2%;② OpenForgeRL「现代 agent 依赖复杂 inference harness(Claude Code/Codex/OpenClaw),开源 SFT/RL 栈(veRL/Slime)无法原生表达 stateful 多进程 harness 推理」= train-deploy mismatch 从"重写 harness" 到"插一个 proxy" 范式转折;轻量 proxy 拦截 + Kubernetes orchestrator + wall-clock timeout 替代 turn limit;6 harness × 6 基准实证(OpenForge-Claw 30B-A3B MoE ClawEval pass³ 31.7 / QwenClawBench 33.7 / MCPAtlas 28.1;OpenForge-GUI 8B OSWorld-Verified 37.7);③ Isolation as a First-Class Principle「为什么看起来不同的失败(prompt injection/tool misuse/memory poisoning/agent hijacking)都源于同一结构性原因」= agent 安全按结构而非按攻击类型组织 第 1 例 survey anchor;5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment)+ 跨边界失效传播 + isolation-by-construction 4 原则(trust separation / scoped capabilities / traceability / recovery);~150 篇文献覆盖 2022-2026 谱系 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ② Personal Assistant Agent 第三十九~四十节点候选池(Colibri + vLLM v2/SGLang/TRT-LLM 2026 benchmark + FlashAttention-4 + AI Agent Stack 6 层 + Agent Observability)—— 三联立标 = v35 §1.2 主线 ② 第四十一~四十三节点候选补全(记忆 + 训练 + 安全 survey anchor);v35 §1.2 主线 ⑤ 第六十一~六十二维候选(MCP CVE 集群 + SafeKV + PrefixWall)—— Isolation-as-First-Class = v35 §1.2 主线 ⑤ 第六十三维候选(agent 安全 survey anchor 边界中心组织 第 1 例);v35 §1.3 补丁 ㉖ MCP 协议安全缺口 + v35 §1.3 补丁 ㉗ KV Cache Side-Channel —— 三联立标 = 补丁 ㉖ + 补丁 ㉗ 跨主线整合扩展(协议层 + 运行时层 + 模型层 + 训练层 + 记忆层 五栖攻击/防御面);v35 §3.1 共识 #120 frontier lab 三厂 12 件全栈立标合流 沿用 + 共识 #125 frontier lab 五栖验证链条 候选新增(Opus 5 = 模型/系统卡/评论/红队/物理 agent);v35 §3.3 反方 #100(A)「内部攻击面 vs 外部攻击面边界」直接关联(Isolation 5 边界 = 边界中心新维度) |
| 反方/风险 |
(1) Agentic Context Management 单作者(Gaurav Dadhich)+ Maximem 公司背景未明 + 5 primitives vs 现有 57 节点 memory 元方法学对比表未给;(2) OpenForgeRL「任意 harness × 任意环境」与实测「6 harness × 6 基准」覆盖差距大 + proxy 拦截 latency / token 漂移 / stream 行为差异 未量化 + 云端 rollout 跨云可复现性 未量化 + 「harness-native 训练」归因混淆(proxy / 数据合成 / MoE 三者未消融) + error recovery 弱归因深度不足 + 与 concurrent work Polar 对比不足(6 条证伪线);(3) Isolation-as-First-Class「边界」作为一阶原语 但缺 isolation strength metric(L1 证伪线 ⭐⭐⭐⭐⭐)+ 5 边界之间相互作用被简化(L2)+ isolation-by-construction 与现有防御体系可结合性未充分评估(L3)+ 缺跨语言/跨模态攻击统一视角(L4)+「首次失效边界」归因存在循环性(L5);(4) 三联立标与 v35 §2.98 PRO-LONG(沿用 flyp 7-24 1550 PRO-LONG critical-read)head-to-head 数据待补(Agentic Context Management「存储检索框架扩展」立场 vs PRO-LONG「反 storage-and-retrieval」立场) |
| 建议归入节 |
§1.1 v36 fresh signals 5 段新增 2(Agent 范式转折三联立标首日达成);§1.2 主线 ② Personal Assistant Agent 第四十一~四十三节点候选池(记忆 + 训练 + 安全 survey anchor);§1.2 主线 ⑤ Application-layer Reliability 第六十三维候选(agent 安全 survey anchor 边界中心组织);§1.3 补丁 ㉖ ㉗ 跨主线整合扩展 + 新补丁 ㉜ Agent 范式转折三联立标候选;§3.1 共识 #125-#127 候选新增(Agent 范式转折三联立标 + train-deploy mismatch proxy 范式 + agent 安全边界中心);§3.3 反方 #117-#124 候选新增(Isolation 5 边界 vs 攻击类型组织);§0.5 试金石 arXiv ID 列表 新增 3 件(2607.21503 + 2607.21557 + 2607.12406) |
| 重要边界 |
不要与 v35 §1.2 主线 ② 候选池已有 Hypernetwork Scaling Laws + IteraSim + DocOps 混淆:这些是已固化候选,本次三联立标是 v36 新候选 = v35 vs v36 不同窗口;不要与 v35 §1.3 补丁 ㉗ SafeKV + PrefixWall 混淆:后者是运行时层时序攻击,三联立标是模型层 + 训练层 + 安全 survey = 运行时 vs 模型/训练/安全 不同层;不要与 v35 §1.2 主线 ① Coding Agent pi-mono 混淆:pi-mono 是 Coding Agent 工具链,OpenForgeRL 是 Agent 训练基础设施 = 工具链 vs 训练基础设施 不同层 |
增量 3 · 🟡 高优 · HF Daily 2026-07-25 头条 AREX arXiv:2607.21461(117▲)+ SLAI T-Rex arXiv:2607.20145(56▲)+ NVIDIA OO Agents arXiv:2607.20709(19▲)+ Tencent WorkBuddy Bench arXiv:2607.20911(18▲) = HF Daily「agent + 中国算力主权 + Agent 编程范式 + 抗污染基准」四面立标合流
| 字段 |
内容 |
| 来源 |
inbox/tom/2026-07-25-0900-hf-daily-2026-07-25.md(15 篇精选按社区票数排序)+ inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.3(完整 9 件 net-new 列表 + SLAI T-Rex 中国算力主权合流细节) + inbox/flyp/2026-07-25-multimodal-e1prep.md §1.4 |
| arXiv 号 |
arXiv:2607.21461(AREX · BAAI · 117▲ 当日 #1 · 未建卡)+ arXiv:2607.20145(SLAI T-Rex · 56▲ · 未建卡)+ arXiv:2607.20709(NVIDIA-labs OO Agents · 19▲ · 未建卡)+ arXiv:2607.20911(Tencent WorkBuddy Bench · 18▲ · 未建卡) |
| 一句话 |
HF Daily 7-25 头条 AREX「面向深度研究的递归自我改进 Agent · BAAI · bi-level 架构利用 discovery/verification 不对称」= 「agent 自我改进 + 深度研究」双栖立标候选 + HF Daily 当日 #1 最高票;SLAI T-Rex「在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练」= 「中国算力主权 × 开源模型主权」合流立标;NVIDIA OO Agents「原生 Python 面向对象 Agents」= 「Agent 编程范式从函数式到 OO」立标候选;Tencent WorkBuddy Bench「抗污染任务构建的多领域 Coding-Agent 基准」= 「腾讯 + Coding-Agent 基准 + 抗污染」立标候选 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ① Coding Agent 第二十三节点候选池(pi-mono)—— Tencent WorkBuddy Bench = v36 §1.2 主线 ① 第二十四节点候选(中国厂商 Coding-Agent 抗污染基准 立标);v35 §1.2 主线 ② 第三十九~四十节点候选(Colibri + 推理引擎 benchmark)—— NVIDIA OO Agents = v36 §1.2 主线 ② 第四十四节点候选(Agent 编程范式从函数式到 OO 立标);v35 §3.1 共识 #120 frontier lab 三厂 12 件全栈立标合流 —— SLAI T-Rex = v36 §3.1 共识 #128 候选(中国算力主权 × 开源模型主权合流立标);v35 §3.2 争议 #88「开源吸纳大部分 AI 资金 = Nathan Lambert 立场 2.0」—— AREX + SLAI T-Rex = v36 §3.2 争议 #123 候选(中国算力主权对开源-闭源差距讨论机制化) |
| 反方/风险 |
(1) 9 件 net-new arXiv 标题全文 + GitHub 开源状态待核;(2) AREX 7-25 当日 #1 117▲ 但未建卡,paper_cards 缺;(3) SLAI T-Rex「Ascend SuperPOD」是否华为官方 vs 学术合作未给;(4) NVIDIA OO Agents vs v35 §2.5 LangGraph + LangChain 对比 待补;(5) Tencent WorkBuddy Bench 抗污染任务构建方法学 + vs SWE-bench Pro 对比 待核;(6) BAAI AREX「递归自我改进」+ DeepSeek-V4 后训练 全部为 7-25 当日新立标,需要 7-26 跨实例核验 |
| 建议归入节 |
§1.1 v36 fresh signals 5 段新增 3(HF Daily 7-25 四面立标合流);§1.2 主线 ① Coding Agent 第二十四节点候选(Tencent WorkBuddy Bench 抗污染基准);§1.2 主线 ② Personal Assistant Agent 第四十四节点候选(NVIDIA OO Agents 编程范式);§1.2 主线 ⑤ 第六十四维候选(AREX agent 自我改进范式从静态 prompt 到动态权重 第 2 例);§3.1 共识 #128 候选(中国算力主权 × 开源模型主权合流);§0.5 试金石 arXiv ID 列表 新增 4 件 |
| 重要边界 |
不要与 v35 §1.2 主线 ① pi-mono 混淆:pi-mono 是 43.9k⭐ 完整 monorepo,Tencent WorkBuddy Bench 是抗污染基准 = 工具链 vs 基准 不同类型;不要与 v35 §1.2 主线 ② 推理引擎候选混淆:Colibri 是消费级 PC 运行 744B MoE,NVIDIA OO Agents 是编程范式 = 推理 vs 编程 不同层;不要与 v35 §3.2 争议 #88 Nathan Lambert 立场 2.0 混淆:Nathan Lambert 是国际评论层,SLAI T-Rex 是中国算力主权合流 = 国际 vs 中国 不同视角 |
增量 4 · 🟡 高优 · Agent 生产失败三模式(Dumb RAG + Brittle Connectors + Compounding Error 0.85^10≈0.197)+ Gartner 2027 40% Agentic AI 项目废弃预测 = RAG / Agent 生产可靠性量化数字立标
| 字段 |
内容 |
| 来源 |
inbox/jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md(theaiengineer.substack.com · Paolo Perrone · ⭐⭐⭐⭐ 可信度)+ inbox/jay/2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md RAG 四大失效模式(AI Vanguard)+ inbox/jay/2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md 企业 Agentic AI 五大失效模式(ForgeWorkflows · McKinsey 调研)+ inbox/spark/2026-07-25-agent-e1prep.md §增量 8 + inbox/stephen/2026-07-25-1245-stephen-coordination-check-noon.md §1.3(jay engineering-e1prep 6 增量印证) |
| arXiv 号 |
无 arXiv(Substack + Gartner 预测 + McKinsey 调研) |
| 一句话 |
Agent 生产失败三模式:① Dumb RAG「Agent 检索低质量上下文却以完整置信度陈述并行动」= 解法:独立评估 pipeline + 引用溯源;② Brittle Connectors「凭证过期/Schema 变更/API 版本」= 解法:熔断 + Fallback + 凭证监控 + Schema 版本固定;③ Compounding Error「每步 85% 准确率,10 步工作流成功率仅 20%(0.85^10 ≈ 0.197)」= 解法:减少不必要步骤 + 每步验证 + 短路机制;关键洞察:确定性系统失败是 loud(报错可见),Agent 失败是 quiet(静默累积误差);Gartner 预测:2027 年 40% Agentic AI 项目将被废弃;RAG 四大失效模式(AI Vanguard):Chunk boundary / Embedding model mismatch / Reranking absence / Context window saturation;企业 Agentic AI 五大失效模式(McKinsey):Flat architecture / 规则缺失 / 治理框架缺失 / 与业务流程未集成 / 可观测性缺失 |
| 与活文档现有脉络的关系 |
v35 §1.1 ④「评测方法学反思 5 → 7 件套补完」沿用 + v35 §1.2 主线 ⑤ 第五十九~六十二维候选 —— Compounding Error 0.85^10≈0.197 = v36 §1.2 主线 ⑤ 第六十五维候选(Multi-Agent 可靠性量化公式);v35 §3.1 共识 #120 frontier lab 三厂 12 件全栈立标合流 —— Agent 失败三模式 = v36 §3.1 共识 #129 候选(Agent 失败 = 静默累积误差 quiet failure 而非确定性报错 loud failure);v35 §3.3 反方 #100(A)「内部攻击面 vs 外部攻击面边界」直接关联(Compounding Error = 内部多步误差累积 = 内部攻击面);v35 §3.3 反方 #112「OpenAI Presence vs Anthropic Project Glasswing 边界」间接关联(Microsoft MAF Harness = Glasswing 风格生产级 SDK) |
| 反方/风险 |
(1) 0.85 准确率数字来源未明确(哪个 benchmark / 何种任务);(2) 10 步工作流代表性问题(真实生产环境可能是 50+ 步);(3)「quiet failure」与「loud failure」区分缺乏形式化定义;(4) Gartner 40% 废弃预测 vs Berkeley RDI 2027 末 40% 取消风险预测是否同源未交叉核验(v35 §2.7 待核);(5) McKinsey 调研一手数据待 PDF 核;(6) 五大失效模式 vs OWASP ASI01-ASI10 防御清单对比待补 |
| 建议归入节 |
§1.2 主线 ⑤ Application-layer Reliability 第六十五维候选(Compounding Error 量化公式);§3.1 共识 #129 候选(Agent 失败 = quiet failure 而非 loud failure);§3.2 争议 #124 候选(Gartner 40% 废弃 vs Berkeley RDI 40% 取消);§1.3 补丁 ㉝ Agent 生产可靠性量化立标 候选(新补丁) |
| 重要边界 |
不要与 v35 §1.2 主线 ⑤ DocOps / EduPanel 混淆:后者是评测方法学,Compounding Error 是生产失败量化 = 评测 vs 生产 不同层;不要与 v35 §3.3 反方 #100(A) 混淆:反方 #100(A) 是攻击面分类,Compounding Error 是失败机制量化 = 攻击面 vs 失败机制 不同维度 |
增量 5 · ⭐ 重要补强 · Microsoft MAF Harness BUILD 2026 + Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)+ LangGraph + MCP + Google ADK Go 2.0 DAG 编排 = 「商业 Harness vs 学术 Harness」立标新维度 + 企业级 Multi-Agent 生产案例 + 多框架横向对比三栖立标
| 字段 |
内容 |
| 来源 |
inbox/jay/2026-07-25-1055-jay-engineering-filter.md(Microsoft MAF Harness)+ inbox/jay/2026-07-25-1105-db-backend-cloudnative-inference-briefing.md(Enterprise LLM Agent 三层架构 · CSDN 智能体开发者社区 2026-07-11 · 文心快码 Multi-Agent 矩阵)+ inbox/jay/2026-07-25-csdn-supplement-agentic-rag-mcp-finetune.md(Google ADK Go 2.0 · CSDN 2026-07-02 · 1.8k 阅读 · DAG 编排)+ inbox/jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md(Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效 · SocialCrawl.ai)+ inbox/jay/2026-07-25-engineering-e1prep.md §1.3 + §1.4 |
| arXiv 号 |
无 arXiv(均为商业框架 + CSDN 源码 + Substack) |
| 一句话 |
Microsoft MAF Harness 生产级 SDK(shell/filesystem 访问 + human-in-the-loop 审批流 + 长时会话上下文管理 + MCP 一体化 + .NET/Python 双语言)+ Enterprise LLM Agent 三层架构(Plan Agent 意图分解 + Architect Agent 技术方案设计 + Zulu Agent LangGraph 状态机驱动执行引擎 + 验证循环)+ Google ADK Go 2.0 DAG 编排(2026-07-02 发布 · 工作流引擎从线性链升级为 DAG 有向无环图 · 每个 Agent 调用/条件分支/并行分叉定义为图节点)+ 文心快码 / Microsoft MAF / AWS Blocks 三家框架横向对比(单 Agent 时代已过, 多 Agent 编排 + 生产级可靠性是主战场)= 「商业 Harness vs 学术 Harness」立标新维度 + 企业级 Multi-Agent 生产案例 + 多框架横向对比 三栖立标 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ① Coding Agent 第二十三节点候选(pi-mono)—— Enterprise LLM Agent 三层架构 = v36 §1.2 主线 ① 第二十五节点候选(企业级 Multi-Agent 生产案例 · Plan/Architect/Zulu);v35 §1.3 补丁 ㉘ 推理引擎 6 维度对比表 + AI Agent Stack 6 层 —— Microsoft MAF Harness = v36 §1.3 补丁 ㉘ 商业 Harness SDK 候选 + Google ADK Go 2.0 = DAG 编排新增;v35 §3.1 共识 #124 frontier lab MCP 三栖 —— Microsoft MAF Harness 一体化 MCP = v36 §3.1 共识 #130 候选(企业级 MCP 一体化 SDK);v35 §3.3 反方 #112「OpenAI Presence vs Anthropic Project Glasswing 边界」直接关联(MAF Harness = Glasswing 风格「商业 Harness SDK」 实现) |
| 反方/风险 |
(1) Microsoft MAF Harness ./harness 样本 GitHub 仓库实际 API 待核;(2) Klarna 案例第三方汇总数据, 一手 Klarna 财报数据待核;(3) Enterprise LLM Agent 三层架构 CSDN 案例 vs v35 §1.2 主线 ① 候选池 对比表待补;(4) Google ADK Go 2.0 DAG 编排 vs v35 §1.2 主线 ① LangGraph 对比 待补;(5) 文心快码 / Microsoft MAF / AWS Blocks 三家框架 GitHub Star 数 + commits 活跃度 + 是否有生产案例 待核 |
| 建议归入节 |
§1.2 主线 ① Coding Agent 第二十五节点候选(Enterprise LLM Agent 三层架构);§1.3 补丁 ㉘ 商业 Harness SDK 候选 + Google ADK Go 2.0 DAG 编排;§3.1 共识 #130 候选(企业级 MCP 一体化 SDK);§3.3 反方 #112 部分解除(MAF Harness = Glasswing 风格商业实现);§0.5 GitHub 列表 新增 3 件 |
| 重要边界 |
不要与 v35 §1.2 主线 ① pi-mono 混淆:pi-mono 是 monorepo 工具链,MAF Harness 是商业 SDK + 验证流 = 工具链 vs SDK 不同类型;不要与 v35 §1.3 补丁 ㉘ HF Sandboxes 混淆:HF Sandboxes 是模型仓库侧零信任执行,MAF Harness 是商业 SDK = 模型仓库 vs 商业 SDK 不同象限 |
增量 6 · ⭐ 重要补强 · TurboQuant arXiv:2504.19874 + VeriCache arXiv:2605.17613 + QuantSpec = KV Cache 压缩三件套 2026 H2 立标 + vLLM MRV2 GB200 56% + 完整 H1 新功能集 = vLLM Inference OS 升格量化立标
| 字段 |
内容 |
| 来源 |
inbox/jay/2026-07-25-1735-evening-rag-inference-stack-jul2026-substack-hf-trending.md §二(TurboQuant 详细)+ inbox/jay/2026-07-25-1335-afternoon-substack-hf-inference-csdn-briefing.md 条目 QuantSpec + inbox/jay/2026-07-25-1105-db-backend-cloudnative-inference-briefing.md 条目 VeriCache + inbox/spark/2026-07-25-llm-infra-e1prep.md 增量 2 + 增量 3(完整版本)+ inbox/jay/2026-07-25-engineering-e1prep.md §1.1 |
| arXiv 号 |
arXiv:2504.19874(TurboQuant · Google Research · ICLR 2026)+ arXiv:2605.17613(VeriCache · 2026-05)+ vLLM MRV2 完整新功能集(7 项)+ Zylos 量化矩阵(FP8/AWQ/GPTQ/GGUF/INT8 5 路线) |
| 一句话 |
TurboQuant 核心技术:PolarQuant(向量旋转变换的坐标变换)+ QJL(Quantized Johnson-Lindenstrauss,1-bit 残差校正);3-bit KV Cache(Key 3-bit + Value 2-bit,无精度损失);性能数据(H100,70B 模型):KV Cache 内存压缩 6×(40GB → ~7GB for 128K context)+ Attention 计算加速 8×;VeriCache:压缩 KV Cache(4×4 compaction)+ 用压缩后 KV 做 self-draft,不引入新模型;接受长度 Qwen-32B ~19 / Llama-70B ~23(EAGLE 仅 2-22);vLLM MRV2:GPU-native Triton kernels + async scheduling + GB200 实测最高 56% 吞吐提升(需显式启用 VLLM_USE_V2_MODEL_RUNNER=1);vLLM 2026 H1 完整新功能集:MRV2 + FP8 inference + NGram GPU speculative decoding + Chunked Prefill 默认 + Native RL APIs + Disaggregated Serving 实验性 + Ascend 950 支持 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ② Personal Assistant Agent 第四十节点候选池(vLLM v2/SGLang/TRT-LLM 2026 benchmark)—— vLLM MRV2 56% + 完整 H1 新功能集 = v36 §1.2 主线 ② 第四十五节点候选(vLLM Inference OS 升格量化立标);v35 §1.3 补丁 ㉘ 推理引擎 6 维度对比表 —— TurboQuant + VeriCache = v36 §1.3 补丁 ㉘ 邻接(KV Cache 压缩三件套 2026 H2 立标);v35 §0.5 arXiv ID 列表 沿用(FlashAttention-4 arXiv:2603.05451)+ v36 新增 TurboQuant arXiv:2504.19874 + VeriCache arXiv:2605.17613 |
| 反方/风险 |
(1) TurboQuant 与香农极限差距 ≈2.7× 是否真能再压 待核;(2) VeriCache 4×4 compaction 与现有 KV cache 压缩方法(AsymCache MSA TTFT 1.90-2.03×)对比 待补;(3) vLLM MRV2 56% 性能 vs 硬件依赖性(GB200 vs H100 vs B200)待独立 benchmark;(4) vLLM 7 项新功能 production enterprise adoption 时点未给;(5) Zylos 量化矩阵 vs llm-compressor / TensorRT-LLM 量化工具对比 待补 |
| 建议归入节 |
§1.2 主线 ② Personal Assistant Agent 第四十五节点候选(vLLM MRV2 56% + 完整 H1 新功能集);§1.3 补丁 ㉘ KV Cache 压缩三件套邻接补完;§0.5 试金石 arXiv ID 列表 新增 TurboQuant arXiv:2504.19874 + VeriCache arXiv:2605.17613 |
| 重要边界 |
不要与 v35 §1.3 补丁 ㉗ SafeKV + PrefixWall KV Cache Side-Channel 混淆:后者是运行时层时序攻击(安全方向),TurboQuant + VeriCache 是 KV Cache 压缩(性能方向) = 安全 vs 性能 不同方向;不要与 v35 §1.2 主线 ② vLLM v2/SGLang/TRT-LLM 2026 benchmark 混淆:vLLM v2 是 v35 候选池,vLLM MRV2 是 7-25 新立标 = v35 vs v36 不同窗口 |
增量 7 · ⭐ 重要补强 · MSR SkillOpt + Memora 7-25 双连发 + AREX arXiv:2607.21461 + Agentic Context Management = Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示 → 动态权重 四栖立标合流
| 字段 |
内容 |
| 来源 |
inbox/jay/2026-07-25-1002-rss-msr-blog.md(5 条 · SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt)+ inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5(完整)+ inbox/tom/2026-07-25-0900-hf-daily-2026-07-25.md AREX 117▲ + paper_cards/564-2607-21503.md(已立) |
| arXiv 号 |
SkillOpt + Memora 完整论文链接待核 + arXiv:2607.21461 AREX + arXiv:2607.21503 Agentic Context Management(已立) |
| 一句话 |
MSR 7-25 双连发:① SkillOpt「将 Skill 编辑转化为训练过程(Skill 作为可训练参数, Agent 自我改进范式从静态 prompt → Skill 训练参数)」;② Memora「谐波记忆表示(在抽象性与具体性之间取得平衡)」;AREX arXiv:2607.21461「面向深度研究的递归自我改进 Agent · BAAI · bi-level 架构利用 discovery/verification 不对称」= 「agent 自我改进 + 深度研究」双栖立标;Agentic Context Management 5 primitives(architecting/ingesting/scoping/anticipating/compacting)= 「storage-and-retrieval → lifecycle + architecture」范式转折 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ② Personal Assistant Agent 第四十一~四十三节点候选(本次三联立标补全)—— SkillOpt + Memora = v36 §1.2 主线 ② 第四十六节点候选(MSR Agent 自我改进范式双栖);v35 §1.1 ②「评测方法学反思 5 → 7 件套补完」—— Agentic Context Management 范式转折 = v36 §1.1 ⑤ 候选新增;v35 §3.1 共识 #120 frontier lab 三厂 12 件全栈立标合流 —— AREX + SkillOpt + Memora = v36 §3.1 共识 #131 候选(Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示 → 动态权重 四栖立标) |
| 反方/风险 |
(1) SkillOpt + Memora MSR 完整论文链接待核;(2) AREX 7-25 当日 #1 但未建卡,paper_cards 缺;(3) SkillOpt 训练数据规模 + Memora 谐波记忆表示与现有 RAG / 上下文压缩技术对比 待核;(4) AREX 「递归自我改进」与 v35 §1.2 主线 ② 候选 OpenForgeRL 训练基础设施关系 待核 |
| 建议归入节 |
§1.2 主线 ② Personal Assistant Agent 第四十六节点候选(MSR SkillOpt + Memora);§3.1 共识 #131 候选(Agent 自我改进范式四栖立标);§0.5 试金石 arXiv ID 列表 新增 AREX arXiv:2607.21461 |
| 重要边界 |
不要与 v35 §1.2 主线 ② Hypernetwork Scaling Laws 混淆:Hypernetwork 是训练时知识注入权重层更新,SkillOpt 是运行时 Skill 训练参数 = 训练时 vs 运行时 不同层;不要与 v35 §1.2 主线 ② Agentic Context Management 混淆:ACM 是上下文生命周期,Memora 是谐波记忆表示 = 上下文 vs 记忆 不同层 |
增量 8 · 🟡 高优 · MSR Sample-Efficient Learning arXiv:2607.21051(paper_card 567)+ Lilian Weng 7-25「自我改进 Harness 工程」+ Raschka「推理 effort 训练/推理时机制」+ Cameron Wolfe 7-25 agentic 三连 = Agent 范式立场层立标与训练基础设施延伸
| 字段 |
内容 |
| 来源 |
paper_cards/567-2607-21051.md(已立)+ inbox/jay/2026-07-25-1001-rss-lilian-weng.md(自我改进的 Harness 工程)+ inbox/jay/2026-07-25-1000-rss-raschka.md(训练时与推理时机制)+ inbox/flyp/2026-07-25-1000-rss-cameron-wolfe.md(Agentic World Models + Agentic RL + Agent 评估详尽指南 三连)+ inbox/jay/2026-07-25-1140-news-x-tech-radar.md #1(Raschta)+ inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5 P1 旁证(Nathan Lambert 开源模型综述 podcast) |
| arXiv 号 |
arXiv:2607.21051(Sample-Efficient Learning from Agent Experience · 2026-07-23)+ Raschka + Lilian Weng + Cameron Wolfe(blog post 无 arXiv) |
| 一句话 |
Sample-Efficient Learning from Agent Experience「in-context learning 一旦经验从上下文移除则增益消失 · context distillation 应用于 Agent 交互历史且不牺牲环境样本效率仍未被充分探索」= 「agent 经验学习 = in-context + context distillation 双栖」;Lilian Weng 7-25「自我改进 Harness 工程」:RSI(递归自我改进)概念历史追溯 I. J. Good 1965 + Harness 工程定义 + 2026 年重要性 = 「RSI · 超智能 · Harness 工程」三栖立标;Raschka「推理 effort 控制:训练时与推理时机制详解」:详细解释 LLM 如何在推理时/训练时切换低/中/高度推理 effort + 完整技术文章 + 280K 播放 Jul 18;Cameron Wolfe 7-25 agentic 三连:Agentic World Models + Agentic RL + Agent 评估详尽指南 = 「agentic 系列三连立标」 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ② 第四十一~四十三节点候选(本次三联立标补全)—— Sample-Efficient Learning = v36 §1.2 主线 ② 第四十七节点候选(agent 经验学习 in-context + context distillation);v35 §1.1 ③「vertical LLM 市场 + Agent Harness 工业化集中爆发期 12 件」—— Lilian Weng 自我改进 Harness 工程 = v36 §1.1 ⑥ 候选新增(立场层立标);v35 §3.2 争议 #88「开源吸纳大部分 AI 资金 = Nathan Lambert 立场 2.0」—— Nathan Lambert 立场 2.0 第 2 期 podcast + Xi WAIC 演讲 = v36 §3.2 争议 #125 候选(中国主权 AI 立场官方升格 + 国际评论层) |
| 反方/风险 |
(1) Lilian Weng 7-25 blog post 无正式 arXiv;(2) Cameron Wolfe 三连 blog post 无正式 arXiv;(3) Sample-Efficient Learning 经验性(ICL → SFT 蒸馏效率)vs v35 §1.2 主线 ② 候选池方法学新意 待核;(4) Nathan Lambert podcast 第 2 期 vs 第 1 期 (v35 §3.2 争议 88)对比 待核;(5) Xi WAIC 演讲具体日期 + 演讲内容核心信号 待核;(6) Raschka 280K 播放 vs 实际学术影响力 待核 |
| 建议归入节 |
§1.2 主线 ② Personal Assistant Agent 第四十七节点候选(Sample-Efficient Learning);§1.1 ⑥ v36 fresh signals 候选新增(Lilian Weng 立场层立标);§3.2 争议 #125 候选(中国主权 AI 立场官方升格 + 国际评论层) |
| 重要边界 |
不要与 v35 §1.2 主线 ② Agentic Context Management 混淆:ACM 是上下文生命周期 5 primitives,Sample-Efficient Learning 是经验学习 ICL + context distillation = 上下文 vs 经验 不同层;不要与 v35 §1.2 主线 ② OpenForgeRL 混淆:OpenForgeRL 是训练基础设施,Sample-Efficient Learning 是经验学习方法 = 基础设施 vs 方法 不同层 |
增量 9(旁证)· CNCF llm-d 正式入 CNCF Sandbox + K8s 自托管 vLLM 官方手册 + KubeCon EU 2026 KAR v1.35 + Cloud Native Model Distribution = CNCF K8s AI 推理事实标准全面立标
| 字段 |
内容 |
| 来源 |
inbox/jay/2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md 条目 1/2/3 + inbox/jay/2026-07-25-1105-db-backend-cloudnative-inference-briefing.md 条目 Cloud Native Model Distribution + inbox/spark/2026-07-25-llm-infra-e1prep.md 增量 1(完整版) |
| arXiv 号 |
无 arXiv(CNCF 官方博客 + K8s manifest) |
| 一句话 |
llm-d 加入 CNCF Sandbox(2026-03-24 公告):Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA 创始;使命 any model, any accelerator, any cloud;核心技术 Disaggregated prefill/decode(PD 分离)+ LeaderWorkerSet(LWS)+ DisaggregatedSet operator(Mistral AI 贡献);CNCF 官方「Kubernetes 运行自托管 vLLM」(2026-07-16):LINSTOR CSI + K8s 三资源 manifest(PVC + Secret + Deployment + Service);KubeCon EU 2026 关键发布:KAR v1.35 + KRO + Agentic Sandbox 可移植性 + 82% 容器用户生产运行 K8s + 66% 托管生成式 AI 组织使用 K8s 推理;Cloud Native AI Model Distribution:Harbor + Dragonfly + Model CSI Driver + ORAS 四步流水线 |
| 与活文档现有脉络的关系 |
v35 §1.2 主线 ② 第四十节点候选池(vLLM v2/SGLang/TRT-LLM 2026 benchmark)—— CNCF llm-d 完整立标 = v36 §1.2 主线 ② 第四十八节点候选(K8s AI 推理事实标准栈);v35 §1.3 补丁 ㉘ 推理引擎 6 维度对比表 —— Cloud Native Model Distribution = v36 §1.3 补丁 ㉘ 邻接(CNCF 模型交付基础设施标准化) |
| 建议归入节 |
§1.2 主线 ② Personal Assistant Agent 第四十八节点候选(CNCF K8s AI 推理事实标准栈);§1.3 补丁 ㉘ 邻接(Cloud Native Model Distribution 四步流水线) |
| 重要边界 |
不要与 v35 §1.2 主线 ② 推理引擎候选混淆:推理引擎候选是 vLLM v2 / SGLang / TRT-LLM,CNCF llm-d 是 K8s 编排层 = 推理引擎 vs 编排层 不同层;不要与 v35 §1.3 补丁 ㉘ AI Agent Stack 6 层混淆:AI Agent Stack 是 Agent 应用栈,CNCF 是基础设施栈 = 应用栈 vs 基础设施栈 不同层 |
增量 10(旁证)· Frontier lab 7-25 第 4 日 30+ 件延续确认(Anthropic Opus 5 + Economic Index/Fund 5 件 + DeepMind Gemini 3.5 Flash Cyber 沿用 + OpenAI ChatGPT Health 沿用 + HF Daily 7-25 头条 AREX + SLAI T-Rex) + Boris Cherny 评论层二次立标 = frontier lab 立标密度第 4 日高峰
| 字段 |
内容 |
| 来源 |
inbox/stephen/2026-07-25-ai-industry-e1prep.md 完整 §1.1-§1.5 + inbox/stephen/2026-07-25-1003-news-anthropic-news.md + inbox/stephen/2026-07-25-1003-news-deepmind-news.md + inbox/stephen/2026-07-25-1003-news-openai-news.md + inbox/stephen/2026-07-25-1003-news-tldr-ai.md + inbox/jay/2026-07-25-1000-rss-simon-willison.md |
| arXiv 号 |
无 arXiv(frontier lab 一手公告) |
| 一句话 |
frontier lab 7-25 早场 30+ 件一手公告 + 1 条评论层二次立标(Boris Cherny Opus 5 评论)+ 1 条 HuggingFace Daily 头条 AREX 117▲ + SLAI T-Rex 56▲;Anthropic 5 件(Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index + Economic Futures Research Fund + Anthropic 7-14 X 引语价值观 3000+ 跨模型聚类 4 主轴 + 加拿大 4.4 倍 + 1000 万 CAD);DeepMind 5 件(Gemini 3.5 Flash Cyber 沿用 + Isomorphic + ATL Saathi + 2 件新);OpenAI 5 件(ChatGPT Health 沿用 + Effingham County 沿用 + 新闻机构 沿用 + 国家科学发展 沿用 + OpenAI Presence 沿用);HF Daily 7-25 头条 AREX 117▲ + SLAI T-Rex 56▲ + ReferTrack 44▲ + 视觉对比自蒸馏 41▲ + K12-KGraph 40▲ + Subliminal Clocks 38▲ + Show Don't Tell 34▲ + Self Gradient Forcing 30▲ + 超越相关性中心 27▲ + ActiveVision 24▲ + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ + Color Pass-Through 17▲ + SANA-Video 2.0 15▲ + LLM 演化用户意图 15▲ |
| 与活文档现有脉络的关系 |
v35 §1.3 补丁 ㉚ frontier lab 7-24 第 3 日 25 件全栈立标合流延续 —— 7-25 第 4 日 30+ 件延续 = v36 §1.3 补丁 ㉚ 沿用 + Boris Cherny 评论层二次立标新增;v35 §1.1 fresh signals #4 评测方法学反思 5 → 7 件套 沿用 —— 评论层二次立标 = v36 §1.1 ⑦ 候选新增(frontier lab 评论层升格) |
| 建议归入节 |
§1.3 补丁 ㉚ frontier lab 第 4 日 30+ 件延续确认;§1.1 ⑦ 评论层二次立标候选新增 |
| 重要边界 |
不要与 v35 §1.3 补丁 ㉚ frontier lab 第 3 日 25 件混淆:第 3 日是 7-24,第 4 日是 7-25 = 不同日 |
2. 与 v35 活文档已有 v35 候选池条目映射
| v35 候选池节点 |
7-25 22.5h 窗口新增引用 |
v36 沿用候选判断 |
| §0.5 v35 候选池 arXiv 9 项(SafeKV 2508.08438v2 + PrefixWall 2603.10726v2 + A-RAG 2602.03442 + xMemory 2602.02007 + UniAI-GraphRAG 2603.25152 + HERA 2604.00901v1 + HM-RAG 2504.12330v1 + Multimodal RAG Survey 2510.15253v2 + FlashAttention-4 2603.05451) |
7-25 22.5h 无新 arXiv 证据(均为非 arXiv + 新 arXiv 增量) |
🟢 v36 候选池 = v35 候选池 9 项全部沿用 + v36 新增 8-10 项候选 |
| §0.5 v35 候选池 frontier lab 非 arXiv 8 项(3 MCP CVE + MCP 2026-07-28 规范 + HF Transformers 5.14.0 + MCP Server hf_fs + Sandboxes + Colibri + pi-mono + AI Agent Stack 6 层) |
Anthropic Opus 5 + Economic Index/Fund + Project Pilot + Boris Cherny 评论层二次立标 + frontie lab 第 4 日 30+ 件延续 |
🟢 v36 §1.3 补丁 ㉒ frontier lab 五栖验证候选补全(模型/系统卡/评论/红队/物理 agent) |
| §1.2 主线 ① Coding Agent 第二十三节点(pi-mono) |
Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)+ Tencent WorkBuddy Bench 抗污染基准 + Microsoft MAF Harness BUILD 2026 |
🟡 v36 §1.2 主线 ① 第二十四~二十五节点候选(企业级 Multi-Agent + 抗污染基准) |
| §1.2 主线 ② Personal Assistant Agent 第三十九~四十节点(Colibri + vLLM v2/SGLang/TRT-LLM 2026 benchmark + FlashAttention-4 + AI Agent Stack 6 层 + Agent Observability) |
Agentic Context Management 5 primitives + OpenForgeRL proxy + Isolation 5 边界 + vLLM MRV2 56% + TurboQuant + VeriCache + MSR SkillOpt + Memora + Sample-Efficient Learning + AREX + NVIDIA OO Agents + CNCF llm-d + 完整 H1 新功能集 + Zylos 量化矩阵 |
🟡 v36 §1.2 主线 ② 第四十一~四十八节点候选(三联立标 + 推理 OS + 训练基础设施 + 自我改进 + CNCF K8s 事实标准) |
| §1.2 主线 ③ Vertical LLM 第六十一节点(Gemini 3.5 Flash Cyber) |
7-25 22.5h 无新增 Vertical LLM 立标 |
🟢 v36 §1.2 主线 ③ 沿用 v35 第六十一节点 |
| §1.2 主线 ④ Agentic RAG 第五十九~六十一节点(A-RAG + xMemory + UniAI-GraphRAG) |
7-25 22.5h 无新增 Agentic RAG arXiv 增量 |
🟢 v36 §1.2 主线 ④ 沿用 v35 第五十九~六十一节点 |
| §1.2 主线 ⑤ Application-layer Reliability 第五十九~六十二维(MCP CVE 集群 + MCP 2026-07-28 规范 + SafeKV + PrefixWall) |
Claude Opus 5 prompt injection 鲁棒性 + Isolation 5 边界 survey anchor + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% |
🟡 v36 §1.2 主线 ⑤ 第六十三~六十五维候选(模型层鲁棒性 + 安全 survey + 失败量化) |
| §1.3 补丁 ㉒ frontier lab 平台层 MCP 三栖 |
Anthropic Opus 5 五栖验证(模型/系统卡/评论/红队/物理 agent)+ Economic Index/Fund + Boris Cherny 评论层二次立标 |
🟢 v36 §1.3 补丁 ㉒ frontier lab 五栖验证候选补全 |
| §3.1 共识 #120(frontier lab 三厂 12 件全栈立标合流) |
Anthropic Opus 5 + 7-25 第 4 日 30+ 件延续 + 评论层二次立标 |
🟢 v36 §3.1 共识 #120 沿用 + #125-#131 候选新增 |
| §3.3 反方 #112(OpenAI Presence vs Anthropic Project Glasswing 边界)+ #115(Google Gemini API 远程 MCP 协议兼容性) |
Microsoft MAF Harness = Glasswing 风格商业 SDK + Isolation 5 边界 survey anchor + Claude Opus 5 = 模型本体零信任执行 |
🟢 v36 §3.3 反方 #112 #115 沿用 + 部分解除(MAF Harness 商业 SDK + Opus 5 模型层零信任) |
3. 值得警惕的矛盾或待核实说法
3.1 待核实 · Claude Opus 5 vs Claude Fable 5 关系 + 关键数字待核
- 来源:
inbox/stephen/2026-07-25-ai-industry-e1prep.md §2.2(stephen 已标矛盾)
- 风险:Opus 5 vs Fable 5 是替代 vs 平行产品未明;Opus 5 上下文窗口 / 训练规模 / 训练 token 量 / 价格 / vs GPT-5.6 Sol head-to-head / 显存要求 / 推理芯片支持 全部待核
- 核实路径:Anthropic 官网模型矩阵 + Opus 5 系统卡关键数字 + vs GPT-5.6 Sol head-to-head + Project Pilot 操控无人机规格 + Economic Index 数据是否对外开放
- 建议:v36 §3.3 反方 #119 新增(Claude Opus 5 vs Fable 5 关系 + Boris Cherny 评论出处 PI evals/红队 完整版本 + Project Pilot 规格 + Economic Index 数据访问性 + Economic Futures Research Fund 资助额度)
3.2 待核实 · Agentic Context Management vs PRO-LONG head-to-head
- 来源:
inbox/spark/2026-07-25-agent-e1prep.md 谨慎提醒 #2(stephen 已标矛盾)
- 风险:Agentic Context Management「存储检索框架扩展」立场 vs PRO-LONG「反 storage-and-retrieval」立场 = 两条路径不同
- 核实路径:PDF 核 + Maximem 公司背景未明 + 5 primitives 与现有 57 节点 memory 元方法学对比表
- 建议:v36 §3.2 争议 #97「Agentic Context Management 扩展 storage-and-retrieval vs PRO-LONG 反 storage-and-retrieval」候选新增
3.3 待核实 · OpenForgeRL「任意 harness × 任意环境」与实测「6 harness × 6 基准」覆盖差距大
- 来源:
inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §B.4 证伪线 M1 ⭐⭐⭐⭐⭐
- 风险:未测试的 harness(Cursor/Aider/Cline)可能因 LLM 调用接口不标准、tool schema 差异、消息格式非 OpenAI/Anthropic 兼容而无法被 proxy 拦截
- 核实路径:OpenForgeRL GitHub 公开后跑 OpenForge-Claw 的 ReACT 子任务(R1 复现档位)+ 与 Polar(Xu et al. 2026)对比
- 建议:v36 §3.3 反方 #120 新增(OpenForgeRL「任意 harness × 任意环境」声明 vs 实测 6×6 覆盖差距)
3.4 待核实 · Isolation-as-First-Class「边界」作为一阶原语 但缺 isolation strength metric
- 来源:
inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §A.4 证伪线 L1 ⭐⭐⭐⭐⭐
- 风险:原则是定性的,工程实现时「scoped capability」和「unscoped capability」难以客观区分;defense 强度无法横向比较
- 核实路径:arXiv:2607.12406 PDF 核 + 与 CaMeL / AgentVisor / Parallax / Managed Agents(Anthropic 2026)等具体工作对齐 + isolation strength metric 是否有定量指标
- 建议:v36 §3.3 反方 #121 新增(Isolation 5 边界 = 边界中心新维度但缺 isolation strength metric)
3.5 待核实 · Compounding Error 0.85^10≈0.197 vs 实际生产 50+ 步工作流
- 来源:
inbox/jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md
- 风险:0.85 准确率数字来源未明确(哪个 benchmark 的 85% / 何种任务类型);10 步工作流代表性问题(真实生产环境可能是 50+ 步);「quiet failure」与「loud failure」区分缺乏形式化定义
- 核实路径:Substack 原作者 Paolo Perrone 一手数据 + Gartner 40% 废弃预测 vs Berkeley RDI 2027 末 40% 取消风险预测交叉核验
- 建议:v36 §3.2 争议 #124 候选(Gartner 40% 废弃 vs Berkeley RDI 40% 取消是否同源 + 0.85 准确率数字来源)
3.6 待核实 · Claude Opus 5「prompt injection 最难」vs 红队实际验证数据
- 来源:
inbox/stephen/2026-07-25-1003-news-anthropic-news.md + inbox/jay/2026-07-25-1000-rss-simon-willison.md(Boris Cherny 引语)
- 风险:Boris Cherny 引语出处 PI evals/red team 完整版本待核 + Opus 5 vs GPT-5.6 Sol head-to-head PI 数据待核 + vs HF 7-16 GPT-5.6 Sol 降级护栏环境下被击破对比
- 核实路径:Anthropic Opus 5 系统卡 PI evals 完整版 + 红队验证报告 + Boris Cherny 7-25 评论出处
- 建议:v36 §3.2 争议 #126 候选(Claude Opus 5 prompt injection 最难 vs 红队实际验证数据 + vs HF 7-16 GPT-5.6 Sol 端降级护栏环境下被击破对比)
3.7 待核实 · Microsoft MAF Harness ./harness 样本 GitHub 仓库实际 API
- 来源:
inbox/jay/2026-07-25-1055-jay-engineering-filter.md(jay 已标"需打开 Harness samples GitHub 提取实际 API 代码")
- 风险:当前处于"有框架描述,无具体代码"的中间状态
- 核实路径:Microsoft MAF Harness GitHub samples + Klarna 案例第三方汇总数据 一手 Klarna 财报数据
- 建议:v36 §3.3 反方 #122 新增(MAF Harness
./harness 样本 API vs 框架描述一致性)
3.8 待核实 · TurboQuant 与香农极限差距 ≈2.7× 是否真能再压
- 来源:
inbox/jay/2026-07-25-1735-evening-rag-inference-stack-jul2026-substack-hf-trending.md §二
- 风险:TurboQuant「KV Cache 压缩问题在算法层面已接近解决」判断是否真 + vs v35 §1.3 补丁 ㉗ SafeKV + PrefixWall 协议层 RCE 集群对比
- 核实路径:TurboQuant GitHub 0xSero/turboquant 第三方 Triton kernel + vLLM 集成 已测试 RTX 3090 / RTX 5090
- 建议:v36 §3.3 反方 #123 新增(TurboQuant 接近香农极限 ≈2.7× vs 协议层 RCE 安全方向差异)
3.9 待核实 · vLLM MRV2 56% 性能 vs 硬件依赖性(GB200 vs H100 vs B200)
- 来源:
inbox/jay/2026-07-25-engineering-e1prep.md §矛盾 1
- 风险:SGLang GB300 NVL72 25× 和 vLLM MRV2 GB200 56% 均在不同代际硬件上测得,不可直接横向对比;需区分"代际提升"vs"同代小幅优化"
- 核实路径:vLLM 0.20.2 / 0.23.0rc1 官方 benchmark + Spheron Blog 实测数据
- 建议:v36 §3.3 反方 #127 新增(vLLM MRV2 56% 性能硬件依赖性)
3.10 待核实 · SkillOpt + Memora MSR 完整论文链接 + AREX BAAI 完整 GitHub 仓库
- 来源:
inbox/jay/2026-07-25-1002-rss-msr-blog.md
- 风险:SkillOpt + Memora MSR 完整论文链接待核;AREX 7-25 当日 #1 117▲ 但未建卡
- 核实路径:MSR Blog 完整论文链接 + AREX BAAI GitHub 仓库
- 建议:v36 §3.3 反方 #128 新增(SkillOpt + Memora MSR 完整论文链接待核 + AREX BAAI 完整仓库状态)
4. 涉及 arXiv 号列表(本次新增 + 沿用 v35 候选池)
4.1 v35 候选池 arXiv 9 项(7-25 22.5h 窗口无新增硬证据,沿用)
| arXiv |
标题 |
主分类 |
v36 沿用 |
| arXiv:2508.08438v2 |
SafeKV: API-可感知时序侧信道防御 |
engineering / risk |
🟢 v35 §1.2 主线 ⑤ 第六十二维 + §1.3 补丁 ㉗ 沿用 |
| arXiv:2603.10726v2 |
PrefixWall: APC 侧信道缓解 |
engineering / risk |
🟢 v35 §1.2 主线 ⑤ 第六十二维 + §1.3 补丁 ㉗ 沿用 |
| arXiv:2602.03442 |
A-RAG: 三层分级接口 |
rag |
🟢 v35 §1.2 主线 ④ 第五十九节点 + 补丁 ⑲ 沿用 |
| arXiv:2602.02007 |
xMemory: 语义组件检索 + MemoryArena |
rag / evaluation |
🟢 v35 §1.2 主线 ④ 第六十节点 + 补丁 ⑲ 沿用 |
| arXiv:2603.25152 |
UniAI-GraphRAG: 本体驱动多源融合 |
rag |
🟢 v35 §1.2 主线 ④ 第六十一节点 + 补丁 ⑲ 沿用 |
| arXiv:2604.00901v1 |
HERA: Multi-agent RAG with Evolving Orchestration |
agent + rag |
🟢 v35 §1.2 主线 ④ 邻接 + 补丁 ⑲ 沿用 |
| arXiv:2504.12330v1 |
HM-RAG: Hierarchical Multi-Agent Multimodal RAG |
agent + multimodal + rag |
🟢 v35 §1.2 主线 ④ 邻接 + 补丁 ⑲ 沿用 |
| arXiv:2510.15253v2 |
Multimodal RAG Survey |
multimodal + agent + rag(综述) |
🟢 v35 §1.2 主线 ④ 综述类 + 补丁 ⑲ 沿用 |
| arXiv:2603.05451 |
FlashAttention-4 Blackwell |
engineering |
🟢 v35 §1.2 主线 ② 邻接 + 补丁 ㉘ 沿用 |
4.2 v36 候选池 arXiv 新增候选(本次预消化建议 v36 新增)
| arXiv |
标题 |
主分类 |
建议归入节 |
| arXiv:2607.21503 |
Agentic Context Management: Lifecycle + Architecture Problems |
agent / memory |
§1.2 主线 ② 第四十一节点 + §1.1 v36 fresh signals #2 + §3.1 共识 #125 |
| arXiv:2607.21557 |
OpenForgeRL: Train Harness-native Agents in Any Environment |
agent / systems / training / evaluation |
§1.2 主线 ② 第四十二节点 + §1.1 v36 fresh signals #2 + §3.1 共识 #126 |
| arXiv:2607.12406 |
Isolation as a First-Class Principle for LLM-Agent System Safety |
agent / survey / safety / systems |
§1.2 主线 ⑤ 第六十三维 + §1.1 v36 fresh signals #2 + §3.1 共识 #127 |
| arXiv:2607.21461 |
AREX: 面向深度研究的递归自我改进 Agent |
agent / methods |
§1.2 主线 ② 第四十六节点 + §1.1 v36 fresh signals #3 + §3.1 共识 #131 |
| arXiv:2607.20145 |
SLAI T-Rex: Ascend SuperPOD DeepSeek-V4 后训练 |
llm-infra / methods |
§1.2 主线 ② 邻接(中国算力主权 × 开源模型主权)+ §3.1 共识 #128 |
| arXiv:2607.20709 |
NVIDIA-labs OO Agents: 原生 Python 面向对象 Agents |
agent / methods |
§1.2 主线 ② 第四十四节点(Agent 编程范式从函数式到 OO) |
| arXiv:2607.20911 |
Tencent WorkBuddy Bench: 抗污染任务构建的多领域 Coding-Agent 基准 |
agent / benchmark |
§1.2 主线 ① 第二十四节点(中国厂商 Coding-Agent 抗污染基准) |
| arXiv:2607.21051 |
Sample-Efficient Learning from Agent Experience |
agent / methods |
§1.2 主线 ② 第四十七节点(agent 经验学习 ICL + context distillation) |
| arXiv:2504.19874 |
TurboQuant: 3-bit KV Cache 无损量化 |
engineering / methods |
§1.3 补丁 ㉘ KV Cache 压缩三件套 + §1.2 主线 ② 邻接(ICLR 2026) |
| arXiv:2605.17613 |
VeriCache: 压缩 KV Cache 替代 EAGLE 类 Draft Model |
engineering / methods |
§1.3 补丁 ㉘ KV Cache 压缩三件套 + §1.2 主线 ② 邻接 |
4.3 v36 候选池非 arXiv 新增候选(本次预消化建议 v36 新增)
| 类型 |
标题 |
建议归入节 |
| frontier lab 模型 |
Claude Opus 5 系统卡 + Boris Cherny 「prompt injection 最难」评论 + Project Pilot + Economic Index/Fund |
§1.1 v36 fresh signals #1 + §1.2 主线 ⑤ 第六十三~六十五维 + §3.1 共识 #125 + 补丁 ㉒ 五栖验证候选补全 |
| Agent 范式转折三联立标 |
Agentic Context Management + OpenForgeRL + Isolation-as-First-Class |
§1.1 v36 fresh signals #2 + §1.2 主线 ② 第四十一~四十三节点 + §1.2 主线 ⑤ 第六十三维 + §1.3 补丁 ㉜ |
| HuggingFace Daily 7-25 头条 |
AREX(117▲)+ SLAI T-Rex(56▲)+ NVIDIA OO Agents(19▲)+ Tencent WorkBuddy(18▲) |
§1.1 v36 fresh signals #3 + §1.2 主线 ① 第二十四节点 + §1.2 主线 ② 第四十四~四十六节点 + §3.1 共识 #128 #131 |
| Agent 失败量化 |
Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃 + RAG 四大失效模式 + 企业 Agentic AI 五大失效模式 |
§1.2 主线 ⑤ 第六十五维 + §3.1 共识 #129 + §1.3 补丁 ㉝ Agent 生产可靠性量化立标 候选(新补丁) |
| 商业 Harness SDK |
Microsoft MAF Harness BUILD 2026 + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 DAG 编排 + 文心快码/Microsoft MAF/AWS Blocks 三家框架横向对比 |
§1.2 主线 ① 第二十五节点 + §1.3 补丁 ㉘ 商业 Harness SDK 候选 + §3.1 共识 #130 + §3.3 反方 #112 部分解除 |
| 推理 OS 升格 |
vLLM MRV2 GB200 56% + 2026 H1 完整 7 项新功能集 + Zylos 量化矩阵 + Continuous Batching 23× + FA-3 840 TFLOPS 85% util |
§1.2 主线 ② 第四十五节点(vLLM Inference OS 升格量化立标) |
| CNCF K8s 事实标准 |
llm-d CNCF Sandbox + K8s 自托管 vLLM 官方手册 + KubeCon EU 2026 + Cloud Native Model Distribution 四步流水线 |
§1.2 主线 ② 第四十八节点 + §1.3 补丁 ㉘ 邻接 |
| MSR Agent 自我改进 |
SkillOpt(Skill 训练参数)+ Memora(谐波记忆表示)+ Sample-Efficient Learning + Lilian Weng 自我改进 Harness + Raschka 推理 effort + Cameron Wolfe agentic 三连 + Nathan Lambert 立场 2.0 podcast 第 2 期 + Xi WAIC 演讲 |
§1.2 主线 ② 第四十六~四十七节点 + §1.1 v36 fresh signals #4 #5 #6 + §3.1 共识 #131 + §3.2 争议 #125 |
| frontier lab 第 4 日延续 |
Anthropic Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + DeepMind Gemini 3.5 Flash Cyber 沿用 + OpenAI ChatGPT Health 沿用 + HF Daily 7-25 头条 15 件 + Boris Cherny 评论层二次立标 = 30+ 件 |
§1.3 补丁 ㉚ frontier lab 第 4 日 30+ 件延续 + §1.1 v36 fresh signals #7 评论层二次立标 |
合计 7-25 22.5h 窗口:v35 候选池 9 件 arXiv 沿用 + v36 新增候选 10 件 arXiv(其中 3 件已建卡 = 564 + 585 + 567,7 件未建卡 net-new)+ v36 新增候选 9 件非 arXiv = v36 候选池预计 19 件 arXiv + 17 件非 arXiv = 36 件候选池(v35 候选池 29 件 → v36 候选池 36 件 = 候选池密度 +24%,稳步推进而非 v35 → v35 的 +113% 翻倍,符合「v35 → v36 沿用候选池深度补完」节奏)
5. 检查过的来源(全部)
5.1 inbox stephen(7-25 共 13 份,含延续)
- 7-25 0910 news-x-vip-radar(4.1KB · X 名人雷达通稿 · 12 账号 · Andrew Ng OpenWorker + Anthropic 7-14 价值观 3000+ 跨模型聚类 4 主轴 + 加拿大 4.4 倍 + LeCun 开源风险论)
- 7-25 1002 news-openai-news(5 URL 一手 + OpenAI Presence 沿用 + ChatGPT Health 沿用)
- 7-25 1003 news-anthropic-news(5 URL 一手 · Anthropic Claude Opus 5 系统卡立标 + Economic Index/Fund + Project Pilot + 7-14 X 引语)
- 7-25 1003 news-bens-bites(Ben's Bites 通稿)
- 7-25 1003 news-deepmind-news(5 URL 一手 + Gemini 3.5 Flash Cyber 沿用 + Isomorphic + ATL Saathi)
- 7-25 1003 news-google-ai(5 URL 一手 + Google AI 沿用)
- 7-25 1003 news-hf-blog(5 URL 一手)
- 7-25 1003 news-tldr-ai(TLDR AI 7-24 头条 · ChatGPT Health 🩺 #1 + Fugu-Ultra 1.1 🐡 #2 + Runway Media Router 🎬 #3)
- 7-25 1005 news-yt-anthropic(5 YouTube · 含「介绍 Claude Fable 5」「Project Glasswing」)
- 7-25 1005 news-yt-deepmind(YouTube 通稿)
- 7-25 1005 news-yt-openai(YouTube 通稿)
- 7-25 1245 stephen-coordination-check-noon(协调棒 · 13 件 7-25 当日 + 8 件延续 + 13 件待人工确认)
- 7-25 ai-industry-e1prep(36KB · 5 条 P0 立标 + 3 条 P1 旁证 + 13 件 inbox 全读 + 6 件 paper_cards 抽查 + 活文档基线 v26 §1.1 第 26 版凌晨棒 · 完整 Opus 5 + Boris Cherny 引语 + System Card 第 73 页 + HF Daily 7-25 + Agentic Context Management + Sample-Efficient Learning + Microsoft SkillOpt + Memora + RRB + Andrew Ng OpenWorker)
- 7-24 llm-application-e1prep(2026-07-24 21:10 立标级 · 沿 v35 → v36 候选池 8 条增量 · v35 候选池 9 件 arXiv + 8 件非 arXiv 的源出处 + 25 件 frontier lab 第 3 日延续)
5.2 inbox jay(7-25 共 27 份,5 实例中规模最大)
- 7-25 1000 bytebytego(RSS · 构建生产 AI Agent 最佳实践)
- 7-25 1000 nathan-benaich(RSS)
- 7-25 1000 raschka(RSS · 推理 effort 控制:训练时与推理时机制详解 + 280K 播放)
- 7-25 1000 simon-willison(RSS · Boris Cherny Opus 5 评论 3 条)
- 7-25 1001 cool-papers-ir + cool-papers(Cool Papers · 高维 LLM Embedding ANNS 挑战赛 SISAP 2026)
- 7-25 1001 lilian-weng(RSS · 自我改进 Harness 工程)
- 7-25 1002 import-ai + msr-blog(MSR Blog · SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流)
- 7-25 1005 yt-fireship(YouTube)
- 7-25 1055 jay-engineering-filter(Microsoft MAF Harness BUILD 2026 + harness 实战)
- 7-25 1105 db-backend-cloudnative-inference-briefing(17KB · vLLM MRV2 56% + VeriCache + Cloud Native Model Distribution + Enterprise LLM Agent 三层架构 + RAG 生产 + 向量库 2026 + Zylos 量化矩阵)
- 7-25 1105 substack-agents-production-failure-a2a-cua(8KB · theaiengineer.substack.com · Agent 生产失败三模式 + A2A/CUA 协议评估)
- 7-25 1140 news-x-tech-radar(X 硬核干货雷达 · 12 账号 · Raschka + omarsar0 + raft_hq + PrimeIntellect + ParseBench)
- 7-25 1335 afternoon-substack-hf-inference-csdn-briefing(Pragmatic Engineer inference engineering 定义 + OWASP Agent 双谱系 + SGLang 杀 TGI + QuantSpec + OpenClaw 210k)
- 7-25 1450 jay-engineering-filter-p2(Zylos FP8 33% + Continuous Batching 23× + FA-3 840 TFLOPS 85% util + Blockify 78x/40x + 70% Enterprise RAG fail + 43% AI code debug + Amazon Kiro 13h outage)
- 7-25 1610 evening-briefing-cncf-llm-d-rag-inference-vecdb(20KB · llm-d CNCF Sandbox + K8s 自托管 vLLM + KubeCon EU 2026 + SGLang 29% + 向量库 P50 benchmark + RAG 四大失效模式 + 企业 Agentic AI 五大失效模式)
- 7-25 1735 evening-rag-inference-stack-jul2026-substack-hf-trending(RAG 5 架构 + TurboQuant arXiv:2504.19874 + RAGAS 7 项评估 + Blockify 78x/40x + DevOps→LLMOps 技能映射表)
- 7-25 1950 jay-engineering-filter(Particula Tech SGLang vs vLLM benchmark + Redis.io RAG at Scale + SocialCrawl.ai Agent Frameworks + LangChain 0.3.20)
- 7-25 2105 evening-briefing-vecdb-arxiv-llm-stack-jul2026(22KB · pgvector + pgvectorscale 471 QPS 11.4× Qdrant + Superintelligent Retrieval Agent arXiv:2605.06647 + Agentic RAG 2026 论文路线图 + DMLR CVPR 2026 + SceneCOT ICLR 2026 + CNCF Q1 2026 66% K8s + K8s v1.35 安全特性 + VoltAgent awesome-ai-agent-papers + Raschka LLM Research Papers 2026)
- 7-25 2155 jay-engineering-filter(SISAP 2026 ANNS 挑战赛 + Lilian Weng 自我改进 Harness 工程 + TechRadar + Import AI)
- 7-25 ai-engineering-trending(14KB · AI 工程趋势日报)
- 7-25 csdn-llm-rag-agent-vecdb(15KB CSDN · Enterprise LLM Agent 三层架构 + LangChain 实战指南 + OpenDeepResearch + vLLM 部署 + 向量库 2026 压测 + LangChain/LangGraph/LangFlow 四大框架 + RAG 完全指南)
- 7-25 csdn-supplement-agentic-rag-mcp-finetune(8KB CSDN · Google ADK Go 2.0 DAG 编排 + RAG 12 种新范式 + MCP 实战 + 微调框架 + 6 阶段最强 RAG 模块化)
- 7-25 database-e1prep(向量库主题 E1)
- 7-25 engineering-e1prep(19KB · vLLM MRV2 56% + CNCF Cloud Native Model Distribution + Microsoft MAF Agent Harness + Enterprise LLM Agent 三层架构 + Agent 生产失败三模式 + Compounding Error 0.85^10=20% + Diff-Logic arXiv:2607.18149)
5.3 inbox tom(7-25 共 8 份)
- 7-25 0840 agent-rag-longcontext-radar(5KB · ⭐ Agentic Context Management + ⭐ OpenForgeRL + ⭐ Sample-Efficient Learning 三高价值候选)
- 7-25 0852 rag-e1prep(15KB · 5 增量 · A-RAG + xMemory + HERA/HM-RAG + RAG Reddit + Page Index 无向量 RAG)
- 7-25 0900 hf-daily-2026-07-25(15 篇精选按社区票数排序 · AREX 117▲ + SLAI T-Rex 56▲ + ReferTrack 44▲ + 视觉对比自蒸馏 41▲ + K12-KGraph 40▲ + Subliminal Clocks 38▲ + Show Don't Tell 34▲ + Self Gradient Forcing 30▲ + 超越相关性中心 27▲ + ActiveVision 24▲ + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ + Color Pass-Through 17▲ + SANA-Video 2.0 15▲ + LLM 演化用户意图 15▲)
- 7-25 1440 agent-rag-longcontext-radar(雷达 14:40 班)
- 7-25 2040 agent-rag-longcontext-radar(雷达 20:40 班)
- 7-25 1004 rss-yt-lex-fridman + rss-yt-yannic-kilcher(RSS)
- 7-25 evaluation-e1prep(16KB · Show Don't Tell + K12-KGraph + OpenForgeRL + Cameron Wolfe 7-25 agentic 三连 + Compounding Error 量化公式 + 3 旁证)
- 7-25 rag-e1prep(同 5.3)
5.4 inbox flyp(7-25 共 8 份)
- 7-25 0944 multimodal-e1prep(35KB · v32 准备棒 · 5 件 v32 全新立标/旁证/综述候选 + 5 件行业 + 3 件续立 + 1 件 P3 待观察 = v32 接力最强准备棒 · 12 节结构)
- 7-25 0950 RRB-intra-query-attention-dilution-critical-read(7.5KB · RRB arXiv:2604.08571v3 + Intra-Query Attention Dilution 轻量精读 + 4 篇补查)
- 7-25 1000 rss-cameron-wolfe(Agentic World Models + Agentic RL + Agent 评估详尽指南 三连)
- 7-25 1002 rss-interconnects(Nathan Lambert 5 条 · 7-25 当日 + 开源模型综述 podcast「Kimi K3 + Qwen 3.8 + Xi WAIC 演讲 + 蒸馏 + 开源-闭源差距」)
- 7-25 1004 rss-yt-ai-explained + rss-yt-two-minute-papers(RSS)
- 7-25 1036 sat-weekly-deep-read-isolation-openforge-acm(37KB · 周六班 · 3 篇方法论级长稿 ⭐⭐⭐⭐⭐ · Isolation as a First-Class Principle arXiv:2607.12406 + OpenForgeRL arXiv:2607.21557 + Agentic Context Management arXiv:2607.21503)
- 7-25 agentrx-multimodal-clinical-critical-read(精读 · AgentRx 多模态临床)
- 7-25 risk-e1prep(Claude Opus 5 + Isolation + Agentic Context Management + OpenForgeRL 三联立标 · flyP 风险主题 E1)
5.5 inbox spark(7-25 共 6 份)
- 7-25 1001 rss-gradient-flow(RSS · 5 篇标题与 v29/v30 比对未变 · 主线 A 连续第 8 天缺失)
- 7-25 1002 rss-chip-huyen(2024-2025 旧文 · 无新增)
- 7-25 1004 rss-yt-3blue1brown(数学基础)
- 7-25 1330 agent-e1prep(45KB · 5 件 P0 主线 + 5 件 P1 旁证 + 6 条反方/风险 · Agentic Context Management + OpenForgeRL + Isolation + Claude Opus 5 + Microsoft MAF Harness + MSR SkillOpt + Memora + AREX + Compounding Error + Cameron Wolfe agentic 三连)
- 7-25 1840 llm-infra-e1prep(完整版 · 6 主线 + 3 旁证 + 2 矛盾点 · llm-d CNCF Sandbox + vLLM MRV2 + TurboQuant + Zylos 量化矩阵 + Microsoft MAF + 70% Enterprise RAG 失败田野 + 43% AI 代码生产调试 + Amazon Kiro 13h outage + Compounding Error 0.85^10=20%)
- 7-25 llm-infra-e1prep(同 5.5)
5.6 paper_cards 近 3 天新卡(7-22 ~ 7-25 入库 ~26 张 7-25)
- 7-25 21:00-22:00:585-2607-21557(OpenForgeRL · paper_card 已立 · v36 主线 ② 第四十二节点候选)+ 584-2305-10403(旧文)+ 583-2308-08155(旧文)+ 582-2305-01210(旧文)+ 581-2307-10169(旧文)+ 580-2307-15043(旧文)+ 579-2305-06161(旧文)+ 578-2301-13867(旧文)+ 577-2302-11382(旧文)
- 7-25 19:00:576-2607-04763(ReOPD · evaluation 主 method)+ 575-2607-19238(FinanceComplexQA · rag 主 method)
- 7-25 12:30-18:00:574-2607-21553(SANA-Video 2.0 · multimodal 主 method · 已立 · v32 §2.39.92 立标候选)+ 573-2607-21576(Self-Supervised Structured Dynamics · multimodal 主 position · 已立 · v32 §2.39.90 P3 旁证)+ 572-2605-09635(K12-KGraph · evaluation 主 benchmark · 已立 · R27 §2.2 教育垂直 benchmark)+ 571-2607-12746(Color Pass-Through · multimodal 主 method · 已立 · v32 §2.39.91 旁证)+ 570-2607-20785(Robostral Navigate · multimodal 主 method · 已立 · v32 旁证)+ 569-2607-20734(LLMs Get Lost in Evolving User Intent · agent 主 method · 已立 · 邻接补充)+ 568-2607-20061(ReferTrack · multimodal 主 method · 已立 · v32 §2.39.87 立标新增)+ 567-2607-21051(Sample-Efficient Learning from Agent Experience · agent 主 method · v36 主线 ② 第四十七节点候选)+ 566-2607-21485(Recurrent Sinusoidal INRs · multimodal 主 method · 已立 · v32 旁证)+ 565-2607-21072(Show, Don't Tell · evaluation 主 benchmark · 已立 · R27 §2.2 + §6.22 双节点新增)+ 564-2607-21503(Agentic Context Management · agent 主 method · v36 主线 ② 第四十一节点候选)+ 563-2607-18149(Diff-Logic EEG · engineering 主 method · 已立)
- 7-24 15:00:560-1406-2227(旧文)+ 561-2203-11171(旧文)+ 562-2607-20092(ENTRAP-VL · multimodal 主 benchmark 旁证)
6. 本场预消化总结
状态:✅ 检查完成(5 inbox 目录 + paper_cards 560-585 共 26 张卡 + work-queue.md + 活文档 v35 全文)
增量条数:8 条主线增量 + 2 条旁证增量 = 10 条(1 Claude Opus 5 + Boris Cherny + Project Pilot + Economic Index/Fund + 1 Agent 范式转折三联立标 Agentic Context Management + OpenForgeRL + Isolation-as-First-Class + 1 HF Daily 7-25 四面立标合流 AREX + SLAI T-Rex + NVIDIA OO Agents + Tencent WorkBuddy + 1 Compounding Error + Gartner 2027 40% + RAG/Agent 五大失效模式 + 1 Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + 1 TurboQuant + VeriCache + vLLM MRV2 56% + 完整 H1 新功能集 + Zylos 量化矩阵 + 1 MSR SkillOpt + Memora + Sample-Efficient Learning + AREX + 1 Sample-Efficient Learning + Lilian Weng 自我改进 Harness + Raschka 推理 effort + Cameron Wolfe agentic 三连 + 1 CNCF llm-d + K8s 自托管 vLLM + KubeCon EU 2026 + Cloud Native Model Distribution + 1 frontier lab 第 4 日 30+ 件延续)
涉及 arXiv 号:10 件 v36 候选池 arXiv 新增候选(arXiv:2607.21503 Agentic Context Management · 已立 + arXiv:2607.21557 OpenForgeRL · 已立 + arXiv:2607.12406 Isolation-as-First-Class + arXiv:2607.21461 AREX + arXiv:2607.20145 SLAI T-Rex + arXiv:2607.20709 NVIDIA OO Agents + arXiv:2607.20911 Tencent WorkBuddy + arXiv:2607.21051 Sample-Efficient Learning · 已立 + arXiv:2504.19874 TurboQuant + arXiv:2605.17613 VeriCache)+ 9 件 v35 候选池 arXiv 沿用(SafeKV 2508.08438v2 + PrefixWall 2603.10726v2 + A-RAG 2602.03442 + xMemory 2602.02007 + UniAI-GraphRAG 2603.25152 + HERA 2604.00901v1 + HM-RAG 2504.12330v1 + Multimodal RAG Survey 2510.15253v2 + FlashAttention-4 2603.05451)+ 3 件 CVE(MCP CVE-2026-26029 / 5059 / 30623 · 沿用 v35)+ 9 件 v36 候选池非 arXiv 新增候选(Claude Opus 5 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + HF Daily 7-25 头条 4 件 + Compounding Error 量化 + Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + 文心快码/Microsoft MAF/AWS Blocks 三家对比 + SkillOpt + Memora + vLLM MRV2 56% + TurboQuant + VeriCache + Zylos 量化矩阵 + CNCF llm-d + Cloud Native Model Distribution + frontier lab 第 4 日 30+ 件)
显著矛盾 / 待核实:10 条(Claude Opus 5 vs Fable 5 关系 + 关键数字 + Agentic Context Management vs PRO-LONG head-to-head + OpenForgeRL 6 harness × 6 基准覆盖差距 + Isolation 5 边界缺 isolation strength metric + Compounding Error 0.85^10 vs 实际 50+ 步 + Claude Opus 5 prompt injection 最难 vs 红队验证 + Microsoft MAF Harness ./harness GitHub API + TurboQuant 与香农极限差距 ≈2.7× + vLLM MRV2 56% 硬件依赖性 + SkillOpt + Memora MSR 完整论文链接待核)
本日结构性约束:Stephen 7-25 三次产出同日接力(ai-industry 10:24 + coordination 12:45 + 本次 llm-application 21:10)+ spark E1 节奏连续恢复第 2 日(13:30 agent + 18:40 llm-infra 双 E1 完整)+ flyp 周六精读 3 篇方法论级 + jay 27 份 5 实例中规模最大 + tom 0840 雷达 3 高价值候选 + paper_cards 560-585 共 26 张卡 = v36 接力时是否同时升 v35 候选池 9 件 arXiv 为正式立标(7-25 ~ 7-27 跨实例核验窗口) + 是否同时补全 v36 候选池 10 件 arXiv + 9 件非 arXiv = v36 立标候选决策点
v35 → v36 过渡判断:v35 已固化 9 件候选池 arXiv 沿用 + 8 件 frontier lab 候选池非 arXiv 沿用 + v36 候选池 10 件 arXiv + 9 件非 arXiv 新增候选 = 36 件候选池(v35 候选池 29 件 → v36 候选池 36 件 = 候选池密度 +24%,v35 → v36 沿用候选池深度补完 + 第二轮立标决定窗口 —— v36 立标决定窗口预计 7-26 evening 协调棒 + 7-27 evening 协调棒两次接力机会)
本次预消化核心结论:7-25 22.5h 窗口 = v35 → v36 过渡期硬资产第二日集中爆发,焦点集中在(1) frontier lab 模型本体立标 + 五栖验证链条第 1 例(Claude Opus 5 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund);(2) Agent 范式转折三联立标首日达成(Agentic Context Management + OpenForgeRL + Isolation-as-First-Class);(3) HF Daily 7-25 头条四面立标合流(AREX + SLAI T-Rex + NVIDIA OO Agents + Tencent WorkBuddy);(4) Agent 生产失败量化与 Harness SDK 立标(Compounding Error 0.85^10≈0.197 + Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0);(5) 推理 OS 升格量化立标 + KV Cache 压缩三件套 2026 H2(vLLM MRV2 56% + TurboQuant + VeriCache + Zylos 量化矩阵);(6) CNCF K8s AI 推理事实标准全面立标(llm-d + K8s 自托管 vLLM + KubeCon EU 2026 + Cloud Native Model Distribution);v36 候选池密度稳步推进 +24% = 7-26 evening 协调棒 22:45 是 v36 立标决定的第一接力机会
Stephen E1 预消化简报 · 2026-07-25 21:10 Asia/Shanghai · 共扫描 5 个 inbox 目录 + paper_cards 560-585 共 26 张卡 + work-queue.md + 活文档 v35 全文
增量 8 条主线 + 2 条旁证 · 涉及 arXiv 10 件 v36 候选池新增 + 9 件 v35 候选池沿用 + 3 件 CVE 沿用 + 9 件 v36 候选池非 arXiv 新增 + 8 件 v35 候选池 frontier lab 非 arXiv 沿用 + 30+ 件 frontier lab 第 4 日延续
无硬凑字数 · 不重写活文档 · 不写他人目录 · 不 git · 不输出密钥 · 沿 v33/v34/v35 不立标哲学明示「v35 → v36 沿用候选池深度补完 + 第二轮立标决定窗口 7-25 ~ 7-27 跨实例核验后再做立标决定」