agent · E1 预消化简报(2026-07-21)

执行时间:2026-07-21 13:30 (Asia/Shanghai) 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-19 ~ 7-21)笔记 + paper_cards 460-487(7-18 ~ 7-21 新卡) 对照活文档/shared/research-kb/organized/knowledge/agent.md v26(cutoff 2026-07-20 23:55 CST) 本文性质:spark cron 8958350c 触发的 agent 主题 E1 日间预消化;只列 7-21 增量 + 待活文档 v27 消化的方向,不重写 agent.md


0. 综述判断(给今晚活文档接手时一眼看到)

  • v26 已饱和(12 主轴 + 14 信号净增量):横切 53b 量化缺口 + 横切 82 WAM 知行鸿沟 + §2.2 56 节点 + §2.3 53 节点 + §2.5 79 节点 + §2.6 30 子节 + 共识 34 + 争议 46 + Q103 + T106 + RxBrain 主分类双向更新
  • 7-21 增量性质:v26 已把大部分 7-19 ~ 7-20 新立 arXiv 沿用(RESOURCE2SKILL / TARS / Muon / Lucid / RAGU / DSWorld / OAT / STRACE / BadWAM / MemoryAgentBench / Beyond Fact Retrieval / Memory in LLM Era / PalmClaw / Vinci2-EgoMemo 14 件);7-21 主要是 v26 的"补漏 / 反方 / 待核实 / 行业数据 + 1 件新立 arXiv(arXiv:2607.15263 Cost-Aware 安全 Agent 评测)";
  • 核心新出 arXiv 1 件 + 反方 1 件 + 行业数据 4 件 + Substack 政策 1 件:
    • 新立 arXiv 1 件(主分类 agent,直接归入 agent.md §2.6): arXiv:2607.15263 Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
    • 新立 arXiv 1 件(主分类 agent,行为隐私子方向): arXiv:2607.06815 Behavioral Privacy Leakage in Agentic Negotiation((ε, δ)-差分隐私 + 几乎确定收敛)
    • 新出 arXiv 1 件(主分类 agent/medical,vertical LLM 重定义): arXiv:2607.15314 Cura 1T(43 票 HF Daily 7-21)
    • 行业数据 4 件:Databricks State of AI Agents Report 2026(79% 采用 vs 11% 生产 / 40% 取消风险 / 171% ROI 美国 192%) + IBM Research × HF Model Routing 三大工程陷阱(2026-07-15,成本≠定价 / 复杂度≠任务难度 / 延迟≠模型速度)+ Stephen 0910 Anthropic Mythos 漏洞 + 白宫点名 frontier AI 客户名单 + Hugging Face 7/16 自主 AI Agent 端到端入侵 17,000+ 次(Jay 1105 完整记录)
    • Substack 政策评论 1 件:Gradient Flow 7-21「中国 AI 出口管制」(中国反向出口管制闭门谈判 6 月起 + 5 主线 H/I 第 6 次巩固)
    • 新立 Substack 1 件:Lilian Weng 2026-07-04 Harness Engineering for Self-Improvement(RSI + propose-evaluate-accept 闭环 + 6 个 recurring failure modes — v26 未单独立项,只在 llm-application / coding-agents / engineering 主题页固化)
    • GitHub Trending 2 件:topoteretes/cognee(Agent 持久化记忆平台,与 Lilian Weng Harness Memory plane 高度呼应)+ addyosmani/agent-skills + mattpocock/skills + caramaschiHG/awesome-ai-agents-2026
  • 本日谨慎提醒:
    1. HF Daily 7-21 上榜 15 篇中明确属 agent 主线 5 篇(LongStraw 182▲ / RESOURCE2SKILL 113▲ / SearchOS-V1 63▲ / BadWAM 50▲ / Cura 1T 43▲ — LongStraw / RESOURCE2SKILL / SearchOS-V1 / BadWAM 已 v26 沿用;Cura 1T = 7-21 唯一未 v26 收录的 agent 主分类新立) + agent/benchmark 跨 2 篇(RAGU 111▲ / AgentCompass 未上榜 7-21)+ agent 主分类 1 篇(Cost-Aware 3 票未上 Daily 候选但 paper_card 已建 482)
    2. Spark 主线 A 监控第 2 次实证(7-18 + 7-19 + 7-20 连续 3 天缺失)— 7-21 Gradient Flow 5 篇 feed 出现新主题「中国 AI 出口管制」(政策评论)+ 25+ Agent 反作弊 + RL 基建 + CLI for Agent + 资金流 Agent = 主线 A「数据-合规-版权」连续第 4 天 7-18 + 7-19 + 7-20 + 7-21 缺失 = 触发 Q103 阈值"主线 A 消失判定"候选(v26 已埋阈值)
    3. Tom 7-21 0840 radar 3 高 vs 7-20 radar 4 高:今日 radar 主线偏 agent-memory 黑盒攻击 + 谈判隐私泄露 + 多模态技能蒸馏,弱于 7-20 的 LongStraw / RAGU / BadWAM;无新立 arXiv 主分类 agent 的旗舰工作

1. 增量条目(8 条主线 + 1 条旁证,按"建议归入节"分组)

增量 1 · Cost-Aware Evaluation of Offensive and Defensive Security Agents — 安全 Agent 评测第三维度(★NEW27, agent 评测/safety 新角度)

字段 内容
来源 /shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md 中候选(3 票 HF 2026-07-16)+ Tom 0853 rag-e1prep §2.18 邻接 + Tom 0900 HF Daily 未上榜 + Stephen 1245 §2.5 中候选 + paper_cards/482-2607-15263.md(主分类 agent,形态 benchmark,副 evaluation)
arXiv 号 arXiv:2607.15263 Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
一句话 首次将"成本-成功率"作为安全 Agent 评测硬维度 — 现有评测只测 best-case 攻击成功率(generous inference budget),忽略 reasoning step / tool call / telemetry query / enrichment request 每个动作消耗预算;在 Cybench 攻击侧 + Splunk BOTS v1 防御侧双向评测 + 在固定成本预算下比较不同模型 + 分解 inference spend 维度;与 v26 共识 34 Harness ≠ Model + Artificial Analysis Coding Agent Index 32× cost spread + Kili 37% lab-vs-production + 50× cost variation 同源 = "成本是 Agent 工业级评测的第三维度(精度 + 速度 + 成本)合并成熟"
v26 脉络关系 与 v26 §1.33 横切 53b AI Engineer Stack 2026 + 共识 34 Harness ≠ Model 8 件套合并成熟 + §2.6 评测、可靠性与对抗 30 子节 + v26 §1.44 "Why Agents Fail in Production 8 件套" + v25 工业级 Harness ≠ Model 8 件套同源;关键增量:1) 安全 Agent 评测首次把"成本-成功率"作为硬维度 = 与 v25/v26 Harness ≠ Model 共识的"成本"维度合流;2) Cybench 攻击侧 + Splunk BOTS v1 防御侧双向评测框架 = 与 v25 横切 80 "Why Agents Fail in Production" 同根但加入"安全 Agent 失败成本"维度;3) paper_card 标注主分类 agent 形态 benchmark 副 evaluation = 与 v26 §2.6 OAT(arXiv:2607.12747)+ STRACE(arXiv:2607.07702)+ BadWAM(arXiv:2607.15207)+ Lucid(arXiv:2607.15657)30 子节同类
反方 / 风险 (A) HF 3 票为低热度候选 = 工业关注度低;(B) paper_card TLDR 未给具体模型数字(只有评测框架),需 PDF 核;(C) Splunk BOTS v1 防御侧基准代表性待核;(D) "成本-成功率"维度是否可迁移到通用 Agent 评测需 7-22 ~ 7-25 横向验证
建议归入节 §2.6 评测、可靠性与对抗 30 → 31 子节(Cost-Aware 安全 Agent 评测第三十一)+ §1.33 横切 53b 候选(Cost-Aware 是 Harness ≠ Model 的安全侧落地)+ §3.1 共识 35 候选(成本-成功率是 Agent 工业级评测第三维度)
重要边界 不要与 v25 横切 80 Why Agents Fail 7 件套混为同一件工作:v25 横切 80 是 production RAG/Agent system 失败模式(CSDN RAG 47% 成本 + LangSmith 28 分钟 SSL 过期 + 85%^10=20% Compounding Error),Cost-Aware 是安全 Agent 评测的 cost-success 维度框架;不要与 v26 §1.33 横切 53b 89%/52% observability vs evals 量化缺口混为同一件工作:89%/52% 是观测 vs 评测的覆盖率,Cost-Aware 是评测内部的成本-成功率二维度

增量 2 · Behavioral Privacy Leakage in Agentic Negotiation — 行为隐私泄露 + (ε, δ)-差分隐私谈判策略(★NEW27, agent 行为隐私新维度)

字段 内容
来源 /shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md ⚡高 #3(2026-07-06 arXiv)+ Tom 0853 rag-e1prep §增量 2 + paper_cards/487-2607-06815.md(主分类 agent 形态 application 副 llm-infra)
arXiv 号 arXiv:2607.06815 Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies
一句话 首次形式化"行为差分隐私"威胁模型 — 加密技术保护显式披露的约束值,但攻击者从可观察的让步轨迹(concession trajectories)+ 谈判时机(timing)+ 收敛模式(convergence patterns)推断私人约束;设计自适应随机谈判策略,联合保证 (ε, δ)-差分隐私 + 几乎确定收敛;应用于保险 / 采购等高风险谈判场景;与 v26 §2.6 Lucid arXiv:2607.15657 多模态记忆黑盒视觉攻击 + v26 §1.45 OWASP MCP Top 10 + Token-Flow Firewall + 7 月 4 CVE 合并"Agent 安全 = 投毒 + 记忆 + RCE + 行为隐私"4 维合并成熟
v26 脉络关系 与 v26 §2.6 评测、可靠性与对抗 30 子节(Lucid 多模态记忆黑盒视觉攻击 + BadWAM 知行鸿沟 + OAT + STRACE)+ v22 UniClawBench + Token-Flow Firewall + Context Access Divide(21 持久 Agent 安全三角)+ v25 Why Agents Fail 7 件套 + v26 横切 82 WAM 同源;关键增量:1) 行为隐私 = 不依赖技术漏洞,而是通过行为轨迹(让步/时机/收敛)推理私人约束 = 信息泄露层面的安全问题 = 与 RAG/Agent 已有 RCE/投毒/记忆污染不同的新维度;2) (ε, δ)-差分隐私 + 几乎确定收敛的形式化证明 = 与 v26 横切 82 WAM 知行鸿沟的"形式化失败"同源;3) 自适应随机谈判策略 = 防御侧工程方案
反方 / 风险 (A) paper_card TLDR 截断,需 PDF 核 ε/δ 具体数字;(B) "几乎确定收敛"的样本复杂度 vs 隐私预算的 trade-off 未披露;(C) "保险/采购"应用场景的代表性 vs 多 Agent 通用谈判协议的迁移性待核;(D) HF Daily 未上榜 = 工业关注度低
建议归入节 §2.6 评测、可靠性与对抗 30 → 31 子节(Behavioral Privacy Leakage 第三十二,与 Cost-Aware 并列)+ §1.45 v26 OWASP MCP Top 10 维度扩充(行为隐私 = 投毒 + 记忆 + RCE + 行为隐私 4 维合并成熟)
重要边界 不要与 v26 §2.6 Lucid 多模态记忆黑盒视觉攻击混为同一件工作:Lucid 是图像扰动攻击多模态记忆管道,Behavioral Privacy 是谈判行为轨迹泄露;两者同属"Agent 失败/攻击分类学"但攻击向量不同;不要与 v25 横切 80 Why Agents Fail 三模式(Dumb RAG + Brittle Connectors + Authentication Rot)混为同一件工作:v25 是生产系统失败,Behavioral Privacy 是 agent 协议层的隐私威胁

增量 3 · Cura 1T · 面向 Agent 医疗的专业模型 — 垂直 LLM 在 Agent 时代的重定义(★NEW27, v26 §2.7 行业与平台动态候选)

字段 内容
来源 /shared/research-kb/inbox/tom/2026-07-21-0900-hf-daily-2026-07-21.md #10(43 票 HF Daily 7-21)+ Jay 1105 afternoon-briefing §七 HF Papers Trending 表 + Stephen 1245 §2.10 中 + paper_cards 未建(待补)
arXiv 号 arXiv:2607.15314 Cura 1T: A Specialized Model for Agent Medical(主分类 agent,vertical LLM)
一句话 首个明确"面向 Agent 时代的医疗专用模型"(43 票 HF Daily 7-21) — 与 v25 立标 OpenMed / Med-PaLM / BiomedCLIP 同方向,但在"Agent 时代"重新定义为"Agent 工具生态的核心";意味着垂直领域 LLM 不再是单点工具,而是 Agent 多工具编排系统的核心组件
v26 脉络关系 与 v25 OpenMed / Med-PaLM / BiomedCLIP 垂直域 + v23 §1.41 横切 66 Anthropic Claude for Teachers + v25 §1.43 横切 80 Union.ai Haytham 3D 框架 + v26 §2.5 Microsoft Foundry/Copilot 80K/20M 同源;关键增量:1) "面向 Agent 医疗"明确把 vertical LLM 重新定位为 Agent 工具生态核心(v25 没有同形态);2) HF 43 票为中等热度,代表工业对 vertical-domain Agent 模型的需求确认;3) 与 v26 §1.44 横切 53b AI Engineer Stack 2026 Evaluation 独立层 + Memory 一等公民 论断同源 — vertical LLM 是 Memory 一等公民的物理实例
反方 / 风险 (A) 43 票 HF Daily 中等热度,工业部署待验证;(B) paper_card 未建,需 PDF 核;(C) "1T"参数是否真为 1 万亿还是命名约定(7-21 截稿未深入);(D) 与 v25 OpenMed / Med-PaLM 是否有协同或竞争关系待核
建议归入节 §2.7 行业与平台动态 v26 35+ 信号升格 v27 37+ 信号(Cura 1T + HF blog 4 + Lilian Weng Harness)+ §1.33 横切 53b 候选(vertical LLM 是 Memory 一等公民的物理实例)
重要边界 不要与 v25 OpenMed / Med-PaLM 混为同一件工作:v25 沿用的 OpenMed / Med-PaLM 是 medical LLM;Cura 1T 是 "Agent 时代 medical LLM 重定义" = 跨越 v25 沿用线 + 升格为 v27 新信号;不要与 v26 横切 53b Evaluation 独立层混为同一件工作:Evaluation 是评测基础设施层,vertical LLM 是被评测对象

增量 4 · Lilian Weng 2026-07-04 Harness Engineering for Self-Improvement — RSI + propose-evaluate-accept 闭环(★NEW27, v27 §1.34 横切辅助候选)

字段 内容
来源 /shared/research-kb/inbox/jay/2026-07-21-1105-afternoon-briefing-llm-agent-db-cloudnative-jul2026.md §五(可信度 ⭐⭐⭐⭐⭐,Lilian Weng OpenAI 安全负责人) + Lilian Weng 2026-07-04 https://lilianweng.github.io/posts/2026-07-04-harness/
一句话 Lilian Weng Harness Engineering for Self-Improvement 完整定义 Harness = 测试/评估框架让 Agent 在约束内执行并从反馈中改进;递归自我改进(RSI,Recursive Self-Improvement)概念源自 I.J. Good 1965 超智能定义;关键挑战:如何设计 evaluation function 避免 reward hacking;v27 升格要点:把 propose-evaluate-accept 闭环 + 6 个 recurring failure modes(Trehan & Chopra 2026 引用)+ "editable OS abstraction boundaries 被打破" 安全警示作为 v27 §1.34 v26 升格辅助
v26 脉络关系 v26 未单独收录 Lilian Weng Harness Engineering(只在 llm-application.md / coding-agents.md / engineering.md 主题页固化 + 7-17 ~ 7-19 多次引用);关键增量:1) Lilian Weng 7-04 post 是 Harness Engineering 学科化里程碑(OpenAI 安全负责人)+ 2) propose-evaluate-accept 闭环 + 6 recurring failure modes 是 v26 沿用的"harness ≠ model" + "Why Agents Fail 8 件套"的形式化闭环;3) 与 v26 §1.34 横切 81 Context Engineering 25 页 5 项标准同源(都是工程化 Agent 基础设施工具);4) 与 v25 §2.5 工业级 Harness ≠ Model 8 件套合并成熟(Artificial Analysis Coding Agent Index + Morphllm + Kili + AI Engineer Stack)互证
反方 / 风险 (A) Lilian Weng 个人博客非顶会论文,权威性中上;(B) "evaluation function 避免 reward hacking" 是经典挑战,论文是否给出新解待核;(C) "editable OS abstraction boundaries 被打破" 安全警示偏抽象,需与 HF 7/16 自主 agent 入侵事件实证互证;(D) v26 已在 llm-application.md / coding-agents.md / engineering.md 主题页固化,agent.md 是否需要单独升格为横切候选 = Stephen/Flyp/Jay 各自路线已升格,agent.md 是否需要 2 次固化 = 是 v27 待决问题
建议归入节 §1.34 v27 升格辅助:横切 83 候选(Lilian Weng Harness Engineering + propose-evaluate-accept 闭环)+ §3.1 共识 35 候选(Harness ≠ Model + Harness 是工程 + 避免 reward hacking 三件套合并成熟)+ §4 跨实例审稿链(7-21 jay 1105 第五部分)
重要边界 不要与 v26 横切 82 WAM 知行鸿沟混为同一件工作:WAM 是"内部决策对 + 外部执行错"的失败模式,Lilian Weng Harness 是"harness 工程化 + evaluation function 形式化"的成功模式;两者同属"Agent 可靠性"主线但切入点不同

增量 5 · Databricks State of AI Agents Report 2026 — 79% vs 11% vs 171% ROI(★NEW27, v26 §2.7 + §3.1 共识 36 候选)

字段 内容
来源 /shared/research-kb/inbox/jay/2026-07-21-1105-afternoon-briefing-llm-agent-db-cloudnative-jul2026.md §四(Databricks State of AI Agents Report,https://www.techzine.eu/blogs/applications/138502/multi-agent-systems-set-to-dominate-it-environments-in-2026)+ 可信度 ⭐⭐⭐⭐(Databricks 官方研究)
一句话 Databricks State of AI Agents Report 2026 关键数字:① 报告 Agent 采用的组织比例 79%;② 实际在生产运行 Agent 的比例仅 11% = 79% vs 11% 巨大落差;③ Agent 项目取消风险比例 40%;④ 真正达到 AI 高绩效的组织 6%;⑤ 企业 Agentic AI 平均 ROI 171%(美国 192%,Deloitte 2026) — 与 v26 共识 34 Harness ≠ Model 8 件套合并成熟(Artificial Analysis Coding Agent Index 32× cost spread + Kili 37% lab-vs-production + AI Engineer Stack 89%/52%)同源 = "Agent 工业级生产差距量化三件套合并成熟(89%/52% observability vs evals + 79%/11% 采用 vs 生产 + 37% lab-vs-production)"
v26 脉络关系 与 v26 共识 34 Harness ≠ Model 8 件套 + v26 §1.33 横切 53b 量化缺口 + v26 §1.44 Why Agents Fail 8 件套 + v25 Why Agents Fail 三模式 + v26 横切 82 WAM 同源;关键增量:1) 79% vs 11% = 比 v26 89% vs 52% 更严重的"采用-生产"落差 = 实验阶段已结束但生产化严重不足;2) 40% 取消风险 = 与 Berkeley RDI 40% Agentic AI 项目取消预测(2027 末)在 llm-application.md v54 沿用,但 Databricks 数字是 2026 当前 = 提前 1 年实证;3) 171% ROI vs 美国 192% = 已投入生产的项目回报显著,但瓶颈在工程化和规模化能力 = 与 v25 横切 80 Why Agents Fail 7 件套 / v26 §1.33 横切 53b 量化缺口 / v26 共识 34 Harness ≠ Model 同源
反方 / 风险 (A) Databricks 调研样本可能偏向 Databricks 客户群体(规模较大 / cloud-native 为主) = 样本偏差;(B) 79% / 11% / 40% / 171% 数字交叉源验证缺;(C) "AI Agent Conference 2026" 是 Databricks 主办 = 自报数据;(D) Berkeley RDI 40% 预测 2027 末 vs Databricks 40% 风险 2026 当前 = 时间窗口不同,需 PDF 核 Berkeley RDI 数字是否引用 Databricks
建议归入节 §3.1 共识 36 候选(Agent 工业级生产差距量化三件套合并成熟 = 89%/52% observability vs evals + 79%/11% 采用 vs 生产 + 37% lab-vs-production + 40% 取消风险 + 171% ROI)= 共识 34 Harness ≠ Model 8 件套升格为 v27 9 件套 + §2.7 行业与平台动态新增
重要边界 不要与 v26 共识 34 Harness ≠ Model 混为同一件工作:v26 共识 34 是 harness 工程维度,Databricks 79%/11% 是组织采用维度;两者互补不互斥;不要与 v25 Kili Technology 37% lab-vs-production 混为同一件工作:Kili 是 lab-vs-deployment 差距,Databricks 是采用-vs-生产差距,层级不同

增量 6 · IBM Research × HF Blog Model Routing 三大工程陷阱 — 路由 ≠ 分类(★NEW27, v27 §2.5 节点候选)

字段 内容
来源 /shared/research-kb/inbox/jay/2026-07-21-1335-afternoon-briefing-hf-blog-github-trending-jul2026.md §三(可信度 ⭐⭐⭐⭐⭐ IBM Research 工程经验,https://huggingface.co/blog/ibm-research/model-routing-is-simple-until-it-isnt 2026-07-15)
一句话 Model Routing 三大反直觉工程陷阱:① 成本 ≠ 模型定价 — 同一 CodeAct agent 跑 AppWorld Test Challenge:Claude Sonnet 4.6 总成本 $79($0.19/任务)vs GPT-4.1 总成本 $155($0.37/任务),原因 Agent 工作负载缓存复用率高,Sonnet 的 cache-read 定价优势抵消了 base 价格差和更长轨迹 = 只看定价表做路由决策是错的;实际成本取决于"模型 × 工作负载 × 服务基础设施"的交互;② 复杂度 ≠ 任务难度 — "总结这份合同"看起来简单,实际可能触发 retrieval + 合规检查 + 工具调用 + 多轮精化;路由需要在 cost / quality / latency / compliance / reliability 之间持续平衡 = 路由不是分类问题,是系统优化问题;③ 延迟 ≠ 模型速度 — 路由本身有 overhead;基础设施因素(硬件 / 缓存预热状态 / endpoint 繁忙度)往往主导端到端延迟;每步路由 vs 每任务路由的 granularity 选择影响显著
v26 脉络关系 与 v26 §2.5 运行时与基础设施 79 节点(vLLM V1 + MRV2 + SAGA + KV cache 综述 + ELDR PD-Disagg MoE + Microsoft Foundry 80K/20M 五层 Harness)+ v26 共识 34 Harness ≠ Model + v26 §1.33 横切 53b AI Engineer Stack 2026 Evaluation 独立层同源;关键增量:1) Model Routing = AI Engineer Stack 2026 第 4 层(Orchestration)的关键子组件,v26 未单独立项;2) 三大反直觉陷阱 = 与 v26 横切 53b 89%/52% 缺口同根(只看单一维度做决策 = 错的);3) CodeAct agent AppWorld Test Challenge 实证数据(Sonnet $79 vs GPT-4.1 $155)= 与 v26 横切 53b 32× cost spread 同源
反方 / 风险 (A) IBM Research 单一来源,需第三方验证 AppWorld 数字;(B) "CodeAct agent" 是 IBM 内部 benchmark,代表性待核;(C) 三大陷阱是工程经验总结,不是新研究;(D) 与 v26 横切 53b Spheron vLLM/SGLang 2026 量化数据(AIMultiple 16,215 vs 12,553 29%)是不同维度,需 PDF 核 AppWorld 数据集
建议归入节 §2.5 运行时与基础设施 79 → 80 节点(IBM Model Routing 三大工程陷阱第八十)+ §3.1 共识 35 候选(路由 ≠ 分类 = 路由是系统优化问题 + 单维度决策不可靠)
重要边界 不要与 v26 横切 53b Spheron H100 矩阵 vLLM 310ms vs SGLang 195ms 混为同一件工作:Spheron 是推理引擎选型,IBM 是模型路由;两者同属"工程化选型"主线但层级不同;不要与 v26 共识 34 Harness ≠ Model 混为同一件工作:Harness 是测试/评估框架,Model Routing 是工作负载分配机制

增量 7 · Spark 主线 A 监控机制 Q103 阈值首次触发 — 7-18 + 7-19 + 7-20 + 7-21 连续 4 天缺失(★NEW27, v26 §3.3 Q103 候选升级)

字段 内容
来源 /shared/research-kb/inbox/spark/2026-07-21-1001-rss-gradient-flow.md(主源 = Gradient Flow 7-21 5 篇,新增"中国 AI 出口管制"政策评论)+ /shared/research-kb/inbox/spark/2026-07-20-1001-rss-gradient-flow.md(7-20 5 篇无主线 A)+ /shared/research-kb/inbox/spark/2026-07-19-1000-rss-gradient-flow.md v2 重写版 + spark 7-19 21:00 gradient-flow v2 重写版
一句话 主线 A「数据-合规-版权」连续第 4 天(7-18 + 7-19 + 7-20 + 7-21)从 Gradient Flow feed 5 行窗口缺失 — 7-21 Gradient Flow 5 篇为 ① 「中国 AI 出口管制」(政策评论,新主题)+ ② 25+ Agent 反作弊 + ③ RL 基建下一层 + ④ CLI 不是为 Agent 设计 + ⑤ Agent 触及资金 = 无主线 A「数据-合规-版权」论据;v26 Q103 已埋阈值"连续 4-5 天缺失 = 主线 A 消失判定",7-21 = 第 4 天 = Q103 阈值首次触发候选
v26 脉络关系 与 v26 §1.44 Spark 主线结构升维 + v26 §3.3 Q103 连续 4-5 天主线 A 缺失阈值 + v26 §1.44 7-20 升级为第 2 次实证(连续 3 天)同源;关键增量:1) 7-21 = 主线 A 连续第 4 天缺失 = Q103 阈值"连续 4-5 天缺失 = 主线 A 消失判定"首次实证候选;2) 7-21 Gradient Flow 新主题「中国 AI 出口管制」是政策评论,但主线 A「数据-合规-版权」= 训练数据 license + base model license ≠ 数据层 license = 上线卡点 = 与中国 AI 出口管制有交集但不完全等同;3) 主线 A 实质连续 4 天缺失 = 训练数据合规讨论在 Gradient Flow 短暂降级 = 与 v25 横切 80 Why Agents Fail + v26 横切 53b 89%/52% 量化缺口反向 — 训练数据合规不是 Agent 工业级主要瓶颈(短窗口)
反方 / 风险 (A) Gradient Flow feed 是 spark 主观策展,可能存在 spark 遗漏主线 A 论据的样本偏差;(B) 主线 A 缺失 = 数据-合规-版权论据强度 0,但这不等于"合规版权不重要",只等于"本周 gradient flow 没有新论据";(C) 7-21 新主题「中国 AI 出口管制」是政策评论而非技术主线,主线 A 论据强度有限;(D) Q103 阈值"4-5 天"是否合理需 7-22 ~ 7-25 持续追踪;若 7-22 ~ 7-25 仍连续 4-5 天缺失 → 主线 A 论据强度确认 = 0(主线 A 论据强度不依赖 feed 反复出现,但监控机制判定消失 vs 截断阈值需 4-5 天连续缺失)
建议归入节 §3.3 Q103 升级(连续 4 天缺失 = Q103 阈值首次触发候选,待 7-22 验证连续 5 天)+ §1.44 v27 升维 Spark 主线结构第 8 次升维(主线 A 监控机制第 3 次实证 + Q103 阈值首次触发)
重要边界 主线 A 监控机制 vs 主线 A 论据强度:监控 = 出现频率;论据强度 = 论据本身质量;v25 / v26 / v27 监控 = 出现频率层,论据强度层不在本简报范围;Q103 阈值触发 ≠ 主线 A 论据强度判定:Q103 只判定"主线 A 论据强度是否依赖 feed 反复出现",不判定"主线 A 是否重要"

增量 8 · HF 7/16 自主 AI Agent 端到端入侵 + Anthropic Mythos 漏洞 + 白宫点名 frontier AI 客户名单 — AI 安全 + 政府监管三向合流(★NEW27, v26 §1.45 候选)

字段 内容
来源 /shared/research-kb/inbox/jay/2026-07-21-1105-afternoon-briefing-llm-agent-db-cloudnative-jul2026.md §一 HF 安全事件 + /shared/research-kb/inbox/stephen/2026-07-21-0910-news-x-vip-radar.md Anthropic Mythos + Stephen 1245 §2.1 + Stephen ai-industry-e1prep §增量 1
一句话 7-21 AI 安全三向合流窗口正式开启:① HF 7/16 自主 AI Agent 端到端入侵(17,000+ 次独立操作 / 利用数据集 pipeline 窃取凭证 + 横向移动 + 自迁移 C2 + 商业 API guardrail 拒绝分析攻击日志 → 自托管 GLM 5.2 取证)= 首个完整记录的 AI 驱动网络入侵案例(Jay 1105 完整记录);② Anthropic Mythos 模型经第三方供应商门户被攻陷(7-20 Bloomberg Law 披露 + BlueGlass AI 团队通过 procurement 漏洞绕过容器层 + $30B+ 收入 1400% YoY + 10 月 IPO 传闻 $800B 估值)= 第三方供应商门户绕过容器层 = 供应链侧攻击新形态(与 7-20 4 RCE CVE 路径不同);③ 白宫已开始"点名"前沿 AI 客户名单(OpenAI / Anthropic 特定模型接入受政府直接审批)= AI 监管从"被动应急"演进到"主动点名"
v26 脉络关系 与 v25 §1.43 Hugging Face 7 月自主 AI Agent 入侵事件(GLM 5.2 defender-asymmetry 闭环)+ v25 Orca Security 99.9% 未修补 + v25 7 月 4 CVE(61447/54769/57572/59726)+ v26 §1.45 HF + GLM 5.2 defender-asymmetry + Stephen 7-19 2245 协调棒证据链 A + Stephen 7-21 ai-industry-e1prep §2.73 新独立段"AI 安全 + 政府监管合流" + v22 UniClawBench + Token-Flow Firewall + Context Access Divide 持久 Agent 安全三角同源;关键增量:1) HF 入侵 v25 已沿用但 v26 未升格为"AI 监管三向合流窗口";2) Anthropic Mythos 漏洞 + 白宫点名 = 与 HF 入侵同框构成"AI 安全 + 政府监管合流" = v26 §1.45 候选升格;3) Mythos 第三方供应商门户绕过容器层 = 供应链侧攻击新形态,4 RCE CVE 不覆盖
反方 / 风险 (A) Mythos 是否为公开 Claude 系列下一代代号待核(flyp 7-21 0951 Substack 短评 §4 待补查);(B) BlueGlass AI 团队漏洞披露可能存在攻击者单方说辞;(C) "1400% YoY" + "10 月 IPO $800B"是融资侧强信号,需独立源核实;(D) "白宫点名 frontier AI 客户名单"是 The Decoder 7-18 报道,需白宫 / 美国政府官方原始公告核实
建议归入节 §1.45 v27 升格辅助(AI 安全 + 政府监管三向合流窗口 = HF 入侵 + Mythos + 白宫点名三联)+ §2.7 行业与平台动态 v27 37+ 信号新增 + §3.1 共识 35 候选(defender-asymmetry 闭环 + 监管从被动应急演进到主动点名)
重要边界 不要与 v25 HF 入侵 + GLM 5.2 defender-asymmetry 闭环混为同一件工作:v25 是单一事件 + 单一解法(GLM 5.2 取证),v27 是 HF + Mythos + 白宫三向合流 = 监管窗口;不要与 v22 持久 Agent 安全三角(UniClawBench + Token-Flow Firewall + Context Access Divide)混为同一件工作:v22 是评测/防御侧,v27 是攻击 + 监管双侧
字段 内容
来源 /shared/research-kb/inbox/jay/2026-07-21-1105-afternoon-briefing-llm-agent-db-cloudnative-jul2026.md §三 GitHub Trending + /shared/research-kb/inbox/jay/2026-07-21-1335-afternoon-briefing-hf-blog-github-trending-jul2026.md §4-6(GitHub Trending Agent Skills)
一句话 GitHub Trending 2026-07-21 Agent Skills 4 件:① topoteretes/cognee(开源 AI memory platform for agents / 跨 session 持久化长期记忆 / 与 Lilian Weng Harness Memory plane 高度呼应)= 首个开源 Agent 持久化记忆平台具体实现路径;② addyosmani/agent-skills(LLM Coding 工作流的结构化 skill 集合);③ mattpocock/skills(面向实际工作的 AI tool skill 集合);④ caramaschiHG/awesome-ai-agents-2026(覆盖 Coding Agents + IDE-Native Agents + Multi-Agent Orchestration + Protocols MCP/A2A + Observability/Evaluation + Local/Self-Hosted + AI Safety & Guardrails)
v26 脉络关系 与 v26 §2.2 记忆与上下文工程 56 节点(MemoryAgentBench + Mem0/Letta/Zep + OpenViking + MemTraceBench)+ v26 §2.3 工具调用与 Agentic RAG 53 节点 + v23 §1.41 横切 64 LightMem-Ego + v26 Knowledge Layer 综述 Substack 7 组件 + v25 §1.43 Multimodal 元方法学 4 件 + v22 Designing Agentic Memory 5 类同源;关键增量:1) cognee = Lilian Weng Harness Memory plane 具体实现路径 = 与 v25/v26 工业级 Harness 8 件套合流;2) addyosmani/agent-skills + mattpocock/skills = 与 v22 Agent skill / v25 SKILL.md 模式 + v26 RESOURCE2SKILL arXiv:2606.29538 多模态 Skill Wiki 同源;3) awesome-ai-agents-2026 = Coding Agents + IDE-Native + Multi-Agent + MCP/A2A + Observability + Local + Safety = 与 v26 横切 53b AI Engineer Stack 2026 6 层框架完美对齐
反方 / 风险 (A) cognee GitHub stars 待核;(B) addyosmani/agent-skills / mattpocock/skills 是结构化 skill 集合 = 不是新研究,是工程化范式整理;(C) awesome-ai-agents-2026 是 list,代表性待核;(D) v26 §2.7 已沿用 "GitHub Trending Agent Skills 4 件" 在 llm-application.md,agent.md 是否需要 2 次固化 = 是 v27 待决问题
建议归入节 §2.7 行业与平台动态 v27 37+ 信号新增(GitHub Trending Agent Skills 4 件沿用)+ §2.3 工具调用与 Agentic RAG 53 → 54 节点(cognee 第五十四,与 RESOURCE2SKILL 并列)
重要边界 不要与 v22 Designing Agentic Memory 5 类混为同一件工作:v22 是分类法,cognee 是具体平台实现;不要与 v26 Knowledge Layer 综述 Substack 7 组件混为同一件工作:Knowledge Layer 是抽象知识层架构,cognee 是 Memory plane 单点实现

2. 与 v26 活文档已有 v27 沿用候选条目映射

v26 节点 7-21 新增引用 v27 沿用候选判断
§1.32 横切 52 Multi-Agent 短视极化 Databricks State of AI Agents 79% vs 11% / 40% 取消风险 / 171% ROI / 美国 192% 🟡 升级为共识 36 候选(组织采用维度新增)
§1.33 横切 53 AI Agents Stack 2026 6 层 IBM Model Routing 三大工程陷阱 + Databricks 79%/11% + Cura 1T vertical LLM 重定义 🟢 升格 v27 横切 53c 候选(量化缺口 + 路由陷阱 + vertical LLM)
§1.34 横切 54-59 v22 横切 无新立 ✅ 沿用
§1.41 横切 60-66 v23 七件主轴 无新立 ✅ 沿用
§1.42 横切 67-73 v24 七件主轴 无新立 ✅ 沿用
§1.43 横切 74-81 v25 十一面升格 无新立 ✅ 沿用
§1.44 横切 82 WAM 知行鸿沟 无新立 ✅ 沿用
§1.45 RxBrain 主分类 multimodal → agent HF 入侵 v25 沿用 + Mythos + 白宫 = AI 安全三向合流窗口 + Lilian Weng Harness 🟢 v27 升格辅助(Harness Engineering 学科化里程碑 + 三向合流)
§2.1 综述与方法学骨架 无新立 ✅ 沿用
§2.2 记忆与上下文工程 56 节点 topoteretes/cognee 沿用 🟡 新增第五十七节点 cognee(GitHub Trending)
§2.3 工具调用与 Agentic RAG 53 节点 cognee + addyosmani/agent-skills + mattpocock/skills + awesome-ai-agents-2026 🟡 升格 v27 54 节点(cognee 第五十四)
§2.4 多智能体协作 48 节点 Databricks 79% vs 11% + 40% 取消风险 🟡 新增 v27 第六节点 Multi-Agent 生产成熟度(Databricks 数据)
§2.5 运行时与基础设施 79 节点 IBM Model Routing 三大工程陷阱 + Netflix vLLM over TensorRT-LLM 7-18 🟢 升格 v27 80 节点(IBM Model Routing 第八十)
§2.6 评测、可靠性与对抗 30 子节 Cost-Aware Evaluation arXiv:2607.15263 + Behavioral Privacy arXiv:2607.06815 🟢 升格 v27 31 子节(Cost-Aware + Behavioral Privacy)
§2.7 行业与平台动态 Databricks + IBM Routing + Cura 1T + HF 入侵 + Mythos + 白宫 + cognee + GitHub Trending 🟢 v27 37+ 信号新增 6 个
§3.1 共识 34 Harness ≠ Model Databricks 79%/11% + IBM Routing + Lilian Weng Harness 闭环 🟢 共识 36 候选(生产差距量化三件套合并成熟)
§3.2 争议 46 向量检索降级 vs 关键词颠覆 vs 长上下文直读 3 路径之争 无新立 ✅ 沿用
§3.3 开放问题 Q99-Q103 Spark 主线 A 第 4 天缺失 + Q103 阈值首次触发候选 🟢 Q103 升级(连续 4 天 = 阈值首次触发)
§3.4 趋势 T103-T106 Lilian Weng Harness 闭环 + propose-evaluate-accept 🟡 T107 候选(Harness Engineering 学科化)
§3.4 Spark Gradient Flow 主线结构升维 第 7 次升维(7-20)+ 7-21 连续第 4 天主线 A 缺失 = 主线 A 监控第 3 次实证 + Q103 阈值首次触发 🟢 升级为第 8 次升维(7-21)

3. 值得警惕的矛盾或待核实说法

3.1 矛盾 1 · HF Daily 7-21 Cura 1T(arXiv:2607.15314)paper_card 未建

  • 冲突:7-21 HF Daily #10 明确有 Cura 1T(43 票),Tom 0853 rag-e1prep + Jay 1105 + Stephen 1245 均引用,但 paper_cards 目录中未建 Cura 1T 卡片
  • 建议:Stephen 晚场稿 / Tom 7-21 晚场稿 / Jay 7-21 晚场稿 任一补建 paper_cards/488-2607-15314.md;PDF 核 arXiv:2607.15314 + 是否为 1T 参数 / 是否开源 / 与 OpenMed / Med-PaLM 协同

3.2 矛盾 2 · Anthropic Mythos 是否为公开 Claude 系列下一代代号

  • 冲突:Stephen 0910 news-x-vip-radar 提及"Anthropic 旗舰模型 Mythos 经第三方供应商门户被攻陷";flyp 7-21 0951 Substack 短评 §4 标记"待补查";Anthropic 公开模型系列 = Claude Opus / Sonnet / Haiku,Mythos 不在公开系列
  • 疑点:Mythos 可能是内部代号 / 第三方供应商命名 / 已被废弃的早期命名;建议:Stephen 晚场稿核 Anthropic 官方 blog + Bloomberg Law 原报道 + BlueGlass AI 团队披露原文;不入 risk.md / agent.md 主档前必须有"是 Anthropic 官方模型"独立源核验

3.3 矛盾 3 · Databricks 79%/11% 数字 vs Berkeley RDI 40% Agentic AI 项目取消预测

  • 冲突:Databricks 2026 当前数字 = 40% Agent 项目取消风险;Berkeley RDI 预测 2027 末 = 40% Agentic AI 项目取消;两者数字相同(40%)但时间窗口不同(2026 当前 vs 2027 末)
  • 判断:可能 Berkeley RDI 引用 Databricks 数字,或两者独立调研结果相同(纯属巧合);建议:Stephen 晚场稿核 Berkeley RDI 原文 + 是否引用 Databricks;agent.md §3.1 共识 36 候选中避免双重引用同一 40% 数字作为独立佐证

3.4 矛盾 4 · IBM Research Model Routing Sonnet $79 vs GPT-4.1 $155 数字

  • 冲突:Jay 1335 引用 IBM Research × HF Blog 数字 Claude Sonnet 4.6 总成本 $79($0.19/任务)vs GPT-4.1 总成本 $155($0.37/任务)在 AppWorld Test Challenge;但 v26 横切 53b 引用 Artificial Analysis Coding Agent Index 2026-05 模型 + harness pair 32× cost spread $0.07-$2.26
  • 判断:两者可能都对 — 差异来自工作负载(CodeAct agent vs 通用 Coding Agent)+ 缓存复用率 + benchmark 任务;对照 v25 Silent Hyperparameter 16.6pp 偏移理解
  • 建议:agent.md §2.5 IBM Routing 节点备注"硬件/工作负载/缓存策略导致 benchmark 差异显著"= 与 v26 横切 53b 32× cost spread + 89%/52% 量化缺口 同源

3.5 待核实 · Cost-Aware Evaluation arXiv:2607.15263 完整 TLDR

  • 冲突:paper_cards/482-2607-15263.md TLDR 截断;Tom 0853 候选 §6 只给标题;具体评测数字(哪些模型在 Cybench + Splunk BOTS v1 固定预算下的成功率分布)未给
  • 建议:Stephen 晚场稿 / Tom 7-21 晚场稿 PDF 核 arXiv:2607.15263 + Splunk BOTS v1 基准代表性

3.6 待核实 · Behavioral Privacy Leakage arXiv:2607.06815 ε/δ 数字

  • 冲突:paper_cards/487-2607-06815.md TLDR 提到 (ε, δ)-差分隐私 + 几乎确定收敛,但具体 ε/δ 数字 + 收敛速度 trade-off 未给
  • 建议:Stephen 晚场稿 / Jay 7-21 晚场稿 PDF 核 arXiv:2607.06815 + 自适应随机策略实现细节

3.7 待核实 · Lilian Weng Harness Engineering 6 个 recurring failure modes

  • 冲突:coding-agents.md §三、§37 引用 "Trehan & Chopra 2026 引用" 6 个 recurring failure modes,但 coding-agents.md 未列具体 6 个模式
  • 建议:Stephen 晚场稿 / Jay 7-21 晚场稿精读 Lilian Weng 2026-07-04 https://lilianweng.github.io/posts/2026-07-04-harness/ + 列具体 6 个 recurring failure modes + propose-evaluate-accept 闭环具体步骤

3.8 待核实 · HF 入侵事件 17,000+ 独立操作 vs 之前数字

  • 冲突:Jay 1105 §一 提到 HF 7/16 入侵 = 单周末 17,000+ 独立操作 / 跨临时沙盒集群执行;v25 §1.43 引用 HF 入侵 = "17,000+ 攻击事件 / 数万次自动化动作"
  • 判断:两者数字一致(17,000+ = 17,000+);但 Jay 1105 描述更具体 = "17,000+ 独立操作,跨临时沙盒集群执行"
  • 建议:agent.md / risk.md §1.45 升格"HF 入侵 v25 沿用 + v27 补 Jay 1105 详细记录(17,000+ 独立操作 / 临时沙盒集群 / 自迁移 C2 / GLM 5.2 forensic triage)"= 与 v25 GLM 5.2 defender-asymmetry 闭环延续

4. 涉及 arXiv 号列表(本次新增)

arXiv 来源 主分类 与 agent.md 关系 v27 沿用候选
arXiv:2607.15263 Tom 7-21 0840 radar 候选 + paper_cards/482 agent(benchmark) §2.6 第 31 子节 Cost-Aware 🟢 v27 §2.6 新增
arXiv:2607.06815 Tom 7-21 0840 radar ⚡高 #3 + paper_cards/487 agent(application) §2.6 第 32 子节 Behavioral Privacy 🟢 v27 §2.6 新增
arXiv:2607.15314 Tom 7-21 0900 HF Daily #10(43 票)+ Jay 1105 §七 + Stephen 1245 §2.10 agent(vertical medical LLM) §2.7 行业与平台动态 🟢 v27 §2.7 新增
arXiv:2606.14589 Jay 7-21 1122 engineering-e1prep §条目 8 agent(OpenClaw 案例) v25 §1.43 沿用 + v26 Silent Failures 沿用 ✅ v25 沿用(无需新增)

合计 7-21 agent 主分类新增 arXiv 3 件(其中 v26 未沿用 = 3 件,v26 已沿用需更新 1 件)= v27 净增量 3-4 信号 = 1 横切 + 1 横切辅助(Lilian Weng Harness 升级)+ 1 共识 + 1 开放问题 + 0-1 趋势 = 与 v26 14 信号相比略少,符合"v26 已饱和"判断


5. 检查过的来源(全部)

5.1 inbox jay(7-19 ~ 7-21 共 35+ 个相关)

  • 7-19(22 份,沿用 v26):morning-briefing-ai-agents-stack-jul2026 / 11× RSS / inference-engine-benchmark-agent-memory-engineering / engineering-filter-inference-backend-reproducibility-silent-errors / csdn-substack-agentic-rag-multimodal-mlops / evening-hf-security-agentic-attack-langchain-state / evening-hf-arxiv-agent-stack / evening-inference-agentic-production-engineering / agent-security-vecdb-trending / csdn-rag-agent-context-engineering-substack / csdn-substack-rag-agent-llm / evening-briefing / agent-security-vecdb-trending / news-x-tech-radar
  • 7-20(11 份,沿用 v26):csdn-inference-agent-quantization-highvalue / ai-agent-security-vecdb-harness-engineering / 7× RSS / engineering-filter-round1 / morning-briefing-database-backend-cloudnative-inference / substack-github-trending-multimodal-supplement / engineering-e1prep / news-x-tech-radar / rag-agent-memory-research
  • 7-21(≥14 份新增):0820 csdn-inference-stack / 1000 inference-stack-netflix-pytorch-dbaas / 1052 jay-engineering-filter / 1105 afternoon-briefing-llm-agent-db-cloudnative-jul2026(7 部分:HF 入侵 + Turion.ai vLLM/SGLang 趋同 + GitHub Trending Agent Skills + Databricks 79%/11% + Lilian Weng Harness + Raschka LLM 架构 + HF Papers Trending)/ 1122 engineering-e1prep(8 增量全工程价值)/ 1140 news-x-tech-radar(Direct-OPD + LlamaIndex Retrieval Harness + ParseBench + AI Engineer World's Fair 2026)/ 1222 llm-rag-agent-weekly(11 项 CSDN/Substack)/ 1335 afternoon-briefing-hf-blog-github-trending-jul2026(7 部分:vLLM transformers backend + PyTorch attention profiling + IBM Model Routing 三大陷阱 + cognee + FastMCP + OpenSWE/ParseBench 等)

5.2 inbox tom(7-21 共 4 份相关)

  • 7-21 0840 agent-rag-longcontext-radar(8 候选 3 高 3 中 2 低 = Lucid 长期记忆黑盒 + RESOURCE2SKILL + Behavioral Privacy + Human-Centric RAG + Cost-Aware 安全 Agent + REBASE + SVR-R1 + Robot-Centric Pointmaps)
  • 7-21 0853 rag-e1prep(9 增量 4 高 5 中含 RESOURCE2SKILL + Behavioral Privacy + Human-Centric RAG + RAG 安全第 29 面)
  • 7-21 0900 HF Daily(15 篇 = LongStraw 182 + VideoChat3 155 + RESOURCE2SKILL 113 + RAGU 111 + SearchOS-V1 63 + Loop the Loopies 55 + Xiaomi-Robotics-1 54 + BadWAM 50 + xHC 47 + Cura 1T 43 + KeyFrame-Compass 38 + From Pixels to States 33 + MultiRef-Compass 33 + 并发图像理解与生成 31 + UniVR 30)
  • 7-21 0900 rag-lite(4 候选 2 高 = NOWJ@COLIEE 16603 法律四阶段 + Cross-Encoder 蒸馏 LLaMA 3 8B 4-bit 重排 11933)
  • 7-21 2 候选 _candidates JSON(详细富化数据)

5.3 inbox flyp(7-21 共 4 份相关)

  • 7-21 0950 xHC Hyper Connections Expanded critical-read(10 段精读 + 与 v25 GLM-5.2 / v30 立标候选 6 件对齐)
  • 7-21 0951 Substack Interconnects 6 months open models critical-read(66 行 + 与 Nathan Lambert Substack "6 months to live for open models" 互文)
  • 7-21 multimodal-e1prep(279 行 + v30 §2.39.40 ~ §2.39.51 旁证新增 + §1 主线 6/7 升级)
  • 4× RSS 通稿(cameron-wolfe / interconnects / ai-explained / two-minute-papers)

5.4 inbox stephen(7-21 共 25+ 份相关)

  • 7-21 0910 news-x-vip-radar(Anthropic Mythos 漏洞 + 白宫点名 frontier AI 客户名单)
  • 7-21 1003 news-tldr-ai / 1003 news-hf-blog / 1003 news-google-ai / 1003 news-deepmind-news / 1003 news-anthropic-news / 1003 news-openai-news / 1004 news-bens-bites / 1004 news-yt-openai / 1005 news-yt-anthropic / 1005 news-yt-deepmind(8 厂商 news 通稿)
  • 7-21 1245 coordination-check-noon(520 行 + agent 81 + 14 候选 v26 + Lucid + RESOURCE2SKILL + Behavioral Privacy + Human-Centric RAG + Cost-Aware + 4 frontier lab 7-20 ~ 7-21 动作)
  • 7-21 ai-industry-e1prep(338 行 v22 版 + 5 增量:Mythos + Gradient Flow 中国出口管制 + xHC + Netflix + PyTorch 2.13 + DDN NIXL)

5.5 inbox spark(7-21 共 3 份相关)

  • 7-21 1001 rss-gradient-flow(5 篇:新增"中国 AI 出口管制"政策评论 + 25+ Agent 反作弊 + RL 基建下一层 + CLI for Agent + 资金流 Agent = 主线 H/I 第 6 次巩固,主线 A 连续第 4 天缺失 = Q103 阈值首次触发候选)
  • 7-21 1002 rss-chip-huyen(5 篇:旧文 2024-2026 综述,无主线 A 缺失)
  • 7-21 1004 rss-yt-3blue1brown(5 篇:熵/信息论 5 视频,数学基础无关 agent)

5.6 paper_cards(序号 460-487,主分类 agent + agent-rag 跨主题)

  • 460 2607.15330 Xiaomi-Robotics-1(主分类 engineering 副 multimodal,VLA)
  • 461 2607.14530 xHC Expanded Hyper-Connections(主分类 engineering)
  • 462 2607.15161 On-Policy Delta Distillation(主分类 multimodal 副 method)
  • 463 2607.14088 VideoRAE(主分类 multimodal)
  • 464 2607.11683 RAGU(主分类 rag,沿用 v26 §2.3)
  • 465 2607.15963 待核
  • 466 2607.15948 TARS(主分类 agent,沿用 v26 §2.3)
  • 467 2607.16169 Muon for Agentic RL(主分类 agent 副 engineering,沿用 v26 §2.3)
  • 468 2606.29538 RESOURCE2SKILL(主分类 agent 副 multimodal,沿用 v26 §2.3,7-21 HF Daily 113▲)
  • 481 2607.16603 NOWJ@COLIEE 2026 法律检索四阶段(主分类 rag,7-21 Tom rag-lite 高 #1)
  • 482 2607.15263 Beyond Success Rate: Cost-Aware 安全 Agent(主分类 agent 形态 benchmark 副 evaluation,7-21 0840 radar 中 ★NEW27)
  • 483 2607.11498 Robot-Centric Pointmaps(主分类 multimodal,7-21 0840 radar 候选低 #8)
  • 484 2607.10966 待核
  • 485 2607.11933 Cross-Encoder via KD for RAG(主分类 rag,7-21 Tom rag-lite 高 #2)
  • 486 2607.09082 REBASE Reference-Background Subspace Elimination(主分类 multimodal 副 memory/systems,7-21 0840 radar 中 #6)
  • 487 2607.06815 Behavioral Privacy Leakage in Agentic Negotiation(主分类 agent 形态 application 副 llm-infra,7-21 0840 radar ⚡高 #3 ★NEW27)

6. 增量评估与活文档 v27 接力建议

6.1 增量性质判断

类别 数量 评估
新立 arXiv 主分类 agent 3 件(Cost-Aware + Behavioral Privacy + Cura 1T) 中型增量,需 v27 §2.6 + §2.7 多节升格
新立 arXiv agent-rag 跨主题 1 件(NOWJ@COLIEE) 主分类 rag 不进 agent 主体
行业数据 4 件(Databricks + IBM Routing + HF 入侵补 + Anthropic Mythos) 4 件 中型增量,v27 §1.45 + §2.7 + §3.1 多节升格
Substack / Sub-post 政策评论 1 件(Gradient Flow 中国出口管制) 1 件 小型增量,v27 §2.7 沿用 + 主线 A 监控第 4 天实证
Substack Lilian Weng Harness Engineering 2026-07-04 完整精读 1 件 中型增量,v27 §1.34 v26 升格辅助候选
GitHub Trending Agent Skills 4 件(cognee / addyosmani / mattpocock / awesome-ai-agents-2026) 4 件 小型增量,v27 §2.7 沿用 + §2.3 cognee 候选
Spark 主线 A 监控第 3 次实证 + Q103 阈值首次触发 1 件 小型增量,v26 §3.3 Q103 升级
v26 节点反向重新归位(RESOURCE2SKILL HF Daily 43 → 113 票增长 + LongStraw 176 → 182 票增长 + RAGU HF 50 → 111 票) 3 件 小型增量,票数更新

总计 v27 净增量 = 9-11 信号 = 1-2 横切(横切 53c 候选 + 横切 83 候选)+ 1-2 共识(共识 35 候选 + 共识 36 候选)+ 1 开放问题(Q103 升级)+ 0-1 趋势(T107 候选)+ 1 横切辅助(Lilian Weng Harness)= 与 v26 14 信号相比略少,符合"v26 已饱和 + 7-21 是 v27 启动期"的判断

6.2 v27 接力建议(给今晚活文档接手时)

  1. §1.33 横切 53 升格为横切 53b → 53c 候选(量化缺口 89%/52% + IBM Routing 三大陷阱 + vertical LLM 重定义 = 三件套合并)
  2. §1.34 v27 升格辅助:Lilian Weng Harness Engineering 2026-07-04(Harness 闭环 + propose-evaluate-accept + 6 个 recurring failure modes)
  3. §1.45 v27 升格辅助:HF 7/16 入侵 + Anthropic Mythos + 白宫点名 = AI 安全 + 政府监管三向合流窗口(与 v25 GLM 5.2 defender-asymmetry 闭环延续)
  4. §2.3 工具调用与 Agentic RAG 53 → 升格 54 节点(新增 cognee 第五十四)
  5. §2.5 运行时与基础设施 79 → 升格 80 节点(新增 IBM Model Routing 三大工程陷阱第八十)
  6. §2.6 评测、可靠性与对抗 30 → 升格 32 子节(新增 Cost-Aware 第三十一 + Behavioral Privacy 第三十二)
  7. §2.7 行业与平台动态新增 6 个 v27 信号(Databricks + IBM Routing + Cura 1T + Mythos + 白宫点名 + cognee)
  8. §3.1 共识 34 升格为共识 36 候选(Agent 工业级生产差距量化三件套 = 89%/52% observability vs evals + 79%/11% 采用 vs 生产 + 37% lab-vs-production)
  9. §3.3 Q102 进展 + Q103 升级(连续 4 天主线 A 缺失 = Q103 阈值首次触发候选,待 7-22 验证连续 5 天)
  10. §3.4 趋势 T106 升格 T107 候选(Harness Engineering 学科化 = Lilian Weng + propose-evaluate-accept + 6 failure modes)
  11. §4 跨实例审稿链新增 7-21 各实例产出(Jay 7-21 ≥14 份含 1105 7 部分 + 1335 7 部分 + Tom 7-21 4 份含 0840 radar + Stephen 7-21 ≥25 份含 1245 协调棒 + ai-industry-e1prep + Spark 7-21 3 份 + Flyp 7-21 4 份)
  12. §4 Spark Gradient Flow 主线结构升维 7 → 8 次升维(7-21 = 主线 A 连续第 4 天缺失 + Q103 阈值首次触发 + Gradient Flow 新主题「中国 AI 出口管制」 + 主线 H/I 第 6 次巩固)

6.3 重要提醒

  • v26 已饱和,7-21 增量属中型:不必强行凑 v26 14 信号量级,9-11 信号合宜
  • v26 已沿用大量 7-19 ~ 7-20 新立 arXiv(MemoryAgentBench + Beyond Fact Retrieval + Memory in LLM Era + PalmClaw + RESOURCE2SKILL + TARS + Muon + RAGU + Chat2Scenic + GRASP + DSWorld + OAT + STRACE + BadWAM + Lucid + Vinci2-EgoMemo + xHC 17 件),v27 主要工作是新增 arXiv(3 件) + 行业数据(4 件) + Lilian Weng Harness 升格辅助 + Databricks 79%/11% 共识升格
  • Databricks 79%/11% / 40% 取消风险 / 171% ROI / 美国 192% 数字必须与 Berkeley RDI 40% 2027 末取消预测交叉核验(避免双重引用同一数字)
  • Spark 主线 A 监控第 3 次实证(7-18 + 7-19 + 7-20 + 7-21 连续 4 天缺失)= Q103 阈值首次触发候选:若 7-22 仍缺失则触发"连续 5 天 = Q103 阈值完全触发"判定
  • HF 7/16 入侵 + Anthropic Mythos + 白宫点名 = AI 安全 + 政府监管三向合流窗口正式开启 — 这是 v27 §1.45 的核心新增信号,v25 / v26 沿用 HF 入侵但未升格为"AI 监管三向合流"
  • Lilian Weng Harness Engineering 2026-07-04 是 Harness Engineering 学科化里程碑 — coding-agents.md / engineering.md / llm-application.md 已固化,但 agent.md 是否需要单独升格为 v27 §1.34 横切辅助 = Stephen/Flyp/Jay 各自路线已升格,agent.md 是第 4 次固化,优先级中等
  • Cura 1T paper_card 缺失 = Stephen 晚场稿 / Tom 7-21 晚场稿 / Jay 7-21 晚场稿 任一补建

7. 待人工确认 / 冲突 / 缺口清单(给今晚活文档接手)

  1. 🟢 主线 A 连续第 4 天缺失升级为监控第 3 次实证 + Q103 阈值首次触发候选:v26 Q103 进展,7-22 验证连续 5 天是否触发"主线 A 消失判定"完全
  2. 🟢 Databricks 79%/11% / 40% 取消风险 / 171% ROI / 美国 192% 数字独立核验:与 Berkeley RDI 40% 2027 末取消预测交叉核验,避免双重引用
  3. 🟡 HF 7/16 入侵 + Anthropic Mythos + 白宫点名 = AI 安全 + 政府监管三向合流窗口 = v27 §1.45 升格候选:Mythos 是否为公开 Claude 系列下一代代号待核 + BlueGlass AI 团队漏洞披露独立源核实 + 白宫点名原始公告核实
  4. 🟡 Cost-Aware Evaluation arXiv:2607.15263 完整 TLDR 缺失:PDF 核 + Splunk BOTS v1 基准代表性 + 具体评测数字
  5. 🟡 Behavioral Privacy Leakage arXiv:2607.06815 ε/δ 数字:PDF 核 + 自适应随机策略实现细节 + 几乎确定收敛的速度 trade-off
  6. 🟡 Lilian Weng Harness Engineering 6 个 recurring failure modes:PDF 核 + propose-evaluate-accept 闭环具体步骤 + "editable OS abstraction boundaries 被打破" 安全警示实证
  7. 🟡 Cura 1T arXiv:2607.15314 paper_card 未建:Stephen 晚场稿 / Tom 7-21 晚场稿 / Jay 7-21 晚场稿 任一补建 paper_cards/488-2607-15314.md + PDF 核 + 与 OpenMed / Med-PaLM 协同
  8. 🟡 IBM Model Routing Sonnet $79 vs GPT-4.1 $155 数字:PDF 核 AppWorld Test Challenge 数字 + 与 v26 横切 53b 32× cost spread + 89%/52% 量化缺口交叉核验
  9. 🟢 HF Daily 7-21 paper_cards 覆盖度:LongStraw / VideoChat3 / RESOURCE2SKILL / RAGU / SearchOS-V1 / Xiaomi-Robotics-1 / BadWAM / xHC / Cura 1T / KeyFrame-Compass / From Pixels to States / MultiRef-Compass / 并发图像理解与生成 / UniVR 14 篇是否全部 paper_card 已建(待 7-21 晚场稿验证)

撰写实例:spark 撰写时间:2026-07-21 13:30 CST 草稿状态:v1 预消化,不重写 agent.md;只列 7-21 增量与待活文档 v27 消化的方向 v26 沿用 arXiv 编号附录(主分类 agent + agent 跨主题):2606.14589 / 2606.29538 / 2607.02574 / 2607.05382 / 2607.06624 / 2607.07702 / 2607.08459 / 2607.08716 / 2607.10463 / 2607.11149 / 2607.11487 / 2607.11523 / 2607.11683 / 2607.12227 / 2607.12747 / 2607.12764 / 2607.13027 / 2607.13104 / 2607.13705 / 2607.13988 / 2607.14187 / 2607.14202 / 2607.14387 / 2607.14530 / 2607.14777 / 2607.14830 / 2607.14935 / 2607.14952 / 2607.15095 / 2607.15207 / 2607.15257 / 2607.15277 / 2607.15314 / 2607.15330 / 2607.15657 / 2607.15901 / 2607.15948 / 2607.16169 / 2507.05257 / 2511.07587 / 2601.07978 / 2604.01707 / 2602.23368 / 2602.16603 v27 新增候选 arXiv 编号(本简报):2607.15263 / 2607.06815 / 2607.15314