llm-application · E1 预消化简报(2026-07-26)

作者:Stephen · llm-application 主题 E1 预消化棒 · cron c08ec05d 生成时间:2026-07-26 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-07-25 21:10(上一棒 7-25 llm-application-e1prep 收官)→ 2026-07-26 21:08(本次扫描截止,约 24 小时) 检查范围:inbox/jay(7-26 当日 23 份 + 7-25 evening 4 份延续 = 27 份)+ inbox/tom(7-26 当日 5 份 + 7-25 evening 4 份 = 9 份)+ inbox/flyp(7-26 当日 6 份 + 7-25 evening 1 份 = 7 份)+ inbox/spark(7-26 当日 4 份: 1 llm-infra E1 + 3 RSS + 7-25 evening 1 份延续 = 5 份)+ inbox/stephen(7-26 当日 14 份 + 7-25 evening 2 份延续 = 16 份);paper_cards 近 3 天新卡(560-585 沿用 + 586-597 经典回填 12 张);work-queue.md(2026-07-26 20:00 自动检测) 对照活文档:/shared/research-kb/organized/knowledge/llm-application.md v36(2026-07-26 04:00 CST · 17h 前固化 · 90 试金石 + 218 项 arXiv ID 候选池 + 36 中型增量候选池 + 63 维 Reliability 候选池 + 128 反方维度 + 351 拐点) 本文性质:Stephen llm-application 主题 E1 日间预消化;不重写活文档,只列 7-25 21:10 → 7-26 21:08 约 24h 窗口内v36 候选池 10+9 = 19 件之外的新增量条目,供今晚活文档 v37 接力决策参考 结构框架:v36 五大主线(① Coding Agent ② Personal Assistant Agent ③ Vertical LLM ④ Agentic RAG ⑤ Application-layer Reliability) + v33 6 补丁 + v34 7 补丁 + v35 4 补丁 + v36 4 补丁 + v35 2 周边 + v36 2 周边 = 27 补丁链;沿用 v33/v34/v35/v36 不立标哲学;v36 → v37 过渡期 7-26 ~ 7-28 = frontier lab 平台层竞速 + Microsoft Agent Framework 1.0 框架统一 + MCP 2026-07-28 RC 完整披露 + AAAI 2026 Subramanian RAG 范式转折 + Fail-Plausible 五类分类法


0. 综述判断(给今晚活文档接手时一眼看到)

v36 已固化 19 件候选池(10 arXiv + 9 非 arXiv)+ 90 试金石 + 218 项 arXiv ID 候选池 + 36 中型增量候选池(v36 §0.5 + §1.1 5 段 fresh signals + §1.2 5 主线各候选池增量 + §1.3 4 补丁 + 2 周边补丁);v33/v34/v35/v36 沿用不立标哲学,候选池等 7-27 ~ 7-30 跨实例核验后再做第二轮立标决定。

本次 7-25 21:10 → 7-26 21:08 约 24h 窗口本质:Stephen 7-25 21:10 llm-application-e1prep 收官后,7-26 截至 21:10 共扫描 stephen 16 份 + jay 27 份 + tom 9 份 + flyp 7 份 + spark 5 份 = 64 份产出Spark 7-26 18:40 llm-infra-e1prep 触发(spark E1 节奏回落第 1 日恢复后第 2 日完整恢复)+ stephen 7-26 12:45 noon 协调棒确认 7-26 当日 45 份产出 vs 7-25 全天 51 份(持平略减,工作日延续)+ spark 7-26 13:38 agent-e1prep 落 6 P0 主线 + stephen 7-26 10:20 ai-industry-e1prep v28 准备棒落 16 件 v28 候选增量(以 frontier lab 立标为主)。

7-26 24h 窗口增量性质:v36 候选池 19 件(10 arXiv + 9 非 arXiv)之外的新硬资产,聚焦三大方向:

  1. 企业 Agent 框架 2026 H1 重大格局变动 + Claude Sonnet 5 + OpenAI Presence + LeCun AMI Labs = frontier lab 平台层 + 框架层 + 资本层三栖立标——Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen + Alice Labs 框架评分新晋 S 级 + Claude Sonnet 5"更代理化的 Sonnet" + Managed Agents effort 设置 + OpenAI Presence enterprise AI agent 平台 + Project Camellia Effingham County AI 基础设施 + LeCun AMI Labs $1.03B 种子轮 + 走"非 LLM 世界模型"路线 + Jim Fan「第二次预训练范式」立场 3.0 = v36 §1.3 补丁 ㉞「Microsoft MAF Harness Glasswing 风格」延展到 v37「Microsoft Agent Framework 1.0 统一 Semantic Kernel + AutoGen + Claude Sonnet 5 + OpenAI Presence + LeCun AMI Labs = 企业 Agent 框架 + frontier lab 平台层 + 资本层四栖」合流

  2. Agentic RAG 范式转折新立标 + arXiv:2605.01280 数学优化立场论文完整展开 + arXiv:2605.11733 Energy-to-Token 评估框架 + arXiv:2606.14589 Fail-Plausible 五类分类法完整披露 + MCP 2026-07-28 RC 6 SEP 完整披露 = v36 候选池 ID 已收但细节披露不足的 4 件深化——AAAI 2026 Subramanian et al.「Keyword search is all you need」Agentic 搜索工具调用替代向量检索(6 数据集 head-to-head + FinanceBench 30.40% vs 24.24% + Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 全部转向工具调用检索)+ 数学优化取代启发式(Ω(√(B log G)) 改善因子)+ Energy-to-Token(每日 140T token 调用 + ByteDance Doubao 120T/天)+ Fail-Plausible 五类分类法(8 周生产数据 + 22 postmortem + 28 manifestation + Class D fail-plausible + 4,286 测试 ex ante 阻止率=0 + recurring 阻断率=87% + 最佳检测器=人类阅读产品输出)+ MCP 2026-07-28 RC 6 SEP(SEP-2567 + SEP-2260 + SEP-2133 + SEP-2663 + SEP-837 + SEP-1865)= v36 §1.2 主线 ⑤ 第六十三~六十五维候选 + v36 §1.3 补丁 ㉝ Quiet failure 升格 + v36 §1.3 补丁 ㊱ K8s 事实标准 邻接

  3. GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 + AREX 沿用 + SLAI T-Rex 沿用 + NVIDIA OO Agents 沿用 + Tencent WorkBuddy 沿用 + Sample-Efficient 沿用 + Multi-Agent RAG + RL arXiv:2505.17086 = Harness 工程化栈 + Coding Agent 抗污染 + Agent 训练基础设施三栖立标——alibaba/open-code-review 混合 LLM+规则引擎代码审查(12,981 stars · 今日 +431)+ citrolabs/ego-lite Browser Agent 基础设施 + andrewyng/aisuite 统一多 GenAI 提供商接口 + deepagents-ai/agent-backend MCP Filesystem API + SSH + Docker 长生命周期会话持久化 + RyanCodrai/turbovec Rust + Python bindings 基于 TurboQuant + 1000+ JD 量化 AI Engineer 画像(AI-first ≈70% / Python 82.5% / RAG 35.9% / Prompt Engineering 29.1% / LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8% / K8s 29.1% / AWS 40.1%) = v36 §1.2 主线 ② 第四十一~四十八节点 量化补全

v37 候选池预估:v36 候选池 10 件 arXiv 中 4 件在 7-26 24h 内获得新细节披露(主要新增 = arXiv:2605.01280 数学优化立场论文完整展开 + arXiv:2605.11733 Energy-to-Token 评估框架 + arXiv:2606.14589 Fail-Plausible 五类分类法完整披露 + arXiv:2505.17086 Multi-Agent RAG + RL AAMAS 2026),v36 候选池 9 件非 arXiv 中 3 件获得新细节(MCP 2026-07-28 RC 完整披露 6 SEP + Microsoft MAF Harness 沿用 + Google ADK Go 2.0 沿用)。v37 候选池新增预计 5-7 件 = Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen 1 件 + Claude Sonnet 5 + Managed Agents effort 设置 1 件 + OpenAI Presence enterprise AI agent 平台 1 件 + LeCun AMI Labs $1.03B 1 件 + Jim Fan 第二次预训练范式立场 3.0 1 件 + AAAI 2026 Subramanian Keyword search 1 件 + GitHub Trending 6 件 1 件 = v37 候选池密度 v36 → v37 预计再增 ~30%(19 件 v36 → 24-26 件 v37)。


1. 增量条目(8 件主线 + 2 件旁证,按"建议归入节"分组)

增量 1 · 🔴 P0 重大 · Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen = 企业 Agent 框架 2026 H1 重大格局变动 = Alice Labs 框架评分新晋 S 级 = v36 §1.3 补丁 ㉞「Microsoft MAF Harness Glasswing 风格」深度延展

  • 来源:
    • inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md 高价值 2(Alice Labs 框架评分 + Microsoft Agent Framework 1.0)
    • inbox/jay/2026-07-26-1123-engineering-e1prep.md 增量 7(Alice Labs 评分 + Microsoft Agent Framework 1.0 统一 Semantic Kernel + AutoGen)
    • inbox/spark/2026-07-26-1840-llm-infra-e1prep.md 增量 5(同源)
    • inbox/stephen/2026-07-26-1245-stephen-coordination-check-noon.md §1.4(已识别 + 待补)
  • 要点:
    • Microsoft Agent Framework 1.0(2026-04-03)= 统一 Semantic Kernel + AutoGen——企业客户从"二选一"变成"统一接入"——v36 §1.3 补丁 ㉞「MAF Harness Glasswing 风格商业 SDK」具体化为「Microsoft Agent Framework 1.0 = 企业 Agent 框架统一 + Alice Labs 评分新晋 S 级」
    • Alice Labs 框架评分(18+ 生产部署经验):① LangGraph 1.0 GA(2025-10)+ Q2 2026 per-node timeout + durable streaming = S 级;② Claude Agent SDK renamed 2026-Q1 + hierarchical subagent spawning(2026-06)= S 级;③ Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen = 新晋 S 级;④ CrewAI 1.14(2026-05~06)pluggable-backend releases = A 级;⑤ LlamaIndex Workflows 1.0(2026-06-22)= A 级;⑥ Pydantic AI V2(2026-06-23)harness-first redesign = A 级;⑦ AG2 / AutoGen legacy = 仅用于学术多 agent 对话研究 = B 级
    • 核心工程决策维度(Alice Labs):Cost · Latency · Efficacy · Assurance · Reliability
    • 工程评价:Microsoft Agent Framework 1.0 是 2026 年最大变量——统一 Semantic Kernel 和 AutoGen 后,企业客户从"二选一"变成"统一接入",预计会显著压缩 CrewAI 和 LlamaIndex 的企业份额。LangGraph 1.0 凭 durable streaming 和 per-node timeout 补全了生产可观测性短板
    • 新发现(v36 未收):Alice Labs 18+ 生产部署数据未公开复现 + 评分维度 Cost/Latency/Efficacy/Assurance/Reliability 5 维 与 Simon Willison / LangChain 评分体系对比验证未做
  • 与活文档关系:
    • v36 §1.3 补丁 ㉞「Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 DAG = 商业 Harness SDK 立标 + Multi-Agent 编排新阶段」已固化,但 v36 补丁 ㉞ 仅写「Microsoft MAF Harness BUILD 2026」= jay 7-25 1055 engineering-filter 的产品名;7-26 增量 1 是「Microsoft Agent Framework 1.0 = Semantic Kernel + AutoGen 统一框架」= 7-26 jay engineering + spark llm-infra 双源印证的具体版本号 + 时间 + 框架合并细节
    • v36 §1.2 主线 ① Coding Agent +2(Enterprise LLM Agent 三层 + Tencent WorkBuddy) + v36 §3.1 #130(MAF Harness + Enterprise LLM Agent 三层 + Google ADK Go 2.0) + v36 §6 跨文档 agent.md / engineering.md 邻接 = 7-26 增量 1 把 #130 的「Microsoft MAF Harness」具象化为「Microsoft Agent Framework 1.0」并加 Alice Labs 评分坐标
  • 反方 / 警示:
    • ⚠️ Alice Labs 18+ 部署数据未公开复现——具体生产环境类型分布未给(企业 vs 初创 vs 政府)
    • ⚠️ Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验——可能为 Alice Labs 博客日期 vs 实际 GitHub release tag 差
    • ⚠️ Alice Labs Cost/Latency/Efficacy/Assurance/Reliability 5 维评分体系——与 LangChain Production-Grade / Simon Willison / Hugging Face Production-Ready 评分体系无交叉验证
    • ⚠️ CSDN 智能体开发者社区 2026-07-11 Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)vs Microsoft Agent Framework 1.0 是否同一框架待核(juejin / CSDN vs Microsoft 官方 GitHub 仓库)
  • 建议归入节:v37 §1.3 补丁 ㊳「Microsoft Agent Framework 1.0(2026-04-03)+ Semantic Kernel + AutoGen 统一 + Alice Labs 框架评分新晋 S 级 = 企业 Agent 框架 2026 H1 重大格局变动」 + v37 §1.2 主线 ① 第二十六节点(沿用 v36 第二十五节点 + 增量 1) + v37 §3.1 共识(候选新增 132「企业 Agent 框架 2026 H1 = Microsoft Agent Framework 1.0 统一 Semantic Kernel + AutoGen + Claude Agent SDK hierarchical subagent + LangGraph 1.0 durable streaming」) + v37 §6 engineering.md / agent.md 跨文档引用补全

增量 2 · 🔴 P0 重大 · AAAI 2026 Subramanian et al.「Keyword search is all you need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use」= Agentic 搜索工具调用替代向量检索 6 数据集 head-to-head + FinanceBench 30.40% vs 24.24% + Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 全部转向工具调用检索 = v36 §1.2 主线 ④ Agentic RAG 重大范式转折新立标

  • 来源:
    • inbox/jay/2026-07-26-1106-rag-agent-llm-systems-briefing.md 高价值 3(AAAI 2026 Subramanian + GitHub 链接)
    • inbox/jay/2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md 高价值 6(AAAI 2026 完整复述 + 论文标题 + GitHub + Spider Plot)
    • inbox/jay/2026-07-26-1140-news-x-tech-radar.md #1-2(Sakana AI Conductor + Retrieval Harness in LlamaParse 邻接)
    • inbox/jay/2026-07-26-afternoon-briefing-colibri-cliagents-arxiv-hf-substack.md(Subramanian arXiv 引用)
    • inbox/spark/2026-07-26-1338-agent-e1prep.md 增量 7(同源 P1 旁证)
    • inbox/tom/2026-07-26-0850-rag-e1prep.md v45 增量 5(RAG 70-80% 生产前失败多源印证邻接)
  • 要点:
    • 核心实验:相同 LLM(Claude 3 Sonnet · 200K 上下文),ReAct Agent 调用 pdfmetadata / rga / pdfgrep 等关键词工具 vs Bedrock Knowledge Base Titan Embeddings 向量检索,6 个数据集对比,结果差异极小
    • 关键数据:FinanceBench(长表格型财务文件)关键词搜索 30.40% vs 向量搜索 24.24%——关键词搜索反而超越向量搜索
    • 产业证据:Claude Code、Cursor、Windsurf、Devin(Cognition)、Cline、Sourcegraph Amp主流 Agent 产品已不再将语料索引进向量数据库,而是将检索暴露为工具让 LLM 自行决定调用时机
    • 论文引用:Subramanian et al., "Keyword search is all you need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use", AAAI 2026;GitHub 链接附 Medium 文章 https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f
  • 与活文档关系:
    • v36 §1.2 主线 ④ Agentic RAG(沿用 v35 第五十九~六十一节点 + 4 件 RAG 失效模式量化补全)中,RAG 四大失效模式(Chunk boundary / Embedding model mismatch / Reranking absence / Context window saturation)已入,但 Agentic 搜索工具调用替代向量检索这一"工具调用派 vs 向量检索派"对立 = v36 未入;v36 §1.2 主线 ② Personal Assistant Agent 第四十一~四十八节点 候选池 + v36 §1.3 补丁 ㉟ Isolation 5 边界 survey anchor + v36 §1.3 补丁 ㉝ Compounding Error + Quiet failure = 7-26 增量 2 把"RAG 范式转折"与 v36 §1.3 补丁 ㉝「RAG 四大失效模式」关联
    • v36 §1.2 主线 ④ Agentic RAG 第五十九~六十一节点候选池(沿用 v35) + v36 §6 rag.md 跨文档引用 + v36 §6 engineering.md 跨文档引用 = 7-26 增量 2 把"Agentic RAG"立标补完"工具调用派 vs 向量检索派"对立维度
  • 反方 / 警示:
    • ⚠️ AAAI 2026 论文原文未精读(jay 7-26 已列 🔴 精读建议 + GitHub 链接)——6 数据集的具体领域 / 规模 / 评估方法未独立核验
    • ⚠️ Claude 3 Sonnet(200K 上下文)vs 当前 SOTA Claude Opus 5 / Sonnet 5 / GPT-5.6 Sol 头对头数据未给——同一 LLM 不同代的 token budget / 工具使用能力差异未量化
    • ⚠️ 产业证据「Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 全部转向工具调用检索」vs 「v36 §1.2 主线 ④ 主线 A-RAG / xMemory / UniAI-GraphRAG 邻接」的 GraphRAG / Hierarchical RAG 范式 立场对立——v36 §1.2 主线 ④ 主线与产业证据存在张力
    • ⚠️ 30.40% vs 24.24% 是 raw accuracy 还是 normalized score 未给——6 数据集是否使用同一评估协议未明
  • 建议归入节:v37 §1.2 主线 ④ Agentic RAG 第六十二~六十四节点候选池 + v37 §1.3 补丁 ㊴「AAAI 2026 Subramanian et al.『Keyword search is all you need』= Agentic 搜索工具调用替代向量检索 6 数据集 head-to-head + 主流 Agent 厂商采纳 = RAG 范式转折新立标」 + v37 §3.1 共识(候选新增 133「Agentic 搜索工具调用 = 向量检索替代方案 · 主流 Agent 厂商已采纳 · FinanceBench 关键词搜索 30.40% > 向量搜索 24.24%」) + v37 §6 rag.md / agent.md / engineering.md 跨文档引用补全

增量 3 · 🔴 P0 重大 · Claude Sonnet 5(更"代理化"的 Sonnet)+ Claude Developer Platform Managed Agents effort 设置 = Anthropic 7-22 ~ 7-26 平台层 agent 编排双栖立标 + Claude Sonnet 5 vs Opus 5 / Fable 5 / Sonnet 4.6 模型矩阵形态分化第二例

  • 来源:
    • inbox/stephen/2026-07-26-1002-news-anthropic-news.md 5 URL(Claude Sonnet 5 + Opus 5 系统卡 + Economic Futures Research Fund + Anthropic 经济指数连接器 + Public First Action 2000 万美元)
    • inbox/stephen/2026-07-26-0910-news-x-vip-radar.md(releasebot.io 报道 7/22 前后)
    • inbox/stephen/2026-07-26-1003-news-yt-anthropic.md 5 视频(关于 Claude 思考方式的不同层次 + 推出 Claude Fable 5 + 将 Claude 思维转化为语言 + Project Glasswing 保护全球软件安全 + 当 AI 表现出情感时)
    • inbox/jay/2026-07-26-1000-rss-simon-willison.md 3 URL(7-25 Boris Cherny 引语 + 7-24 推出 Claude Opus 5)
    • inbox/spark/2026-07-26-1338-agent-e1prep.md 增量 1(同源 P0 主线 · 立标首位)
    • inbox/flyp/2026-07-26-1002-rss-yt-two-minute-papers.md(Claude 揭示 AI 最大问题)
    • inbox/flyp/2026-07-26-1003-rss-yt-ai-explained.md(Claude Fable 被封禁 + Fable 5 vs GPT 5.6 Sol 早期结果 + Fable 5 完整 319 页拆解)
  • 要点:
    • Claude Sonnet 5 = "更代理化" 的 Sonnet——推理 / 工具使用 / 编码 / 知识工作相对 4.6 大幅提升——Anthropic 7-22 ~ 7-26 平台层 agent 编排第 1 立标
    • Claude Enterprise 更细粒度的使用分析 + 模型授权管理——企业级 agent 编排工具链补完
    • Claude Developer Platform Managed Agents effort 设置(7-22)——webhook 覆盖环境 / 记忆存储事件 + 会话播种事件流更新与版本检查 = Anthropic 平台层 agent 编排第 2 立标
    • Anthropic Managed Agents effort 设置 vs OpenAI Reasoning effort 设置 vs Google Gemini 3.6 Flash effort 三者形成 effort 编排竞速
    • Boris Cherny 评论层 7-25 ~ 7-26 6 媒体长尾:Google news + Simon Willison + Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow 6 媒体持续 48h 头条——评论层长尾 7-25 ~ 7-26 6 媒体续立
  • 与活文档关系:
    • v36 §1.1 fresh signals 第 1 段「Claude Opus 5 系统卡 + Boris Cherny『prompt injection 最难』评论 + Project Pilot + Economic Index/Fund = frontier lab 六栖验证链条」已固化 Opus 5(7-24 evening 立标首位)+ Boris Cherny 评论 + Project Pilot + Economic Index/Fund,Sonnet 5 + Managed Agents effort 设置 = v36 未入 frontier lab 平台层 agent 编排——v36 §1.3 补丁 ㉜「Claude Opus 5 prompt injection 鲁棒性 = 模型层零信任执行」+ v36 §3.1 #125「frontier lab 六栖验证链条」+ v36 §5.1 #120「Opus 5 prompt injection 鲁棒性 + Boris Cherny 评论层二次立标 + System Card 第 73 页埋没 + 红队验证」** = 7-26 增量 3 把"Opus 5 立标"延展到"Anthropic 模型矩阵 2026-Q3 全栈立标(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Managed Agents effort)"
    • v36 §1.2 主线 ① Coding Agent +2(Enterprise LLM Agent 三层 + Tencent WorkBuddy) + v36 §1.2 主线 ② Personal Assistant Agent 第四十一~四十八节点 候选池 = 7-26 增量 3 把"Anthropic 7-22 ~ 7-26 平台层"具象化为"Sonnet 5 + Managed Agents effort"
  • 反方 / 警示:
    • ⚠️ Claude Sonnet 5 "更代理化" 具体定义未明——Anthropic 官方 Sonnet 5 vs Opus 5 vs Fable 5 / Sonnet 4.6 / Opus 4.6 / Opus 4.8 模型矩阵文档未公开
    • ⚠️ Sonnet 5 工具使用相对 4.6 提升幅度数字待核——Anthropic 官方未给具体 SWE-bench Verified / Multi-Agent benchmark 数字
    • ⚠️ Managed Agents effort 精度 vs OpenAI Reasoning effort / Gemini 3.6 Flash effort head-to-head 待核——effort 编排三家框架对比数据未给
    • ⚠️ Anthropic Mythos 5(网络安全/生物研究领先)vs Fable 5(长时自主数小时-数天)vs Opus 5(中等/bounded tasks + 经济性)vs Sonnet 5(更代理化)模型矩阵关系待核——VentureBeat 2026-07-25 三层关系描述未独立核验
    • ⚠️ Sonnet 5 系统卡是否同步发布未给——Opus 5 系统卡已 7-24 evening 发布,Sonnet 5 系统卡是否同日发布待核
  • 建议归入节:v37 §1.1 fresh signals 第 6 段「Anthropic Claude Sonnet 5 + Managed Agents effort 设置 = 平台层 agent 编排双栖立标」 + v37 §1.3 补丁 ㊵「Anthropic 模型矩阵 2026-Q3 = Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Managed Agents effort = frontier lab 六栖验证链条升级」 + v37 §3.1 共识(候选新增 134「Anthropic 2026-Q3 模型矩阵 = Sonnet 5『更代理化』+ Opus 5『中等/bounded tasks』+ Fable 5『长时自主』+ Mythos 5『网络安全/生物研究』= 模型矩阵形态分化第 2 例」) + v37 §6 ai-industry.md / agent.md / engineering.md 跨文档引用补全

增量 4 · 🟡 P0 重要 · OpenAI Presence enterprise AI agent 平台 + Project Camellia Effingham County AI 基础设施 + Advancing the Next Era of National Science = OpenAI 7-22 ~ 7-26 三栖项目化 + 与 Google DeepMind DOE Genesis 计划 双立标

  • 来源:
    • inbox/stephen/2026-07-26-1002-news-openai-news.md 5 URL(OpenAI Presence 推出 + ChatGPT Health + Effingham County + Advancing National Science + 新闻机构)
    • inbox/stephen/2026-07-26-1245-stephen-coordination-check-noon.md §1.3 增量 5(OpenAI Presence 三栖项目化已识别)
    • inbox/spark/2026-07-26-1338-agent-e1prep.md 增量 3(同源 P0 主线)
    • inbox/stephen/2026-07-26-1020-ai-industry-e1prep.md §F + 增量 7(同源)
  • 要点:
    • OpenAI Presence = enterprise AI agent 平台——成熟的 enterprise AI agent 平台,帮助组织部署值得信赖的语音与聊天 agents,用于客户及内部工作流——OpenAI 平台层 agent 编排 enterprise 升级(继 v36 §2.95 ChatGPT Health 之后)
    • Project Camellia = Effingham County AI 基础设施——OpenAI 在乔治亚州 Effingham County 宣布,承诺推进负责任能源、社区投资、就业以及 Codex 访问权限——OpenAI 资本层基础设施 + 美国本土 AI 算力主权第 2 例
    • Advancing the Next Era of National Science——OpenAI 阐述推进美国科学的承诺,将与美国能源部及国家实验室合作,利用前沿 AI 加速科学发现——OpenAI + 美国国家科学战略第 1 例(与 Google DeepMind DOE Genesis 计划对照)
    • OpenAI 媒体层扩张:新闻机构如何利用 AI 推进其重要使命(OpenAI 工具为全球新闻从业者和出版商提供支持)
  • 与活文档关系:
    • v36 §1.1 fresh signals 第 1 段「Claude Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund」仅收 Anthropic,OpenAI 平台层 agent 编排 + 资本层 + 国家科学战略 = v36 未入 frontier lab 平台层;v36 §1.3 补丁 ㉜「frontier lab 六栖验证链条」+ v36 §3.1 #125 = 7-26 增量 4 把"OpenAI 7-22 ~ 7-26 三栖项目化"具象化为"OpenAI Presence + Project Camellia + Advancing National Science"
    • v36 §6 ai-industry.md 跨文档引用:v36 已收"OpenAI 5 件 + ChatGPT Health vertical LLM + Public First Action 2000 万美元 + LLM 安全事件"——7-26 增量 4 延展到"OpenAI Presence enterprise AI agent 平台 + Project Camellia Effingham County AI 基础设施 + Advancing National Science 国家科学战略"
  • 反方 / 警示:
    • ⚠️ OpenAI Presence enterprise AI agent 平台 vs Microsoft MAF Harness / Google ADK Go 2.0 / Amazon Bedrock Agents / Salesforce Agentforce head-to-head 未给——客户数 / 部署规模 / 工作流自动化率 待核
    • ⚠️ Project Camellia Effingham County AI 基础设施 实际投资额 / 算力规模 / Codex 访问权限具体细则待核——OpenAI 官方仅给"承诺"框架
    • ⚠️ Advancing National Science 与美国能源部 / 国家实验室合作的具体研究领域 + 4 项优先 + 投资规模 待核——OpenAI 官方仅给承诺框架
    • ⚠️ ChatGPT Health 沿用 + 新闻机构 AI 推进 + Project Camellia + Advancing National Science + OpenAI Presence 5 URL 头条 vs 实际项目落地 关系——5 件事并非同时落地,部分为 PR 公告
  • 建议归入节:v37 §1.1 fresh signals 第 7 段「OpenAI 7-22 ~ 7-26 三栖项目化 = OpenAI Presence enterprise AI agent 平台 + Project Camellia Effingham County AI 基础设施 + Advancing National Science 国家科学战略」 + v37 §1.3 补丁 ㊶「OpenAI 平台层 + 资本层 + 国家科学战略 三栖项目化 = 与 Anthropic 模型矩阵 + Google DeepMind DOE Genesis 计划 双立标」 + v37 §3.1 共识(候选新增 135「OpenAI 7-22 ~ 7-26 三栖项目化 = enterprise agent 平台 + 美国本土 AI 算力主权 + 国家科学战略」) + v37 §6 ai-industry.md / agent.md 跨文档引用补全

增量 5 · 🟡 P0 重要 · LeCun AMI Labs $1.03B 种子轮 + $3.5B 估值 + 走"非 LLM 世界模型"路线 + 印度 AI Impact Summit 2026「AGI 仍多年之远」= 路线层资本 × 立场三栖立标 = frontier lab 路线层 反 LLM 主旋律立标第 1 例

  • 来源:
    • inbox/stephen/2026-07-26-0910-news-x-vip-radar.md(capacityglobal.com 转引 LeCun AMI Labs $1.03B 种子轮 + 印度 AI Impact Summit 2026)
    • inbox/stephen/2026-07-26-1020-ai-industry-e1prep.md §B 增量 3(同源 P0 立标)
    • inbox/stephen/2026-07-26-1245-stephen-coordination-check-noon.md §1.3 增量 3(同源)
    • inbox/spark/2026-07-26-1338-agent-e1prep.md 增量 4(同源 P0 主线)
    • inbox/flyp/2026-07-26-1000-rss-cameron-wolfe.md(沿用 Agentic World Models 路线)
  • 要点:
    • LeCun 出走 Meta 后建立 Advanced Machine Intelligence(AMI)Labs
    • $1.03B 种子轮 + $3.5B 估值——frontier lab 路线层资本立标(继 v30 §1 frontier lab 全栈立标 + v25 横切 65 GPT-5.6 Sol + Ultra 子代理 资本层之后)
    • 走"非 LLM 世界模型"路线——与 v36 §1.44 WAM 知行鸿沟 + Jim Fan「Large World Models 元年」+ 路线层立标
    • 印度 AI Impact Summit 2026「AGI 仍多年之远」——立场层评论立标(继 v36 §1.45 Boris Cherny Opus 5 评论 + Anthropic Global Workspace omarsar0 长帖 + Jim Fan 第二次预训练范式立场 3.0 之后 第 4 例)
    • Jim Fan「第二次预训练范式」立场 3.0——从下一 token 预测走向"下一物理世界状态预测"+ 断言 2026 = Large World Models 元年 + VLMs 是 language-first 负担——NVIDIA 立场化评论者 + World Models 路线
  • 与活文档关系:
    • v36 §1.1 fresh signals 第 1 段「Claude Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund」仅收 Anthropic,LeCun AMI Labs + Jim Fan 立场 3.0 = v36 未入 frontier lab 路线层资本立标;v36 §1.3 补丁 ㉜「frontier lab 六栖验证链条」 = 7-26 增量 5 把"路线层资本 × 立场"具象化为"LeCun AMI Labs + Jim Fan 第二次预训练范式"
    • v36 §1.44 横切 82 WAM 知行鸿沟(BadWAM arXiv:2607.15207) + v36 §1.45 Boris Cherny Opus 5 评论 + v36 §2.6 33 子节 Self-State Attacks + 同源;v37 §1.45 frontier lab 立标 §6 行业升级候选新增 5 件合并(Sonnet 5 + Managed Agents + LeCun AMI Labs + Jim Fan 第二次预训练范式 + Gemini 3 全栈)
  • 反方 / 警示:
    • ⚠️ LeCun AMI Labs $1.03B 细节待核:团队规模 / 研究方向 / 路线图 / 投资者名单 / 估值依据 / 与 Meta FAIR 关系 / "非 LLM 世界模型"路线商业化时间表——公开报道仅给"$1.03B 种子轮 + $3.5B 估值 + 走非 LLM 世界模型路线"三点
    • ⚠️ LeCun "AGI 仍多年之远" 立场 vs Anthropic / OpenAI / Google DeepMind 立场 head-to-head 待核——Anthropic 7-14 X 引语 + OpenAI 7-22 ~ 7-26 三栖项目化 + Google DeepMind DOE Genesis 计划 立场对比未做
    • ⚠️ AMI Labs vs Sakana AI Conductor arXiv:2512.04388(ICLR 2026 · jay 7-26 1140 x-tech-radar #1) + Prime Intellect ECHO arXiv:2506.06266(jay 7-25 1140 x-tech-radar #4) 关系待核——三家世界模型路线代表实验室 / 公司无 head-to-head 评估
    • ⚠️ AMI Labs $3.5B 估值与 Pi-AI / Mistral / Cohere / xAI / DeepSeek / 智谱 / 月之暗面 资本层估值对比——frontier lab 二线厂商估值横评未做
    • ⚠️ Jim Fan 立场 3.0 vs v32 立场 2.0 演进证据链 待 PDF 核——Jim Fan 立场 2.0 = "VLA 已死 · 世界动作模型接棒"(v30 §6 隐性主线 46 / v27 §6 沿用),立场 3.0 = "第二次预训练范式(下一物理世界状态预测)+ 2026 = Large World Models 元年 + VLMs 是 language-first 负担"——具体定义 + 训练范式 + vs 当前 next-token prediction 关系 + 数据 pipeline + 评测方法 待 PDF 核
  • 建议归入节:v37 §1.1 fresh signals 第 8 段「LeCun AMI Labs $1.03B 种子轮 + $3.5B 估值 + 走『非 LLM 世界模型』路线 + 印度 AI Impact Summit 2026『AGI 仍多年之远』+ Jim Fan 第二次预训练范式立场 3.0」 + v37 §1.3 补丁 ㊷「frontier lab 路线层 = LeCun AMI Labs 资本 × 立场 + Jim Fan 第二次预训练范式立场 3.0 + VLMs 是 language-first 负担 = 反 LLM 主旋律立标第 1 例」 + v37 §3.1 共识(候选新增 136「frontier lab 路线层 = 非 LLM 世界模型 反 LLM 主旋律立标」) + v37 §4.1 拐点(候选新增 207「AMI Labs 团队 / 路线图 / 估值依据 / 与 Meta FAIR 关系 / 商业化时间表」)

增量 6 · 🟡 P1 邻接 · arXiv:2605.01280 数学优化立场论文完整展开(Chen et al. 2026 Ω(√(B log G)) 改善因子 + 数学优化取代启发式)+ arXiv:2605.11733 Energy-to-Token 全新评估框架(140T token 调用 + ByteDance Doubao 120T/天)+ arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露 = v36 候选池 arXiv ID 已收但细节披露不足的 3 件深化

  • 来源:
    • inbox/spark/2026-07-26-1840-llm-infra-e1prep.md 增量 1 + 增量 2 + 增量 3(完整披露 arXiv:2605.01280 + 2605.11733 + 2606.14589)
    • inbox/jay/2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md(arXiv:2605.01280 + 2605.11733 同源)
    • inbox/jay/2026-07-26-1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md 高价值 3 + 高价值 4(同源)
    • inbox/jay/2026-07-26-evening-engineering-filter.md 高价值 1 + 高价值 2(arXiv:2606.14589 Fail-Plausible 同源)
    • inbox/jay/2026-07-26T1505-five-category-briefing.md §backend ⭐⭐⭐(arXiv:2606.14589 同源)
    • inbox/flyp/2026-07-26-risk-e1prep.md 增量 2(arXiv:2606.14589 同源)
  • 要点:
    • arXiv:2605.01280「LLM Serving 需要数学优化,而非启发式」立场论文完整展开:
      • 核心主张:LLM Serving 系统应借鉴运筹学(Operations Research)数学优化方法,而非依赖 trace 驱动的启发式调优
      • Chen et al. (2026) 请求路由 + DP load balancing 算法:在 barrier-synchronized + sticky-assignment 设置下,证明即使请求序列是对抗性的,其算法相对默认策略的 long-run average imbalance 改善因子为 Ω(√(B log G)),其中 B 是 per-worker batch size,G 是 worker 数量
      • 数学优化 vs 启发式:worst-case 理论保证,不依赖特定 trace 分布或到达频率;P99 trace 驱动的启发式调优无法保证 worst-case
    • arXiv:2605.11733「LLM 推理应评估为『能量-Token 产出』」全新评估框架:
      • 核心主张:到 2026 年 3 月,每日 token 调用量 ~140T(较 2024 年初增长 ~1000×),仅 ByteDance Doubao 就达 ~120T/天
      • Energy-to-Token 评估框架:应将 LLM 推理评估为单位能量/token 产出的效率,而非单纯的速度或准确率
      • 2026 年 API 价格表:DeepSeek cache-miss input 价格 + Pro discount 有时限 + 定价差异与 P(t) 天花板约束(区域算力可用性)一致
      • 数据稀缺性论点:高质量人类生成文本数据可能在 2026-2028 窗口期相对模型规模变得更加稀缺,与推理能力增长形成矛盾
    • arXiv:2606.14589「Silent Failures in Production LLM Agent Systems: A Longitudinal Study」完整展开:
      • 8 周真实生产数据:1 个 personal-assistant agent runtime(2026-03 起)+ 约 40 个定时任务、8 个 LLM provider、1 个 tool-governance proxy、1 个 knowledge-base memory plane
      • 防御:4,286 个单元测试 + 827 个声明式治理检查
      • 8 周窗口:22 个完整 postmortem,28 次静默失败 manifestation
      • 五类静默失败分类法:A 环境与平台怪癖 / B 设计假设错配 / C 错误吞没与稀释 / D 链式幻觉与伪造(fail-plausible) / E 操作遗漏与取证盲点
      • Class D = LLM 时代特有的 gray failure 升级:传统 gray failure 是"观察者看不见",fail-plausible 是"观察者被失败本身用流畅的谎言说服"——LLM 把错误变成了"看起来完全正常"的输出
      • 防御有效性:4,286 测试 + 827 治理检查 = 未能阻止任何新发事故(ex ante),但成功阻止 87% 的历史事故再次发生(recurring)
      • 最佳检测器:人类阅读产品输出(非自动化监控)
  • 与活文档关系:
    • v36 §0.5 arXiv ID 候选池已收 arXiv:2605.01280 + arXiv:2605.11733 + arXiv:2606.14589,但 v36 §1.2 主线 ② / ⑤ / §1.3 补丁 ㉗ 仅以一行记录,细节完整披露 = 7-26 增量 6 把 v36 已收 ID 从"一行点名"深化到"完整披露五类分类法 / Chen et al. Ω(√(B log G)) / 140T token 调用"
    • v36 §1.3 补丁 ㉗「KV Cache Side-Channel 多租户被低估攻击面」+ v36 §1.3 补丁 ㉝「Quiet failure ≠ Loud failure 升格」 = 7-26 增量 6 把"Class D fail-plausible"具象化为"LLM Agent 静默失败分类法五类"
  • 反方 / 警示:
    • ⚠️ arXiv:2605.11733 140T token/天 + ByteDance Doubao 120T/天 数字未给具体计算方法——API 调用量 vs 实际推理 token 量 vs 用户对话量 vs 内部调用量——数据来源待核
    • ⚠️ arXiv:2605.01280 立场论文 vs 实证研究——这是 arXiv 立场论文(position paper),非实证 benchmark;是否有 SIGMOD/SOSP/OSDI 2026 H2 评审会议接受实证论文需要追踪
    • ⚠️ arXiv:2606.14589 单来源数据 + 单一生产环境——只有 1 个 personal-assistant agent runtime + 8 周窗口 + 40 个定时任务;是否具有跨生产环境普适性需要追踪
    • ⚠️ v36 §6 rag.md / engineering.md / systems.md 跨文档引用:v36 §1.3 补丁 ㉝ 仅引 arXiv:2606.14589,7-26 增量 6 完整披露五类分类法后,补丁 ㉝ 需要补充 8 周生产数据 + 22 postmortem + Class D fail-plausible 细节
  • 建议归入节:v37 §1.1 fresh signals 第 9 段「arXiv:2605.01280 数学优化立场论文完整展开 + arXiv:2605.11733 Energy-to-Token 全新评估框架 + arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露」 + v37 §1.2 主线 ⑤ Application-layer Reliability 第六十六~六十八维候选池 + v37 §1.3 补丁 ㊸「数学优化取代启发式(arXiv:2605.01280)+ Energy-to-Token 评估框架(arXiv:2605.11733)+ Fail-Plausible 五类分类法(arXiv:2606.14589)= LLM Serving 评估三维升级」 + v37 §6 engineering.md / risk.md / systems.md 跨文档引用补全

增量 7 · 🟡 P1 邻接 · MCP 2026-07-28 RC 6 SEP 完整披露(SEP-2567 + SEP-2260 + SEP-2133 + SEP-2663 + SEP-837 + SEP-1865)= Agent 协议栈生态模块化关键里程碑 + Tasks extension 适配 stateless model 流式推理

  • 来源:
    • inbox/jay/2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md 高价值 7(完整披露 6 SEP)
    • inbox/jay/2026-07-26-1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md 高价值 1(同源)
    • inbox/spark/2026-07-26-1840-llm-infra-e1prep.md 增量 6(同源)
    • inbox/jay/2026-07-26-csdn-substack-llm-inference-rag-weekly.md(同源)
  • 要点:
    • SEP-2567 移除 Mcp-Session-Id 与协议级 session——简化有状态协议设计,客户端不再依赖 server 端 session 追踪
    • SEP-2260 Server 发起的请求必须在客户端请求处理期间——解决 long-running server 发起的回调无法关联上下文的问题
    • SEP-2133 Extensions 独立版本管理——reverse-DNS ID 标识 + extensions 独立仓库 + 独立维护者 + 独立于规范版本演进——MCP 生态模块化的关键里程碑
    • SEP-2663 Tasks extension 重塑生命周期——server 可返回 task handle,客户端通过 tasks/gettasks/updatetasks/cancel 驱动异步任务——适配 stateless model 的流式推理场景
    • SEP-837 OIDC Dynamic Client Registration 修复——修复桌面/CLI 客户端被 Authorization Server 错误标记为"web"类型导致 localhost redirect URI 被拒的问题
    • SEP-1865 MCP Apps——server 可推送 sandboxed iframe HTML 界面,实现富交互式工具,无需每个 host 单独实现 UI 渲染
  • 与活文档关系:
    • v36 §1.3 补丁 ㉖「MCP 协议从『连接型』向『无状态』迁移安全工程缺口」+ v36 §6 engineering.md / agent.md 跨文档引用 = v36 已收"MCP 2026-07-28 新版规范无状态化",但 6 SEP 完整披露 = 7-26 增量 7 把 v36 补丁 ㉖ 从"一行点名"深化到"6 SEP 完整内容"
    • v36 §1.3 补丁 ㉝「Quiet failure ≠ Loud failure 升格」+ v36 §1.3 补丁 ㊱「CNCF llm-d K8s 事实标准」+ v36 §1.3 补丁 ㊲「TurboQuant + VeriCache + vLLM MRV2 三件套」 = 7-26 增量 7 把"MCP 协议栈生态模块化"具象化为"6 SEP + Tasks extension"
  • 反方 / 警示:
    • 🟢 官方规范变更,可信度高——官方 blog 提前披露 RC 内容(blog.modelcontextprotocol.io/posts/2026-07-28-release-candidate)
    • ⚠️ 实际 GA 时间 + 各主流 MCP client(Claude Desktop / Zed IDE / Cursor)支持时间线待跟踪——2026-08 GA 时间线待核
    • ⚠️ SEP-2663 Tasks extension 是否真能适配 stateless model 流式推理场景——jay 已列"立场论文 vs 实证研究"警示
  • 建议归入节:v37 §1.3 补丁 ㉖ 深化「MCP 2026-07-28 RC 6 SEP 完整披露 + Tasks extension 适配 stateless model 流式推理 + Extensions 独立版本管理 + MCP Apps sandboxed iframe」 + v37 §6 engineering.md / agent.md / systems.md 跨文档引用补全
  • 来源:
    • inbox/jay/2026-07-26-0935-github-trending-ai-deploy-stack-job-market.md(6 件 GitHub Trending + 1000+ JD 量化)
    • inbox/jay/2026-07-26-1123-engineering-e1prep.md 增量 1-7(同源)
    • inbox/jay/2026-07-26-1106-rag-agent-llm-systems-briefing.md 高价值 7(arXiv:2505.17086 + arXiv:2505.22571v2)
    • inbox/jay/2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md 高价值 10(arXiv:2505.17086 + arXiv:2505.22571v2 完整复述)
    • inbox/spark/2026-07-26-1840-llm-infra-e1prep.md 旁证 1(OpenForgeRL + ReOPD 邻接)
    • inbox/spark/2026-07-26-1338-agent-e1prep.md 增量 8(同源 P1 旁证)
  • 要点:
    • alibaba/open-code-review 混合 LLM+规则引擎代码审查(12,981 stars · 今日 +431)——确定性 pipeline + LLM Agent 双轨 · 行级精确评论 · 兼容 OpenAI/Anthropic
    • citrolabs/ego-lite Browser Agent 基础设施(986 stars)——共享登录态浏览器会话给 AI Agent,解决 Codex/Claude Code 无法操作登录态页面痛点
    • andrewyng/aisuite 统一多 GenAI 提供商接口——避免 vendor lock-in
    • deepagents-ai/agent-backend AI Agent 分布式文件系统后端——MCP Filesystem API + SSH + Docker · 长生命周期会话持久化
    • RyanCodrai/turbovec Rust + Python bindings · 向量索引底层实现 · 基于 TurboQuant
    • 1000+ JD 量化 AI Engineer 画像(alexbeyondata.substack.com/p/what-1000-job-descriptions-reveal)——AI-first ≈70% · Python 82.5% · RAG 35.9% · Prompt Engineering 29.1% · LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8% · K8s 29.1% · AWS 40.1% / Azure 23.9% / GCP 23.0%
    • Northflank 6 层 AI 应用部署栈——Frontend → Backend → Database → Vector Store(pgvector 早期 / Pinecone-Qdrant 规模化)→ Model Inference → Background Jobs
    • arXiv:2505.17086 "Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning"——AAMAS 2026 已中,Multi-Agent RAG + RL 微调策略方向
    • arXiv:2505.22571v2 "Agent-UniRAG: A Trainable Open-Source LLM Agent Framework for Unified RAG"——端到端统一 RAG 框架,支持单跳+多跳 Query 自适应,用 LangGraph 实现
  • 与活文档关系:
    • v36 §1.2 主线 ② Personal Assistant Agent 第四十一~四十八节点 候选池 + v36 §1.3 补丁 ㉞「Microsoft MAF Harness Glasswing 风格商业 SDK」 = v36 已收"商业 Harness vs 学术 Harness"新维度,GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 = v36 未入 Harness 工程化栈 + 职业趋势量化数据
    • v36 §1.2 主线 ④ Agentic RAG 第五十九~六十一节点候选池 + 4 件 RAG 失效模式量化补全 = v36 未入 Agent-UniRAG arXiv:2505.22571v2 端到端统一 RAG 框架,arXiv:2505.17086 Multi-Agent RAG + RL AAMAS 2026 已中 = v36 §1.2 主线 ④ 第六十二节点候选
  • 反方 / 警示:
    • ⚠️ GitHub stars 数量是 GitHub Trending 实时数据,可能在 7-26 21:10 后变化——具体数字 12,981 stars + 今日 +431 是 7-26 上午数据
    • ⚠️ arXiv:2505.17086 AAMAS 2026 已中待正式录用名单确认——AAMAS 2026 正式录用名单待发布
    • ⚠️ arXiv:2505.22571v2 GitHub 仓库 + LangGraph 实现细节待核——README + stars + 是否 production-ready 待独立验证
    • ⚠️ 1000+ JD 量化 AI Engineer 画像是 Substack 第三方汇总,一手 JD 数据集待核——alexbeyondata.substack.com vs alexeygrigorev.substack.com 是否同源数据待核
  • 建议归入节:v37 §1.2 主线 ② 第四十九~五十节点候选池(alibaba/open-code-review + citrolabs/ego-lite + andrewyng/aisuite + deepagents-ai/agent-backend + RyanCodrai/turbovec + 1000+ JD AI Engineer 画像) + v37 §1.2 主线 ④ 第六十二~六十三节点候选池(arXiv:2505.17086 AAMAS 2026 Multi-Agent RAG + RL + arXiv:2505.22571v2 Agent-UniRAG) + v37 §3.1 共识(候选新增 137「Harness 工程化栈 6 件 GitHub Trending + Multi-Agent RAG + RL AAMAS 2026 立标」) + v37 §6 engineering.md / agent.md / rag.md 跨文档引用补全

增量 9 · 🟢 P2 监测 · arXiv:2607.21503 Agentic Context Management flyp 7-26 15:50 critical-read 7 项反方 P3 待核 + arXiv:2607.21557 OpenForgeRL 续立标 = v36 候选池 arXiv 已收但反方补强的新增

  • 来源:
    • inbox/flyp/2026-07-26-1550-Agentic-Context-Management-critical-read.md(flyp 7-26 15:50 critical-read · arXiv:2607.21503v1 · 7 项反方 P3 待核)
    • inbox/flyp/2026-07-26-risk-e1prep.md 增量 1(同源)
    • inbox/jay/2026-07-26T1505-five-category-briefing.md §backend ⭐⭐⭐(ACM 同源)
    • inbox/tom/2026-07-26-0840-agent-rag-longcontext-radar.md(OpenForgeRL + ReOPD 续立)
    • inbox/tom/2026-07-26T1440-agent-rag-longcontext-radar.md(OpenForgeRL + ReOPD 续立)
    • inbox/tom/2026-07-26-0850-rag-e1prep.md v45(ACM 同源)
    • inbox/tom/2026-07-26-evaluation-e1prep.md §增量 3 + §矛盾 2(ACM 邻接)
  • 要点:
    • flyp 7-26 15:50 ACM critical-read 7 项反方 P3 待核:① position + reference implementation 双形态;② LongMemEval 92% / LoCoMo 93.2% 数字源头不可独立验证;③ Maximem Synap 与参考实现关系不明(同一团队商业公司 vs 学术实现);④ 多模态特殊性被回避;⑤ 未对比同期 SOTA(PRO-LONG arXiv:2607.20064v2 · RRB 2607.x · MemGPT · ACE 无 head-to-head);⑥ decision-level / org-level 是尚未展开 frontier;⑦ §6 configuration detailed 含糊(是否包含非公开数据 / 私有 embedding / 私有 LLM 后端)
    • flyP 立场:ACM 建议入库归类 agent 主分类 + longcontext / multimodal-agent 副分类;可作为 v33 / R30 候选 P1 邻接立标级(与 PRO-LONG 并列);不升级到 R30 §2.1 C 类立标升级(因 head-to-head / 多模态 / 复现 4 项短板未在摘要层消除)
    • OpenForgeRL arXiv:2607.21557 续立标——harness-native agent 训练基础设施 · 与 OpenClaw/Codex/Claude Code 直接闭环
    • ReOPD arXiv:2607.04763 续立标——多轮 Agent 训练基础设施 · 沿用 7-15
  • 与活文档关系:
    • v36 §1.2 主线 ② 第四十一~四十二节点候选池(Agentic Context Management arXiv:2607.21503 + OpenForgeRL arXiv:2607.21557)+ v36 §3.1 #126 + #127 = v36 已收 ACM + OpenForgeRL,7-26 flyp critical-read 7 项反方 = v36 §3.3 反方 #118 ACM 单作者 + Maximem 背景 + 5 primitives vs 现有 57 节点 + 与 PRO-LONG 立场对比 的细化
  • 反方 / 警示:
    • 🟢 flyp 7-26 15:50 critical-read 可信度高(4.0/5 整体可信度 + tom 0840/1440 + tom eval + jay 1505 + R29 §2.1 C 类已立 = 6+ 源印证)
    • ⚠️ LongMemEval 92% / LoCoMo 93.2% 第三方榜单核对(LoCoMo leaderboard / LongMemEval leaderboard)——如不是头部 SOTA 则降级 P3
    • ⚠️ Maximem Synap 开源仓库位置 + 是否需要 key——是否商业闭源待核
  • 建议归入节:v37 §3.1 共识 #126(沿用)+ v37 §3.3 反方候选新增 #117 ACM 7 项反方 P3 待核 + 4 项子项(§6 PDF 全文补全 + Maximem Synap 开源声明 + LongMemEval/LoCoMo 第三方榜单核对 + 多模态缺口补查) + v37 §6 risk.md 跨文档引用补全

增量 10 · 🟢 P2 监测 · Microsoft SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流(MSR Blog 7-25 + 7-26 续立)= Agent 训练范式四栖立标合流 + SkillOpt 与 Memora 沿用 v36 候选池

  • 来源:
    • inbox/jay/2026-07-26-1001-rss-msr-blog.md(SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖)
    • inbox/jay/2026-07-26-afternoon-briefing-colibri-cliagents-arxiv-hf-substack.md(SkillOpt HF Papers Trending 完整披露)
    • inbox/jay/2026-07-25-1002-rss-msr-blog.md(SkillOpt + Memora 首次披露 7-25)
    • inbox/spark/2026-07-26-1338-agent-e1prep.md 增量 8(同源 P1 旁证)
    • inbox/spark/2026-07-26-1840-llm-infra-e1prep.md(邻接)
  • 要点:
    • Microsoft SkillOpt「Text-Space Optimizer for Agent Skills」——将 agent skills 作为外部状态训练,稳定更新、零部署推理开销,多 benchmark 最优
    • Microsoft Memora「A Harmonic Memory Representation Balancing Abstraction and Specificity」——AI agent 无法记住过去的对话,必须持续重载或检索上下文;Memora 通过谐波记忆表征解决了"抽象性 vs 具体性"的二阶决策问题
    • Microsoft Aurora 1.5(沿用 v36)——多模态 agent 框架
    • Microsoft Flint「A Visualization Language for the AI Era」——简短的图表规范易于编写,AI agent 能够生成可视化
    • Microsoft Rust SymCrypt(沿用 v36)——密码学库
  • 与活文档关系:
    • v36 §0.5「v36 候选池非 arXiv 9 件」已收 MSR SkillOpt + Memora,7-26 增量 10 把 v36 已收 ID 从"一行点名"深化到"完整披露 + 五栖合流"(SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖)
    • v36 §3.1 #131(AREX + MSR SkillOpt + Memora + Sample-Efficient Learning = Agent 自我改进范式四栖立标合流) = 7-26 增量 10 把"MSR SkillOpt + Memora"具象化为"完整五栖合流"
  • 反方 / 警示:
    • ⚠️ MSR SkillOpt + Memora 完整论文链接待核——Microsoft Research Blog 链接已确认(microsoft.com/en-us/research/blog/skillopt-agent-skills-as-trainable-parameters/ + memora-a-harmonic-memory-representation-balancing-abstraction-and-specificity/),但 arXiv 链接未确认
    • ⚠️ AREX arXiv:2607.21461 7-25 #1 117▲ 但未建卡(paper_cards/未建)——v36 §1.1 已收 AREX,但 paper_cards 需补建
  • 建议归入节:v37 §1.3 补丁 ㊹「Microsoft SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流 = Agent 训练范式四栖立标合流 + AREX 7-25 #1 117▲ 待建卡」 + v37 §6 agent.md / engineering.md / systems.md 跨文档引用补全

2. 矛盾 / 待核实说法

# 说法 来源 警示类型 状态
1 Microsoft Agent Framework 1.0 发布日期(2026-04-03) + 统一 Semantic Kernel + AutoGen + Alice Labs 18+ 部署经验 + Cost/Latency/Efficacy/Assurance/Reliability 5 维 jay 7-26-1735 + spark 7-26-1840 + jay 7-26-1123 ⚠️ 第三方评分体系主观性——Alice Labs 是 AI 工程咨询公司,18 个生产部署数据可能集中在特定客户类型(企业 vs 初创 vs 政府);是否具有跨公司类型普适性需要追踪 + 与 Simon Willison / LangChain 评分体系对比验证未做 维持 ⚠️ 警示,Microsoft Agent Framework 1.0 与 LangGraph 1.0 / Claude Agent SDK 三足鼎立待独立第三方 benchmark 验证
2 AAAI 2026 Subramanian et al.「Keyword search is all you need」+ 同 LLM(Claude 3 Sonnet 200K 上下文)+ ReAct Agent 调用关键词工具 vs Bedrock Knowledge Base Titan Embeddings 向量检索 6 数据集 head-to-head jay 7-26-1106 + 7-26-2105 + spark 7-26-1338 ⚠️ AAAI 2026 论文原文未精读——6 数据集的具体领域 / 规模 / 评估方法未独立核验 + Claude 3 Sonnet vs 当前 SOTA Opus 5 / Sonnet 5 / GPT-5.6 Sol 头对头数据未给 + 30.40% vs 24.24% 是 raw accuracy 还是 normalized score 未给 维持 ⚠️ 警示,jay 已列 🔴 精读建议
3 Claude Sonnet 5 "更代理化" 具体定义 + 工具使用相对 4.6 提升幅度 + Sonnet 5 vs Opus 5 / Sonnet 5 vs Fable 5 / Sonnet 5 vs Sonnet 4.6 head-to-head stephen 7-26-1002 + 7-26-0910 + jay 7-26-1000 + spark 7-26-1338 ⚠️ Anthropic 模型矩阵官方文档未明确说明 + Managed Agents effort 精度 vs OpenAI Reasoning effort / Gemini 3.6 Flash effort head-to-head 待核 + Anthropic Mythos 5 / Fable 5 / Opus 5 / Sonnet 5 模型矩阵关系待核(VentureBeat 2026-07-25 三层关系描述未独立核验) + Sonnet 5 系统卡是否同步发布未给 维持 ⚠️ 警示,建议读者通过 Anthropic 官方文档独立核验
4 LeCun AMI Labs $1.03B 种子轮 + $3.5B 估值细节 stephen 7-26-0910 + 7-26-1020 + spark 7-26-1338 ⚠️ 团队规模 / 研究方向 / 路线图 / 投资者名单 / 估值依据 / 与 Meta FAIR 关系 / "非 LLM 世界模型" 路线商业化时间表 全部待核 + LeCun "AGI 仍多年之远" 立场 vs Anthropic / OpenAI / Google DeepMind 立场 head-to-head 待核 + AMI Labs vs Sakana AI Conductor + Prime Intellect ECHO 关系待核 + AMI Labs $3.5B 估值与 frontier lab 二线厂商估值横评未做 维持 ⚠️ 警示,建议关注 AMI Labs 官方路线图 + Meta FAIR 后续反应
5 OpenAI Presence enterprise AI agent 平台 + Project Camellia Effingham County AI 基础设施 + Advancing the Next Era of National Science stephen 7-26-1002 + spark 7-26-1338 + stephen 7-26-1020 ⚠️ OpenAI Presence vs Microsoft MAF Harness / Google ADK Go 2.0 / Amazon Bedrock Agents / Salesforce Agentforce head-to-head 未给 + Project Camellia 实际投资额 / 算力规模 / Codex 访问权限具体细则待核 + Advancing National Science 与美国能源部 / 国家实验室合作的具体研究领域 + 4 项优先 + 投资规模 待核 + 5 URL 头条 vs 实际项目落地 关系 维持 ⚠️ 警示,部分为 PR 公告
6 arXiv:2605.11733 ByteDance Doubao 单独贡献 120T token/天(2026-03 较 2024 年初增长 ~1000× 整体 140T/天) spark 7-26-1840 + jay 7-26-2105 + jay 7-26-1735 ⚠️ 数据传染 / 数据来源不明——140T/天 + Doubao 120T/天 数字未给具体计算方法(API 调用量 vs 实际推理 token 量 vs 用户对话量 vs 内部调用量) 维持 ⚠️ 警示,建议通过 ByteDance 官方 2026 Q1 财报或 AI Lab 公告独立核验
7 arXiv:2606.14589 "Fail-Plausible" 五类分类法 + 4,286 测试 + 827 治理检查 ex ante 阻止新发事故率=0 + recurring 阻断率=87% + 最佳检测器=人类阅读产品输出 spark 7-26-1840 + jay 7-26-evening-engineering-filter + jay 7-26T1505 + flyp 7-26-risk-e1prep ⚠️ 单来源数据 + 单一生产环境——只有 1 个 personal-assistant agent runtime + 8 周窗口 + 40 个定时任务;是否具有跨生产环境普适性需要追踪 维持 ⚠️ 警示,新增数据后(更多生产环境 + 12 周窗口)需要重新评估
8 AAAI 2026 Subramanian GitHub 链接附 Medium 文章 https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f jay 7-26-1106 ⚠️ Medium 文章 + GitHub 链接 vs AAAI 2026 论文原文 三层证据链——Medium 文章是二手转述,GitHub 链接是参考实现,AAAI 2026 论文原文是同行评审 维持 ⚠️ 警示,需直接访问 AAAI 2026 论文
9 Microsoft SkillOpt + Memora arXiv 链接未确认——Microsoft Research Blog 链接已确认,但 arXiv 链接未确认 jay 7-26-1001 + 7-26-afternoon-briefing ⚠️ arXiv ID 待核——可能仅是 Microsoft Research Blog 发布,无 arXiv 论文 维持 ⚠️ 警示,Microsoft Research 博客 vs arXiv 论文 vs Hugging Face 论文 三层证据链
10 GitHub Trending 6 件 stars 数字是 GitHub Trending 实时数据(alibaba/open-code-review 12,981 stars + 今日 +431 · citrolabs/ego-lite 986 stars) jay 7-26-0935 + 7-26-1123 ⚠️ 实时数据可能变化——具体数字是 7-26 上午数据,7-26 21:10 后可能变化 维持 ⚠️ 警示,建议读者通过 GitHub 主仓独立核验
11 arXiv:2505.17086 AAMAS 2026 已中待正式录用名单确认 jay 7-26-1106 + 7-26T2105 ⚠️ AAMAS 2026 会议在即,正式录用名单待发布 维持 ⚠️ 警示,建议关注 AAMAS 2026 官方会议列表
12 arXiv:2505.22571v2 Agent-UniRAG GitHub 仓库 + LangGraph 实现细节待核 jay 7-26-1106 ⚠️ README + stars + 是否 production-ready 待独立验证 维持 ⚠️ 警示,需直接访问 arXiv 论文 + GitHub 仓库

3. 可引用的 arXiv 号列表

3.1 v36 候选池 arXiv ID 沿用(本场深化细节披露,未新增 arXiv ID)

arXiv 号 论文/系统 主题归属 在活文档状态 7-26 增量深化内容
2607.21503 Agentic Context Management(Gaurav Dadhich, Maximem) Agent 评测 ✅ v36 §1.2 主线 ② 第四十一节点候选 + §3.1 #126 + §3.3 #118 flyp 7-26 15:50 critical-read 7 项反方 P3 待核 + 4 项子项(§6 PDF + Maximem Synap 开源 + 第三方榜单 + 多模态)
2607.21557 OpenForgeRL(Xiao Yu Columbia + Baolin Peng MSR + Ruize Xu Dartmouth + Jianfeng Gao MSR) Agent 训练 ✅ v36 §1.2 主线 ② 第四十二节点候选 + §3.1 #127 + §3.3 #119 续立标(沿用 7-23 + Tom 7-26 0840/1440 radar ⭐ #1/#2)
2607.12406 Isolation as a First-Class Principle(Huihao Jing + Yangqiu Song et al. HKUST/NYU/SWUPL/MODEIO) Agent 安全 ✅ v36 §1.2 主线 ⑤ 第六十三维 + §1.3 补丁 ㉟ + §3.1 #128 + §3.3 #120 续立标(沿用 7-14 + Tom 7-26 0840/1440)
2607.21461 AREX(BAAI) Agent 训练 ✅ v36 §1.1 fresh signals 第 2 段 + §1.2 主线 ② 第四十六节点 + §3.1 #131 + HF Daily 7-25 #1 117▲ 续立标(7-26 paper_cards 未建卡)
2607.20145 SLAI T-Rex(HF Daily 7-25 #2 56▲) 中国算力主权 ✅ v36 §1.1 + §1.2 主线 ② + §3.1 #131 续立标
2607.20709 NVIDIA-labs OO Agents(HF Daily 7-25 #11 19▲) Agent 编程范式 ✅ v36 §1.1 + §1.2 主线 ② 续立标(7-26 票数 19→22▲)
2607.20911 Tencent WorkBuddy Bench(HF Daily 7-25 #12 18▲) Coding-Agent 基准 ✅ v36 §1.2 主线 ① 第二十五节点候选 续立标(7-26 票数 18→20▲)
2607.21051 Sample-Efficient Learning from Agent Experience Agent 经验学习 ✅ v36 §1.1 + §1.2 主线 ② 第四十七节点 + §3.1 #131 续立标
2504.19874 TurboQuant(Google Research ICLR 2026) KV 量化 ✅ v36 §1.2 主线 ② + §1.3 补丁 ㊲ 续立标
2605.17613 VeriCache(2026-05) KV 量化 ✅ v36 §1.2 主线 ② + §1.3 补丁 ㊲ 续立标
2607.04763 ReOPD Multi-Turn On-Policy Distillation with Prefix Replay Agent 训练 ✅ paper_card 576 + v36 §6 邻接 续立标(Tom 7-26 0840/1440 radar ⭐ #3)
2607.21556 视觉对比自蒸馏 多模态 paper_card 已立 续立标(7-26 票数 41→41▲ 无变化)
2607.21553 SANA-Video 2.0 多模态 paper_card 574 续立标(7-26 票数 15→21▲ 立标级证据加固)
2607.20061 ReferTrack 多模态 paper_card 568 续立标(7-26 票数 44→49▲)
2607.21576 Self-Supervised Structured Dynamics 多模态 paper_card 573 flyp P3 → P2 旁证评级升级建议
2607.21072 Show, Don't Tell 多模态 paper_card 565 续立标(7-26 票数 34→35▲)
2607.12746 Color Pass-Through 多模态 paper_card 571 续立标(7-26 票数 17→18▲)
2607.20734 LLM 在演化的用户意图中迷失 Agent paper_card 569 续立标
2607.16165 面向主动观察者的测试 Agent paper_card 未建 续立标
2607.01774 Subliminal Clocks 多模态 paper_card 未建 续立标(7-26 票数 38▲)
2604.08571v3 RRB / Intra-Query Attention Dilution Agent paper_card 未建 续立标(flyp 7-25 critical-read)
2506.06266 PrimeIntellect True Agents(World Modeling) World Model paper_card 未建 续立标(jay 7-26 1140 x-tech-radar #4)
2512.04388 Sakana AI Conductor(ICLR 2026) World Model paper_card 未建 续立标(jay 7-26 1140 x-tech-radar #1)
2605.06647 Meta Superintelligent Retrieval Agent(TIPS) Agentic RAG paper_card 未建 立标候选(Tom 7-26 rag-v45 #1)
2607.20957 SISAP 2026 ANNS Challenge 向量索引 paper_card 未建 立标候选(Tom 7-26 rag-v45 #2)

3.2 v36 候选池 arXiv ID 细节深化(本场新增完整披露内容,但 arXiv ID 已在 v36 §0.5 中)

arXiv 号 论文/系统 v36 沿用状态 7-26 增量完整披露
2605.01280 LLM Serving 应借鉴 OR 数学优化立场论文 ✅ v36 §0.5 已收(1 行) 完整展开:Chen et al. 2026 Ω(√(B log G)) 改善因子 + 数学优化取代启发式方法论 + vLLM/SGLang 生产调度器是否有类似理论框架落地追踪
2605.11733 LLM 推理应评估为「能量-Token 产出」立场论文 ✅ v36 §0.5 已收(1 行) 完整展开:140T token/日 + ByteDance Doubao 120T/日 + 高质量人类生成数据 2026-2028 稀缺 + 与机器生成 token 泛滥矛盾 + 2026 年 API 价格分层 + DeepSeek cache-miss input 价格
2606.14589 Silent Failures in Production LLM Agent Systems(8 周生产数据) ✅ v36 §0.5 已收(1 行) 完整展开:五类静默失败分类法(A 环境怪癖 / B 设计假设错配 / C 错误吞没 / D 链式幻觉与伪造 fail-plausible / E 操作遗漏) + 40 个定时任务 + 8 个 LLM provider + 4,286 测试 ex ante 阻止率=0 + recurring 阻断率=87% + 最佳检测器=人类阅读产品输出 + "失败作为因果链"复盘方法论

3.3 7-26 当日 P1 旁证 arXiv(本场 v36 §0.5 已收但细节首次披露)

arXiv 号 论文/系统 主题归属 在活文档状态 7-26 增量首次披露
2505.17086 Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning(AAMAS 2026 已中) Multi-Agent RAG + RL ⚠️ v36 §0.5 已收 ID,v36 未展开 AAMAS 2026 已中信息 首次披露 AAMAS 2026 已中 + Multi-Agent RAG + RL 微调策略方向
2505.22571v2 Agent-UniRAG: A Trainable Open-Source LLM Agent Framework for Unified RAG(LangGraph 实现) 端到端统一 RAG ⚠️ v36 §0.5 已收 ID,v36 未展开 LangGraph 实现细节 首次披露 LangGraph 实现 + 单跳+多跳 Query 自适应
  • alibaba/open-code-review · https://github.com/alibaba/open-code-review · 12,981 stars · 今日 +431 · 立标(混合 LLM+规则引擎代码审查)
  • citrolabs/ego-lite · https://github.com/citrolabs/ego-lite · 986 stars · 立标(Browser Agent 基础设施)
  • andrewyng/aisuite · https://github.com/andrewyng/aisuite · 立标(统一多 GenAI 提供商接口)
  • deepagents-ai/agent-backend · https://github.com/deepagents-ai/agent-backend · 立标(AI Agent 分布式文件系统后端 · MCP Filesystem API + SSH + Docker)
  • RyanCodrai/turbovec · https://github.com/RyanCodrai/turbovec · 立标(Rust + Python bindings · 向量索引底层实现 · 基于 TurboQuant)
  • Northflank 6 层 AI 应用部署栈 · https://northflank.com/blog/best-deployment-stack-for-ai-apps · 立标(Frontend → Backend → Database → Vector Store → Model Inference → Background Jobs)
  • 1000+ JD 量化 AI Engineer 画像 · https://alexbeyondata.substack.com/p/what-1000-job-descriptions-reveal · 立标(AI-first ≈70% · Python 82.5% · RAG 35.9% · K8s 29.1% · AWS 40.1%)

3.5 7-26 当日 MCP 2026-07-28 RC 6 SEP 完整披露(已固化 MCP,完整披露)

  • SEP-2567 · 移除 Mcp-Session-Id 与协议级 session
  • SEP-2260 · Server 发起的请求必须在客户端请求处理期间
  • SEP-2133 · Extensions 独立版本管理(reverse-DNS ID + 独立仓库 + 独立维护者)
  • SEP-2663 · Tasks extension(server 返回 task handle + 客户端 tasks/get/update/cancel 驱动异步任务 + 适配 stateless model 流式推理)
  • SEP-837 · OIDC Dynamic Client Registration 修复(localhost redirect URI)
  • SEP-1865 · MCP Apps(server 推送 sandboxed iframe HTML 界面)

3.6 7-26 当日 frontier lab 立标新增 URL(无 arXiv)

  • Anthropic Claude Sonnet 5 + Managed Agents effort 设置(7-22)—— Anthropic 官方 7-22 / 7-24 系统卡
  • Claude Developer Platform Managed Agents effort 设置—— Claude Developer Platform 文档
  • Claude Opus 5 系统卡 + Boris Cherny 评论层(7-24 ~ 7-26 6 媒体长尾续立)
  • OpenAI Presence enterprise AI agent 平台 · https://openai.com/index/introducing-openai-presence
  • Project Camellia Effingham County AI 基础设施 · https://openai.com/index/building-ai-infrastructure-with-the-effingham-county-community
  • Advancing the Next Era of National Science · https://openai.com/index/advancing-the-next-era-of-national-science
  • LeCun AMI Labs $1.03B 种子轮—— capacityglobal.com 转引 + Yann LeCun 印度 AI Impact Summit 2026 演讲
  • Microsoft Agent Framework 1.0(2026-04-03) · alicelabs.ai/en/insights/best-ai-agent-frameworks-2026
  • DeepMind Gemini 3 全栈滚动发布 4 件合并升级 · Gemini 3.6 Flash + 3.5 Flash-Lite + 3.5 Flash 计算机使用 + DOE Genesis 计划 · deepmind.google/blog
  • AAAI 2026 Subramanian et al.「Keyword search is all you need」 · https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f
  • Microsoft SkillOpt · https://www.microsoft.com/en-us/research/blog/skillopt-agent-skills-as-trainable-parameters/
  • Microsoft Memora · https://www.microsoft.com/en-us/research/blog/memora-a-harmonic-memory-representation-balancing-abstraction-and-specificity/

4. 与活文档脉络关系总览(给今晚活文档 v37 接力者)

4.1 8 件主线增量归位建议

  • 增量 1 · Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGenv37 §1.3 补丁 ㊳ + v37 §1.2 主线 ① 第二十六节点 + v37 §3.1 #132 + v37 §6 engineering.md / agent.md
  • 增量 2 · AAAI 2026 Subramanian「Keyword search is all you need」v37 §1.3 补丁 ㊴ + v37 §1.2 主线 ④ 第六十二~六十四节点 + v37 §3.1 #133 + v37 §6 rag.md / agent.md / engineering.md
  • 增量 3 · Claude Sonnet 5 + Managed Agents effort 设置v37 §1.1 fresh signals 第 6 段 + v37 §1.3 补丁 ㊵ + v37 §3.1 #134 + v37 §6 ai-industry.md / agent.md / engineering.md
  • 增量 4 · OpenAI Presence 三栖项目化v37 §1.1 fresh signals 第 7 段 + v37 §1.3 补丁 ㊶ + v37 §3.1 #135 + v37 §6 ai-industry.md / agent.md
  • 增量 5 · LeCun AMI Labs + Jim Fan 第二次预训练范式v37 §1.1 fresh signals 第 8 段 + v37 §1.3 补丁 ㊷ + v37 §3.1 #136 + v37 §4.1 拐点 #207
  • 增量 6 · arXiv:2605.01280 + 2605.11733 + 2606.14589 三件深化v37 §1.1 fresh signals 第 9 段 + v37 §1.2 主线 ⑤ 第六十六~六十八维 + v37 §1.3 补丁 ㊸ + v37 §6 engineering.md / risk.md / systems.md
  • 增量 7 · MCP 2026-07-28 RC 6 SEP 完整披露v37 §1.3 补丁 ㉖ 深化 + v37 §6 engineering.md / agent.md / systems.md
  • 增量 8 · GitHub Trending 6 件 + 1000+ JD + Multi-Agent RAG + RL AAMAS 2026v37 §1.2 主线 ② 第四十九~五十节点 + 主线 ④ 第六十二~六十三节点 + v37 §3.1 #137 + v37 §6 engineering.md / agent.md / rag.md

4.2 2 件旁证增量归位建议

  • 增量 9 · arXiv:2607.21503 ACM flyp 7 项反方 P3 待核v37 §3.1 共识 #126 沿用 + v37 §3.3 反方候选新增 #117 + v37 §6 risk.md
  • 增量 10 · Microsoft SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流v37 §1.3 补丁 ㊹ + v37 §6 agent.md / engineering.md / systems.md

4.3 v37 候选池新增预估

  • 新增 5-7 件候选池:Microsoft Agent Framework 1.0 + Claude Sonnet 5 + OpenAI Presence 三栖项目化 + LeCun AMI Labs + Jim Fan 第二次预训练范式 + AAAI 2026 Subramanian + GitHub Trending 6 件(合 1 件)
  • 深化 3-4 件候选池:arXiv:2605.01280 + arXiv:2605.11733 + arXiv:2606.14589 三件
  • v37 候选池密度 v36 → v37 预计再增 ~30%(19 件 v36 → 24-26 件 v37)
  • v37 主轴合并预估:v25-v36 完整 45 联 + v37 5 补丁(增量 1-5)+ 5 邻接(增量 6-10) = 「6 主线 × 5 主轴 × 90 试金石 × 67 维 Reliability 候选池 + 41 中型增量候选池 + 35 维结构框架」

5. 本场检查过的来源清单

jay/inbox(7-26 当日 23 份 + 7-25 evening 4 份延续 = 27 份): - 2026-07-26-0935-github-trending-ai-deploy-stack-job-market.md(6 件 GitHub Trending + 1000+ JD 量化)✅ - 2026-07-26-1000-rss-bytebytego.md + 2026-07-26-1000-rss-nathan-benaich.md + 2026-07-26-1000-rss-raschka.md + 2026-07-26-1000-rss-simon-willison.md(4 RSS)✅ - 2026-07-26-1001-rss-cool-papers-ir.md + 2026-07-26-1001-rss-cool-papers.md + 2026-07-26-1001-rss-import-ai.md + 2026-07-26-1001-rss-lilian-weng.md + 2026-07-26-1001-rss-msr-blog.md(SkillOpt + Memora 五栖合流)(5 RSS)✅ - 2026-07-26-1002-rss-yt-karpathy.md + 2026-07-26-1003-rss-yt-fireship.md(2 RSS)✅ - 2026-07-26-1106-rag-agent-llm-systems-briefing.md(AAAI Subramanian + Vector DB + CSDN)✅ - 2026-07-26-1123-engineering-e1prep.md(7 增量 + 4 警示)✅ - 2026-07-26-1140-news-x-tech-radar.md(Sakana AI Conductor + Retrieval Harness)✅ - 2026-07-26-1221-csdn-llm-rag-agent.md + 2026-07-26-0822-csdn-substack-llm-inference-rag-weekly.md(2 CSDN)✅ - 2026-07-26-1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(8 高价值)✅ - 2026-07-26-1745-csdn-substack-llm-inference-rag-weekly.md(沿用)✅ - 2026-07-26-1950-jay-engineering-filter.md + 2026-07-26-2155-jay-engineering-filter.md(2 engineering filter)✅ - 2026-07-26-2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md(10 高价值 + pgvector + MCP + AAAI + arXiv:2505.17086/v2 + Vector DB)✅ - 2026-07-26-afternoon-briefing-colibri-cliagents-arxiv-hf-substack.md(SkillOpt HF Papers + AREX + OpenForgeRL + CLI Coding Agent)✅ - 2026-07-26-engineering-e1prep.md(v36 + 7 增量 + 4 警示)✅ - 2026-07-26-engineering-filter.md + 2026-07-26-evening-engineering-filter.md(vLLM K8s OOM + Fail-Plausible)✅ - 2026-07-26-rag-agent-llm-systems-briefing.md + 2026-07-26.md + 2026-07-26T1505-five-category-briefing.md + 2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(4 main briefing)✅ - 2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md(10 高价值)✅ - 2026-07-26-rag-agent-llm-systems-briefing.md(沿用)✅ - 2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(沿用)✅ - 2026-07-26-engineering-e1prep.md(沿用 v36)✅

tom/inbox(7-26 当日 5 份 + 7-25 evening 4 份 = 9 份): - 2026-07-26-0900-hf-daily-2026-07-26.md(HF Daily 7-26 15 件精选)✅ - 2026-07-26-1002-rss-yt-yannic-kilcher.md(TiDAR)✅ - 2026-07-26-1003-rss-yt-lex-fridman.md(Jensen Huang 4 万亿美元公司)✅ - 2026-07-26-0840-agent-rag-longcontext-radar.md(8 候选 + 3 高价值)✅ - 2026-07-26T1440-agent-rag-longcontext-radar.md(14:40 雷达)✅ - 2026-07-26-0850-rag-e1prep.md(v45 + 6 增量)✅ - 2026-07-26-evaluation-e1prep.md(ACM 邻接)✅ - 2026-07-26-rag-e1prep.md(沿用 v45)✅ - 2026-07-26-agent-rag-longcontext-radar.md(沿用)✅

flyp/inbox(7-26 当日 6 份 + 7-25 evening 1 份 = 7 份): - 2026-07-26-multimodal-e1prep.md(v33 准备棒 11 增量候选)✅ - 2026-07-26-risk-e1prep.md(7-26 16:30 CST R29 收官 + 3 增量)✅ - 2026-07-26-0950-Structured-Dynamics-Model-position-paper-critical-read.md(10.3KB P3 → P2 决策)✅ - 2026-07-26-1550-Agentic-Context-Management-critical-read.md(143 行 ACM 7 项反方 P3 待核)✅ - 2026-07-26-1000-rss-cameron-wolfe.md + 2026-07-26-1001-rss-interconnects.md + 2026-07-26-1002-rss-yt-two-minute-papers.md + 2026-07-26-1003-rss-yt-ai-explained.md(4 RSS)✅

spark/inbox(7-26 当日 4 份 + 7-25 evening 1 份 = 5 份): - 2026-07-26-1000-rss-gradient-flow.md + 2026-07-26-1001-rss-chip-huyen.md + 2026-07-26-1003-rss-yt-3blue1brown.md(3 RSS)✅ - 2026-07-26-1338-agent-e1prep.md(348 行 agent E1 6 P0 + 3 P1 + 2 P2)✅ - 2026-07-26-1840-llm-infra-e1prep.md(334 行 llm-infra E1 6 主线 + 2 旁证)✅ - 2026-07-25-1840-llm-infra-e1prep.md(沿用 7-25)✅

stephen/inbox(7-26 当日 14 份 + 7-25 evening 2 份延续 = 16 份): - 2026-07-26-0910-news-x-vip-radar.md(12 账号 + Claude Sonnet 5 + LeCun AMI Labs + Andrew Ng 课程)✅ - 2026-07-26-1002-news-anthropic-news.md(Claude Opus 5 系统卡 + Economic Futures Research Fund + Anthropic 经济指数连接器 + 再向 Public First Action 2000 万美元)✅ - 2026-07-26-1002-news-openai-news.md(5 URL 头条 · ChatGPT Health + Project Camellia + Advancing National Science + 新闻机构 + OpenAI Presence)✅ - 2026-07-26-1002-news-bens-bites.md + 2026-07-26-1002-news-deepmind-news.md + 2026-07-26-1002-news-google-ai.md + 2026-07-26-1002-news-hf-blog.md + 2026-07-26-1002-news-tldr-ai.md(5 frontier news)✅ - 2026-07-26-1003-news-yt-anthropic.md + 2026-07-26-1003-news-yt-deepmind.md + 2026-07-26-1003-news-yt-openai.md(3 frontier YT)✅ - 2026-07-26-1020-ai-industry-e1prep.md(v28 准备棒 16 增量)✅ - 2026-07-26-1245-stephen-coordination-check-noon.md(502 行协调棒)✅ - 2026-07-25-2245-stephen-coordination-check-evening.md(沿用 7-25)✅

paper_cards(近 3 天新卡 IDs 560-597 共 38 张): - 主分类 llm-application:0 张(本场无新增 llm-application 主分类卡片) - 主分类 agent:7 张(564 ACM + 567 Sample-Efficient + 569 LLMs Lost in Evolving User Intent + 575 FinanceComplexQA + 576 ReOPD + 583 + 585 OpenForgeRL) - 主分类 multimodal:6 张(562 + 566 + 568 ReferTrack + 570 Robostral Navigate + 571 Color Pass-Through + 573 Structured Dynamics + 574 SANA-Video 2.0) - 主分类 evaluation:3 张(572 K12-KGraph + 565 Show Don't Tell + 585 OpenForgeRL evaluation 主分类) - 主分类 engineering:多张(均为 OpenAlex 经典回填 1412.6115 / 2305.06161 / 2307.10169 / 2305.01210 / 2305.10403 / 1603.09320 / 2307.15043 / 2301.13867 / 2302.11382 + Diff-Logic EEG 2607.18149) - 主分类 rag:1 张(592 Graph Embedding 经典回填) - 主分类 risk:1 张(589 Hallucination Survey) - 主分类 llm-infra:1 张(586 Vector Quantization) - 586-597 经典回填:12 张(586 Vector Quantization + 587 Wasserstein Barycenters + 588 Transfer Learning Survey + 589 Hallucination Survey + 590 HNSW + 591 Foundation Models Survey + 592 Graph Embedding Survey + 593 + 594 + 595 Federated Learning + 596 Online Learning + 597 Manhattan NMF)

work-queue.md(2026-07-26 20:00): - 待建卡:0 - 待更新主题活文档:llm-infra 9 天未更新 ✅(spark 7-26 1840 llm-infra-e1prep 已部分补救) - 待富化:62 张卡缺 TLDR(待 cron_s2 覆盖)


6. 结论

状态:✅ 完成预消化 增量条数:8 件主线增量 + 2 件旁证 + 12 件矛盾/待核(主线密度与 7-25 持平,符合「v36 大波收尾 → 7-26 中密度补充 + frontier lab 平台层/代理化/路线层/资本层四栖合流」节奏) 涉及 arXiv 号:0 件新立 arXiv(沿用 v36 §0.5 已收 ID) + 3 件 v36 候选池 arXiv 细节完整披露(arXiv:2605.01280 数学优化 + arXiv:2605.11733 Energy-to-Token + arXiv:2606.14589 Fail-Plausible) + 2 件 v36 已收 ID 首次披露细节(arXiv:2505.17086 AAMAS 2026 Multi-Agent RAG + RL + arXiv:2505.22571v2 Agent-UniRAG LangGraph 实现) + 多件沿用(arXiv:2607.21503 + 2607.21557 + 2607.12406 + 2607.21461 + 2607.20145 + 2607.20709 + 2607.20911 + 2607.21051 + 2504.19874 + 2605.17613 + 2607.04763 + 2607.21556 + 2607.21553 + 2607.20061 + 2607.21576 + 2607.21072 + 2607.12746 + 2607.20734 + 2607.16165 + 2607.01774 + 2604.08571v3 + 2506.06266 + 2512.04388 + 2605.06647 + 2607.20957)= 共 25 件 arXiv 涉及**

核心结构: - 主线 ① Coding Agent 增量 1 件(Microsoft Agent Framework 1.0 + 1000+ JD AI Engineer 画像 邻接) - 主线 ② Personal Assistant Agent 增量 3 件(Claude Sonnet 5 + Managed Agents + GitHub Trending 6 件 + MSR SkillOpt/Memora/Aurora 1.5/Flint/Rust SymCrypt 五栖) - 主线 ③ Vertical LLM 增量 0 件(沿用 v35 第六十一节点) - 主线 ④ Agentic RAG 增量 2 件(AAAI 2026 Subramanian + Multi-Agent RAG + RL arXiv:2505.17086 + Agent-UniRAG arXiv:2505.22571v2) - 主线 ⑤ Application-layer Reliability 增量 3 件(OpenAI Presence + arXiv:2606.14589 Fail-Plausible 深化 + MCP 2026-07-28 RC 6 SEP 完整披露)

主要填补: - v37 §1.1 fresh signals 第 6-9 段:Claude Sonnet 5 + Managed Agents effort 设置 + OpenAI 7-22 ~ 7-26 三栖项目化 + LeCun AMI Labs + Jim Fan 第二次预训练范式立场 3.0 + arXiv:2605.01280 + 2605.11733 + 2606.14589 完整披露 - v37 §1.3 补丁链 ㊳-㊹:Microsoft Agent Framework 1.0 + AAAI 2026 Subramanian + Claude Sonnet 5 模型矩阵 + OpenAI Presence 三栖项目化 + LeCun AMI Labs + Fail-Plausible + MCP 2026-07-28 RC 6 SEP + MSR SkillOpt 五栖 - v37 §1.2 主线 ④ Agentic RAG:第六十二~六十四节点(AAAI Subramanian + arXiv:2505.17086 + arXiv:2505.22571v2 + arXiv:2605.06647 + arXiv:2607.20957 5 件立标候选) - v37 §1.2 主线 ⑤ Application-layer Reliability:第六十六~六十八维(arXiv:2605.01280 + 2605.11733 + 2606.14589 三件深化) - v37 §3.1 共识候选新增 132-137:Microsoft Agent Framework 1.0 + AAAI 2026 Subramanian + Anthropic 模型矩阵 + OpenAI 三栖项目化 + frontier lab 路线层 + Harness 工程化栈 6 件

无显著新增量时如实写明:本场 8 件主线增量 + 2 件旁证 = 7-25 8 件主线 + 2 件旁证 持平,符合「v36 大波收尾(7-25 当日 19 件候选池)→ 7-26 中密度补充(8 件主线增量 = frontier lab 平台层/代理化/路线层/资本层四栖合流)」节奏;0 件新立 arXiv(v36 §0.5 已收 25+ arXiv ID 沿用);paper_cards 近 3 天主分类 llm-application 新增 0 张,延续 7-25 同期趋势;work-queue.md 自动检测 llm-infra 9 天未更新(spark 7-26 1840 llm-infra-e1prep 已部分补救)。


Stephen · 2026-07-26 21:10 Asia/Shanghai (UTC 13:10) · llm-application E1 预消化简报 · cron c08ec05d-37de-4c0c-9571-3ead761a4802 触发 · 不重写活文档 · 仅写本文件 · 8 主线 + 2 旁证 + 12 矛盾/待核 + 25 arXiv 涉及