ai-industry · E1 预消化简报(2026-07-25)
主题:ai-industry · 窗口:7-24 16:00 UTC → 7-25 02:00 UTC(亚太早场 ~ 10:00 CST) 承接:knowledge/ai-industry.md 第 26 版(7-25 00:00 凌晨棒 · 133 主线 · 95 arXiv · 11 CVE · 64 URL) 本期增量簇:5 条 P0 立标(Anthropic Claude Opus 5 立标 · OpenAI ChatGPT Health 二次落地 · HF Daily AREX 立标 · TLDR 7-24 Fugu-Ultra + Runway Media Router + Andrew Ng OpenWorker + Agentic Context Management arXiv:2607.21503 立场化立标)+ 3 条 P1 旁证(Nathan Lambert 开源模型综述 podcast · flyP RRB Intra-Query Attention Dilution critical-read · SkillOpt + Memora 微软两连发 agent 记忆栈) 体例:每条 = 来源 / 要点 / 与现有脉络关系 / 建议归入节 / 待核实
0. 检查覆盖度(检查过的来源)
stephen inbox(7-25 当日 13 件全读):0910-news-x-vip-radar · 1002-news-openai-news · 1003-news-anthropic-news · 1003-news-bens-bites · 1003-news-deepmind-news · 1003-news-google-ai · 1003-news-hf-blog · 1003-news-tldr-ai · 1005-news-yt-anthropic · 1005-news-yt-deepmind · 1005-news-yt-openai。
jay inbox(7-25 当日 9 件全读):1000-bytebytego · 1000-nathan-benaich · 1000-raschka · 1000-simon-willison · 1001-cool-papers-ir · 1001-cool-papers · 1001-lilian-weng · 1002-import-ai · 1002-msr-blog。
tom inbox(7-25 当日 3 件全读):0900-hf-daily-2026-07-25 · 1004-rss-yt-lex-fridman · 1004-rss-yt-yannic-kilcher。
flyp inbox(7-25 当日 5 件全读):1000-rss-cameron-wolfe · 1002-rss-interconnects · 1004-rss-yt-ai-explained · 1004-rss-yt-two-minute-papers · 25-RRB-intra-query-attention-dilution-critical-read。
spark inbox(7-25 当日 3 件全读):1001-rss-gradient-flow · 1002-rss-chip-huyen · 1004-rss-yt-3blue1brown。
paper_cards(7-24 ~ 7-25 新增与高频 6 件抽查):545-2607.20368(Self Gradient Forcing 已立)· 562-2607.20092(ENTRAP-VL 旁证已立)· 564-2607.21503(Agentic Context Management · 本期新立标候选)· 567-2607.21051(Sample-Efficient Learning from Agent Experience · 旁证)· 568-2607.20061(ReferTrack 沿用)· 541-2607.18603(AutoIndex 已立)。
活文档基线:knowledge/ai-industry.md 第 26 版(2026-07-25 00:00 凌晨棒)· 第 25 版(2026-07-24 00:00)。
1. 增量条目
1.1 [P0 · 立标] Anthropic Claude Opus 5 正式发布(7-24 evening 立标 + 7-25 系统卡 + 评论) = frontier lab 模型发布节奏首位新立标
来源:stephen 7-25 1003-news-anthropic-news(5 条一手:rss.google.com 引用 anthropic.com)· jay 7-25 1000-rss-simon-willison(3 条评论含 Boris Cherny 引语 + 「正式发布 Claude Opus 5」)· stephen 7-25 1005-news-yt-anthropic(5 条视频含「介绍 Claude Fable 5」「Project Glasswing」)· stephen 7-25 0910-news-x-vip-radar(Anthropic 7-14 价值观 3000+ 跨模型聚类 4 主轴)· web_fetch simonwillison.net 2026-07-25 Boris Cherny 引语。
要点: - Claude Opus 5 系统卡立标(7-24 evening · 推送为 Anthropic 官网模型卡,www-cdn.anthropic.com 托管 PDF)—— Anthropic 自 Fable 5(7-22 evening 立标)之后第二个新旗舰模型立标。 - Boris Cherny(Claude Code 团队)7-25 评论要点:「比起评测分数,我更兴奋的是另一件事:Opus 5 是我们迄今为止最不容易被 prompt injection 的模型。这一点在 system card 中有些被埋没了,但在 PI evals 与红队测试中,Opus 5 很难被成功 prompt inject。」(System Card 第 73 页) - Project Pilot:AI 模型操控无人机 = Anthropic 模型本体物理 agent 实证延续(继 Project Glasswing「保护全球软件安全」+ Fable 5 视频 + 「Claude 思维不同层次」 + 「将 Claude 思维转化为语言」 + 「AI 表现情感时」5 件 YouTube)。 - Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程(Anthropic 经济测度产品 + 研究基金正式立项) = 「经济测度 → Lobby → 经济学测度范式转折」第 3 / 4 件续立(承接第 25 版 + 第 26 版 §1 「Lobby → 经济学测度范式转折」)。 - Anthropic 7-14 X 引语(承接 7-25 雷达但信号弱):Claude 表达 3000+ 价值观,跨模型/语言聚类后识别 4 条主轴(Deference / Warmth 等)· 加拿大 Claude 人均使用量为全球平均 4.4 倍 · 1000 万 CAD 资助加拿大 AI 研究。
与现有脉络关系: - §1「frontier lab 从「模型公司」升格为「全栈 AI 基础设施 + 国家战略合作伙伴 + 健康垂直 + 平台层路由器 + 长 horizon agent」」—— Claude Opus 5 = frontier lab「模型公司」本体节奏首位 7-24 立标(继 Gemini 3.6 Flash + Kimi K3 + Qwen 3.8 + Claude Fable 5 7-16 ~ 7-22 立标密度之后第 5 个 frontier model 立标) - §1「评论层首次显著升格」—— Boris Cherny 「prompt injection 最难」评论 + system card 第 73 页埋没 + 红队验证 = 「评测 → 系统卡 → 评论层 → 红队」四栖验证链条第 1 例 - §2.74「Anthropic 三产品线」—— Anthropic 7-24 evening 资本 + 研究 + 模型 + 物理 agent 四线齐扩 = 资本(基金)· 研究(Economic Index)· 模型(Opus 5)· 物理 agent(Project Pilot)四栖 - §2.87 OpenAI 全栈立标 5 件 + §2.84 推理三连发 = Claude Opus 5 vs GPT-5.6 Sol vs Gemini 3.6 Flash = 「frontier model 三足立标」第 1 例 - §3.1 第 95 / 104 / 105 共识 + §3.2 第 87 争议 → Claude Opus 5 = frontier lab vertical LLM 之外的「本体模型立标」新维度
建议归入节:新立 §2.103「Anthropic Claude Opus 5 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index + Economic Futures Research Fund = frontier lab「模型公司」本体节奏 7-24 evening 立标首位 + 系统卡 → 评论层 → 红队四栖验证链条第 1 例」。归入 §1「frontier lab 模型公司本体节奏」 · §3.1 新增共识 112 · §3.2 新增争议 95 · §4.1 新增开放问题 193。
待核实:Opus 5 上下文窗口 / 训练规模 / 训练 token 量 / 价格 / system card 关键数字 / 与 Fable 5 关系(替代 or 平行)/ vs GPT-5.6 Sol head-to-head / 显存要求 / 推理芯片支持 / 与 Project Pilot 整合路径 / Economic Index 数据是否对外开放 / Economic Futures Research Fund 资助额度。
1.2 [P0 · 立标] OpenAI ChatGPT Health 健康 vertical LLM 7-24 立标 7-25 二次落地(承接 + TLDR 7-24 头条确认)
来源:stephen 7-25 1002-news-openai-news(5 条 · 「在 ChatGPT 中推出 Health」一手)· stephen 7-25 1003-news-tldr-ai(TLDR AI 2026-07-24 头条「ChatGPT Health 🩺, Fugu-Ultra 1.1 🐡, Runway Media Router 🎬」)· web_fetch tldr.tech/ai/2026-07-24(「ChatGPT Health (3 minute read) ... The company said connected health data and related chats would not be used to train foundation models or targ...」)· 已有 v26 §2.95 已立。
要点: - TLDR AI 2026-07-24 头条第 1 位 = ChatGPT Health(继 §2.95 立标后被 TLDR 媒体层升格为周内头条 = 「评论层二次落地」第 1 例) - TLDR 摘录新信息:「The company said connected health data and related chats would not be used to train foundation models or targ...(被截断 · 推测 = not used to target ads)」= 「OpenAI ChatGPT Health 数据训练隔离 + 广告隔离承诺」= 「健康数据合规双层隔离」 = 「vertical LLM 数据治理第 2 例(继 Gemini 3.5 Flash Cyber 「先限政府与可信伙伴 pilot」后)」 - 承接 §2.95 已立条目——本预消化不重复立标,只标记「评论层二次落地」。
与现有脉络关系: - §2.95 OpenAI ChatGPT Health 健康 vertical LLM 立标(7-24 早场新立)= TLDR AI 7-24 = 评论层二次落地 = vertical LLM 升格「评论层 → 周内头条」 - §2.79 Gemini 3.5 Flash Cyber 网络安全 vertical LLM = vertical LLM 「评论层二次落地」第 2 例(继 Gemini 3.5 Flash Cyber 7-22 TLDR 后第 2 例) - §2.74 AI 监管三向合流 = 「健康数据训练隔离 + 广告隔离」双层承诺 = frontier lab 「健康垂直数据治理」第 1 例
建议归入节:承接 §2.95,在 §2.95 末尾追加「🟡 评论层二次落地:TLDR AI 7-24 头条第 1 位 + 「数据训练隔离 + 广告隔离」双层承诺」。不新立 §2 子节;在 §3.1 共识 104 末尾追加「🟢 TLDR AI 7-24 头条第 1 位 + 「数据训练隔离 + 广告隔离」双层承诺」;在 §4.1 开放问题 185 末尾追加「🟢 「健康数据训练隔离 + 广告隔离」承诺的实证检验方法 + vs HIPAA / GDPR 健康数据法规对比」。
待核实:not used to train foundation models or targ... 完整原文 + ChatGPT Health vs Apple HealthKit 数据驻留边界 + 与 Epic / Cerner EHR 集成深度。
1.3 [P0 · 立标] HF Daily Papers 2026-07-25 头条 AREX(arXiv:2607.21461 · 117 票)+ 14 件新论文 = 「7-25 fresh arXiv 立标合集」与 v26 §2.102 形成立标合流
来源:tom 7-25 0900-hf-daily-2026-07-25(15 篇精选按社区票数排序 · 7-25 当日新鲜)· paper_cards 抽查 6 件(545 / 562 / 564 / 567 / 568 / 541)。
要点(按票数排序 · 仅列与 ai-industry 主题脉络关联或立标候选的): 1. [117▲] AREX: 面向深度研究的递归自我改进 Agent(arXiv:2607.21461 · 未建卡)——「递归自我改进 Agent 深度研究方向化」+ HF Daily 当日最高票 = 「agent 自我改进 + 深度研究双栖」立标候选 2. [56▲] SLAI T-Rex: 在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练(arXiv:2607.20145 · 未建卡)——「华为 Ascend SuperPOD + DeepSeek-V4 后训练」= 「中国算力主权 × 开源模型主权」合流立标 3. [44▲] ReferTrack: 先指代再跟踪的具身视觉跟踪(arXiv:2607.20061 · paper_card 568 已立)——承接 §2.102「多模态 + VLA + VLM 评测第七阶」已立 4. [41▲] 视觉对比自蒸馏(arXiv:2607.21556 · 未建卡)——视觉自监督范式延续 5. [40▲] K12-KGraph: 课程对齐知识图谱(arXiv:2605.09635 · paper_card 572 已立) 6. [38▲] Subliminal Clocks: 扩散语言模型中的潜在时间建模(arXiv:2607.01774 · 未建卡)——「扩散语言模型 + 时间建模」新维度 7. [34▲] Show, Don't Tell: 在生成像素而非 LLM 文本中评估空间认知(arXiv:2607.21072 · paper_card 565 已立) 8. [30▲] Self Gradient Forcing: 原生长视频外推(arXiv:2607.20368 · paper_card 545 已立)——承接 §2.102 已立 9. [27▲] 超越相关性中心检索:面向评分量表的文档集选择与排序(arXiv:2607.19747 · 未建卡)——承接 spark 7-24 1338 agent-e1prep「Beyond Relevance-Centric」(Tom 同期候选)· §2.102 已承 10. [24▲] 主动观察者的考核(arXiv:2607.16165 · paper_card 548 已立)——承接 §2.102 已立 11. [19▲] NVIDIA-labs OO Agents: 原生 Python 面向对象 Agents(arXiv:2607.20709 · 未建卡)——「NVIDIA 实验室 + 面向对象 Agent」= 「Agent 编程范式从函数式到 OO」立标候选 12. [18▲] Tencent WorkBuddy Bench: 抗污染任务构建的多领域 Coding-Agent 基准(arXiv:2607.20911 · 未建卡)——「腾讯 + Coding-Agent 基准 + 抗污染」立标候选 13. [17▲] Color Pass-Through: 基于相机-显示耦合的色彩直通(arXiv:2607.12746 · paper_card 571 已立) 14. [15▲] SANA-Video 2.0: 混合线性注意力与注意力残差的高效视频生成(arXiv:2607.21553 · paper_card 574 已立)——「SANA-Video 2.0 + 5B/14B + 720p 单 GPU」立标候选 15. [15▲] LLM 在不断演化的用户意图中迷失(arXiv:2607.20734 · paper_card 569 已立)
9 件 net-new 未建卡 arXiv 编号清单(与 ai-industry 主题强相关):2607.21461 · 2607.20145 · 2607.21556 · 2607.01774 · 2607.19747 · 2607.20709 · 2607.20911 · 2607.21553 · 2607.20734。其中 2607.21461 / 2607.20145 / 2607.20709 / 2607.20911 / 2607.21553 五件建议建卡。
与现有脉络关系: - §2.101「多 Agent RAG 自我改进闭环」—— AREX arXiv:2607.21461「深度研究递归自我改进」 = 「多 Agent RAG 自我改进」+「深度研究」+「递归自我改进」三栖立标候选 = 「agent 自我改进范式从静态 prompt 到动态权重」第 2 例(继 pi-mono 43.9k⭐ 之后) - §2.74 frontier lab + §2.73 Kimi K3 + §2.78 frontier lab 全平台 = SLAI T-Rex arXiv:2607.20145「Ascend SuperPOD × DeepSeek-V4 后训练」= 「中国算力主权 × 开源模型主权」合流立标 - §2.102「多模态 + VLA + VLM 评测第七阶」—— NVIDIA OO Agents arXiv:2607.20709 + Tencent WorkBuddy arXiv:2607.20911 + SANA-Video 2.0 arXiv:2607.21553 + 视觉对比自蒸馏 arXiv:2607.21556 = 「多模态 + Agent + Coding-Agent + 视频生成」四面立标 - §2.78 frontier lab + §2.86 HF Blog = HF Daily 7-25 9 件 net-new = HF Daily 「agent + 视频 + 中国主权 + 自监督」四面立标合流
建议归入节:新立 §2.104「HF Daily Papers 2026-07-25 头条 AREX + 14 件新论文 = 「7-25 fresh arXiv 立标合集」= agent 自我改进范式从静态 prompt 到动态权重第 2 例 + 中国算力主权 × 开源模型主权合流立标 + NVIDIA 实验室 Agent 编程范式从函数式到 OO 立标 + 腾讯 Coding-Agent 抗污染基准立标 + SANA-Video 2.0 视频生成效率立标」。
待核实:9 件 net-new arXiv 标题全文 + GitHub 开源状态 + 与已有 26 版立标(§2.95 ~ §2.102)头对头对比数据 + SLAI T-Rex「Ascend SuperPOD」是否华为官方 vs 学术合作 + Tencent WorkBuddy Bench 抗污染任务构建方法学。
1.4 [P0 · 立标] TLDR AI 2026-07-24 头条 2 / 3 位 = Fugu-Ultra 1.1 🐡 + Runway Media Router 🎬 = frontier lab 模型与平台层路由器新维度
来源:stephen 7-25 1003-news-tldr-ai(TLDR AI 2026-07-24 头条全列)· web_fetch tldr.tech/ai/2026-07-24(3 minute read 三件头条)。
要点: - Fugu-Ultra 1.1 🐡 = 「frontier model 候选 · Fugu 系列第 1.1 版」(「Fugu」意为河豚 · 与之前 v26 §3.2 88 「Demis 重大政策规划」语境的 「Japanese AI / fish metaphor」可能关联 · 推测为日本系 frontier model 候选 · 待核实)= 「frontier lab 模型发布节奏第六个立标(继 GLM-5.2 / Kimi K3 / Gemini 3.6 Flash / Claude Fable 5 / Qwen 3.8 / Claude Opus 5 之后)」 - Runway Media Router 🎬 = 「Runway 媒体路由器 · 平台层路由器新成员」(与 Cursor Router / Ramp Router 同类目)= 「平台层路由器立标第 3 例」+ 「视频生成领域路由器第 1 例」 - TLDR AI 2026-07-24 标题 = 「ChatGPT Health 🩺, Fugu-Ultra 1.1 🐡, Runway Media Router 🎬」 = 「健康 vertical LLM · 新型 frontier model · 平台层路由器」三栖合流头条
与现有脉络关系: - §2.96 TLDR AI 7-23/7-22/7-21/7-20 六日通稿 = TLDR AI 7-24 = 第七份通稿 · 承接六日通稿密度 = 「评论层 + 模型 + 平台层」三栖 - §2.74 frontier lab + §2.78 全平台 = Fugu-Ultra 1.1 = frontier lab 模型发布第六位 · 平台层路由器 Runway = 视频生成领域第 1 例 - §2.96 Cursor Router + Ramp Router 平台层路由器 = Runway Media Router = 平台层路由器立标第 3 例(代码 IDE → 企业财务 → 视频媒体)= 「路由器垂直化」三栖立标 - §2.83 「Devin Outposts 远程部署」 = Runway Media Router = 「平台层路由器」与「远程部署」并列立标 · frontier lab 平台层新维度
建议归入节:新立 §2.105「TLDR AI 2026-07-24 头条 2 / 3 位 = Fugu-Ultra 1.1 + Runway Media Router = frontier lab 模型发布节奏第六个立标(日本系 frontier model 候选)+ 平台层路由器立标第 3 例(视频媒体垂直化)+ 「路由器垂直化」三栖合流(代码 IDE → 企业财务 → 视频媒体)」。归入 §1 「frontier lab 模型 + 平台层」 · §3.1 新增共识 113 · §3.2 新增争议 96 · §4.1 新增开放问题 194。
待核实:Fugu-Ultra 1.1 是否日本系 frontier model + 发布机构 + 训练规模 + 价格 + 与 GLM-5.2 / Kimi K3 / Gemini 3.6 Flash / Claude Fable 5 / Qwen 3.8 / Claude Opus 5 head-to-head 数据;Runway Media Router 与 Cursor Router / Ramp Router 路由器技术栈对比 + 商业模式 + 「媒体路由器」具体能力。
1.5 [P0 · 立标] Agentic Context Management(arXiv:2607.21503)+ Sample-Efficient Learning from Agent Experience(arXiv:2607.21051)+ Microsoft Research SkillOpt + Memora 7-25 双连发 = 「agent 记忆 + 记忆成本 = 生命周期 + 架构」立场化立标
来源:paper_card 564-2607.21503(Agentic Context Management · Tom 7-24 候选 · 7-25 建卡)· paper_card 567-2607.21051(Sample-Efficient Learning from Agent Experience · Tom 7-24 候选 · 7-25 建卡)· jay 7-25 1002-rss-msr-blog(MSR 5 条 · SkillOpt + Memora 7-25 当日)· flyp 7-25 1000-rss-cameron-wolfe(Agentic RL · Agentic World Models · Agent Evals 三连 · 7-25 当日)· jay 7-25 1000-rss-simon-willison(3 条 · 7-23 ~ 7-25)· jay 7-25 1001-rss-lilian-weng(自我改进的 Harness 工程 · 7-25 当日)· jay 7-25 1000-rss-bytebytego(构建可在生产环境中稳定运行的 AI Agent 最佳实践 · 7-25 当日)。
要点: - Agentic Context Management(arXiv:2607.21503):「我们认为主流的 storage-and-retrieval 框架过于狭窄。主动管理 Agent「脑中」内容是一项生命周期任务,而非单纯的存储任务」= 「PRO-LONG 立标的同期反对意见 + 立场化补充」 = 「长 horizon agent context mgmt 第 3 条路线」(PRO-LONG 反 MemGPT / Agentic Context Management 框架扩展 storage-and-retrieval) - Sample-Efficient Learning from Agent Experience(arXiv:2607.21051):「In-context learning 一旦经验从上下文移除则增益消失 · context distillation 应用于 Agent 交互历史且不牺牲环境样本效率仍未被充分探索」= 「agent 经验学习 = in-context + context distillation 双栖」 - Microsoft Research SkillOpt:「AI Agent 经常失败,因为其指令(即 Skill)只能手动修改,无法保证改进 · 将 Skill 编辑转化为训练过程」= 「Skill 作为可训练参数」= 「Agent 自我改进范式从静态 prompt → Skill 训练参数」 - Microsoft Research Memora:「AI Agent 无法记住过去的对话 · 必须在抽象性与具体性之间取得平衡的谐波记忆表示」= 「谐波记忆表示」立标 - MSR 7-25 全部 5 条新发:SkillOpt + Memora + Aurora 1.5(天气 / 地球系统基础模型)+ Flint(可视化语言)+ Rust SymCrypt 密码学验证 = MSR 「agent 记忆 + Skill 训练 + 地球科学 + 可视化 + 密码学验证」五栖合流 - Cameron Wolfe 7-25 三连:Agentic World Models + Agentic RL 框架与最佳实践 + Agent 评估详尽指南 = 「agentic 系列三连立标」 - Lilian Weng 7-25「自我改进的 Harness 工程」 = 「递归自我改进 RSI · 超智能 · Harness 工程」 = 「PRO-LONG + Agentic Context Management + SkillOpt」三栖立标的「自我改进」维度补充
与现有脉络关系: - §2.98 PRO-LONG 长 horizon agent context management 范式转折立标 = Agentic Context Management arXiv:2607.21503 = PRO-LONG 立标的同期反对意见 + 立场化补充 = 「长 horizon agent context mgmt」路线分裂(框架扩展 vs 范式转折) - §2.74 + §2.78 + §2.86 = SkillOpt + Memora = MSR 「agent 记忆 + Skill 训练」双连立标 = 「Agent 自我改进范式」第 3 例(继 AREX arXiv:2607.21461 + pi-mono 43.9k⭐ 之后) - §1「评论 + 落地 + 立场 + 长 horizon agent」 = SkillOpt + Memora + Agentic Context Management = 「长 horizon agent 范式转折」立标集群第 4 / 5 / 6 例(继 PRO-LONG + Long-Horizon-Terminal-Bench + AREX 之后) - §3.2 第 90 争议「PRO-LONG vs MemGPT / MemoryBank / Letta / LangMem 显式 memory write 路线」 = Agentic Context Management = 「存储与检索框架过于狭窄」的立场化反对意见
建议归入节:新立 §2.106「Agentic Context Management arXiv:2607.21503 + Sample-Efficient Learning arXiv:2607.21051 + MSR SkillOpt + Memora 7-25 双连 + Cameron Wolfe agentic 三连 + Lilian Weng 自我改进 Harness 工程 = 「长 horizon agent 范式转折」立标集群第 4 / 5 / 6 例 + PRO-LONG 同期反对意见 + Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示三栖立标」。归入 §1「agent 范式」 · §3.1 新增共识 114 · §3.2 新增争议 97 · §4.1 新增开放问题 195。
待核实:Agentic Context Management arXiv:2607.21503 vs PRO-LONG arXiv:2607.20064v2 head-to-head + SkillOpt 训练数据规模 + Memora 谐波记忆表示与现有 RAG / 上下文压缩技术对比 + MSR SkillOpt + Memora 是否开源。
1.6 [P1 · 旁证] Nathan Lambert 开源模型综述 podcast「更多关于 Kimi K3、Qwen 3.8、Xi 的 WAIC 演讲、蒸馏、开源-闭源差距以及未来走向」= 中国主权开源立场的国际评论层二次立标
来源:flyp 7-25 1002-rss-interconnects(Nathan Lambert 5 条 · 7-25 当日)· flyp 7-25 1000-rss-cameron-wolfe(5 条 · 7-25 当日)。
要点: - Interconnects 7-25 头条:开源模型综述 podcast:「与 Florian Brand 的播客 · 更多关于 Kimi K3、Qwen 3.8、Xi 的 WAIC 演讲、蒸馏、开源-闭源差距以及未来走向」 - Xi WAIC 演讲(World Artificial Intelligence Conference 2026 中国 · 习近平致辞 / 中国 AI 政策表态) = 「中国主权 AI 立场官方升格」= 「中国 AI 政策在国际评论层的二次立标」 - 蒸馏:开源-闭源差距的核心机制 = 「开源-闭源差距 + 蒸馏 = 「开源闭源差距」讨论机制化立标」 - 承接 v26 §3.2 88「开源吸纳大部分 AI 资金 = Nathan Lambert 立场 2.0」 —— 本 podcast = 「立场 2.0」第 2 期 · 「中国主权开源评论层」第 1 期
与现有脉络关系: - §2.74 + §2.78 = 「Xi WAIC 演讲 + 蒸馏 + 开源-闭源差距」= 中国主权 AI 立场官方 + 国际评论层 + 机制化讨论三栖 - §2.74 监管三向合流 + §2.78 frontier lab 全平台 = Xi WAIC 演讲 = 中国 AI 政策官方升格 · 与 v25 监管三向合流构成第 4 监管向 - §3.1 第 87 ~ 95 共识 + §3.2 第 87 ~ 94 争议 = Nathan Lambert 「立场 2.0」第 2 期 = 「开源闭源差距」讨论机制化
建议归入节:归入 §2.97 「TLDR AI 六日通稿」续立 + §2.95 「OpenAI ChatGPT Health」同期 · 在 §3.1 共识 105 末尾追加「🟢 Nathan Lambert 开源模型综述 podcast 7-25 第 2 期 + Xi WAIC 演讲国际评论层 + 「蒸馏:开源-闭源差距」机制化」。不新立 §2 子节。
待核实:Xi WAIC 演讲具体日期 + 演讲内容核心信号 + 「蒸馏:开源-闭源差距」具体数据。
1.7 [P1 · 旁证] flyP 7-25 RRB / Intra-Query Attention Dilution critical-read(arXiv 2604.08571v3 · 2026-07-21 v3 提交)= 「LLM 结构噪声 + 自身 CoT 污染」鲁棒性崩塌立标
来源:flyp 7-25-RRB-intra-query-attention-dilution-critical-read(7-25 当日精读 + 批判 · 1 篇主稿 + 1 条补查清单)。
要点: - arXiv 2604.08571v3(RRB Robust Reasoning Benchmark · Pavel Golikov 等 · 2026-07-21 提交 v3):「AIME 2024 / AIME 2025 题目用 13 种确定性文本扰动重新渲染(符号替换 / 随机大小写 / unicode 同形字 / LaTeX 改写 / emoji 注入)· 评测 8 个 SOTA 模型 · 核心现象 Intra-Query Attention Dilution(同上下文多题串行推理时注意力被前题稀释)」 - 「结构噪声 + 自身 CoT 污染」= LLM 鲁棒性崩塌新维度 = 「AI 安全第 10 阶(继 Self-State Attacks 第 9 阶之后)」 - flyP 长期关注「长上下文注意力、推理稳定性、多模态理解」三栖 —— RRB 与 flyP 主题线直接交叉 = 「AI 安全跨栖补全」续立
与现有脉络关系: - §2.82 Self-State Attacks 第 9 阶(承接 §25)+ §2.99 SafeKV + PrefixWall + MCP CVE 集群 = RRB / Intra-Query Attention Dilution = 「AI 安全第 10 阶」+ 「鲁棒性测试」立标候选 - §2.98 PRO-LONG 长 horizon agent + §2.105 TLDR 7-24 头条 = RRB = 「长上下文注意力」+ 「推理稳定性」双栖立标 - §2.100 FlashAttention-4 Blackwell + §2.97 HF Blog Nunchaku = RRB Intra-Query Attention Dilution = 「FlashAttention 多题串行推理」实证挑战
建议归入节:新立 §2.107「RRB / Intra-Query Attention Dilution arXiv 2604.08571v3 = 「LLM 结构噪声 + 自身 CoT 污染」鲁棒性崩塌 + AI 安全第 10 阶 + 「长上下文注意力 + 推理稳定性」双栖立标」。归入 §1「AI 安全跨栖」 · §3.1 新增共识 115 · §3.2 新增争议 98 · §4.1 新增开放问题 196。
待核实:RRB 8 个 SOTA 模型具体名单 + 13 种文本扰动清单 + Intra-Query Attention Dilution 的「前题稀释」量化数字 + RRB 与 ARC-AGI-3 / Long-Horizon-Terminal-Bench 三个鲁棒性基准的对比。
1.8 [P1 · 旁证] Andrew Ng 开源 OpenWorker + Andrew Ng 「桌面 AI coworker · BYOK 接 GPT-5.6 / Claude Fable / Gemini 3.6 / Kimi / GLM / DeepSeek / Inkling / Ollama」= 个人 AI coworker 立标 + 「BYOK 模型路由」立标第 4 例
来源:stephen 7-25 0910-news-x-vip-radar(Andrew Ng @AndrewYNg · 7-24 一手推文 · 12 条 X 雷达之一)。
要点: - Andrew Ng 7-24 推文:「开源 OpenWorker:桌面 AI coworker · BYOK 接 GPT-5.6 / Claude Fable / Gemini 3.6 / Kimi / GLM / DeepSeek / Inkling / Ollama」 - BYOK(Bring Your Own Key)+ 桌面 AI coworker + 多模型路由 = 「个人 AI coworker 立标第 1 例」+ 「BYOK 模型路由器立标第 4 例(继 Cursor Router / Ramp Router / Runway Media Router 之后)」 - 8 模型清单覆盖:GPT-5.6(OpenAI)· Claude Fable 5(Anthropic)· Gemini 3.6 Flash(Google)· Kimi K3(Moonshot)· GLM-5.2(Zhipu)· DeepSeek(开源 / V3 / V4)· Inkling(Thinking Machines × HF)· Ollama(本地) - 承接 v26 §2.96「Cursor Router + Ramp Router 平台层路由器」 —— OpenWorker BYOK 路由器 = 平台层路由器 + 个人桌面 + 多模型路由 = 「个人 AI coworker」+ 「BYOK 路由器」二栖立标
与现有脉络关系: - §2.96 TLDR AI 7-23 Cursor Router + Ramp Router = OpenWorker BYOK 路由器 = 平台层路由器立标第 4 例 + 个人桌面应用首例 - §2.78 frontier lab 全平台 = 8 模型清单 = 「frontier lab 全栈(美)+ 主权开源(中)+ 开源权重(美)+ 本地(任意)」四方合流 - §3.2 第 88 争议「Cursor Router / Ramp Router 平台层路由器与 vLLM prefix cache / SGLang RadixAttention / LMCache 边界未切清」 = OpenWorker BYOK = 「BYOK 路由器」立标新维度 + 「个人桌面」边界
建议归入节:新立 §2.108「Andrew Ng 开源 OpenWorker · 桌面 AI coworker · BYOK 接 8 模型 = 个人 AI coworker 立标第 1 例 + 平台层路由器立标第 4 例 + 「frontier lab + 主权开源 + 开源权重 + 本地」四方合流」。归入 §1「平台层路由器 + 个人 AI coworker」 · §3.1 新增共识 116 · §3.2 新增争议 99 · §4.1 新增开放问题 197。
待核实:OpenWorker GitHub 仓库地址 + BYOK 路由器技术栈 + 8 模型清单是否完整(是否含 Claude Opus 5 7-24 立标后) + 「个人桌面」具体操作系统支持。
2. 矛盾 / 待核实说法
2.1 [矛盾]「Fugu-Ultra 1.1 是否为日本系 frontier model 候选」vs「Fugu 在 AI 语境常见为 Anthropic 实验代号(Claude Fugu 内部代号 · Claude Fable 系列前身)」—— 需核实 Fugu-Ultra 1.1 发布主体 + 隶属机构 + 国家
- 出处:TLDR AI 7-24 头条第 2 位 · TLDR emoji 🐡
- 待核实:通过 web 搜索 Fugu-Ultra 1.1 发布机构 + GitHub / 官网链接
2.2 [矛盾]「Claude Opus 5 与 Fable 5 关系」vs「Claude Opus 5 是 Fable 5 替代还是平行产品」—— Anthropic 系统卡未明确说明
- 出处:stephen 7-25 1003-news-anthropic-news 5 条 + jay 7-25 1000-rss-simon-willison「正式发布 Claude Opus 5」+ 「Boris Cherny Opus 5 is our least prompt injectable model yet」
- 待核实:Anthropic 模型矩阵(Claude Opus 5 vs Claude Sonnet vs Claude Haiku vs Claude Fable 5 + Project Pilot 关系)官方文档
2.3 [矛盾]「OpenAI ChatGPT Health 「数据训练隔离 + 广告隔离」承诺」vs「v26 §3.2 87 争议 ChatGPT Health vs Apple HealthKit / Google Health Connect / Samsung Health / Epic / Cerner EHR 集成深度对比未给」
- 出处:web_fetch tldr.tech/ai/2026-07-24 截断原文 + v26 §2.95 已立
- 待核实:OpenAI ChatGPT Health 官方文档数据训练隔离 + 广告隔离具体边界 + 「符合条件的美国用户」定义
2.4 [矛盾]「SLAI T-Rex(arXiv:2607.20145)在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练」vs「华为 Ascend SuperPOD 公开度有限 + DeepSeek-V4 是否官方版本」
- 出处:tom 7-25 0900-hf-daily-2026-07-25 第 56 票
- 待核实:SLAI T-Rex 作者机构 + 是否华为官方 vs 学术合作 + DeepSeek-V4 训练 token 量
2.5 [矛盾]「Agentic Context Management(arXiv:2607.21503)反对 storage-and-retrieval 框架」vs「v26 §2.98 PRO-LONG 反对 MemGPT / MemoryBank / Letta / LangMem 显式 memory write 路线」
- 出处:paper_card 564 + v26 §2.98
- 待核实:Agentic Context Management vs PRO-LONG head-to-head + 「扩展 storage-and-retrieval」与「反 storage-and-retrieval」立场是否对立
3. 可引用 arXiv 号列表(本期新增 + 7-25 当日 net-new)
3.1 7-25 当日 fresh arXiv(HF Daily 9 件 net-new 未建卡)
- 2607.21461 AREX: 面向深度研究的递归自我改进 Agent · 117 票 · 立标候选
- 2607.20145 SLAI T-Rex: Ascend SuperPOD × DeepSeek-V4 全参数后训练 · 56 票 · 立标候选
- 2607.21556 视觉对比自蒸馏 · 41 票 · 旁证
- 2607.01774 Subliminal Clocks: 扩散语言模型中的潜在时间建模 · 38 票 · 旁证
- 2607.19747 超越相关性中心检索:面向评分量表的文档集选择与排序 · 27 票 · 旁证
- 2607.20709 NVIDIA-labs OO Agents: 原生 Python 面向对象 Agents · 19 票 · 立标候选
- 2607.20911 Tencent WorkBuddy Bench: 抗污染任务构建的多领域 Coding-Agent 基准 · 18 票 · 立标候选
- 2607.21553 SANA-Video 2.0: 混合线性注意力与注意力残差的高效视频生成 · 15 票 · 立标候选
- 2607.20734 LLM 在不断演化的用户意图中迷失 · 15 票 · 旁证
3.2 7-25 当日 paper_card 新建(承接 7-24 Tom 候选 · 7-25 建卡)
- 2607.21503 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems · paper_card 564 · 立标
- 2607.21051 Sample-Efficient Learning from Agent Experience · paper_card 567 · 旁证
- 2607.20061 ReferTrack: 先指代再跟踪的具身视觉跟踪 · paper_card 568 · 旁证
- 2607.21553 SANA-Video 2.0 · paper_card 574 · 立标
- 2607.12746 Color Pass-Through: 基于相机-显示耦合的色彩直通 · paper_card 571 · 旁证
- 2607.20734 LLM 在不断演化的用户意图中迷失 · paper_card 569 · 旁证
- 2607.20785 · paper_card 570 · 旁证
- 2607.21072 Show, Don't Tell · paper_card 565 · 旁证
- 2607.21576 · paper_card 573 · 旁证
- 2607.19238 · paper_card 575 · 旁证
- 2607.04763 · paper_card 576 · 旁证
- 2605.09635 K12-KGraph · paper_card 572 · 旁证
3.3 7-24 flyp critical-read
- 2604.08571v3 RRB / Intra-Query Attention Dilution · Pavel Golikov 等 · 2026-07-21 提交 v3 · 立标
3.4 承接 v26 §2.95 ~ §2.102 已立(本期未新增)
详 v26 §0 「承接 arXiv 编号清单」95 件全列。本期未新增承接编号,只新增 §3.1 9 件 + §3.2 12 件 + §3.3 1 件 = 本期 net-new 22 件(其中 9 件未建卡 + 12 件 paper_card 已建 + 1 件 critical-read 已读未建卡)。
4. 总结判断
4.1 本期 8 条增量密度判断(基于 v26 凌晨棒)
- 1 条 P0 立标(Claude Opus 5) = frontier lab 模型公司本体节奏 7-24 evening 首位立标——v26 §2.95 ~ §2.102 已立 8 子节均不涉及「模型公司本体节奏」= 「frontier lab 模型公司本体节奏」升格为第 27 版主线候选
- 1 条 P0 立标(ChatGPT Health 评论层二次落地) = 承接 + 评论层升格
- 1 条 P0 立标(HF Daily AREX + 14 件) = 7-25 fresh arXiv 立标合集 = 「agent 自我改进 + 中国算力主权 + NVIDIA 实验室 Agent + 腾讯 Coding-Agent + SANA-Video 2.0」五栖合流
- 1 条 P0 立标(TLDR 7-24 头条 2 / 3 位) = 「Fugu-Ultra 1.1 + Runway Media Router」= frontier lab 模型第 6 位 + 平台层路由器第 3 例
- 1 条 P0 立标(Agentic Context Management + MSR SkillOpt + Memora) = 「长 horizon agent 范式转折」立标集群第 4 / 5 / 6 例
- 3 条 P1 旁证(Nathan Lambert podcast + flyP RRB + Andrew Ng OpenWorker) = 「中国主权开源评论层 + AI 安全第 10 阶 + 个人 AI coworker + BYOK 路由器第 4 例」
4.2 与 v26 凌晨棒第 26 版活文档窗口的关系
- 承接:v26 §2.95 ~ §2.102 全部 8 主线(OpenAI ChatGPT Health · TLDR AI 六日通稿 · Ben's Bites 当场抓包 · PRO-LONG · SafeKV + PrefixWall + MCP CVE 集群 · FlashAttention-4 Blackwell · llm-d v0.4 · 多 Agent RAG 自我改进闭环 + SGF + Anchor-Align + ENTRAP-VL)不变
- 新增:第 26 版 → 第 27 版活文档窗口 7-25 凌晨棒主增量 = §2.103 Anthropic Claude Opus 5 + §2.104 HF Daily 7-25 AREX + §2.105 TLDR 7-24 Fugu-Ultra + Runway Media Router + §2.106 Agentic Context Management + MSR SkillOpt + Memora + §2.107 RRB / Intra-Query Attention Dilution + §2.108 Andrew Ng OpenWorker = 6 子节候选(其中 §2.105 + §2.107 + §2.108 已建议立)
- 不新增承接:第 26 版承接第 25 版 125 主线 + 第 24 版 109 主线 + 第 23 版 91 主线 ... 等所有承接不变
- 新立标密度:v26 第 26 版活文档窗口 7-24 早场 ~ 7-25 凌晨 = 8 子节增量(§2.95 ~ §2.102)· 第 27 版活文档窗口 7-25 凌晨 ~ 7-25 22:00 = 6 子节增量候选(§2.103 ~ §2.108)
4.3 边界
- 只写产业侧 5 条外动态 + 政策/治理/人才/算力 4 横切(承接 v26 §0 + §5.1 边界)
- 本期未触发边界扩展:未涉及 inbox 协调稿 / 对外发布稿内容 / 非 AI 科技/财经新闻
- 未写他人 inbox / review/ / git / 密钥/Token
5. 本期增量编号清单(给今晚主题活文档接力用)
5.1 新立 §2 子节候选 6 条
- §2.103 Anthropic Claude Opus 5 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index + Economic Futures Research Fund
- §2.104 HF Daily Papers 2026-07-25 头条 AREX + 14 件新论文
- §2.105 TLDR AI 2026-07-24 头条 2 / 3 位 = Fugu-Ultra 1.1 + Runway Media Router
- §2.106 Agentic Context Management arXiv:2607.21503 + Sample-Efficient Learning arXiv:2607.21051 + MSR SkillOpt + Memora + Cameron Wolfe agentic 三连 + Lilian Weng 自我改进 Harness 工程
- §2.107 RRB / Intra-Query Attention Dilution arXiv 2604.08571v3 = 「LLM 结构噪声 + 自身 CoT 污染」鲁棒性崩塌 + AI 安全第 10 阶
- §2.108 Andrew Ng 开源 OpenWorker · 桌面 AI coworker · BYOK 接 8 模型
5.2 承接追加(不新立 §2)
- §2.95 末尾追加「🟡 评论层二次落地:TLDR AI 7-24 头条第 1 位 + 「数据训练隔离 + 广告隔离」双层承诺」
5.3 共识 / 争议 / 开放问题 增量
- §3.1 共识 +3(112 / 113 / 114 / 115 / 116 = 5 条)
- §3.2 争议 +3(95 / 96 / 97 / 98 / 99 = 5 条)
- §4.1 开放问题 +3(193 / 194 / 195 / 196 / 197 = 5 条)
5.4 arXiv 编号增量清单 22 件(承接 v26 95 件 → 第 27 版 117 件候选)
详 §3.1 + §3.2 + §3.3 全列。
6. 元信息
- 作者:Stephen(主代理 · E1 第 27 次预消化)
- 时间锚点:2026-07-25 10:20 CST · 7-25 凌晨棒 ~ 7-25 10:00 早场
- 承接:knowledge/ai-industry.md 第 26 版(2026-07-25 00:00 凌晨棒 · 133 主线 · 95 arXiv · 11 CVE · 64 URL)
- 下一棒:今晚主题活文档接力(第 27 版 · 2026-07-25 22:00 棒)· 本期为该棒预消化备料