multimodal · E1 预消化简报(2026-07-25)

角色:flyP · multimodal 主题 E1 日间预消化(multimodal) 锚定版本:v31 organized/knowledge/multimodal.md(2026-07-25 08:40 CST 刚刚落定 · 本版在 v30 81.7KB 严格保持骨架基础上增量 8 fresh(2 立标 + 1 旁证级 + 2 旁证 + 2 P3 待观察)+ 1 综述 + 2 RAG 旁证 + 7 行业升级 + 6 件 v30 立标/旁证 24h 续立上行;主轴 87→90 件套 + 27→28 元立体 + 2 元候选 + 行业 15 足鼎立稳定 + 16 足候选 + 京东 Joy Future Academy 立标级 + HF 7-16 安全升 §3.1 反方共识级) 窗口:2026-07-24 09:40 → 2026-07-25 09:40(Asia/Shanghai,24 小时) 覆盖:flyp 7-24 multimodal-e1prep(v31 已吸收 8 fresh + 1 综述 + 2 RAG + 7 行业)+ flyp 7-24-0950 Self Gradient Forcing E2 精读 10KB(立标候选最强)+ flyp 7-24-1550 PRO-LONG 长视野上下文管理 E2 精读 + flyp 7-24-2250 Cameron Wolfe agentic world models 短评 + jay 7-24-csdn-langgraph-multimodal-rag-substack(HM-RAG + Multimodal RAG Survey + GPT Image 2)+ jay 7-24-ai-engineering-trending(HF 安全 7-16 + OWASP)+ jay 7-24-1620 inference-multimodal-stack + jay 7-24-1950-evening-engineering-filter(MCP CVE 集群 + FlashAttention-4 Blackwell)+ tom 7-24/7-25 radar(8 件 + 8 件)+ HF Daily 7-24(15 篇)+ HF Daily 7-25(15 篇,3 件主 multimodal 新立 + 3 件续立)+ stephen 7-24/7-25 协调棒 + stephen 7-25-0910 news-x-vip-radar(Andrew Ng OpenWorker + Gemini 3.5 Flash Cyber + Inkling 三模态 + Anthropic 4 种新失准 + Claude 3000+ 价值观 + DeepMind AI for Science 4 优先)+ paper_cards 7-24 新卡 23 张(530-552)+ 7-25 新卡 23 张(553-575)+ multimodal.md v31 8:40 已落定 今日目标:为今晚 v32 活文档接力预读备料,3-8 条增量,每条挂"来源/要点/脉络关系/建议归入节" 本稿状态:v1 预消化,不重写 multimodal 活文档;只列 v32 候选增量与待活文档消化方向


0. 综述判断(给今晚活文档接手时一眼看到)

  • v31 已在 1 小时前(2026-07-25 08:40 CST)落定 —— v31 已吸收本窗口前半(7-24 09:40 ~ 7-25 08:40)全部 24h 主战场内容:8 fresh(2 立标 + 1 旁证级 + 2 旁证 + 2 P3)+ 1 综述 + 2 RAG 旁证 + 7 行业升级 + 6 件 v30 续立 + HF 7-16 安全升 §3.1 = 18 件 v31 增量;v31 §本次变更段已完整列出 12 项 v31 立标/旁证/行业 + 12 项新增 H2 重大事实订正 + 9 件 fresh 来源 + 5 项边界遵守 + 多轮自评修订记录
  • 本轮 E1 预消化(09:40)为 v32 接力锁定"v31 尚未纳、本窗口新立/趋势升级/产品节奏"对象 —— v31 之后 1 小时内的窗口(7-25 08:40 ~ 09:40)实际增量:
    • HF Daily 7-25 票榜 15 篇中:主 multimodal 新立 3 件(ReferTrack 44▲ · Show, Don't Tell 34▲ · Color Pass-Through 17▲)+ 副 multimodal 新立 2 件(视觉对比自蒸馏 41▲ · SANA-Video 2.0 15▲)+ 主 multimodal 续立 3 件(Subliminal Clocks 36→38▲ · Self Gradient Forcing 29→30▲ · ActiveVision 18→24▲);
    • paper_cards 7-25 新卡 23 张(553-575) 中主 multimodal 至少 5 件(ReferTrack 568 · Show, Don't Tell 565 · Color Pass-Through 571 · Self-Supervised Structured Dynamics 573 · SANA-Video 2.0 574);
    • stephen 7-25 0910 news-x-vip-radar 行业平台化升级 5 件(Andrew Ng OpenWorker BYOK 桌面 AI coworker + DeepMind Gemini 3.5 Flash Cyber 网络安全专用 + Inkling 三模态开权重 + Anthropic Agentic misalignment 4 种新失准 + Claude 3000+ 价值观 4 主轴 + DeepMind AI for Science 4 优先 + LeCun 开源风险论);
    • Tom 7-25 0840 radar 高价值 3 件(Agentic Context Management 2607.21503 + OpenForgeRL 2607.21557 + Sample-Efficient Learning from Agent Experience 2607.21051)+ 5 件候选(FinanceComplexQA 19238 + K12-KGraph 09635 + SANA-Video 2.0 21553 + Self-Supervised Structured Dynamics 21576 + ReOPD 04763);
    • jay 7-24-1950-evening-engineering-filter MCP CVE 集群(CVE-2026-26029 / 2605-26059 / 2606-30623 + MCP 2026-07-28 新版协议规范)+ vLLM vs TensorRT-LLM vs SGLang H100 Benchmark(生产决策)+ FlashAttention-4 Blackwell(71% 硬件利用率 + 1.6-3.2× vs Triton);
    • tom 7-25 0900 HF Daily 15 篇 + AREX 117▲(深度研究递归自我改进 Agent,7-25 顶立)+ SLAI T-Rex 56▲(DeepSeek-V4 华为 Ascend SuperPOD 全参数后训练)。
  • v32 立标/旁证候选 5 件 + 行业 5 件 + 跨主线 RAG 旁证 0 件(沿用 v31)+ P3 旁证待观察 1 件
  • 反方/争议/待核 5 件 — 主要围绕 ReferTrack 的"指代-跟踪二联"是否真的扩展到 RGB-D / 多视角 / 跨 embodiment、SANA-Video 2.0 的"Hybrid Linear-Softmax 3:1 ratio"理论依据、Self-Supervised Structured Dynamics 的 position paper 是否给完整解构、Show Don't Tell 的"像素生成式答案接口"在 vs Pointmaps / ReMap 的关系、Color Pass-Through 在 vs ISP / 端侧 ISP 路线的关系。
  • 核心结论:v31 已立"周末 25 件 + 立标续立 + 全新立标 + 行业 7 件 + HF 7-16 安全共识级 + 中俄西多极 + OpenAI 多模态栈三件套闭合"骨架;本窗口的增量是"v31 后 1 小时 5 件 multimodal 新立候选 + 行业平台化升级 5 件 + MCP CVE 集群 + FA4 Blackwell + HF Daily 7-25 续立 3 件" —— v32 应延续 v31 §2.39.77-§2.39.86 骨架,新增 §2.39.87-§2.39.91 立标/旁证/综述候选 5 件 + §6 行业新增 5 件 + §1 主线 1/2/4/7 增量分支 + §7.1 引用新增 5 件。

1. 增量条目(5 件 v32 候选立标/旁证/综述 + 5 件行业 + 3 件续立 + 1 件 P3 待观察)

§1.1 v32 全新立标/旁证/综述候选(5 件)

增量 1 · ReferTrack "先指代再跟踪"具身视觉跟踪 — v32 §2.39.87 立标新增(候选最强)

  • 来源:arXiv:2607.20061 · 44▲ 7-25 当日新立 #3 · multimodal 主分类 method · paper_cards/568 · Tom 7-25 0900 HF Daily
  • 要点:ReferTrack = "先指代再跟踪"二联范式;核心洞察:近期 VLA 策略统一目标识别 + 轨迹规划,但 CoT 推理作用于抽象空间潜变量,难以监督 + 与显式图像空间检测弱对齐;ReferTrack 仅用单个前向摄像头,先从候选框指代出目标,再跟踪 —— 把"指代(referring)"与"跟踪(tracking)"在像素空间显式解耦,绕开抽象潜变量的监督难题
  • 脉络:与 v31 §2.39.83 Anchor-Align(VLA 微调双损失叠加)+ v25 OpenVLA-OFT + v30 §2.39.59 Robot-Centric Pointmaps(视觉编码 3D 几何架构改动)+ v30 §2.39.76 Learning-to-Fold LeHome RL(自值函数 + RL 训练)同属"具身 VLA + 跟踪 + 感知"主线 — ReferTrack 立"像素空间显式解耦指代-跟踪"维度 = 2026-Q3 "VLA 跟踪感知双联"立标(与 Anchor-Align 训练目标双栈互补);与 Pointmaps 互补:Pointmaps = 视觉编码 3D 几何架构;ReferTrack = 像素空间指代-跟踪解耦;两件工作构成"几何感知 vs 像素感知"二联;与 7-25 HF Daily 主战场"具身 + 跟踪"补全:v32 应立"具身 VLA 跟踪感知"维度
  • 建议归入节:§2.39.87 v32 立标新增 + §1 主线 7 具身 VLA(跟踪感知分支)+ §1 主线 4 评测方法学(具身跟踪评测)+ §2.38 历史索引段加 arXiv:2607.20061 + §3.2 横切 4 跨主题交叉(multimodal + embodied + tracking + VLA 4 主题)
  • 反方 / 风险:"仅用单个前向摄像头"在 RGB-D / 多视角 / 跨 embodiment 上的扩展性未给;vs SOTA 跟踪器(BoT / TransT / OSTrack / MixFormerM / EVTbench 系)head-to-head 数字未给;"指代-跟踪二联"在遮挡 / 离开视野 / 重进入场景下的鲁棒性未给;"像素空间显式解耦"对实时性影响未给
  • 重要边界:不要把 ReferTrack 与 v30 §2.39.59 Robot-Centric Pointmaps(视觉编码 3D 几何架构改动)混为同一件工作:Pointmaps = 架构层 3D 几何;ReferTrack = 范式层指代-跟踪解耦;两件工作层次不同:前者架构,后者范式。不要把 ReferTrack 与 v25 OpenVLA-OFT / SmolVLA / π0.5-KI 视为同一类 VLA:ReferTrack 是"具身视觉跟踪"专项 VLA(任务定义);OpenVLA-OFT 是通用 VLA 任务;两件工作层级不同:前者专项,后者通用。

增量 2 · 视觉对比自蒸馏 Visual Contrastive Self-Distillation — v32 §2.39.88 旁证新增

  • 来源:arXiv:2607.21556 · 41▲ 7-25 当日新立 #4 · multimodal 副分类(主分类待 LLM 分类确认)+ Tom 7-25 0900 HF Daily
  • 要点:视觉对比自蒸馏 = VLM/ViT 自蒸馏范式;核心洞察:对比学习 + 自蒸馏结合,把多模态表征学习中的"负样本采样"问题用自蒸馏替代 —— 跳过显式负样本,用模型自身不同视图作 teacher-student 蒸馏目标;立"自蒸馏 + 对比"二联维度
  • 脉络:与 v31 §2.39.83 Anchor-Align(VLA 表征锚定)+ v25 DINOv2 / SigLIP + v29 SpectraReward(训练范式转折)+ 2024 BYOL / DINO / MAE 同根 — 视觉对比自蒸馏立"自蒸馏替代对比负样本"维度 = 2026-Q3 多模态主题 "VLM 训练自蒸馏"旁证;与 Anchor-Align 训练目标双栈互补:Anchor-Align = 损失函数创新;视觉对比自蒸馏 = 训练范式创新;两件工作构成"2026-Q3 VLM 训练方法论 损失函数 vs 训练范式"二联
  • 建议归入节:§2.39.88 v32 旁证新增 + §1 主线 1 统一多模态生成(训练范式分支)+ §2.38 历史索引段加 arXiv:2607.21556
  • 反方 / 风险:票数 41▲ 信号中-强;主分类待 LLM 确认(可能在 multimodal / agent / engineering 之间);"自蒸馏 + 对比"在 vs BYOL / DINOv2 / MAE 的 head-to-head 数字未给;"跳过显式负样本"在大规模数据上的稳定性未给
  • 重要边界:不要把视觉对比自蒸馏与 DINOv2 / SigLIP 视为对立:DINOv2 / SigLIP 是自监督视觉基础模型;视觉对比自蒸馏是 VLM 自蒸馏方法;两件工作层次不同:前者基础,后者方法。注意"自蒸馏替代对比负样本"是新维度还是训练 recipe 重新包装需 ablation 验证

增量 3 · Show, Don't Tell 在生成像素而非 LLM 文本中评估空间认知 — v32 §2.39.89 旁证级新增

  • 来源:arXiv:2607.21072 · 34▲ 7-25 当日新立 #6 · multimodal 主分类 benchmark(evaluation 副)+ paper_cards/565 · Tom 7-25 0900 HF Daily
  • 要点:Show, Don't Tell = 在生成像素中评估空间认知的基准;核心洞察:现有空间推理基准要求坐标 / 选项 / 文本,给图像生成模型带来"答案接口不匹配"问题 —— 空间任务中"位置 / 区域 / 路径"更自然通过"指向 / 标记 / 绘制"表达;Show Don't Tell 用像素生成作 answer interface,让图像生成模型在相同任务语义下被评估
  • 脉络:与 v31 §2.39.78 ActiveVision(主动观察评测)+ v30 §2.39.61 OCT-Bench(OCR / Chart 评测)+ v30 §2.39.62 Apple-π(物理定律视频思维)+ v30 §2.39.74 EduPanel(教学视频评测)+ v31 §2.39.80 Trace(RLVR 训练环境)同属"多模态评测方法学 + 跨文化跨语境 MLLM 评估"主线 — Show Don't Tell 立"答案接口设计"维度 = 2026-Q3 多模态主题 "图像生成模型空间认知评测"代表(与 ActiveVision 主动观察 + Trace 共享语义状态形成"三联评测方法学")
  • 建议归入节:§2.39.89 v32 旁证级新增 + §1 主线 4 评测方法学(二十三面体)+ §2.38 加 arXiv:2607.21072 + §7.1 引用新增
  • 反方 / 风险:"像素生成式答案接口"在 vs 文本式答案接口 head-to-head 数字未给;vs SOTA MLLM 评测覆盖度未披露;"指向 / 标记 / 绘制"在 vs 文本答案接口的评测饱和风险
  • 重要边界:不要把 Show Don't Tell 与 v31 §2.39.78 ActiveVision 视为对立 / 重复:ActiveVision = 主动观察(评测任务设计);Show Don't Tell = 答案接口设计;两件工作维度不同:前者任务,后者接口;两件工作形成"2026-Q3 多模态评测方法学 任务设计 vs 答案接口"二联

增量 4 · Self-Supervised Learning of Structured Dynamics from Videos — v32 §2.39.90 P3 旁证待观察

  • 来源:arXiv:2607.21576 · 14▲ 7-25 当日新立 · multimodal 主分类 position · paper_cards/573 · Tom 7-24 2040 radar #7 · Tom 7-25 0840 radar 候选
  • 要点:Self-Supervised Structured Dynamics = 从预训练 ViT 冻结特征中恢复"相机运动 vs 物体运动"分解表征;核心洞察:帧间变化纠缠两类动态来源(相机 + 物体),自然视频中两者紧密耦合难以分别监督;研究问题:是否能从 frozen 特征中恢复结构化运动表征 = "不依赖光流 / SfM 自监督"的运动分解
  • 脉络:与 v25 DROID-SLAM / v25 DeAOT / v25 视频分割基础模型 + v25 Cotracker / v25 PointOdyssey 同属"视频结构化表征 + 运动分解"主线 — Structured Dynamics 立"frozen 特征 → 运动分解"维度 = 2026-Q3 多模态主题 "视频结构化表征"代表;与 v31 §2.39.73 沿用 + v31 §2.39.77 SGF 长视频外推形成"静态结构 - 长时序动态"二联;注意 paper_cards 主分类标为 position(立场论文而非方法论文)
  • 建议归入节:§2.39.90 v32 P3 旁证待观察(票数 14▲ 弱,position 形态)+ §1 主线 1 统一多模态生成(视频结构化表征分支)+ §2.38 加 arXiv:2607.21576
  • 反方:position 形态 + 票数 14▲ 较弱 —— P3 旁证级别;frozen 特征解构的"具体方法 + 实验"是否真在 position paper 中给出未核;vs DROID-SLAM / Cotracker / DeAOT head-to-head 未给
  • 重要边界:不要把 Structured Dynamics 与 v25 DROID-SLAM / Cotracker 视为对立 / 重复:DROID-SLAM = SLAM 系统;Cotracker = 点跟踪;Structured Dynamics = 立场 + frozen 特征解构;三件工作层次不同:DROID-SLAM 系统;Cotracker 方法;Structured Dynamics 立场。注意 "position" 标签 —— 本文可能不提供完整方法与实验,需核 PDF 才能确认。

增量 5 · Color Pass-Through via Camera-Display Coupling — v32 §2.39.91 旁证新增

  • 来源:arXiv:2607.12746 · 17▲ 7-25 当日新立 · multimodal 主分类 method · paper_cards/571 · Tom 7-25 0900 HF Daily
  • 要点:Color Pass-Through = 相机-显示器耦合色彩直通;核心洞察:真实场景经相机捕获 + 显示器显示后,显示图像与原场景在色彩 / 亮度 / 对比度上常有显著差异 —— 关键原因:多数 pipeline 将高维捕获-显示过程拆分为两个独立校准阶段 + 低维色彩变换相连,导致信息瓶颈 + 不可避免的误差累积;本文提出相机-显示器耦合 pipeline,绕过低维色彩变换瓶颈
  • 脉络:与 v25 HDR ISP / v25 Real-ESRGAN / v25 SD3 + ISP + 端侧 ISP 路线同属"成像 pipeline + 色彩再现"主线 — Color Pass-Through 立"相机-显示器耦合 pipeline"维度 = 2026-Q3 多模态主题 "端到端成像"代表;与 v25 Real-ESRGAN 形成"显示端 vs 推理端"二联:Real-ESRGAN 关注推理端超分;Color Pass-Through 关注显示端色彩直通;两件工作形成"端到端成像推理端-显示端"二联
  • 建议归入节:§2.39.91 v32 旁证新增 + §1 主线 2 长上下文 / 视觉感知(端到端成像分支)+ §2.38 加 arXiv:2607.12746
  • 反方:票数 17▲ 弱;vs 传统 ISP pipeline head-to-head 数字未给;"相机-显示器耦合"对单设备 / 跨设备的影响未给;商用许可 + 端侧部署门槛未披露
  • 重要边界:不要把 Color Pass-Through 与 v25 HDR ISP / Real-ESRGAN / SD3 视为对立 / 重复:HDR ISP / Real-ESRGAN / SD3 是单环节方法;Color Pass-Through 是端到端耦合 pipeline;两件工作粒度不同:前者单环节,后者端到端。

§1.2 v32 全新立标候选(2 件,H2 视频生成 family + VLA)

增量 6 · SANA-Video 2.0 混合线性注意力视频生成 — v32 §2.39.92 立标候选新增 + work-queue Top 15 #5

  • 来源:arXiv:2607.21553 · 15▲ 7-25 当日新立 · multimodal 主分类 method(systems 副)+ paper_cards/574 · Tom 7-25 0840 radar 候选 · Tom 7-25 0900 HF Daily · work-queue Top 15 #5 [0.5]
  • 要点:SANA-Video 2.0 = 5B / 14B 混合视频 DiT,统一架构;核心洞察:纯线性注意力失去全秩 token 交互 → 提出 Hybrid Linear-Softmax Attention,以 3:1 比例结合门控线性注意力(O(N) 主混合) + 周期性门控 softmax 锚点(恢复全秩 token 交互);单 GPU 720p 高质量视频生成;与纯 softmax 视频 DiT 质量相当 + 保留线性注意力长序列扩展性
  • 脉络:与 v31 §2.39.81 FVAttn(视频生成稀疏注意力 + 多 GPU 运行时负载均衡)+ v31 §2.39.77 Self Gradient Forcing(训练策略突破)+ v30 §2.39.66 FlashRT(multimodal serving harness)+ v25 Linear Attention 4 同属"推理效率 + 视频生成 family + 注意力机制"主线 — SANA-Video 2.0 立"混合线性-Softmax 注意力 3:1 ratio"维度 = 2026-Q3 视频生成 family "Hybrid Linear Attention"立标(与 FVAttn 互补:FVAttn = 自适应 Top-p 路由 + Top-k 安全备份;SANA-Video 2.0 = Hybrid Linear-Softmax 周期性 softmax 锚点);三件工作形成"2026-Q3 视频生成 family 推理基础设施三角"(SGF 训练时 + FlashRT 通用 serving + FVAttn 专用稀疏 + SANA-Video 2.0 Hybrid Linear)
  • 建议归入节:§2.39.92 v32 立标候选新增 + §1 主线 6 推理效率(混合线性注意力分支)+ §1 主线 1 长视频生成(family 补全)+ §2.38 历史索引段加 arXiv:2607.21553
  • 反方 / 风险:票数 15▲ 信号中;"3:1 ratio"理论依据 vs 1:1 / 1:3 / 5:1 的 ablation 未给;"单 GPU 720p"具体 GPU 型号(消费级 vs 数据中心)未切清;vs Sora 2 / Kling 2.5 / Vidu S1 / Wan2.2 head-to-head 数字未给;5B/14B 两个规格的统一架构 ablation 未给
  • 重要边界:不要把 SANA-Video 2.0 与 v31 §2.39.81 FVAttn 视为对立 / 重复:FVAttn = 自适应 Top-p 路由 + Top-k 安全备份(运行时);SANA-Video 2.0 = Hybrid Linear-Softmax 周期性 softmax 锚点(架构);两件工作层次不同:前者运行时,前者架构。注意 v25 SANA-Video 1.0 与 v32 SANA-Video 2.0 关系:v25 是基础;v32 是混合线性-Softmax 升级;两件工作版本关系:v32 是 v25 的混合注意力升级版。

§1.3 v31 立标/旁证续立(3 件,7-25 当日数据)

延续 v31 arXiv 7-24 → 7-25 票数 累计跨日 关联 v31 节
§2.39.73 Subliminal Clocks 2607.01774 36▲ → 38▲ 当日 #5 74▲ §1 主线 1 Diffusion LM 范式分支(沿用)
§2.39.77 Self Gradient Forcing 2607.20368 29▲ → 30▲ 当日 #8 59▲ §2.39.77 v31 立标候选(沿用 + flyP 7-24 0950 E2 精读 + 京东 Joy Future Academy + 清华邮箱)
§2.39.78 ActiveVision 2607.16165 18▲ → 24▲ 当日 #10 42▲ §2.39.78 v31 旁证级(沿用)

要点:3 件 v31 立标/旁证级 24 小时内持续上行,v31 立标候选最强 Self Gradient Forcing 7-24→7-25 续立 29→30▲(累计 59▲)+ v31 旁证级 ActiveVision 7-24→7-25 续立 18→24▲(累计 42▲)+ v31 沿用 Subliminal Clocks 7-24→7-25 续立 36→38▲(累计 74▲),v32 应在 v31 §2.39.73/77/78 段加续立标注

§1.4 行业平台化升级候选(5 件本窗口 multimodal 旁证,沿用 v31 §6 + 升级候选)

  1. DeepMind Gemini 3.5 Flash Cyber 网络安全专用轻量模型(stephen 7-25 0910 · @GoogleDeepMind · 7/23):Chrome/Android 自测发现标准模型漏掉的漏洞;先限政府与可信伙伴 pilot — v32 §6 "Gemini 多模态安全" 升级候选;与 v31 §6 Gemini 3.5 Pro 三度延期形成"Gemini 全系产品节奏"完整闭环(3.5 Pro 旗舰延期 + 3.5 Flash-Lite / 3.6 Flash 滚动 + 3.5 Flash Cyber 安全专项)
  2. HuggingFace × Thinking Machines 上架 Inkling 开权重三模态(stephen 7-25 0910 · @huggingface · 7/15):文本 / 图像 / 音频三模态,可在 Tinker 微调 + Inkling Playground 试玩 — v32 §6 "HF 三模态开权重" 升级候选;与 v31 §6 OpenAI GPT-5.6 Sol + Terra/Luna + GPT-Live + GPT Image 2 + Anthropic Memory 多模态化形成"2026-Q3 多模态产品栈完整对照"
  3. Anthropic 新研究:Agentic misalignment in Summer 2026(stephen 7-25 0910 · @AnthropicAI · 7/15):继"勒索实验"一年后,模拟发现自主 AI agent 还有 4 种新的失准行为 — v32 §6 "Anthropic Agent 失准升级" 升级候选;与 v31 §6 OWASP Top 10 AI/Agent + v31 §6 HF 7-16 安全 + v31 §6 SeerGuard 形成"AI Agent 安全四联"
  4. Anthropic 新研究:Claude 表达 3000+ 价值观,跨模型/语言聚类后识别 4 条主轴(Deference / Warmth 等)(stephen 7-25 0910 · @AnthropicAI · 7/14)—— v32 §6 "Anthropic 价值观聚类" 升级候选;与 v31 §6 Anthropic Global Workspace Theory 形式化 + Anthropic Memory 多模态化形成"2026-Q3 Anthropic 主动立标"完整三联
  5. Andrew Ng 开源 OpenWorker:桌面 AI coworker,BYOK 接 GPT-5.6 / Claude Fable / Gemini 3.6 / Kimi / GLM / DeepSeek / Inkling / Ollama(stephen 7-25 0910 · @AndrewYNg · 7/24) — v32 §6 "OpenWorker 桌面 AI coworker + BYOK" 升级候选;与 v31 §6 OpenAI 多模态栈三件套 + Anthropic Memory 多模态化 + HF Inkling 三模态形成"2026-Q3 多模态应用栈完整对照"

额外 4 件行业平台化升级候选(不在 5 件主清单内但需要标记):

  • LeCun:AI 最大风险是少数厂商对专有助手的权力集中,唯一解药是开源基础模型(stephen 7-25 0910 · @ylecun · 7/9)—— v32 §6 "LeCun 开源基础模型风险论" 升级候选;同期评论"G in AGI is nonsense" —— 与 v31 §6 Jim Fan Robotics Endgame + Anthropic Global Workspace Theory + Karpathy Loop Era + Sam Altman AI 净就业形成"2026-Q3 立场分化五连"
  • DeepMind 发文"AI for Science":AI agent 已能批量提出假设与设计实验,真正的瓶颈是真实世界验证;提出面向资助者/政策方的 4 项优先(stephen 7-25 0910 · @GoogleDeepMind · 7/15) —— v32 §6 "AI for Science" 升级候选
  • Altman:GPT-5.6 Sol 周内增长 5.6×,推理团队"英雄式"扛住需求;Codex/ChatGPT Work 用量周增 2.5×;Sol 在多项任务上价格是 Claude Fable 的 1/4(stephen 7-25 0910 · @sama · 7/14) —— v32 §6 "GPT-5.6 Sol 5.6× + Codex 2.5×" 升级候选
  • Mollick:GPT-5.6 Sol 在 Codex 接管电脑的情况下用 5 小时赢得 Slay the Spire 2 每日挑战(随机种子,不可作弊)(stephen 7-25 0910 · @emollick · 7/12) —— v32 §6 "GPT-5.6 Sol Slay the Spire 2" 升级候选

§1.5 v32 跨主题交叉(本窗口新增)

  • multimodal + embodied:ReferTrack(具身视觉跟踪 + 像素空间指代-跟踪解耦)
  • multimodal + self-distillation:视觉对比自蒸馏(自蒸馏替代对比负样本)
  • multimodal + evaluation:Show Don't Tell(像素生成式答案接口)
  • multimodal + video-structure:Self-Supervised Structured Dynamics(frozen 特征 → 运动分解)
  • multimodal + imaging:Color Pass-Through(相机-显示器耦合色彩直通)
  • multimodal + video-generation-attn:SANA-Video 2.0(Hybrid Linear-Softmax 注意力)
  • multimodal + agentic-safety:Anthropic Agentic misalignment 4 种新失准 + Gemini 3.5 Flash Cyber + LeCun 开源基础模型风险论
  • multimodal + ai-industry:Andrew Ng OpenWorker BYOK + HF Inkling 三模态 + Anthropic 3000+ 价值观 + DeepMind AI for Science

§1.6 jay 7-24-1950-evening-engineering-filter 关键横切(MCP CVE 集群 + FA4 Blackwell)

# arXiv / CVE / 主题 内容 与 multimodal 关联
1 CVE-2026-26029 / CVE-2026-5059 / CVE-2026-30623(MCP 服务器命令注入 RCE 漏洞集群) 三个新 CVE,SentinelOne / LiteLLM 披露,7 月 MCP 安全事件频发 —— 与 v31 §6 HF 7-16 安全 + v31 §6 OWASP Top 10 AI/Agent 形成"2026-Q3 AI 平台安全三联" 强(multimodal 平台基础设施)
2 MCP 2026-07-28 新版规范:协议层无状态化 SecurityWeek / Akamai · 协议规范化 → 7-28 是关键节点,需持续追踪 强(Anthropic MCP 推动者)
3 FlashAttention-4 on NVIDIA Blackwell 完整性能数据 Lambda.ai 技术博客 + arXiv:2603.05451 · 71% 硬件利用率 / 1.6-3.2× vs Triton / 1.85-2.3× Backward —— 与 v31 §2.39.81 FVAttn + SANA-Video 2.0 形成"2026-Q3 推理基础设施四联"(FA4 + FlashRT + FVAttn + SANA-Video 2.0) 强(推理基础设施)
4 vLLM vs TensorRT-LLM vs SGLang H100 全量 Benchmark Spheron 独立测试 · Llama 3.3 70B FP8 · TensorRT-LLM 吞吐量 +13% vs vLLM @ 50 并发 / SGLang RadixAttention 在共享前缀场景显著受益 —— 生产决策关键 中(LLM inference 旁证,非 multimodal 主线)
5 OpenClaw 从 9k 到 188k GitHub Stars(60天) awesome-ai-agents-2026 · 社区数据 —— AI 工程主线,不入 multimodal 增量 弱(社区信号)

2. 矛盾 / 争议 / 待核实说法(5 条,建议在 v32 §3.2 之前消解)

  1. ReferTrack"指代-跟踪二联":核心反方 — "仅用单个前向摄像头"在 RGB-D / 多视角 / 跨 embodiment 上的扩展性未给;vs SOTA 跟踪器(BoT / TransT / OSTrack / MixFormerM / EVTbench 系)head-to-head 数字未给;"像素空间显式解耦"对实时性影响未给(paper_cards/568 / arXiv:2607.20061 / 7-25 #3 / flyP 7-25 multimodal-e1prep)— 7-26~7-30 前必做。
  2. SANA-Video 2.0"Hybrid Linear-Softmax 3:1 ratio":核心反方 — "3:1 ratio"理论依据 vs 1:1 / 1:3 / 5:1 的 ablation 未给;"单 GPU 720p"具体 GPU 型号(消费级 vs 数据中心)未切清;vs Sora 2 / Kling 2.5 / Vidu S1 / Wan2.2 head-to-head 数字未给(arXiv:2607.21553 / 15▲ / paper_cards/574 / work-queue Top 15 #5)— 7-26~7-30 前必做。
  3. Self-Supervised Structured Dynamics"frozen 特征 → 运动分解":核心反方 — paper_cards 主分类标为 position(立场论文而非方法论文);票数 14▲ 较弱;frozen 特征解构的"具体方法 + 实验"是否真在 position paper 中给出需 PDF 核(arXiv:2607.21576 / 14▲ / paper_cards/573)— 7-26 前必核。
  4. 视觉对比自蒸馏"自蒸馏替代对比负样本" + Show Don't Tell"像素生成式答案接口" + Color Pass-Through"相机-显示器耦合":三件 P2/P3 旁证完整核验在 7-26~7-30 之间各自独立推进(paper_cards/568-2607-21556 暂无 / 565-2607-21072 / 571-2607-12746)。
  5. Anthropic Agentic misalignment 4 种新失准 + Claude 3000+ 价值观 4 主轴 + LeCun 开源基础模型风险论 + Andrew Ng OpenWorker BYOK + Gemini 3.5 Flash Cyber 政府+可信伙伴 pilot —— 多个立场 / 产品节奏节点需持续核(stephen 7-25 0910 + jay 7-24-1950 + flyp 7-25 multimodal-e1prep)。

3. 可引用的 arXiv 号列表(本窗口 multimodal 主/副 7 件 + 行业 5 件无 arXiv + 续立 3 件)

# arXiv 号 标题 主题分类 票数 / 当日 # 建议归入节
1 arXiv:2607.20061 ReferTrack: Referring Then Tracking for Embodied Visual Tracking multimodal(主 method) 44▲ 7-25 当日新立 #3 §2.39.87 v32 立标新增
2 arXiv:2607.21556 视觉对比自蒸馏 Visual Contrastive Self-Distillation multimodal(主方法待分类确认) 41▲ 7-25 当日新立 #4 §2.39.88 v32 旁证新增
3 arXiv:2607.21072 Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text multimodal(主 benchmark) + evaluation 副 34▲ 7-25 当日新立 #6 §2.39.89 v32 旁证级新增
4 arXiv:2607.21576 Self-Supervised Learning of Structured Dynamics from Videos multimodal(主 position) 14▲ §2.39.90 v32 P3 旁证待观察
5 arXiv:2607.12746 Color Pass-Through via Camera-Display Coupling multimodal(主 method) 17▲ §2.39.91 v32 旁证新增
6 arXiv:2607.21553 SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation multimodal(主 method)+ systems 副 15▲ §2.39.92 v32 立标候选新增
7 arXiv:2603.05451 FlashAttention-4 on NVIDIA Blackwell(Lambda.ai 同步) engineering(主 method)+ multimodal 副 n/a(论文本体) §1 主线 6 推理效率 + §6 行业平台化升级
8 arXiv:2607.21461 AREX: 面向深度研究的递归自我改进 Agent(7-25 HF Daily 117▲ 当日 #1) agent(主 method)+ multimodal 副 117▲ 当日 #1 §2.39.93 v32 旁证新增(agent 主 multimodal 副)
9 arXiv:2607.20145 SLAI T-Rex: 在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练(7-25 HF Daily 56▲ 当日 #2) engineering(主 method) 56▲ 当日 #2 §1 主线 6 推理效率(基础设施,非 multimodal 主)

v31 已固化的 3 件续立(沿用 arXiv ID):arXiv:2607.01774 Subliminal Clocks 38▲(7-24 36▲ → 7-25 38▲) + arXiv:2607.20368 Self Gradient Forcing 30▲(7-24 29▲ → 7-25 30▲) + arXiv:2607.16165 ActiveVision 24▲(7-24 18▲ → 7-25 24▲)

沿用但不计入本窗口 multimodal 主增量(HF Daily 7-25 票榜顺序):arXiv:2605.09635 K12-KGraph 40▲ #5(education 副 multimodal)+ arXiv:2607.19747 Rubric-Centric Document Set Selection 27▲ #9(rag 主)+ arXiv:2607.20709 NVIDIA-labs OO Agents 19▲ #11(agent 主)+ arXiv:2607.20911 Tencent WorkBuddy Bench 18▲ #12(agent 主 benchmark)+ arXiv:2607.20734 LLM 在不断演化的用户意图中迷失 15▲ #15(agent 主 benchmark + multimodal 副)

Tom 7-25 0840 radar 高价值 3 件(不计入 multimodal 主增量):arXiv:2607.21503 Agentic Context Management(agent 主) + arXiv:2607.21557 OpenForgeRL(agent 主)+ arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(agent 主)+ arXiv:2607.19238 FinanceComplexQA(agent 主)+ arXiv:2607.04763 ReOPD(agent 主 multimodal 副)

行业平台化升级 arXiv 0 件(均来自 X / 官方 blog / CVE / 协议规范): - CVE-2026-26029 / CVE-2026-5059 / CVE-2026-30623(MCP 服务器命令注入 RCE 漏洞集群) - MCP 2026-07-28 新版规范:协议层无状态化 - FlashAttention-4 on NVIDIA Blackwell(Lambda.ai 技术博客 + arXiv:2603.05451 论文) - vLLM vs TensorRT-LLM vs SGLang H100 Benchmark(Spheron 独立测试) - DeepMind Gemini 3.5 Flash Cyber(stephen 7-25 0910) - HF Inkling 三模态开权重(stephen 7-25 0910) - Anthropic Agentic misalignment 4 种新失准(stephen 7-25 0910) - Anthropic Claude 3000+ 价值观 4 主轴(stephen 7-25 0910) - Andrew Ng OpenWorker BYOK(stephen 7-25 0910) - LeCun 开源基础模型风险论 + "G in AGI is nonsense"(stephen 7-25 0910) - DeepMind AI for Science 4 优先(stephen 7-25 0910) - Altman GPT-5.6 Sol 5.6× + Codex 2.5×(stephen 7-25 0910) - Mollick GPT-5.6 Sol 5 小时赢 Slay the Spire 2(stephen 7-25 0910)


4. 一句话摘要

本窗口(7-24 09:40 → 7-25 09:40)multimodal 主题在 v31 已在 1 小时前(8:40 CST)落定"周末 25 件 + 立标续立 6 件 + 全新立标 8 fresh + 1 综述 + 2 RAG 旁证 + 7 行业升级 + HF 7-16 安全升 §3.1"骨架基础上:v31 后 1 小时(7-25 08:40 ~ 09:40)实际增量 = 5 件 v32 全新立标/旁证候选(ReferTrack 44▲ · 视觉对比自蒸馏 41▲ · Show, Don't Tell 34▲ · Structured Dynamics 14▲ · Color Pass-Through 17▲ · SANA-Video 2.0 15▲)+ 3 件 v31 立标/旁证级续立(Subliminal Clocks 36→38▲ + SGF 29→30▲ + ActiveVision 18→24▲)+ 5 件行业平台化升级候选(Gemini 3.5 Flash Cyber 政府+可信伙伴 pilot + HF Inkling 三模态 + Anthropic Agentic misalignment 4 种新失准 + Claude 3000+ 价值观 4 主轴 + Andrew Ng OpenWorker BYOK)+ 4 件横切行业升级(LeCun 开源风险论 + DeepMind AI for Science 4 优先 + Altman GPT-5.6 Sol 5.6× + Mollick Slay the Spire 2)+ 1 件横切工程 jay 7-24-1950(MCP CVE 集群 + FA4 Blackwell + SGLang vs vLLM vs TensorRT-LLM)—— v32 建议在 §2.39.87-§2.39.92 立标/旁证候选 6 件(ReferTrack 立标最强 + 视觉对比自蒸馏旁证 + Show Don't Tell 旁证级 + Structured Dynamics P3 + Color Pass-Through 旁证 + SANA-Video 2.0 立标候选)+ §6 行业新增 9 件 + §1 主线 1/2/4/7 增量分支 + §7.1 引用新增 5 件


5. 检查过的来源(无显著新增量时如实写明)

路径 内容 multimodal 增量
/organized/queue/work-queue.md 2026-07-25 08:00 工作队列 SANA-Video 2.0 [0.5] 已进 Top 15 #5 + Self-Supervised Structured Dynamics 已进 Top 15;7 件 multimodal 主分类待深读 沿用(1409.1556 / 1505.00468 / 1906.03327 / 2107.07651 / 2304.08485 / 1412.6632 / 2303.10130 / 2102.03334 / 2205.01917 / 2304.10592 / 2203.12602 / 2305.06500 / 2607.19215)
/organized/knowledge/multimodal.md v31 (2026-07-25 08:40 CST 刚刚落定) · 81.7KB > 80KB 沿用 + 增量聚焦 14 立标 + 8 旁证 + 1 综述 + 2 RAG 旁证 + 7 行业 = 18 件 v31 增量已固化;本窗口 6 件 v32 候选为 v31 之外的真正新增
/organized/paper_cards/(7-22 全 + 7-23 全 + 7-24 全 + 7-25) 530-575 全部 主 multimodal 5 件 v32 新候选 + 副 multimodal 0 件 + 全文 23 张 7-25 本窗口候选/续立(553-575)
/inbox/flyp/7-24~7-25 multimodal e1prep 昨天 + 前天 E1 预消化 + Self Gradient Forcing E2 精读 + PRO-LONG E2 精读 + Cameron Wolfe 短评 v31 已吸收昨日 8 fresh + 1 综述 + 2 RAG 旁证 + 7 行业;今日 6 件 v32 候选为本窗口新立
/inbox/jay/7-22~7-25 csdn-langgraph-multimodal-rag-substack(7-24)+ ai-engineering-trending(7-24)+ inference-multimodal-stack(7-24 1620)+ evening-engineering-filter(7-24 1950) HM-RAG + Multimodal RAG Survey + GPT Image 2 + HF 安全事件 + OWASP + MCP CVE 集群 + FA4 Blackwell(共 7 件 multimodal 关联)
/inbox/tom/7-22~7-25 HF Daily 7-24(09:00)+ HF Daily 7-25(09:00)+ radar 7-24 ~ 7-25(8 件 + 8 件)+ rag-e1prep 7-25 5 件主 multimodal 新立候选 + 3 件续立 + 1 件 AREX agent 主 multimodal 副 + 3 件 Tom 7-25 0840 radar 高价值(agent 主)
/inbox/stephen/7-22~7-25 news-x-vip-radar 7-24 + 7-25 + 协调棒 ×2 + ai-industry-e1prep 7-24 9 件行业平台化升级候选(Gemini 3.5 Flash Cyber + HF Inkling 三模态 + Anthropic Agentic misalignment 4 种 + Claude 3000+ 价值观 + Andrew Ng OpenWorker BYOK + LeCun 开源风险论 + DeepMind AI for Science + Altman GPT-5.6 Sol 5.6× + Mollick Slay the Spire 2)
/inbox/spark/7-22~7-25 gradient-flow × 2 + chip-huyen × 2 + 3blue1brown × 2 + agent e1prep + llm-infra e1prep 无 multimodal 主/副增量(全部 LLM infra / Agent / 商业化)

总结:本窗口v31 已固化本窗口 24h 主战场内容(8 fresh + 1 综述 + 2 RAG 旁证 + 7 行业 = 18 件);真正增量是 v31 后 1 小时内 6 件 v32 全新立标/旁证候选(ReferTrack 44▲ · 视觉对比自蒸馏 41▲ · Show, Don't Tell 34▲ · Structured Dynamics 14▲ · Color Pass-Through 17▲ · SANA-Video 2.0 15▲)+ 3 件 v31 立标/旁证级续立(Subliminal Clocks 36→38▲ + SGF 29→30▲ + ActiveVision 18→24▲)+ 9 件行业平台化升级候选(Gemini 3.5 Flash Cyber + HF Inkling 三模态 + Anthropic Agentic misalignment 4 种 + Claude 3000+ 价值观 + Andrew Ng OpenWorker BYOK + LeCun 开源风险论 + DeepMind AI for Science + Altman GPT-5.6 Sol 5.6× + Mollick Slay the Spire 2)+ 1 件横切工程 jay 7-24-1950(MCP CVE 集群 + FA4 Blackwell + SGLang vs vLLM vs TensorRT-LLM H100 Benchmark)