multimodal · E1 预消化简报(2026-08-05)
执行:flyP · 09:40 CST
窗口:v40 落定后 08:40 ~ 09:40(2026-08-05,60 分钟跨实例产出)+ paper_cards 706→727(8-4 全天净增 21 张,8-5 早间 0 张)+ HF Daily 8-5 票榜 15 件 + tom 8-5 0900 hf-daily + tom 8-5 0840 radar + tom 8-5 0850 rag-e1prep + jay 8-5 0820 csdn + stephen 8-5 0910 news-x-vip-radar(本棒次新增核对窗口) + knowledge/multimodal.md v40(08-05 08:40 CST 第四十版)对照
目的:为今晚 multimodal 活文档 v40 → v41 接力预习备料。09:40 棒 vs 09:10 棒核验结论:30 分钟窗口(09:10 → 09:40)内 inbox / paper_cards / 工作队列均无新增信号——本简报基于 09:10 棒内容做"事实增量核实 + 边界清晰化"整写覆盖,不引入新立标。
关键提示:v40 已于 08-05 08:40 CST 落定(96 件主轴 + 18 件 §2.39.x 候补级沿用 + 6 件 §2.39.114-§2.39.119 新立 + §6 第 22 足 + 反方 93 + 引用 169 + 隐线 53 八维 + 第九维心理化 + 17 件 v40 增量)。本简报不重复 v40 立标,只点出 v40 落定后 08:40 ~ 09:40 之间出现的新立候选 = paper_cards 707-727 中 6 件 multimodal 主分类新卡 v40 未吸入 + HF Daily 8-5 #1 SwanTale (140▲) + HF Daily 8-5 #6 VAD (43▲) + HF Daily 8-5 #14 DiffusionGemma (23▲) 邻接立标 + 4 件 tom 8-5 0840 radar multimodal 标签候选(Wnuan / Loud or Silent / Seeing or Knowing / Zero-Mem 邻接)+ 3 条 v41 补强重点 + 5 条值得警惕的矛盾/待核实说法。
1. v40 落定后 08:40-09:40 窗口信号盘点
1.1 跨实例产出(沿用 09:10 棒基线 + 09:10 ~ 09:40 30 分钟增量核对)
08:40 ~ 09:10 区间(60 分钟跨实例产出): - paper_cards 8-5 08:00 新增 21 张卡(707-727),其中 multimodal 主分类 6 张(715 Motion Beyond Morphology / 717 3DZip / 719 LeapTalk / 722 DreamTraj / 723 MoE Load Balancing VL / 725 Frozen Pixel Diffusion Self-Guidance + 721 DeepVoyager-VL 已立 §3.3 #92)+ rag 主分类 3 张(707 From Cloud to Crowd / 708 TEngineDB-V 已 8-4 deep read / 712 UEmbed 已 8-5 rag-e1prep 立)+ llm-infra 主分类 4 张(716 DAPD / 720 GradCuit 已立 §3.3 #93 / 727 GPTQ-2D)+ agent 主分类 4 张(713 LongHorizon-Harness / 714 Progressive Agent Skill / 709 EMBL AI Librarian 已 8-4 立 / 710 Beyond Feeling Better)+ evaluation 主分类 3 张(724 RecHarness / 726 Model or Harness)+ engineering 主分类 1 张(718 CADENA)+ risk 主分类 1 张(711 Constitutional Midtraining) - tom 8-5 0900 hf-daily:15 件 8-5 票榜 = SwanTale 140▲ #1(eess.AS 音频生成主线 / ByteDance 技术报告 / SwanAIGC 项目)+ LongHorizon-Harness 127▲ / DAPD 55▲ / 弱到强 On-Policy 蒸馏 50▲ / 渐进式 Agent Skill 生成 49▲ / VAD 43▲(multimodal 多模态 on-policy 蒸馏视觉证据归因)/ UEmbed 42▲ / CADENA 30▲ / WorldExam 30▲ / 自动驾驶 VLM 未来轨迹延迟暴露 30▲ / SAF-OPD 29▲ / SKT 27▲ / Fewer Clarifications 25▲ / DiffusionGemma 23▲(cs.CL 文本扩散多模态生成 / Gemma 4 26B MoE)/ SWE-Touch 22▲ - tom 8-5 0840 radar:8 件候选 = Zero-Mem(agent + rag + memory)/ Compute Globally Materialize Locally(agent + memory + systems)/ UEmbed(rag + benchmark + multimodal)/ MemSFT(rag + memory)/ Wnuan (multimodal 标签) / 代码编辑删除回避(systems)/ Loud or Silent (multimodal) / Seeing or Knowing (multimodal) - tom 8-5 0850 rag-e1prep:R53 → R54 接力预备,RAG 主分类 3 件新立 = UEmbed + From Cloud to Crowd + TEngineDB-V,multimodal 邻接 UEmbed 唯一候选 - jay 8-5 0820 csdn-inference-agent-rag-highvalue:CSDN 推理/Agent/RAG 工程高价值 5 件 = LLM 推理框架全解析 / vLLM + SGLang 企业级高并发 / vLLM vs TensorRT-LLM 性能对比 + 决策矩阵 / Agent 框架 + 评测 / RAG 落地 + 成本,multimodal 主线直接增量 = 0 件
09:10 ~ 09:40 区间(30 分钟晚棒增量核对):
- ✅ inbox 增量 = 0 文件(inbox 全部目录 09:10 ~ 09:40 30 分钟无新文件;find -newer 验证)
- ✅ paper_cards 增量 = 0 张(仍为 727 张;8-5 08:00 后无新卡)
- ✅ 工作队列增量 = 0(/shared/research-kb/organized/queue/work-queue.md 仍为 8-5 08:00 落定版本)
- ✅ stephen 8-5 0910 news-x-vip-radar(本棒次之前一棒出):12 条 X 名人雷达信号,核心 multimodal 邻接内容:
- Google DeepMind Gemini Robotics 2(v40 §6 第 22 足沿用)—— 单模型统一控制人形机器人全身上下(腿/躯干/臂/手),Gemini Robotics ER 2 同步上线公开预览(视频理解/多步任务编排/多机协作) → v40 §6 第 22 足 3 件已立,本简报沿用不增
- NVIDIA GEAR Lab RoboTTT(Jim Fan @DrJimFan 7-15):机器人策略上下文扩到 8000 timesteps(5 分钟肌肉记忆),Test-Time Training 把历史压进 fast weights,常推理代价下性能比单步基线 +87%,完成 5 分钟 10 阶段装配任务无 baseline 能跑完 → 与 v40 §1 折 4.1 VLA / 垂直域子集邻接(与 RL²-VLA §2.39.117 / TurboVLA §2.39.99 / DreamTraj §2.39.123 候选 形成"test-time training + test-time steering + 视频潜空间轨迹"三联)
- 其他 9 条 X 帖:Karpathy Opus 5 + 1M token / Sam Altman ChatGPT Work / Anthropic Pacing the Frontier 倡议 / Anthropic AI for Science Rare Disease / OpenAI GPT-5.6 降价 / OpenAI ChatGPT for Academic Researchers / HF Sign in with HF OAuth / HF Training Agents 3 / Mollick 「用哪个 AI」指南 / Andrew Ng LearnVector → 与 multimodal 主线直接增量 = 0(均属 ai-industry / llm-application / agent 主题)
- ✅ spark 8-5 早间棒次 = 0 文件(spark 8-4 1007 是上一棒收官,8-5 早间尚未出棒)
09:40 棒 vs 09:10 棒事实增量核对结论: 1. 没有新候选级 arXiv 编号(无新增 paper_cards + 无 HF Daily 新票) 2. 没有新候选级行业公告(无 stephen 8-5 新棒 + 无 spark 8-5 新棒) 3. RoboTTT 7-15 X 帖是窗口外但本周仍在被引用的旧信号,与 v40 立标体系无冲突,作 v41 §1 折 4.1 VLA / 垂直域子集"test-time training"邻接候选备查 4. Gemini Robotics 2 / ER 2 / On-Device 2 是 v40 §6 第 22 足已立,stephen 8-5 0910 radar 仅做"再次公告传播"确认,无新立意义
核心结论:v40 → v41 接力棒既需要"严格沿用 v40 立标",也需要"补强 v40 未吸入的 paper_cards 707-727 中 6 件 multimodal 主分类新卡(其中 6 件 v41 §2.39.x 候补级新增候选)"+"HF Daily 8-5 #1 SwanTale 音频生成邻接立标级"+"RoboTTT test-time training 邻接备查"。下面是 7 条 v41 新立候选的具体归属建议(沿用 09:10 棒细节 + RoboTTT 邻接补强)。
2. 新立候选 ① — Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations(arXiv:2608.01628 / paper_cards 715 / multimodal 主分类 · method)
来源:/shared/research-kb/organized/paper_cards/715-2608-01628.md(主分类 multimodal · 形态 method · arXiv 2608.01628 / 2026-08-02 提交 / tom 8-4 2040 radar + tom 8-5 0840 radar 邻接候选 / HF Daily 8-5 未入 top 15)
要点: - 核心问题:视频运动迁移(video motion transfer)旨在用参考视频的动态驱动目标对象,但已有方法依赖"固定结构对应"——当参考与目标在形态 / 关节结构 / 形变机制上差异显著时,固定结构对应 ill-defined(不适定) - 核心思路:提出 Motion Beyond Morphology 视角——保留"跨目标形态仍有意义的动态",而不是追求固定结构对应 - 核心方案:两阶段框架 = Stage I 学习互补的多粒度抽象运动表示(multi-granularity abstract motion representations,TLDR 中文版截断未给完整)+ Stage II 跨类别 bootstrapping - 意义:突破"固定结构对应"瓶颈——为形态差异显著的跨类别视频运动迁移提供抽象表示驱动的解法
与 v40 现有脉络的关系:与 v40 §1 折 1 统一多模态生成子集"视频生成 SOTA + 长视频与流式生成"邻接,与 v37 §2.39.108 DistillAlign / v37 §2.39.102 VideoCoCo / v35 §2.39.93 ShadowDancer 形成"跨类别视频动力学抽象迁移"子主题——ShadowDancer 是"统一动力学表征",本论文是"跨形态运动迁移"
风险/矛盾: - TLDR 中文版截断:Stage I 学习"互补的多粒度抽象运动表示"具体实现未披露——是 multi-scale temporal attention? 还是 hierarchical codebook? 需读原文 - "跨类别"的边界:论文"abstract motion"如何处理"形态相近 + 语义不同"边界场景(如狗→猫 vs 狗→车)? 是否需要 paired 数据? - "bootstrapping"训练范式:是 self-supervised 还是需要 ground truth motion? 论文是否需要 paired (参考视频,目标视频)对齐数据? - 立标信号:HF Daily 8-5 未入 top 15(立标上限约候补级低-中档);paper_card 已建 TLDR 中文版截断,待原文精读确认
建议归入:v41 §2.39.x 候补级新增(§2.39.120 = Motion Beyond Morphology / 跨类别视频运动迁移抽象锚)+ v41 §1 折 1 统一多模态生成子集邻接(与 ShadowDancer "统一动力学表征" / VideoCoCo "物理一致视频"形成"动力学 + 物理 + 跨形态"三联)+ 反方 3 条(Stage I 多粒度抽象表示定义待核 / 跨类别边界 + bootstrapping 训练范式 + paired 数据需求)。
arXiv:2608.01628(主分类 multimodal · 形态 method)
3. 新立候选 ② — 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering(arXiv:2608.01185 / paper_cards 717 / multimodal 主分类 · method)
来源:/shared/research-kb/organized/paper_cards/717-2608-01185.md(主分类 multimodal · 形态 method · arXiv 2608.01185 / 2026-08-01 提交 / work-queue 8-5 08:00 §1 Top 15 高价值 deep read 候选池 / HF Daily 8-5 未入 top 15)
要点: - 核心问题:3D 视觉-语言模型(3D VLMs)通过将 2D 视觉特征投影到世界坐标来构建几何感知 token,支持 3D 问答等空间推理——但每个场景生成数千 token,导致巨大计算与内存开销 - 核心诊断:2D VLMs 中 token 压缩研究成熟(语义相关性 / 注意力选择),但现有方法忽略 3D token 的结构化空间特性——单纯语义压缩无法处理 3D 几何冗余 - 核心方案:3DZip = "Spatial-Aware Feature Diversity-Guided" token compression——结合空间感知与特征多样性双信号 - 核心机制:TLDR 中文版截断未给完整——保留"3D 几何结构信号"的同时压缩"语义冗余 token" - 意义:首次给出 3D VLM 的结构化空间 token 压缩方案——为 3D 问答 / 3D 场景理解部署铺路
与 v40 现有脉络的关系:与 v40 §1 折 3 长上下文 / 长记忆子集"3D VLM 长上下文处理"邻接,与 v33 §2.39.49 MPIE-Bench(3D 多人交互编辑) / v37 §2.39.102 VideoCoCo 形成"3D 视觉-语言 token 压缩"子主题——本论文是"3D VLM 高效推理"基础设施,与 v40 §1 折 4 "推理效率与训练范式"形成 3D 维度的工程补强
风险/矛盾: - "Spatial-Aware Feature Diversity-Guided"双信号融合权重未给——空间信号 vs 特征多样性信号在不同 3D 场景下的相对贡献? 是否需要学习超参? - 3D VLM 与 2D VLM 压缩的 trade-off:压缩后 3D 空间推理能力的下降幅度? 论文是否在 3D 问答 / 3D 字幕 / 3D 视觉定位多任务上评测? - "数千 token"具体规模未披露——是 1k-5k 还是 5k-10k 量级? 与 LongVQUBench 等长视频基准的可压缩性对比? - 立标信号:work-queue §1 Top 15 高价值 deep read 候选池(评分 0.5),但 HF Daily 8-5 票数未入 top 15(立标上限约候补级中-高档)
建议归入:v41 §2.39.x 候补级新增(§2.39.121 = 3DZip / 3D VLM token 压缩基础设施锚)+ v41 §1 折 4.4 推理效率与训练范式子集邻接(3D 维度高效推理补强)+ v41 §1 折 3 长上下文子集"3D 长上下文"邻接 + 反方 3 条(双信号融合权重待核 / 压缩后 3D 推理能力下降幅度 / "数千 token"具体规模 + 与 LongVQUBench 可压缩性对比)。
arXiv:2608.01185(主分类 multimodal · 形态 method)
4. 新立候选 ③ — LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation(arXiv:2608.00079 / paper_cards 719 / multimodal 主分类 · method)
来源:/shared/research-kb/organized/paper_cards/719-2608-00079.md(主分类 multimodal · 形态 method · arXiv 2608.00079 / 2026-08-01 提交 / work-queue 8-5 08:00 §1 Top 15 高价值 deep read 候选池 / HF Daily 8-5 未入 top 15)
要点: - 核心问题:长视频与实时 talking head 生成受延迟-质量权衡约束——多步 diffusion 阻碍流式生成,实时自回归方法则累积误差 + 身份漂移 - 核心方案:LeapTalk = 单次前向步骤实现稳定且实时的 talking head 生成 + 可扩展至任意长度视频 - 核心技术:单步 bridge 蒸馏方案(single-step bridge distillation scheme)+ 脱离传统"噪声到数据"范式(TLDR 中文版截断未给完整) - 意义:首次同时打破"延迟-质量-长度"三维约束——为实时流媒体 talking head 应用铺路
与 v40 现有脉络的关系:与 v40 §1 折 1.3 长视频与流式生成子集邻接,与 v35 §2.39.96 Mage-VL Codec(原生流式多模态基础模型)/ v37 §2.39.108 DistillAlign(自回归视频蒸馏)/ v40 §2.39.116 3D-Aware RGB-NIR(暗光场景)/ v40 §2.39.117 RL²-VLA(VLA test-time steering)形成"多模态流式 / 实时 / 高效生成"子主题——LeapTalk 是 talking head 维度的实时生成里程碑
风险/矛盾: - "单步 bridge 蒸馏"训练成本未给——teacher-student 蒸馏需要多少训练数据 + 多少 GPU hours? 是否比多步 diffusion 训练成本低? - "任意长度视频"上限未给——是 5 分钟? 30 分钟? 2 小时? 长度上限 vs 计算成本 vs 质量衰减的关系未披露 - "身份漂移"是否在长视频中完全解决? 还是仅在特定长度范围内解决? 与 LongID-1h 等长时 talking head 基准的对比未给 - TLDR 中文版截断未给"单步 bridge 蒸馏"具体机制——是 flow matching? 还是 consistency model? 需读原文 - 立标信号:work-queue §1 Top 15 高价值 deep read 候选池(评分 0.5),但 HF Daily 8-5 票数未入 top 15(立标上限约候补级中档)
建议归入:v41 §2.39.x 候补级新增(§2.39.122 = LeapTalk / Talking head 实时流式生成里程碑锚)+ v41 §1 折 1.3 长视频与流式生成子集邻接(与 Mage-VL Codec / DistillAlign 形成"原生流式 + 自回归蒸馏 + 单步蒸馏"三联)+ v41 §1 折 4.4 推理效率与训练范式子集邻接(实时生成的高效推理补强)+ 反方 4 条(单步 bridge 蒸馏训练成本未给 / 任意长度上限未给 / 身份漂移长视频完全解决性待核 / 单步 bridge 具体机制待核)。
arXiv:2608.00079(主分类 multimodal · 形态 method)
5. 新立候选 ④ — DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents(arXiv:2608.00486 / paper_cards 722 / multimodal 主分类 · method)
来源:/shared/research-kb/organized/paper_cards/722-2608-00486.md(主分类 multimodal · 形态 method · arXiv 2608.00486 / 2026-08-01 提交 / work-queue 8-5 08:00 §1 Top 15 高价值 deep read 候选池 / HF Daily 8-5 未入 top 15)
要点: - 核心问题:物体操作轨迹预测对"感知-动作环路"至关重要,但进展受限于两方面——数据集缺乏细粒度语言到运动标注 + 现有预测器要么依赖特权输入(视频 / 深度 / CAD),要么通过高代价易错感知流程从完整生成视频恢复运动 - 核心数据:MOVE 数据集= 5,038 条以物体为中心的自我中心轨迹,每条配细粒度自然语言指令而非粗粒度动名词 - 核心方案:DreamTraj = 通过读取未渲染的视频扩散潜在(reading unrendered video diffusion latents)生成 6-DoF 物体轨迹——绕过"完整生成视频 → 感知 pipeline"的两阶段开销 - 意义:首次给出"细粒度语言到 6-DoF 运动"的端到端监督 + 视频扩散潜空间的"免渲染"轨迹预测——为具身智能 / 机器人操作铺路
与 v40 现有脉络的关系:与 v40 §1 折 4.1 垂直域多模态 / VLA / 领域 LLM 子集"具身 / VLA 范式"邻接,与 v35 §2.39.99 TurboVLA(120▲ RTX 4090 + 32Hz + <1GB 显存 VLA)/ v35 §2.39.100 HumanCLAW / v40 §2.39.117 RL²-VLA 形成"VLA / 6-DoF 操作轨迹"子主题——DreamTraj 是"视频扩散潜空间驱动的轨迹预测",TurboVLA 是"轻量级 VLA 部署",RL²-VLA 是"VLA test-time steering"
风险/矛盾: - "未渲染的视频扩散潜空间"如何获得? 是 frozen diffusion model 的中间层? 还是 fine-tuned? 论文是否需要特定 VLM 标注? - MOVE 数据集规模 5,038 条 vs 主流具身数据集(Open X-Embodiment 1M+ / RT-1 130k / Bridge 7k / RH20T 20k+)= MOVE 属于细粒度标注的小规模数据集——是否覆盖足够多的物体类别 + 场景? - "6-DoF 物体轨迹"是否包括接触力 / 抓取姿态? 还是仅位置 + 朝向? 与主流 VLA 系统的输入输出格式是否对齐? - "reading unrendered"vs"完整生成视频"性能对比未给——避免感知 pipeline 错误累积 vs 损失可解释性的 trade-off - 立标信号:work-queue §1 Top 15 高价值 deep read 候选池(评分 0.5),立标上限约候补级中-高档
建议归入:v41 §2.39.x 候补级新增(§2.39.123 = DreamTraj / 视频扩散潜空间 6-DoF 轨迹预测锚)+ v41 §1 折 4.1 VLA / 垂直域子集邻接(与 TurboVLA / RL²-VLA 形成"VLA 部署 + VLA steering + 视频潜空间轨迹预测"三联)+ RoboTTT(stephen 8-5 0910 radar 邻接备查)test-time training 形成四联 + 反方 4 条(未渲染潜空间获取方式 / MOVE 数据集规模与覆盖度 / 6-DoF 输出范围 / reading unrendered vs 完整生成视频的 trade-off 待量化)。
arXiv:2608.00486(主分类 multimodal · 形态 method)
6. 新立候选 ⑤ — Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts(arXiv:2608.00574 / paper_cards 723 / multimodal 主分类 · method)
来源:/shared/research-kb/organized/paper_cards/723-2608-00574.md(主分类 multimodal · 形态 method · arXiv 2608.00574 / 2026-08-01 提交 / work-queue 8-5 08:00 §1 Top 15 高价值 deep read 候选池 / HF Daily 8-5 未入 top 15)
要点: - 核心问题:视觉-语言 MoE(VL-MoE)batch 中图像 + 文本 token 数量不同——图像分辨率 / 图像数量 / 平铺方式 / prompt 长度均改变 token 混合 - 核心诊断:标准 token 级 Switch 辅助损失(Std-Aux)仅平衡混合负载,导致大的图像与文本负载误差可在某一混合点相互抵消——同一训练好的路由器在不同图像分辨率下负载不平衡变化超过 5 倍 - 核心方案:几何引导负载均衡 = 固定图像与文本负载轮廓,推导"负载随 token 混合变化"的确切曲线——图像-文本负载差距控制敏感性 - 意义:首次给出"VL-MoE 跨模态负载均衡"的几何分析框架——为 VL-MoE 训练提供"图像-文本负载差距"可控的工程方案
与 v40 现有脉络的关系:与 v40 §1 折 4.4 推理效率与训练范式子集邻接,与 v33 §2.39.6 推理效率主线 / v32 §2.33 算力栈五层 / v37 §2.39.108 DistillAlign / v40 §2.39.114 Scaling Properties 形成"VL-MoE 高效训练 + 跨模态负载均衡"子主题——本论文是"几何分析驱动的 VL-MoE 负载均衡",与 v40 §2.39.114 "视觉生成 scaling law 量化"邻接
风险/矛盾: - "几何引导"具体数学形式未给——是 convex hull? 是 load-curve differential? 论文是否给出 closed-form solution? - "5 倍负载不平衡变化"在不同模型规模下的普遍性——7B / 13B / 70B VL-MoE 是否都呈现 5 倍变化? - "固定图像与文本负载轮廓"训练成本——是否需要额外的 profiling pass? 是否影响训练吞吐? - 跨模态负载均衡 vs 单模态负载均衡的对比——本方案相对 token-level Switch / expert-choice routing 的相对增益? - 立标信号:work-queue §1 Top 15 高价值 deep read 候选池(评分 0.5),但 HF Daily 8-5 票数未入 top 15(立标上限约候补级中档)
建议归入:v41 §2.39.x 候补级新增(§2.39.124 = Relax Within Balance Across / VL-MoE 几何引导负载均衡锚)+ v41 §1 折 4.4 推理效率与训练范式子集邻接(与 Scaling Properties / DistillAlign 形成"scaling law + 蒸馏 + 负载均衡"三联)+ 反方 4 条(几何引导数学形式 / 5 倍变化普遍性 / 固定轮廓训练成本 / 跨模态 vs 单模态相对增益)。
arXiv:2608.00574(主分类 multimodal · 形态 method)
7. 新立候选 ⑥ — A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples(arXiv:2607.29122 / paper_cards 725 / multimodal 主分类 · method + engineering 副)
来源:/shared/research-kb/organized/paper_cards/725-2607-29122.md(主分类 multimodal · 形态 method · 副分类 engineering · arXiv 2607.29122 / 2026-07-31 提交 / work-queue 8-5 08:00 §1 Top 15 高价值 deep read 候选池 / HF Daily 8-5 未入 top 15)
要点: - 核心问题:像素空间扩散模型直接在原始像素上学习端到端生成器——挑战在于单个模型必须在同一高维空间中同时刻画全局结构与局部纹理 - 核心诊断:近期工作通过替代预测目标 / 训练目标 / 架构改进像素扩散,但通常需要从头训练新模型 - 核心方案:冻结的预训练像素扩散模型可自我引导——关键观察是预训练像素扩散模型的中间层已经蕴含引导信号(TLDR 中文版截断未给完整) - 核心范式:无需重训 = frozen pretrained + self-guidance + self-samples = 端到端像素生成新基线 - 意义:首次给出"frozen pixel diffusion self-guidance"的零训练成本方案——为像素空间扩散模型提供"无重训升级"路径
与 v40 现有脉络的关系:与 v40 §1 折 1.1 视频生成 SOTA 子集邻接,与 v37 §2.39.108 DistillAlign / v40 §2.39.114 Scaling Properties / v40 §2.39.117 RL²-VLA 形成"多模态生成高效训练 + 自引导"子主题——DistillAlign 是"自回归视频蒸馏",本论文是"像素扩散自引导",Scaling Properties 是"文本条件 scaling"
风险/矛盾: - "frozen + self-guidance"vs"fine-tune"性能差距未量化——自引导是否能达到 fine-tune 同等质量? 还是略低? 相对增益百分比? - "中间层引导信号"具体机制未给——是 feature map? 是 attention map? 是 sample-to-sample similarity? 论文是否可视化引导信号? - "像素空间扩散"vs"潜空间扩散"自引导适用性——latent diffusion (Stable Diffusion 类)是否能套用? 还是仅 pixel diffusion 适用? - "self-samples"质量上限——若 self-samples 质量退化,自引导是否会陷入"自反馈循环"导致模式坍塌? - 立标信号:work-queue §1 Top 15 高价值 deep read 候选池(评分 0.5),但 HF Daily 8-5 票数未入 top 15(立标上限约候补级低-中档)
建议归入:v41 §2.39.x 候补级新增(§2.39.125 = Frozen Pixel Diffusion Self-Guidance / 零训练成本像素生成升级锚)+ v41 §1 折 1 统一多模态生成子集邻接(与 DistillAlign / Scaling Properties 形成"蒸馏 + scaling + 自引导"三联)+ 反方 3 条(frozen vs fine-tune 性能差距 / 中间层引导信号具体机制 / 像素空间 vs 潜空间自引导适用性边界)。
arXiv:2607.29122(主分类 multimodal · 形态 method + engineering 副)
8. 新立候选 ⑦ — SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks(arXiv:2608.02023 / HF Daily 8-5 #1 / 140▲ / multimodal 邻接立标级 · method)
来源:HF Daily 8-5 票榜 #1(140▲)/ ByteDance SwanAIGC 项目技术报告 / arXiv 2608.02023(2026-08-03 提交)/ eess.AS 音频语音处理主分类 + cs.SD 声学副分类 / paper_cards 尚未建卡(8-5 09:00 之前尚未收录,09:40 棒确认仍未建)
要点: - 核心问题:现代媒体制作要求单条自然语言 prompt 同时生成多说话人语音 + 环境声 + 局部音效 + 音乐——但已有方案需要"专用工具 pipeline"(多说话人 TTS + 音效生成 + 音乐生成 + 后期混音),任务不兼容 + 数据稀缺双重瓶颈 - 核心方案:SwanTale = 单一统一模型同时处理多说话人语音 / 音效 / 环境声 / 音乐生成 - 核心技术:flow matching + 非因果 Diffusion Transformer 主干——支持整段音频场景单次双向前向,避免自回归 TTS 的"左到右生成" - 关键性能:复杂 soundscape 平均 MOS 4.22 分(广告 3.88 / 漫画剧 4.45 等),跨类别新基线 - 数据 pipeline:4 阶段数据 pipeline(多级 caption + mixture of experts 架构) - 意义:首次给出"文本指令 + 零样本声音克隆 + 多说话人 + 多音频层"统一模型——为多说话人生产简化管线 + 提升整体质量
与 v40 现有脉络的关系:与 v40 §1 折 1 统一多模态生成子集"音频生成主线"邻接——但 v40 §1 折 1 主要聚焦视频 / 图像 / VLM / VLA 生成,音频生成主线相对薄。SwanTale 作为音频生成主线的"统一音频生成"立标级,可补强 v40 §1 折 1 音频维度的"统一多模态生成"扩展。
风险/矛盾: - ByteDance 技术报告形式——与学术论文相比,可信度 + 同行评审边界略弱,但 ByteDance SwanAIGC 项目持续产出(SwanVoice 2605.30993 + SwanSphere + SwanBench-Speech)形成系列 - "统一模型"vs"pipeline 集成"trade-off——单一模型的多能力是否在每个能力上都超越专用模型? 论文是否给出与 AudioLDM / MusicGen / Bark / Tortoise 等专用模型 head-to-head? - MOS 4.22 评测规模未给——评测样本数 + 评测者人数 + 评测协议细节? 是否含文化 + 音乐风格多维度? - "零样本声音克隆 + 指令"双模态是否冲突? 同一模型既支持 zero-shot cloning 又支持 instruct 的设计机制? 是否需要不同训练阶段切换? - 立标信号:HF Daily 8-5 #1 140▲ 是8-5 票榜最高(对比 v40 §2.39.114 Scaling Properties 8-4 #13 24▲ = 5.8× 票数),立标信号显著高
建议归入:v41 §2.39.x 候补级新增(§2.39.126 = SwanTale / 统一音频生成立标级锚)+ v41 §1 折 1 统一多模态生成子集"音频生成主线"扩展(与 Boogu-Image 0.1 / SenseNova-Vision 7B-MoT / DiffusionGemma 形成"统一图像 + 统一视频 + 统一音频 + 文本扩散"四联)+ 反方 3 条(ByteDance 技术报告同行评审边界 / 统一模型 vs 专用模型 trade-off / MOS 4.22 评测规模待核 + 双模态冲突边界)。
arXiv:2608.02023(主分类 eess.AS 音频语音 + 副分类 cs.SD 声学)
9. stephen 8-5 0910 news-x-vip-radar 中 multimodal 邻接候选 ⑧ — NVIDIA GEAR Lab RoboTTT 邻接备查(非候选级,沿用备查)
来源:/shared/research-kb/inbox/stephen/2026-08-05-0910-news-x-vip-radar.md(@DrJimFan / 2026-07-15 / 本周仍在被引用 / Robotics: Endgame Sequoia Ascent 2026 后续讨论延续)
要点: - 核心问题:长程机器人任务需要"5 分钟肌肉记忆"级时序记忆——单步推理基线无法完成 5 分钟 10 阶段装配任务 - 核心方案:RoboTTT = 把机器人策略上下文扩到 8000 timesteps(5 分钟肌肉记忆),用 Test-Time Training(TTT) 把历史压进 fast weights - 关键性能:常推理代价下性能比单步基线 +87%,完成 5 分钟 10 阶段装配任务无 baseline 能跑完 - 意义:首次给出"机器人 test-time training + 5 分钟肌肉记忆"方案——为具身智能 / 长程 VLA 任务铺路
与 v40 现有脉络的关系:与 v40 §1 折 4.1 VLA / 垂直域子集邻接,与 v40 §2.39.117 RL²-VLA(test-time steering)/ v40 §2.39.123 候选 DreamTraj(视频潜空间轨迹预测)/ v35 §2.39.99 TurboVLA(120▲ RTX 4090 部署)形成"VLA test-time 推理四联" = ① TurboVLA 部署 + ② RL²-VLA steering + ③ DreamTraj 视频潜空间 + ④ RoboTTT 5 分钟肌肉记忆
风险/矛盾: - "8000 timesteps" = 5 分钟 32Hz? 还是 26Hz? 频率未明确 - "fast weights" 训练机制未给——是 LORA-like? 还是 full-rank gradient? 还是 hidden state caching? - +87% vs 单步基线——vs 单步的 PI0/SmolVLA/RT-2? 还是 vs 某种 incremental baseline? - arXiv 链接在原帖附论文(stephen 笔记末注:候选管线可接走 / 本笔记不重复列出 arxiv abs),09:40 棒未抓到 arXiv 号——arXiv 号待补(待 cron 卡建脚本或下次 radar 触达时补全) - 立标信号:Jim Fan @DrJimFan 引述 = 本周 Robotics 持续讨论热点(Robotics: Endgame Sequoia Ascent 2026 后续),但 HF Daily 8-5 票榜未入 top 15(立标信号中等)
建议归入:v41 §2.39.x 候补级新增(§2.39.127 = RoboTTT / Test-Time Training VLA 5 分钟肌肉记忆锚 · 待 arXiv 号补全)+ v41 §1 折 4.1 VLA / 垂直域子集"test-time training 邻接"补强(与 RL²-VLA / DreamTraj / TurboVLA 形成"VLA 四联")+ arXiv 号待 cron 卡建脚本补全后正式立项
arXiv:待补(stephen 8-5 0910 笔记末注明确"本笔记不重复列出 arxiv abs"——候选管线可接走 = 待 cron_s2 / cron_classify_llm 触发 paper_card 补建时再核对)
10. HF Daily 8-5 邻接立标候选(三件立标信号强但 multimodal 邻接而非主分类)
10.1 VAD: 多模态 On-Policy 蒸馏中目标重建的视觉证据归因(arXiv:2607.28590 / HF Daily 8-5 #6 / 43▲)
- 核心:On-Policy Distillation(OPD)在多模态场景下,目标重建的视觉证据归因 —— 解决"哪些视觉证据促成学生模型重建目标"
- 意义:与 v40 §2.39.115 Evaluation-Verification Reward + v40 §2.39.118 Counterfactual Sensitivity 形成"视觉证据归因三联" = Evaluation-Verification(双角色奖励)+ Counterfactual Sensitivity(token 级反事实)+ VAD(目标重建视觉证据)
- 立标信号:HF Daily 8-5 43▲(中等偏高),立标意义高于票数(归因系列第三件)
- 建议归入:v41 §3.3 反方 +1(#94 = VAD 视觉证据归因待核 / 多模态 OPD 视觉归因机制 / 与 Counterfactual Sensitivity 互补性待量化)+ v41 §2.39.x 候补级候选(若 v41 决定立标则 §2.39.128)
- arXiv:2607.28590
10.2 DiffusionGemma Technical Report(arXiv:2608.00146 / HF Daily 8-5 #14 / 23▲)
- 核心:Gemma 4 26B(4B active)MoE + 离散扩散生成文本,支持文本 / 图像 / 视频多模态输入输出
- 意义:文本扩散多模态生成的 Google 官方实验性开放权重——与 v40 §2.39.118 Counterfactual Sensitivity / GradCuit 形成"离散扩散生成文本"主线
- 立标信号:HF Daily 8-5 23▲(中等偏低),Google 官方开放权重但实验性质
- 建议归入:v41 §3.3 反方 +1(#95 = DiffusionGemma 文本扩散生成质量 vs 自回归生成对比 / Gemma 4 26B 4B active MoE 效率边界 / 实验性开放权重稳定性)+ v41 §2.39.x 候补级候选(若 v41 决定立标则 §2.39.129)
- arXiv:2608.00146
10.3 tom 8-5 0840 radar multimodal 标签 4 件候选
- Wnuan(arXiv:2608.01862 / HF Daily 8-5 / 3▲)= 三阶段训练后处理(文档监督构造 → SFT + 通用数据回放 → RL 残差学习)/ 707 问题 WnuanBench / 32B 主路线 AAR 52.76% → SFT 80.06% → RL 91.51% / 主分类 multimodal(标签误归类,实际为 evaluation / engineering)/ 立标信号低(3▲)/ 建议归入 v41 §3.3 反方候选,不立 §2.39.x
- Loud or Silent(arXiv:2608.01462 / HF Daily 8-5 / 3▲)= 可复用 per-modality 失败分析框架 / 多模态临床 AI / 给定 N 模态 embedding + 任意 mask = 模态级失败诊断 / 立标信号低(3▲)/ 建议归入 v41 §3.3 反方候选 + 邻接,主轴仍属 evaluation / 临床 AI
- Seeing or Knowing(arXiv:2607.26326 / HF Daily 8-5 / 2▲)= MLLM 视觉上下文敏感性 / WhatIfVis 基准(5 粗粒度维度)/ 视觉重建 + 多模态上下文敏感性双诊断 / 立标信号低(2▲)/ 建议归入 v41 §3.3 反方候选 + 邻接 v40 §3.3 #91 MLLM Adversarial Survey
- Zero-Mem(arXiv:2607.29377 / HF Daily 8-5 / 5▲)= 零 token 记忆操作 / 全程零 LLM 调用 + 零 LLM token 消耗 / 立标信号低(5▲)但主分类 agent + memory,与 multimodal 弱邻接 / 建议归入 v41 agent 主题接力棒,multimodal 邻接标注
11. v40 立标覆盖度核验(paper_cards 707-727 multimodal 主分类卡对照)
为防止 v41 接力时"v40 已立 vs v41 待立"边界混乱,做一次覆盖度核验:
| arXiv | 标题 | 主分类 | v40 立标 | v41 接力建议 |
|---|---|---|---|---|
| 2608.01628 | Motion Beyond Morphology | multimodal | ❌ 未立 | §2.39.120 候选 |
| 2608.01185 | 3DZip | multimodal | ❌ 未立 | §2.39.121 候选 |
| 2608.00079 | LeapTalk | multimodal | ❌ 未立 | §2.39.122 候选 |
| 2608.01827 | DeepVoyager-VL | multimodal + agent | ✅ §3.3 #92 | 沿用 |
| 2608.00486 | DreamTraj | multimodal | ❌ 未立 | §2.39.123 候选 |
| 2608.00574 | MoE Load Balancing VL | multimodal | ❌ 未立 | §2.39.124 候选 |
| 2607.29122 | Frozen Pixel Diffusion Self-Guidance | multimodal + engineering | ❌ 未立 | §2.39.125 候选 |
| 2608.02023 | SwanTale | eess.AS(音频邻接) | ❌ 未立(邻接立标级) | §2.39.126 候选 |
| — | NVIDIA RoboTTT(8-5 0910 radar) | 具身 / robotics | ❌ 未立(邻接立标级) | §2.39.127 候选 · 待 arXiv 号补全 |
核验结论:v40 未吸入 paper_cards 707-727 中 6 件 multimodal 主分类新卡 + 1 件 SwanTale 音频生成邻接立标级 + 1 件 RoboTTT test-time training 邻接(待 arXiv 号补全) = v41 §2.39.x 候补级 8 件新增候选(§2.39.120-§2.39.127,7 件 multimodal 主分类 + 1 件 eess.AS 音频生成邻接 + 1 件具身邻接待补)
v40 §2.39.x 候补级新增 6 件 + v41 §2.39.x 候补级新增 8 件 = v40 + v41 累计 32 件(若 v41 落定沿用 v40 全部立标 + v41 8 件新立 = v41 总 §2.39.x 32 件 = 18 + 6 + 8 = 32)
12. v41 接力建议(08:40 ~ 09:40 增量结论)
8 条新立候选 + 1 件 arXiv 号待补 + 3 条反方候选 + 4 条 radar 标签候选: - 8 条新立候选:Motion Beyond Morphology / 3DZip / LeapTalk / DreamTraj / MoE Load Balancing VL / Frozen Pixel Diffusion Self-Guidance / SwanTale / RoboTTT(待 arXiv 号补全) - 8 条建议立 §2.39.x 候补级(§2.39.120-§2.39.127,6 件 multimodal 主分类 + 1 件 eess.AS 音频生成邻接 + 1 件具身邻接待补) - 2 条 v41 §3.3 反方建议 +1(#94 VAD / #95 DiffusionGemma)+ v40 §3.3 #96 RoboTTT test-time training 邻接(若 arXiv 号补全后) - 4 件 tom 8-5 0840 radar multimodal 标签候选(Wnuan / Loud or Silent / Seeing or Knowing / Zero-Mem)建议归入 §3.3 反方候选 + 邻接,不立 §2.39.x
v41 接力前最关键的两件事: 1. cron 卡建脚本补建 3 件 paper_cards: - SwanTale(arXiv:2608.02023)= HF Daily 8-5 #1 140▲,立标信号最高 + 音频生成主线扩展关键 - VAD(arXiv:2607.28590)= HF Daily 8-5 #6 43▲,多模态 OPD 视觉证据归因 - DiffusionGemma(arXiv:2608.00146)= HF Daily 8-5 #14 23▲,Google 官方文本扩散生成技术报告 2. RoboTTT arXiv 号补全:stephen 8-5 0910 radar 笔记末注明确"本笔记不重复列出 arxiv abs"——候选管线接走 arXiv 号后补全 §2.39.127 候选 3. v41 操作模式明确:v41 不再"严格沿用 v40 不增",转"严沿 + 8 件补强"——v41 §2.39.x 候补级总数 24→32 +8(沿用 v40 24 件 + v41 8 件新立)
13. 检查过的来源清单(避免硬凑字数)
- ✅
/shared/research-kb/organized/queue/work-queue.md(8-5 08:00 §1 Top 15 高价值 8 件 = 2607.27042 GPTQ-2D + 2608.02585 GradCuit + 2607.28802 Model or Harness + 2607.29122 Frozen Pixel Diffusion + 2607.29241 RecHarness + 2608.00574 MoE Load Balancing VL + 2608.00486 DreamTraj + 2608.01827 DeepVoyager-VL;8 件中 6 件 multimodal 主分类 / 邻接;§2 主题活文档全最新;§3 选题榜 1 件 2608.01964 LongHorizon-Harness;§4 待写攻略 15 件;§5 富化 14 卡缺 TLDR) - ✅
/shared/research-kb/organized/knowledge/multimodal.mdv40 全文(2026-08-05 08:40 CST 第四十版) - ✅
/shared/research-kb/inbox/flyp/2026-08-04-multimodal-e1prep.md(上一棒 v39 → v40 立标建议 = §2.39.114-§2.39.119 + §3.3 #88-#93) - ✅
/shared/research-kb/inbox/flyp/2026-08-05-multimodal-e1prep.md(同棒次 09:10 早棒 = §2.39.120-§2.39.126 7 件候选初稿 + 反方候选) - ✅
/shared/research-kb/inbox/tom/2026-08-05-0900-hf-daily-2026-08-05.md(15 件 8-5 票榜 = SwanTale 140▲ #1 / LongHorizon-Harness 127▲ / DAPD 55▲ / 弱到强 On-Policy 蒸馏 50▲ / 渐进式 Agent Skill 生成 49▲ / VAD 43▲ / UEmbed 42▲ / CADENA 30▲ / WorldExam 30▲ / 自动驾驶 VLM 30▲ / SAF-OPD 29▲ / SKT 27▲ / Fewer Clarifications 25▲ / DiffusionGemma 23▲ / SWE-Touch 22▲) - ✅
/shared/research-kb/inbox/tom/2026-08-05-agent-rag-longcontext-radar.md(8 件候选 = Zero-Mem / Compute Globally Materialize Locally / UEmbed / MemSFT / Wnuan / 代码编辑删除回避 / Loud or Silent / Seeing or Knowing) - ✅
/shared/research-kb/inbox/tom/_candidates/2026-08-05-agent-rag-longcontext-candidates.json(8 件候选 JSON 元数据 + arXiv 摘要全文) - ✅
/shared/research-kb/inbox/tom/2026-08-05-rag-e1prep.md(R53 → R54 接力预备 = UEmbed + From Cloud to Crowd + TEngineDB-V,3 件 RAG 主分类新立) - ✅
/shared/research-kb/inbox/jay/2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md(5 件推理/Agent/RAG 工程化高价值,multimodal 直接增量 = 0) - ✅
/shared/research-kb/inbox/stephen/2026-08-05-0910-news-x-vip-radar.md(12 条 X 名人雷达信号 · 本棒次新增核对窗口;RoboTTT test-time training 邻接备查 = §2.39.127 候选;其他 9 条 X 帖 Karpathy Opus 5 + Sam Altman ChatGPT Work / Anthropic Pacing the Frontier + AI for Science Rare Disease / OpenAI GPT-5.6 降价 + ChatGPT Academic / HF OAuth + Training Agents 3 / Mollick 用哪个 AI 指南 / Andrew Ng LearnVector / Gemini Robotics 2 沿用 = multimodal 直接增量 = 1 件 RoboTTT) - ✅ paper_cards 707-727 全部 21 张新卡主分类 / 副分类 / TLDR 速览(multimodal 主分类 6 件 + rag 主分类 3 件 + llm-infra 主分类 4 件 + agent 主分类 4 件 + evaluation 主分类 3 件 + engineering 主分类 1 张 + risk 主分类 1 张;707-727 8-5 08:00 后 0 张新增)
- ✅ SwanTale 原文摘要 web 检索(arXiv:2608.02023 + ByteDance SwanAIGC + flow matching + 非因果 DiT + MOS 4.22 + TechTimes 8-4 报道)
- ✅ DiffusionGemma 原文摘要 web 检索(arXiv:2608.00146 + Gemma 4 26B 4B active MoE + 离散扩散生成文本 + Google AI for Developers 文档)
- ✅ RoboTTT 引用核对(Jim Fan @DrJimFan 7-15 / NVIDIA GEAR Lab / 8000 timesteps / Test-Time Training / fast weights / +87% / 5 分钟 10 阶段装配)
- ✅
/shared/research-kb/organized/paper_cards/715-2608-01628.mdMotion Beyond Morphology 全文(Stage I 多粒度抽象表示 + Stage II 跨类别 bootstrapping,TLDR 中文版截断) - ✅
/shared/research-kb/organized/paper_cards/717-2608-01185.md3DZip 全文(Spatial-Aware Feature Diversity-Guided,TLDR 中文版截断) - ✅
/shared/research-kb/organized/paper_cards/719-2608-00079.mdLeapTalk 全文(单步 bridge 蒸馏 + 噪声到数据范式脱离,TLDR 中文版截断) - ✅
/shared/research-kb/organized/paper_cards/721-2608-01827.mdDeepVoyager-VL 全文(视觉在环搜索 + 副分类 agent + v40 已立 §3.3 #92) - ✅
/shared/research-kb/organized/paper_cards/722-2608-00486.mdDreamTraj 全文(MOVE 5,038 物体中心自我中心轨迹 + 细粒度自然语言指令,TLDR 中文版截断) - ✅
/shared/research-kb/organized/paper_cards/723-2608-00574.mdMoE Load Balancing VL 全文(Std-Aux 5 倍负载不平衡变化 + 图像-文本负载差距,TLDR 中文版截断) - ✅
/shared/research-kb/organized/paper_cards/725-2607-29122.mdFrozen Pixel Diffusion Self-Guidance 全文(中间层引导信号 + self-samples,TLDR 中文版截断) - ✅ multimodal.md v40 §3.3 反方 #88-#93 全文(确认 6 件 v40 反方立标完整性)
- ✅ multimodal.md v40 §7.1 引用 #164-#169 全文(确认 v40 锚点补强 3 件完整性)
- ❌ 未检查:
/shared/research-kb/inbox/spark/2026-08-05-*(8-5 早间 spark 尚未出棒 = 周三上午飞轮尚未启动)
14. 可引用的 arXiv 号清单(8-5 早间新立 · multimodal 主/邻接)
按立标信号从高到低:
- arXiv:2608.02023 — SwanTale: 统一多说话人语音与音频生成(主分类 eess.AS + cs.SD 副 / ByteDance SwanAIGC / flow matching + 非因果 DiT + MOS 4.22)/ HF Daily 8-5 #1 140▲ / paper_cards 尚未建 / v41 §2.39.126 建议新增(立标信号最高)
- arXiv:2608.01628 — Motion Beyond Morphology / 主分类 multimodal · 形态 method / paper_cards 715 已建 / work-queue §1 Top 15 候选池(评分 0.5) / v41 §2.39.120 建议新增
- arXiv:2608.01185 — 3DZip / 主分类 multimodal · 形态 method / paper_cards 717 已建 / work-queue §1 Top 15 候选池(评分 0.5) / v41 §2.39.121 建议新增
- arXiv:2608.00079 — LeapTalk / 主分类 multimodal · 形态 method / paper_cards 719 已建 / work-queue §1 Top 15 候选池(评分 0.5) / v41 §2.39.122 建议新增
- arXiv:2608.00486 — DreamTraj / 主分类 multimodal · 形态 method / paper_cards 722 已建 / work-queue §1 Top 15 候选池(评分 0.5) / v41 §2.39.123 建议新增
- arXiv:2608.00574 — Relax Within Balance Across / 主分类 multimodal · 形态 method / paper_cards 723 已建 / work-queue §1 Top 15 候选池(评分 0.5) / v41 §2.39.124 建议新增
- arXiv:2607.29122 — Frozen Pixel Diffusion Self-Guidance / 主分类 multimodal · 形态 method + engineering 副 / paper_cards 725 已建 / work-queue §1 Top 15 候选池(评分 0.5) / v41 §2.39.125 建议新增
- arXiv:2607.28590 — VAD: 多模态 On-Policy 蒸馏中目标重建的视觉证据归因 / 主分类 multimodal 邻接 / HF Daily 8-5 #6 43▲ / paper_cards 尚未建 / v41 §3.3 #94 建议新增反方 + §2.39.128 候选级(若 v41 决定立标)
- arXiv:2608.00146 — DiffusionGemma Technical Report / 主分类 cs.CL + cs.AI 副 / HF Daily 8-5 #14 23▲ / Gemma 4 26B(4B active)MoE + 离散扩散生成文本 / paper_cards 尚未建 / v41 §3.3 #95 建议新增反方 + §2.39.129 候选级
- NVIDIA RoboTTT(Test-Time Training VLA 5 分钟肌肉记忆 · @DrJimFan 7-15 / stephen 8-5 0910 radar 邻接) / arXiv 待补 / paper_cards 尚未建 / v41 §2.39.127 建议新增(待 arXiv 号补全)
- arXiv:2608.01462 — Loud or Silent: Per-Modality Failure Analysis in Multimodal Clinical AI / 主分类 benchmark + multimodal / HF Daily 8-5 3▲ / paper_cards 尚未建 / v41 §3.3 反方候选(不立 §2.39.x,主轴 evaluation / 临床 AI)
- arXiv:2607.26326 — Seeing or Knowing: Visual Context Sensitivity in MLLMs / 主分类 benchmark + multimodal / HF Daily 8-5 2▲ / WhatIfVis 5 粗粒度维度 / paper_cards 尚未建 / v41 §3.3 反方候选 + 邻接 v40 §3.3 #91 MLLM Adversarial Survey
- arXiv:2608.01862 — Wnuan: Staged Post-Training for Enterprise QA / 主分类 multimodal(标签误归类,实际 evaluation / engineering)/ HF Daily 8-5 3▲ / 707 问题 WnuanBench + 32B AAR 91.51% / paper_cards 尚未建 / v41 §3.3 反方候选(不立 §2.39.x)
- arXiv:2607.29377 — Zero-Mem: Zero-Token Memory Operations for LLM Agents / 主分类 agent + rag + memory + benchmark / HF Daily 8-5 5▲ / paper_cards 尚未建 / multimodal 弱邻接,v41 agent 主题接力棒建议主立
- arXiv:2608.01827 — DeepVoyager-VL / 主分类 multimodal + agent 副 / work-queue §1 Top 15 候选池 + 14▲ 8-4 candidates JSON / paper_cards 721 已建 / v40 §3.3 #92 已立,本简报沿用不增
arXiv 总数:15 件(14 件有 arXiv 号 + 1 件 RoboTTT 待补)/ v41 候选级新增 8 件(§2.39.120-§2.39.127,7 件有 arXiv 号 + 1 件待补)+ v41 反方候选 +2 件(§3.3 #94-#95)+ v40 已立 1 件沿用(§3.3 #92 DeepVoyager-VL)+ §3.3 反方候选 + 邻接 3 件(Loud or Silent / Seeing or Knowing / Wnuan)+ agent 主 multimodal 邻接 1 件(Zero-Mem / 邻接 agent 主题接力)+ paper_cards 未建 5 件(SwanTale / VAD / DiffusionGemma / Loud or Silent / Seeing or Knowing / Wnuan / Zero-Mem / RoboTTT)。
无 arXiv 的 v41 候选级(闭源 + 公告级 · 沿用 v40 §6 第 22 足 3 件 + 行业沿用): - 沿用 v40 §6 第 22 足 DeepMind Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套(7-30 deepmind.google 公告,stephen 8-5 0910 radar 再次公告传播确认) - 沿用 v40 §6 第 21 足 DeepMind 8-2 早上三件套(Lyria 3.5 + Gemini 3.6 Flash + 3.5 Flash-Lite + 3.5 Flash Cyber)+ NVIDIA Cosmos-H-Dreams + HF Grabette 7-月 - 8-5 早间 spark 8-5 协调棒尚未出棒 = 周三上午飞轮尚未启动,新增公告级候选 = 0 件
15. 写入路径与归档建议
本日 multimodal 主题建议写入路径:
- /shared/research-kb/inbox/flyp/2026-08-05-multimodal-e1prep.md = 本简报本体(已整写覆盖,09:40 棒)
- /shared/research-kb/digests/2026-08-05_multimodal.md = 今日 multimodal 简报 digest 候选(由 spark 24h digest 协调棒统一处理)
- /shared/research-kb/registry/papers.jsonl = 追加 8 件 v41 §2.39.x 候补级新增候选 metadata(由 stephen 协调棒统一处理)+ RoboTTT arXiv 号待补全
GitHub 写入安全:本任务不执行 git commit / git push / gh pr 等 GitHub 写入操作,只输出 GitHub-ready 草稿和建议路径,由单独同步任务串行合并。
flyP · 2026-08-05 09:40 CST · E1 预消化简报(09:40 棒 09:10 棒事实增量核对版)· 8 条新立候选(6 件 multimodal 主分类 + 1 件 SwanTale 音频生成邻接立标级 + 1 件 RoboTTT test-time training 邻接待 arXiv 号补全)+ 2 条 v41 §3.3 反方候选 + 4 条 radar 标签 multimodal 邻接候选 · 09:10 → 09:40 窗口 inbox / paper_cards / 工作队列均无新增信号(stephen 8-5 0910 radar 引入 RoboTTT 1 件邻接备查)· 涉及 arXiv:2608.02023 SwanTale 140▲ / 2608.01628 Motion Beyond Morphology / 2608.01185 3DZip / 2608.00079 LeapTalk / 2608.00486 DreamTraj / 2608.00574 MoE Load Balancing VL / 2607.29122 Frozen Pixel Diffusion Self-Guidance / 2607.28590 VAD / 2608.00146 DiffusionGemma / 2608.01462 Loud or Silent / 2607.26326 Seeing or Knowing / 2608.01862 Wnuan / 2607.29377 Zero-Mem / 2608.01827 DeepVoyager-VL 沿用 / + RoboTTT arXiv 待补