flyP · 2026-07-01 多模态研究线索与待精读清单

本文件是 2026-07-01 周三多模态 digest 的配套 inbox 草稿,仅记录候选研究线索 / 待精读 / 待核验项。 主简报:/shared/research-kb/digests/2026-07-01_multimodal.md 本文件不复制论文原文,仅作链接、评价、待办、标签。


A. 优先精读队列(4 篇)

A1. DiffusionBench / NanoGen(arXiv:2606.24888, 2026-06-23)

  • 作者:Xingjian Leng et al.(多家参与,摘要中未明确机构归属,需精读正文)
  • 链接arXiv:2606.24888HTML v1
  • 会议:未注明接收会议(arXiv v1)
  • 核心:DiT 评测应同时跑 ImageNet + T2I;NanoGen 单框架 12 行配置切换;21 个潜扩散模型;ImageNet FID 与 T2I 三种指标的 Pearson 相关 -0.38 ~ -0.58
  • 标签#dit #benchmark #t2i #imagenet #holistic-eval #methodology
  • 价值判断:方法学改革,影响面 > 任何单一新模型
  • 待精读补全:21 个模型完整名单、是否含 SD3 / Flux / Sana / PixArt、T2I 三种指标的具体身份(GenEval / DPG-Bench / T2I-CompBench?)、12 行配置切换的具体 snippet、NanoGen 框架 GitHub 链接
  • 下游链接LinkedIn 帖(10 小时训练 T2I 宣传)、alphaXiv 复现指南

A2. Orca: General World Foundation Model(arXiv:2606.30534, 2026-06-30)

  • 作者:Yihao Wang, Yuheng Ji, Mingyu Cao … Pengwei Wang 等(多机构大团队)
  • 链接arXiv:2606.30534
  • 核心:Next-State-Prediction 范式;125K 小时视频 + 160M 事件标注;unconscious(连续视频)+ conscious(语言描述)双训练;backbone 冻结 + 轻量模态解码器;三类 readout(文本生成 / 图像预测 / 具身动作)
  • 标签#world-model #unified-latent #next-state-prediction #multi-task #frozen-backbone
  • 价值判断:世界模型赛道 2026 上半年的"标定"工作之一,需与世界模型主线(WorldArena、DrivePI-4D、RoboBrain、BabyVision)合流
  • 待精读补全:backbone 是哪个(推测可能是 Qwen-VL 系或自研);160M 事件标注的来源;与 DrivePI-4D 在具身动作 readout 上的对比;ablation:backbone 冻结 vs 微调对三类 readout 的实际影响

A3. Do VLMs See or Guess?(arXiv:2606.10400, 2026-06-09)

  • 作者:Pratham Singla et al.
  • 链接arXiv:2606.10400HTML v1
  • 会议:Submitted to EMNLP 2026
  • 核心:540 图 × 6 类 × 4 问法变体,控制措辞;最难关上 11 个 VLM 全退步;no-image ablation 把开源模型压到 1-9% 文本基线;GRPO 后训练部分缓解且 OOD 迁移
  • 标签#vlm-eval #textual-prior #no-image-ablation #grpo #controlled-comparison
  • 价值判断:与 CrossMath、CoT-degrades-visual-spatial 同族,应归并到我已经在 06-29 末班车做的"VLM 文本先验专题",不另起一篇独立精读,而是补充内容到已有主线
  • 待精读补全:4 问法变体的具体措辞(尤其"hardest"如何从图直接生成);11 个 VLM 的具体名单与版本;6 类推理的具体覆盖域

A4. MAVIN: Multi-shot Audio-Visual Generation with Narrative Control(arXiv:2606.29473, 2026-06-29)

  • 作者:Kaiqi Liu, Yunyao Mao, Ziqi Cai 等(含 Peking U / Kuaishou / ByteDance)
  • 链接arXiv:2606.29473HTML v1
  • 核心:boundary-aware attention + ID-aware propagation + 多 agent script pipeline;MAVINSet 数据集;SOTA
  • 标签#audio-visual #multi-shot #narrative #multi-agent #dataset
  • 价值判断:第一个多镜头视听叙事统一生成框架;视频 + 音频 + 脚本三向交叉;可作为"专业影视工作流 AI 化"标志性工作
  • 待精读补全:boundary-aware attention 的具体实现(如何在 cross-frame attention 中区分镜头边界);ID-aware 嵌入的训练目标;多 agent 脚本 pipeline 的工程实现

B. 次优先 / 待核验

B1. Mural: LLM 知识迁移到 T2I via MoT(arXiv:2606.29013, 2026-06-28)

  • 核心:Mixture-of-Transformers + 冻结 reasoning LLM,共享 attention;GenEval 0.85 / DPG 86.75 / WISE 0.66
  • 链接arXiv:2606.29013
  • 标签#unified-mllm #mixture-of-transformers #llm-knowledge-transfer
  • 待核验:冻结 LLM 是哪一款(是否复用 Qwen2.5 / Qwen3);MoT 中的 attention 共享具体哪些层;"世界知识驱动生成"具体如何量化

B2. Obliviate: AR 图像生成概念擦除(arXiv:2606.28643, 2026-06-28)

  • 作者:Hossein Shakibania, Jonas Henry Grebe 等(含 TU Darmstadt / MARUM)
  • 链接arXiv:2606.28643
  • 核心:KL + trajectory-level + aligned prefix 三件套;RAB nudity 91.58 → 3.15;覆盖 Liquid / Emu3-Gen / Janus-Pro
  • 标签#safety #ar-image-gen #concept-erasure
  • 待核验:轨迹级更新的训练成本(trajectory 长度、GPU 时长);"模型实用性"如何量化(哪个基准 / 哪个 metric)

B3. SAFE-DiT(arXiv:2606.29360, 2026-06-29)

  • 作者:含 Xuanhua Yin(疑为原作者)
  • 链接arXiv:2606.29360Code
  • 核心:揭示 MIDT 4.1×~5.8× slowdown;SAFE-Core + SAFE-DiT+SW 两档;1024² 上 2.69× 加速、2560² 上 5.09×、3072² 可行;94.1GB → 27.9GB 显存
  • 标签#dit-systems #inference #flashattention #engineering
  • CSDN 等价收录候选:必须先看 repo 实际跑通,再决定是否写工程实践分享

B4. EcoVideo(arXiv:2606.30557, 2026-06-30)

  • 作者:Jiayu Chen, Hengyi Zhang 等(含 Peking U)
  • 链接arXiv:2606.30557Code
  • 核心:早期 attention 熵估信息密度 → 高熵关键帧云端去噪 → 边端运动插值;带宽 / 算力受限场景 2.9× 端到端加速
  • 标签#video-gen #cloud-edge #systems
  • 待核验:在什么 DiT base(猜测 Wan2.2 / CogVideoX / Cosmos)上验证;edge 模型的参数量;端到端延迟的硬件设置

B5. Goku / Goku-Edit(arXiv:2606.30599, 2026-06-30)

  • 作者:Sen Liang, Cong Wang, Zhentao Yu 等(多机构)
  • 链接arXiv:2606.30599
  • 核心:200 万对指令式视频编辑数据;双分支(mask + appearance);Goku-Bench 1000 例 + 7 个评测指标;指令跟随相对开源 +8%
  • 标签#video-editing #dataset #mllm-encoder
  • 待核验:200 万对数据的来源(自采 vs 复用)、合规性(是否含版权视频);双分支的架构图与训练 loss

B6. Orca / PhysisForcing / CrashTwin / Weather(三联世界模型)

  • CrashTwin(arXiv:2606.28757)—— 多智能体碰撞物理可信度
  • PhysisForcing(arXiv:2606.28128)—— 具身视频生成的物理一致性;Wan2.2-I2V-A14B +22.3%、closed-loop 16%→24%
  • Weather(arXiv:2606.29020)—— 语义 + 物理 + 几何三因子 weather synthesis
  • 共同主题:物理一致性是世界模型落地的硬瓶颈;建议合并入"世界模型 + 物理"子专题

B7. Audio 系列

  • Audio-Oscar(arXiv:2606.07397)—— 多 agent 复杂音频场景生成 + ASG-Bench
  • Omni2Sound(CVPR 2026 OpenAccess)—— 统一视频-文本到音频
  • Audio Editing Survey(arXiv:2606.23139)—— 音频编辑 foundation model 综述
  • Continuous Audio Thinking for LALMs(arXiv:2606.18273)—— 大音频语言模型的 continuous thinking

B8. Substack — Cameron R. Wolfe: Vision Large Language Models (vLLMs)(2026 年)

  • 链接Deep (Learning) Focus
  • 作者:Cameron R. Wolfe, Ph.D.
  • 核心:vision encoder(ViT-H/630M 参,2.5B 图文对 contrastive 预训练)+ image adapter 两阶段训练 + decoder-only LLM;附 LLaMA-3.2 Vision 案例拆解
  • 标签#vllm #survey #tutorial #llama-3.2-vision
  • 用途:内部培训素材;建议保留链接与目录摘要,不复制原文长段
  • 对应规则:Substack 内容只作研究线索 / 摘要 / 引用 / 后续行动建议;不复制长段

C. VLM 评估侧线

  • VS-Bench(vs-bench.github.io)—— CVPR 2026 多智能体战略环境 VLM 评测,15 个 VLM;最佳 46.6% 预测 / 31.4% return
  • Almieyar-Oryx-BloomBench(arXiv:2606.05531)—— 双语多模态认知推理分级评测
  • Dynamic Human Preferences(arXiv:2606.07653)—— 上下文动态偏好 VLM 评测
  • r/LocalLLaMA 视觉基准第二轮(2026-06-21):Qwen3-VL 8B @ Q8 第一(75.5/100,4-8 GB 档),Qwen3.6 35B-A3B 与 Gemma 4 26B-A4B 并列 Excellent 段
  • VLM-RobustBench / ParseBench / OneIG-Bench:鲁棒性 / 文档解析 / 全维度图像评测

D. 待人工确认 / 待后续 cron 复核

  1. arXiv 2606 子路径(/list/cs.CV/2026-06-30)返回 400 → 改用 aha-time 日榜 + arXiv search 兜底
  2. DiffusionBench 21 个模型完整名单 → 需精读正文表 1
  3. Orca backbone 身份 → 需精读正文方法节
  4. Substack Cameron Wolfe 长文是否允许直接摘要 + 图示引用 → 待 Anan 确认收录原则
  5. LocalLLaMA 基准稳定性 → 下次 cron 复核是否仍第一
  6. 是否要把"世界模型 + 物理"合并成专题页(CrashTwin / PhysisForcing / Weather 三联) → 待 Anan 确认合并粒度

E. 跨实例去重 + 同步状态

  • 与 jay / spark / stephen / tom 目录无主题冲突
  • 与 flyP 自身 06-27~06-30 已落地的精读(AgentRx / CrossMath / CoffeeBench / PaperMind)主题互补、不重叠
  • 上期 2026-06-17-multimodal-weekly-digest.md 已覆盖条目本期未重复(UniCanvas / UniDDT / Real-Time Streamable Talking Portrait / FineSightBench / AudioX-Turbo / Kimi K2.6 等)

维护说明:本文件只在 cron 触发日更新;下次更新 = 下周三(2026-07-08)。 若 A 节任意一项在两日内未被精读,应在下次 cron 时降级为 B 节或剔除。