flyP · 2026-07-01 多模态研究线索与待精读清单
本文件是 2026-07-01 周三多模态 digest 的配套 inbox 草稿,仅记录候选研究线索 / 待精读 / 待核验项。 主简报:
/shared/research-kb/digests/2026-07-01_multimodal.md本文件不复制论文原文,仅作链接、评价、待办、标签。
A. 优先精读队列(4 篇)
A1. DiffusionBench / NanoGen(arXiv:2606.24888, 2026-06-23)
- 作者:Xingjian Leng et al.(多家参与,摘要中未明确机构归属,需精读正文)
- 链接:arXiv:2606.24888 | HTML v1
- 会议:未注明接收会议(arXiv v1)
- 核心:DiT 评测应同时跑 ImageNet + T2I;NanoGen 单框架 12 行配置切换;21 个潜扩散模型;ImageNet FID 与 T2I 三种指标的 Pearson 相关 -0.38 ~ -0.58
- 标签:
#dit#benchmark#t2i#imagenet#holistic-eval#methodology - 价值判断:方法学改革,影响面 > 任何单一新模型
- 待精读补全:21 个模型完整名单、是否含 SD3 / Flux / Sana / PixArt、T2I 三种指标的具体身份(GenEval / DPG-Bench / T2I-CompBench?)、12 行配置切换的具体 snippet、NanoGen 框架 GitHub 链接
- 下游链接:LinkedIn 帖(10 小时训练 T2I 宣传)、alphaXiv 复现指南
A2. Orca: General World Foundation Model(arXiv:2606.30534, 2026-06-30)
- 作者:Yihao Wang, Yuheng Ji, Mingyu Cao … Pengwei Wang 等(多机构大团队)
- 链接:arXiv:2606.30534
- 核心:Next-State-Prediction 范式;125K 小时视频 + 160M 事件标注;unconscious(连续视频)+ conscious(语言描述)双训练;backbone 冻结 + 轻量模态解码器;三类 readout(文本生成 / 图像预测 / 具身动作)
- 标签:
#world-model#unified-latent#next-state-prediction#multi-task#frozen-backbone - 价值判断:世界模型赛道 2026 上半年的"标定"工作之一,需与世界模型主线(WorldArena、DrivePI-4D、RoboBrain、BabyVision)合流
- 待精读补全:backbone 是哪个(推测可能是 Qwen-VL 系或自研);160M 事件标注的来源;与 DrivePI-4D 在具身动作 readout 上的对比;ablation:backbone 冻结 vs 微调对三类 readout 的实际影响
A3. Do VLMs See or Guess?(arXiv:2606.10400, 2026-06-09)
- 作者:Pratham Singla et al.
- 链接:arXiv:2606.10400 | HTML v1
- 会议:Submitted to EMNLP 2026
- 核心:540 图 × 6 类 × 4 问法变体,控制措辞;最难关上 11 个 VLM 全退步;no-image ablation 把开源模型压到 1-9% 文本基线;GRPO 后训练部分缓解且 OOD 迁移
- 标签:
#vlm-eval#textual-prior#no-image-ablation#grpo#controlled-comparison - 价值判断:与 CrossMath、CoT-degrades-visual-spatial 同族,应归并到我已经在 06-29 末班车做的"VLM 文本先验专题",不另起一篇独立精读,而是补充内容到已有主线
- 待精读补全:4 问法变体的具体措辞(尤其"hardest"如何从图直接生成);11 个 VLM 的具体名单与版本;6 类推理的具体覆盖域
A4. MAVIN: Multi-shot Audio-Visual Generation with Narrative Control(arXiv:2606.29473, 2026-06-29)
- 作者:Kaiqi Liu, Yunyao Mao, Ziqi Cai 等(含 Peking U / Kuaishou / ByteDance)
- 链接:arXiv:2606.29473 | HTML v1
- 核心:boundary-aware attention + ID-aware propagation + 多 agent script pipeline;MAVINSet 数据集;SOTA
- 标签:
#audio-visual#multi-shot#narrative#multi-agent#dataset - 价值判断:第一个多镜头视听叙事统一生成框架;视频 + 音频 + 脚本三向交叉;可作为"专业影视工作流 AI 化"标志性工作
- 待精读补全:boundary-aware attention 的具体实现(如何在 cross-frame attention 中区分镜头边界);ID-aware 嵌入的训练目标;多 agent 脚本 pipeline 的工程实现
B. 次优先 / 待核验
B1. Mural: LLM 知识迁移到 T2I via MoT(arXiv:2606.29013, 2026-06-28)
- 核心:Mixture-of-Transformers + 冻结 reasoning LLM,共享 attention;GenEval 0.85 / DPG 86.75 / WISE 0.66
- 链接:arXiv:2606.29013
- 标签:
#unified-mllm#mixture-of-transformers#llm-knowledge-transfer - 待核验:冻结 LLM 是哪一款(是否复用 Qwen2.5 / Qwen3);MoT 中的 attention 共享具体哪些层;"世界知识驱动生成"具体如何量化
B2. Obliviate: AR 图像生成概念擦除(arXiv:2606.28643, 2026-06-28)
- 作者:Hossein Shakibania, Jonas Henry Grebe 等(含 TU Darmstadt / MARUM)
- 链接:arXiv:2606.28643
- 核心:KL + trajectory-level + aligned prefix 三件套;RAB nudity 91.58 → 3.15;覆盖 Liquid / Emu3-Gen / Janus-Pro
- 标签:
#safety#ar-image-gen#concept-erasure - 待核验:轨迹级更新的训练成本(trajectory 长度、GPU 时长);"模型实用性"如何量化(哪个基准 / 哪个 metric)
B3. SAFE-DiT(arXiv:2606.29360, 2026-06-29)
- 作者:含 Xuanhua Yin(疑为原作者)
- 链接:arXiv:2606.29360 | Code
- 核心:揭示 MIDT 4.1×~5.8× slowdown;SAFE-Core + SAFE-DiT+SW 两档;1024² 上 2.69× 加速、2560² 上 5.09×、3072² 可行;94.1GB → 27.9GB 显存
- 标签:
#dit-systems#inference#flashattention#engineering - CSDN 等价收录候选:必须先看 repo 实际跑通,再决定是否写工程实践分享
B4. EcoVideo(arXiv:2606.30557, 2026-06-30)
- 作者:Jiayu Chen, Hengyi Zhang 等(含 Peking U)
- 链接:arXiv:2606.30557 | Code
- 核心:早期 attention 熵估信息密度 → 高熵关键帧云端去噪 → 边端运动插值;带宽 / 算力受限场景 2.9× 端到端加速
- 标签:
#video-gen#cloud-edge#systems - 待核验:在什么 DiT base(猜测 Wan2.2 / CogVideoX / Cosmos)上验证;edge 模型的参数量;端到端延迟的硬件设置
B5. Goku / Goku-Edit(arXiv:2606.30599, 2026-06-30)
- 作者:Sen Liang, Cong Wang, Zhentao Yu 等(多机构)
- 链接:arXiv:2606.30599
- 核心:200 万对指令式视频编辑数据;双分支(mask + appearance);Goku-Bench 1000 例 + 7 个评测指标;指令跟随相对开源 +8%
- 标签:
#video-editing#dataset#mllm-encoder - 待核验:200 万对数据的来源(自采 vs 复用)、合规性(是否含版权视频);双分支的架构图与训练 loss
B6. Orca / PhysisForcing / CrashTwin / Weather(三联世界模型)
- CrashTwin(arXiv:2606.28757)—— 多智能体碰撞物理可信度
- PhysisForcing(arXiv:2606.28128)—— 具身视频生成的物理一致性;Wan2.2-I2V-A14B +22.3%、closed-loop 16%→24%
- Weather(arXiv:2606.29020)—— 语义 + 物理 + 几何三因子 weather synthesis
- 共同主题:物理一致性是世界模型落地的硬瓶颈;建议合并入"世界模型 + 物理"子专题
B7. Audio 系列
- Audio-Oscar(arXiv:2606.07397)—— 多 agent 复杂音频场景生成 + ASG-Bench
- Omni2Sound(CVPR 2026 OpenAccess)—— 统一视频-文本到音频
- Audio Editing Survey(arXiv:2606.23139)—— 音频编辑 foundation model 综述
- Continuous Audio Thinking for LALMs(arXiv:2606.18273)—— 大音频语言模型的 continuous thinking
B8. Substack — Cameron R. Wolfe: Vision Large Language Models (vLLMs)(2026 年)
- 链接:Deep (Learning) Focus
- 作者:Cameron R. Wolfe, Ph.D.
- 核心:vision encoder(ViT-H/630M 参,2.5B 图文对 contrastive 预训练)+ image adapter 两阶段训练 + decoder-only LLM;附 LLaMA-3.2 Vision 案例拆解
- 标签:
#vllm#survey#tutorial#llama-3.2-vision - 用途:内部培训素材;建议保留链接与目录摘要,不复制原文长段
- 对应规则:Substack 内容只作研究线索 / 摘要 / 引用 / 后续行动建议;不复制长段
C. VLM 评估侧线
- VS-Bench(vs-bench.github.io)—— CVPR 2026 多智能体战略环境 VLM 评测,15 个 VLM;最佳 46.6% 预测 / 31.4% return
- Almieyar-Oryx-BloomBench(arXiv:2606.05531)—— 双语多模态认知推理分级评测
- Dynamic Human Preferences(arXiv:2606.07653)—— 上下文动态偏好 VLM 评测
- r/LocalLLaMA 视觉基准第二轮(2026-06-21):Qwen3-VL 8B @ Q8 第一(75.5/100,4-8 GB 档),Qwen3.6 35B-A3B 与 Gemma 4 26B-A4B 并列 Excellent 段
- VLM-RobustBench / ParseBench / OneIG-Bench:鲁棒性 / 文档解析 / 全维度图像评测
D. 待人工确认 / 待后续 cron 复核
- arXiv 2606 子路径(
/list/cs.CV/2026-06-30)返回 400 → 改用 aha-time 日榜 + arXiv search 兜底 - DiffusionBench 21 个模型完整名单 → 需精读正文表 1
- Orca backbone 身份 → 需精读正文方法节
- Substack Cameron Wolfe 长文是否允许直接摘要 + 图示引用 → 待 Anan 确认收录原则
- LocalLLaMA 基准稳定性 → 下次 cron 复核是否仍第一
- 是否要把"世界模型 + 物理"合并成专题页(CrashTwin / PhysisForcing / Weather 三联) → 待 Anan 确认合并粒度
E. 跨实例去重 + 同步状态
- 与 jay / spark / stephen / tom 目录无主题冲突
- 与 flyP 自身 06-27~06-30 已落地的精读(AgentRx / CrossMath / CoffeeBench / PaperMind)主题互补、不重叠
- 上期
2026-06-17-multimodal-weekly-digest.md已覆盖条目本期未重复(UniCanvas / UniDDT / Real-Time Streamable Talking Portrait / FineSightBench / AudioX-Turbo / Kimi K2.6 等)
维护说明:本文件只在 cron 触发日更新;下次更新 = 下周三(2026-07-08)。 若 A 节任意一项在两日内未被精读,应在下次 cron 时降级为 B 节或剔除。