2026-09-23 周三多模态文献总结(flyP 周报)
今日主题
多模态:图像生成、视频生成、音频生成、视觉语言模型(VLM)、多模态推理与评估。
检索来源
- arXiv cs.CV / cs.CL / cs.SD / cs.MM / cs.GR / eess.AS 过去一周列表(pastweek)
- arXiv 单篇 abstract(2609.16572、2609.15863、2609.21455、2609.24362、2609.15128、2510.22200 等)
- Hugging Face 论文页与 Papers-with-Code 提及
- awesome-video-diffusions、Video-Generation-arxiv-daily 等维护列表
- Substack 高价值 newsletter:The Living Edge(Philip Bankier)、Jakob Nielsen PhD 2026 预测、AI Weekly Tracker(multimodal tag)
- AI Weekly 实时追踪页(multimodal news 标签)
- ICML 2026 / ICLR 2026 / NeurIPS 2026 已接收论文集
- 中文社区:知乎、Substack 中文转载、HyperAI 教程(非主源,仅用于线索)
新增候选概览(本周 arXiv 与公开资料,UTC 2026-09-14 → 2026-09-22)
| ID | 标题 | 类别 | 提交日期 | 备注 |
|---|---|---|---|---|
| 2609.16572 | Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models | image generation / systems | 2026-09-15 | 无需训练、按 prompt 复杂度动态调度步数,COCO + DiffusionDB |
| 2609.15863 | LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows | video generation / agent | 2026-09-14 | 32B 共享 multimodal DiT + 27B Flash,单 H100 540p/22 帧 843ms / 377ms |
| 2609.21455 | CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation | video generation / physics | 2026-09-18 | NeurIPS 2026 投稿,可一次示例适配月球重力 |
| 2609.24362 | VLM-in-Sandbox: Visual Workspaces for Agentic Multimodal Reasoning | VLM agent / systems | 2026-09-22 | training-free,sandbox 内多模态推理 |
| 2609.15128 | Omni-Streaming Thinking | VLM / streaming reasoning | 2026-09-15 | 流式音视频推理,类型化验证 + 状态重写 |
| 2609.04031 | DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation | video generation / systems | 2026-09 | Wan2.1/2.2、CogVideoX1.5-5B 的 QAT |
| 2609.08505 | Temporal State Transport in Video Generation | video generation / theory | 2026-09 | 用谱分析诊断时序不均衡,τ≈0.2 稳定 |
| 2510.22200 | LongCat-Video Technical Report | video generation | 2025-10(本周仍 Trending) | 美团 13.6B DiT,720p/30fps,Block Sparse Attention + 粗到细 |
| 2505.00337 | T2VPhysBench | benchmark | 2025-09 (ICLR 2026) | 第一性原理物理一致性 benchmark |
| 2605.15178 (引用) | SANA-WM | world model | 2026 | 分钟级世界模型混合线性 DiT,被 SolarWM 等引用 |
| OmniVChat | Qwen3-Omni 系列新模块:原生音视频对话 | audio-video | 2026-09-21 | HF 公布 native omni chat 任务/bench/RL recipe |
| Qwen3.8-Omni-Flash | Qwen 1M context 全模态新版本 | audio-video | 2026-09 | 26%+ 平均提升,闭源分发 |
说明:表中 ID 为 arXiv 编号或公开代号;当前任务严格遵守“只摘要、不长引”,所有条目只做中文摘记与价值判断。
必读 3-5 篇
- CompAdapt(arXiv 2609.21455,HIT + Alibaba):提出“复合运动建模 + 一次示例适配”,在零样本(地球重力)→ 微调(月球重力)的迁移上稳定。可作为“physics-consistent T2V”方向 2026 年下半年代表工作;NeurIPS 2026 投稿,建议精读 + 复现消融。
- LynnReal-Omni(arXiv 2609.15863):32B 共享多模态 DiT,把 T2V / I2V / 参考引导 / 结构控制 / 编辑 / 退化修复 / 长视频 七个任务统一到同一 backbone,配合 27B Flash 子模型做实时。系统级贡献(数据管线 MSAVP 评测、VAE 解码加速)比模型结构更值得关注。
- Omni-Streaming Thinking(arXiv 2609.15128):流式音视频推理里的“视觉主导偏差”问题,给出类型化验证 + 依赖感知状态重写。在五个 streaming / audio-visual bench 上提升明显,对 RAG / 长视频 Agent 评估都有借鉴意义。
- Adaptive Step Schedule Controller(arXiv 2609.16572):纯推理调度优化,不改训练。提示“固定步数并非最优,prompt 复杂度驱动调度”,落地成本最低,可直接复用到自家 T2I 推理栈。
- LongCat-Video Technical Report(arXiv 2510.22200,本周仍 Trending):美团 LongCat 团队 13.6B DiT,多任务统一 + Block Sparse Attention + 粗到细 + GRPO。开源权重 + 推理脚本都已发,跟工业级 T2V 流水线对比值得做。
高价值技术文章
- The Living Edge · Last Week in Multimodal AI #40(Substack,Philip Bankier):本周要点包括统一跨模态检索、模型自反馈训练、世界模拟器、LTX-2/Qwen3-VL/cbottle 等 GPU-poor 友好模型。属于高质量周更 newsletter,建议长期订阅作为线索源。
- Substack · Multimodal AI News September 2026(blog.mean.ceo):对市场视角做了汇总,强调“从新奇走向业务栈”,但科研价值有限,仅作行业背景。
- HyperAI 教程 · LongCat-Video:给出 num_frames / num_inference_steps / guidance_scale 等推理参数的经验值(480p 30fps / 720p 30fps),工程上可直接抄。
- fal.ai LongCat-Video Prompt Guide:480p → 720p 的步数 / guidance 经验表。
- Meta AI · Flow Matching Guide and Code(论文 + PyTorch 仓库):FM 综述与官方实现,新入门可作为配套资料。
- Sander Dieleman · Generating music in the waveform domain:音频领域的经典博客,作为音频生成入门基线。
- CSDN 暂未发现符合“必有命令、可复现”的高质量工程稿,本轮不收录。
分类标签
multimodal / video generation / image generation / audio generation / VLM / multimodal reasoning / evaluation / benchmark / physics-consistent / agent / systems / quantization / world model / survey / reproduction
是否建议精读 / 反方审稿 / 主题页更新
- 建议精读:CompAdapt、Omni-Streaming Thinking、LongCat-Video Tech Report。
- 建议作为反方审稿(看质疑点):
- DSAQuant:用 QAT 解决视频扩散激活量化,作者只对比 Wan/CogVideoX 系列,建议同步测 SANA / HunyuanVideo / Mochi;
- LynnReal-Omni 的 MSAVP 评测 100 prompt / 20 metric,规模小且与作者模型一同发布,需关注第三方独立复现;
- Adaptive Step Schedule Controller 缺乏对 SDXL / Flux / SD3 等新一代 LDM/DiT 的对比。
- 建议主题页更新:
- “多模态世界模型 / 长视频”加入 SANA-WM、LongCat-Video、SolarWM;
- “物理一致性 T2V”加入 T2VPhysBench(ICLR 2026)、PhyWorldBench、PhyGenBench 三套互补 benchmark;
- “评估与基准”加入 Omni-Streaming Thinking、OmniPro、VS-Bench。
建议写入文件路径
- 本周报草稿:
/shared/research-kb/inbox/flyp/2026-09-23-multimodal-weekly-digest.md(即本文件) - 同步根路径:
research-kb/digests/2026-09-23_multimodal.md(由同步任务统一合并) - 候选登记:
research-kb/registry/papers.jsonl追加下列行(不入 commit,由合并任务串行追加):
{"id":"2609.21455","title":"CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation","venue":"arXiv","date":"2026-09-18","tags":["video generation","physics-consistent","diffusion"],"note":"NeurIPS 2026 submission; one-shot reference adaptation"}
{"id":"2609.15863","title":"LynnReal-Omni","venue":"arXiv","date":"2026-09-14","tags":["video generation","agent","multimodal DiT"],"note":"32B + 27B Flash; 540p/22f 377ms on H100"}
{"id":"2609.15128","title":"Omni-Streaming Thinking","venue":"arXiv","date":"2026-09-15","tags":["VLM","audio-visual reasoning","streaming"],"note":"typed verification + dependency-aware state rewriting"}
{"id":"2609.16572","title":"Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models","venue":"arXiv","date":"2026-09-15","tags":["image generation","systems","diffusion"],"note":"training-free step schedule controller"}
{"id":"2609.24362","title":"VLM-in-Sandbox: Visual Workspaces for Agentic Multimodal Reasoning","venue":"arXiv","date":"2026-09-22","tags":["VLM","agent","systems"],"note":"training-free sandbox reasoning"}
{"id":"2609.04031","title":"DSAQuant","venue":"arXiv","date":"2026-09","tags":["video generation","quantization"],"note":"denoising-stage-aligned QAT"}
{"id":"2609.08505","title":"Temporal State Transport in Video Generation","venue":"arXiv","date":"2026-09","tags":["video generation","analysis"],"note":"spectral transport diagnostic"}
{"id":"2510.22200","title":"LongCat-Video Technical Report","venue":"arXiv","date":"2025-10","tags":["video generation","DiT","long video"],"note":"Meituan 13.6B, GRPO + Block Sparse Attention"}
待人工确认的问题
- LongCat-Video 与最新开源 T2V(Wan2.2、HunyuanVideo、Mochi 2)的客观 benchmark 对齐:是否需要单列对比表?
- CompAdapt 是否开源了训练/推理代码与 checkpoint?arXiv 摘要未注明,建议打开论文 + project page 后再决定“reproduction”标签。
- OmniVChat、Qwen3.8-Omni-Flash 是否对应 arXiv 论文?目前只见 HF / Hugging Face 公告,建议确认后再标 multimodal / audio-video 主线。
- 是否需要把“视频量化”与“视频步数调度”合并为“video inference efficiency”专题主题页?
- Substack 来源本周以 The Living Edge #40 为主,是否将 Suppress-Stack 类的 forecast(如 Jakob Nielsen)纳入季度回顾而非每周多模态?