2026-09-23 周三多模态文献总结(flyP 周报)

今日主题

多模态:图像生成、视频生成、音频生成、视觉语言模型(VLM)、多模态推理与评估。

检索来源

  • arXiv cs.CV / cs.CL / cs.SD / cs.MM / cs.GR / eess.AS 过去一周列表(pastweek)
  • arXiv 单篇 abstract(2609.16572、2609.15863、2609.21455、2609.24362、2609.15128、2510.22200 等)
  • Hugging Face 论文页与 Papers-with-Code 提及
  • awesome-video-diffusions、Video-Generation-arxiv-daily 等维护列表
  • Substack 高价值 newsletter:The Living Edge(Philip Bankier)、Jakob Nielsen PhD 2026 预测、AI Weekly Tracker(multimodal tag)
  • AI Weekly 实时追踪页(multimodal news 标签)
  • ICML 2026 / ICLR 2026 / NeurIPS 2026 已接收论文集
  • 中文社区:知乎、Substack 中文转载、HyperAI 教程(非主源,仅用于线索)

新增候选概览(本周 arXiv 与公开资料,UTC 2026-09-14 → 2026-09-22)

ID 标题 类别 提交日期 备注
2609.16572 Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models image generation / systems 2026-09-15 无需训练、按 prompt 复杂度动态调度步数,COCO + DiffusionDB
2609.15863 LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows video generation / agent 2026-09-14 32B 共享 multimodal DiT + 27B Flash,单 H100 540p/22 帧 843ms / 377ms
2609.21455 CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation video generation / physics 2026-09-18 NeurIPS 2026 投稿,可一次示例适配月球重力
2609.24362 VLM-in-Sandbox: Visual Workspaces for Agentic Multimodal Reasoning VLM agent / systems 2026-09-22 training-free,sandbox 内多模态推理
2609.15128 Omni-Streaming Thinking VLM / streaming reasoning 2026-09-15 流式音视频推理,类型化验证 + 状态重写
2609.04031 DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation video generation / systems 2026-09 Wan2.1/2.2、CogVideoX1.5-5B 的 QAT
2609.08505 Temporal State Transport in Video Generation video generation / theory 2026-09 用谱分析诊断时序不均衡,τ≈0.2 稳定
2510.22200 LongCat-Video Technical Report video generation 2025-10(本周仍 Trending) 美团 13.6B DiT,720p/30fps,Block Sparse Attention + 粗到细
2505.00337 T2VPhysBench benchmark 2025-09 (ICLR 2026) 第一性原理物理一致性 benchmark
2605.15178 (引用) SANA-WM world model 2026 分钟级世界模型混合线性 DiT,被 SolarWM 等引用
OmniVChat Qwen3-Omni 系列新模块:原生音视频对话 audio-video 2026-09-21 HF 公布 native omni chat 任务/bench/RL recipe
Qwen3.8-Omni-Flash Qwen 1M context 全模态新版本 audio-video 2026-09 26%+ 平均提升,闭源分发

说明:表中 ID 为 arXiv 编号或公开代号;当前任务严格遵守“只摘要、不长引”,所有条目只做中文摘记与价值判断。

必读 3-5 篇

  1. CompAdapt(arXiv 2609.21455,HIT + Alibaba):提出“复合运动建模 + 一次示例适配”,在零样本(地球重力)→ 微调(月球重力)的迁移上稳定。可作为“physics-consistent T2V”方向 2026 年下半年代表工作;NeurIPS 2026 投稿,建议精读 + 复现消融。
  2. LynnReal-Omni(arXiv 2609.15863):32B 共享多模态 DiT,把 T2V / I2V / 参考引导 / 结构控制 / 编辑 / 退化修复 / 长视频 七个任务统一到同一 backbone,配合 27B Flash 子模型做实时。系统级贡献(数据管线 MSAVP 评测、VAE 解码加速)比模型结构更值得关注。
  3. Omni-Streaming Thinking(arXiv 2609.15128):流式音视频推理里的“视觉主导偏差”问题,给出类型化验证 + 依赖感知状态重写。在五个 streaming / audio-visual bench 上提升明显,对 RAG / 长视频 Agent 评估都有借鉴意义。
  4. Adaptive Step Schedule Controller(arXiv 2609.16572):纯推理调度优化,不改训练。提示“固定步数并非最优,prompt 复杂度驱动调度”,落地成本最低,可直接复用到自家 T2I 推理栈。
  5. LongCat-Video Technical Report(arXiv 2510.22200,本周仍 Trending):美团 LongCat 团队 13.6B DiT,多任务统一 + Block Sparse Attention + 粗到细 + GRPO。开源权重 + 推理脚本都已发,跟工业级 T2V 流水线对比值得做。

高价值技术文章

  • The Living Edge · Last Week in Multimodal AI #40(Substack,Philip Bankier):本周要点包括统一跨模态检索、模型自反馈训练、世界模拟器、LTX-2/Qwen3-VL/cbottle 等 GPU-poor 友好模型。属于高质量周更 newsletter,建议长期订阅作为线索源。
  • Substack · Multimodal AI News September 2026(blog.mean.ceo):对市场视角做了汇总,强调“从新奇走向业务栈”,但科研价值有限,仅作行业背景。
  • HyperAI 教程 · LongCat-Video:给出 num_frames / num_inference_steps / guidance_scale 等推理参数的经验值(480p 30fps / 720p 30fps),工程上可直接抄。
  • fal.ai LongCat-Video Prompt Guide:480p → 720p 的步数 / guidance 经验表。
  • Meta AI · Flow Matching Guide and Code(论文 + PyTorch 仓库):FM 综述与官方实现,新入门可作为配套资料。
  • Sander Dieleman · Generating music in the waveform domain:音频领域的经典博客,作为音频生成入门基线。
  • CSDN 暂未发现符合“必有命令、可复现”的高质量工程稿,本轮不收录。

分类标签

multimodal / video generation / image generation / audio generation / VLM / multimodal reasoning / evaluation / benchmark / physics-consistent / agent / systems / quantization / world model / survey / reproduction

是否建议精读 / 反方审稿 / 主题页更新

  • 建议精读:CompAdapt、Omni-Streaming Thinking、LongCat-Video Tech Report。
  • 建议作为反方审稿(看质疑点):
  • DSAQuant:用 QAT 解决视频扩散激活量化,作者只对比 Wan/CogVideoX 系列,建议同步测 SANA / HunyuanVideo / Mochi;
  • LynnReal-Omni 的 MSAVP 评测 100 prompt / 20 metric,规模小且与作者模型一同发布,需关注第三方独立复现;
  • Adaptive Step Schedule Controller 缺乏对 SDXL / Flux / SD3 等新一代 LDM/DiT 的对比。
  • 建议主题页更新:
  • “多模态世界模型 / 长视频”加入 SANA-WM、LongCat-Video、SolarWM;
  • “物理一致性 T2V”加入 T2VPhysBench(ICLR 2026)、PhyWorldBench、PhyGenBench 三套互补 benchmark;
  • “评估与基准”加入 Omni-Streaming Thinking、OmniPro、VS-Bench。

建议写入文件路径

  • 本周报草稿:/shared/research-kb/inbox/flyp/2026-09-23-multimodal-weekly-digest.md(即本文件)
  • 同步根路径:research-kb/digests/2026-09-23_multimodal.md(由同步任务统一合并)
  • 候选登记:research-kb/registry/papers.jsonl 追加下列行(不入 commit,由合并任务串行追加):
{"id":"2609.21455","title":"CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation","venue":"arXiv","date":"2026-09-18","tags":["video generation","physics-consistent","diffusion"],"note":"NeurIPS 2026 submission; one-shot reference adaptation"}
{"id":"2609.15863","title":"LynnReal-Omni","venue":"arXiv","date":"2026-09-14","tags":["video generation","agent","multimodal DiT"],"note":"32B + 27B Flash; 540p/22f 377ms on H100"}
{"id":"2609.15128","title":"Omni-Streaming Thinking","venue":"arXiv","date":"2026-09-15","tags":["VLM","audio-visual reasoning","streaming"],"note":"typed verification + dependency-aware state rewriting"}
{"id":"2609.16572","title":"Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models","venue":"arXiv","date":"2026-09-15","tags":["image generation","systems","diffusion"],"note":"training-free step schedule controller"}
{"id":"2609.24362","title":"VLM-in-Sandbox: Visual Workspaces for Agentic Multimodal Reasoning","venue":"arXiv","date":"2026-09-22","tags":["VLM","agent","systems"],"note":"training-free sandbox reasoning"}
{"id":"2609.04031","title":"DSAQuant","venue":"arXiv","date":"2026-09","tags":["video generation","quantization"],"note":"denoising-stage-aligned QAT"}
{"id":"2609.08505","title":"Temporal State Transport in Video Generation","venue":"arXiv","date":"2026-09","tags":["video generation","analysis"],"note":"spectral transport diagnostic"}
{"id":"2510.22200","title":"LongCat-Video Technical Report","venue":"arXiv","date":"2025-10","tags":["video generation","DiT","long video"],"note":"Meituan 13.6B, GRPO + Block Sparse Attention"}

待人工确认的问题

  1. LongCat-Video 与最新开源 T2V(Wan2.2、HunyuanVideo、Mochi 2)的客观 benchmark 对齐:是否需要单列对比表?
  2. CompAdapt 是否开源了训练/推理代码与 checkpoint?arXiv 摘要未注明,建议打开论文 + project page 后再决定“reproduction”标签。
  3. OmniVChat、Qwen3.8-Omni-Flash 是否对应 arXiv 论文?目前只见 HF / Hugging Face 公告,建议确认后再标 multimodal / audio-video 主线。
  4. 是否需要把“视频量化”与“视频步数调度”合并为“video inference efficiency”专题主题页?
  5. Substack 来源本周以 The Living Edge #40 为主,是否将 Suppress-Stack 类的 forecast(如 Jakob Nielsen)纳入季度回顾而非每周多模态?