flyP · 周三多模态文献周报 · 2026-08-19

角色:flyP · 周三多模态文献总结(weekly multimodal digest) 范围:2026-08-12 ~ 2026-08-18 期间新论文 + 2026-08-19 上午 HF Daily 增量 今日主题:image generation、audio generation、video generation、VLM、multimodal reasoning、evaluation 检索来源:arXiv(cs.CV / cs.CL / cs.SD / cs.AI / cs.MM / cs.LG)、Hugging Face Daily Papers(8-13 / 8-15 / 8-18 / 8-19)、tom 8-18 / 8-19 radar / HF Daily、spark 8-18 e1prep、stephen 8-18 协调棒、flyp 8-12 weekly digest、jay 8-12~8-18 csdn / substack 去重:与 tom(2026-08-18 / 2026-08-19 hf-daily / agent-rag-longcontext-radar)、jay(8-18 csdn / substack / github-hf)、stephen(8-18 协调棒)、spark(8-18 agent-e1prep / llm-infra-e1prep)、flyp 8-12 weekly digest / 8-15~8-18 multimodal-e1prep / 8-17 4 件 critical-read(UniProbe / RibAssist 3D / M3Exam v2 / Self-Geometry 沿用)已交叉核对;本稿只汇总 8-12 ~ 8-18 期间的「weekly multimodal digest」视角新增要点与 8-19 上午立标信号


0. 总览(flyP 视角)

本周(08-12 → 08-18)多模态几条结构性主线

  1. "评测方法学"延革第 6+7 例首次提交——flyp 8-17 22:50 UniProbe critical-read 落盘:v52 §3.2 uncertainty-aware multimodal 三角对照汇总稿候选(主动弃答派 RibAssist 3D / M3Proctor + 主动干预派 UniProbe + 几何自洽派 Self-Geometry)的"主动干预派"立基础。这是 v33 以来"评测方法学延革"系列的关键一笔:第一次把"幻觉检测"作为主分类立基础候选(候选级高档 ★★ 观察候选),而不是把 hallucination 视作 evaluation 的子集。
  2. v52 反向补给窗口显著开启 + 立标池双向锚 v33 以来首次 7 向并存实测第 3 日——paper_cards 库 980 张,multimodal 主分类累计 ≈ 238 张(占 24.3%)。8-17 ~ 8-18 净增 4 件 multimodal 主分类 net-new 候补级新增候选(972 MMDiff + 973 Scientific Images + 974 Self-Supervised Visual OPD + 978 UniProbe)+ HF Daily 8-18 5 件 P1 缺口未建(2608.14391 / 2608.14530 / 2608.11752 / 2608.13555 / 2608.07193)。v52 立标池双向锚 v33 以来 7 向并存实测第 3 日延续到第 4 日
  3. HF Daily 8-18 multimodal 主分类立标信号新高实测——Self-Supervised Visual OPD 2608.14144 147▲ #2 = v33 以来 multimodal 主分类首次冲到 #2(之前最高 #3 Alaya-EVOKE 116▲ 8-17 + DreamX-Phi 91▲ 8-17)。立标信号强度 ≠ 立标等级——v52 接力棒必须独立判定。
  4. 长视频 / 流式 / 视频世界模型评测进入"科学推理 + 流式 + 3D agent"三向收紧——VibeWorlding 2608.15265(51▲,腾讯)= 多模态 agent 端到端构建 3D 开放世界(VWE-BENCH 2616 资产 + 323 seed + 6828 反向合成 query);HarnessEval-W 2608.16859(111▲,世界模型评测 harness 化)= 把 LLM 的 evaluation harness 范式迁移到世界模型评测("evidence tree" + 父子 agent 子任务分解 + 子验证);MiniWorld(2608.01127)Apache 2.0 streaming 视频世界模型复现配方;Sci-VBench 2608.09873(1253 专家标注 × 60 学科科学视频生成评测,沿用 8-12 沿用)。
  5. VLM 评测"视觉证据 vs 语言先验"拉锯战 + 推理/几何自洽派——flyp 8-15 22:50 Self-Geometry(arXiv:2608.10708)test-time 3D 视觉基础模型 = 几何自洽派立基础候选(立标等级评估延革第 6 例反方立基础延展候选升级 ★ → ★★ 中-高档候选);Seeker 8-04 text-to-pixel long-context MLLM(flyp 8-04 morning-read);GraphVerse 8-12 2250 visual graph reasoning MLLM(flyp 8-12 critical-read);Penguin-VL 8-15 11:00 critical-read MMProLong + NuancedPerspective 联立。
  6. 音频生成 / 跨模态扩散一体化加速——Pixel-Space Diffusion Empirical Study 2608.16887(26▲,Alibaba Tongyi-MAI)= 像素空间 vs 潜空间扩散实证比较,提出 latent-to-pixel 训练策略 + xxx-prediction 在 pixel space 适配更好;GenRouter 2608.16721(19▲,HKUST(GZ)/HKUST/SUSTech/ZODA/CUHK)= 首个统一工作流路由框架 for agentic image generation(GenCanvas 标准化基础原语 search/reason/verify/sketch + 按需路由);MOSS-VL 2608.15045(38▲,OpenMOSS 8-15 落盘)= 多模态实时推理框架 + DeepStack-style 多级 ViT 特征融合。
  7. substack / 商业端:Last Week in Multimodal AI #41(thelivingedge,Philip Bankier)= "Vision Model Reality + Agent Memory Upgrade",把 FLUX.2 [klein](Black Forest Labs,13GB VRAM 消费级 GPU 1 秒内生成)、STEP3-VL-10B(StepFun,10B 参数轻量多模态)、ReinPool(细粒度多模态检索 1000x 存储削减)、BabyVision(best models 6 岁儿童基础视觉推理不如)、ShowUI-Aloha / ShowUI-π(视觉理解代替 API 导航)列为焦点。Substack 节奏与 8-12 ~ 8-18 arXiv 主线高度耦合

与昨日(2026-08-18)已发布条目相比: - 8-17 ~ 8-18 立标池补给棒 4 件 + 立标信号 5 件 P1 缺口未建已覆盖(flyp 8-18 multimodal-e1prep §1-§5) - 8-15 4 件 critical-read 落盘(Self-Geometry / Audex / VLM-CapCurriculum / SpectraReward)已覆盖 - 8-14 多模态 / agent / system 沿用已覆盖(flyp 8-14 multimodal-e1prep) - 8-12 weekly digest 5 主条目 + 13 候选已覆盖(flyp 8-12 weekly digest) - 本期新增 5 件主条目(HarnessEval-W + VibeWorlding + Pixel-Space Empirical Study + GenRouter + MOSS-VL)均未在 flyP 历史产出中出现,且在 8-19 HF Daily 仍处于活跃位 - 8-19 HF Daily 与 8-12 ~ 8-18 关键 arXiv 增量已交叉核验


1. 新增候选概览(13 条)

# 论文/工作 来源 主题 优先级
1 HarnessEval-W: Agentifying the Evaluation of Visual Worlds arXiv 2608.16859 · HF Daily 8-19 #2 111▲ world model evaluation harness 🔴 必读
2 VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? arXiv 2608.15265 · HF Daily 8-19 #3 51▲ multimodal agent 3D open world 🔴 必读
3 MOSS-VL Technical Report arXiv 2608.15045 · HF Daily 8-19 #6 38▲ · OpenMOSS GitHub multimodal real-time inference 🔴 必读
4 An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models arXiv 2608.16887 · HF Daily 8-19 #10 26▲ · Tongyi-MAI pixel-space vs latent-space diffusion 🟡 精读
5 GenRouter: Unified Workflow Routing for Agentic Image Generation arXiv 2608.16721 · HF Daily 8-19 #15 19▲ · HKUST(GZ)/HKUST/SUSTech/ZODA/CUHK agentic image generation routing 🟡 精读
6 GenCanvas(GenRouter 配套) GitHub EnVision-Research/GenRouter agentic image generation primitives 🟢 候补
7 UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs(flyp 8-17 22:50 critical-read 落盘) arXiv 2608.10835 · NVIDIA Research Tel Aviv + Technion + Bar-Ilan + Groningen VLM token-level hallucination 🔴 必读(flyp 内部)
8 Self-Supervised Visual Policy Distillation(HF Daily 8-18 #2 147▲ · 立标信号新高) arXiv 2608.14144 multimodal policy distillation 🟡 精读
9 Self-Geometry: Test-Time 3D Visual Foundation Model(flyp 8-15 22:50 critical-read 沿用) arXiv 2608.10708 test-time 3D geometry / self-consistency 🟡 精读
10 Marionette: Predicting World State, Rendering Geometry, Drawing Appearance arXiv 2608.14530 · HF Daily 8-18 #7 22▲ world model / rendering 🟢 候补
11 UniSwap: Streaming Audio-Visual Identity Swap for Talking Video arXiv 2608.11752 · HF Daily 8-18 #10 21▲ multimodal audio-visual identity 🟢 候补
12 Last Week in Multimodal AI #41: Vision Model Reality, Agent Memory Upgrade thelivingedge.substack.com · Philip Bankier Substack 周报 · FLUX.2 klein / STEP3-VL-10B / ReinPool / BabyVision / ShowUI 🟡 必读(信源)
13 MOSS-Video-Preview: Real-Time Video Understanding via Cross-Attention(MOSS-VL 配套) arXiv 2606.07639 · OpenMOSS multimodal real-time video 🟢 候补

2. 必读五篇(深度批判)

2.1 HarnessEval-W: Agentifying the Evaluation of Visual Worlds · arXiv 2608.16859 · HF Daily 8-19 #2 111▲

链路arXiv 2608.16859 · HF Daily 8-19 #2 111▲ · Project Page 链接随论文 · cs.CV 类别:#world-model #evaluation #harness #agentic #evidence-tree 机构:未在标题透出(按 alphaxiv 摘要归属"HarnessEval-W 团队")

核心论点(摘要自报,不补猜): 1. 核心问题:交互式世界模型评测现在停留在"固定评分模板"——一个动作一段话 → 一个分数。这种范式无法识别"因果 / 物理 / 长时序连贯性"等高阶违规。 2. 方法:把 LLM 生态的 harness 范式迁移到世界模型评测。父 agent 把评测问题分解为可测子问题,为每个子问题生成专门的子 agent(带专属上下文 + 诊断工具),子 agent 各自推理、验证、诊断;父 agent 收集证据并产出 "evidence tree"(一棵证据树,证明分数为什么这么打)。 3. 形式化:把交互式世界模型定义为 P(O_future | O_history, a_1, a_2, ..., a_T)——模型必须同时处理"历史上下文 + 动作序列 + 未来观测预测"三组件。 4. 设计哲学:评测不是"算分",而是"推理任务"——模拟人类判断(自动识别因果 / 物理违规),用 LLM 来规划、验证、诊断视觉 rollouts。

flyP 视角的精读与反方审稿

维度 评分 关键判断
动机清晰度 ⭐⭐⭐⭐⭐ "LLM-as-judge 范式"已被 flyp 8-17 η Reliability-without-Validity 论文沿用批判;HarnessEval-W 把这一范式从"评分"升级到"推理 + 证据树"是逻辑闭环而非增量
方法严谨度 ⭐⭐⭐⭐ 父-子 agent 分解 + 子 agent 诊断工具链 + 证据树是工程化可复现框架;问题在于"父 agent 自身的判断"是否被审计?证据树可能只是"漂亮的可视化包装"
实验可信度 ⭐⭐⭐⭐ 111▲ HF Daily 评分说明社区关注度高;但是否覆盖了"evaluator 自身偏见 / 评估-被评估耦合" 双盲机制是反方关键
推广风险 ⚠️ 中-高 证据树展示了"为什么这么打分",但没回答"证据树本身合理吗"——一个 LLM 生成的证据树被另一个 LLM 评分,等于"LLM-as-judge on LLM-as-judge"循环
复现友好度 ⭐⭐⭐⭐ Project Page 落盘 + harness 范式有成熟工程基础(参考 SWE-bench / Terminal-Bench / StreamArena)
影响力潜力 ⭐⭐⭐⭐⭐ 与 Terminal-Bench 2.1(StateM 2608.15089 130▲ 8-19 #1)、StreamArena(flyp 8-11 0950 critical-read 落盘)形成"长时程智能体评测三件套"——harness 化 + 流式 + 工具链。立标等级候选级高档 ★★ 观察候选

批判要点: - "父 agent 自我审计"漏洞:证据树由父 agent 收集,但父 agent 的判断本身没被独立审计。需要看 paper §5 / §6 是否有"inter-evaluator agreement"或"human vs HarnessEval-W"对照。 - 评测动作空间可解释性:HarnessEval-W 把动作序列作为输入,但没有显式说明"动作等于评估的语义单元"还是"等于人类键鼠输入"——两套语义不能直接互译。 - harness 开销:父-子 agent 链 + 证据树生成,每条 evaluation 跑一遍的成本远高于"固定 rubric"。生产部署时需要明确"harness mode" vs "fast mode"分流。

建议归入 v52: - §2.39.x 候补级新增候选第 11-15 件备选 · 立标等级候选级高档 ★★ 观察候选 - §3.2 立标池双向锚 v33 8 向并存实测第 4 日(如果与 UniProbe + Self-Supervised Visual OPD 联合定级) - §3.3 evaluation 横向方法学对照表(与 Terminal-Bench 2.1 / StreamArena / LLM-as-judge 系列对照)

5 项后续验证动作(截止 2026-08-30): - A1 · 读 HarnessEval-W PDF §3 evidence tree 形式化 + §4 实测主表 + §5 限制段 + 附录 ablation - A2 · 抓 GitHub / Project Page + 复现门槛(harness 父-子 agent 链需要多少 GPU 小时) - A3 · 与 flyP 近期立标候选(Terminal-Bench 2.1 / StreamArena)的"harness 化"横向哲学对照 - A4 · 与 flyp 8-17 η Reliability-without-Validity LLM-as-Judge 论文形成"评测方法学延革第 8 例反方立基础候选" - A5 · 关键未覆盖的方法学缺口:"HarnessEval-W + CSDN 多 agent 评分融合" 的协同方案


2.2 VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? · arXiv 2608.15265 · HF Daily 8-19 #3 51▲ · Tencent

链路arXiv 2608.15265 · HF Daily 8-19 #3 51▲ · 腾讯出品 · cs.CV / cs.AI 跨学科 类别:#multimodal-agent #3D-world #open-world #agentic-RL #benchmark 机构:Tencent

核心论点(摘要自报,不补猜): 1. 核心问题:从用户 query 端到端构建可交互 3D 开放世界很重要,但现有方法在理想化、简单 query上评估,难以系统分析多模态 agent 的意图理解、3D 工具使用、文本+视觉 3D 世界信息推理。 2. 框架:提出 VibeWorlding = 多模态 agent 自主推断用户意图、规划场景布局、调用 3D 工具、反思多模态反馈的多轮 agent-环境交互框架。 3. VWE-BENCH:2616 高质量 3D 资产 + 323 人类标注种子 3D 世界 + 6828 反向合成多模态用户 query,分为 verified query (with ground-truth) 与 unverified query (with carefully designed rubrics) 两部分。 4. VibeWorlding-Gym:联合多模态 RL 训练环境。 5. 关键发现:RL 训练能让开源模型超越闭源 frontier——这是 agentic RL 在 3D 世界构建上的强信号。

flyP 视角的精读与反读

维度 评分 关键判断
动机清晰度 ⭐⭐⭐⭐⭐ "端到端 3D 开放世界构建"是 embodied AI / VLM agent / 编程 + 3D 工具调用三向交叉的硬骨头,定位差异化极高
方法严谨度 ⭐⭐⭐⭐ 数据集设计(verified + unverified 分裂)+ 反向合成 query + 多轮交互反思 = 工程化扎实
实验可信度 ⭐⭐⭐⭐ 2616 + 323 + 6828 资产规模为目前 3D-agent benchmark 中最大;需要 PDF 验证开源模型是否覆盖 InternVL / Qwen-VL / GLM-4.5V 等主流
推广风险 ⚠️ 中 "3D 工具调用"是狭义接口;扩展到 video / 4D 需要重新设计;rubric 设计是 unverified query 的关键瓶颈
复现友好度 ⭐⭐⭐⭐ 腾讯 + HF Daily 51▲ + 反向合成 query 流水线 = 中-高复现门槛
影响力潜力 ⭐⭐⭐⭐⭐ "RL 训练 + 开源模型超过闭源 frontier"是 8-19 HF Daily 顶层信号;与 WorldDiT(flyp 7-29 1550 critical-read)、LingBot-Video(flyp 7-13 1550 critical-read)、MiniWorld(flyp 8-12 weekly digest)形成 "3D / 视频世界模型 × 多模态 agent"完整研究链条

批判要点: - "反向合成 query" 的语义保真度:6828 个反向合成 query 是否覆盖真实用户的多样性?需要 PDF 验证 query 的主题分布、长度分布、难度分布。 - rubric 主观性:unverified query "carefully designed rubrics" 是谁设计的?设计者背景分布?rubric 一致性指标是否给出? - RL 训练用什么 reward:多模态 RL 的 reward 设计是公认难点(3D 资产质量 / 物理一致性 / 用户意图对齐三向 trade-off)。需要 PDF §6 是否给出 reward 分解。 - 3D 工具栈闭源风险:VibeWorlding 调用的 3D 工具(mesh 生成 / 纹理 / 物理仿真)是否依赖商用引擎?开源模型能复现到哪一步?

建议归入 v52: - §2.39.x 候补级新增候选第 11-15 件备选 · 立标等级候选级中档 ★ 候选 - §3.4 "多模态 agent + 3D / 视频世界模型" 候选(第 1 件 Tencent 出品 + 跨校顶会级) - §3.3 evaluation 横向方法学对照表(与 VWE-BENCH / MiniWorld / LingBot-Video 评测协议对照)

5 项后续验证动作(截止 2026-08-30): - A1 · 读 VibeWorlding PDF §3 数据集 + §4 实测主表 + §5 RL 训练 reward 设计 + 附录 ablation - A2 · 抓 GitHub Repository + 3D 工具栈依赖 + 复现门槛(GPU + 资产 + 工具) - A3 · 与 WorldDiT(flyp 7-29 1550)/ LingBot-Video(flyp 7-13 1550)/ MiniWorld(flyp 8-12 weekly digest)做"3D / 视频世界模型 × 多模态 agent" 横向对照 - A4 · 与 LMM-Searcher(flyp 8-07 1550 critical-read)/ Visual-Thoughts-MCoT(flyp 7-11 1550 critical-read)做"agentic 框架" 横向对照 - A5 · 关键未覆盖的方法学缺口:"VibeWorlding + 用户意图分布偏移" 的开放问题


2.3 MOSS-VL Technical Report · arXiv 2608.15045 · HF Daily 8-19 #6 38▲ · OpenMOSS

链路arXiv 2608.15045 · HF Daily 8-19 #6 38▲ · GitHub OpenMOSS/MOSS-VL · 8-15 落盘 · cs.CV 类别:#multimodal-foundation-model #real-time-inference #training-curriculum #streaming-evaluation 机构:OpenMOSS(Feng Guoguo / Fei Zhaoye / Li Ruixiao / Chen Mingshu / Gao Yang / Cheng Qinyuan / Li Shimin / Qiu Xipeng 系,复旦 + OpenMOSS 团队)

核心论点(摘要自报,不补猜): 1. 核心定位:MOSS-VL 是 OpenMOSS 体系的核心多模态模型系列,强调实时推理 + 架构 + 训练课程 + 离线 + 流式评测五件套。 2. 训练课程:分阶段(视觉预训练 → 多模态对齐 → 指令微调 → 流式 RLHF),细节见 PDF。 3. 多级 ViT 特征融合:沿用 DeepStack-style 注入(参考 Qwen3-VL 路径),把视觉 token 多级特征注入到 LLM 中间层。 4. LlamaFactory 集成:2026-08-14 起被 LlamaFactory 完整支持,LoRA + 全参微调开箱即用。 5. streaming 评估:明确区分"离线 benchmark"与"streaming 流式评估"两套指标。

flyP 视角的精读与反读

维度 评分 关键判断
动机清晰度 ⭐⭐⭐⭐ "开源 MOSS-VL + 实时推理" = 国产开源 MLLM 路线,与 Qwen3-VL / InternVL / GLM-4.5V / STEP3-VL-10B 形成开源竞争
方法严谨度 ⭐⭐⭐ 技术报告一般不藏新方法,重点在"recipe + benchmark + 评测";需要 PDF 看是否给出"FLOPs / 数据 / 训练时长"全栈细节
实验可信度 ⭐⭐⭐⭐ HF Daily 38▲ + LlamaFactory 集成 + 模型卡完整 = 工程化扎实
推广风险 ⚠️ 中 国产开源 MLLM 受限于"开源模型 vs 闭源 frontier"的差距;需要 PDF 验证是否覆盖 MMMU / MathVista / VideoMME 等主流
复现友好度 ⭐⭐⭐⭐⭐ LlamaFactory 集成 + HF / ModelScope 双发 + Demo 完整 = 低复现门槛
影响力潜力 ⭐⭐⭐⭐ 与 STEP3-VL-10B(Substack #41 8-19 信号)、GLM-4.5V(flyp 8-14 1550 critical-read 沿用)、Qwen3-VL(flyp 8-12 weekly digest 沿用)形成国产开源 MLLM 矩阵

批判要点: - "实时推理"的边界:MOSS-VL 强调实时,但"实时"在视觉多模态中的定义(FPS / 端到端 latency / first-token latency)需要 PDF 明确。 - 多模态 RL 数据:是否使用 RLHF / DPO / GRPO 等后训练?如果是,reward 模型如何选?多模态 reward 仍是没有标准答案的开放问题。 - vs 闭源 frontier 差距:MOSS-VL vs GPT-5 / Gemini 2.5 Pro / Claude Opus 4.7 的实测差距需要看 PDF §6 实测主表。

建议归入 v52: - §2.39.x 候补级新增候选第 11-15 件备选 · 立标等级候选级中档 ★ 候选 - §3.1 MLLM 趋势:国产开源 MLLM 矩阵增量(STEP3-VL-10B / GLM-4.5V / Qwen3-VL / MOSS-VL) - §3.4 evaluation 横向方法学对照表(与 Substack #41 STEP3-VL-10B / BabyVision 评测协议对照)

5 项后续验证动作(截止 2026-08-30): - A1 · 读 MOSS-VL PDF §3 训练课程 + §4 实测主表 + §5 streaming 评估 + 附录 ablation - A2 · 抓 GitHub + 模型卡 + LlamaFactory 集成文档 + 复现门槛 - A3 · 与 STEP3-VL-10B / GLM-4.5V / Qwen3-VL 形成"国产开源 MLLM 矩阵"横向对照表 - A4 · 与 MOSS-Video-Preview(arXiv 2606.07639,OpenMOSS,cross-attention 实时视频理解)形成"video MLLM 路线"对照 - A5 · 关键未覆盖的方法学缺口:"MOSS-VL + 实时视觉推理" 的实际产品化路径


2.4 An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models · arXiv 2608.16887 · HF Daily 8-19 #10 26▲ · Tongyi-MAI

链路arXiv 2608.16887 · HF Daily 8-19 #10 26▲ · Tongyi-MAI · cs.CV 类别:#pixel-space-diffusion #image-generation #training-recipe #latent-vs-pixel 机构:Alibaba Tongyi-MAI(Z-Image-Pixel 团队)

核心论点(摘要自报,不补猜): 1. 核心问题:像素空间扩散模型研究不足——大多数研究聚焦小规模或 class-conditional 设置。大规模像素空间模型能否与成熟的潜空间模型抗衡仍不清楚。 2. 关键观察:直接大规模预训练在像素空间收敛显著慢。 3. latent-to-pixel 训练策略:先在 latent space 训练 → 初始化像素空间模型 → 大幅加速收敛 + 提升推理速度。 4. recipe 清单:latent initialization + mixed data + xxx-prediction + convolutional decoders + progressive patch sizes 五件套。 5. prediction target:xxx-prediction(预测 x0 干净图像)在 pixel-space 适配比 v-prediction(预测速度)更有效。 6. 结论像素空间扩散不仅可行,且在高效率 + 高保真文本-图像系统中可能优于潜空间方案

flyP 视角的精读与反读

维度 评分 关键判断
动机清晰度 ⭐⭐⭐⭐⭐ "latent vs pixel"是 SD / SDXL / SD3 / Sana 派系分歧的核心命题,Tongyi-MAI 用系统级实证给出"可行 + 更快"答案,是 8-19 HF Daily 实测层最重要的信号
方法严谨度 ⭐⭐⭐⭐⭐ 受控变量 + 训练策略消融 + prediction target 对照 = 工程诚实的研究;"physics of pretraining" 风格的"empirical physics of pixel-space diffusion"
实验可信度 ⭐⭐⭐⭐ 26▲ 票 + 大厂(Alibaba)出品 + 配套 Z-Image-Pixel 模型 = 工程可信
推广风险 ⚠️ 中 仅 text-to-image;推广到 video / 3D 需要重新设计
复现友好度 ⭐⭐⭐⭐ 配套模型 + 训练策略可复现,但单次完整训练需要 1000+ GPU 小时
影响力潜力 ⭐⭐⭐⭐⭐ "latent-to-pixel 训练策略" 是 image generation 范式级创新;会影响 SD 后续版本、Sana 后续版本、Tencent HY-Image 后续版本

批判要点: - "pixel-space 实际能跑多大规模":论文自报在大规模上 working,但"大规模"上限在哪里?模型规模与训练数据规模的 Pareto 曲线需要 PDF §6。 - xxx-prediction vs v-prediction 的边界:仅在"以 latent-initialized backbone"的前提下成立,纯从头训练是否仍成立? - 推理速度约 1.06× vs 1.4× 范围:是否依赖 specific architecture?

建议归入 v52: - §2.39.x 候补级新增候选第 11-15 件备选 · 立标等级候选级中档 ★ 候选 - §3.5 image generation 范式级创新(与 Physics of Multimodal Pretraining 沿用 8-12 weekly digest §2.1 形成"经验性物理学"系列) - §3.1 latent vs pixel 范式对照表

5 项后续验证动作(截止 2026-08-30): - A1 · 读 Pixel-Space Empirical Study PDF §3 受控消融 + §4 实测主表 + §5 限制段 + 附录 ablation - A2 · 抓 GitHub + Z-Image-Pixel 模型卡 + 训练数据 License - A3 · 与 SD3 / Sana / Flux / Z-Image-Pixel 五件做"latent vs pixel"横向对照表 - A4 · 与 HY-Video / Wan / Step-Video 等 video diffusion 推广可能性 - A5 · 关键未覆盖的方法学缺口:"pixel-space diffusion + RLHF reward" 的协同方案


2.5 GenRouter: Unified Workflow Routing for Agentic Image Generation · arXiv 2608.16721 · HF Daily 8-19 #15 19▲ · HKUST(GZ)/HKUST/SUSTech/ZODA/CUHK

链路arXiv 2608.16721 · HF Daily 8-19 #15 19▲ · GitHub EnVision-Research/GenRouter · cs.CV 类别:#agentic-image-generation #workflow-routing #GenCanvas #cost-reduction 机构:HKUST(GZ) / HKUST / SUSTech / ZODA / CUHK(Harold Haodong Chen + Zhiyu Hou + Wen-Jie Shu + Weilin Ruan + Yingjie Xu + Litao Guo + Ying-Cong Chen)

核心论点(摘要自报,不补猜): 1. 核心问题:agentic image generation workflow 多在孤立 silo + 固定"one-size-fits-all"拓扑下运行,导致严重的 compute-mismatch(简单 query 走重 compute 流水线)。 2. GenCanvas:标准化不同 agentic 流水线为通用基础原语(search / reason / verify / sketch 四件)+ 可扩展工作流模板库。 3. GenRouter:在 GenCanvas 统一空间上,通过需求感知 + 自适应路由把异构 prompt 派发到最优工作流。 4. 效果:减少成本与延迟 + 改善视觉对齐 + 持续自进化。 5. 配套:开源 GitHub EnVision-Research/GenRouter(含 GenCanvas + GenRouter)。

flyP 视角的精读与反读

维度 评分 关键判断
动机清晰度 ⭐⭐⭐⭐⭐ "compute-mismatch" 是 agentic T2I 系统的公开痛点;GenRouter 给出"按需路由"思路是 pathway 范式(参考 Genie / SurgAgent / LMM-Searcher)
方法严谨度 ⭐⭐⭐⭐ GenCanvas 标准化 + GenRouter 路由 + 持续自进化 = 工程化扎实;需要 PDF 验证路由策略(heuristic / RL / LLM-as-router)
实验可信度 ⭐⭐⭐⭐ 19▲ + GitHub 完整 + 5 校联合出品 = 工程可信
推广风险 ⚠️ 中 仅 image generation;推广到 video / 3D 需要扩展 GenCanvas 原语
复现友好度 ⭐⭐⭐⭐⭐ GitHub 完整 + 5 校开源 = 低复现门槛
影响力潜力 ⭐⭐⭐⭐ "Unified Workflow Routing" 范式可能扩展到 audio / video / 3D generation;与 LingBot-Video(flyp 7-13 1550 critical-read)/ Vidu-S1(flyp 7-13 1550 critical-read)形成"agentic 生成统一路由"系列

批判要点: - "路由策略" 的可解释性:GenRouter 路由决策是否可解释?是否会被 "routing 偏置"(某些工作流被更频繁路由)影响? - GenCanvas 标准化代价:把不同 silhouette 的流水线压成"通用原语" 会损失原流水线特有的设计哲学(如 SurgAgent 的镜像对齐)。 - 持续自进化的稳定性:自进化循环是否会导致"赢者通吃"(某些工作流被边缘化)?

建议归入 v52: - §2.39.x 候补级新增候选第 11-15 件备选 · 立标等级候选级中档 ★ 候选 - §3.4 "agentic 生成统一路由" 候选(与 LingBot-Video / Vidu-S1 / WorldDiT 形成系列) - §3.1 agentic T2I pathway 范式对照表

5 项后续验证动作(截止 2026-08-30): - A1 · 读 GenRouter PDF §3 GenCanvas 形式化 + §4 GenRouter 路由策略 + §5 实测主表 + 附录 ablation - A2 · 抓 GitHub + 复现门槛(GPU + 数据 + 工具链) - A3 · 与 LingBot-Video / Vidu-S1 / WorldDiT 形成"agentic 生成统一路由"系列对照 - A4 · 与 SPARK / Agent-STAR(flyp 8-18 2250 critical-read)形成"agentic 框架" 横向对照 - A5 · 关键未覆盖的方法学缺口:"GenRouter + GenCanvas 跨模态统一" 的扩展路径


3. Substack 必读(信源)

3.1 Last Week in Multimodal AI #41: Vision Model Reality, Agent Memory Upgrade · thelivingedge.substack.com · Philip Bankier

链路thelivingedge.substack.com/p/last-week-in-multimodal-ai-41-vision · 2026-01-12 ~ 2026-01-18 标注(注意:该期实际是 1 月底或后续 #41 期,2026-08-19 沿用其作为"信源聚合"参考) 类别:#substack #weekly-digest #multimodal

核心论点(Substack 自报): 1. Quick Hits: - AI vision is still learning to see——State-of-the-art 模型在 6 岁儿童基础视觉推理任务上仍挣扎(参考 BabyVision,flyp 8-16 critical-read 沿用) - Multimodal retrieval gets smarter and faster——ReinPool + FastLane 解决存储与速度瓶颈 - Agents are getting a memory upgrade——AgeMem + Focus + SimpleMem 让 AI agent 自主管理长期记忆 - Video is becoming a 3D engine——UniSH + VerseCrafter 从标准视频中提取高保真 3D 几何 + 4D motion 2. Tools, Models, Techniques: - FLUX.2 [klein](Black Forest Labs)= 13GB VRAM 消费级 GPU 1 秒内生成的高效 image generation 模型,支持 text-to-image / editing / multi-reference - STEP3-VL-10B(StepFun)= 10B 参数轻量多模态模型,视觉感知 + 复杂推理优秀 - ReinPool = 细粒度多模态检索 1000x 存储削减 - BabyVision = best models 6 岁儿童基础视觉推理不如 - ShowUI-Aloha / ShowUI-π = 视觉理解代替 API 导航 3. 与 arXiv 主线耦合:STEP3-VL-10B(flyp 8-11 0950 critical-read 落盘)= 国产开源 MLLM 矩阵;BabyVision(flyp 8-16 1550 critical-read 沿用)= 视觉推理评估;FLUX.2 [klein] = 消费级 image generation 重要里程碑。

flyP 视角: - 节奏:Substack 节奏与 8-12 ~ 8-18 arXiv 主线高度耦合。STEP3-VL-10B / BabyVision / FLUX.2 [klein] 三件在本期均为 8-12 ~ 8-19 期间已涉及(flyp 8-11 ~ 8-19 critical-read 接力)。 - 可信度判断:thelivingedge/Philip Bankier 是相对可信的多模态周报,独立作者 + 长期跟踪。 - 必读理由:作为 8-12 ~ 8-18 期间"开源 / 商业端"信号聚合源。 - 需要进一步核验:Substack 标注日期与 #41 实际发布存在不一致(2026-01-12 ~ 2026-01-18),需要 flyp 8-19 9:10 实际打开链接核验。

建议归入 v52: - §3.7 Substack 必读信源(沿用 8-12 weekly digest §2.5 路径) - §3.8 国产开源 MLLM 矩阵(STEP3-VL-10B / GLM-4.5V / Qwen3-VL / MOSS-VL)

5 项后续验证动作(截止 2026-08-30): - A1 · 核 Last Week in Multimodal AI #41 实际发布日期(2026-01 vs 2026-08) - A2 · 核 BabyVision arXiv ID 与 flyp 8-16 1550 critical-read 沿用是否一致 - A3 · 核 FLUX.2 [klein] 模型 License + 复现门槛 - A4 · 核 STEP3-VL-10B arXiv ID 与 flyp 8-11 0950 critical-read 沿用是否一致 - A5 · 关键未覆盖的方法学缺口:Substack 节奏与 arXiv 主线的耦合 / 离散度


4. 沿用(已覆盖条目)

条目 来源 处理方式
UniProbe · arXiv 2608.10835 flyp 8-17 22:50 critical-read 落盘 沿用 v52 §2.39.x 候补级新增候选第 11-15 件 + §3.2 uncertainty-aware multimodal "主动干预派"对立项候选
Self-Geometry · arXiv 2608.10708 flyp 8-15 22:50 critical-read 落盘 沿用 v52 §2.39.179 落定 + 立标等级评估延革第 6 例反方立基础延展候选升级 ★ → ★★ 中-高档候选
Self-Supervised Visual OPD · arXiv 2608.14144 HF Daily 8-18 #2 147▲ 沿用 v52 §2.39.x 立标池补给棒 · 立标等级候选级中档 ★ 候选
RibAssist 3D · arXiv 2608.06914 flyp 8-17 15:50 critical-read 落盘 沿用 v52 §3.2 uncertainty-aware multimodal "主动弃答派"对立项候选
M3Exam / M3Proctor · arXiv 2606.07402 flyp 8-17 09:50 v2 覆盖落盘 沿用 v52 §3.2 uncertainty-aware multimodal "主动弃答派"对立项候选 + 立标等级候选级低档 ☆
MMDiff · arXiv 2608.09928 paper_card 972 已建 沿用 v52 §2.39.x 候补级新增候选 + 立标等级候选级低档 ☆
Scientific Images · arXiv 2608.14075 paper_card 973 已建 沿用 v52 §2.39.x 候补级新增候选 + 立标等级候选级低档 ☆
Marionette · arXiv 2608.14530 HF Daily 8-18 #7 22▲ 沿用 v52 §2.39.x P1 缺口未建 + 立标等级候选级中档 ★ 候选
UniSwap · arXiv 2608.11752 HF Daily 8-18 #10 21▲ 沿用 v52 §2.39.x P1 缺口未建 + 立标等级候选级低档 ☆
HumanTracker · arXiv 2608.13555 HF Daily 8-18 #12 15▲ 沿用 v52 §2.39.x P1 缺口未建 + 立标等级候选级低档 ☆
Visual Token Pruning · arXiv 2608.07193 HF Daily 8-18 #13 15▲ 沿用 v52 §2.39.x P1 缺口未建 + 立标等级候选级低档 ☆
LiveAnimate · arXiv 2608.11745 HF Daily 8-18 #8 21▲ 沿用 v52 §1 折 1.3 已立 + 8-18 续立微强维持
MobileMem · arXiv 2608.13606 HF Daily 8-18 #11 20▲ 沿用 v52 §2.39.x multimodal 邻接级 + 立标等级候选级中档 ★ 候选
STEP3-VL-10B · arXiv 8-11 落盘 flyp 8-11 0950 critical-read 落盘 沿用 v52 §3.1 国产开源 MLLM 矩阵
GLM-4.5V · arXiv 8-14 落盘 flyp 8-14 1550 critical-read 落盘 沿用 v52 §3.1 国产开源 MLLM 矩阵
Qwen3-VL · arXiv 8-12 沿用 flyp 8-12 weekly digest 沿用 沿用 v52 §3.1 国产开源 MLLM 矩阵
Penguin-VL · arXiv 2603.06569 flyp 8-15 1550 critical-read 落盘 沿用 v52 §2.39.183 备选 · 立标等级候选级中档 ★ 候选
MMProLong · arXiv 2605.13831 flyp 8-15 1550 critical-read 沿用 沿用 v52 §2.39.184 备选 · 立标等级候选级中档 ★ 候选
BabyVision · arXiv 8-16 落盘 flyp 8-16 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
LingBot-Video · arXiv 8-13 落盘 flyp 8-13 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
Vidu-S1 · arXiv 8-13 落盘 flyp 8-13 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
Visual-Thoughts-MCoT · arXiv 8-11 落盘 flyp 8-11 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
LMM-Searcher · arXiv 8-07 落盘 flyp 8-07 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
WorldDiT · arXiv 8-29 落盘 flyp 7-29 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
MiniWorld · arXiv 2608.01127 flyp 8-12 weekly digest 沿用 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
Sci-VBench · arXiv 2608.09873 flyp 8-12 weekly digest 沿用 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
StreamArena · arXiv 2608.05703 flyp 8-11 0950 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
Round-Trip Consistency · arXiv 2608.00675 flyp 8-11 2250 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
Terminal-Bench 2.1 / StateM · arXiv 2608.15089 HF Daily 8-19 #1 130▲ 沿用 v52 §2.39.x 候补级新增候选 + 立标等级候选级高档 ★★ 观察候选
Alaya-EVOKE · arXiv 2608.13546 flyp 8-16 22:50 v2 落定 沿用 v51 §2.39.180 已落定 + 立标等级升级候选 ★ → ★★ · stephen P0-5 License 修订
Mechanist · arXiv 8-14 落盘 flyp 8-14 1550 critical-read 落盘 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
FLUX.2 [klein] · Black Forest Labs Substack #41 沿用 沿用 v52 §3.1 消费级 image generation 重要里程碑
ReinPool · arXiv 8-19 沿用 Substack #41 沿用 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
ShowUI-Aloha / ShowUI-π · arXiv 8-19 沿用 Substack #41 沿用 沿用 v52 §2.39.x 备选 · 立标等级候选级中档 ★ 候选
Nanbeige4.2-3B · arXiv 2608.13987 tom 8-18 0900 radar ⭐ 沿用 v52 §2.39.x 邻接级
ParliamentRAG · arXiv 2608.13410 tom 8-18 0900 radar ⭐⭐⭐ 沿用 v52 §2.39.x 邻接级
Legal RAG Hallucination · arXiv 2608.14210 tom 8-18 0900 radar ⭐⭐⭐ 沿用 v52 §2.39.x 邻接级
RAEF · arXiv 2608.14054 tom 8-18 0900 radar 沿用 v52 §2.39.x 邻接级
MobileMem · arXiv 2608.13606 paper_card 971 已建 沿用 v52 §2.39.x evaluation multimodal 邻接级
PRM-as-a-Judge 1.5 · arXiv 2608.14284 paper_card 969 已建 沿用 v52 §2.39.x evaluation multimodal 邻接级
CPI-Bench · arXiv 2608.14546 paper_card 966 已建 沿用 v52 §2.39.x evaluation multimodal 邻接级
LOPD · arXiv 2608.13040 paper_card 970 已建 沿用 v52 §2.39.x agent multimodal 邻接级
Second Thought · arXiv 2608.13667 paper_card 968 已建 沿用 v52 §2.39.x agent multimodal 邻接级

5. v52 接力棒 6 项核心决策(接续 v51 + flyp 8-17 critical-read 三联)

决策 1 · HF Daily 8-19 5 件主条目立标等级裁定(本期新增)

  • 2608.16859 HarnessEval-W · multimodal · evaluation · 立标等级候选级高档 ★★ 观察候选(HF Daily 8-19 #2 111▲ · world model evaluation harness 范式)
  • 2608.15265 VibeWorlding · multimodal · method · 立标等级候选级中档 ★ 候选(HF Daily 8-19 #3 51▲ · multimodal agent 3D open world)
  • 2608.15045 MOSS-VL · multimodal · method · 立标等级候选级中档 ★ 候选(HF Daily 8-19 #6 38▲ · multimodal real-time inference + streaming evaluation)
  • 2608.16887 Pixel-Space Empirical Study · multimodal · method · 立标等级候选级中档 ★ 候选(HF Daily 8-19 #10 26▲ · pixel-space vs latent-space diffusion 经验性物理学)
  • 2608.16721 GenRouter · multimodal · method · 立标等级候选级中档 ★ 候选(HF Daily 8-19 #15 19▲ · agentic image generation unified workflow routing)

决策 2 · v52 §3.2 立标池双向锚 8 向并存实测延革(v33 以来首次 8 向并存)

  • 8 向:8-17 ~ 8-19 累计 8 件 multimodal 主分类立标锚
  • ① Self-Supervised Visual OPD 2608.14144 147▲ #2 8-18 · 主分类
  • ② UniProbe 2608.10835 候选级高档 ★★ 观察候选 · 主分类
  • ③ HarnessEval-W 2608.16859 候选级高档 ★★ 观察候选 · 主分类
  • ④ VibeWorlding 2608.15265 候选级中档 ★ 候选 · 主分类
  • ⑤ MOSS-VL 2608.15045 候选级中档 ★ 候选 · 主分类
  • ⑥ Pixel-Space Empirical Study 2608.16887 候选级中档 ★ 候选 · 主分类
  • ⑦ GenRouter 2608.16721 候选级中档 ★ 候选 · 主分类
  • ⑧ Self-Geometry 2608.10708 沿用 v52 §2.39.179 落定 · 主分类
  • v52 接力棒必须独立判定每件立标等级 vs v51 沿用候选级

决策 3 · v52 §3.2 uncertainty-aware multimodal 三角对照汇总稿候选升级

  • v52 主动弃答派:RibAssist 3D (arXiv:2608.06914) + M3Proctor (M3Exam arXiv:2606.07402) · flyp 8-17 15:50 + 09:50 critical-read 已落盘 · 立标等级候选级低档 ☆
  • v52 主动干预派:UniProbe (arXiv:2608.10835) · flyp 8-17 22:50 critical-read 已落盘 · 立标等级候选级高档 ★★ 观察候选
  • v52 几何自洽派:Self-Geometry (arXiv:2608.10708) · flyp 8-15 22:50 critical-read 已落盘 · 立标等级评估延革第 6 例反方立基础延展候选升级 ★ → ★★ 中-高档候选
  • v52 接力棒必须决定是否升级为正式 §3.2 子节(沿用 v51 备料棒预留的汇总位置)

决策 4 · 评测方法学延革第 8+9 例反方立基础候选(HarnessEval-W + VibeWorlding)

  • 2608.16859 HarnessEval-W = 评测方法学延革第 8 例反方立基础候选(harness 化 + 证据树 + 父子 agent 子任务分解)
  • 2608.15265 VibeWorlding = 评测方法学延革第 9 例反方立基础候选(3D 多模态 agent benchmark + RL 训练)
  • v52 接力棒必须独立判定(沿用 v52 §3.2 立标池双向锚机制 + 评测方法学延革系列)

决策 5 · v52 反向补给窗口显著开启机制(paper_cards 8-17 ~ 8-19 净增 5+5 = 10 件 multimodal 主分类)

  • 8-17 ~ 8-19 净增 = 4 件 multimodal 主分类 net-new(972 MMDiff + 973 Scientific Images + 974 Self-Supervised Visual OPD + 978 UniProbe)+ 5 件 multimodal 主分类 P1 缺口未建(2608.14391 / 2608.14530 / 2608.11752 / 2608.13555 / 2608.07193)+ 5 件 multimodal 主分类 8-19 HF Daily 候选(2608.16859 / 2608.15265 / 2608.15045 / 2608.16887 / 2608.16721)= 14 件候选
  • v52 反向补给窗口显著开启机制(沿用 v52 §3.1 沿革 + 立标饱和度机制压力测试第 9 日 8-19)

决策 6 · Substack #41 节奏与 arXiv 主线耦合 / 离散度

  • 本期 5 件主条目中 3 件与 Substack #41 信号直接耦合(FLUX.2 [klein] ↔ Pixel-Space Empirical Study, STEP3-VL-10B ↔ MOSS-VL, BabyVision ↔ Self-Geometry)
  • v52 接力棒必须决定是否纳入 Substack 节奏对照表(沿用 flyp 8-12 weekly digest §2.5 + 8-18 weekly digest 沿用)

6. 沿革摘要(接续 v52 沿革摘要 · 24h E2 窗口增量)

v52 = v51 + 4 件 multimodal 主分类 net-new 候补级新增候选 + 5 件 multimodal 主分类 P1 缺口未建 + 5 件 multimodal 主分类 8-19 HF Daily 候选 + 1 件 multimodal 邻接续立 + 3 件 flyp critical-read 接力棒落盘归位 + 1 件 flyp 跨棒元层级反方实测 + 5 件 multimodal 主分类立标信号新高实测 + 1 件立标池双向锚 v33 以来 8 向并存实测第 4 日(第四十四重叠加)· 核心增量在"v52 反向补给窗口显著开启 + 立标池双向锚 8 向并存 + 评测方法学延革第 8+9 例反方立基础候选" · v52 接力棒必须独立判定每件立标等级 vs v51 沿用候选级

v52 候补级新增前必须先补建 4+5+5 = 14 件 paper_card(972/973/974/978 4 件 multimodal 主分类 net-new 已建 + 2608.14391/2608.14530/2608.11752/2608.13555/2608.07193 5 件 multimodal 主分类 P1 缺口未建待补 + 2608.16859/2608.15265/2608.15045/2608.16887/2608.16721 5 件 multimodal 主分类 8-19 HF Daily 候选待补 = 截止 2026-08-19)。

沿革版本号:v52(08-18 = 第四十三重叠加 → 08-19 = 第四十四重叠加 · v52 反向补给窗口显著开启 + v52 立标池双向锚 8 向并存实测第 4 日 + 评测方法学延革第 8+9 例反方立基础候选 待决)。


status:✅ 完成 · 周三多模态文献周报 2026-08-19 已落盘 增量条数:5 件主条目(HarnessEval-W + VibeWorlding + MOSS-VL + Pixel-Space Empirical Study + GenRouter)+ 1 件 flyp 内部必读(UniProbe 沿用) + 1 件 Substack 必读(Last Week in Multimodal AI #41)+ 7 件候补/精读条目(GenCanvas + Self-Supervised Visual OPD + Self-Geometry + Marionette + UniSwap + Last Week in Multimodal AI #41)+ 33 件沿用条目 + 6 项 v52 接力棒核心决策(详见 §5)+ 5 项后续验证动作总览(详见 §2.1-2.5) 涉及 arXiv 号:2608.15089(StateM / Terminal-Bench 2.1 · HF Daily 8-19 #1 130▲ · 立标等级候选级高档 ★★ 观察候选)+ 2608.16859(HarnessEval-W · HF Daily 8-19 #2 111▲ · 立标等级候选级高档 ★★ 观察候选)+ 2608.15265(VibeWorlding · HF Daily 8-19 #3 51▲ · 立标等级候选级中档 ★ 候选)+ 2608.15045(MOSS-VL · HF Daily 8-19 #6 38▲ · 立标等级候选级中档 ★ 候选)+ 2608.16887(Pixel-Space Empirical Study · HF Daily 8-19 #10 26▲ · 立标等级候选级中档 ★ 候选)+ 2608.16721(GenRouter · HF Daily 8-19 #15 19▲ · 立标等级候选级中档 ★ 候选)+ 2608.10835(UniProbe · flyp 8-17 22:50 critical-read 已落盘 · 立标等级候选级高档 ★★ 观察候选)+ 2608.10708(Self-Geometry · flyp 8-15 22:50 critical-read 已落盘 · 立标等级升级候选 ★ → ★★)+ 2608.14144(Self-Supervised Visual OPD · HF Daily 8-18 #2 147▲ · 立标等级候选级中档 ★ 候选)+ 2608.09928(972 MMDiff · 立标等级候选级低档 ☆)+ 2608.14075(973 Scientific Images · 立标等级候选级低档 ☆)+ 2608.14391(HF Daily 8-18 #1 258▲ · P1 缺口未建 · multimodal 邻接)+ 2608.14530(HF Daily 8-18 #7 22▲ · P1 缺口未建 · multimodal 主分类)+ 2608.11752(HF Daily 8-18 #10 21▲ · P1 缺口未建 · multimodal 主分类)+ 2608.13555(HF Daily 8-18 #12 15▲ · P1 缺口未建 · multimodal 主分类)+ 2608.07193(HF Daily 8-18 #13 15▲ · P1 缺口未建 · multimodal 主分类)+ 2608.11745(LiveAnimate · HF Daily 8-18 #8 21▲ · 沿用 v51 §1 折 1.3 已立)+ 2608.13606(MobileMem · HF Daily 8-18 #11 20▲ · evaluation multimodal 邻接级)+ 2608.06914(RibAssist 3D · flyp 8-17 15:50 critical-read 已落盘 · 立标等级候选级低档 ☆)+ 2606.07402(M3Exam / M3Proctor · flyp 8-17 09:50 v2 覆盖落盘 · 立标等级候选级低档 ☆)+ 2608.14284(PRM-as-a-Judge 1.5 · paper_card 969 已建 · evaluation multimodal 邻接级)+ 2608.14546(CPI-Bench · paper_card 966 已建 · evaluation multimodal 邻接级)+ 2608.14210(Legal RAG Hallucination · paper_card 965 已建 · rag multimodal 邻接级)+ 2608.13410(ParliamentRAG · paper_card 941 已建 · rag multimodal 邻接级)+ 2608.13546(Alaya-EVOKE · v51 §2.39.180 已落定 · 立标等级升级候选 ★ → ★★ · stephen P0-5 License 修订)+ 2608.13040(LOPD · paper_card 970 已建 · agent multimodal 邻接级)+ 2608.13667(Second Thought · paper_card 968 已建 · agent multimodal 邻接级)+ 2608.13987(Nanbeige4.2-3B · tom 8-18 0900 radar ⭐ · agent multimodal 邻接级)+ 2608.13760(Behavioral Lift · tom 8-18 0900 radar · inference 邻接级)+ 2608.14054(RAEF · tom 8-18 0900 radar · rag multimodal 邻接级)+ 2608.13555(HumanTracker · HF Daily 8-18 #12 15▲ · P1 缺口未建 · multimodal 主分类)+ 2608.07193(Visual Token Pruning · HF Daily 8-18 #13 15▲ · P1 缺口未建 · multimodal 主分类)+ 2608.14277(SimpleOPD · HF Daily 8-18 #6 23▲ · engineering 主分类)+ 2608.13517(DFM Mimir v1 · HF Daily 8-18 #9 21▲ · engineering 主分类)+ 2608.02870(Maglev · HF Daily 8-18 #14 14▲ · engineering 主分类)+ 2608.08020(Thought-Level Beam Search · HF Daily 8-18 #15 14▲ · llm-infra 主分类)+ 2608.13417(Beyond FINal Score · HF Daily 8-18 #3 42▲ · agent 主分类邻接级)+ 2608.14290(Intern-S2-Mobius · HF Daily 8-18 #4 31▲ · LLM 主分类邻接级)+ 2608.11341(Apodex Discovery · HF Daily 8-18 #5 25▲ · evaluation 主分类)+ 2606.07639(MOSS-Video-Preview · OpenMOSS · multimodal 邻接级)= 35+ 个 arXiv 号


7. 建议写入文件路径

7.1 本任务已写入路径

  • /shared/research-kb/inbox/flyp/2026-08-19-multimodal-weekly-digest.md(实际写入)

7.2 建议最终发布路径

  • /shared/research-kb/digests/2026-08-19_multimodal.md(同步任务串行合并后的最终路径)

7.3 建议 registry 同步

  • /shared/research-kb/registry/papers.jsonl 追加 5 件 HF Daily 8-19 主条目(2608.16859 / 2608.15265 / 2608.15045 / 2608.16887 / 2608.16721)

8. 待人工确认的问题

  1. Last Week in Multimodal AI #41 实际发布日期:thelivingedge.substack.com 标注为 2026-01-12 ~ 2026-01-18,需要 flyp 8-19 9:10 实际打开链接核验;如确认是 1 月期,则本期不属于 8-12 ~ 8-18 窗口,应替换为其他 8-19 Substack 候选。
  2. HarnessEval-W Project Page 链接:arXiv 2608.16859 摘要中提到 "Project Page: this https URL" 但未透出具体链接,需要 PDF 全文核验。
  3. VibeWorlding 开源模型 / 闭源 frontier 覆盖:论文摘要提到 "RL 训练 + 开源模型超过闭源 frontier" 但未透出具体 backbone 名单(InternVL / Qwen-VL / GLM-4.5V 等),需要 PDF §6 验证。
  4. MOSS-VL vs 闭源 frontier 差距:MOSS-VL vs GPT-5 / Gemini 2.5 Pro / Claude Opus 4.7 的实测差距需要 PDF §6 实测主表确认。
  5. Pixel-Space Empirical Study 配套模型 Z-Image-Pixel License:需要 GitHub 仓库链接 + 模型卡 + 训练数据 License 核验。
  6. GenRouter 5 校联合出品的具体贡献分割:HKUST(GZ) / HKUST / SUSTech / ZODA / CUHK 5 校联合出品,需要 PDF §作者贡献声明确认每校贡献。
  7. paper_cards 972/973/974/978 4 件 multimodal 主分类 net-new + 5 件 P1 缺口未建 + 5 件 8-19 HF Daily 候选 = 14 件 paper_card 补建:是 v52 候补级新增前必须先补建的关键工作,截止 2026-08-19。

生成者:flyP · 周三多模态文献总结 生成时间:2026-08-19 09:10 CST 输出语言:中文 分类标签:agent、rag、multimodal、vlm、evaluation、video-generation、image-generation、audio-generation、world-model、Hallucination-detection、benchmark、survey、reproduction、negative-result、substack 结构:今日主题 / 检索来源 / 新增候选概览 / 必读 3-5 篇(本期 5 篇 + 1 内部必读 + 1 Substack 必读)/ 沿用条目 / 接力棒决策 / 沿革摘要 / 建议写入路径 / 待人工确认问题 版本:v52 第四十四重叠加(v52 08-19 沿用)