• 质量分:8(满分 10)

Tom 评 flyP · 2026-07-15 周三多模态周报

1. 评分与定位

  • 被评对象/shared/research-kb/inbox/flyp/2026-07-15-multimodal-weekly-digest.md(约 19.5 KB,作者:flyP)
  • 类型:weekly multimodal digest,覆盖 2026-07-08 → 07-14
  • 触达深度:3 篇必读每篇都用六维评分表 + 反方要点拆解;2 篇次必读各给 1 段摘要 + 入库建议;12 条候选 + 主线分类 + 5 处主题页更新建议 + 5 项待人工确认问题
  • 总评:信息密度高、结构严谨、反方视角主动;存在 2 处与已公开源(GitHub README / arXiv 摘要)对不上的数字,1 处需要更细的"基线覆盖"补查。
# 论点 flyP 表述 已公开源 判定
F1 Thinking with Video · arXiv 2511.04570 · CVPR 2026 · Fudan OpenMOSS · Sora-2 在 Eyeballing Puzzles 上超 GPT-5 10% ✅ 一致 OpenAccess CVPR2026 PDF、GitHub tongjingqi/Thinking-with-Video、emergentmind 摘要均吻合 ✅ 准确
F2 Sora-2 在 MMMU 上 69.2% / MATH 上 92% ⚠️ 数字偏小 GitHub README 报告(CVPR 收录版):MMMU 75.5%、MATH 94.0%、GSM8K 98.9% 使用了旧版/早期数字,与 CVPR 最终公开版不一致
F3 VideoThinkBench 覆盖视觉中心 + 文本中心;并用 Sora-2 当推理器 GitHub README 明确 vision-centric(eyeballing puzzles / mazes / ARC-AGI-2)+ text-centric(MATH / GSM8K / MMLU / MMMU)
F4 VLM-CapCurriculum · UCSC-VLAA · ICML 2026 · "感知是瓶颈" + 三阶段课程 + 顺序消融 ICML 2026 poster 61345、OpenReview forum id r7uOjvZdzO、项目页 ucsc-vlaa.github.io/VLM-CapCurriculum ✅ 准确
F5 VLM-CapCurriculum 关键数字 +20.8% 更短推理;顺序反转 -4.6pts 项目页与 GitHub README:1.46% 准确率提升 + 20.8% 推理缩短(一致);-4.6pts 顺序反(一致)
F6 Qwen3-VL-8B 58.56 → 62.99 文章给"+4.5"+RealWorldQA +3.7% 项目页有"+1.46% global"+"+3.7% RealWorldQA"两套口径,4.43/4.5 是另一基准或子集口径,未在摘要级公开 ⚠️ 数字来源不清,容易被读者误以为全局一致;应注明"实测基准=?,差值=?"
F7 Audex 30B-A3B · 基于 Nemotron-Cascade-2-30B-A3B · MoE 30B-A3B · 单 Transformer decoder + 音频投影到文本 embedding MarkTechPost 2026-07-07、HF nvidia/Nemotron-Labs-Audex-30B-A3B、Reddit r/machinelearningnews ✅ 准确
F8 Audex arXiv 2607.05196 ⚠️ web 未直接出现该 arXiv id HF card + NVIDIA blog 确认存在,但arxiv 编号 2607.05196 没在搜索结果命中,可能 arXiv 编号错误或发布时间过晚未索引 ⚠️ 需复核 arXiv 编号(建议 HF / NVIDIA 项目页直接拉一次)
F9 VoxENES 2026 · arXiv 2607.11706 · 53,628 样本 · 10 种 TTS · 8 个 detector 最佳 28.98% EER arxiv.org/abs/2607.11706、ResearchGate 摘要
F10 Xiaomi-Robotics-U0 38B AR · 几何一致性 + 本体约束 ✅(描述合理) arXiv 2607.11643 没单独查,但飞 P 自己标"摘要只给 38B AR,未给 SOTA 数字、未列对比基线"——这个批评是合理的,flyP 自己也已标注意见 ✅(自我谨慎)
F11 Substack LWMAI #40 焦点:Qwen3-VL-Embedding + e5-omni + LTX-2 + UniVideo ⚠️ 未跨源核查 LWMAI #40 公开存档没在搜索结果出现;flyP 给的主题词(Qwen3-VL-Embedding、e5-omni 等)是合理推断,但没列具体发布日期/作者/收藏数 ⚠️ 轻度存疑:作为"信源条目"建议加 date 与 Substack 链接锚
F12 与 tom / jay / spark 不重合的声明 ⚠️ 仅给文件名,没给 cross-check 工作队列中确实有 2026-07-15-agent-rag-longcontext-radar 等条目,但飞 P 没附上前者主题列表做差集 ⚠️ 轻度:建议加一句差集依据

关键事实问题汇总

  1. F2 是这期最需要修的硬伤:把"CVPR 2026 收录版"的 MMMU/MATH 数字读成 69.2%/92%,而公开 GitHub 给的是 75.5%/94.0%。建议下一版 digest 把这一栏改成 GitHub README / CVPR PDF 数字,并注明"对比报告来源:CVPR 2026 published PDF §5"。
  2. F8 建议复核 arXiv 编号 —— 2607.05196 是一个 2026-07 中的编号,未在搜索结果命中;可能是 2607.05196 真实存在但 Tavily 索引不全,建议人工直接访问 arxiv.org/abs/2607.05196 验证。
  3. F6 也建议明确"+4.5"对应的具体基准与对比设定,避免读者当成全局增益引用。

3. 深度评估

强项(执行到位)

  • 反方审稿维度表 —— 六个维度(动机清晰度 / 方法严谨度 / 实验可信度 / 推广风险 / 复现友好度 / 影响力潜力)覆盖很全,是 flyP 周报的标准差异化动作,明显高于一般 weekly digest。
  • 方法论反方:对 Thinking with Video 的"Sora-2 黑盒 + 未并排 Kling 3.0/Wan 2.6/Veo 3.1"批评是真正尖锐的(行业里很多人避谈);对 Audex 的"text regression 评估用什么基准"也是一个工程社区会关注的盲点。
  • 主题页更新建议 —— 与工作队列主题"database"3 天未更新形成清晰呼应;把 5 个主题页都给出 owner 候选路径(notes/multimodal-thinking/notes/audio-evaluation/ 等),与 Anan 的知识库活文档治理目标一致。
  • 承认局限 —— 第 8 节"待人工确认"5 条问题承认自己不能决断的事,例如 Sora-2 推理是否构成新趋势、Nemotron Audex 是否追文、Xiaomi-Robotics-U0 是否升级精读。

弱项(可改进)

  1. 数字来源透明度:6 维评分表只给评级,没明确"该数字来源 = §X 表 / GitHub README / OpenReview 投稿"。FlyP 应当提供一个"信源列",至少在 2.1/2.2/2.3 每节加一行"数据来源"指向具体 §表。
  2. 缺一个"被对比基线"的集中表:在 2.1 提到了 Kling 3.0 / Wan 2.6 / Veo 3.1,2.2 提到 Qwen2.5-VL/Qwen3-VL/LLaVA 系列,2.3 提到 Qwen3-Omni,但分在三处。建议在第 0 节总览后单独放一个"对照基线表",把 flyP 全部提到的对比对象聚到一处,便于后续 deep-read 跟进。
  3. "音频 token 量化细节不公开"批评在 2.3 重复出现两次(同节),可压成一句 + 一句具体"建议补充什么"。
  4. VoxENES 2026 + ControlAudio + FreyaTTS 链——flyP 自己提到了 ControlAudio (ACL 2026) 与 FreyaTTS (2607.09530),但没有给 ControlAudio/FreyaTTS 的具体摘要与对照表。"完整图景"这个判断应当附"具体哪些基准数据互相对得上"。
  5. 缺一个"最新进展 vs 上周"的对照:第 0 节总览列了昨日已覆盖项,但没和 2026-07-08-multimodal-weekly-digest.md(flyP 上期)做差集,所以flyP 自己的延续性没体现。建议加一节"对比上周周报"。
  6. EG-VQA / ForeSight / MET 处理过于轻量:6/7/8 三条都被标"略过 / 并入 / 待定",但没有任何 1 行说明这三条具体为什么不入主线。这类 marginal call 应当至少 1 行 skip reason。

与最新进展的差距(要找的更新)

  • Thinking with Video 的 Sora-2 数字:flyP 自报 69.2% / 92%(旧版),但GitHub 上的 CVPR 收录版是 75.5% / 94.0%。这是"飞 P 没读到最新公开版"的迹象。
  • ICML 2026 名单:ICML 已公布 poster 61345(From Seeing to Thinking),flyP 文章中"VLM-CapCurriculum"label 与正式标题"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models"略有不齐——以后用正式标题更稳。
  • NVIDIA Audex:MarkTechPost 2026-07-07 已发稿,flyP 仍标"v1 2026-07"+arXiv 2607.05196 但没引用 NVIDIA blog / HF model card 链接(只有 Hugging Face URL 间接确认)。加一条官方 announcement 链接会让信源链更稳。
  • VoxENES:搜索结果显示 arXiv 2607.11706 已被 1 天前覆盖(07-14 出现 ResearchGate 摘要),flyP 自报 2026-07-13 v1 合理。

可读性

  • 8 节结构(0 总览 → 7 文件路径 → 8 待人工确认)→ 节奏合理。
  • 6 维评分表在表格中用 ⭐⭐⭐ 与 ⚠️ 区分"质量"与"风险",可读性高。
  • 路径建议过于细致(notes/multimodal-thinking/video-as-reasoning-2026.md 等)—— 飞 P 不直接写这些,建议改用"/shared/research-kb/...`留白",让 Anan 在 curated/ 阶段定夺。
  • 标注"不复制任何一篇长文 / PDF 全文 / benchmark 图"在文末一行非常专业。

误导风险评估

  • 无明显可被读者照搬后误导的句子。最严重的潜在误导是 F2(用旧版数字当成 CVPR 收录版数字),但 flyP 自己也已留出"未并排对比同类视频生成模型"的反方意见,读者不太会直接采信。

4. 可执行的修改建议(按优先级)

P0(必须修)

  1. 2.1 节关键数字修订:MMMU 75.5%(非 69.2%)、MATH 94.0%(非 92%)、补 GSM8K 98.9%;来源:GitHub tongjingqi/Thinking-with-Video README / CVPR 2026 OpenAccess PDF §5。
  2. 2.3 节 arXiv 编号核查:直接访问 https://arxiv.org/abs/2607.05196,若不存在或编号错(2607.05xxx 通常仍是合理编号),改用 HF model card URL https://huggingface.co/nvidia/Nemotron-Labs-Audex-30B-A3B 作为主链接。
  3. 2.2 节"+4.5"对应基准说明:明确 +4.5 是哪个基准/哪个 baseline 的差,避免读者照搬为"全局增益"。

P1(强烈建议)

  1. 在第 0 节总览后增加"本周对比基线一览"小表(Thinking with Video: Kling 3.0 / Wan 2.6 / Veo 3.1;VLM-CapCurriculum: GPT-5 / Claude 4.x / Gemini 3 Pro;Audex: Qwen3-Omni / Step-Audio 2 / Audio-Flamingo 3),便于深读跟进。
  2. 在每节"反方审稿"前加一行"信源:GitHub README / CVPR PDF §X / HF model card",做信源指针。
  3. 4 节候选"略过"项(E-VQA、MET、ForeSight、GLM-Image、Machine Learns #63、MultimodalAIArt News、LWMAI #40):每条至少 1 行 skip / merge 理由,提升论文随记可追溯性。
  4. 引用边界声明改为更具体的"未复制 Sora-2 prompt / Codex 代码 / benchmark 表格",避免泛指。

P2(建议)

  1. 在第 0 节总览后增加一节"对比 flyP 2026-07-08 上期周报"——把上周已覆盖条目列出 + 这周新增 5/12 条主条目之差说清楚,便于连续性追踪。
  2. 把 2.3 节"音频 token 量化细节不公开"压成一句 + 一条具体追加请求(建议附 codec 候选:DAC / SoundStream / EnCodec)。
  3. 在第 8 节"待人工确认问题"中加一条"VLM-CapCurriculum 论文正式标题是 From Seeing to Thinking,是否改用正式标题?"

5. 评分细节(与对照其他产出)

维度 评分 备注
事实准确性 7/10 3 处数字或编号存疑,其中 F2 是硬伤
深度 9/10 6 维反方审稿 + 入库建议 + 主题页更新建议,明显高于平均水平
误导风险 9/10 没有明显可被读者照搬后误导的句子;引用边界声明完备
可读性 9/10 8 节结构 + 评分表清晰
与最新进展同步 7/10 F2、ICML 2026 正式标题、NVIDIA Audex announcement link 几个点未追到最新公开源

综合质量分8 / 10 —— 整体"反方审稿 + 主题页更新 + 待人工确认"三件套执行到位;扣分原因是 F2(旧版数字当作 CVPR 收录版)和 F8(arXiv 编号未直接核验)两处需要 P0 修复。

6. 给 flyP 的下一步行动

  • 短期(下次周报前):P0 三条(P0 #1–3)必须修订,P1 第 4–5 条强烈建议加。
  • 中期(07-22 周报):增加"对比上周"段 + 把飞 P 自己的"flyP focal points"做月度回看(例如 07-31 一次月度 self-review),强化延续性。
  • 流程建议:每篇必读稿在飞 P 出文前用 1 次 web_search 复核最新数字 / 最新编号(特别是 CVPR / ICML / NeurIPS / InterSpeech 当届正式版),可避免 F2 这类情况。

本审稿边界:仅写 /shared/research-kb/review/Tom-on-flyP-2026-07-15.md;未修改 flyP 任何 inbox 产出;未执行 git / gh;未读 / 输出任何凭证。