flyP 微审稿 2026-07-15 09:50 · 候补升级判断

任务班次:cron 3d8f503a 当日第 3 次(轻量精读) 本文档性质:对今日 multimodal-candidates.jsonl 中两条"候补"条目做反方审稿 + 主题合并建议,不重复上午班已做的 must-read 精读约束:仅基于 arXiv 摘要与 CVPR 元数据,不抓全文;遵守 flyP 写作范围 /shared/research-kb/inbox/flyp/


1. 本次主题

把上午未消化的两条"候选"做最小化判断:是否升级为 must-read、是否与今日已精读条目合并主题页、是否本周内补抓。


2. 检索范围

  • arXiv abs 页(仅 abstract / metadata)
  • CVPR 2026 Open Access 元数据(PDF 仅确认作者与标题)
  • 今日上午已写入的 5 篇 flyP 精读稿(2026-07-15-0950 ~ 0955

未抓全文;未调用 GitHub / HF API。


3. 候选条目 + 反方审稿

3.1 E-VQA(Evidence-Backed Video QA)· arXiv 2607.11862

字段
标题 Evidence-Backed Video Question Answering
链接 https://arxiv.org/abs/2607.11862
提交 2026-07-13
任务定义 同时输出"语义答案 + 时空证据(时间段 + 跟踪过的物体分割 masklet)"
数据集 文中提到 ST-Evi*(摘要截断,未取全文)

核心贡献(摘要级) - 把 Video LLM 的可解释性从"文本 rationale / 稀疏 bbox" 推到 dense tracked masklet:能覆盖遮挡、非刚体形变等动态。 - 任务定义本身(新任务 + 新标注协议)大于模型贡献。

主要问题(反方审稿) 1. 标注成本:dense masklet × 时间段 × 跟踪 ID 比 bbox×frame 高一个数量级,数据集规模很可能 <1k 视频,与现有 VideoQA(数十 k)不在一个量级,泛化结论会非常脆弱。 2. 评估歧义:masklet IoU 的阈值怎么定、跟踪 ID 切换是否计入 penalty,摘要里没说——这恰是这一类任务的命门。 3. "Evidence-Backed" ≠ Faithful:仅看摘要未提任何 faithfulness 指标(如"答案正确且 evidence 被删后答案必须变化"),容易做成 post-hoc rationalization

可信度:中(任务定义有意思,但数据集规模与评估口径必须等 PDF §4 + §5 才能判断)。

是否升级为 must-read——今日上午已用 Thinking-with-Video(0950)覆盖了"video reasoning"主题,E-VQA 偏 video-grounding/segmentation 侧,属于不同子方向。建议降级为"下周观察清单",待 PDF 公开 + 数据集放出再做主题页。

主题页建议:可与未来的 notes/multimodal/video-grounding/ 合并,建独立主题页。


3.2 ForeSight(CVPR 2026)· 见元数据

字段
标题 See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
作者 Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang
单位 Baidu Inc + Zhejiang University + HIT
收录 CVPR 2026(OpenAccess 已挂 PDF)
标签 #VLM #RL #low-level-vision #tool-use #CVPR2026

核心贡献(摘要级 + 标题级推断) - 用 low-level 视觉线索(边缘 / 深度 / 分割图)作为 VLM 推理的"反射"输入,配套 reflection 机制。 - 工业味:百度主投,已被 CVPR 2026 收录,落地动机强。

主要问题(反方审稿) 1. "low-level visual cues + reflection" 的新颖性边界:2025 年已经有一波 VLM + 工具调用 / 草稿本式 reflection 工作(ToT、Reflexion、Visual-CoT 系列),摘要级证据不足以判断 ForeSight 是真的把 low-level 信号做成了训练目标(RL reward),还是只在推理时拼接。 2. 实验基座:是否在同一 base model + 同等 RL 数据下做 ablation?摘要未给表格,Baidu 风格报告经常"vs Qwen2.5-VL / InternVL / GPT-4o"但 ablation 节被剪。 3. 可复现:百度系工作通常不开权重 / 不放训练数据,复现风险偏高。

可信度:中(CVPR 2026 背书 + 工业实证;但与今日上午 0951 VLM-CapCurriculum 同属"VLM 后训练 / curriculum"主题,方向重叠)。

是否升级为 must-read——与 0951 VLM-CapCurriculum(perception–reasoning 解耦 curriculum)方向重叠,差异化点只在"low-level cues"与"reflection"。建议合并入 VLM 后训练主题页,作为"另一条路线"对比条目,本周不必单独精读全文。

主题页建议:未来 notes/vlm/post-training/ 主题页里加 1 段"另一条路线:low-level reflection",引用 ForeSight 即可。


4. 高价值条目(本次实际升级的)

。今日上午班 0950–0955 已覆盖当日所有 must-read。两条候补按"反方审稿 + 主题合并"处理即可,无需新增精读稿。


5. 分类标签

  • #video-qa #video-grounding #masklet-tracking
  • #vlm-post-training #curriculum #low-level-vision #reflection
  • #cvpr2026 #flyp-micro-triage

6. 建议写入路径

类型 完整路径 状态
本次微审稿 /shared/research-kb/inbox/flyp/2026-07-15-0956-candidates-micro-triage.md ✅ 本次写入
主题页(建议合并不新建) notes/vlm/post-training/notes/multimodal/video-grounding/ ⏳ 由 Anan 决策
候补跟踪清单(建议) /shared/research-kb/inbox/flyp/2026-07-22-pending-list.md(下周班写入) ⏳ 下周

说明:flyP 写作范围仅限 /shared/research-kb/inbox/flyp/;不写入 notes/ review/ published/;不执行 git / gh。


7. 后续验证动作

  1. E-VQA:下周(07-22)班次若 PDF 已挂公开 §4 数据集规模 + §5 评估口径,再决定是否升级为短评(不超过 1 页)。
  2. ForeSight:等 Baidu 官方 GitHub / ModelScope 是否同步放权重;若不放,仅作为 CVPR 2026 主题页的"路线对比"一行引用。
  3. 跨班次去重:已确认本次判断不与上午 0950 Thinking-with-Video0951 VLM-CapCurriculum0952 Audex 30B A3B0953 VoxENES 20260954 Xiaomi-Robotics-U00955 Substack LWMAI #40 任一条目重复主题方向。

引用边界声明:本稿仅引用 arXiv abs 摘要 + CVPR OpenAccess 元数据;不复制任何全文 / PDF / 图。