flyP 微审稿 2026-07-15 09:50 · 候补升级判断
任务班次:cron 3d8f503a 当日第 3 次(轻量精读) 本文档性质:对今日
multimodal-candidates.jsonl中两条"候补"条目做反方审稿 + 主题合并建议,不重复上午班已做的 must-read 精读。 约束:仅基于 arXiv 摘要与 CVPR 元数据,不抓全文;遵守 flyP 写作范围/shared/research-kb/inbox/flyp/。
1. 本次主题
把上午未消化的两条"候选"做最小化判断:是否升级为 must-read、是否与今日已精读条目合并主题页、是否本周内补抓。
2. 检索范围
- arXiv abs 页(仅 abstract / metadata)
- CVPR 2026 Open Access 元数据(PDF 仅确认作者与标题)
- 今日上午已写入的 5 篇 flyP 精读稿(
2026-07-15-0950~0955)
未抓全文;未调用 GitHub / HF API。
3. 候选条目 + 反方审稿
3.1 E-VQA(Evidence-Backed Video QA)· arXiv 2607.11862
| 字段 | 值 |
|---|---|
| 标题 | Evidence-Backed Video Question Answering |
| 链接 | https://arxiv.org/abs/2607.11862 |
| 提交 | 2026-07-13 |
| 任务定义 | 同时输出"语义答案 + 时空证据(时间段 + 跟踪过的物体分割 masklet)" |
| 数据集 | 文中提到 ST-Evi*(摘要截断,未取全文) |
核心贡献(摘要级) - 把 Video LLM 的可解释性从"文本 rationale / 稀疏 bbox" 推到 dense tracked masklet:能覆盖遮挡、非刚体形变等动态。 - 任务定义本身(新任务 + 新标注协议)大于模型贡献。
主要问题(反方审稿) 1. 标注成本:dense masklet × 时间段 × 跟踪 ID 比 bbox×frame 高一个数量级,数据集规模很可能 <1k 视频,与现有 VideoQA(数十 k)不在一个量级,泛化结论会非常脆弱。 2. 评估歧义:masklet IoU 的阈值怎么定、跟踪 ID 切换是否计入 penalty,摘要里没说——这恰是这一类任务的命门。 3. "Evidence-Backed" ≠ Faithful:仅看摘要未提任何 faithfulness 指标(如"答案正确且 evidence 被删后答案必须变化"),容易做成 post-hoc rationalization。
可信度:中(任务定义有意思,但数据集规模与评估口径必须等 PDF §4 + §5 才能判断)。
是否升级为 must-read:否——今日上午已用 Thinking-with-Video(0950)覆盖了"video reasoning"主题,E-VQA 偏 video-grounding/segmentation 侧,属于不同子方向。建议降级为"下周观察清单",待 PDF 公开 + 数据集放出再做主题页。
主题页建议:可与未来的 notes/multimodal/video-grounding/ 合并,不建独立主题页。
3.2 ForeSight(CVPR 2026)· 见元数据
| 字段 | 值 |
|---|---|
| 标题 | See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection |
| 作者 | Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang |
| 单位 | Baidu Inc + Zhejiang University + HIT |
| 收录 | CVPR 2026(OpenAccess 已挂 PDF) |
| 标签 | #VLM #RL #low-level-vision #tool-use #CVPR2026 |
核心贡献(摘要级 + 标题级推断) - 用 low-level 视觉线索(边缘 / 深度 / 分割图)作为 VLM 推理的"反射"输入,配套 reflection 机制。 - 工业味:百度主投,已被 CVPR 2026 收录,落地动机强。
主要问题(反方审稿) 1. "low-level visual cues + reflection" 的新颖性边界:2025 年已经有一波 VLM + 工具调用 / 草稿本式 reflection 工作(ToT、Reflexion、Visual-CoT 系列),摘要级证据不足以判断 ForeSight 是真的把 low-level 信号做成了训练目标(RL reward),还是只在推理时拼接。 2. 实验基座:是否在同一 base model + 同等 RL 数据下做 ablation?摘要未给表格,Baidu 风格报告经常"vs Qwen2.5-VL / InternVL / GPT-4o"但 ablation 节被剪。 3. 可复现:百度系工作通常不开权重 / 不放训练数据,复现风险偏高。
可信度:中(CVPR 2026 背书 + 工业实证;但与今日上午 0951 VLM-CapCurriculum 同属"VLM 后训练 / curriculum"主题,方向重叠)。
是否升级为 must-read:否——与 0951 VLM-CapCurriculum(perception–reasoning 解耦 curriculum)方向重叠,差异化点只在"low-level cues"与"reflection"。建议合并入 VLM 后训练主题页,作为"另一条路线"对比条目,本周不必单独精读全文。
主题页建议:未来 notes/vlm/post-training/ 主题页里加 1 段"另一条路线:low-level reflection",引用 ForeSight 即可。
4. 高价值条目(本次实际升级的)
无。今日上午班 0950–0955 已覆盖当日所有 must-read。两条候补按"反方审稿 + 主题合并"处理即可,无需新增精读稿。
5. 分类标签
#video-qa#video-grounding#masklet-tracking#vlm-post-training#curriculum#low-level-vision#reflection#cvpr2026#flyp-micro-triage
6. 建议写入路径
| 类型 | 完整路径 | 状态 |
|---|---|---|
| 本次微审稿 | /shared/research-kb/inbox/flyp/2026-07-15-0956-candidates-micro-triage.md |
✅ 本次写入 |
| 主题页(建议合并不新建) | notes/vlm/post-training/、notes/multimodal/video-grounding/ |
⏳ 由 Anan 决策 |
| 候补跟踪清单(建议) | /shared/research-kb/inbox/flyp/2026-07-22-pending-list.md(下周班写入) |
⏳ 下周 |
说明:flyP 写作范围仅限 /shared/research-kb/inbox/flyp/;不写入 notes/ review/ published/;不执行 git / gh。
7. 后续验证动作
- E-VQA:下周(07-22)班次若 PDF 已挂公开 §4 数据集规模 + §5 评估口径,再决定是否升级为短评(不超过 1 页)。
- ForeSight:等 Baidu 官方 GitHub / ModelScope 是否同步放权重;若不放,仅作为 CVPR 2026 主题页的"路线对比"一行引用。
- 跨班次去重:已确认本次判断不与上午
0950 Thinking-with-Video、0951 VLM-CapCurriculum、0952 Audex 30B A3B、0953 VoxENES 2026、0954 Xiaomi-Robotics-U0、0955 Substack LWMAI #40任一条目重复主题方向。
引用边界声明:本稿仅引用 arXiv abs 摘要 + CVPR OpenAccess 元数据;不复制任何全文 / PDF / 图。