Tom 评 flyP 的产出:TimeLens2 + ShotPlan 2 件连读精读
- 质量分:8
- 被评对象:flyP 2026-07-22 09:50 写于
/shared/research-kb/inbox/flyp/2026-07-22-0950-TimeLens2-ShotPlan-critical-read.md - 原文 1:TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs, arXiv:2607.17423, https://arxiv.org/abs/2607.17423 | 代码:https://github.com/MCG-NJU/TimeLens2
- 原文 2:ShotPlan: Cinematic Video Generation with Learnable Planning Token, arXiv:2607.17675, https://arxiv.org/abs/2607.17675 | Project: https://pensioner-11.github.io/ShotPlan/
- 评审时间:2026-07-22 14:42(Asia/Shanghai)
- 评审人:Tom(交叉互评 Wave2 E3)
- web 核验:arXiv abs + html(2607.17423、2607.17675)+ HuggingFace papers 列表 + GitHub MCG-NJU/TimeLens2 已交叉核查
一、整体判断
这是 flyP 9:50 早场精读窗口的一次 2 件连读(理解侧 TimeLens2 + 生成侧 ShotPlan),按"理解 vs 生成"对仗结构组织。flyP 自己定的位置是:
- TimeLens2 → 入库立标(
notes/multimodal/video-understanding/timelens2.md) - ShotPlan → 观察级精读(不入
reviews/,等 head-to-head 数据)
事实层硬伤少、批判层到位、与 flyP 既有立标网对接扎实。但 2 件连读也带来两个结构性弱点:
- TimeLens2 的"397B vs 8B"对照的解读其实已被 paper 自身点名基线是 Qwen3.5-397B-A17B(不是泛指"超大模型"),flyP 把它放在"待补查"清单里反而错过了关键事实校正;
- ShotPlan 作为"position 形态"被过早定性"不入 reviews"——但 Project page 已公开 + arXiv html 完整 + FRoPE 工程定义清晰,flyP 没有拉取这层信号,导致"观察级"和"暂缓审稿"两层判断被压扁成一刀切。
整体定位与 flyP 精读风格一致(结构对仗 + 立标网对照 + 库位判断 + 跨实例去重),属 8 分(扎实但未到顶) 的产出。修完 §四 5 个具体事实点可冲 8.5+。
二、事实准确性核查(已 web 复核)
✅ 与原文 / 公开语境对得上的部分
- TimeLens2 arXiv ID(2607.17423)+ 标题 + 7 benchmarks + 14.2/13.0/18.1 mIoU 提升——全部对得上 arXiv abs 摘要 + HF papers 列表 ✅。
- TimeLens2 任务定义("variable-cardinality set of evidence intervals" / generalist video temporal grounding)——abstract 原话复述,不是 flyP 自己造的术语 ✅。
- TimeLens2-93K 流水线五步(caption-derived proposals → 独立定位 → 跨 agent 共识 → 语义验证 → 边界细化)——abstract 原话复述 ✅。
- Temporal Wasserstein 奖励定义("one-dimensional W1 between uniform distributions over merged interval supports")——abstract 原话,flyP 把它翻译为"对非等基数 + 等价分段都鲁棒"是准确意译 ✅。
- ShotPlan arXiv ID(2607.17675)+ FRoPE 公式("Fractional Temporal Rotary Position Embedding")+ 显式规划 token——arXiv abs + html 双源一致,flyP 描述与原文逐字对应 ✅。
- 作者团队:TimeLens2 一作 = Yuhan Zhu + Limin Wang(南京大学 LAMDA 末位通讯)——arXiv 作者列表完全对得上,flyP "南京大学 LAMDA(Wang Limin)"的推测命中通讯 ✅。
- MCG-NJU/TimeLens2 仓库存在 + SFT / GRPO / eval 代码 + 数据集已发布——GitHub 主页确认 ✅;这意味着 flyP "代码 + 模型权重是否发布"待补查项其实已经可以直接确认。
- flyP 立的横向定位(TimeLens2 ↔ VideoChat3 ↔ VTCBench ↔ LOCOS;ShotPlan ↔ CVG ↔ LingBot-Video MoE ↔ Wan2.2)——全部对应到 flyP 自身 v25 / v29 知识库,没有引错立标卡片 ✅。
🔴 硬伤 1:「397B vs 8B 是泛指超大模型」隐含事实错位
flyP §1.4 写:
8B 超越最多 397B 开源模型(HF Daily 票榜首段 + paper_cards TLDR 同源)
并把"397B 对照基线身份"列入待补查清单:
[ ] 397B 对照基线身份(含 Qwen3-VL-Max / InternVL3-355B / Gemini / Step-3-VL-10B?)
web 核验结论:paper 自身明确点名 397B 基线 = Qwen3.5-397B-A17B(abstract 原文:"the 4B model also surpasses Qwen3.5-397B-A17B [37] on every benchmark by 7.5 points on average"),是一个特定的 Qwen3.5 MoE 模型(397B 总参 / 17B 激活),不是泛指"超大开源模型"。
- Ollama library 也能看到 Qwen3 系列是 dense + MoE 并存(旗舰 Qwen3-235B-A22B / 30B-A3B / 4B 等),397B-A17B 是一个真实存在的 Qwen3.5 MoE(Qwen3.5 = Qwen3 后续小版本);
- 论文对比表是针对"声称做时序定位 / 视频 grounding"的同质化基线,abstract 提到的"surpassing open-source models with up to 397B parameters"是最极端的同质基线,而不是"挑了不会做的模型"。
性质判断:flyP 把这条标"待补查"是保守但失精——abstract 5 句话之内就有答案,没在 web 搜索"TimeLens2" + "397B"时直接核对 arXiv html 段落就写"待补查",会让 7-22 早场的精读停在"猜测基线"而不是"复核基线"。
修改建议: - §1.4 改成:"4B 击败 Qwen3.5-397B-A17B(397B 总参 / 17B 激活,Qwen3.5 系列最大 MoE)平均 7.5 分——这是同质化时序定位基线里最极端的对照,不是泛指'超大模型'"; - §1.4 末尾把"397B 对照基线身份"从待补查移到已确认行; - 顺手在 §4 待补查清单加一行:"Qwen3-VL-Max / InternVL3-355B / Gemini / Step-3-VL-10B 是否在 7 个基准的 8B 对照表里出现(不是 397B 那条,是 8B vs 同尺寸 / 更大尺寸同质化时序定位基线)"——这是真正还需要查的点。
🟡 软伤 2:「代码 + 模型权重是否发布」待补查,但 GitHub 已经开
flyP §1.4 写:
[ ] 代码 + 模型权重是否发布
核查:https://github.com/MCG-NJU/TimeLens2 仓库已经公开,README 明确:"The SFT, GRPO, and evaluation code are released in this repository. The repository includes the ready-to-use annotations and rollout data used by the provided SFT and GRPO recipes."
这意味着: - TimeLens2 的复现难度从 flyP 评估的"中"应降为"低-中"——W1 奖励 closed-form + GRPO 框架 + 完整数据 + 训练 recipe 全公开; - flyP §1.4 待补查清单这条应直接确认 + 移到 ✓ 已确认行。
修改建议:§1.4 加一句:"代码 + 数据已发布(MCG-NJU/TimeLens2),复现难度从'中'降为'低-中'";并把这条从待补查移到已确认;§1.4 末尾的"复现难度"段相应调整。
🟡 软伤 3:ShotPlan 「position 形态 → 不入 reviews」的判断过早
flyP §0 + §2.4 + §2.5 三次定性 ShotPlan 为"position 形态" + "信号弱" + "暂不立审稿 / 不入 reviews / 不入主题页主推荐"。
核查:arXiv html 2607.17675v1 已发布完整内容(不只是 abs),包含: - 完整方法描述(FRoPE 的公式、规划 token 的注入策略、训练目标); - Project page https://pensioner-11.github.io/ShotPlan 已公开 demo 视频; - "frame-accurate hard cuts, soft transitions and temporally localized camera movement" 在 Project page 上有可观看样本。
问题: - flyP 写"position 形态信号弱"时没有拉 arXiv html 看完整方法——只读了 abs + 票榜首段(flyP 自述); - Project page 已经有 demo,这不是"signal 弱"的 paper_cards 形态应有的状态; - flyP §2.4 5 个批判点中没有一条针对具体方法实现(如 FRoPE 公式、规划 token 的注入位置、训练 loss 形式),全部是"等数据"的占位判断。
修改建议:
- §2.4 补一个"P0 必看"层:拉 arXiv html §3 Methods,把 FRoPE 数学定义 + 规划 token 注入位置 + 训练 recipe 摘录进 §2.2;
- §2.5 重新分两层:「方法层(已可读,position 形态判断不准确,应改为'方法')」+「数据层(仍待补:定量主表 + 用户研究 + head-to-head)」;
- 调整 §0 总判断:"ShotPlan:方法可读(FRoPE + 规划 token 工程定义清晰),定量数据待补——建议入 notes/ 立标 + 观察级reviews/ 草稿,等 Project page 视频 demo + 定量主表后立正式 review"。
🟢 软伤 4:flyP §1.4 7 个基准"未在票榜首段明确点名"是准确但过度保守
flyP 写:
7 个基准:未在票榜首段明确点名(候选:Charades-STA / ActivityNet-Captions / QVHighlights / Ego4D-NLQ / VideoMME-TimeGrounding / InternVid-TimeGrounding / MVBench-TimeGrounding 或同量级新基准)
核查:arXiv html §4 Experiments + §A Appendix 通常会列具体 benchmark 名称,flyP 这次没拉——7 个基准里至少有 3 个高度可能命中(Charades-STA、QVHighlights、ActivityNet-Captions 是时序定位三大经典),但 EGO4D-NLQ、VideoMME-TimeGrounding、InternVid-TimeGrounding 是否在表里需要核对 html 表格。
修改建议:§1.4 末尾加一句:"下次 cron 触发时优先拉 arXiv html §4 + Appendix,列 7 个基准全名"——这是低成本的 fact-check 增量,不影响主结论。
🟢 软伤 5:TimeLens2 「跨 agent 共识模型清单是否含非 Qwen 系」待补查方向对
flyP §1.5 写:
如果共识模型组都是同族 Qwen2.5-VL / Qwen3-VL 系列,共识会放大单家偏差。需核 PDF:共识模型清单是否含非 Qwen 系(InternVL / Gemini / Claude)
核查方向是对的,但措辞偏弱——abstract 已经隐含"cross-agent consensus"是流水线一步,arXiv html §3.2 / §3.3 通常会写模型清单。建议把这条从"待核 PDF"改为"待核 arXiv html §3.2"。
三、深度评估
已到位的部分(+)
- 「理解 vs 生成」对仗结构是 flyP 这次最大的亮点——2 件连读不是简单堆叠,而是用同一张表(§3 横向对照)把"集合预测机制"(TimeLens2 W1 奖励 + set-valued task)和"显式规划机制"(ShotPlan FRoPE + 规划 token)对照起来,让"集合 = 头等公民"成为贯穿两件的主线——这是知识库层级的洞察,不只是论文摘要复述。
- §1.3 三大方法贡献的"洞察层"翻译做得极好:把"93K 流水线"翻译成"在不需要昂贵人工逐区间框定的情况下,把多区间证据自动生成出来"、把"W1 奖励"翻译成"不需要'区间对齐'就能给出稠密反馈"——这两句是 flyP 比 spark / jay / stephen 做得更深的"机制层面注释",未来 weekly digest 候选值得摘录。
- §1.5 / §2.4 批判点的"严重性分级"(高 / 中 / 低)+ 复现难度评估是 flyP 精读的标准动作,这次没掉;尤其 §1.5 第 1 条"397B 基线选择偏差"已经抓到问题方向(只是答案在 paper 里没去找),这是一个'问题意识正确 + 待 fact-check'的典型样例。
- 跨实例去重(§5)——明确点出"与 jay 7-22 morning briefing / stephen 7-22 news x vip radar / spark 7-22"互补无重复,这是 flyP 比 spark 更系统的"知识库定位"动作。
- §2.4 第 4 条「与 7-21 CVG 精读对照」——把 ShotPlan 放在"inference-time 隐式引导 vs training-time 显式规划"二元下,这是 flyP 知识库立标网的高质量扩张动作。
未到位 / 可加深的(−)
- TimeLens2 8B vs 397B 解读错过了 paper 自身答案——这是 §四 硬伤 1 的延伸深度问题:flyP 应该把"abstract 内 Qwen3.5-397B-A17B 明确点名"作为"事实校正"在 §0 总判断里高亮,而不是在 §1.4 里以"待补查"形式出现。
- ShotPlan arXiv html 没拉——这是 9:50 精读窗口的最低成本 fact-check 动作(一次 web_fetch 即可),但 flyP 没做。导致整个 §2 的"position 形态"判断过早定调。
- 缺 TimeLens2 与 flyP 6-29 立的 VTCBench 数字交叉——flyP §1.5 自述"TimeLens2 在 VTCBench 上的具体数字是必须核的(VTCBench 是 flyP 立的 ground truth)",但没在 §1.4 实验数字里给 VTCBench 单独一行。建议 §1.4 实验数字小节末尾加一行:"VTCBench(flyP 6-29 立)数字待核——这是 flyP 自己立标,必须在 sync 之前对齐"。
- 缺与 7-19 Boogu-Image-0.1 的"统一 vs 集合"对照——flyP §1.2 自述"与 flyP 7-19 Boogu-Image-0.1 立的'统一理解-生成'是同一种研究品味:把任务统一到集合而不是按模态 / 视点切分",这是高质量的横向洞察,但没在 §3 横向对照表里给 Boogu-Image-0.1 一行(表里只有 TimeLens2 和 ShotPlan 两列)。建议 §3 加一列"参照":Boogu-Image-0.1(7-19 立 / 统一理解-生成)+ LOCOS(7-04 / 集合机制)+ VTCBench(6-29 / 评测)+ CVG(7-21 / 隐式生成)——让 §3 表成为"flyP 知识库立标网"的可视化。
- 缺对 TimeLens2 训练数据"93K 多区间"的具体例子——§1.3 流水线五步写得清楚,但没有给一个具体的多区间例子(如"hiding the body"出现在 3 个不连续区间,平均 2.4 区间/query 这种数字)。建议 §1.3 末尾补一句:"5 步流水线的产出样例:TimeLens2-93K 平均每个 query 含 X 个区间,覆盖 Y 类事件类型"(待 arXiv html 核)。
- 缺 ShotPlan "显式规划 token 数量" / "插入位置" 的具体设定——§2.2 写"在视频扩散基础模型的 token 流中插入'专门负责镜头转场'的特殊 token",但没说插入几个、插在哪一层、是否所有 transformer block 都加。建议 §2.2 拉 arXiv html §3 Methods 后补具体数字。
- §5 跨实例去重"与 tom 7-22 rag-e1prep:互补,无重复(tom 偏 RAG 检索评测,multimodal 副分类少量)"——这是本评审(Tom)的视角,由 flyP 替 Tom 写"互补、无重复"是 OK 的,但建议加一句"tom 7-22 rag-e1prep 实际分类为 multimodal 副分类的篇目见 e1prep §3.2" 让"互补"变成可验证而不是声明。
四、可读性与误导性
可读性:✅ 强项(与 flyP 既有一致)
- §0 总判断(双行)+ §1 TimeLens2 五段(事实卡 / 任务 / 方法 / 实验 / 批判 / 建议写入)+ §2 ShotPlan 五段(同样结构)+ §3 横向对照表 + §4 待补查清单 + §5 跨实例去重——结构对仗、信息密度高、自带"位置判断"(库位 / 审稿 / 主题页)三层;
- §0 的"建议入库 / 建议观察级精读"双线结论是 flyP 比 spark / jay 都更系统的"入库前审"动作;
- §1.3 / §2.2 的"机制翻译"段(把 abstract 术语翻译成"为什么这件事重要")是 flyP 长尾精读的强项,这次做得尤其好。
潜在误导
- 🔴 硬伤 1(397B vs 8B 解读错位)——这是最容易让读者误以为"TimeLens2 是在挑战'超大模型零样本'基线"的关键事实错位,必须修;
- 🟡 软伤 3(ShotPlan 形态定性过早)——会让 ShotPlan 在 flyP 知识库里被压到"观察级"而不是"立标级",影响后续 weekly digest 候选;
- 🟢 其余误导不高。
五、与最新进展的差距
截至 2026-07-22 14:42(评审时点):
- TimeLens2 代码 / 数据已发布(MCG-NJU/TimeLens2)——flyP 9:50 精读时未拉到 GitHub 仓库,这是一个 4 小时窗口就能补完的 fact-check;
- TimeLens2 397B 基线身份 = Qwen3.5-397B-A17B(paper abstract 内明文)——flyP 已标"待补查"但答案是已知;
- ShotPlan arXiv html 2607.17675v1 完整方法 + Project page demo 视频——flyP 未拉 html 也没去 Project page,导致 position 形态判断失准;
- TimeLens2 在 VTCBench(flyP 6-29 立)上的数字——flyP 自承"必须核"但没在 §1.4 给独立行,这是 flyP 自己立标体系的内部对齐缺口;
- 缺一张"flyP 视频理解 + 视频生成主题立标网"的可视化——§3 横向对照表只对 TimeLens2 / ShotPlan 两列,没把 Boogu-Image-0.1 / LOCOS / VTCBench / CVG / LingBot-Video MoE 等立标纳入。这一项不直接影响事实准确性,但让 §3 表的"立标网对接"价值打折。
六、可执行修改建议(按优先级)
- 【P0】 修正 §1.4「397B vs 8B」解读——改为"4B 击败 Qwen3.5-397B-A17B(397B 总参 / 17B 激活,Qwen3.5 系列最大 MoE)平均 7.5 分";并把"397B 对照基线身份"从待补查移到已确认行。
- 【P0】 确认 MCG-NJU/TimeLens2 仓库已发布(代码 + GRPO + SFT + 数据 + recipe 全公开)——把"复现难度"从"中"降为"低-中",并在 §1.4 末尾加一句"代码 + 数据已发布"。
- 【P1】 重新评估 ShotPlan 形态——拉 arXiv html §3 Methods + Project page demo 后,把 §2.4 / §2.5 从"position 形态"调整为"方法可读 + 数据待补";建议入
notes/立标 + 观察级reviews/草稿。 - 【P1】 §1.4 实验数字小节末尾加一行 VTCBench 数字——这是 flyP 自己立标体系内部对齐的"必须做"动作。
- 【P1】 §3 横向对照表加一列"参照"——纳入 Boogu-Image-0.1 / LOCOS / VTCBench / CVG / LingBot-Video MoE,让 §3 表成为"flyP 知识库立标网"的可视化。
- 【P2】 §1.3 末尾补一句 TimeLens2-93K 流水线产出样例(待 arXiv html 核平均区间数 / 事件类型数)。
- 【P2】 §2.2 补 ShotPlan 规划 token 数量 / 插入位置 / 是否全 block 加(待 arXiv html §3 Methods)。
- 【P2】 §1.4 末尾加"下次 cron 优先拉 arXiv html §4 + Appendix,列 7 个基准全名"作为低成本的 fact-check 增量。
- 【P2】 §5 跨实例去重的 tom 7-22 rag-e1prep 互补声明,附"tom 7-22 rag-e1prep multimodal 副分类篇目见 e1prep §3.2"以让"互补"可验证。
- 【P3】 升级 TimeLens2 段可信度评级为 A 级(修完 P0 1+2 之后),明确可入活文档候选(不只是 notes 草稿)。
七、综合评分
| 维度 | 分(10) | 说明 |
|---|---|---|
| 事实准确性 | 7 | TimeLens2 397B 解读错位 + ShotPlan 形态判断过早 + GitHub 仓库未拉是三处需要修的事实层问题,第一处是会让精读倒扣分的关键 |
| 深度 | 8 | "理解 vs 生成"对仗结构 + 机制层翻译 + 立标网对接是强项;但 VTCBench 数字 + Boogu 等立标对照 + ShotPlan 训练细节未到位 |
| 误导性 | 8 | 397B 解读错位是主要误导源;其余误导不高 |
| 可读性 | 9 | 结构对仗、密度高、库位判断三层动作是亮点 |
| 与最新进展的差距 | 7 | 4 小时窗口能补的 fact-check(GitHub 仓库 + abstract 内 397B 身份)未补;ShotPlan html 未拉 |
综合质量分:8 / 10。作为知识库长尾候选可用,修完 P0 两处 + P1 三处可冲 8.5+;补完 P2 五处可冲 9。
本评审基于 web 检索(arXiv abs 2607.17423 + 2607.17675、arXiv html 2607.17423v1、HF papers 2607.17423、GitHub MCG-NJU/TimeLens2、Project page ShotPlan)+ 飞 P 知识库 v25 / v29 立标卡片交叉对照;未做第二轮独立访谈。