• 质量分:7

Tom 评 flyP · 2026-10-05

被评对象:flyP 2026-10-05-0950 精读《Ego2Act + Video Generation Models Survey 双连弹》 文件路径:/shared/research-kb/inbox/flyp/2026-10-05-0950-flyP-critical-read-Ego2Act-VideoGen-Survey.md 本轮工作目录:研究知识库 · Wave2 E3 互评 · Tom 评 flyP · 每天14:40 cron


一、整体判断

这是一份模板熟练、节奏稳定的轻量精读产出。flyP 沿用「基本信息 → 核心贡献 → 方法拆解 → 贡献判断 → 实验风险 → 复现难度 → 与活文档脉络 → 可信度 → 是否入库」九段式节奏,两篇论文一气呵成。但深度欠到位——尤其在事实核验与时效信号抓取上比 spark 同类产出慢半拍,没有把 web_abs 页面上一眼能看到的关键事实(venue、code link、cross-institution)及时收进文档。

二、事实准确性(核查结果)

项 flyP 写法 实际 判定
Ego2Act arXiv ID 2610.01092 ✅ 正确 OK
Ego2Act 作者列表 13 人 MBZUAI 主导 ✅ 正确(含 Mohit Bansal / Alham Fikri Aji) OK
Ego2Act 规模 2,640 视频 / 110 任务 ✅ 正确 OK
Ego2Act 开源 "70% 预判开源 + ⚠3 待核实" 摘要明确写 "Code, dataset and project website linked in the paper" ⚠ 轻度误导:已经把链接写进 paper 注释,flyP 当成不确定事项
Ego2Act 提交日期 未写 2026-10-01 v1 缺
Survey arXiv ID 2610.00812 ✅ 正确 OK
Survey 作者 12 人("可能跨机构") 12 人,跨 ASU / Twitch / Stanford / eBay / NewsBreak 等 5+ 机构 ⚠ 轻度误导:摘要注释里能看出多机构标,flyP 当不确定
Survey 提交日期 未写 2026-09-30 v1 缺
Survey 收录 未提 已发表在 TMLR 2026(Comments: "Published in Transactions on Machine Learning Research (TMLR), 2026") ❌ 重要遗漏——这是升档元老级的硬证据
Survey 配套 未提 有 GitHub repo + 项目页(已贴在 HF paper page) ❌ 重要遗漏
Survey 四象限问题 列出 4 项 ✅ 与摘要原文一致 OK

三、深度评估

够用的部分: - 「方法拆解」段虽然标注"基于摘要推断",但拆解方向正确(物理合理性 / 目标达成度 / 视觉保真度 / 多步一致性),对一般升档预备已足够。 - 「与活文档脉络关系」承接 v87+23 + 10-04 三连弹(flyP 自己昨天的 RAG Landscape / OneStreamer / 2150 followup),有内部一致性。 - 「⚠3 第 1 日观测」与 multimodal.md §2.39.628+629 锚定建议是结构化的活文档增量信号,可执行。

不够的部分: 1. venue + 开源状态没顺手抓——这是升档判断的两大权重。Survey 已经 TMLR 2026 发表 + 有 GitHub,按 flyP 自己的"元老级主题"升档标准早就够线,不需要"待核实"。 2. Ego2Act 摘要注释里就写了 code/dataset/project website,flyP 却以 70% 概率预判,浪费了一次精读机会。 3. 作者隶属没去 arxiv html 拉一下——Survey 作者标号 1-9 已经写明 ASU/Twitch/Stanford/eBay/NewsBreak 等机构,结论"跨机构代表性弱"被自己的假设推翻。 4. 没给两个 paper 互相交叉的引用证据——Survey 主题是 video generation post-training,Ego2Act 是 embodied video gen benchmark,二者在"self-forcing / DPO 在长视频生成对齐"这条线上是同一波工作流。可在 §4 综合判断里点一下。 5. 基线模型没具体到 Sora / Veo / Wan 系列版本号,只说"Sora / Veo / Wan2.2 / CogVideoX"——Survey HTML 里引用了 Wan 2.x 全系列,flyP 可以引用具体段落加深"视频生成后训练四象限"的论据。 6. HF Daily 10-04 早棒 44▲ #6 → 10-05 55▲ #9 顶置续立 第 2 日这条信号没用——10-05 已是新一日数据,如果只是延续就不应该写"第 2 日"。这是数据时序认知错位。

四、是否有误导

  • 无硬性误导——核心结论(升档 multimodal.md §2.39.628+629)方向正确。
  • 但 "Survey 待核实四象限 + 统一评测协议" 的措辞让读者误以为 Survey 可能缺乏这种系统性 —— 实际上 Survey 已经把"post-training 作为统一框架,区分 implicit alignment vs explicit alignment"作为核心卖点,flyP 自己没引用这段,是抓重点的遗漏,不是误导。

五、可读性

  • ✅ 结构清晰,章节编号一致,每节末尾有自评(⭐⭐⭐⭐)和入库建议。
  • ⚠ "⚠3 第 1 日观测" 这种 emoji-token 在不同上下文复用含义,第一次出现时未给定义。短句密度可以再压一压(文档已经 200+ 行但真正新信息密度有限)。
  • ⚠ "本轮完成 / 单轮双连弹" 这种 banner 句偏多,对评审者抓重点形成干扰。

六、与最新进展的差距

  • 没引用 Survey 里 "implicit alignment vs explicit alignment" 这条关键二分法——这是 Survey 最有原创性的提法之一,比"四象限问题"更接近作者真主张。
  • 没引用 Survey 摘要里的 "adapt pretrained models without retraining them from scratch"——这是 post-training 区别于 full-finetune 的核心定义,对活文档 §2.39.629 升级元老级有用。
  • 没引用 Ego2Act HTML 提到的 Deng et al. 2026 ICML "Rethinking video generation model for the embodied world"(arXiv:2601.15282)——这是 embodied video gen 的近邻基线,flyP 应该放进 Ego2Act 的相关工作段。

七、可执行的修改建议(按优先级)

  1. 【必做】 把 Survey 段落从"⚠3 待核实"全部降级为"已确认"——TMLR 2026 发表 + GitHub + Project page + 跨机构 5+ 是硬事实,应直接写进 §3.1 / §3.5 / §3.7。
  2. 【必做】 Ego2Act §2.1 加上 "Code, dataset, project website linked in paper" 引用,把"70% 预判开源"删掉。
  3. 【建议】 Survey §3.3 补充 "post-training = adapt pretrained models without retraining from scratch" + "implicit vs explicit alignment" 二分法——这是 Survey 的真主张。
  4. 【建议】 Ego2Act §2.5 加一条"对比基线"——Deng et al. 2026 ICML "Rethinking video generation model for the embodied world" (arXiv:2601.15282),明示是同领域相邻工作而不是替代。
  5. 【建议】 §4.1 综合判断加一段 "两篇工作流同源"——Survey 提供 post-training 框架(self-forcing / DPO / RM),Ego2Act 提供评估场域,两者闭环。
  6. 【可选】 把"⚠3 第 1 日观测"在首次出现时用一句话定义(如"⚠3 = 升档预备级观测窗"),并统一语义——避免 10-04 起的复用累积歧义。
  7. 【可选】 删掉结尾的"本轮精读产出完毕 · flyP · 2026-10-05 09:50 CST · 轻量模式 · 单轮双连弹"banner 类结尾——属于装饰性内容,对升档入库动作无信息增益。

八、综合打分

  • 事实准确性:6.5/10(venue + 开源 + 跨机构三处误判)
  • 深度:7/10(九段式熟练但没挖到 Survey 原文的核心二分法)
  • 可读性:8/10(结构清晰 banner 略多)
  • 时效性:7/10(10-04 vs 10-05 信号叠加用得不够干净)
  • 与最新进展契合:6.5/10(Survey 已发 TMLR 没抓住;Ego2Act 没用上 ICML 近邻)

加权总分:7.0 / 10

7 分不是否定,是「模板稳定 / 信号抓取需要补强」。下一轮建议在「摘要注释 + arxiv html 头段」抓 venue / open-source / author affiliation 三件事,再决定升档与否——这一轮 Survey 已经满足元老级,flyP 自己降级到 ⚠3 是过度保守。


Tom · 2026-10-05 14:40 CST · 研究知识库 · Wave2 E3 互评 · 边界:仅写 review/ 下本文件