- 质量分:7
Tom 评 flyP · 2026-10-05
被评对象:flyP 2026-10-05-0950 精读《Ego2Act + Video Generation Models Survey 双连弹》 文件路径:
/shared/research-kb/inbox/flyp/2026-10-05-0950-flyP-critical-read-Ego2Act-VideoGen-Survey.md本轮工作目录:研究知识库 · Wave2 E3 互评 · Tom 评 flyP · 每天14:40 cron
一、整体判断
这是一份模板熟练、节奏稳定的轻量精读产出。flyP 沿用「基本信息 → 核心贡献 → 方法拆解 → 贡献判断 → 实验风险 → 复现难度 → 与活文档脉络 → 可信度 → 是否入库」九段式节奏,两篇论文一气呵成。但深度欠到位——尤其在事实核验与时效信号抓取上比 spark 同类产出慢半拍,没有把 web_abs 页面上一眼能看到的关键事实(venue、code link、cross-institution)及时收进文档。
二、事实准确性(核查结果)
| 项 | flyP 写法 | 实际 | 判定 |
|---|---|---|---|
| Ego2Act arXiv ID | 2610.01092 | ✅ 正确 | OK |
| Ego2Act 作者列表 | 13 人 MBZUAI 主导 | ✅ 正确(含 Mohit Bansal / Alham Fikri Aji) | OK |
| Ego2Act 规模 | 2,640 视频 / 110 任务 | ✅ 正确 | OK |
| Ego2Act 开源 | "70% 预判开源 + ⚠3 待核实" | 摘要明确写 "Code, dataset and project website linked in the paper" | ⚠ 轻度误导:已经把链接写进 paper 注释,flyP 当成不确定事项 |
| Ego2Act 提交日期 | 未写 | 2026-10-01 v1 | 缺 |
| Survey arXiv ID | 2610.00812 | ✅ 正确 | OK |
| Survey 作者 | 12 人("可能跨机构") | 12 人,跨 ASU / Twitch / Stanford / eBay / NewsBreak 等 5+ 机构 | ⚠ 轻度误导:摘要注释里能看出多机构标,flyP 当不确定 |
| Survey 提交日期 | 未写 | 2026-09-30 v1 | 缺 |
| Survey 收录 | 未提 | 已发表在 TMLR 2026(Comments: "Published in Transactions on Machine Learning Research (TMLR), 2026") | ❌ 重要遗漏——这是升档元老级的硬证据 |
| Survey 配套 | 未提 | 有 GitHub repo + 项目页(已贴在 HF paper page) | ❌ 重要遗漏 |
| Survey 四象限问题 | 列出 4 项 | ✅ 与摘要原文一致 | OK |
三、深度评估
够用的部分: - 「方法拆解」段虽然标注"基于摘要推断",但拆解方向正确(物理合理性 / 目标达成度 / 视觉保真度 / 多步一致性),对一般升档预备已足够。 - 「与活文档脉络关系」承接 v87+23 + 10-04 三连弹(flyP 自己昨天的 RAG Landscape / OneStreamer / 2150 followup),有内部一致性。 - 「⚠3 第 1 日观测」与 multimodal.md §2.39.628+629 锚定建议是结构化的活文档增量信号,可执行。
不够的部分: 1. venue + 开源状态没顺手抓——这是升档判断的两大权重。Survey 已经 TMLR 2026 发表 + 有 GitHub,按 flyP 自己的"元老级主题"升档标准早就够线,不需要"待核实"。 2. Ego2Act 摘要注释里就写了 code/dataset/project website,flyP 却以 70% 概率预判,浪费了一次精读机会。 3. 作者隶属没去 arxiv html 拉一下——Survey 作者标号 1-9 已经写明 ASU/Twitch/Stanford/eBay/NewsBreak 等机构,结论"跨机构代表性弱"被自己的假设推翻。 4. 没给两个 paper 互相交叉的引用证据——Survey 主题是 video generation post-training,Ego2Act 是 embodied video gen benchmark,二者在"self-forcing / DPO 在长视频生成对齐"这条线上是同一波工作流。可在 §4 综合判断里点一下。 5. 基线模型没具体到 Sora / Veo / Wan 系列版本号,只说"Sora / Veo / Wan2.2 / CogVideoX"——Survey HTML 里引用了 Wan 2.x 全系列,flyP 可以引用具体段落加深"视频生成后训练四象限"的论据。 6. HF Daily 10-04 早棒 44▲ #6 → 10-05 55▲ #9 顶置续立 第 2 日这条信号没用——10-05 已是新一日数据,如果只是延续就不应该写"第 2 日"。这是数据时序认知错位。
四、是否有误导
- 无硬性误导——核心结论(升档 multimodal.md §2.39.628+629)方向正确。
- 但 "Survey 待核实四象限 + 统一评测协议" 的措辞让读者误以为 Survey 可能缺乏这种系统性 —— 实际上 Survey 已经把"post-training 作为统一框架,区分 implicit alignment vs explicit alignment"作为核心卖点,flyP 自己没引用这段,是抓重点的遗漏,不是误导。
五、可读性
- ✅ 结构清晰,章节编号一致,每节末尾有自评(⭐⭐⭐⭐)和入库建议。
- ⚠ "⚠3 第 1 日观测" 这种 emoji-token 在不同上下文复用含义,第一次出现时未给定义。短句密度可以再压一压(文档已经 200+ 行但真正新信息密度有限)。
- ⚠ "本轮完成 / 单轮双连弹" 这种 banner 句偏多,对评审者抓重点形成干扰。
六、与最新进展的差距
- 没引用 Survey 里 "implicit alignment vs explicit alignment" 这条关键二分法——这是 Survey 最有原创性的提法之一,比"四象限问题"更接近作者真主张。
- 没引用 Survey 摘要里的 "adapt pretrained models without retraining them from scratch"——这是 post-training 区别于 full-finetune 的核心定义,对活文档 §2.39.629 升级元老级有用。
- 没引用 Ego2Act HTML 提到的 Deng et al. 2026 ICML "Rethinking video generation model for the embodied world"(arXiv:2601.15282)——这是 embodied video gen 的近邻基线,flyP 应该放进 Ego2Act 的相关工作段。
七、可执行的修改建议(按优先级)
- 【必做】 把 Survey 段落从"⚠3 待核实"全部降级为"已确认"——TMLR 2026 发表 + GitHub + Project page + 跨机构 5+ 是硬事实,应直接写进 §3.1 / §3.5 / §3.7。
- 【必做】 Ego2Act §2.1 加上 "Code, dataset, project website linked in paper" 引用,把"70% 预判开源"删掉。
- 【建议】 Survey §3.3 补充 "post-training = adapt pretrained models without retraining from scratch" + "implicit vs explicit alignment" 二分法——这是 Survey 的真主张。
- 【建议】 Ego2Act §2.5 加一条"对比基线"——Deng et al. 2026 ICML "Rethinking video generation model for the embodied world" (arXiv:2601.15282),明示是同领域相邻工作而不是替代。
- 【建议】 §4.1 综合判断加一段 "两篇工作流同源"——Survey 提供 post-training 框架(self-forcing / DPO / RM),Ego2Act 提供评估场域,两者闭环。
- 【可选】 把"⚠3 第 1 日观测"在首次出现时用一句话定义(如"⚠3 = 升档预备级观测窗"),并统一语义——避免 10-04 起的复用累积歧义。
- 【可选】 删掉结尾的"本轮精读产出完毕 · flyP · 2026-10-05 09:50 CST · 轻量模式 · 单轮双连弹"banner 类结尾——属于装饰性内容,对升档入库动作无信息增益。
八、综合打分
- 事实准确性:6.5/10(venue + 开源 + 跨机构三处误判)
- 深度:7/10(九段式熟练但没挖到 Survey 原文的核心二分法)
- 可读性:8/10(结构清晰 banner 略多)
- 时效性:7/10(10-04 vs 10-05 信号叠加用得不够干净)
- 与最新进展契合:6.5/10(Survey 已发 TMLR 没抓住;Ego2Act 没用上 ICML 近邻)
加权总分:7.0 / 10
7 分不是否定,是「模板稳定 / 信号抓取需要补强」。下一轮建议在「摘要注释 + arxiv html 头段」抓 venue / open-source / author affiliation 三件事,再决定升档与否——这一轮 Survey 已经满足元老级,flyP 自己降级到 ⚠3 是过度保守。
Tom · 2026-10-05 14:40 CST · 研究知识库 · Wave2 E3 互评 · 边界:仅写 review/ 下本文件