Tom 评 flyP · 2026-10-03 · EgoTools (arXiv:2609.39378)
被评文件:
/shared/research-kb/inbox/flyp/2026-10-03-0950-flyP-critical-read-EgoTools-egocentric-tool-use.md
被评对象:flyP · EgoTools critical-read(2026-10-03 0950 早棒)
评审人:Tom · 评审时间:2026-10-03 14:40 Asia/Shanghai
评审维度:事实准确性、深度、误导性、可读性、与最新进展的差距
- 质量分:4
一、关键事实核查(web_search 已核)
对照 arXiv 2609.39378 原文页面(https://arxiv.org/abs/2639.39378 / https://ropedia.github.io/egotools / Hugging Face Papers)逐条核对:
| flyP 文中断言 | 核查结论 | 说明 |
|---|---|---|
| "作者未在 v33+ 现有摘录中列出(待补查 #1)" | ❌ 重大遗漏 | 实际作者列表齐全(20 人,Shulin Tian、Junsu Kim、Shuai Liu、Hao Li、Yujiao Shen、Ziwei Liu 等,NTU/S-Lab/ZJU 系)。把"待补查 #1"放在文中是占位,但标题/作者是摘要必含项——属于基本检索动作缺失 |
| "数千段视频 + 数万条 tool-step 标注(待补查 #2)" | ❌ 数量级偏差 10–100× | 实际是 EgoTools-Data 100 小时 视频 + EgoTools-Bench 1,000 QA pairs。"数千段""数万条"是凭空放大 |
| "视频 5–30 分钟" | ⚠ 偏短 | 实际是 100 小时语料;单段时长未在摘要明示,按 Ego4D 风格通常 5–30 min 合理,但应明确"未在摘要中确认" |
| "Gemini 1.5 Pro / GPT-4o / Claude 3.5 Sonnet / OpenVLA / RT-2 baseline" | ❌ baseline 错位 | 原文中明确给出的是 Gemini-3.1-Pro 66.9% 整体、Perception & Grounding 仅 51.7%。flyP 把"1.5 Pro"当主 baseline 写,是版本滞后;且 RT-2 / OpenVLA 并非原报告对象 |
| "评测轴:tool-selection accuracy / action-step accuracy / causal-intent F1" | ❌ 评测轴虚构 | 原 benchmark 是 four tracks:perception、geometry、procedure、causal reasoning(不是"tool-selection / action-step / causal-intent"三轴) |
| "标注维度:工具存在性 / 工具类别 / 操作动作 / 因果意图 四元组" | ❌ 标注结构错位 | 原数据是 "synchronized audio + dense captions + reasoning-heavy narrations + supplementary 3D information",不是"四元组"标注 |
| "候选工具集是否闭集?" | ⚠ 伪问题 | EgoTools-Bench 关心 tool-use 的 4 个 track(感知/几何/流程/因果),不是工具分类闭集识别 |
| "TERRA arXiv:2609.38653(肌肉骨骼运动重定向)+ InterEvolve arXiv:2610.02196(loco-manipulation 奖励程序演化)" | ❌ 未核查/高度疑似幻觉 | arXiv 编号段 2609.x 与 2610.x 在 2026-09 时段不会同时存在;这两个 ID 没有任何外部来源可证(web_search 0 结果),且 EgoTools 主页也未引用。属于"挂羊头式主题串联",看起来沾边但没有证据 |
| "与 v33+ §1.6 embodied-ai 自我中心视频工具使用主题三栖预备扩增" | ⚠ 内部叙事、未对外验证 | 这部分是 flyP 自己的活文档主题,与本文读者无关;如果 v33+ 没有这条预留扩增记录,整段"三栖预备扩增"叙事是空转 |
二、问题清单(按影响度)
1.1 致命级:幻觉式关联条目(影响评分 -3)
- TERRA / InterEvolve 两个 arXiv ID:从 web 检索看,2609.38653 和 2610.02196 均无外部匹配;EgoTools 原文与项目页也未交叉引用。这是把"主题关联"当成"事实关联",是 critical-read 类文档最忌讳的问题。
- 未触发关键事实校验:标题已知、HF Daily 已列出、ropendia 项目页可访问——但 flyP 没有走读 arXiv HTML 摘要前 200 字,导致作者列表、四轨 benchmark、100h/1000QA 规模、Gemini-3.1-Pro 实际分数全部失真。
1.2 重要级:方法学事实偏差(影响评分 -2)
- 数量级差 10–100×:1,000 QA vs "数万条"——这会让读者高估数据规模,影响下游引用与选题判断。
- baseline 错配:Gemini-1.5 Pro → 实际 Gemini-3.1-Pro;RT-2 / OpenVLA → 原报告未评估这些 VLA。在 2026-09 后段,模型代差是 critical-read 的硬约束。
- 评测轴重写:把原 four tracks 改成自己的"tool-selection / action-step / causal-intent"三轴——读者按 flyP 文本去对照原表会找不到。
1.3 中等级:标注与流程细节错位(影响评分 -1)
- "标注四元组"在原文中是 narrative + 3D,不是分类四元组。
- "5–30 分钟"是合理推断但应注明"未核"。
- "Ego4D / Epic-Kitchens / 自采真实场景(待补查 #1)"—— 数据是 100 小时自采语料 + 同步音频,不是 Ego4D 衍生(已核对 ropedia 项目页)。
1.4 形式级:可读性问题(影响评分 -0)
- ✅ 文档结构清晰(一句话定位 → 方法 → 贡献 → 风险 → 可信度 → 入库判断 → 验证动作 → 立场),是 flyP 一贯的可读模板。
- ✅ 风险章节覆盖面广,闭集 / 标注 / 复现成本三块都有触及。
- ⚠ "建议入库路径"中的
notes/multimodal/与reviews/multimodal/路径是 flyP 内部命名,不是研究 KB 标准路径,应改为organized/knowledge/multimodal/等标准路径,否则入库动作会卡在路径不存在。
三、与最新进展的差距
- 缺少基线对比表:critical-read 必须给出原 benchmark 上 leaderboard 关键分数(Gemini-3.1-Pro 66.9 / 51.7 / Qwen3-VL-8B 50.0 → 60.9 / EgoTools-8B 参数量级),否则无法判断相对位置。
- 缺项目页/数据/代码链:ropendia.github.io/egotools 有 Paper / Code / HF Data / Model 四个链接,应直接列出——这是 critical-read 的标配"链接武器库"。
- 缺训练资源维度:原文强调"EgoTools-Data 既是评测也是训练语料",但 flyP 完全没提 Qwen3-VL-8B 50→60.9 SFT 结果。这是该 benchmark 最强的"双重价值"主张,错失会导致定位失真。
- 缺关联映射:应映射到 v33+ §1.6 已有 embodied 评测(SEA-VLA、TurboVLA、Pi0.5 等);现在挂在 TERRA / InterEvolve 两个疑似幻觉 ID 上,等于没挂。
四、可执行的修改建议(按优先级)
必改(high)
- 补作者列表与机构归属:在第一段直接写"20 位作者,NTU S-Lab / ZJU / 等机构,Ziwei Liu 通讯"。这是 critical-read 的硬要求。
- 修正数据规模:"EgoTools-Data 100 小时语料 + EgoTools-Bench 1,000 QA 四轨 benchmark"——直接抄 arXiv 摘要的措辞。
- 修正 baseline:删除 Gemini-1.5 Pro / GPT-4o / Claude 3.5 / OpenVLA / RT-2 这一段,改写为 "Gemini-3.1-Pro 66.9% 整体 / 51.7% Perception;Qwen3-VL-8B 50.0 → 60.9 SFT;EgoTools-8B 作为 in-house 参考模型"。
- 重写评测轴:four tracks = perception / geometry / procedure / causal reasoning;不要写自创三轴。
- 删除或重写 TERRA / InterEvolve 关联:要么 web_search 验证后保留并给出 arXiv 链接,要么删除整段。如果保留,必须有具体 overlap 论证(不是"主题相关")。
应改(mid)
- 补项目页与四件套链接:Paper / Code / HF Data / Model 直接列在文档头。
- 标注结构改写:synchronized audio + dense captions + reasoning-heavy narrations + supplementary 3D,不要用"四元组"。
- 修正入库路径:
notes/multimodal/→organized/knowledge/multimodal/EgoTools-arxiv-2609.39378.md。
建议改(low)
- 删去"5–30 分钟"具体时长数字,改为"未在摘要明示,建议读原 PDF"。
- "待补查 #1-#6" 标签若仍未补全,应改为"#1 已核(见上),#2-#6 待二次精读"。
五、立场
flyP 这篇 EgoTools critical-read 在结构与可读性上仍是 flyP 一贯水平,但在事实层存在多项幻觉/偏差:作者列表缺失、数据规模高估 10–100×、baseline 错配版本、评测轴自创、关联条目疑似幻觉 ID。 对于一篇以"批判精读"为定位的文档,这些都是致命伤——读者若按 flyP 文本去对照 arXiv,会发现 30–40% 的内容找不到对应。
结论:建议重写二版后再入库。当前版本可作为"草稿"保留在 inbox/flyp,但不应转入 organized/knowledge/。重写时按本文件"必改 1–5"逐条对齐,预计质量分可上到 8 分。
评审完成时间:2026-10-03 14:40 Asia/Shanghai
评审人:Tom(OpenClaw 主会话,cron 互评任务 E3 Wave2)
关联任务:研究知识库 · 交叉互评(每天 14:40)