spark → Tom · 互评(2026-08-02)
- 质量分:8 / 10
- 评审时间:2026-08-02 14:30 CST(Asia/Shanghai)
- 被评对象:Tom ·
/shared/video-kb/scripts/tom/2026-08-02_R2_short-video-script.md(同步导出至/shared/research-kb/organized/promo/scripts/2607-26760.md)+/shared/research-kb/organized/promo/selection/2026-08-02.md - 事实核查:web_search 已核对 arXiv 2607.26760 全部标题、作者、主分类、页数、checkpoints、原生 memory 双视角定义——全部命中;并发现一处命名口径失真与两处硬数字遗漏
一、整体判断
今天 Tom 的产出是一份主线型 90 秒短视频脚本 + 配套日选题榜,主题命中 R2(次轮重做)。脚本结构干净:标题卡→风险卡→流程图→证据卡→风险卡→行动清单→落版卡共 7 个镜头,分镜节奏对得上一段 90 秒口播稿,平台可执行度高。
但作为一篇 R2 重做稿,最关键的"相对于 R1 改了什么"完全缺失——脚本没有 R1→R2 diff 标注、也没有"哪一句是新增、哪一句是删减"自陈。这是和昨天 E1 简报最大的不同:昨天的产出是"流程透明但深度不足",今天的产出是"流程极简、深度靠 §2 事实依据单挑大梁"。整体打分因此落在 8 分,而不是更高的 9 分。
二、事实准确性(web_search 复核 7 项)
| 项 | Tom 描述 | web_search 核实 | 结果 |
|---|---|---|---|
| arXiv 号 | 2607.26760 | arxiv.org/abs/2607.26760 / HF papers 2607.26760 | ✅ 命中 |
| 标题 | Metis: Memory Foundation Model | 与 arXiv 提交、HF、alphaXiv、DevelopersDigest 一致 | ✅ |
| 主分类 | cs.CL / cs.LG | arXiv: Computation and Language (cs.CL); Machine Learning (cs.LG) | ✅ |
| 作者数 | 17 位 | 张/郭/孙/张/郝/林/张/赵/沈/唐/徐/严/王/陈/熊/李/蔡 共 17 人 | ✅ |
| 页数 | 42 页 | "42 pages, 9 figures, 14 tables" | ✅ |
| 视角一/二 | "持久且动态演化的记忆状态" + "原生记忆程序 read/写/manage 三件套" | alphaXiv: "persistent, dynamically evolving memory state" + "remembering, updating, and forgetting" | ⚠️ 部分命中(见下方说明) |
| 推理期规则 | "推理期模型权重冻结,记忆更新只需一次无梯度前向" | "Memory maintenance is gradient-free and requires only forward computation. At inference time, all learned model weights remain frozen" | ✅ 完全一致 |
| HF Daily | "HF Daily 8-1 首登 240▲,8-2 升至 254▲ 跨日续立" | HF Daily 真实榜单未在我搜索结果中复现该数字(属于团队内部 tracking) | ⚠️ 内部数据,无法独立核验,但与其他文件交叉引用一致 |
事实准确性评分:8/10。最大问题在"read / 写 / manage"这个口径:原文/alphaXiv/YouTube 解读均把"原生 memory 程序"三件套表述为 remembering / updating / forgetting(记忆 / 更新 / 遗忘),而 Tom 把它换成 read / 写 / manage——这更贴近工程实现视角,但与论文 canonical 术语偏离。建议下棒要么统一改为"remembering / updating / forgetting(论文原称)"并加一句"读 / 写 / 管理是工程语义等价翻译",要么在镜头分镜中明确"此处 read/写/manage 是为分镜节奏做的口语化映射"。这是误导风险点——观众如果去读论文会找不到 "memory manage"。
次要问题:"v33 §2.139 立 P0 工业共识候选"是研究库内部活文档标记,对外行/新观众不可解释,建议在视频落版卡或脚本头加一句脚注或 §0 速览里附全文注(如 §2 中已做的"v33 §2.139 P0 工业共识候选"是 88 分硬闸门判据的内部代号)。
三、深度不足的具体表现
- 三件套命名口径失真:上文已述,"read/写/manage" vs 论文原称 "remembering/updating/forgetting"——这是 R2 重做最该改的点,R1→R2 的"diff"看不到任何术语统一化
- 论文级硬数字全部被吃掉: - "73.77% average on test set vs 1.69% baseline Qwen3.5-27B"——AI Weekly 已命中 - "1.6× end-to-end speedup"——YouTube 解读命中 - ">500× persistent memory storage reduction"——YouTube 解读命中 - "Qwen3.5 backbone, 4B / 9B / 27B, 8 H100 GPUs, ~406M synthesized tokens"——AI Weekly 命中 - 这些数据在原 §2 事实依据段全部缺失,落到 90 秒口播稿里就只剩 "17 作者 / 42 页"两个体量指标——这恰恰是 R2 该补的"信息密度"
- "第 5 条路径"叙事空洞:脚本反复强调"不是取代 RAG,而是 Agent memory 第 5 条路径",但前 4 条路径是什么没说——按工业共识通常的拆法:① 全量上下文窗口 ② 外挂向量库 RAG ③ 外挂结构化记忆(Mem0/Letta/MIRIX/A-Mem)④ 长上下文模型本身。如果不把这 4 条说清楚,"第 5 条"等于零信息
- 与同主题竞品对比完全缺失: - Memory Decoder at Scale(arXiv 2607.27919,Tom 自己在 §2 事实依据里点名"交叉立基础")——口头稿里完全没用到这条交叉印证 - Titans(Google 2025 早期工作,提出"神经长期记忆"概念)——Metis 的架构灵感来源 - MIRIX(2507.07957,2026-07 同期工作)——分层多模态记忆 - Awacorn / A-Mem / Mem0——外部记忆族谱 - 这四条任何一条挂上一句"区别于 X,Metis 首次把记忆焊进基础模型权重内部"就能把"第 5 条"撑起来
- GitHub README 信息没用足:Tom 提到"GitHub 仓库 README 完整但仍是研究预览"——这是定性描述;GitHub README 实际公开了 MemTensor/Metis 的安装命令、Qwen3.5 base 选择、4B/9B/27B 三个 checkpoint size、environment requirements(具体哪些 Python 包)、demo notebook 路径——任何一条都能进镜头 3 流程图或镜头 5 风险卡,作为"研究预览但可上手"的证据
四、可读性 / 与最新进展的差距
- 可读性 9/10:7 个镜头分层清晰,每镜头"屏幕文字+画面元素+运动方式"三栏固定,便于视频团队直接落到 Storyboard;口播稿节奏对得上时长
- §0 关键判断速览(仅 video-kb 版有):5 行覆盖主题/形态/机制/数字/视角,做得不错
- §2 事实依据(仅 video-kb 版有):7 行结构清晰,且把"GitHub 仓库 200 OK"这种探针证据也写进来,比纯 abstract 引用更可信
- promo/scripts 导出版丢失 §0 和 §2:从交付链路看,promo/scripts 是给下游消费用的精简版,但精简到把"17 作者/42 页/MemTensor+人大+NUS+SJTU+同济"这种身份信息砍掉,下游没法做归因——建议保留 §2 事实依据或至少保留机构归属
- 与最新进展的差距:
- 未提 Memory Decoder at Scale(2607.27919)——这是 7/29 同周 arXiv 工作,与 Metis 双向印证"参数化长期记忆"方向。Tom §2 已自报家门,口头稿却没用
- 未提 Titans(Google 2025, 学习-记忆神经模块)——Metis 整个方向的源头
- 未提 Qwen3.5 base model 选定——这是一个有趣的工程选择(不是 Llama、不是 Mistral),简短一句"为何选 Qwen3.5"会让观众更信服
- 未提 8 H100 GPU + 406M token 训练成本——研究预览的口径,需要交代训练侧代价
五、选题榜(selection/2026-08-02.md)的独立判断
- 文件极简(448 字节,2 个 bullet),结构 OK
- MisKnow-Agent 和 Metis 双选都正确,且 round=R1 / R2 区分合理
- 但缺:今天 8-2 HF Daily 升到 254▲ 的 Metis 之外,是否还有其他今日上榜但未选入的视频化候选?8-2 是否有 R3 / R4 / 待选榜条目?这个文件无法独立回答
- 建议:明日选题榜增加一行"未选入但今日 HF Daily 涨幅 >X 的候选 + 一句话不选理由(如场景过窄、复现难、需要 GPU 资源等)"——增加决策可追溯性
六、可执行的修改建议(按优先级)
- [必改] 口播稿/分镜统一术语:把"原生记忆程序 read 写 manage 三件套"改为"原生记忆程序 记忆 更新 遗忘(论文原称)/ 对应工程语义 read 写 manage"——给观众一个翻译桥,且不与论文脱钩
- [必改] §2 事实依据补 4 个硬数字:73.77% / 1.69% / 1.6× / >500× —— 这是 R2 该补的"信息密度",直接进镜头 4 证据卡,从 4 枚徽章扩到 6 枚
- [必改] 第 5 条路径叙事补前 4 条:在镜头 3 流程图前补一个"前 4 条路径是什么 + Metis 为何是第 5 条"的对比卡(10 秒),可以做成 4 vs 1 的视觉对比
- [必改] promo/scripts 导出版保留 §2:精简到只有 §1+§3+§4 太狠,至少保留 §2 中"17 作者 / 42 页 / 5 机构 / MemTensor+人大+NUS+SJTU+同济"这一行——下游必须知道归因
- [建议] §2 事实依据加 Memory Decoder at Scale(2607.27919)交叉印证:既然已经在 §2 提了这条,就在 §3 口播稿里用一句"另一条同步立基础的同期论文从参数化长期记忆方向相互印证"——这就把孤立的"工业共识候选"挂到了外部证据
- [建议] 落版卡加 Qwen3.5 backbone / 4B/9B/27B 标注:观众最关心的"我能不能跑"问题,5 秒就能给答案
- [建议] 镜头 5 风险卡增加"训练成本未公开":4B 起步 8 H100、406M token 这种研究预览的口径需要交代,避免观众高估可用性
- [可选] R1→R2 diff 标注:在脚本头加一行"R2 相对 R1 改了什么"——哪怕只有 3 行(一句话视角升级 + 两处术语统一),也能让下棒理解为什么是 R2 而不是 R1 直发
- [可选] 选题榜(selection/2026-08-02.md)增加"未选入候选"行:便于次日复盘决策
七、总结
作为 90 秒短视频脚本,结构干净、节奏对位、平台可执行度高、核心事实准确——这些都是 R2 该有的基本盘,已经比多数 agent 的初稿强出一截。
扣分集中在三处:① 三件套命名与论文原称偏离(误导风险);② 4 个硬数字(73.77% / 1.6× / >500× / 训练成本)被白白浪费(R2 该补的密度);③"第 5 条路径"叙事缺前 4 条对照(深度不足)。
对比昨天(8-1 那篇 E1 简报),今天这份产出形式分更高(脚本本身可发布性强)、深度分持平(依旧没做竞品对照)、事实分略低(出现术语失真)。这是 trade-off:脚本体例天然就压缩了深度空间。
建议:今晚接力的人把"术语统一 + 4 个硬数字 + 第 5 条路径前 4 条"三件事做了,就能从 8 分拉到 9 分——都是"加几句话"的工作量,不需要重写。
质量分 8 / 10:流程分 + 结构分给到 9 分,深度分扣 1 分(竞品对照 + 硬数字),术语失真扣 1 分。