spark 评 Tom · 2026-07-15 短视频脚本
- 被评对象:
Tom 短视频脚本 · Sparse Delta Memory · arXiv:2607.07386 · 2026-07-15 R2 - 文件路径:
/shared/research-kb/organized/promo/scripts/2607-07386.md(原路径/shared/video-kb/scripts/tom/2026-07-15_R2_sparse-delta-memory-linear-rnn-sparse-state-capacity-short-video-script.md) - 评审员:spark
- 评审时间:2026-07-15 14:30 (Asia/Shanghai)
- 质量分:7
事实准确性核查(1 处硬错 + 2 处软疑)
通过 2 次 web_search 抽查 arXiv 2607.07386 + 配套 GitHub,对照原文摘要:
| # | 条目 | 核查结论 |
|---|---|---|
| 1 | arXiv 2607.07386 存在性 / 标题 | ✅ 准确。arxiv HTML 确认标题为 "Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity",cs.LG 类目,作者含 Loïc Cabannes、Pierre-Emmanuel Mazaré、Gergely Szilvasy、Matthijs Douze、Maria Lomeli、Ilze Amanda Auzina、Justin Carpentier、Gabriel Synnaeve、Hervé Jégou(九人均 Meta FAIR)——脚本"Meta 一手实现"成立。 |
| 2 | License 字段错误(硬错) | 🔴 脚本第 2 段:"CC BY 4.0" —— 但 GitHub 主页明确写 "Sparse-Delta-Memory (SDM) is licensed under CC-BY-NC 4.0"。差一个 -NC(非商用限制),对短视频脚本分发合规影响很大:BY 允许商用再传播,BY-NC 禁止商用。这是要立刻修正的硬事实错误。 |
| 3 | "PKM 稀疏寻址 + GDN 稀疏推广 + 状态容量天花板释放" | ✅ 准确。论文 §3.1 verbatim:"rather than applying the decay and delta update to the entire dense state, we maintain an explicit memory table M_t ∈ ℝ^{N×dv} with N slots, and apply gated delta updates only to the W slots selected by sparse keys" —— 与脚本描述一致。 |
| 4 | "GDN/Mamba2 状态太小被 Arora 2025 实证锁死" | 🟡 "Arora et al. 2025" 仅作间接证据带过标注,未在论文摘要或 GitHub 主页直接看到此引用。脚本已自觉加 Arora 2025 论断副卡 双源标识,透明度 OK,但"双源标识"实际上是"主源 + 一个未被核验的旁证",需在字幕层明确声明"未核验"。 |
| 5 | "8B activated × 1T tokens isoFLOP" | 🟡 脚本原文加 论文自报 · 权重未公开。GitHub README 显示仓库是 Meta Lingua fork、参考实现提供 Triton/CUDA kernels,但 README 结果表里没有显式 8B 模型卡片(看到的 RULER 数字偏小模型口径)。脚本如要把"8B activated × 1T"作主推卖点,应在场景 5 evidence 卡里加 "scale-up 自报数据 · 仓库未提供 8B 权重" 的限制语。 |
| 6 | "PKM top-k 额外算力 < 1%" | 🟡 论文 §3.1 自报但未被独立 kernel benchmark 印证。脚本自标 需独立验证 · grep 锚点 PR9-pkm-topk-overhead,透明度合格。 |
| 7 | RULER 1M tokens 召回显著超过 GDN | ✅ 准确。GitHub README 的 RULER 表显示 multivalue +35.0 / multiquery +37.4 / single_2 +26.4 / single_3 +42.3 / multikey_1 +26.4 / vt +26.1 —— "显著超过 GDN" 成立(甚至 single_3/multikey_3 等较难任务 GDN 接近 0%、SDM 也有低个位数百分比,是任务难度上限而非失败)。脚本不应只说"显著超过",应该注明 multikey_2/3/cwe 等任务 GDN/SDM 都低,SDM 不是 SOTA 而是 narrow wins。 |
| 8 | "正交于 Mamba-3" | 🟢 合理推断。脚本已自带 grep 锚点 PR8-...-vs-mamba3-orthogonal 字幕层强制声明,技术层面成立(Mamba-3 改 SSM 核、SDM 改 memory 层),但建议在脚本里给一行"为什么说正交"的判定依据(不是"不构成替代"就足够)。 |
1 处硬事实错误(License 字段),2 处软疑(Arora 旁证未被核验、8B × 1T 引用弱)。
优点
- 透明度纪律比昨天的雷达(7-14 review B 项)明显提升:脚本里出现 8 处"脚本作者基于 arXiv:2607.07386 abstract + §3.1 verbatim 转述 · 非作者声明" + 9 处"缺独立 ablation 印证 / 缺跨论文 cross-eval 复现" + 9 张风险卡的 #01–#09 编号体系。这套"自标注未验证"的纪律是把幻觉压到最低的关键机制,应当作为短脚本的固定范式。
- 场景分镜严格在 7×8s=56s 内闭环:scene-1 hero → scene-2 cards → scene-3 flow → scene-4 isoFLOP → scene-5 evidence → scene-6 risk → scene-7 closing —— 信息密度曲线(前 4 场景铺设方法、后 3 场景铺设证据 + 风险 + 行动)合理,口播稿 45–90s 区间内可读。
- isoFLOP 论证拆得很细:参数对齐(
W_q, W_k, W_vGDN 与 SDM 同形) + 算力对齐(O(H · d_qk · d_v)GDN vsO(H^SDM · (W+R) · d_v^SDM)与 N 无关) + PKM top-k < 1% —— 把"不靠算力换性能"这一关键卖点拆成三张对齐卡,比单纯说 isoFLOP 高一档说服力。 - 退化路径锚点("当 N = d_qk, W = R = d_qk 时 SDM → GDN")是好卖点:把"稀疏推广"的数学正确性写进证据链,对研究工程师 audience 是有效锚点。
- "今天能带走什么"5 行动收口明确:cross-eval 复现 / PKM kernel benchmark / M₀ ablation / hybrid 开源 / agentic 长上下文落地 —— 5 条都能让"看完就走"变成"看完就有一个 follow-up 钩"。
不足与可执行修改建议
A. License 硬错必须修正(最高优先级)
- 现状:脚本第 2 段
arXiv:2607.07386 · 2026-07 submission · CC BY 4.0。 - 问题:GitHub LICENSE 文件 + README 都明确是 CC-BY-NC 4.0(非商用)。脚本如果走"商用视频分发"路径,可能踩到 NC 限制;如果走"教育/研究分享"路径,影响较小但仍要标注。
- 建议:
- 改写为
arXiv:2607.07386 · 2026-07 submission · 论文 CC BY 4.0(arXiv 端)/ 代码 CC-BY-NC 4.0(github.com/facebookresearch/sparse-delta-memory)· Meta Lingua fork BSD-3-Clause。 - 同时在场景 7 closing 加一行橙色风险卡 #10:商用传播路径需另行评估代码 -NC 限制。
B. RULER 数字应区分"显著超过" vs "窄胜"(次高优先级)
- 现状:脚本 scene-5 evidence 卡只写 "1M tokens RULER · SDM 显著高于 GDN"。
- 问题:GitHub README 的 RULER 表显示 multikey_2 / multikey_3 / cwe / qa_1 等任务 GDN 和 SDM 都在低个位数 % —— 不是"显著"而是"窄胜"或"双双失败"。
- 建议:
- 把 "1M tokens RULER · SDM 显著高于 GDN" 改写为 "1M tokens RULER · 单/多键检索任务 SDM 显著高于 GDN (+26–42 pp);多键深度检索 + 复杂 QA 任务两者仍低于 FullAttn baseline" —— 这样更准确,也更可信。
- 加一行
SDM 不是 RULER SOTA · SOTA 仍是 Full Attention (full-attn baseline 是 75.3 / 32.9 / 59.3 vs SDM 59.3 / 4.7 / 1.2 等)。
C. "8B activated × 1T tokens" 引用需要补 scaling-up 限制语
- 现状:脚本 evidence 卡 #03 "8B × 1T tokens isoFLOP · loss < GDN"。
- 问题:GitHub 仓库 README 的结果表未显式给出 8B 模型卡片(看到的更多是 1.4B 口径 + 图 4 perplexity-by-position),"8B × 1T" 大概率来自论文正文 §5/§6 实验节但仓库参考实现未放出 8B 权重。
- 建议:
- 在 evidence 卡 #03 加一行 "论文 §5/§6 文本实验 · 8B 权重未在 github.com/facebookresearch/sparse-delta-memory 公开"。
- 在风险卡 #02("8B × 1T 论文自报 · 权重未公开")已经是正确的,加 "复现尝试需自行训练 ≈ 数百万 GPU-hours"。
D. Arora 2025 旁证需要明确"未核验"标签(连续第二天同类问题)
- 现状:脚本用 "Arora et al. 2025 实证证明『linear RNN 类架构『无限 context』叙事背后的真实短板 = 状态容量天花板』" —— 用作 GDN 缺点的"外部背书"。
- 问题:7-14 radar review B 项已点名"软性事实漂移",今天的版本是"引入未核验旁证"——症状在演化。
- 建议:
- 在双源标识卡里把 "Arora 2025 论断副卡" 改写为 "Arora et al. 2025 论断副卡 · 论文 §2 未显式引用 · 字幕层务必标『待核验』"。
- 主源卡只引用 arXiv 2607.07386 + GitHub 主页 + fla-org / state-spaces / mamba 三个一手仓库。
E. 标题"R2 修订"应该明确版本日志(中等优先级)
- 现状:标题里"R2"在脚本顶部一行,但全文没有 R1 → R2 diff。
- 建议:
- 在脚本顶部加一段 changelog:
- R1 (07-15 上午):初稿
- R2 (07-15 下午):① 与 Mamba-3 正交不替代 显式声明 ② 中文样本覆盖度 边界 显式声明 ③ 9 类风险卡 #01-#09 体系化
- 这样 reviewer 一眼能看出"R1 → R2 改了什么",避免下次 review 又重复相同建议。
F. scene-3 flow 第三卡"Sparse Read"公式缺失
- 现状:scene-3 的 3 卡流程里,第 ③ 卡 Sparse Read 给的公式是
y_t = M_t^⊤ q_t = Σ q_t^{(i)} · M_t[i]。 - 问题:脚本描述用 q_t^{(i)} 但没解释这是什么 —— 是 PKM 稀疏 key 选中 slot 的 query 向量吗?读者在 8s 内根本看不清符号约定。
- 建议:
- 把第 ③ 卡文字改成 "Sparse Read · 选中 W 个 slot 加权求和 → 拼接 → RMSNorm → 门控 g → 投影 W_o" —— 文字描述 8s 内可读。
- 公式放到底部脚注,不进字幕。
总体判断
这是一份"严谨度高于平均水平但有一处必须改的硬错"的脚本。透明标注体系(9 风险卡 + 8 处 verbatim 转述声明 + 5 行动 checklist)是 Tom 这周产出的明显进步点,应当沿用并固化为短脚本模板。
但 License 错误(CC BY 4.0 → 应为 CC-BY-NC 4.0)是合规层面必须立刻修的——脚本如果是商用分发渠道,会触发版权方投诉。
建议:① License 字段修正 → ② RULER 数字分"显著超过 / 窄胜"两档 → ③ 8B × 1T 限制语补全 → ④ Arora 2025 标"待核验" → ⑤ 上述 4 条改完后,质量分可由 7 升到 8。
质量分:7 / 10(License 硬错扣 2 分 + RULER 数字粒度扣 1 分)