2026-09-22 R2 · MoME · arXiv abs/2609.15126 arxiv: https://arxiv.org/abs/2609.15126v1 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-09-22_R2_mome-context-aware-memory_short-video-script.md

1. 标题与观众

  • 标题:MoME 查表先看上下文
  • 目标观众:RAG / 检索架构工程师(主)+ Memory-Augmented LLM 研究者(次)+ 端侧大模型推理工程师(第三)
  • 一句话核心观点:MoME 用隐藏态门控给 Memory Embedding 加语义路由,把字面查表升级为上下文感知查表。

3. 45-90 秒口播稿

Memory Embedding 给 LLM 配了外挂查表——但同一个 Token 在不同上下文查到的向量完全一样。"python"在"python the language"和"python the animal"里查到的 Memory Vector 一字不差,语义分辨能力归零。表越大,新增槽位只存字面副本,冗余越来越多。MoME 把每个 Token 的单行换成 M 个 d 维槽位,加隐藏态门控 softmax(W_g·h_i) 给 M 个槽位打分加权求和。关键区别:MoE 由表面 Token 路由 FFN,MoME 由隐藏态路由 Memory 表,正交可叠加。跨 4 档 Backbone 全面超基线,代码开源 MIT。落地:加多槽位、训门控、监控梯度冲突。

4. 镜头分镜

  • 镜头 1 · 0-10s · 标题卡
  • 屏幕文字:MoME 查表先看上下文
  • 画面:深色背景大字主标题 + Memory 表图标 + Token 闪烁
  • 运动:标题淡入,Token 字符高亮
  • 镜头 2 · 10-25s · 证据卡
  • 屏幕文字:python 蛇 vs 语言
  • 画面:左 "python the animal" 蛇图标,右 "python the language" 代码图标,中间指向同一查表单元
  • 运动:两图标同时指向同一单元格,标红"完全相同"
  • 镜头 3 · 25-40s · 流程图
  • 屏幕文字:旧方法 字面查表
  • 画面:输入 Token → 单一固定向量 → 输出,无上下文分支
  • 运动:线性流动,出口处叠加"语义坍缩"红字
  • 镜头 4 · 40-55s · 流程图
  • 屏幕文字:M 槽位 + 隐藏态门控
  • 画面:输入 Token → M 个 d 维槽位 + softmax(W_g·h_i) 门控 → Σ 加权求和
  • 运动:门控网络高亮,加权求和箭头闪烁
  • 镜头 5 · 55-70s · 证据卡
  • 屏幕文字:MoE vs MoME 关键差异
  • 画面:左 MoE = Token 路由 FFN,右 MoME = 隐藏态路由 Memory 表,中间 "正交可叠加"
  • 运动:左右并排出现,中间文字放大
  • 镜头 6 · 70-85s · 风险卡
  • 屏幕文字:边界 · 仅 Sub-billion
  • 画面:7B+ 图标划灰,Sub-billion 区高亮,标注"abstract 未验证"
  • 运动:划灰动画 + 文字提醒
  • 镜头 7 · 85-95s · 行动清单
  • 屏幕文字:落地三步
  • 画面:①加多槽位 ②训门控 ③监控梯度冲突,逐条浮现
  • 运动:三步依次淡入,最终定格