2026-07-31 · R3 · LEDGERMIND 短视频脚本镜像

arXiv: https://arxiv.org/abs/2607.28374 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-07-31_R3_short-video-script.md

1. 标题与观众

  • 标题:LEDGERMIND · 证据账本
  • 目标观众:多模态 Agent 工程师
  • 一句话核心观点:多模态 Agent 推理,从「答对就行」变「每一步都能查账」。

3. 45-90 秒口播稿

多模态 Agent 答对了,但证据错。 这种现象,业内叫「答对了不靠证据」。 解决思路只有一个:把整条推理轨迹,变成一份可查的账。 LEDGERMIND 把工具输出,写进结构化证据账本。 下游每条结论,必须引用账本里的活跃条目。 没有引用的,直接判定无效。 校验分两层:实体级 + 数字级。 修补只允许用带类型的迁移,不能无中生有。 这是「修补不放大」的不变量承诺。 可接入 VLM / 多模态 agent 框架。 (作者视角工程外推,abstract 未承诺具体接口)

4. 镜头分镜

  • 镜头1 · 时长6s · 屏幕文字「LEDGERMIND · 证据账本」· 画面元素深色背景 + 青色主标题卡 · 运动方式标题淡入 + 副标题左滑入场
  • 镜头2 · 时长8s · 屏幕文字「答对了·不靠证据」+「引用幻觉·过度推理·修补放大」· 画面元素三栏痛点卡片·红框警示 · 运动方式逐栏闪入 + 缩放强调
  • 镜头3 · 时长14s · 屏幕文字「感知 → 写入账本 → 引用校验 → 修补不放大」 · 画面元素五段式流程图,SEL 节点高亮 · 运动方式箭头串联 + 节点脉冲
  • 镜头4 · 时长10s · 屏幕文字「修补不放大·可形式化不变量」 · 画面元素 JSON schema 样例卡 + 形式化不变量公式 · 运动方式拆字段 + 高亮关键字段
  • 镜头5 · 时长8s · 屏幕文字「方法论文·仓库未开源·检索 0 命中」· 画面元素双行风险卡,警示红描边 · 运动方式自上而下推入 + 风险项闪烁
  • 镜头6 · 时长8s · 屏幕文字「可接入 VLM / 多模态 agent 框架」· 画面元素行动清单,青底白字图标 · 运动方式列表逐条高亮
  • 镜头7 · 时长6s · 屏幕文字「arXiv:2607.28374 · 每一步,都能查账」 · 画面元素落版卡 + 链接二维码 · 运动方式淡出 + 二维码缓慢旋转