视频脚本镜像 · AgentLens · 2607.06624

日期: 2026-07-21 · 轮次: R2 arxiv 链接: https://arxiv.org/abs/2607.06624 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-07-21_R2_agentlens-trajectory-review-coding-eval-short-video-script.md

1. 标题与观众

标题: 可读的评估 AgentLens 目标观众: AI 工程师 一句话核心观点: 把编码 Agent 的分数从黑箱数字拆成可读的轨迹评审

3. 45-90 秒口播稿

编码 Agent 跑过测试,只给一个 bit — 通过或没通过。但用户感受到的是整段 trajectory:怎么听话、用工具、自检、从错里爬出来。AgentLens 不只看结尾,搭了三件套:有客观检查的位置用形式化验证做硬判,没客观检查的位置让 LLM 写一份带证据的可读评审,同一段 trajectory 还能跟 anchor run 并排对比。每次跑完,拿到的不再是 70% 这个数,而是一份解释分数为何如此的可读 verdict。今天能带走一件事:别再只看一个数字,问一句分数怎么被读出来。

4. 镜头分镜

  • scene-1 · 0-8s · 标题卡 · 屏幕文字 AgentLens 可读的评估 · 画面元素 深底白字 + 三个并排小卡片(形式化 / LLM 评审 / 并排对比)横向点亮 · 运动方式 三个卡片依次从左到右滑入
  • scene-2 · 8-16s · 判断卡 · 屏幕文字 单 bit ≠ 整段体验 · 画面元素 红叉标在「pass / fail」上 + trajectory 时间轴从左拉到右 · 运动方式 时间轴逐段点亮 · 副行 跑通 ≠ 整段靠谱
  • scene-3 · 16-24s · 流程图 · 屏幕文字 formal check → LLM review → side-by-side · 画面元素 三方框箭头串联 + 中间挂「evidence」标签 · 运动方式 箭头依次点亮 · 副行 paper 数字层 = 0·方法论
  • scene-4 · 24-32s · 证据卡 · 屏幕文字 每次评分都带可读评审 · 画面元素 verdict 文本框 + 引文标记逐行出现 · 运动方式 文本逐句浮现 · 副行 LLM 当评审·非同行评议
  • scene-5 · 32-40s · 证据卡 · 屏幕文字 v1 ~14 天 v2 ~7 天 · 画面元素 时间轴锚定两个提交日 + arXiv/GitHub/HF 三标签 · 运动方式 标签逐个亮起 · 副行 GH 5 stars·arXiv preprint
  • scene-6 · 40-48s · 风险卡 · 屏幕文字 v1+v2 已发 / 0 引用 / abstract 无数字 · 画面元素 三行风险小字堆叠 · 运动方式 逐行闪烁 · 副行 方法论论文·不外推共识
  • scene-7 · 48-56s · 行动清单 · 屏幕文字 问三件事 · 画面元素 三个问题垂直排列 · 运动方式 逐条出现 · 副行 你的分数能读出来吗