视频脚本镜像 · AgentLens · 2607.06624
日期: 2026-07-21 · 轮次: R2 arxiv 链接: https://arxiv.org/abs/2607.06624 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-07-21_R2_agentlens-trajectory-review-coding-eval-short-video-script.md
1. 标题与观众
标题: 可读的评估 AgentLens 目标观众: AI 工程师 一句话核心观点: 把编码 Agent 的分数从黑箱数字拆成可读的轨迹评审
3. 45-90 秒口播稿
编码 Agent 跑过测试,只给一个 bit — 通过或没通过。但用户感受到的是整段 trajectory:怎么听话、用工具、自检、从错里爬出来。AgentLens 不只看结尾,搭了三件套:有客观检查的位置用形式化验证做硬判,没客观检查的位置让 LLM 写一份带证据的可读评审,同一段 trajectory 还能跟 anchor run 并排对比。每次跑完,拿到的不再是 70% 这个数,而是一份解释分数为何如此的可读 verdict。今天能带走一件事:别再只看一个数字,问一句分数怎么被读出来。
4. 镜头分镜
- scene-1 · 0-8s · 标题卡 · 屏幕文字
AgentLens 可读的评估· 画面元素 深底白字 + 三个并排小卡片(形式化 / LLM 评审 / 并排对比)横向点亮 · 运动方式 三个卡片依次从左到右滑入 - scene-2 · 8-16s · 判断卡 · 屏幕文字
单 bit ≠ 整段体验· 画面元素 红叉标在「pass / fail」上 + trajectory 时间轴从左拉到右 · 运动方式 时间轴逐段点亮 · 副行跑通 ≠ 整段靠谱 - scene-3 · 16-24s · 流程图 · 屏幕文字
formal check → LLM review → side-by-side· 画面元素 三方框箭头串联 + 中间挂「evidence」标签 · 运动方式 箭头依次点亮 · 副行paper 数字层 = 0·方法论 - scene-4 · 24-32s · 证据卡 · 屏幕文字
每次评分都带可读评审· 画面元素 verdict 文本框 + 引文标记逐行出现 · 运动方式 文本逐句浮现 · 副行LLM 当评审·非同行评议 - scene-5 · 32-40s · 证据卡 · 屏幕文字
v1 ~14 天 v2 ~7 天· 画面元素 时间轴锚定两个提交日 + arXiv/GitHub/HF 三标签 · 运动方式 标签逐个亮起 · 副行GH 5 stars·arXiv preprint - scene-6 · 40-48s · 风险卡 · 屏幕文字
v1+v2 已发 / 0 引用 / abstract 无数字· 画面元素 三行风险小字堆叠 · 运动方式 逐行闪烁 · 副行方法论论文·不外推共识 - scene-7 · 48-56s · 行动清单 · 屏幕文字
问三件事· 画面元素 三个问题垂直排列 · 运动方式 逐条出现 · 副行你的分数能读出来吗