日期: 2026-08-16 · 轮次: R2 arxiv: https://arxiv.org/abs/2606.25819 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-08-16_R2_short-video-script.md
1. 标题与观众
- 标题:Agent 工具调用能力 vs 不可靠下恢复能力
- 目标观众:Agent 系统开发者 / Agent 评测工程师 / LLM 应用架构师
- 一句话核心观点:工具调用量不等于能力,诊断 + 恢复才是生产环境 Agent 的真考题。
3. 45-90 秒口播稿
调用能力 vs 不可靠下恢复能力,是两码事。
ToolBench-X 在 5 类 hazard 上注入故障,每类至少留一条恢复路径。可靠环境工作的 Agent,遇到可恢复 hazard 时大量失败。
扛住的是诊断加恢复策略,不是调用量。诊断率不等于完成率,主流 Agent API 不暴露诊断状态。
反直觉:test-time scaling 解决不了可靠性。要靠训练阶段显式引入可靠性训练。
动作:CI/CD 加可靠性维度;prompt 加 hazard-aware;关键任务加 fallback;补诊断埋点。
4. 镜头分镜
| scene | 时长 | 屏幕文字 | 画面元素 | 运动方式 |
|---|---|---|---|---|
| scene-1 hero | 8s | 调用 ≠ 恢复 |
标题卡:左右分屏「调用」/「恢复」对比构图 | 镜头从左滑到右,字幕淡入 |
| scene-2 关键判断点 1 | 8s | 5 类 hazard |
流程图:5 个圆形图标横向排列,每个图标带 hazard 名称 | 图标依次弹入,伴随轻微抖动暗示"故障" |
| scene-3 关键判断点 2 | 8s | 诊断 ≠ 完成 |
证据卡:左半"诊断率"仪表盘,右半"完成率"仪表盘,中间一条断开的连接线 | 仪表盘指针转动,断线闪烁高亮 |
| scene-4 工程意义 | 8s | hazard prompt |
流程图:系统 prompt 模板框 + 5 类 hazard 列表 + 4 种恢复策略 | 框内文字逐行打字机出现 |
| scene-5 反方限定语 | 8s | 1⭐ 待观察 |
风险卡:GitHub 仓库截图 + 1 star 徽标 + 警示色边框 | 镜头轻微推近,警示色脉冲一次 |
| scene-6 今天能带走什么 | 8s | scaling 无效 |
折线图:横轴推理预算,纵轴可靠性提升,曲线平缓 | 曲线从左向右缓慢延伸,配"⚠️"浮标 |
| scene-7 把判断变成行动 | 8s | 5 类 · 3 维 |
行动清单卡片:3 行 checklist(评测 / prompt / 埋点) | 卡片依次滑入,最后一行加粗高亮 |