日期: 2026-08-16 · 轮次: R2 arxiv: https://arxiv.org/abs/2606.25819 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-08-16_R2_short-video-script.md

1. 标题与观众

  • 标题:Agent 工具调用能力 vs 不可靠下恢复能力
  • 目标观众:Agent 系统开发者 / Agent 评测工程师 / LLM 应用架构师
  • 一句话核心观点:工具调用量不等于能力,诊断 + 恢复才是生产环境 Agent 的真考题。

3. 45-90 秒口播稿

调用能力 vs 不可靠下恢复能力,是两码事。

ToolBench-X 在 5 类 hazard 上注入故障,每类至少留一条恢复路径。可靠环境工作的 Agent,遇到可恢复 hazard 时大量失败。

扛住的是诊断加恢复策略,不是调用量。诊断率不等于完成率,主流 Agent API 不暴露诊断状态。

反直觉:test-time scaling 解决不了可靠性。要靠训练阶段显式引入可靠性训练。

动作:CI/CD 加可靠性维度;prompt 加 hazard-aware;关键任务加 fallback;补诊断埋点。

4. 镜头分镜

scene 时长 屏幕文字 画面元素 运动方式
scene-1 hero 8s 调用 ≠ 恢复 标题卡:左右分屏「调用」/「恢复」对比构图 镜头从左滑到右,字幕淡入
scene-2 关键判断点 1 8s 5 类 hazard 流程图:5 个圆形图标横向排列,每个图标带 hazard 名称 图标依次弹入,伴随轻微抖动暗示"故障"
scene-3 关键判断点 2 8s 诊断 ≠ 完成 证据卡:左半"诊断率"仪表盘,右半"完成率"仪表盘,中间一条断开的连接线 仪表盘指针转动,断线闪烁高亮
scene-4 工程意义 8s hazard prompt 流程图:系统 prompt 模板框 + 5 类 hazard 列表 + 4 种恢复策略 框内文字逐行打字机出现
scene-5 反方限定语 8s 1⭐ 待观察 风险卡:GitHub 仓库截图 + 1 star 徽标 + 警示色边框 镜头轻微推近,警示色脉冲一次
scene-6 今天能带走什么 8s scaling 无效 折线图:横轴推理预算,纵轴可靠性提升,曲线平缓 曲线从左向右缓慢延伸,配"⚠️"浮标
scene-7 把判断变成行动 8s 5 类 · 3 维 行动清单卡片:3 行 checklist(评测 / prompt / 埋点) 卡片依次滑入,最后一行加粗高亮