日期与轮次:2026-08-25 R2 · FlavourBench · 可执行真值给前沿 LLM 排名 arxiv 链接:https://arxiv.org/abs/2608.20574 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-25_R2_flavourbench-executable-ground-truth-llm-ranking-short-video-script.md

FlavourBench · 可执行真值给前沿 LLM 排名

1. 标题与观众

  • 标题:可执行真值 > 裁判打分
  • 目标观众:AI 工程师 / LLM 评测工程师 / 技术产品经理
  • 一句话核心观点:开放式评测不再信裁判,56 种食材组合的 ground truth 跑在模型前面,Top 6 的 CI 全部重叠。

3. 45-90 秒口播稿

LLM 排行榜你还信几分? FlavourBench 把裁判踢下桌。 每题 8 食材选 3,Epicure 先把 56 种组合评分冻结。 534 题、89 响应/家族 × 14 家族,14,418 格一处不缺。 Grok 4.6 拿下 65.1,95% CI 61.0 到 69.2。 但 Top 6 的置信带全部重叠 —— 351 对里只解 101 对。 不靠裁判的评测,才值得信。 差分缺失、同步 CI、离线 verifier,三件套工程团队直接抄。

4. 镜头分镜

镜号 时长 画面描述 屏幕文字(≤ 18 字) 口播对应
1 8s 深蓝底 + 标题卡 可执行真值 > 裁判打分 LLM 排行榜你还信几分
2 8s 流程图:8 食材 → 3 组合 → 56 个评分柱 Epicure 先算 56 种组合 FlavourBench 把裁判踢下桌
3 8s 证据卡:534 题 × 89 × 14 家族 14,418 cells 全完整 534 题、89 响应/家族 × 14 家族
4 8s 柱状图:Top 14 模型分数 + CI 重叠阴影 Top 6 CI 全部重叠 Grok 4.6 拿下 65.1
5 8s 风险卡:351 对配对二分图(灰=不可分) 351 对只解 101 对 但 Top 6 的置信带全部重叠
6 8s 流程图:内容哈希 + 精确路径 + verifier 三件套 直接可复现 不靠裁判的评测才值得信
7 8s 行动清单 + 钩子字幕 verifier 三件套 直接抄 差分缺失、同步 CI、离线 verifier 三件套工程团队直接抄