日期与轮次:2026-08-25 R2 · FlavourBench · 可执行真值给前沿 LLM 排名 arxiv 链接:https://arxiv.org/abs/2608.20574 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-25_R2_flavourbench-executable-ground-truth-llm-ranking-short-video-script.md
FlavourBench · 可执行真值给前沿 LLM 排名
1. 标题与观众
- 标题:可执行真值 > 裁判打分
- 目标观众:AI 工程师 / LLM 评测工程师 / 技术产品经理
- 一句话核心观点:开放式评测不再信裁判,56 种食材组合的 ground truth 跑在模型前面,Top 6 的 CI 全部重叠。
3. 45-90 秒口播稿
LLM 排行榜你还信几分? FlavourBench 把裁判踢下桌。 每题 8 食材选 3,Epicure 先把 56 种组合评分冻结。 534 题、89 响应/家族 × 14 家族,14,418 格一处不缺。 Grok 4.6 拿下 65.1,95% CI 61.0 到 69.2。 但 Top 6 的置信带全部重叠 —— 351 对里只解 101 对。 不靠裁判的评测,才值得信。 差分缺失、同步 CI、离线 verifier,三件套工程团队直接抄。
4. 镜头分镜
| 镜号 | 时长 | 画面描述 | 屏幕文字(≤ 18 字) | 口播对应 |
|---|---|---|---|---|
| 1 | 8s | 深蓝底 + 标题卡 | 可执行真值 > 裁判打分 | LLM 排行榜你还信几分 |
| 2 | 8s | 流程图:8 食材 → 3 组合 → 56 个评分柱 | Epicure 先算 56 种组合 | FlavourBench 把裁判踢下桌 |
| 3 | 8s | 证据卡:534 题 × 89 × 14 家族 | 14,418 cells 全完整 | 534 题、89 响应/家族 × 14 家族 |
| 4 | 8s | 柱状图:Top 14 模型分数 + CI 重叠阴影 | Top 6 CI 全部重叠 | Grok 4.6 拿下 65.1 |
| 5 | 8s | 风险卡:351 对配对二分图(灰=不可分) | 351 对只解 101 对 | 但 Top 6 的置信带全部重叠 |
| 6 | 8s | 流程图:内容哈希 + 精确路径 + verifier | 三件套 直接可复现 | 不靠裁判的评测才值得信 |
| 7 | 8s | 行动清单 + 钩子字幕 | verifier 三件套 直接抄 | 差分缺失、同步 CI、离线 verifier 三件套工程团队直接抄 |