视频脚本镜像 · 2026-07-18 R1 · arXiv 2606.19544
- 日期与轮次:2026-07-18 · R1
- arxiv 链接:https://arxiv.org/abs/2606.19544
- video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-18_R1_judge-kappa-deflation-mvp-short-video-script.md
1. 标题与观众
- 标题:法官模型 还能信吗(6 字符 · ≤25 阈值 ✅)
- 目标观众:AI 工程师 / LLM 评测方向研究员 / 评估基础设施搭建者
- 一句话核心观点:LLM-as-Judge 跑得"稳定"未必真的在判别 —— reliability 不等于 validity。
- metadata 主标题(≤25 字符):法官模型 还能信吗
- metadata 副标题(≤35 字符):LLM-as-Judge 元方法学 · 评估器侧诊断层
- metadata E1 行:MVVP 可作为评估基础设施落地的最小可行 checklist(E1 脚本作者推断)
- metadata E2 行:consistency-bias paradox 直接打脸"judge 稳定 = 判别可靠" 行业共识(E2 脚本作者推断)
- metadata E3 行:与 R3 07-17 TimeBlind minimal-pairs paradigm 形成"任务侧诊断 + 评估器侧元方法学"三层闭环(E3 脚本作者推断 · 非 Justin Norman et al. 原话 · 共识方向)
- metadata E4 行:F4 verbosity bias 被高估意味着 pairwise rubric 下不应再过度担心长度偏好(E4 脚本作者推断)
- metadata E5 行:Bonferroni / FDR 修正若不到位可能拉低 4 大 finding 统计显著性(E5 脚本作者推断)
- metadata E6 行:学术引用层级 = 脚本作者推断(类比 R3 07-17 B-RW8 · R1 07-18 本轮新增)
3. 45-90 秒口播稿
法官模型 还能信吗?一篇论文,跨 21 judge × 9 厂商 × 3 benchmark × 118 轮 ≈ 541k judgments,只盯出 4 个反直觉 finding。F1:把 exact-match 当 agreement 用,在 MT-Bench 高估 33–41 pp——Kappa deflation。F2:同一 judge 在 MT-Bench / JudgeBench / RewardBench 排名最多移动 14 位次。F3:两个生产 judge,test-retest >0.95 同时 position bias >0.10——稳定 ≠ 公平。F4:pairwise rubric 下 cohort verbosity bias <0.011——长度偏好被高估。行动:把 4 finding 当 MVVP checklist 抽样复测 F1/F3——共识方向由我推断,非论文原话。
4. 镜头分镜
- scene-1 (8s) hero 标题卡:屏幕文字「法官模型 还能信吗」+ 副标题「LLM-as-Judge 元方法学」;画面元素 = 主标题 hero 居中 + arXiv 2606.19544 论文角标 + 时间锚 2026-06-17 v1;运动方式 = 0.6s 淡入 + 静止 7s + 0.4s 切场。
- scene-2 (8s) 5 张证据卡(4 finding + 1 MVVP · 0.5s × 5 = 2.5s 内出完):卡 1 = 「F1 κ 偏差」33–41pp · 卡 2 = 「F2 排名漂移」14位次 · 卡 3 = 「F3 并存悖论」 · 卡 4 = 「F4 长度偏倚」<0.011 · 卡 5 = 「MVVP 清单」;屏幕文字每条 ≤18 字;底部 30 字小字「W3 · MT-Bench/JudgeBench/RewardBench 文本 judge · 多模态外推待验」。
- scene-3 (8s) 流程图:画面元素 = 三层结构(顶层 Reliability 一致性 audit / 中层 Reliability vs Validity 拆解图 + 判别效度 diagnostic split + 评估协议一致性 audit + 4 finding 路径示意 / 底层 validity 4 finding 路径 · 33–41 pp · 14 位次 · >0.95 + >0.10 · <0.011);运动方式 = 顶层 0.8s 出现 → 中层 1.2s 描线 → 底层 4 finding 路径 1.6s 顺序弹出;底部 30 字小字「W4 · 数字均为论文 abstract · 抽样审计仅重现 F1/F3」。
- scene-4 (8s) hero number 第二行:第一行 = 4 大方法学 finding · 第二行 = 33–41 pp · 14 位次 · >0.95 · <0.011(底部 30 字小字「论文 abstract · 抽样审计仅重现 F1/F3」);第三行 = 21 judges × 9 providers × 3 benchmarks × 118 runs(底部 30 字小字「W2 · Bonferroni / FDR 修正待核」);屏幕文字每条 ≤18 字。
- scene-5 (8s) 三行证据卡:第一行 = 「arXiv 2606.19544」· 第二行(细分隔线)= 「flyP 22:50 精读」· 第三行(细分隔线)= 「popular 2602-19127」;第三行底部时间锚「2026-07-17 抓取 · 2026-06-17 v1 发布」;底部 30 字小字「W12 · Justin Norman 等作者 · v1 单版本未公开 v2 / rebuttal」+「W11 · 21 judge × 9 vendor × 3 bench · 复现脚本未官方发布」。
- scene-6 (8s) 风险卡(6 张):W1 单源依赖 / W2 Bonferroni / FDR 待核 / W3 MVVP 外推 / W4 abstract-only 数字 / W5 v1 单版本 / W6 复现成本中-高 + W7 文本 judge 覆盖 / W8 benchmark 偏差 / W9 v2 作者列表 / W10 统计修正细节 + W11 复现脚本仓库 / W12 cohort 覆盖 · 共 12 处底部小字 + E1-E6 6 项推断 verbatim 显式标注 + 底部 30 字小字「E6 · 学术引用层级 = 脚本作者推断(类比 R3 07-17 B-RW8 · 本轮新增)」+「W11 · 复现脚本仓库(完整 / 最小子集)未官方发布」+「W12 · 裁判 cohort 是否含 Qwen3 / DeepSeek-V3 / Llama-4 / GLM-5 待核」。
- scene-7 (8s) 行动清单 4 条:第 1 条 = 读 arXiv 2606.19544 摘要(底部 30 字小字「E6 · MVVP 可作为评估基础设施落地的最小可行 checklist · E1 脚本作者推断」)· 第 2 条 = 自己抽样复测 F1/F3(底部留空 · W11 风险标注)· 第 3 条 = 共识方向 = 脚本作者推断(E3 推断限定语 · 非 Justin Norman et al. 原话 · 第 3 段底部留空)· 第 4 条 = 读 flyP 中文精读(底部 30 字小字「W1 · 单源依赖 arXiv 一手 + flyP 精读 + popular 类比映证」);屏幕文字每条 ≤18 字。