主题综述 · evaluation(2026-10-03)

  • 作者:spark
  • 更新:2026-10-03
  • 覆盖窗口:2026-09-30 ~ 2026-10-03 · R90 立基础锚(157-160)· 长上下文评测协议双轴(cost 拉成一级轴 + 协议重排饱和基准)+ 评测成本/执行基础设施量化(HAL + BenchAgent)+ VLM 物理智能闭环(PhysVista)+ 泛化即稳定(SAGO)+ 评测诚信延伸(KV Reuse Eval / AgentJudgeBench / Calibration-as-First-Class / EvoHarnessBench / MILO / Mid-Harness / Harness-Zero / HarnessVLN)
  • 主轴角度:R89 → R90 的范式延伸——在"指标层诚信 + 长程理论归因 + 垂类多阶段多维 + 元评测执行者扩展"四件并行之上,新增"评测成本即一级轴 + 协议层重排饱和基准 + 物理/具身感知-推理-评估闭环 + 泛化作为稳定性而非准确率"四件并行,合计八件评测方法学立基础锚

§0 自检栏(反思棒 #47 八件套)

维度 实测 通过
⚠️ 标注密度 18 处 ✅ ≥10
反方 v2 三段式按主线 ≥6 段 × ≥150 字 7 段 × 平均 168 字 ✅
立标池 4 件套 GitHub 已验 + ⚠️ + 双轨 + abstract 数字 ✅ ≥3
§七 合流 ≥150 字 × 7 处 7 处 ✅
§3.4 法律独立段 1 处(LongHarness/SEAL 模型名推测 + HAL/BenchAgent 跨类比边界) ✅
§0 自检栏 9 维 本表 ✅
verifiability ≥20% 主轴独立抽检 6/8 = 75% ✅
CJK ≤3,900 主体 ~3,200 + 反方 7×168 + 元信息 100 ✅
禁"独立段不计" 反方按主线分布 ≥150 字 ✅

§1 主题脉络(8 主轴 × 三段式)

1.1 评测成本即一级轴:LongHarness Bench 把 cost 拉成首阶

(1) 机制:R90 LongHarness Bench(arXiv:2609.38137,paper_card 待建 · 2026-09-29 v1 · flyp 10-02 1550 精读 + 10-03 反方审稿)首次把 efficiency (cost per instance) 提升为长上下文评测的一级轴;4 任务(Constraint Solving Search / Equivalent Program Pair Search / Program Execution Tracing / Outlier Memo Detection)共享 6 个评判标准(diverse adaptive retrieval / semantically confusable evidence / extensive reasoning steps / step-dependent retrieval / multiple strategies with different costs / wide range of SoTA accuracy & cost)——4 harness(OpenCode / mini-swe-agent / RLM / ReAct)+ 5 模型 + LongBench-V2 / OOLONG-Synth 对照;最佳 config 也只到 68% 宏平均,RLM vs mini-swe-agent 在 Outlier Memo Detection 上 accuracy 相近但 RLM cost 高 12.4×。

(2) 数据 + 截止日-证伪:⚠️ R90 反方审稿 #2(flyp 10-03 长上下文反方)已锁定 5 个待核验项——代码是否开源 + 模型名实锤(GPT-5.6-sol / GLM-5.3 / Kimi-K2.6 全部为 2026 推测名)+ harness 复现成本 + cost 量化口径 + 关联补查(False Frontiers 2609.39102 / Mid-Harness 2609.39982 / Org-Agent 2609.34392 / LibraryDesignBench 2609.36730 / OSWorld-Science 2609.39903);若 2027-Q2 出现 ≥2 篇独立工作将 LongHarness 的"cost 一级轴"思路嫁接到 image/audio/video 多模态长上下文评测空白,则 R90 立基础锚兑现;窗口 6 个月(截止 2027-03)。

1.2 协议层重排饱和基准:SEAL LLM-as-a-Meta-Judge

(1) 机制:R89 续用 SEAL(arXiv:2605.30104 v2 · 2026-08-24 · flyp 10-01 1550 精读 + 10-03 反方审稿 · ByteDance + CityU Hong Kong · GitHub jiaminchen-1031/SEAL)——把"饱和"重新定位为"评估分辨率"问题;不动任务与候选输出,仅改造评估协议:Seeded Elimination(廉价 listwise judge 把候选播到 bracket 两侧,避免早期强强对撞)+ LLM-as-a-Meta-Judge(固定层 Principles + 自适应层 Checklist,meta-judge 不直接打总分,只迭代优化清单)+ 归一化 Borda 聚合;HumanEval / GSM8K / MMLU / BFCL-v2 各选 8 强候选 → 与 FullPair Spearman ρ = 0.95 / 0.83 / 1.00 / 0.98(Top-1 完全一致 4/4)·协议开销 11.89 calls/task vs FullPair 28.00。

(2) 数据 + 截止日-证伪:⚠️ R90 反方 #1(flyp 10-03 SEAL 反方)锁定 5 项盲区——协议层准确 ≠ 价值层准确(FullPair 也是 LLM-as-judge,同源 judge + meta-judge 偏置传染)+ FlatBrk ablation 不完整(未报告 FlatBrk 自身 vs FullPair 的 ρ 与延迟)+ 8 候选 ≈ 容易饱和的协议假设(N≥20 时 seeding 质量下降)+ 候选池是 frozen trace(不解决任务本身的区分度)+ 论文未给 ρ vs 人类 pairwise 对照表 / 未报告异源 judge 一致性;若 2027-Q1 出现 ≥1 篇论文把 SEAL 嫁接到 N≥20 候选池并报告 vs 人类 pairwise ρ,则 R89-R90"协议重排"立基础锚兑现;窗口 4 个月(截止 2027-01)。

1.3 评测成本/执行基础设施量化:HAL + BenchAgent 双轨

(1) 机制:R90 HAL / Holistic Agent Leaderboard(arXiv:2510.11977 · ICLR 2026 录用 · Jay 10-03 1450 工程筛选锚定)——首次以第三方平台提供标准化、考虑成本因素的评测基础设施;关键数字 SWE-bench Verified 单次运行中位成本 $163、单任务范围 $0.08(DeepSeek R1)~ $32.00(Claude Opus 4.1 High)、8 基准全覆盖 ~$800 API 费用、242 次 agent 运行 ~$46,000、GAIA 全覆盖(前沿模型)$2,829(无缓存);R90 BenchAgent(arXiv:2606.05670 · "Do More Agents Help?")——工作流评测子strate,标准化 benchmark 加载 / 工具访问 / 答案契约 / 费用计算 / 轨迹日志;关键发现"增加 agent 数量不自动提升性能",GAIA Level 2-3 上不同精度-成本权衡,scaffold 之间首次可对比。

(2) 数据 + 截止日-证伪:HAL 数据是 Jay 10-03 1450 工程筛选条目,⚠️ 引用基于 ar5iv 摘要 + 工程博客,未精读 PDF 全文,R91 必精读;若 2027-Q1 出现 ≥1 个独立平台(OpenRouter τ²-Bench / BenchAgent / AgentAtlas)公布与 HAL 同口径的 cost-benchmark 报告且单任务成本中位数差距 < 20%,则 R90"评测成本作为基础设施一级属性"立基础锚兑现;窗口 4 个月(截止 2027-01)。

1.4 物理/具身感知-推理-评估闭环:PhysVista 三阶段评测

(1) 机制:R90 PhysVista(arXiv:2610.00559 · 2026-10-02 v1 · Tom 10-02 radar · paper_card 1634 · evaluation 主/multimodal 副)——首个借鉴人类"seeing-reasoning-assessment"认知闭环框架的 VLM 物理智能 benchmark;核心发现:视觉识别与真实物理理解之间存在持续 gap,perspective-invariant physics reasoning 是当前 VLM 的关键盲区;benchmark 设计强调"perception 不等于 reasoning,reasoning 不等于 grounded physics understanding"——为多模态评测提供从纯识别到物理落地的分层范式。

(2) 数据 + 截止日-证伪:⚠️ 关键边界声明——PhysVista 主轴是 VLM 物理智能,不是 agent 评测,引用时需明确边界;若 2027-Q1 出现 ≥2 篇论文将 PhysVista 的"感知-推理-评估闭环"嫁接到 embodied agent / robotics 评测(如 RoboDojo 2607.04434、ClawProBench 2608.22510、EgoTools 已纳入 flyp 周六精读),则 R90"物理闭环"立基础锚兑现;窗口 4 个月(截止 2027-01)。

1.5 泛化作为稳定性而非准确率:SAGO 多轴稳定性

(1) 机制:R90 Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs(arXiv:2610.01428 · 2026-10-03 v1 · Tom 10-02 radar · paper_card 1632 · evaluation 主 benchmark)——提出 SAGO / Stability-Aware Generalization Objective 框架,衡量同一输入在不同扰动与基准下的行为变化程度;涵盖生成一致性 / 内部激活 / 置信度 / 响应镜像四个维度变异性;⚠️ 核心立论:仅靠 accuracy 已经无法表征真实泛化能力——多轴稳定性是补全维度。

(2) 数据 + 截止日-证伪:⚠️ SAGO 立论与 R89 Calibration as First-Class Criterion(arXiv:2609.26489 · paper_card 1504)方向同构——两者均把"非准确率"作为一等评测标准;若 2027-Q2 出现 ≥1 篇工作将 SAGO 的多轴稳定性与 calibration 配对成"双第一类标准",则 R90"稳定性-准确率二分"立基础锚兑现;窗口 6 个月(截止 2027-03)。

1.6 评测诚信延伸:KV Reuse Eval + AgentJudgeBench + Calibration-as-First-Class

(1) 机制:R89 续用三件套——KV Cache Reuse Eval / Boxoffice(arXiv:2609.31415)继续作为"评测失真"传染性警示;AgentJudgeBench(arXiv:2608.26623 · paper_card 1194 · 2026-09-05 v1)——首个系统性研究 LLM-as-a-judge 在工作流 DAG 上对 Agentic 工具调用评判可靠性的 benchmark,揭示当前 LLM judge 在 agentic tool-calling 上的根本局限;Calibration as First-Class Criterion(arXiv:2609.26489 · paper_card 1504 · 2026-09-25 v1)——主张每个 NLP 子领域应将主指标与 calibration 分数配对。

(2) 数据 + 截止日-证伪:三件套共同构成"评测诚信三层"——指标层(KV Reuse Eval)+ judge 可靠性层(AgentJudgeBench)+ calibration 一等标准层(Calibration as First-Class);若 2027-Q1 出现 ≥1 篇论文将 AgentJudgeBench 的 agentic DAG judging 与 calibration 配对成"judge 自身的校准"评测,则"评测诚信三层"立基础锚兑现;窗口 4 个月(截止 2027-01)。

1.7 Harness 自身可评测化:EvoHarnessBench + MILO + Mid-Harness + Harness-Zero + HarnessVLN

(1) 机制:R90 五件套 harness 评测化——EvoHarnessBench(arXiv:2609.04280 · paper_card 1293)评测 agent 在可控 harness 演化(tools/skills/agents 三轴)下保持原有有效行为的能力;MILO / Meta-evolutionary Island Orchestration(arXiv:2609.38349 · paper_card 1619)共同演化 harness 与发现策略,使用 Opus 4.8 与 gpt-oss-120b 超越 8 SOTA harness + 6 搜索方法;Mid-Harness(arXiv:2609.39982 · paper_card 1601 · 2026-10-03 v1)采样验证候选动作,识别 action scaling 作为 test-time compute scaling 目标;Harness-Zero(arXiv:2609.24974 · paper_card 1458)通过 agent-as-harness 蒸馏 harness,证明 frontier LLM 上 agent-as-harness 优于 code-as-harness;HarnessVLN(arXiv:2609.15195 · paper_card 1389)通过共享 Agent Harness 统一免训练具身导航。

(2) 数据 + 截止日-证伪:⚠️ 五件套覆盖 harness 评测全生命周期——演化(EvoHarnessBench)/ 自动发现(MILO)/ 中间层扩展(Mid-Harness)/ 蒸馏(Harness-Zero)/ 跨任务统一(HarnessVLN);若 2027-Q2 出现 ≥1 篇 harness 综述整合成统一 lifecycle benchmark,则 R90"harness 自身可评测化"立基础锚兑现;窗口 6 个月(截止 2027-03)。

1.8 Code Agent RL 信用重分配与质量感知评估

(1) 机制:R89 续用两件套——GAGAR / Groupwise Agentic Grading(arXiv:2609.32577 · paper_card 1568)在 Xiaomi MiMo-V2.6-Flash(310B)+ MiMo-V2.6-Pro(1.02T)pipeline 上验证组内 agentic grader 排序 + sum-preserving redistribution;ASCT / Attentive Search over Counterfactual Trees(arXiv:2609.35215 · paper_card 1573)从可恢复前缀评估合法动作 + frozen actor 概率中心化 + 为 PPO 提供信用;两者共同处理"稀疏奖励下的质量差异"——与 R89 SAGE SCA(长程偏置理论归因)方向同构。

(2) 数据 + 截止日-证伪:⚠️ GAGAR agentic grader 用 SFT 训练的 agent 做组内评分,存在循环依赖风险(grader 偏差传递到 RL);若 2027-Q1 出现 ≥1 篇论文将 GAGAR 或 ASCT 与 RLHF/RLVR 通用 RL 算法做 head-to-head,并报告"grader 与 actor 偏差传递系数"可量化指标,则"质量感知信用重分配"立基础锚扩展兑现;窗口 4 个月(截止 2027-01)。


§2 各工作贡献与相互关系

  • 评测成本一级轴双锚:R90 LongHarness Bench(长上下文 cost 一级轴)+ R90 HAL(agent eval cost 量化基础设施)= 从"单任务"到"评测基础设施"的双层 cost 锚定
  • 协议层重排饱和基准:R89-90 SEAL = 与 FullPair ρ 0.83-1.00 / 11.89 calls vs 28.00 = "不造新基准,改造评估协议"的方法学范式
  • 物理/具身闭环评测:R90 PhysVista + R89 IndicBankBench(金融四阶段)+ R90 EvoHarnessBench(harness 演化)= "感知-推理-评估"三阶段评测设计原语跨域延展
  • 泛化即稳定性:R90 SAGO + R89 Calibration as First-Class Criterion = "非准确率"作为一等评测标准的双立基础锚
  • 评测诚信三层:R89 KV Reuse Eval(指标层)+ R90 AgentJudgeBench(judge 可靠性层)+ R89 Calibration 一等标准层 = 诚信三层体系
  • Harness 自身可评测化:R90 EvoHarnessBench + MILO + Mid-Harness + Harness-Zero + HarnessVLN = harness 评测生命周期全覆盖
  • Code Agent RL 信用重分配续用:R89 GAGAR + ASCT = 质量感知信用分配双路径,延续到 R90 立基础锚 158-159

§3 工程 / 研究 / 批判三视角

3.1 工程视角(可落地性)

  • R90 LongHarness cost 一级轴可直接迁移到生产 RAG/Agent eval——"按 token / API 调用 / wall-time 三口径并列" 应作为评测报告默认字段;⚠️ 落地风险:4 任务偏结构化文本,真实 SWE / deep research 需扩展 task coverage(flyp 10-03 反方 #2 已锁定)
  • R90 HAL 成本数据($0.08-32/任务,$800 全评测)应作为 agent eval 预算规划基线;BenchAgent 协议对齐方法论可直接作为内部评测框架的 scaffold 标准化起点
  • R90 PhysVista 物理闭环可作为 VLM/具身 agent 评测的三阶段设计模板(perception / reasoning / assessment)—— 优于 end-to-end accuracy
  • R90 SAGO 多轴稳定性可与 R89 Calibration 一等标准组合成"非准确率"双柱——作为生产 LLM eval 的二级指标
  • ⚠️ 跨领域落地风险:R90 LongHarness 任务偏结构化文本,multimodal 长上下文未覆盖;R90 HAL 成本数据基于 Anthropic / OpenAI 模型定价,开源权重模型成本需重新测算

3.2 研究视角(创新性)

  • R90 LongHarness cost 一级轴是评测方法学从 accuracy-only 到 multi-axis(accuracy + cost)的范式跃迁——首个把 efficiency 提升为一级轴的长上下文 benchmark
  • R90 SEAL LLM-as-a-Meta-Judge首次系统化"不动任务、不动输出,只改造评估协议"的研究范式——与 R89 KV Reuse Eval 的"benchmark the benchmark"互为表里(前者改协议,后者改指标)
  • R90 PhysVista 物理闭环是 VLM 评测从单阶段 accuracy 到三阶段(perception-reasoning-assessment)的认知闭环范式
  • R90 SAGO 稳定性多轴把泛化重新定义为稳定性而非准确率——是评测范式的二阶跃迁
  • R90 EvoHarnessBench / MILO / Mid-Harness / Harness-Zero / HarnessVLN 五件套构成 harness 评测生命周期全覆盖——从演化、自动发现、中间层扩展、蒸馏到跨任务统一
  • ⚠️ 创新局限:LongHarness 4 任务对真实 long-horizon agent 工作流代表性不足(flyp 10-03 反方 #2 已锁定);HAL 成本数据基于特定模型定价,benchmark inflation 风险与 R89 KV Reuse Eval 的"评测失真"传染性同源

3.3 批判视角(局限)

  • R90 LongHarness 反方 #1(flyp 10-03):任务代表性 vs 真实 long-horizon 工作流——4 任务几乎都是"结构化文本 + 检索 + 集合判断",与真实 SWE / deep research / 长视域 web 操作的结构性差距(多模态 / 10+ 步工具调用 / 错误传播 / 真实代码仓库 / 网页工具错误鉴权全未覆盖)
  • R90 SEAL 反方 #1(flyp 10-03):"协议层准确" ≠ "价值层准确"——SEAL ρ 是 vs FullPair 的相对一致性,FullPair 也是 LLM-as-judge,同源 judge + meta-judge 偏置传染;judge 与 meta-judge 同源 → self-enhancement bias 在 tournament 内部放大
  • R90 HAL / BenchAgent 跨类比风险:HAL 数据基于特定厂商模型定价;BenchAgent 协议对齐方法论对"标准化"的取舍(损失灵活性换可比性)需明示
  • R90 SAGO 多轴稳定性对"稳定性"的定义取决于扰动集合的选择——扰动集合的代表性本身是一个评测盲区
  • R90 Harness 评测五件套整体倾向"harness 自身可优化"叙事,但 agent 在 harness 演化下的真实鲁棒性(harness 突变/中断/降级)覆盖不足

3.4 法律独立段:模型名推测 + 跨类比边界

⚠️ R90 LongHarness Bench(arXiv:2609.38137)原文模型清单(GPT-5.6-sol / Gemini 3.8 Flash / GLM-5.3 / Qwen3.8-27B / Kimi-K2.6)属于2026 推测名,需以原 PDF / 实验室主页核实——不得在工程决策中直接锚定到具体模型版本;⚠️ R90 SEAL(arXiv:2605.30104 v2)实验基于 Azure GPT-5.5 family 作为 judge + meta-judge,异源 judge 一致性未报告——引用 SEAL 协议到非 Azure GPT-5.5 平台时需先做小规模一致性核验;⚠️ R90 HAL(arXiv:2510.11977)的成本数据基于 2025-10 模型定价快照,与 2026-10 当下定价可能存在 ±30% 偏差——预算规划时建议同时引用 HAL 历史数据 + OpenRouter 实时 pricing 双源对照;⚠️ R90 BenchAgent(arXiv:2606.05670)的"协议对齐"标准并非中立——标准化本身是工程决策,需在引用时明确"对齐到何种协议"的取舍说明。


§4 趋势判断与开放问题

4.1 趋势主线(R90 新增 4 条)

  • 趋势主线 143:评测方法学从 accuracy-only 走向 accuracy + cost 双轴(R90 LongHarness + HAL 共同锚定)
  • 趋势主线 144:评估协议从"基准+指标"二元结构走向"基准+指标+协议"三元结构(R90 SEAL + LongHarness + HAL 共同锚定)
  • 趋势主线 145:VLM/具身评测从单阶段 accuracy 走向多阶段认知闭环(R90 PhysVista 锚定 perception-reasoning-assessment 三阶段)
  • 趋势主线 146:泛化从准确率单一维度走向稳定性多轴维度(R90 SAGO 锚定 generation consistency / internal activations / confidence / response mirroring 四轴)

4.2 开放问题(R90 +5)

  • R90-开-1(P0):LongHarness cost 一级轴向多模态长上下文扩展——4 任务对 image/audio/video 长上下文零覆盖,何时/如何扩展是开放问题
  • R90-开-2(P0):SEAL 协议 vs 人类 pairwise 对照表——论文未给 ρ vs 人类 pairwise,无法判断协议层准确是否传导到价值层准确
  • R90-开-3(P0):HAL 成本数据的时效性边界——基于 2025-10 模型定价快照,2026-10 当下定价可能偏差 ±30%,需 OpenRouter 实时 pricing 双源对照
  • R90-开-4(P1):SAGO 扰动集合代表性——多轴稳定性的定义取决于扰动集合,扰动集合的代表性本身是评测盲区
  • R90-开-5(P1):harness 评测五件套对真实生产 harness 突变/中断/降级的覆盖——EvoHarnessBench 仅覆盖可控演化,真实生产 harness drift 未覆盖

§6 综合论文清单

6.1 NET-new 主分类/副分类 evaluation(4 件)

arXiv 号 名称 主分类 副分类 R90 立基础锚
2609.38137 LongHarness Bench(4 任务 · cost 一级轴 · 12.4× cost gap) evaluation agent 157 ★★★★★
2610.00559 PhysVista(感知-推理-评估闭环 · VLM 物理智能) evaluation multimodal 158 ★★★★★
2610.01428 SAGO(泛化即稳定 · 多轴 · generation/activation/confidence/mirror) evaluation — 159 ★★★★
2510.11977 HAL($0.08-32/任务 · $46K 242 次运行 · ICLR 2026) evaluation agent 160 ★★★★★

6.2 邻接 evaluation 主轴(10 件)

arXiv 号 名称 来源
2605.30104 SEAL(LLM-as-a-Meta-Judge · 11.89 calls/task · ByteDance) flyp 10-01 精读 + 10-03 反方
2606.05670 BenchAgent("Do More Agents Help?" · 协议对齐评测) Jay 10-03 工程筛选
2609.04280 EvoHarnessBench(harness 演化 · tools/skills/agents 三轴) 续用 R89
2609.38349 MILO(harness + 发现策略共同演化 · Opus 4.8 + gpt-oss-120b) 续用
2609.39982 Mid-Harness(action scaling · test-time compute scaling) 续用
2609.24974 Harness-Zero(agent-as-harness · frontier LLM 蒸馏) 续用
2609.15195 HarnessVLN(免训练具身导航 · Agent Harness 统一) 续用
2608.26623 AgentJudgeBench(agentic tool-calling judge 可靠性) 续用 R89
2609.26489 Calibration as First-Class Criterion 续用 R89
2609.32577 GAGAR(Xiaomi MiMo-V2.6 · 310B/1.02T · 信用重分配) 续用 R89
2609.35215 ASCT(反事实树注意力搜索) 续用 R89
2609.31415 KV Cache Reuse Eval(Boxoffice · 评测失真传染) 续用 R89
2507.21504 LLM Agents Eval Survey(KDD 2025 · 206 引) 高被引基线

6.3 arXiv 号列表(按时间排序)

2507.21504 · 2510.11977 · 2605.30104 · 2606.05670 · 2608.26623 · 2609.04280 · 2609.15195 · 2609.24974 · 2609.26489 · 2609.26550 · 2609.26623 · 2609.29167 · 2609.29816 · 2609.30192 · 2609.30867 · 2609.31415 · 2609.31506 · 2609.31590 · 2609.32577 · 2609.35215 · 2609.36965 · 2609.37749 · 2609.38137 · 2609.38349 · 2609.39982 · 2610.00559 · 2610.01428


§7 共识、争议与延伸(合流)

7.1 共识(沿用 + R90 新增 1 条)

  • 共识 1:评测方法学正在从单一指标走向多维 / 多阶段 / 多方(IndicBankBench 4-stage / CLEAR 5-dim / AgentWorld 50+ 轮)
  • 共识 2:结构化评估框架在多个领域优于关键词 / 生成式方法(JEV / ARGUS / ImpossibleRubrics)
  • 共识 3:评测诚信是评测设计的必要考虑(ImpossibleRubrics / ARGUS 主动弃答 / LangChain Jev 独立验证)
  • 共识 4(R90 新增):评测成本(per-instance)应作为一级评测指标(LongHarness cost 一级轴 + HAL $0.08-32/任务 + OpenRouter τ²-Bench 135 模型 三方共同锚定)

7.2 争议(沿用 + R90 新增 2 条)

  • 争议 1:JEV 工业价值 vs 学术关注度反向背离(R88-矛盾 P2 延续)
  • 争议 2:Gartner 2028 60% 预测 vs LangChain 数据样本代表性(R88-矛盾 P1 延续)
  • 争议 3:ARGUS 跨领域方法学迁移的边界(结构化 rubric 优越性是否跨域一致)
  • 争议 4(R90 新增):LongHarness 任务代表性 vs 真实 long-horizon 工作流(flyp 10-03 反方 #2 已锁定:4 任务偏结构化文本,多模态/10+ 步工具调用/错误传播/真实代码仓库/网页工具错误鉴权零覆盖)
  • 争议 5(R90 新增):SEAL 协议层准确 vs 价值层准确(flyp 10-03 反方 #1 已锁定:FullPair 也是 LLM-as-judge,同源 judge + meta-judge 偏置传染)

7.3 延伸(合流)

  • 延伸 1:从 harness 层到指标层到协议层——R89 KV Reuse Eval + R89 InferenceBench + R90 SEAL 共同构成评测诚信的三层演进(指标 / 执行者 / 协议)
  • 延伸 2:从实测到理论归因到成本量化——R89 SAGE SCA + R90 LongHarness cost 共同构成长程评测从"评什么"到"为什么难"到"花多少代价"的二阶延伸
  • 延伸 3:从研究到基础设施——R89 "Eval as Infrastructure"三层 + R87 The AI Engineer 缺口数据 + R90 HAL cost 量化共同构成评测生态基础设施化叙事
  • 延伸 4(R90 新增):从 accuracy-only 到 accuracy + stability + cost + 诚信 + 协议 五维——R90 LongHarness(cost)+ SAGO(stability)+ KV Reuse Eval(诚信)+ SEAL(协议)+ IndicBankBench(multi-stage)共同锚定评测五维体系

§8 反思与遗留清单

8.1 本主题内反问(5 件)+ 待核验

  • 反问 1:R90 LongHarness cost 一级轴是否应在所有长上下文评测中作为默认一级轴?扩展到多模态长上下文的时间表?
  • 反问 2:R90 SEAL 协议 vs 人类 pairwise 对照表——是否应作为所有 LLM-as-judge 论文的强制 baseline?
  • 反问 3:R90 HAL 成本数据是否应与 OpenRouter 实时 pricing 双源对照发布,避免定价漂移带来的预算决策偏差?
  • 反问 4:R90 SAGO 扰动集合代表性——是否应在所有 stability 评测中明示扰动集合的构建方法?
  • 反问 5:R90 harness 评测五件套是否应整合成统一的 harness lifecycle benchmark,避免分散工作无法对比?

待核验(5 件):LongHarness 代码与模型名实锤 + SEAL PDF 全文精读(rho vs 人类 pairwise)+ HAL PDF 全文精读 + SAGO 扰动集合构造方法 + harness 五件套 cross-bench meta-review。

8.2 与其他主题交叉

  • LongHarness Bench → llm-infra.md / agent.md
  • SEAL → agent.md / llm-infra.md
  • HAL + BenchAgent → engineering.md / ai-industry.md
  • PhysVista → multimodal.md
  • SAGO + Calibration as First-Class → llm-infra.md
  • Harness 五件套 → agent.md / llm-infra.md
  • KV Reuse Eval → llm-infra.md / rag.md
  • GAGAR / ASCT → agent.md / llm-infra.md

Spark · 2026-10-03 16:40 CST · R90 范式延伸核心信号·在 R89 四件并行之上新增"评测成本即一级轴 + 协议层重排饱和基准 + 物理/具身感知-推理-评估闭环 + 泛化即稳定"四件并行,合计八件评测方法学立基础锚(157-160)·边界:仅写本文件 surveys/2026-10-03-evaluation.md