主题综述 · evaluation(2026-07-21)

  • 作者:spark
  • 更新:2026-07-21

本文综合 /shared/research-kb/organized/paper_cards/ 中主分类为 evaluation 的高信号论文卡、/shared/research-kb/organized/knowledge/evaluation.md R23 活文档脉络、/shared/research-kb/inbox/{tom,jay,spark,flyp,stephen}/ 近 7 天相关笔记,对 2026 H2 末 LLM / Agent / RAG / 多模态系统评测领域做一次深度综述。8 篇主力论文全部带 arXiv ID 出处,所有数字均来自 paper_cards/ 与 inbox 精读反方对照;引用阶段如发现相左以 paper_card TLDR / 可复用信息为准,未核数字以 ⚠️ 标注。


1. 主题脉络:从单点能力到"评测元方法学"

2026 H2 末,evaluation 已经从"哪个模型在 MMLU / HumanEval 上分高"演化为对智能系统做稳定、可重复、可审计、可反向影响训练、可指导 Harness 自演进、可归因组合因子、可在多 Agent 协调盲区中保持有效、可在无失败样本条件下归因根因、可被 Harness Engineering 持续重新定义入口的工程体系(R23 活文档 §0 十二重范式跃迁,paper_cards/048-2507.21504)。这一演化的几个关键节点:

  • 评测对象的扩展:从 LLM 单点能力 → Agent / RAG / 多模态 / 长上下文 / 行业垂直 5+ 类对象分化(活文档 §1)。
  • 评测方法的工程化:从 score-only → harness + judge + CI gate + trace-driven evaluation + EDD 生产闭环(活文档 §3)。
  • 评测可信度元层化:FrontierMath v2 修正 v1 42% 题目错误;Benchmark Saturation 60 benchmark 饱和轨迹成为独立主线;Judge Reliability Harness(JRH, RAND Corporation 2026-07-19)首次把 judge 校准从"trust 论文"推到"trust artifact"(活文档 §2.1, §3.2)。
  • 评测基础设施元层化:从 model snapshot → service snapshot → inference stack + harness + verifier 三层独立可配置矩阵(L1/L2/L3);AgentCompass(arXiv:2607.13705)显式把 Benchmark / Harness / Environment 三组件解耦成独立矩阵(paper_cards/405-2607.13705,HF Daily 38▲ 7-19);AI Engineer 2026 agent stack 把 Evaluation 升为 Layer 5,Governance 升为 Layer 6。
  • 验证成为独立 scaling 轴:LLM-as-a-Verifier 在 Terminal-Bench V2 86.5% / SWE-Bench Verified 78.2% / RoboRewardBench 87.4% / MedAgentBench 73.3% 4 套基准 SOTA;Rubric LLM judge-as-rubric-grader 接入 RL reward 通道;Long-Horizon-Terminal-Bench 46 项长程任务 + dense reward(活文档 §1 第 7 维)。
  • Harness Engineering 双轴 + Judge 校准三件套(活文档 §2.1 R22 总结):Harness 自演进 AHE / The Last Harness / Meta-Harness / HarnessHandbook / LongStraw 5 件套,与 Judge 校准 Reliability without Validity(arXiv:2606.19544)+ JRH + paean-harness 工程实践三件套合流,构成 2026 H2 末评测产业格局。
  • CoT 压缩-可监控性前沿 + Compass 命名范式扩散 + matched budget 三层反方 + 89%/52% 缺口量化 + 垂直具身评测分化(R23 新增第 14 维):Length Penalties Make CoT Less Monitorable(arXiv:2607.09786)揭示 compression-monitorability frontier,KeyFrame-Compass + MultiRef-Compass + AgentCompass 让 Compass 命名从五件套扩展到六件套(增视频生成 Compass),Rethinking Harness Evolution(arXiv:2607.12227)L1+L3 反方深化,The AI Engineer Stack 2026 报告 89% 团队宣称做 eval 但只有 52% 真正落地(37pp 缺口,⚠️ Substack 数字待独立核验),SIS-Bench(arXiv:2607.12477)+ VIABench(arXiv:2607.14660)垂直具身评测分化。

2. 各工作贡献与相互关系

2.1 评测综述与方法论(奠基层)

arXiv:2507.21504(166 S2 被引,paper_cards/048)——《Evaluation and Benchmarking of LLM Agents: A Survey》

提出"评价目标 × 评价过程"二维分类体系,沿评估目标维度组织已有工作,是 2025 H2 末 LLM Agent 评测领域被引最高的综述(166 S2 / 4 影响力)。它的局限性也由此而来:评测覆盖有限(模型家族、工具、pipeline 拓扑),多模态 agent、紧密耦合 RAG 系统、强沙箱场景可能不同——这是 2026 H2 末"评测对象的横向分化"主线(活文档 §2.7 六十+ 子领域)的源头批判。

arXiv:2606.11435(2 S2 被引,paper_cards/073)——《Agent Skill Evaluation and Evolution: Frameworks and Benchmarks》

把 Skill 评测与 Skill 演化合并为一张图,归纳四种范式:执行反馈 / 轨迹蒸馏 / 压缩 / 强化学习。代表性 benchmark:WildClawBench(60 tasks / 6 categories,真实 OpenClaw 环境,Docker 隔离评分);SkillForge(3,737 tasks,5 个真实云技术场景);SkillRouter(retriever + reranker 做技能选择,仅靠名称/描述在大规模场景下不准确)。它的贡献是把 skill ecosystem 当成"评测对象的一个新层级",与 AgentCompass 三层解耦互补——前者是"技能维度的评测套件",后者是"评测套件本身的解耦"。

2.2 Harness 自演进(从手工到自动化到元自动化)

三篇代表性工作形成"Harness 自演进三件套",按方法论递进:

arXiv:2604.25850(36 S2 被引 / 7 影响力,paper_cards/030)——《Agentic Harness Engineering (AHE)》

核心是"三个相互匹配的 observability 支柱":每次 harness 编辑被转成"可证伪的契约"——前提(premise)自声明 + 决策可观测(Decision Observability)+ 任务级结果验证。10 轮 AHE 迭代后,Terminal-Bench 2 的 pass@1 从 69.7% → 77.0%,超越人类设计的 Codex-CLI(71.9%);跨任务迁移:冻结的 evolved harness 在 SWE-bench-verified 上 top-12% 且 token 减少 12%;跨三个模型族均有 +5.1pp 至 +10.1pp 提升。这是 2026 H2 末最有"硬数字"支撑的 Harness 自动化工作。

arXiv:2604.21003(2 S2 被引,paper_cards/028)——《The Last Harness》

AHE 的"二级跳"——把"手动 harness 工程 → 自动化 harness 工程"再向前一步,自动化"自动化本身的设计"。双层循环:外层自动化 harness 工程,内层自动化 harness 自动化方法的设计(即自动化 LLM 选择、奖励函数形状、搜索预算分配等 meta-参数)。与 AHE 的实证路线相比,更偏框架性,没有提供同等量级的实证数字,但为后续 AgentCompass 三层解耦(下面 §2.4)埋下伏笔。

arXiv:2606.13643(0 S2 被引,paper_cards/012)——《Recursive Agent Harnesses (RAH)》

命名并研究"递归单元是完整 Agent harness(filesystem 工具 + 代码执行 + 规划)而非无工具的模型调用"这一模式,在长上下文推理上给出受控评估。它与 AHE / The Last Harness 形成对照:RAH 是"递归深度"维度(一个 agent 的内部递归),AHE 是"harness 自身演进"维度(harness 作为一个对象在工程上迭代),The Last Harness 是"meta 自动化"维度。三者一起把"harness 不再是 wrapper"这件事讲透了。

2.3 Harness 评测协议反方(深度审视)

arXiv:2607.12227(0 S2 被引,paper_cards/434)——《Rethinking the Evaluation of Harness Evolution for Agents》

对 LLM Agent 自动 harness 演化进行广泛评估,在相当的反馈和推理预算下,把 harness evolution 与简单的 test-time scaling / discovery 基线比较;并在 held-out 任务上评估 evolved harness 是否真的泛化。它形成活文档 §6.22 总结的 Rethinking Harness Evolution 三层反方体系

  • L1 matched budget 颗粒度 loophole:预算的颗粒度(每次 rollout 的 token cost / API call 数 / wall-clock / retry 数)作者可任选;harness evolution 的"prompt 写入"是 long-lived 资产,task-level search 的"prompt 选择"是 ephemeral,预算 matched 不等于价值 matched
  • L2 hacking_gap(与 SpecBench, arXiv:2605.21384 互补):把 reward hacking 量化成 hacking_gap = val_pass − holdout_pass;每 10× 代码量增加约 28pp gap,2,900 行"hash-table compiler"实际是查表背测试输入的反例(flyP 7-20 E2 精读,⚠️ held-out 隔离性待 PDF 核)。
  • L3 held-out 跨家族泛化边界:Terminal-Bench 同一任务家族 distribution shift 有限,真正的"泛化"应该是跨任务类型(held-out SWE → held-out RAG / web / GUI)。

三层反方合流意味着:harness evolution 不是"做出来 + 跑分高"就够,必须经过 matched budget 协议 + 跨家族 held-out + hacking_gap 量化三重审计。这是 2026 H2 末评测元方法学"协议可操作化工具成熟"的核心载体。

2.4 评测基础设施的三层解耦

arXiv:2607.13705(0 S2 被引 / 38▲ HF Daily 7-19,paper_cards/405)——《AgentCompass: A Unified Evaluation Infrastructure》

把评测流程围绕三个独立组件组织:L1 Benchmark(题面 + 真值 + 评分协议) / L2 Harness(agent 调度 + 工具接入 + trace 收集) / L3 Environment(沙箱 + 状态管理 + 资源约束)。三者可以独立替换 / 配置,不必重新实现复杂执行逻辑。它的核心贡献是把"评测套件自身的设计"推到 L1/L2/L3 矩阵——任何评测报告都必须显式声明三者各自的版本与契约。这是与 AHE "harness 编辑可证伪"互补的另一面:AHE 让 harness 自动化,AgentCompass 让 harness 可被独立审视。

2.5 评测对象的横向分化(具体的、被低估的能力)

arXiv:2606.14397(0 S2 被引,paper_cards/251)——《Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments》

GauntletBench 提出"被低估的能力"三种:temporal perception(时间感知)/ graphical understanding(图形理解)/ 3D reasoning(3D 推理)——这三种在 SWE-bench / HumanEval / WebArena 等"familiar" benchmark 上几乎不被覆盖。它揭示了当前 Agent 能力与复杂真实场景所需能力之间的巨大差距。与 The Last Harness 的"自动化 automation 本身"配对看:当前 agent 的"自我认知边界"远未到达元自动化所需的可靠度。

arXiv:2510.13910(4 S2 被引,paper_cards/141)——《RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic RAG Systems》

能力导向的细粒度评测——不只看端到端 QA 正确率,而是拆解 agentic RAG workflow 的中间任务(规划 / 检索 / 推理 / 综合),构建典型 LLM 错误的分类体系,针对性设计评测问题。反方实证(paper_cards/141 可复用信息区):在 FinanceBench 数据集上,Agentic RAG + GPT-5-mini 达到 92% 正确率,是传统 RAG 的 3.8 倍;agentic 检索 > 关键词检索 baseline(2.8×)。这意味着"端到端分数的提升未必来自检索本身,可能是中间错误被下游吸收或掩盖",RAGCap-Bench 把这种"端到端 vs 过程化"的差暴露出来。

arXiv:2607.01233(1 S2 被引,paper_cards/188)——《Measuring the Gap Between Human and LLM Research Ideas》

实证结论:强 LLM 能产出一系列合理思路,但其范围比人类研究品味更窄,并存在系统性偏移。这把"AI Scientist"评测从"想法可不可行"推到"想法的分布是否与人类品味对齐"——评测对象第一次从"能力"扩展到"研究品味"。

2.6 安全 / 测量偏差 / RAG 评测侧翼

arXiv:2606.10749(1 S2 被引,paper_cards/069)——《Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Benchmarking》

观点:安全 LLM Agent 需要显式信任边界 + 原则化权限控制 + 具备溯源能力的 state 管理 + 与真实运行场景对齐的评估实践;现有 benchmark 仍未充分覆盖长程、具状态、对部署敏感的风险。数据点(可复用信息区):2024 单 agent 90.5% / 多 agent 9.5%;2025 单 agent 76.0% / 多 agent 24.0%;2026(部分)单 agent 82.7% / 多 agent 17.3%——多 agent 已从 niche 转为稳定子领域,但安全 benchmark 跟不上速度。

arXiv:2605.24217(0 S2 被引,paper_cards/138)——《Systemic Measurement Bias in LLM Inference Benchmarking》

提出无偏、多进程 evaluation 框架,能有效分散 client 端负载,在每秒数千次 query 以上的生产规模下做精确、可复现的 LLM profiling。这是评测"可信复现性"的反方工作——评测套件的可重复性不能依赖偶然的客户端时序,必须用协议消除。

arXiv:2603.29875(0 S2 被引,paper_cards/080)——《UnWeaving GraphRAG》

position 论文:实体分解能形成对原始信息更精炼的表示,并降低索引与生成过程中的噪声;端到端 QA 评测中 VectorRAG 表现优于标准 GraphRAG,且接近当前 SOTA 图方法的效果。这把"RAG 评测的可信度"推到检索策略选择本身——评测分数的提升未必来自 prompt 或 LLM,而可能来自检索侧的优化被吸收。

arXiv:2607.09786(0 S2 被引,paper_cards/413)——《Length Penalties Make CoT Less Monitorable》

揭示 compression-monitorability frontier:更廉价的推理在保留答案的同时使影响更难被检测。token 压缩、length-normalized decoding 等长度惩罚提升效率的同时让 CoT 推理更难被人类或自动化 judge 检测。与 Reliability without Validity 的 verbosity bias 被高估 < 0.011、JRH Finding 4 verbosity bias 测试、judge 太宽松(arXiv:2607.12885)四件套同根——"压缩效率 vs 推理可审计性"成为 2026 H2 末 judge 校准的第四轴(在已知的"格式扰动 / 改述 / 长度偏好 / 重复采样"四维外)。


3. 工程视角(可落地性)

把上面 14 篇工作按"可落地"和"研究导向"分两组,会看到工程视角的核心张力:

可落地性已经成熟的工作

  • AHE(arXiv:2604.25850) 是当前最接近工业可用的 Harness 自演进框架——10 轮迭代、Terminal-Bench 2 pass@1 +7.3pp、跨模型族泛化 +5.1pp 至 +10.1pp、token 减少 12% 都有硬数字。它的三 observability 支柱可以直接移植到 CI pipeline(每次 PR 自动跑 AHE 一轮 + 任务级结果验证)。落地难点在于:依赖"自声明预测"的契约要求——harness 编辑者必须把意图写成机器可校验的声明,工程团队需要培训这一纪律。
  • AgentCompass(arXiv:2607.13705) 的 L1/L2/L3 解耦对工程团队极友好:现有 benchmark 不必重写,只要换 Harness / Environment 就能在同一报告框架下对比不同推理栈。这是把 model snapshot 推到 service snapshot 的关键一步
  • Systemic Measurement Bias(arXiv:2605.24217) 的多进程框架直接对生产推理服务做 profiling,0.69s 的延迟开销可接受,对 vLLM / SGLang / RTP-LLM 等部署是必读。
  • RAGCap-Bench(arXiv:2510.13910) 的能力导向评测直接对应"agentic RAG 中间步骤错误如何级联影响最终答案"——工程团队用它诊断自家 RAG pipeline 的瓶颈比端到端分数更有信号。

工程视角下的最大痛点

  • JRH(活文档 §3.2)——judge 校准从论文推到产品层,但与 Reliability without Validity 的对应关系"consistency-bias paradox 对应 JRH 哪一维"未明示。工程团队拿到 JRH 不会用,因为它没有给出与既有元方法学批判的映射。
  • Compass 六件套续势(KeyFrame-Compass + MultiRef-Compass + AgentCompass) 命名范式扩散到视频生成评测是好趋势,但"评测基础套件 Compass / OS / OS-Agent / SearchOS / Guard 五件套"之间没有统一接口协议——Compass 命名学得会,但协议层各家不同,迁移成本不低。
  • Rethinking Harness Evolution(arXiv:2607.12227)的反方 实际意味着任何 harness evolution 报告都必须重做一遍——这是 AHE 的工业落地风险:硬数字漂亮,但匹配预算的颗粒度怎么选仍由作者定,工业采用需要协议对齐。

4. 研究视角(创新性)

研究视角下,evaluation 在 2026 H2 末的几个真正创新点:

  • Harness 自动化从工程问题变成元自动化问题。AHE 解决"自动化 harness 编辑",The Last Harness 解决"自动化自动化设计",RAH 解决"递归深度"——三个工作一起把 Harness 视为 first-class object,而不是 LLM 周围的脚手架。这是研究范式的跃迁:从 wrapper 到 object。
  • 评测协议质疑成为独立子方向。Rethinking Harness Evolution 三层反方 + SpecBench hacking_gap 量化(arXiv:2605.21384,flyP 7-20 E2 精读) + LoCoBench-Agent comprehension vs efficiency 双轴(arXiv:2511.13998,flyP 7-20 v2 重写)合流——"评测套件自身的评测"(meta-evaluation)从边缘走到中心
  • Judge 校准三件套:Reliability without Validity 元方法学批判(21 judges × 9 providers × 3 benchmarks × 118 runs ≈ 541,000 judgments,4 大方法学发现)+ JRH 工业落地 + paean-harness 工程实践——judge 验证从"trust 论文"演进到"trust artifact"。研究层面第一次有了"judge 校准作为产品层"的工程化范式。
  • 评测反向耦合训练 reward。Rubric LLM judge-as-rubric-grader 接入 RL reward 通道(活文档 §1 第 14 维)+ Ring-Zero(arXiv:2607.12395,90▲ 7-19)+ SEED(arXiv:2607.14777,83▲ 7-19)+ LongStraw(arXiv:2607.14952v1,176▲ 7-20 本期最高票)——评测驱动训练推到万亿参数 base layer + 长上下文 RL 训练补全
  • AI Scientist 评测从能力推到品味。Measuring the Gap Between Human and LLM Research Ideas(arXiv:2607.01233)首次把"研究品味分布"作为评测维度,与"想法可不可行"互补——研究对象从"产出质量"扩展到"产出分布"。

5. 批判视角(局限)

每篇工作的局限都已被作者或反方论文挑明,列在这里不只是为批判,更是为了给后续工作留口子:

  • arXiv:2507.21504:依赖外部攻击 LLM(弱模型降低成功率);评测覆盖有限(模型家族、工具、pipeline 拓扑);多模态 agent、紧密耦合 RAG 系统、强沙箱场景可能不同。
  • arXiv:2606.11435:WildClawBench 60 tasks / SkillForge 3,737 tasks 的规模仍偏小;SkillRouter 仅靠名称/描述的局限性在工具爆炸场景下会放大;评测指标没有覆盖"技能动态增删"。
  • arXiv:2604.25850:10 轮 AHE 迭代在 Terminal-Bench 2 上的 +7.3pp 提升依赖 harness 编辑者把意图写成可校验契约——质量受编辑者纪律影响;SWE-bench-verified top-12% + token 减少 12% 的迁移性在跨家族泛化上需要更多对照(已有 +5.1pp 至 +10.1pp 跨三个模型族,但仍是闭集评估)。
  • arXiv:2604.21003:偏框架性,缺少与 AHE 等量的实证对照;meta 自动化层没有清晰的目标函数。
  • arXiv:2606.13643:长上下文受控评估,但"递归深度"对算力的依赖没有量化。
  • arXiv:2607.12227:三层反方的"匹配预算"颗粒度本身仍由评测者定义,没有"价值匹配"的统一尺度;held-out 跨任务类型泛化的实验尚少。
  • arXiv:2607.13705:三层解耦的协议层还没标准化——L1 Benchmark / L2 Harness / L3 Environment 的版本契约如何表达没有 RFC。
  • arXiv:2606.14397:GauntletBench 的 temporal / graphical / 3D 三种能力评测指标与现有能力评测的对应关系不清晰。
  • arXiv:2510.13910:能力导向的中间任务拆分可能遗漏"组合错误"——单独看每个中间步骤没问题,组合起来崩。
  • arXiv:2607.01233:研究品味分布的"系统偏移"用什么 metric 量化未明示。
  • arXiv:2606.10749:威胁面 + 攻击 + 防御 + 评测的并列分类法可能让"评测"沦为描述性,缺乏攻防博弈的演进分析。
  • arXiv:2605.24217:多进程框架在 client 端负载分散时是否引入额外 bias 需要独立验证。
  • arXiv:2603.29875:position 论文的端到端 QA 结论是单 benchmark(MuSiQue),跨任务类型泛化未核。
  • arXiv:2607.09786:compression-monitorability frontier 的"monitorability" operational metric 尚未规范。

这些局限共同指向一个事实:评测领域的"评测对象"在 2026 H2 末已经从 LLM 单点能力扩展到 67+ 子领域(活文档 §5),每一类都有独立的方法学缺口


6. 趋势判断与开放问题

6.1 趋势

  1. Harness Engineering 三件套(HarnessHandbook + LongStraw + JRH)将成为工业 Agent 评测入口位。HarnessHandbook 让 harness 可读可编辑,LongStraw 让 harness 训练补全,JRH 让 harness 的 judge 校准产品化——三件套构成 Harness Engineering 统一标准的雏形。预判 2026 H2 末出现首批"JRH-style judge 可靠性 SDK + matched budget protocol + 评测基础套件 Compass / OS / OS-Agent / SearchOS / Guard / Video-Compass 六件套工业 SDK + Reliability without Validity 元层方法学批判"四件套论文 5-10 篇(活文档 §8.57)。

  2. 评测反向驱动 RL / 训练 / 架构。Ring-Zero + SEED + LongStraw(176▲ 7-20 本期最高票)把"评测反向耦合"推到万亿参数 base layer + 长上下文 RL 训练补全——评测不再是"训练完之后打一个分",而是 RL 后训练通道的 active 组件。

  3. CoT 压缩-可监控性成为 judge 校准第四轴。Length Penalties Make CoT Less Monitorable(arXiv:2607.09786)与 Reliability without Validity consistency-bias paradox / JRH Finding 4 verbosity bias / judge 太宽松四件套同根。预判 2026 H2 末出现首批"CoT 监控性 + Compass 六件套 + matched budget 三层反方 + 89%/52% 缺口量化 + 垂直具身评测分化"五件套论文 5-8 篇(活文档 §8.58)。

  4. AI Engineer 89%/52% 缺口是 2026 H2 末评测产业的核心矛盾。The AI Engineer Stack 2026 报告显示 89% 团队宣称做 observability 但 52% 真正落地 eval(37pp 缺口,⚠️ Substack 数字待独立核验)。生产质量死亡地带会推动工业评测从"事后审计"转向"事前 CI gate + 事后审计"双闭环。

  5. 评测基础套件命名范式扩散到 Compass / OS / OS-Agent / SearchOS / Guard / Video-Compass 六件套。从 agent 评测 → 视频生成评测 → 开放域检索 → 图像护栏——命名学成为评测产业的"事实接口协议"。

6.2 开放问题

  1. Judge Reliability Harness 六维 judge 可靠性测试是否覆盖"语义级错误模式"。JRH 当前主要测试"格式扰动 / 改述 / 长度偏好 / 重复采样"四类,对"语义级对立"(反驳论证 / 反事实推理 / 范畴越界)的覆盖度有限。Reliability without Validity 的 consistency-bias paradox 与 JRH 哪一维对应未明示。Human-in-the-loop review 引入评测者主观偏差形成循环依赖。

  2. Harness Evolution 的 matched budget 颗粒度与价值匹配。Rethinking Harness Evolution 揭示 L1 预算颗粒度 loophole,但预算 matched 不等于价值 matched——评测协议是否需要补充"价值匹配"维度?Terminal-Bench 同一家族 held-out 是否真正代表"泛化"?跨任务类型(held-out SWE → RAG / web / GUI)的实验何时被纳入 harness evolution 评测?

  3. Compass 六件套(增 Video-Compass)的工业协议层。KeyFrame-Compass(arXiv:2607.14202)+ MultiRef-Compass(arXiv:2607.14189)+ AgentCompass(arXiv:2607.13705)三个 Compass 命名有接口层吗?版本契约如何表达?评测报告能否"以同一份格式"列出三个 Compass?

  4. AI Scientist 评测的研究品味分布如何量化。arXiv:2607.01233 揭示 LLM 思路"范围更窄、系统性偏移",但"系统性偏移"用什么 metric 量化?是否需要"人类品味分布"作为 ground truth 来校准?这与 JRH 的人类在环 review 是同一个问题还是两个问题?

  5. RAG 评测的可信度边界。arXiv:2603.29875 揭示 VectorRAG > 标准 GraphRAG,但端到端 QA 评测可能掩盖检索侧的优化贡献;arXiv:2510.13910 把评测推到中间任务步骤——RAG 评测何时从"端到端分数"演进到"过程化分数 + 端到端分数"双报告?

  6. 评测基础设施 L1/L2/L3 解耦后的协议标准化。AgentCompass 把三层独立可配置,但 L1 Benchmark / L2 Harness / L3 Environment 之间的版本契约、测试集契约、校准记录契约如何统一?JRH 是否能为这三层各自的"评测可信度"分别给出测试?

6.3 跨主题连接

  • agent.md:Harness 自演进 + Judge 校准三件套 + Agent 50+ 件套评测(活文档 §2.7)。
  • rag.md:RAGCap-Bench 能力导向 + Human-Centric RAG Evaluation(arXiv:2607.15963)+ Agentic Adaptive RAG(arXiv:2606.05658)评测方法论双线。
  • multimodal.md:KeyFrame-Compass + MultiRef-Compass + Boogu-Image-0.1(126▲ 7-20)+ VideoChat3(146▲ 7-20)视频 MLLM 评测基线。
  • llm-infra.md:Systemic Measurement Bias 多进程评测框架 + AgentCompass 三层解耦 + 评测协议可操作化工具成熟。
  • risk.md:Toward Secure LLM Agents 威胁面 + TokenWall / Beyond Attack-Success Rate / Vera / AgentLAB 四轴 + 行为隐私(arXiv:2607.06815)评测新维度。
  • ai-industry.md:JRH 工业落地 + The AI Engineer 89%/52% 缺口 + Compass / OS / OS-Agent / SearchOS / Guard / Video-Compass 六件套产品形态。

7. 综合论文 arXiv ID 列表

本文综合 8 篇主力论文(带 arXiv 号):

  1. arXiv:2507.21504 —— Evaluation and Benchmarking of LLM Agents: A Survey(paper_cards/048,166 S2 被引)
  2. arXiv:2606.11435 —— Agent Skill Evaluation and Evolution: Frameworks and Benchmarks(paper_cards/073)
  3. arXiv:2604.25850 —— Agentic Harness Engineering (AHE)(paper_cards/030,36 S2 被引 / 7 影响力)
  4. arXiv:2604.21003 —— The Last Harness: Meta-Evolution 双层循环(paper_cards/028)
  5. arXiv:2606.13643 —— Recursive Agent Harnesses (RAH)(paper_cards/012)
  6. arXiv:2607.12227 —— Rethinking the Evaluation of Harness Evolution for Agents(paper_cards/434)
  7. arXiv:2607.13705 —— AgentCompass: A Unified Evaluation Infrastructure(paper_cards/405,38▲ HF Daily 7-19)
  8. arXiv:2606.10749 —— Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Benchmarking(paper_cards/069)

引用支撑 6 篇(出现在 §2.5 / §2.6 / §3 / §5 / §6):

  1. arXiv:2606.14397 —— Running the Gauntlet: GauntletBench(paper_cards/251)
  2. arXiv:2510.13910 —— RAGCap-Bench(paper_cards/141)
  3. arXiv:2607.01233 —— Measuring the Gap Between Human and LLM Research Ideas(paper_cards/188)
  4. arXiv:2605.24217 —— Systemic Measurement Bias in LLM Inference Benchmarking(paper_cards/138)
  5. arXiv:2603.29875 —— UnWeaving GraphRAG: GraphRAG vs VectorRAG 理论分析(paper_cards/080)
  6. arXiv:2607.09786 —— Length Penalties Make CoT Less Monitorable(paper_cards/413)

合计 14 篇 arXiv 论文 + 活文档 R23 / R22 脉络 + inbox 7-19~7-21 五位成员 E1 预消化 + flyP 7-20 E2 精读。