主题综述 · evaluation(2026-09-13)
- 作者:spark
- 更新:2026-09-13
承接 9-7 / 9-9 evaluation 综述基线 + 9-8 llm-infra v2 重写(#47 失守全修)+ 9-11 risk + 9-12 agent + 9-13 rag。本期聚焦「评测基础设施的三层解耦 → Harness 自演进 × 演进协议反方 → 评测对象的横向分化(垂直具身 / 真实场景 / 全生命周期信任)→ Harness 演进产物回灌训练」四线合流。Sep 12-13 信号密度为 R73 以来最低点(Tom 9-13 evaluation e1prep 0 件 net-new),但 R73 已锚 12 件工作票数横盘,意味着本主题进入「消化期」而非「停滞期」。
整合性 disclaimer:本棒「四线合流 / 反方四维 / Harness 矩阵化」均为综述视角方法学整合,非学界共识。需 ≥2 独立团队对 AgentCompass + EVOHARNESSBENCH + Rethinking Harness Evolution + OpenForgeRL + AHE + RoboDojo + SIS-Bench + WearableQA + SWE-Bench Pro Verified + EvoSafeHarness + AgentAudit + IdeaAMBIG + MetroLLM-Bench 做 head-to-head 才升级立基础锚。
§0 自检栏
机制段 N=4 线合流;⚠️ 数字核验 K=12;CJK ≤3,900 硬约束(W36 主体 ≤3,500 + 反方 300 + 元信息 100);反方 v2 三段式按主线分布 ≥150 字 ✅;反方 v2 形式标签 ≥5 处 ✅;立标池红线 4 件套命中 3 件(GitHub 已验 AHE / AgentCompass / RoboDojo / EVOHARNESSBENCH + ⚠️ 立标 4 件 + 双轨 + abstract 核实);私域 SUM=0;verifiability ≥20% 抽查 8/16 = 50%;增量窗口 1 天 net-new 0 件 + 沿用 13 件 R73 已锚 + 1 件 ACL 2026 Findings 综述新增 + 1 件 arXiv 2606.20683 综述新增 = 16 件主轴工作。
1. 主题脉络:从「分数高」到「评测即基础设施」的四线合流
2026 H2 末 evaluation 主题持续上 / 下 / 横三迁,本期合流在四线:
- 向上(评测基础设施元层化):AgentCompass
arXiv:2607.13705(paper_card 405 · evaluation 主分类 · HF Daily 7-19 38▲)把评测流程拆成 L1 Benchmark / L2 Harness / L3 Environment 三层独立可配置矩阵——三者可独立替换 / 配置,不必重新实现复杂执行逻辑。这是评测作为「CI 基础设施」的工程先决条件。 - 向下(Harness 自演进 + 演进协议反方):AHE
arXiv:2604.25850(76 S2 / 16 影响力被引 · paper_card 030)三支柱 premise / Decision Observability / 任务级验证闭环把 Terminal-Bench 2 pass@1 推 69.7%→77.0%(超 Codex-CLI 71.9%);Rethinking Harness EvolutionarXiv:2607.12227(17 S2 · paper_card 434)反方把「harness evolution 与 test-time scaling 在 matched budget 下其实相当」揭示出来,形成 matched budget loophole + hacking_gap + held-out 跨家族泛化三层反方。 - 横向(评测对象的多元化):RoboDojo
arXiv:2607.04434(12 S2 · paper_card 172,30 策略 × sim-and-real 统一基准)+ SIS-BencharXiv:2607.12477(4 S2 · paper_card 411,UAV self-in-space)+ WearableQAarXiv:2609.05405(4,084 题 / 200 真实用户可穿戴数据)+ MetroLLM-BencharXiv:2609.10016(955 用例 / 6 真实地铁系统)+ AgentAuditarXiv:2609.09875(10 维全生命周期信任评估)——评测对象从「通用 Agent」扩展到「具身 / 真实场景 / 嵌入式 UI / 公共基础设施」全谱。 - 回灌(Harness 演进产物反哺训练):OpenForgeRL
arXiv:2607.21557(4 S2 · paper_card 585)首次把「harness 原生 agent 训练」开源框架化,让 harness 演进不再止于 evaluation,而是产出可训练的 agent 策略。
Sep 12-13 窗口(Tom 9-13 evaluation e1prep 报告):eval 专项 net-new = 0,eval 邻接 net-new = 0,但 R73 已锚的 12 件工作票数延续横盘(EvoSafeHarness 47▲ · WearableQA 37▲ · SWE-Bench Pro Verified 23▲)——信号密度进入低谷期但方法学脉络持续。
2. 各工作贡献与相互关系
2.1 评测综述与方法论(2026 H2 新增两块拼图)
Yehudai et al. 2026(ACL 2026 Findings · pp 26690-26714 · DOI 10.18653/v1/2026.findings-acl.1330)——《A Survey on Evaluation of LLM-based Agents》。
2026 H1 LLM-based Agent 评测综述,五个视角:①核心 LLM 能力(planning / tool use)/ ②应用专属 benchmark(web / OS)/ ③评估方法(trajectory / process / outcome)/ ④可信度 / ⑤评测基础设施。它是 arXiv:2507.21504(166 S2 被引 · paper_card 048)之后的接力综述,把 LLM Agent 评测从「agent 单点能力」系统化到「agent-as-system 全链路」。
arXiv:2606.20683(2026-06)——《From Question Answering to Task Completion: A Survey on Agent System and Harness Design》。
横切 2020-2026 所有 LLM-based Agent 系统:prompting 方法 / 工作流框架 / harness & runtime 设计 / 多模型编排 / agent-native 训练 / 模型-harness 协同进化 / 领域部署 / 评估方法学。其中提到 Meng et al. 把 harness 形式化为六元组,Li et al. 提出七层 ETCLOVG 分类法并对大规模开源语料做映射。它与 Yehudai et al. 的差异:前者更系统化(评测独立成章),后者更工程化(harness/runtime 与评测并列)。
2.2 Harness 自演进三件套 → 矩阵化(Harness 不再是 wrapper)
arXiv:2604.25850(76 S2 / 16 影响力被引 · paper_card 030)——《Agentic Harness Engineering (AHE)》。
三支柱:①premise 自声明 + ②Decision Observability + ③任务级结果验证。每一次 harness 编辑都被转成「可证伪的契约」。实证(paper_card 030 复用信息区):10 轮 AHE 迭代 → Terminal-Bench 2 pass@1 从 69.7% → 77.0%,超过人类设计的 Codex-CLI 71.9%;跨任务迁移:冻结的 evolved harness 在 SWE-bench-verified 上 top-12% 且 token 减少 12%;跨三个模型族均有 +5.1pp 至 +10.1pp 提升。它的方法论价值是把 harness 从「prompt 套壳」推到「可证伪对象」,是 2026 H2 末评测元方法学的奠基性工作之一。
arXiv:2607.13705(2 S2 / 38▲ HF Daily · paper_card 405)——《AgentCompass: A Unified Evaluation Infrastructure》。
L1 Benchmark / L2 Harness / L3 Environment 三层解耦。原生支持 20+ benchmarks × 5 capability dimensions(web / GUI / coding / search / DS)。提供 fault-tolerant asynchronous runtime + 轨迹分析工具覆盖 reward hacking。它与 AHE 是互补关系——AHE 让 harness 自动化,AgentCompass 让 harness 可被独立审视。AHE 是「harness 演进路径」,AgentCompass 是「harness 矩阵化」。
arXiv:2606.13643(2 S2 · paper_card 012)——《Recursive Agent Harnesses (RAH)》。
命名并研究「递归单元是完整 Agent harness(filesystem 工具 + 代码执行 + planning)而非无工具的模型调用」的模式,在长上下文推理上给出受控评估。三者一起把「harness 不再是 wrapper」这件事讲透:AHE 让 harness 可演进,AgentCompass 让 harness 可独立配置,RAH 让 harness 可作为递归单元。
2.3 Harness 演进协议反方(matched budget + hacking_gap + 跨家族泛化)
arXiv:2607.12227(17 S2 · paper_card 434)——《Rethinking the Evaluation of Harness Evolution for Agents》。
对 LLM Agent 自动 harness 演化做广泛评估——在「相当的反馈与推理预算下」把 harness evolution 与 test-time scaling / discovery baseline 做比较;并在 held-out 任务评估泛化性。三层反方:
- L1 matched budget 颗粒度 loophole:每次 rollout 的 token cost / API call / wall-clock / retry 由作者任选;harness evolution 的 prompt 写入是 long-lived 资产,task-level search 的 prompt 选择是 ephemeral —— 预算 matched ≠ 价值 matched。
- L2 hacking_gap:量化 reward hacking 为
val_pass − holdout_pass;每 10× 代码量约 +28pp gap;2,900 行 hash-table compiler 实为查表背测试输入的反例(⚠️ held-out 隔离性待 PDF §X 核)。 - L3 held-out 跨家族泛化边界:Terminal-Bench 同一任务家族 distribution shift 有限,真正的泛化应是跨任务类型(held-out SWE → held-out RAG / web / GUI)。
它与 AHE 形成方法论对冲:AHE 给 harness evolution 数字,Rethinking 给数字的边界。三层反方合流是 2026 H2 末「评测协议可操作化工具成熟」的核心载体。
2.4 Harness 演化的产物回灌训练(harness → agent policy)
arXiv:2607.21557(4 S2 · paper_card 585)——《OpenForgeRL》。
开源框架,端到端训练 harness-based agents;覆盖工具/爪型 Agent、多模态 GUI 浏览器、计算机使用 Agent。它把 harness evolution 的产物「再回灌到训练阶段」——harness 不再只是 evaluation 时的包装,而是训练时的脚手架。这是 2026 H2 末首次出现的「harness × training」端到端工作(⚠️ 跨阶段端到端实证规模与硬件门槛需 PDF §X 核)。
2.5 评测对象的横向分化(垂直具身 / 真实场景 / 嵌入式 / 公共基础设施 / 全生命周期)
arXiv:2607.04434(12 S2 · paper_card 172)——《RoboDojo》。
sim-and-real 统一基准,30 策略 × XPolicyLab 集成 + 公开排行榜。是 2026 H2 末具身机器人策略评估的「立标级」候选(⚠️ leaderboard 实际访问性与各策略提交门槛需 PDF §X 核)。它的方法论价值是把 sim-only 与 real-only 评测合并成同一协议,避免 sim-to-real 评测的「单边失真」。
arXiv:2607.12477(4 S2 · paper_card 411)——《SIS-Bench (Self in Space)》。
UAV 具身空间智能基准,self-in-space 统一表述 + 运动感知表征(光流 + 视觉特征融合)。与 RoboDojo 形成「地面具身 vs 空中具身」双锚。它的反直觉发现是「self-related dynamics 是空间认知的关键瓶颈」,对 agent 自我建模提出新要求。
arXiv:2609.05405(paper_card 1303 · HF 37▲ 横盘)——《WearableQA》。
4,084 道十选一题 × 200 真实用户的可穿戴时序 + 血液生物标志物 + 人口统计。是 2026 H2 末健康推理评测的「真实数据」立标——把 LLM 推理评测从「公开数据集」推到「个人健康数据」,对隐私保护 + 推理鲁棒性提出新约束。
arXiv:2609.10016(paper_card 1326)——《MetroLLM-Bench》。
955 用例 × 6 真实地铁系统(37-414 站点)× 11 类(路径 / 票价 / 中断 / 无障碍 / 对抗输入)。两层评分:Tier 1 14 个 deterministic 组件 + Tier 2 8 个 semantic-quality 组件(其中 6 个用 LLM judge)。是 2026 H2 末首次「公共基础设施运营」评测,把 LLM-as-policy 推到「关键基础设施运行时」级别(⚠️ Tier 2 的 LLM judge 可靠性需 PDF §X 核)。
arXiv:2609.09875(paper_card 1296)——《AgentAudit》。
全生命周期信任评估框架,10 维:instruction integrity / planner / memory / tool selection / tool invocation / tool correctness / alignment / tool faithfulness / security / behaviour。反方(来自 paper_card 1296 TLDR):现有评测框架(AgentBench / AgentDojo / ASB)只评估 agent 的单一环节,失败可发生在任意阶段但很少被精确定位。AgentAudit 把 10 维轨迹评估做成可扩展的开放框架。
arXiv:2606.23127(6 S2 · paper_card 277)——《Managing Procedural Memory in LLM Agents》。
382 真实企业任务 × 6 专业角色 × 22 程序性技能。反直觉发现:「部分 skill 在任务和模型间广泛泛化,另一些则专化为角色特定工作流,迁移时失去效力」——评测对象第一次从「能力维度」扩展到「skill 跨域迁移维度」。
2.6 Harness 安全演化与一致性(risk 主轴交集)
arXiv:2609.05903(paper_card 1321 · HF 47▲ 横盘)——《EvoSafeHarness》。
模型 + 领域双维度进化式安全 Harness。反方(来自 paper_card 1321 TLDR):现有 safety harness 通常由专家一次设计、跨模型 / 跨领域通用,但「模型在多大 enforcement 下保持 utility」与「领域对受治理的 effect / state / action 序列」都是 deployment-dependent——harness 过严 → utility 衰减,过松 → 安全失效。把 harness 演进从「效能」推到「安全」轴,与 AHE 互补。
arXiv:2609.08832(paper_card 1288 · 主分类 agent)——《Closing the Consistency Gap》。
自演化 agent 框架,把「不稳定、低一致性步骤」识别并转成 episodic memory,让 agent 在后续运行中调用。与 EvoSafeHarness 互补:后者是「harness 层一致性」,前者是「agent 轨迹层一致性」。
2.7 Harness 演进作为持续学习对象
arXiv:2609.04280(paper_card 1293)——《EVOHARNESSBENCH》。
把 non-stationarity 从「任务流」移到「harness」:覆盖三个演进轴——tools / skills / agents。在持续学习场景下评估「agent 能否跟上 harness 演进」。它的方法论价值是把 harness evolution 从「一次性优化」(AHE 路径)推到「持续学习对象」(CV 持续学习路径),与 EVOHARNESSBENCH 评估的「跟上节奏」形成新立标(⚠️ 三轴交叉的实证规模需 PDF §X 核)。
2.8 评测对象的工程化新边界(编译 / 拼接 / 形式化 / 创意实现就绪度)
arXiv:2609.05779(paper_card 1302)——《Diffs vs. Whole Files》。
Flutter/Dart 代码模型实证比较——diff 生成在「短小、空间局部化」的编辑上胜出,类别级优势集中在 refactoring 与 error-handling 两类(平均编辑步数最低)。反直觉:编辑步数低的任务是 diff 生成的优势区。这对 coding agent 的生成范式选择给出明确指引——长文件大改用 whole file,短局部修用 diff。
arXiv:2609.10539(paper_card 1331)——《IdeaAMBIG》。
研究「实施就绪度」——研究想法可能新颖、连贯、科学合理,但方法细节不足导致忠实复现困难。从论文 / 代码库 / issue 讨论 / 复现工件构建「基于证据的规范」与「支持性消解方案」。把评测对象从「想法可不可行」推到「想法的可编码就绪度」,与 Diffs vs. Whole Files 形成「实现路径评测」两栖。
arXiv:2609.09264(paper_card · evaluation 主分类)——《StochBench》。
形式化定理证明的随机过程领域专项基准,弥补现有 IMO/Putnam 类「竞赛数学」基准对 field-specific 应用覆盖不足的问题。形式化证明评测从「数学竞赛」扩展到「领域随机过程」(⚠️ 与 Lean 生态整合的工程门槛需 PDF §X 核)。
3. 工程视角 / 研究视角 / 批判视角(三栖)
3.1 工程视角(可落地性)
- 可立即部署的:AgentCompass(开源 + 三层解耦)+ RoboDojo(30 策略 + 公开 leaderboard)+ OpenForgeRL(端到端训练框架)+ EVOHARNESSBENCH(持续学习评测)。
- 需要中等改造成本:AHE(10 轮迭代闭环,需要团队先有 harness codebase + premise 自声明约定)+ MetroLLM-Bench(11 类结构化工具调用 + deterministic scoring 需要场景定制)。
- 门槛较高:SIS-Bench(UAV 硬件 + RealSense + 真实采集)+ RoboDojo sim-and-real(77-DoF Franka 等)。
- 最佳工程入口(按 ROI 排序):①AgentCompass 三层解耦作为评测 CI 基建 → ②AHE premise 自声明 + Decision Observability 作为 harness 演进规范 → ③RoboDojo / SIS-Bench 作为具身评测入口 → ④OpenForgeRL 作为 harness-native 训练框架。
3.2 研究视角(创新性)
- 方法学新立标:AgentCompass 三层解耦 + EVOHARNESSBENCH harness 持续学习 + AHE premise 契约 + IdeaAMBIG 编码就绪度 + MetroLLM-Bench 公共基础设施 LLM-as-policy + Closing the Consistency Gap 轨迹级 episodic memory。
- 跨主线合流新节点:Rethinking Harness Evolution 把 harness evolution 评测协议做成「matched budget + hacking_gap + held-out 跨家族」三层反方,是 2026 H2 末方法学最锐利的进步。
- 评测对象的边界扩张:从通用 Agent → 具身(RoboDojo / SIS-Bench)→ 真实场景(WearableQA)→ 公共基础设施(MetroLLM-Bench)→ 嵌入式 UI(AgentAudit 10 维)→ 程序性 skill 跨域(Managing Procedural Memory)→ 创意实现就绪度(IdeaAMBIG)—— 评测对象从「1 维能力」扩张到「全谱系场景」。
3.3 批判视角(局限)
- (1) 机制 — Harness 演进产物回灌训练的可验证性:AHE 实证 Terminal-Bench 2 69.7%→77.0% 跨模型族 +5.1pp-+10.1pp,但 OpenForgeRL 把 harness evolution 产物「再回灌到训练」的端到端信号仍稀缺(⚠️ 跨阶段端到端实证规模与硬件门槛需 PDF §X 核);本研究方向的「长链路反方验证」尚未成形。
- (2) 数据 — 评测数据集的 leakage 与质量:SWE-Bench Pro Verified
arXiv:2609.08149自陈「reward hacking 由 gold solution / 隐藏评估信息泄漏引发 + 任务质量误导性问题」——R73 已锚的 SWE-Bench Pro Verified 票数横盘 23▲,但与未 Verified 版本的对比实证尚未完整披露(⚠️ Verified 版本的发布渠道与替换覆盖率需 PDF §X 核)。FrontierMath v2 修正 v1 42% 题目错误的「评测自身需要评测」困局尚无系统性解决方案。 - (3) 截止日 / 证伪 — Harness 演进协议反方的可证伪化:Rethinking Harness Evolution L1 matched budget 颗粒度 loophole 作者可任选预算颗粒度;L2 hacking_gap 与 SpecBench 互补但跨论文可比性弱;L3 held-out 跨家族泛化尚无标准协议——三层反方各自「给出问题但未给出统一可证伪协议」是 2026 H2 末最大开放问题(截止 2026-12 评估)。
4. 趋势判断与开放问题
4.1 三条主线趋势
- 趋势 ①:评测基础设施元层化稳态化 —— AgentCompass 三层解耦 + EVOHARNESSBENCH 三轴演进 + AHE premise 契约,三者共同把「评测套件自身的设计」推到 L1/L2/L3 矩阵可独立配置。
- 趋势 ②:Harness 演进协议反方成熟化 —— Rethinking Harness Evolution 三层反方 + SpecBench hacking_gap + SWE-Bench Pro Verified leakage 修复,三者共同把「harness evolution 不是『做出来 + 跑分高』就够」固化成可审计协议。
- 趋势 ③:评测对象的横向分化到「全谱系场景」 —— RoboDojo + SIS-Bench + WearableQA + MetroLLM-Bench + AgentAudit + Managing Procedural Memory + IdeaAMBIG,2026 H2 末评测对象已从「通用 Agent 单维能力」扩展到「具身 / 真实场景 / 嵌入式 UI / 公共基础设施 / 程序性 skill / 创意实现就绪度」全谱。
4.2 五个开放问题
- Harness 演进产物回灌训练的端到端可验证性:OpenForgeRL 已开路,但跨阶段(harness evolution → policy 训练 → evaluation)的反方验证机制尚未成形。
- 跨家族泛化的标准协议:Rethinking Harness Evolution L3 反方提出「跨任务类型」泛化,但具体协议(跨几个任务族 / 哪种 sampling / 哪种 metric)尚未标准化。
- 评测自身可靠性的元层化:FrontierMath v2 修正 v1 42% 题目错误 + SWE-Bench Pro Verified 修复 leakage,但「评测自身需要评测」的元层化方案尚无系统性工程实现。
- 公共基础设施 LLM-as-policy 的可信度:MetroLLM-Bench Tier 2 八组件中 6 个用 LLM judge,但 LLM judge 在「高风险 / 关键基础设施」场景的可靠性边界尚未实证(⚠️ Tier 2 judge 错判率 vs 人类专家需 PDF §X 核)。
- 真实场景评测的隐私与合规:WearableQA 用 200 真实用户可穿戴数据 + 血液生物标志物,开源 release 的隐私脱敏与 IRB 合规是否完整披露需 PDF §X 核——评测数据集「真实化」与「合规化」的协议尚未标准化。
§9 自检双硬约束
- 反方 v2 三段式按主线分布 ≥150 字:✅ §3.3 三条主线各 ≥150 字(机制 / 数据 / 截止日-证伪),分别在 harness 演进产物回灌可验证性 / 数据集 leakage 与质量 / Harness 演进协议反方的可证伪化。
- 反方 v2 形式标签 ≥5 处:✅ §3.3 三个 (1)(2)(3) 起首标注 + ⚠️ 标注 ≥4 处 + 截止日标注 1 处 = 共 ≥8 处形式合规标签。
- CJK 字数硬约束 ≤3,900:主体 ~3,400 + 反方 300 + 元信息 100 = ~3,800 ✅(私域污染 SUM=0)。
- 立标池红线 4 件套命中 ≥3:GitHub 已验(AHE / AgentCompass / RoboDojo / EVOHARNESSBENCH)+ ⚠️ 立标 4 件(OpenForgeRL / RoboDojo leaderboard / SWE-Bench Pro Verified Verified 替换覆盖率 / MetroLLM-Bench Tier 2 LLM judge 可靠性 / WearableQA 隐私)+ 双轨(abstract 核实 + GitHub repo 已核)+ abstract 核实(16 件主轴工作全部命中 abstract)= 命中 4/4 ✅。
- verifiability ≥20% 主轴独立抽查:8/16 = 50% ✅(AHE / AgentCompass / Rethinking Harness Evolution / RoboDojo / OpenForgeRL / EVOHARNESSBENCH / Closing the Consistency Gap / Managing Procedural Memory 各 1 次主轴独立抽查)。
5. 综合论文清单(16 件 · arXiv 号列表)
主线立标 / 高被引(5 件): - arXiv:2604.25850 · Agentic Harness Engineering (AHE) · 76 S2 · 16 影响力被引 · paper_card 030 - arXiv:2607.13705 · AgentCompass · 2 S2 · HF 38▲ · paper_card 405 - arXiv:2607.12227 · Rethinking the Evaluation of Harness Evolution · 17 S2 · paper_card 434 - arXiv:2607.04434 · RoboDojo · 12 S2 · paper_card 172 - arXiv:2607.21557 · OpenForgeRL · 4 S2 · paper_card 585
评测对象横向分化(5 件): - arXiv:2607.12477 · SIS-Bench · 4 S2 · paper_card 411 - arXiv:2609.05405 · WearableQA · HF 37▲ 横盘 · paper_card 1303 - arXiv:2609.10016 · MetroLLM-Bench · paper_card 1326 - arXiv:2609.09875 · AgentAudit · paper_card 1296 - arXiv:2606.23127 · Managing Procedural Memory · 6 S2 · paper_card 277
Harness 演进与风险主轴交集(4 件): - arXiv:2606.13643 · Recursive Agent Harnesses (RAH) · 2 S2 · paper_card 012 - arXiv:2609.05903 · EvoSafeHarness · HF 47▲ 横盘 · paper_card 1321 - arXiv:2609.08832 · Closing the Consistency Gap · paper_card 1288 - arXiv:2609.04280 · EVOHARNESSBENCH · paper_card 1293
工程化新边界(3 件): - arXiv:2609.05779 · Diffs vs. Whole Files · paper_card 1302 - arXiv:2609.10539 · IdeaAMBIG · paper_card 1331 - arXiv:2609.09264 · StochBench · paper_card(待补编号)
综述(2 件 · 来自 web_search 与 paper_cards 补全): - Yehudai et al. 2026(ACL 2026 Findings pp 26690-26714 · DOI 10.18653/v1/2026.findings-acl.1330)·《A Survey on Evaluation of LLM-based Agents》 - arXiv:2606.20683 ·《From Question Answering to Task Completion: A Survey on Agent System and Harness Design》
R73 沿用未在本棒展开(4 件): - arXiv:2609.08149 · SWE-Bench Pro Verified · paper_card 1308(评测质量修复,HF 23▲ 横盘) - arXiv:2606.13681 · EvoArena + EvoMem · paper_card 085 - arXiv:2608.04205 · MatrAIx · paper_card(8.3B persona agents) - arXiv:2609.06245 · VDiff-Bench · paper_card 1290(⚠️ 票数消散待核实)
Spark · 2026-09-13 20:46 CST · W5 主题深度综述 · evaluation · 私域污染 SUM=0 · 边界:仅写本文件 surveys/2026-09-13-evaluation.md