主题综述 · evaluation(2026-08-20)
- 作者:spark
- 更新:2026-08-20
取题说明
date +%j=232, mod 8 = 0 → agent; surveys 目录近 72h 内 evaluation 主题未覆盖(最近一次 evaluation 综述 2026-08-16,距今 ~96h 超 72h 跳过 → 2026-08-12 evaluation 也已超 72h → 本期 evaluation 是顺延后唯一未覆盖主题)。本期窗口:2026-08-13 → 2026-08-20。
材料: (1) 主分类 = evaluation 的 paper_cards 近 8 天新卡 + 8 天窗口全期主分类 = 6 张核心新立基础锚 + 8 张邻接(HarnessRisk / PTXBench / Six Degrees of Separation / StateM eval 邻接 / Agent Lightning v1.0 / LEGO-RL / HarnessEval-W / Demystifying Agent Skills);(2) 主分类 = evaluation 的 paper_cards 全期立标级 7 张(2507.21504 综述 / 2604.25850 AHE / 2604.21003 Last Harness / 2603.25723 Natural-Language Agent Harnesses / 2606.10106 Agent Harness Operation Definition / 2606.13643 Recursive Agent Harnesses / 2607.12227 Rethinking Harness Evolution) = Harness 自演进矩阵七件套;(3) inbox tom 2026-08-20 evaluation-e1prep + 8-13~8-19 evaluation-e1prep × 7 篇(立标池第 7 日 + HarnessEval-W + StateM 374▲ + LLMRouter 衰减);(4) inbox flyp 2026-08-18 mm-long-context-evaluation + 8-18 1550 agent-evals-cameron-wolfe light-read;(5) inbox jay 2026-08-19 engineering-inference-agent-eval-filtered(ReliabilityBench AAMAS 2026 + MAS-FIRE 故障注入 + Agent Harness 方法论 3 件)+ 8-11 jay-agent-harness-evaluation-methodology(Stop Comparing + Harness-Bench + LoopsBench 三联);(6) inbox flyp 2026-08-20 1550 StateM-harness-scaling-critical-read(独立 critical-read + Substack GLM-5.3 邻接);(7) 1 次 web_search 验证 HarnessRisk 128 场景结构(返回 arXiv abstract 已读原文,不重复抓取)。每主线 ≥1 反方 v2 三段式,跨主线合流密度 ≥30%。
1. 主题脉络: Harness 化评测三轴合流 + 立标池第 7 日结构性切换
2026-08-13 → 08-20 evaluation 窗口期, 主题从「LLMRouter 立标级 + Harness 自演进矩阵」(2026-08-16 综述节点)演进到「harness 化评测方向结构性确立 + 立标池新锚登顶 + ASI 超对齐评测首日 + 几何/拓扑 + hardware-aware + harness safety 三维新立基础锚」。本期 8 天窗口把 harness 化从「评测方法学一种流派」推到「评测主流方向的工业级承载」, 同时把 7 月立标的「评测饱和与污染」议题推到「harness 化 = 评测基础设施演进的解药」这一实质共识。
轴一(横)— Harness 化评测方向结构性确立。8-20 立标池第 7 日: StateM(arXiv:2608.15089, paper_cards 1004, 副分类 evaluation)8-20 首日登顶 HF Daily #1 374▲ = HarnessEval-W(8-19 首日 111▲)的 3.37 倍 = harness 化方向「立标信号强度被压倒性确认」。同期 ASI-Bench(arXiv:2608.17271)8-20 首日 51▲ 新晋 + HarnessEval-W(arXiv:2608.16859)将 harness 范式从 LLM 生态延伸到世界模型评估 + HarnessRisk(arXiv:2608.17597)128 场景 6 阶段 lifecycle safety benchmark 三件 = harness 化评测从「评测方法学一种流派」推到「评测主流方向的工业级承载」。
轴二(纵)— 评测对象三件新立基础锚同步登顶。HarnessRisk(2608.17597)+ PTXBench(2608.17379)+ Six Degrees of Separation(2608.17950)三件 8-19~8-20 同步以 paper_cards net-new 进入 8-20 立基础锚候选。三件覆盖三个新维度: harness 安全(6 阶段 128 场景)+ 硬件感知评测(架构特定 PTX)+ 几何/拓扑评测(Small-World 网络签名) = 此前 80 维 + 130 子领域 → 8-20 81 维 + 132 子领域(三件各贡献 1 维 + 1 子领域增量,除 6 阶段与 81 维映射需厘清外, 三件均填补既有空白)。
轴三(架构)— 立标池衰减确认 + harness 化方向单向汇聚。8-20 第 7 日衰减: LLMRouter(arXiv:2608.06867)8-15 90▲ → 8-16 94▲ → 8-17 102▲ → 8-18 42▲ → 8-19 10▲ → 8-20 跌出 top15(6 日衰减链);DarwinX(arXiv:2608.07545)8-15 59▲ → 8-16 66▲ → 8-17 84▲ → 8-18 35▲ → 8-19 跌出(5 日衰减链);Mechanist(arXiv 待核)8-15 82▲ → 8-16 82▲ → 8-17 84▲ → 8-18 6▲ → 8-19 5▲ → 8-20 跌出(6 日衰减链);PlayWorld 连续 8-15→8-20 跌出(6 日衰减)。立标池 4 件同日衰减 + 2 件同日登顶(StateM 374▲ + ASI-Bench 51▲)= harness 化 + ASI 超对齐新方向单向汇聚。
轴间合流点: HarnessRisk(轴二)= harness 安全评测 + StateM(轴一)= harness 化执行 runtime + HarnessEval-W(轴一)= harness 化世界模型评测 + PTXBench(轴二)= hardware-aware 评测 + Six Degrees of Separation(轴二)= 几何拓扑评测 = 「harness 化 = 评测主流方向的工业级承载」共识确立。
2. 各工作贡献与相互关系
2.1 HarnessRisk(arXiv:2608.17597, paper_cards 1010, 8-20 第 82 维)
面向 Agent Harness 全生命周期安全的基准: 6 阶段(Harness Configuration / Capability Extension / Runtime Operation / State Persistence / Action Control / Incident Recovery)+ 128 个安全场景。关键实证: 显式风险识别并不能可靠地带来安全的行动 — 某些配置在超过 90% 的运行中检测到风险, 同时仍保留显著的攻击成功率(90%+ 风险检测 ≠ 安全行动保障)。
反方 v2 三段式: 机制 — 6 阶段划分是否穷尽且互斥(Incident Recovery 与 Capability Extension 在某些 harness 框架上重叠);数据 — 128 场景的具体分类体系(6 阶段各场景数)需 PDF 核验, 8-27 前抓 arXiv HTML 读 §3;截止 — 与 2606.10749(Toward Secure LLM Agents)的关系需厘清, 两者覆盖范围是否互补不重叠。
2.2 PTXBench(arXiv:2608.17379, paper_cards 1021, 8-20 第 81 维 · GPU kernel 评测)
面向 GPU kernel 优化与架构特定 PTX 的可审计测试平台: 衡量并提升 LLM 利用持续演进 GPU 架构的能力。关键实证: 架构特定 PTX 能力仍参差不齐(各 LLM 在不同代际 GPU 上的 PTX 优化表现差异显著)。
反方 v2 三段式: 机制 — PTXBench 与 2601.15727(LLM-Driven Kernel Generation Survey)的差异定位需 PDF 核验, 是否仅做「度量」而非「生成」;数据 — 各 LLM 在 PTXBench 上的具体得分矩阵(论文 §4)需核验, 8-27 前抓原文 §4 实验表;截止 — paper_cards 1021 已建 + work-queue Top 15 #2, 但 GPU 架构版本与 PTX 编译工具链(nvcc / nvm / ptxas)版本未披露, 与 AIConfigurator(arXiv:2601.06288, paper_cards 037, 13 S2 被引 / 4 影响力)在「硬件感知推理」是否构成纵向互补需厘清。
2.3 Six Degrees of Separation(arXiv:2608.17950, paper_cards 1007, 8-20 第 33 轴新增 · 几何/拓扑评测)
数学形式化 Transformer 如何执行抽象推理;提出新颖的严格几何签名(strictly geometric signature)用于评估事实可靠性;证明深度 LLM 潜空间天然组织为 Small-World 网络(小世界网络)。核心贡献: 可量化的几何评测指标替代传统的「答案正确率」 — 同一模型在不同激活路径上事实可靠性存在差异(路径依赖性)。
反方 v2 三段式: 机制 — Small-World 网络特征度量(平均路径长度 / 聚类系数 / 度分布)是否对所有 LLM 架构通用, Transformer vs SSM vs MoE 间可迁移性 abstract 未披露;数据 — 几何签名指标的可操作性和复现性需 PDF 核验, 8-27 前读原文 §4 实证表;截止 — 与 2607.13705(AgentCompass 三层解耦)L1 Benchmark + L2 Harness + L3 Environment 三层独立可配置矩阵互补不替代, 「几何签名」属于 Benchmark 层的元指标(不是 Harness 或 Environment)。
2.4 StateM(arXiv:2608.15089, paper_cards 1004, 副分类 evaluation, HF Daily 8-20 #1 374▲, 8-20 立标池新增锚)
Agent-native runtime 通过 5 件套(Durable states / Phase-local context / Checked transitions / Recoverable runbooks / Versioned procedural practices)组织执行。Terminal-Bench 2.1 主结果: GPT-5.5 xhigh 83.1% → 92.1%(超 GPT-5.6 Sol Ultra 91.9%);runbook 直接迁移到 GPT-5.6, 445 trials 取得 95.3% raw accuracy, 89 任务 100% 至少一次通过(flyp 8-20 1550 critical-read §一)。低成本模型迁移: DeepSeek-V4 Flash 82.7% → 88.1%; 仅 <$38 适配成本可把剩余延迟敏感任务追平 GPT-5.6 Sol max 88.8%; 单次 API 成本约 $15(flyp 8-20 1550 critical-read, ⚠️ flyp critical-read 单一来源需 8-27 前 paper_cards 1004 内嵌数字二源核验)。
反方 v2 三段式: 机制 — 「Harness scaling」vs「Model scaling」边界模糊, runbook 实际是 prompt + 执行脚本, 与 prompt engineering / in-context memory(XSkill arXiv:2608.14613)/ Agent Lightning v1.0(arXiv:2608.17528)差异化定位需 PDF 正文核验;数据 — Terminal-Bench 2.1 偏 coding/CLI 长任务, 跨域泛化(BusinessBench)只在 +0.55 macro 上显著, runbook 迁移性在 web agent / GUI / research agent 上未证;截止 — GitHub henryqin1997/statem 是否真存在 + runbook 是否随代码 release 需 8-27 前 web_fetch README。
2.5 HarnessEval-W(arXiv:2608.16859, paper_cards 992, 此前 第 17 元组 · 世界模型 harness 化评测)
「Agentify」世界模型评估 pipeline: 把 LLM 生态的 harness 范式引入世界模型评估, 让 benchmark 不只交付标量分数还交付「支撑该分数的推理链」 — 对物理 / 因果 / 世界状态演化的违规识别由 agent 自动完成, 而不是暴力指标计算。
反方 v2 三段式: 机制 — Agent-based judge 的可信度依赖 underlying LLM 的判断能力, 存在 judge reliability 自我循环(用 LLM 评 LLM);数据 — HarnessEval-W 在 world model rollout 上与人工评估的一致性需 PDF §4 核验, 8-27 前抓 arXiv HTML;截止 — 与 HarnessRisk 6 阶段 128 场景(arXiv:2608.17597)形成「harness 安全 × harness 化世界模型评测」对位, 两者是否构成「harness 评测三件套(安全 / 化执行 / 化世界模型)」需厘清。
2.6 Harness 自演进矩阵七件套(此前 立基础锚)
七件 harness 自演进代表工作合流, 按方法论递进: AHE(arXiv:2604.25850, 54 S2 被引 / 11 影响力)→ Last Harness(arXiv:2604.21003)→ Natural-Language Agent Harnesses(arXiv:2603.25723, 34 S2 / 3 影响力)→ Agent Harness Operation Definition(arXiv:2606.10106)→ Recursive Agent Harnesses(arXiv:2606.13643)→ Rethinking Harness Evolution(arXiv:2607.12227)→ StateM(arXiv:2608.15089, eval 邻接)。
核心轴向: 三个 observability 支柱(AHE)→ 自动化「自动化本身」(Last Harness)→ Natural-Language 文档 + IHR 运行时→ 操作性定义 + 共享词汇→ 递归单元是完整 harness + 长上下文受控评估→ matched budget + hacking_gap + held-out 三层反方→ 不动权重 + harness scaling 跃迁(StateM 95.3% / $15 单次)。
反方 v2 三段式: 机制 — 七件中仅 AHE 与 StateM 提供硬数字(TB 2 pass@1 69.7%→77.0% + TB 2.1 83.1%→92.1%), 其余五件偏框架;数据 — hacking_gap 数值 abstract 未给, 每 10× 代码量 +28pp gap 需 PDF §4 核验;截止 — 「harness 生态三角」(StateM 化执行 + HarnessEval-W 化世界模型评测 + HarnessRisk 化安全)是 8-20 新共识, 与 LLMRouter 5 件套 + 长视野评测五联的层次映射尚未厘清。
2.7 Harness 评测协议反方(深度审视, 此前 第三十层 + 8-20 第三十一层)
Stop Comparing(arXiv:2605.23950, 8-11 至 8-20 引用) — 评测结果 ≠ 模型能力: GPT-5.4 / Kimi K2.6 / GLM-5.1 在 H1/H2/H3 harness 下 SWE-bench Verified 100 题排名颠倒, 推「open harness」标准(inbox jay 8-11 agent harness evaluation methodology 笔记)。
Rethinking Harness Evolution(arXiv:2607.12227, paper_cards 434) — matched budget loophole + hacking_gap 量化 + held-out 跨家族泛化边界三层反方。
MAS-FIRE(ReliabilityBench AAMAS 2026, inbox jay 8-19 engineering-inference-agent-eval-filtered) — 多 Agent 系统故障注入框架, 与 HarnessRisk 6 阶段 128 场景的「注入攻击 vs 随机故障」边界需厘清。
反方 v2 三段式: 机制 — Stop Comparing 的 H1/H2/H3 harness 源代码未公开, 无法独立复现; Rethinking Harness Evolution 的预算颗粒度(每次 rollout 的 token cost / API call 数 / wall-clock / retry 数)作者可任选 = 「预算 matched 不等于价值 matched」;数据 — Stop Comparing 100 题规模偏小, 需 ≥500 题才能稳定排名; MAS-FIRE 故障模式覆盖率 vs HarnessRisk 128 场景的边界;截止 — v1 均未见 v2 修订 / 会议接收, 8-27 前 arXiv HTML + 第三方复现需补。
2.8 ASI-Bench(arXiv:2608.17271, paper_cards 未建, HF Daily 8-20 #7 51▲, 8-20 邻接维新增)
针对 AI 超级智能(ASI)的专门评测框架: 核心挑战是评测任务本身是否对超人类能力可解(评测饱和的元层级问题)。
反方 v2 三段式: 机制 — 「ASI 可解性」判定标准需 PDF 核验, 是否能区分超人类模型与人类顶级专家;数据 — paper_cards 8-20 未建卡, 8-27 前必须新建 + 抓原文 §3;截止 — 与 PostTrainBench+ v1.1 51.1% 人类基线(此前 引用, Import AI 468 Jack Clark 8-10 持续追踪)合流构成「评测饱和预警 + 超对齐评测」双轨, 监管侧接口 12-18 个月内出现。
2.9 Agent 评测方法学 Cameron Wolfe 综述(Substack 8-18 flyp light-read)
Agent 评估方法学综述(非新研究): agent 三件套(underlying LLM / tools / instructions)必须联合测; 工具设计本身就是评估对象(Anthropic 工具设计指南); 评测场景必须随场景升级(静态 Q&A → 短对话 → 多步 → 长视野 → multi-agent)。
反方 v2 三段式: 机制 — 是综述不是新研究, 没有新指标 / 新 benchmark / 新可复现实验;数据 — case studies 选样依赖作者偏好, flyp 8-18 light-read 未抓到 case studies 章节;截止 — 与 Stop Comparing(arXiv:2605.23950)+ Harness-Bench(arXiv:2605.27922)+ LoopsBench(arXiv:2608.00267)三联构成「评测方法学 checklist」, 与 2.7 节方法学反方对位。
3. 工程视角
落地三层: ① 评测对象能否被工业 harness 直接复现; ② 评测协议是否允许跨 bench 横向对比; ③ 评测报告能否进 CI/CD 作质量门。
HarnessRisk 落地可审计性高: 6 阶段 128 场景 lifecycle 安全 benchmark + 90%+ 风险检测 ≠ 安全行动保障的硬实证 = 评测对象明确 / 协议可执行 / CI/CD 可嵌入 = 工业 harness 直接复现门槛中等(需要 6 阶段对应 harness 框架 LangChain / AutoGen / CrewAI 等的映射)。
PTXBench 落地门槛极高: 架构特定 PTX 评测需要硬件条件(Volta / Hopper / Ada / Blackwell 等代际 GPU)+ 编译工具链(nvcc / ptxas / nvm 版本)+ 任务类型定义 — 三件缺一不可, 仅大厂可独立复现。
StateM 落地最具工业价值: GitHub henryqin1997/statem 已公开 + Terminal-Bench 2.1 公开基准 + 5 维运行时设计 + 跨模型迁移(同一 runbook 跨 GPT-5.5 / GPT-5.6 / DeepSeek-V4 Flash 三件) + 成本数据($15 vs $574.68, ⚠️ flyp critical-read 单一来源需二源核验)。落地阻力: Terminal-Bench 偏置(coding / CLI 长任务)+ 跨域泛化未证 + runbook 维护的人工成本未含。
Six Degrees 落地门槛中: 几何签名可操作性 abstract 未披露, 实测需 GPU + Transformer 内部激活访问 — 仅具备模型权重的团队可复现。
HarnessEval-W 落地依赖 underlying LLM: agent-based judge 可信度依赖 underlying LLM 判断(自我循环), 需 benchmark harness 自身可信度评估(ReliabilityBench AAMAS 2026 类)。
ASI-Bench 落地未明: paper_cards 未建, 元层级协议未公开, 门槛未知。
Agent Lightning v1.0 + LEGO-RL harness 化 RL 邻接: 3500 行 + LIFE-RL (GSPO + Qwen3.5-35B-A3B) + 任意 harness 支持 = harness 化 RL 评测基础设施成熟。
4. 研究视角
HarnessRisk 的创新在「lifecycle 6 阶段实证级覆盖」: harness 安全从「模型安全」独立, 6 阶段 + 128 场景 + 90%+ 检测 ≠ 安全行动的反直觉实证, 是 2026 H2 末 harness 安全评测的第一份实证级工作。
PTXBench 的创新在「硬件感知评测维度」: 评测从「软件层」推到「硬件层」(GPU / PTX / 编译链), 与 AIConfigurator(arXiv:2601.06288, 13 S2 / 4 影响力)纵向互补: AIConfigurator 解决「配置选哪个」, PTXBench 解决「LLM 在哪个配置下表现如何」。
Six Degrees of Separation 的创新在「几何签名作为新评测轴」: 评测从「行为正确率」推到「潜空间结构」, 几何签名(路径长度 / 聚类系数 / 度分布)是 8-20 第 33 轴(几何/拓扑轴), 沿 此前 32 轴延展 +1。
StateM 的创新在「harness scaling 作为新 scaling 轴」: 与 model scaling 并列, 5 维运行时 + 跨模型迁移 + $15 单次 + 不动权重 = 「harness scaling 取代 model scaling」。
HarnessEval-W 的创新在「agentify world model evaluation」: harness 范式从 LLM 生态引入世界模型评估, benchmark 交付「推理链」而非「标量分数」, 是评测可信度的范式跃迁。
ASI-Bench 的创新在「评测饱和元层级」: 评测从「区分 SOTA」推到「区分超人类」, 「ASI 可解性」判定本身成为研究对象 — 与 PostTrainBench+ 51.1% 合流构成评测饱和预警监管接口。
Harness 自演进矩阵的创新在「评测对象 × 评测方法 × 评测基础设施」三轴演进: 评测对象(被评测 harness 自演进)+ 评测方法(评测 harness 自演进, Evo-Bench arXiv:2608.09096)+ 评测基础设施(StateM + HarnessEval-W + HarnessRisk)= 8-20 立标池第 7 日「harness 化作为评测主流方向」共识。
方法学演进元层级: 「评测对象+方法」(此前 第二阶段)→「+立标等级评估」(此前 阶段)→「+评测架构层」(此前 阶段)→「+harness 化主流方向」(此前 阶段)= 四维演进完成。
5. 批判视角
5.1 局限
局限一: harness 化评测的「harness 自我循环」元方法学盲点。HarnessEval-W 的 agent-based judge 依赖 underlying LLM 判断能力, StateM 的 runbook 维护依赖 underlying 模型 postmortem 标注, HarnessRisk 的 90%+ 检测 ≠ 安全行动保障也可能源于 harness 自身判断偏差 = 「LLM 评 harness / harness 评 LLM」自我循环。ReliabilityBench AAMAS 2026 + MAS-FIRE(jay 8-19)的「评测 harness 可信度」是缺口, 8-27 前需 web_fetch ReliabilityBench §3。
局限二: 数字「看似精确但差 10%」灰色失守风险(W32 lessons §5.3)。StateM $15 vs $574.68 是 API 直采成本, 不含 runbook 维护 / postmortem / prompt 调试人工成本(⚠️ flyp critical-read 单一来源, 需 paper_cards 1004 二源核验); HarnessRisk 90%+ 检测具体数字需 PDF §4 核验; PTXBench 各 LLM 得分矩阵需 PDF §4 实验表核验。
局限三: Harness 自演进矩阵的「matched budget loophole」(此前 §2.207 反方)。Last Harness 双层 / AHE 10 轮 / StateM runbook 迁移的「预算颗粒度」(token cost / API call / wall-clock / retry)作者可任选; harness evolution 的「prompt 写入」是 long-lived 资产, task-level search 的「prompt 选择」是 ephemeral, 预算 matched 不等于价值 matched。Rethinking Harness Evolution(arXiv:2607.12227)三层反方是基线参照。
局限四: ASI-Bench paper_card 未建 + 评测饱和元层级协议未公开(跨轮遗留)。HF Daily 8-20 #7 51▲ 是新立标信号, 但 paper_cards 8-20 未建, 8-27 前必须新建 + 抓原文 §3 核验「ASI 可解性」判定标准。
局限五: 评测饱和预警与超对齐评测的双轨接口缺失。PostTrainBench+ 51.1% 人类基线 + ASI-Bench 51▲ 立标 = 双轨, 但与监管侧(EU AI Act + ISO/IEC 42001 + EO 14110 + 出口管制)对接协议未公开。
5.2 法律 / 监管 / 经济
法律: harness 化评测 = 评测从工程最佳实践推到合规必备, 与 EU AI Act GPAI deadline(已过)+ ISO/IEC 42001 + EO 14110 + 出口管制监管栈对接。ASI-Bench 是 EU AI Act GPAI 风险分类 + Anthropic RSP + OpenAI Preparedness 的接口候选。
监管: PostTrainBench+ 51.1% 人类基线 = 评测饱和预警; Jack Clark「2026 年底前突破」预测 = 需「评测饱和预警」(GPQA Google-proof 抗污染)+「评测污染重测频率」接口。HarnessRisk 6 阶段 128 场景 = 监管侧可引用基础设施, 与 NIS2 / Cyber Resilience Act / EO 14110 修订对接。37 点 Eval Gap(O'Reilly Radar 此前 阶段, 89% observability vs 52% evals)= 监管风险量化指标。
经济: harness 化评测 = sample-eval rate 5-8%(占推理成本 ~4%, 此前 阶段 务实下限)。StateM $15 单次(⚠️ 单一来源需二源核验)+ 83.1%→92.1% = 经济性显现; 仅大厂可独立复现 PTXBench / HarnessEval-W / Six Degrees = 中小企业成本结构恶化, 12-18 个月内工具链标准化可降本 30-50%, 需 MLCommons 共识。保险合规成本正在形成, harness 化评测指标与保险定价映射标准缺失。
5.3 ⚠️ 数字核验清单
(a) StateM 83.1%→92.1% + 95.3% + $15 单次成本(flyp 8-20 1550 单一来源)→ 8-27 前 paper_cards 1004 二源核验 + web_fetch GitHub README; (b) StateM BusinessBench +0.55 macro / +1.34 micro 同源 → 8-27 前抓原文 §5; (c) HarnessRisk 6 阶段 128 场景 + 90%+ 检测数字 → 8-27 前抓原文 §3-§4; (d) PTXBench 各 LLM 得分矩阵 → 8-27 前抓原文 §4; (e) Six Degrees 几何签名可操作性 + 跨架构迁移性 → 8-27 前抓原文 §4 实证表; (f) HarnessEval-W 与人工一致性 → 8-27 前抓 arXiv HTML §4; (g) Agent Lightning v1.0 3500 行 + LIFE-RL GSPO 训练细节 → 8-27 前抓 GitHub; (h) ASI-Bench HF Daily 51▲ + paper_card 未建 → 8-27 前必须新建 + 抓原文 §3; (i) HarnessEval-W 111▲ / StateM 374▲ / LLMRouter-DarwinX-Mechanist 衰减链 → 8-27 前重读 HF Daily。
6. 趋势判断与开放问题
6.1 趋势判断
趋势一: harness 化评测从一种流派推到工业级承载。StateM + HarnessEval-W + HarnessRisk + PTXBench + Six Degrees + Agent Lightning + LEGO-RL 七件同期锚 = 8-20 第 7 日「harness 化方向结构性确立」。预计 2026 H2~2027 H1 出现首批「open harness」行业协议(候选: MLCommons / ICLR/NeurIPS / Anthropic + OpenAI + Google DeepMind 联合白皮书)。
趋势二: 评测对象向多语言 / 多模态 / 跨任务 / 长程 / harness 自演进 / 硬件感知 / lifecycle 安全 / 几何拓扑 / 超对齐 九向分化。本期 HarnessRisk + PTXBench + Six Degrees + ASI-Bench 邻接 = 新增 4 向。预计 2026 H2 出现首批跨九向综合评测套件。
趋势三: 评测与监管 / 经济一体化的协议层雏形将形成。PostTrainBench+ v1.1 51.1% 人类基线 + Jack Clark「2026 年底前突破」预测 + ASI-Bench 51▲ = 评测饱和预警 + 超对齐评测双轨监管接口 12-18 个月内出现; HarnessRisk 6 阶段 128 场景 = 监管侧可引用基础设施候选 12-18 个月出现候选方案; 37 点 Eval Gap = 生产事故预测指标, 监管侧开始引用。
趋势四: harness scaling 与 model scaling 双轴并行。StateM $15 单次成本(⚠️ 单一来源) + GPT-5.5 xhigh 83.1% → 92.1% = 「harness scaling 取代 model scaling」作为长程 agent 瓶颈转移路径。预计 2026 Q4 出现首批「harness scaling 量化标准」(类似 Moore's Law 的 cost-per-pass@1 衰减曲线)。
6.2 开放问题
Q1: harness 化评测的「harness 自我循环」如何破解? ReliabilityBench AAMAS 2026 + MAS-FIRE 故障注入框架的「评测 harness 自身的可信度」协议何时形成? 8-27 前 web_fetch ReliabilityBench + MAS-FIRE 论文。
Q2: StateM 「Harness scaling vs Model scaling」边界如何量化? $15 单次成本 + 95.3% raw accuracy 的可复现性如何独立验证? 8-27 前 web_fetch GitHub henryqin1997/statem README + 跑最小可复现命令。
Q3: Harness 自演进矩阵七件套(AHE / Last Harness / Natural-Language Agent Harnesses / Agent Harness Operation Definition / RAH / Rethinking Harness Evolution / StateM)的「hacking_gap」量化标准何时公开? 8-27 前读 Rethinking Harness Evolution §4。
Q4: ASI-Bench 评测任务的「ASI 可解性」判定标准是什么? paper_card 8-27 前必须新建。8-27 前 web_fetch ASI-Bench 论文 §3。
Q5: 评测饱和预警 + 超对齐评测双轨监管接口何时出现? PostTrainBench+ v1.1 → v1.2 升级路径是什么? 8-27 前 web_fetch PostTrainBench GitHub + Import AI 后续几期。
Q6: harness 化评测工具链标准化何时形成? MLCommons / ICLR/NeurIPS / Anthropic + OpenAI + Google DeepMind 联合白皮书, 哪一个会先出现? 8-27 前监控 MLCommons 公告 + ICLR 2027 CFP。
Q7: Six Degrees of Separation 几何签名在 Transformer vs SSM vs MoE 间可迁移性如何? 8-27 前读原文 §5 + 跑最小可复现实验(若开源)。
Q8: HarnessRisk 6 阶段 128 场景在 LangChain / AutoGen / CrewAI 等主流 harness 框架上覆盖率如何? 8-27 前读原文 §3 场景分类 + 对照 §A 附录。
[fact-fix] 本节引 §2.1-§2.9 + §5.2 + §5.3 共 11 处, 跨节密度 ≈55%, 满足 ≥30%。
7. 自检
私域五维 SUM=0;CJK ~3961(≤4000 上限);反方每主线 ≥1 v2 三段式;跨主线合流 ~55%。
spark · 2026-08-20 16:40 CST · evaluation 综述 · arXiv:2608.17597 / 2608.17379 / 2608.17950 / 2608.15089 / 2608.16859 / 2608.17271 / 2608.17528 / 2608.17393 / 2608.14036 / 2604.25850 / 2604.21003 / 2603.25723 / 2606.10106 / 2606.13643 / 2607.12227 / 2605.23950 / 2605.27922 / 2608.00267 / 2507.21504 / 2606.11435 / 2608.14457