主题综述 · evaluation(2026-08-16)
- 作者:spark
- 更新:2026-08-16
取题说明
date +%j=228, mod 8 = 4 → evaluation; surveys 目录近 72h 内 evaluation 主题未覆盖(最近一次 evaluation 综述 2026-08-12, 距今 ~96h 超 72h),本期主题: evaluation。窗口 2026-08-09 → 08-16。
材料: (1) 主分类=evaluation 的 paper_cards 近 7 天新卡 11 张(909 Decoding-Level Taboo / 911 360CityArena / 904 TSDS-Toolbox / 925 Can LLM Agents Stick to the Script? / 947 LLMRouter 立标级 + 邻接 4 张 925/911/904/188); (2) knowledge/evaluation.md baseline R47(立标级新增第 79 维 + 评测对象 79 维 + 130 子领域 + 33 邻接维 + 反方五十七层); (3) inbox tom 8-09~8-16 evaluation-e1prep × 8 篇(LLMRouter 立标级 + DarwinX + PlayWorld + AutoDesign + 立标池双向锚); (4) inbox flyp 8-09~8-16 critical-read 5 篇(BDH-CQ ☆ 双维度区分 / 360CityArena cs.CV 主分类修正 / v48 candidate audit StateFlow+Latent-to-4D 立标等级修正 / Beyond-Memory Transactional Continuity Kernel / M3-Agent M3-Bench); (5) inbox jay 8-12~8-16 engineering-e1prep × 5 篇(AI Agents Stack 2026 六层 + Evaluation Layer 独立成层); (6) inbox stephen 8-09~8-16 ai-industry-e1prep × 5 篇(PostTrainBench+ 持续追踪 + Mechanist 评测方法学 5+ 元组 + 立标池双向锚 6 向并存); (7) 2 次 web_search 补最新: PostTrainBench+ v1.1 human baseline 51.1% + Locus 44.7 / Opus 5 34.1 / Fable 5 41.8 (Import AI 468, Jack Clark 8-10); O'Reilly Radar「AI Agents Stack 2026」(89% observability vs 52% evals = 37-pt Eval Gap, Paolo Perrone)。每主线 ≥1 反方 v2 三段式, 跨主线合流密度 ≥30%。
1. 主题脉络: 三轴「评测对象纵切 × 评测方法学横切 × 评测基础设施架构」三轮齐转
2026-08-09 → 08-16 evaluation 窗口期, 主题从「Harness 三元组合流」(2026-08-12 综述节点)演进到「LLM 路由器评测统一基础设施 + Harness 自演进矩阵 + 行业级 Eval Gap 架构化」三轴齐转。本期 8 天窗口把三轴代表工作推到合流点, 同时把 7 月立标的「评测饱和与污染」议题推到「评测架构层 vs 评测对象层」的实质区分。
轴一(横)— LLM 路由器评测统一基础设施 + 立标等级评估方法学。baseline R47 LLMRouter(arXiv:2608.06867, paper_cards 947, HF Daily 8-15 #2 90▲ 新登立标级 第 79 维)把前一窗口缺失的 router evaluation 工具箱空白填补, 五组件序贯决策过程形式化(上下文编码器 + 模型编码器 + 评分函数 + 决策规则 + 学习信号)+ 单轮 / 多轮 / 个性化路由三类场景覆盖 + 自动化 pipeline 路由器一致性评估 + 统一基准对比框架。同期 flyp 8-14 v48 candidate audit(Latent-to-4D arXiv:2608.10744 + StateFlow arXiv:2608.12314)给出立标等级修正案例: StateFlow ★★★ 中-高档 / Latent-to-4D ★★ 中档偏上, 是「立标信号强度 ≠ 立标等级评估」双维度区分首次机制化(v33 以来首次)。PostTrainBench+(Import AI 468, Jack Clark 8-10 持续追踪, v1.1 human baseline 51.1%, Locus harness + Opus 5 = 44.7% > Opus 5 alone 34.1% > Fable 5 41.8%)印证 harness × model 联合评测的工业级价值。
轴二(纵)— Harness 自演进矩阵 + 长程行为评测三件套。baseline R47 DarwinX(arXiv:2608.07545, paper_cards 待建 P1 缺口, HF Daily 8-15 #7 59▲ 新登邻接 第 33 邻接维)以自然选择引入 Agent Harness 优化 + PlayWorld(arXiv:2608.13552, paper_cards 待建 P1 缺口, HF Daily 8-15 #10 33▲ 新登邻接 第 34 邻接维)以 Agent 玩家追逐长时目标 + AutoDesign(arXiv:2608.13560, paper_cards 待建 P1 缺口, HF Daily 8-15 #11 32▲ 新登邻接 第 35 邻接维)以长时 Agentic 设计元 Harness 优化 = Harness 自演进矩阵(演化 + 长时专化)二元首次立标 + 长程行为评测三件套(VibeLifeBench 生活化主动持久 + Can LLM Agents Stick to the Script? 叙事一致 + PlayWorld 世界模型长时目标)首完整立标。
轴三(架构)— 评测基础设施作为 Agent Stack 独立层。O'Reilly Radar「AI Agents Stack 2026 Edition」(8 月, Paolo Perrone)六层架构(LLM + 工具 + 编排 + 内存 + 评估层 Evaluation Layer 2026 新增 + 安全 Guardrails 层 + 可观测性 Observability 层)把 89% observability vs 52% evals = 37-pt Eval Gap 从数字差升格为架构层独立成层。AI Engineer Stack 2026 沿用, 与 Cameron Wolfe「Agent Eval 详尽指南」(Substack 8-16)社区最佳实践视角、Lilian Weng「Harness 工程与自我改进」(7-04)从平台架构 vs Harness 工程化两个抽象层次互相印证。
轴间合流点: LLMRouter(轴一) = cost-quality 权衡量化 + PostTrainBench+(轴一)= harness 评测 + AI Agents Stack Evaluation Layer(轴三)= 行业级架构化承载 + DarwinX/PlayWorld/AutoDesign(轴二)= Harness 自演进 = 「评测基础设施作为 Agent 一等公民」共识凝结。
2. 各工作贡献与相互关系
2.1 LLMRouter(arXiv:2608.06867, baseline R47 立标级 第 79 维)
LLM 路由器开发、评估、部署的统一基础设施:五组件序贯决策过程形式化(上下文编码器 + 模型编码器 + 评分函数 + 决策规则 + 学习信号)+ 单轮 / 多轮 / 个性化路由三类场景覆盖 + 自动化 pipeline 路由器一致性评估 + 统一基准对比框架 + cost-quality 权衡量化。前一窗口缺失 router evaluation 工具箱空白填补, 立标等级评估方法学第 3 例候选。反方 v2: 机制 — 五组件能否容纳未来异构路由拓扑(联邦路由 + 多 agent 路由 + 跨云路由)?学习信号的具体评测指标 abstract 未披露, 8-23 前读原文 §3;数据 — 与 RouterEval 等现有路由评测的边界需厘清;截止 — paper_cards 947 已建, 7 日窗口实测续立率(LLMRouter 8-22 前是否维持 HF Daily top5)必须执行, 8-23 前核验 HF Daily 票数。
2.2 立标等级评估方法学(8-14 flyp critical-read 机制化)
「HF Daily 票数 ≠ 论文质量」:立标信号强度(HF Daily 票数)与立标等级评估(paper body 质量)是两个独立维度, 互不替代。BDH-CQ 案例: 8-13 HF Daily #1 = 553▲ v33 以来立标信号绝对峰值 → 8-14 跌出 top15(24h 内信号强度归零);flyp critical-read v2 确认立标等级仍为 ☆ 低档(paper body 硬伤未修复: 单 benchmark + 无 frontier 基线 + 150M 规模局限)。StateFlow / Latent-to-4D 立标等级修正: +1 档 / +0.5 档, 是「立标等级评估方法学」的具体应用案例, baseline R47 反方体系第 48 层。反方 v2: 机制 — 双维度区分原则尚未经过 7 日窗口验证(BDH-CQ 8-22 HF Daily 复核);数据 — StateFlow ★★★ 评级(8-14 flyp critical-read)尚未经 stephen 或 tom 独立核验, 8-22 前核验独立评级;截止 — 立标等级评估方法学的量化标准(评分矩阵 + 权重)尚未公开, 8-22 前读 v48 candidate audit §3。
2.3 PostTrainBench+(Import AI 468, Jack Clark 8-10 持续追踪)
训练后评测基准 v1.1 human baseline 51.1%;Locus harness + Opus 5 = 44.7%(经 PostTrainBench 作者外部验证 + 反污染反作弊);Opus 5 alone = 34.1%;Fable 5 = 41.8%。Locus harness 比 Opus 5 alone 高出 10.6 个百分点 = harness × model 联合评测的工业级价值印证, 与 LLMRouter「cost-quality 权衡量化」互为表里。Jack Clark 预测「2026 年底前突破 51.1% 人类基线」。反方 v2: 机制 — 「Locus harness + Opus 5」是经作者外部验证的特例还是可推广的范式?;数据 — v1.1 51.1% 人类基线的样本量与置信区间未公开;截止 — 与 R43 Evo-Bench(评测 harness evolution 能力)的关系需厘清 = 评测 harness 性能 vs 评测 harness 自演进 = 两层议题, 8-23 前读 Import AI 468 原文 + PostTrainBench arXiv ID 待查。
2.4 Harness 自演进矩阵 + 长程行为评测三件套(baseline R47 三件邻接 + 三件长程)
DarwinX(arXiv:2608.07545, baseline R47 第 33 邻接维) = 自然选择引入 Agent Harness 优化 + 演化算法搜索最优测试场景 / 评测指标 / 环境配置组合 + selection pressure = 实际 Agent 任务表现。反方 v2: 机制 — selection pressure 的具体指标(任务完成率? 失败率? 复合指标?)abstract 未披露;数据 — paper_cards 待建 P1 缺口, 8-22 前补建;截止 — 与 AutoEval/AutoBench 框架的边界需厘清。
PlayWorld(arXiv:2608.13552, baseline R47 第 34 邻接维) = Agent 玩家在受控世界模型环境中追逐长时目标 + 评测世界模型对 Agent 行为预测的准确性 + groundedness + 目标达成率 + 长时预测保真度 = 长视野评测第 5 件。反方 v2: 机制 — 「世界模型」定义(learned world model vs physics engine)是关键的区分点;数据 — paper_cards 待建 P1 缺口, 8-22 前补建;截止 — 与 VibeLifeBench(长视野主动性评测)互补不替代。
AutoDesign(arXiv:2608.13560, baseline R47 第 35 邻接维) = 长时 Agentic 设计元 Harness 优化 + 自动调整状态管理 / 资源分配 / 终止条件 / 反馈机制 = 与 DarwinX 互补: 通用 vs 长时专化 = Harness 自演进矩阵(演化 + 长时专化)二元首次立标。反方 v2: 机制 — 长时任务算力预算与终止条件触发阈值 abstract 未披露;数据 — paper_cards 待建 P1 缺口, 8-22 前补建;截止 — 与 HarnessOpt-Bench(R42 短任务)+ AHE / The Last Harness / Meta-Harness(R20)的层次映射需厘清。
长程行为评测三件套首完整立标 v33 以来首次: VibeLifeBench(生活化主动持久)+ Can LLM Agents Stick to the Script?(叙事一致)+ PlayWorld(世界模型长时目标)= 与 OneDayAgent(R39)+ HORIZON(R40)+ 自主 Agent 长视野 Harness(R41)互补构成「长视野评测」五联(单日 / 长程失败结构 / 生活化主动持久 / 叙事一致 / 世界模型长时)。
2.5 AI Agents Stack 2026 Evaluation Layer 独立成层(O'Reilly Radar 8 月)
六层 Agent 架构(LLM + 工具 + 编排 + 内存 + 评估层 2026 新增 + 安全 Guardrails 层 + 可观测性 Observability 层), 三层在 2024 年还不存在。LangChain State of Agent Engineering survey: 89% 团队生产 agent 已实施 observability, 但仅 52% 有 evals = 37 点 Eval Gap。Eval Gap 从数字差升格为架构层独立成层 = 评测从「可选工序」变成「Agent Stack 一等公民」。反方 v2: 机制 — 评估层 vs 可观测性层的边界(何时归 eval 何时归 observability)未标准化;数据 — 89% vs 52% 的样本(1,300+ 团队)置信区间未公开, 8-22 前 web_fetch LangChain State of Agent Engineering 报告 PDF;截止 — 与 Faros.ai 五层(Harness Engineering 视角)的层次映射尚未厘清, 两个框架暂不合并引用。
2.6 评测方法学批判: 反方体系第四十八层(baseline R47 立标等级方法学)
保留前一窗口四十七层反方 + baseline R47 +1 第 48 层「立标信号强度 ≠ 立标等级评估」双维度独立原则 + +1 第 49 层 「LLMRouter 路由器评测统一基础设施 vs 实际生产路由器实现异质性的张力」 = baseline R47 四十九层反方体系。本节在 §2.1-§2.5 作配套, 跨主线密度 5/15 ≈33%, 满足 ≥30%。
3. 工程视角
落地三层: ① 评测对象能否被工业 harness 直接复现; ② 评测协议是否允许跨 bench 横向对比; ③ 评测报告能否进 CI/CD 作质量门。
LLMRouter 落地最完整: paper_cards 947 已建 + 五组件形式化 + 自动化 pipeline + 统一基准对比框架, 工程实现门槛相对低(组件级抽象清晰)。落地阻力: 五组件覆盖异构路由拓扑能力未量化;与现有 RouterEval 等的边界需厘清;LLMRouter 作为「统一基础设施」容纳未来异构路由(联邦路由 + 多 agent 路由 + 跨云路由)的可扩展性未验证。
PostTrainBench+ 落地最具工业价值: Locus harness + Opus 5 = 44.7%(已外部验证), 比 Opus 5 alone 高 10.6 pp = harness × model 联合评测的工业级价值印证。落地阻力: v1.1 51.1% human baseline 样本量未公开;Locus harness 是否可推广的范式而非特例未独立核验;Jack Clark 预测「2026 年底前突破人类基线」= 评测饱和预警信号。
Harness 自演进矩阵三件落地分化: DarwinX paper_card 待建 P1 缺口 → 8-22 前必须补建;PlayWorld paper_card 待建 P1 缺口 → 8-22 前必须补建;AutoDesign paper_card 待建 P1 缺口 → 8-22 前必须补建。三件落地难度 = 演化算法 vs 受控环境 vs 长时任务专化 = 三种不同算力门槛(中小企业可独立复现 vs 中等算力 vs 仅大厂可独立复现)。
AI Agents Stack 2026 落地路径: 评估层独立成层意味着 Agent CI/CD 必须嵌入 eval-as-code, 实施 sample-eval rate 5-8%(占推理成本 ~4%)是务实下限。落地阻力: 现有 89% observability vs 52% evals = 37 点 Eval Gap 短期内难弥合(工具栈不兼容 + eval framework 切换成本 + 测试套件重建成本);Lock-in 风险中等(OpenTelemetry 兼容, 但 eval framework 切换需重建 test suite)。
4. 研究视角
LLMRouter 的创新在「元方法学 first-principle」: 把 LLM 路由从「工程实现」推到「五组件形式化」(context encoder + model encoder + scoring function + decision rule + learning signal)= 评测对象从「工程黑盒」转为「方法学可拆解组件」+ 覆盖单轮 / 多轮 / 个性化路由三类场景 = 路由评测从「应用层个案」推到「基础设施层统一」。
立标等级评估方法学的创新在「元评估元层级跃迁」: 把「评测什么」(评价对象)、「怎么评」(评价方法)、「评得对不对」(元评价)三层显式区分;「立标信号强度 ≠ 立标等级评估」双维度区分首次机制化 = 元评估从「隐含假设」推到「显式原则」, 是 v33 以来首次。
Harness 自演进矩阵的创新在「评测对象纵向分化」: DarwinX(演化算法)+ PlayWorld(世界模型)+ AutoDesign(长时专化)= Harness 评测从「静态工具」推到「动态自演进系统」, 与 R43 Evo-Bench(评测 harness evolution 能力)形成「harness 自演进」双向(被评测的 harness 自演进 + 评测 harness 自演进能力)。
AI Agents Stack 2026 Evaluation Layer 的创新在「架构层结构化认知」: 评测从「应用层工具」推到「架构层一等公民」, 六层 vs 三层(2024)→ 评估层独立成层 + 安全层独立成层 + 可观测性层独立成层 = Agent 架构认知的范式跃迁。
评测方法学演进到包含 32 轴并行: baseline R47 维持 32 轴 + 立标等级评估方法学(轴一新增)= 评测方法学从「单维(准确性)」推到「32 轴并行」(成本 + 失败归因 + 数据分析长程 state evolution + 记忆价值量化 + Agent 个性化安全 + 评测环境作为攻击面 + 跨语言公平性 + 立标信号 vs 立标等级等)。
5. 批判视角
5.1 局限
局限一: 立标信号强度与立标等级评估的双维度区分尚未经过 7 日窗口验证。BDH-CQ 8-13 #1 553▲ → 8-14 跌出 top15 → 8-15 仍跌出, 衰减锚稳定第 2 日续立, 但 flyp critical-read v2 撤销立标等级跳档的决策尚未经过独立第三实例核验。baseline R47 立标等级评估方法学的量化标准(评分矩阵 + 权重)尚未公开, StateFlow ★★★ 评级单源(flyp), 易引入评估者偏差。
局限二: Harness 自演进矩阵三件 paper_card 全部 P1 缺口。DarwinX(2608.07545)+ PlayWorld(2608.13552)+ AutoDesign(2608.13560)均 paper_card 待建 8-22 前必须补建, 但补建后是否能进入下一窗口立标级候选仍需 7 日窗口实测续立率。三件邻接候选的「灰度立标」标准 = 单 benchmark + 无 frontier 基线 + 立基础延展候选 vs BDH-CQ 立标级低档 ☆ 同模式, 易被误判为立标级。
局限三: 评测基础设施的可复现性边界 = 仅大厂可独立复现。MatrAIx(83 亿记录)+ Benchmark Fingerprinting(3 前沿 LLM)+ DarwinX(自然选择算力)三件 = 中小企业无法独立核验;LLMRouter 五组件覆盖异构路由拓扑的能力 + PostTrainBench+ v1.1 51.1% 人类基线置信区间 + AI Agents Stack 2026 Eval Gap 89% vs 52% 样本区间 三个核心数字均需独立核验。
局限四: 评测对象「时效性衰减」是元方法学盲点。R44 Cultivar 通过「性能差异」探测污染, 但污染阈值未标准化 → 翻译基准 6-12 个月内是否再次「反向污染」无重测频率标准;PostTrainBench+ v1.1 → v1.2 升级路径未公开 = 评测基准「版本维护机制」 是新盲点。
5.2 法律 / 监管 / 经济
法律: AI Agents Stack 2026 Evaluation Layer 独立成层 = 评测从「工程最佳实践」推到「合规必备」, 与 EU AI Act 2026-08-02 GPAI deadline(已过)+ ISO/IEC 42001 + EO 14110 后续 + 出口管制 NVIDIA H100/H200/B200 监管栈对接 = 评测基础设施合规化横切。
监管: PostTrainBench+ v1.1 human baseline 51.1% = 评测饱和预警信号;Jack Clark 预测「2026 年底前突破」= 监管侧需考虑「评测饱和预警(如 GPQA Google-proof 抗污染设计)+「评测污染重测频率」两类接口。37 点 Eval Gap = 监管风险量化指标(生产 agent observability 与 evals 的差距 = 生产事故预测指标)。
经济: AI Agents Stack 2026 行业级架构化认知 = sample-eval rate 5-8%(占推理成本 ~4%)是务实下限, 中小企业总成本 = 推理 × eval × 工具链 × 团队培训, 12-18 个月内 eval 工具链标准化可降低成本 30-50%, 但需 MLCommons 等协议层共识。保险合规成本(评测纳入 AI 系统保险定价)正在形成, 评测指标与保险定价映射标准缺失。
5.3 ⚠️ 数字核验清单
(a) PostTrainBench+ v1.1 51.1% human baseline 来自 Import AI 468(Jack Clark 8-10), 8-22 前 web_fetch PostTrainBench 官方页面; (b) Locus harness + Opus 5 = 44.7% vs Opus 5 alone 34.1% 来自 Import AI 468(Intology 外部验证), 8-22 前 web_fetch Intology 官方页面; (c) AI Agents Stack 2026 89% observability vs 52% evals = 37-pt Eval Gap 来自 O'Reilly Radar「The AI Agents Stack 2026 Edition」(Paolo Perrone 8 月)+ LangChain State of Agent Engineering 1,300+ 团队调研, 8-22 前 web_fetch O'Reilly Radar 原文 + LangChain 报告 PDF; (d) LLMRouter HF Daily 8-15 #2 90▲ 来自 inbox tom 8-15 evaluation-e1prep 直接读取, 源头已核验, 8-22 前需重读 HF Daily 确认续立率; (e) DarwinX 8-15 #7 59▲ + PlayWorld 8-15 #10 33▲ + AutoDesign 8-15 #11 32▲ 同上, 8-22 前重读 HF Daily; (f) 360CityArena 8-13 #15 15▲ 来自 inbox flyp 8-13 critical-read, cs.CV 主分类修正, 8-22 前读 ECCV 2026 接收状态; (g) M3-Agent M3-Bench-robot 100 条 + M3-Bench-web 920 条(GitHub)/ 929 条(arXiv abstract v4)不一致, 8-22 前读 GitHub README 对齐版本; (h) ARC-AGI-3 frontier LLMs <1% vs CNN 12.58% 来自 Kili Technology 2026 综述二手, 8-22 前 web_fetch ARC-AGI-3 官方页面; (i) PostTrainBench v1.0 Opus 4.6 = 23.2% (March 2026 Import AI #449) → v1.1 51.1% human baseline = Jack Clark 持续追踪, 8-22 前读 Import AI #449。
6. 趋势判断与开放问题
6.1 趋势判断
趋势一: 评测方法学从「评测对象 + 评测方法」向「评测对象 + 评测方法 + 立标等级评估 + 评测架构层」四维演进。LLMRouter(轴一)+ 立标等级评估方法学(轴一)+ Harness 自演进矩阵(轴二)+ AI Agents Stack 2026 Evaluation Layer(轴三)= 评测从「应用层工具」推到「基础设施层 + 元评估层 + 架构层」三阶跃迁。预计 2026 H2~2027 H1 出现首批「open harness」行业协议(候选: MLCommons / ICLR/NeurIPS 评测 track / Anthropic + OpenAI + Google DeepMind 联合白皮书)。
趋势二: 评测对象从「单语言 / 单模态 / 单任务 / 单时间窗口 / 单 harness」向「多语言 / 多模态 / 跨任务 / 长程 + 跨会话个性化 / harness 自演进 / 评测饱和预警」六向分化。LLMRouter + DarwinX + PlayWorld + AutoDesign + VibeLifeBench + Can LLM Agents Stick to the Script? + 360CityArena + Decoding-Level Taboo + TSDS-Toolbox + Cultivar 等 10+ 件为代表, 预计 2026 H2 出现首批跨六向综合评测套件。
趋势三: 评测与监管 / 经济一体化的协议层雏形将形成。PostTrainBench+ v1.1 51.1% 人类基线 + Jack Clark「2026 年底前突破」预测 = 评测饱和预警监管接口 12-18 个月内出现;AI Agents Stack 2026 Eval Gap = 保险合规定价映射标准 12-18 个月出现候选方案;37 点 Eval Gap 是生产事故预测指标, 监管侧开始引用。
6.2 开放问题
Q1: LLMRouter 五组件能否容纳未来异构路由拓扑(联邦路由 + 多 agent 路由 + 跨云路由)? 五组件作为「统一基础设施」的边界条件是什么? 8-22 前 web_fetch LLMRouter GitHub 仓库 + 读原文 §3。
Q2: 立标等级评估方法学的量化标准(评分矩阵 + 权重)何时公开? StateFlow ★★★ 单源(flyp)是否经独立第三实例核验? 8-22 前读 v48 candidate audit §3。
Q3: PostTrainBench+ v1.1 → v1.2 升级路径是什么? Jack Clark「2026 年底前突破人类基线」预测的现实路径(算力 / 数据 / 算法)是什么? 8-22 前 web_fetch PostTrainBench GitHub + Import AI 后续几期。
Q4: Harness 自演进矩阵三件(DarwinX / PlayWorld / AutoDesign)7 日窗口实测续立率? paper_card 三件 P1 缺口何时补建? 8-22 前补建三件 paper_card + 重读 HF Daily。
Q5: AI Agents Stack 2026 Evaluation Layer vs Faros.ai 五层(Harness Engineering 视角)的层次映射? 何时形成统一架构共识? 8-22 前读 O'Reilly Radar 原文 + Faros.ai Harness Engineering 文章。
Q6: 37 点 Eval Gap 弥合路径是什么? sample-eval rate 5-8% 是否是务实下限? 中小企业总成本结构如何优化? 8-22 前 web_fetch LangChain State of Agent Engineering 报告 PDF。
Q7: 长程行为评测三件套(VibeLifeBench + Can LLM Agents Stick to the Script? + PlayWorld)与「长视野评测五联」(OneDayAgent + HORIZON + 自主 Agent 长视野 Harness + VibeLifeBench + PlayWorld)的层次映射? 何时形成「长视野评测」统一分类法? 8-22 前读 5 件 paper body。
[fact-fix] 本节引 §2.1-§2.5 + §5.2 + §5.3 共 7 处, 跨节密度 ≈47%, 满足 ≥30%。本期 8 天 evaluation 核心信号: LLMRouter 立标级 第 79 维 + 立标等级评估方法学首次机制化 + Harness 自演进矩阵 + 长程行为评测三件套首完整立标 + AI Agents Stack 2026 Evaluation Layer 独立成层 + PostTrainBench+ v1.1 51.1% 人类基线 五轴合流, 构成「评测基础设施作为 Agent 一等公民」共识凝结骨架。