evaluation · E1 预消化简报(2026-08-26)

信源检查记录

本次覆盖(窗口:2026-08-25 15:40 ~ 2026-08-26 15:40 CST):

  • work-queue.md ✓(Top 15 含 ClawProBench 2608.22510 · Trace-Aware Evaluation of AI Agents with Runtime Coverage,#1 高价值待深度解读;无其他 eval 专项净新增)
  • inbox/tom(8-25~8-26):2026-08-26-0900-hf-daily-2026-08-26(Prime Agent 32▲ #7)+ 2026-08-26T1440-agent-rag-longcontext-radar(Evidence Blindness in DCI 新概念 + δ-mem 第三记忆路径)✓;2026-08-25-evaluation-e1prep R57 基线确认 ✓;2026-08-26-rag-e1prep ✓
  • inbox/flyp(8-25~8-26):2026-08-26-multimodal-e1prep(Prime Agent arXiv:2608.23552 评测方法学延革第 6 锚链完整触发 + LongWoF-Bench EvoMap 基因外部化 + EchoWM 全模态世界模型双雄预备)✓;2026-08-26-1001-rss-interconnects(无 eval 专项)✓
  • inbox/jay(8-25~8-26):2026-08-25-agent-eval-debugging-production ★★★(已入 R57)+ 2026-08-26T0820-csdn-highvalue-inference-rag-multimodal(RAGAS + LLM-as-Judge 评测体系邻接)+ 2026-08-26T0935-hf-state-open-models-vecdb-benchmark-agent-memory(RAGAS + LLM-as-Judge 评测体系邻接)+ 2026-08-26T1335-evening-briefing(Agent eval 邻接)✓
  • inbox/spark(8-25~8-26):无 evaluation 直接增量 ✓
  • inbox/stephen(8-25~8-26):无 evaluation 直接增量 ✓
  • paper_cards 近 3 天新卡(1058~1085 范围):
  • 1085(ClawProBench 2608.22510,evaluation 主分类 ★★★ work-queue Top15 #1)
  • 1069(MobilePA-Bench 2608.23035,evaluation 主分类 ★)
  • 1070(Task-CoEvolve 2608.20169,evaluation 主分类 ★★)
  • 1081(LongWoF-Bench 2608.23200,evaluation 主分类 ★)
  • 1060(Dis2Pat 2608.21249,evaluation 主分类,8-25 新建)
  • 1073(GameXpert-Bench 2608.21833,agent 主分类 eval 邻接)
  • OmniAssistBench(2608.21360)paper_card ❌仍未建(跨轮 R57→R58 遗留)
  • Beyond Correctness(2608.12781)paper_card ❌仍未建(跨轮 R57→R58 遗留)
  • AgentDebug(GitHub)paper_card ❌仍未建(跨轮 R57→R58 遗留)
  • PV-SST(2608.20438)paper_card ❌仍未建(跨轮 R57→R58 遗留)
  • FlavourBench(2608.20574)paper_card ❌仍未建(跨轮 R57→R58 遗留)
  • HF Daily 8-26:Prime Agent 32▲ #7(RLM Harness 评测方法学延革第 6 锚链)+ MobilePA-Bench 34▲ #6 ✓
  • knowledge/evaluation.md R57 基线确认 ✓(R56→R57:ReliabilityBench P0反方立基础锚 + HORIZON + AgentDebug + 41种失败模式分类学 + OmniAssistBench + Beyond Correctness + Datadog + TraceCoder + §2.5反方44层→46层 + 失败模式反方体系43→46层 + 评测方法学延革第14-18例 + 立标池双向锚第14日信号 + v44-v57十四日连续)

增量摘要

本轮(E1-R58,窗口 2026-08-25 下午 ~ 2026-08-26 下午)eval 主题 eval 专项 net-new paper_card 新增 4 条(ClawProBench + MobilePA-Bench + Task-CoEvolve + LongWoF-Bench);eval 邻接新增 1 条(GameXpert-Bench,agent 主分类 eval 副分类)。

本轮最重要增量ClawProBench(2608.22510,work-queue Top15 #1 ★★★)——trace 感知评测提出"声明式 model-plus-runtime 配置"作为恰当评测单元,将失败定位于证据获取/routing/安全边界/重复执行,首次将 runtime native evaluation 引入 Agent 评测范式,与 R57 的 ReliabilityBench/HORIZON 形成方法学层面的互补——后者关注跨时长/跨域可靠性,前者关注运行时 trace 级别的 failure attribution。另有 Task-CoEvolve(2608.20169 ★★) 自适应验证任务选择使 harness 优化成本大幅降低,填补了"harness 演进评测效率"空白。Prime Agent(2608.23552,HF Daily 8-26 #7 32▲) 触发评测方法学延革完整 6 锚链(v33 以来首次),同时与 ReliabilityBench "memory scaffold 普遍伤害"形成反向验证预备。


条目一:ClawProBench — trace 感知 runtime-native Agent 评测(eval 专项 ★★★,paper_card 1085 已建,work-queue Top15 #1 高价值待深度解读)

来源paper_cards/1085-2608-22510.md(2026-08-26 新建);work-queue.md Top15 #1;inbox/tom/_candidates/2026-08-26-agent-rag-longcontext-candidates.json arXiv2608.22510 主分类:evaluation;形态:benchmark

要点

  • 核心论点:现有 Agent 评测只考察最终答案,即便 Agent 运行在有状态的 runtime 上——这"欠指定了被评测对象"。恰当的评测单元应是"声明式 model-plus-runtime 配置",其失败可能出现在:① 证据获取(evidence acquisition)、② runtime 路由(runtime routing)、③ 安全边界(safety boundaries)、④ 重复执行(repeated execution)
  • 关键贡献:ClawProBench——trace 感知的 runtime-native benchmark;实例化于 OpenClaw(配备 workspace 工具以及 browsing/memory/messaging/scheduling/skills/subagents 等原生 surface 的 live agent runtime);定义两条赛道(102 题);failure 不只发生在最终答案,还发生在 trace 过程中的多个位置
  • 立标信号:work-queue Top15 #1 高价值待深度解读;paper_card 1085 2026-08-26 新建

与 knowledge/evaluation.md R57 现有脉络的关系

  • 现有脉络:R57 §2.207 评测方法学 22→24 元组(R56 新增 HSI/EnvHarness);§2.6 失败模式反方体系 46 层(ReliabilityBench/HORIZON/AgentDebug);ClawProBench 提出 trace 级别的 failure location 定位——与 AgentDebug 17×5 错误分类互补(后者是分类维度,前者是定位层次);与 ReliabilityBench RDC/VAF/GDS/MOP 四指标形成垂直互补(时序可靠性 vs trace 空间定位)
  • 建议归入节:§2.207 评测方法学候选 → ClawProBench(trace 感知 runtime-native 评测 + model-plus-runtime 配置单元);§2.6 失败模式反方体系邻接

矛盾 / 待核实

  • ClawProBench 实例化于 OpenClaw——runtime 特定性是否限制泛化?与 R57 §2.6.47 HORIZON 跨域 harness 异质性问题同构
  • evaluator leak 风险:OpenClaw 作为 runtime 本身是否参与了 evaluation,引入evaluator leak?HF Daily 8-26 未见覆盖,需 PDF 核实
  • 102 道题的具体分布和评测指标设计

arXiv 列表

  • 2608.22510(✅ paper_card 1085 已建;eval 专项 ★★★;work-queue Top15 #1)

条目二:Task-CoEvolve — 自适应验证任务选择实现 harness 高效优化(eval 专项 ★★,paper_card 1070 已建)

来源paper_cards/1070-2608-20169.md(2026-08-25 新建);inbox/tom/_candidates/2026-08-25-agent-rag-longcontext-candidates.json arXiv2608.20169 主分类:evaluation;形态:method

要点

  • 核心问题:Harness 优化迭代改写 harness 代码以提升性能,无需更新模型权重。但现有方法在每次迭代中对固定验证集做完整评估——即便某些任务随 harness 演进区分度下降,仍产生高昂评测成本
  • 关键贡献:Task-CoEvolve——验证任务与 harness 协同演进;通过解决两项挑战(选择性评估 + 任务权重动态调整)使验证集随 harness 同步演化,避免在低区分度任务上浪费评测预算
  • 立标信号:paper_card 1070 2026-08-25 新建;HF Daily 未上榜但方法学贡献显著

与 knowledge/evaluation.md R57 现有脉络的关系

  • 现有脉络:R57 §2.1 评测方法学 35 轴(R55 LDM 开放式发现/探索-利用评测轴第35);§3.5 harness 生态七角候选(R55+1 HarnessEval-W cs.CV + AgentDebug);Task-CoEvolve 填补"harness 演进效率"空白——使 harness 优化本身变成可工程化的低成本操作,属于 §2.1 评测方法学邻接(harness 高效优化方法轴候选)
  • 建议归入节:§2.1 评测方法学邻接 → Task-CoEvolve(自适应验证任务选择);§3.5 harness 生态七角延伸

矛盾 / 待核实

  • Task-CoEvolve 的两项核心挑战具体技术方案(PDF 原文未读取)
  • 与 Rethink(2607.12227)"harness evolution 算力等价不优于 parallel sampling"是否矛盾——Task-CoEvolve 是否属于 Rethink 批判范围内的改进

arXiv 列表

  • 2608.20169(✅ paper_card 1070 已建;eval 专项 ★★)

条目三:MobilePA-Bench — 交互式有状态移动端 Planner Agent 评测(eval 专项 ★,paper_card 1069 已建,HF Daily 8-26 #6 34▲)

来源paper_cards/1069-2608-23035.md(2026-08-25 新建);inbox/tom/_candidates/2026-08-25-agent-rag-longcontext-candidates.jsonHF Daily 2026-08-26 #6 34▲ arXiv2608.23035 主分类:evaluation;形态:benchmark;副分类:agent

要点

  • 核心问题:现有移动端 Agent 评测分为两类,各自存在关键盲区:① GUI 中心基准只测表层屏幕操作,忽略后台工具调用和长程规划;② 静态 function-calling 基准依赖离线 API 匹配,与真实运行时约束脱节
  • 关键贡献:MobilePA-Bench——交互式、有状态、以工具为中心的移动端 Agent 评测;填补"后台工具调用与长程规划"评测空白;端侧 LLM Agent(个人副驾驶)的评测需求
  • 立标信号:HF Daily 8-26 #6 34▲(高于 OmniAssistBench 28▲ #10);paper_card 1069 2026-08-25 新建

与 knowledge/evaluation.md R57 现有脉络的关系

  • 现有脉络:R57 §2.2 评测对象分化(88→90维;OmniAssistBench 助手风格交互评测 + Beyond Correctness 行为对齐评测);MobilePA-Bench 填补"移动端交互式 Agent 评测"空白,与 OmniAssistBench(助手风格通用评测)形成垂直互补——前者专于移动端,后者通用助手
  • 建议归入节:§2.7 评测对象分化邻接 → MobilePA-Bench(移动端交互式 Agent 评测);§2.2 评测对象邻接(交互式有状态工具中心 benchmark)

矛盾 / 待核实

  • MobilePA-Bench 的评测指标是否区分"GUI 交互质量"和"后台工具调用效率"两个维度
  • 具体支持的移动端平台(Android/iOS)和工具集规模

arXiv 列表

  • 2608.23035(✅ paper_card 1069 已建;eval 专项 ★;HF Daily 8-26 #6 34▲)

条目四:LongWoF-Bench — 可验证长工作流任务基准与 EvoMap 基因外部化(eval 专项 ★,paper_card 1081 已建)

来源paper_cards/1081-2608-23200.md(2026-08-26 新建);inbox/tom/_candidates/2026-08-26-agent-rag-longcontext-candidates.json arXiv2608.23200 主分类:evaluation;形态:benchmark

要点

  • 核心问题:LLM 执行复杂工作流的成功经验在单次运行后丢失,迫使后续模型从头重新发现策略和失败模式。EvoMap 提出将验证器确认的执行轨迹整合为结构化 Gene,实现经验外部化和复用
  • 关键贡献:LongWoF-Bench 评估 EvoMap 基因外部化设定;工作流成功依赖于维持相互依赖约束并产出满足严格端到端验证的产物;引入可验证长工作流任务基准
  • 立标信号:paper_card 1081 2026-08-26 新建;flyp 8-26 multimodal-e1prep 提及

与 knowledge/evaluation.md R57 现有脉络的关系

  • 现有脉络:R57 §2.1 评测方法学 35 轴(R54 HSI 可热替换 harness 任务特定性;R56 ReliabilityBench RDC 长视可靠性曲线);LongWoF-Bench 提出"EvoMap 基因"作为可验证长工作流评测单元,与 ReliabilityBench"随时长衰减"和 HORIZON"跨域诊断"形成三维互补——时序衰减 × 跨域异质性 × 基因外部化复用
  • 建议归入节:§2.207 评测方法学候选 → LongWoF-Bench(EvoMap 基因外部化 + 可验证长工作流基准);§2.1 评测方法学邻接

矛盾 / 待核实

  • EvoMap Gene 具体数据结构(是否有公开 schema)
  • LongWoF-Bench 的端到端验证器是否依赖特定领域或通用

arXiv 列表

  • 2608.23200(✅ paper_card 1081 已建;eval 专项 ★)

条目五:Prime Agent — 自我改进 RLM Harness 触发评测方法学延革完整 6 锚链(eval 邻接 ★★★,HF Daily 8-26 #7 32▲,paper_card 未建)

来源HF Daily 2026-08-26 #7 32▲inbox/flyp/2026-08-26-multimodal-e1prep.mdwork-queue.md arXiv2608.23552(❌ paper_card 未建) 主分类:evaluation(邻接);形态:method/harness

要点

  • 核心方法:Prime Agent(PrimeIntellect-ai 系 12 人,Seth Karten + Alex L. Zhang + Sami Jaghouar 主导);RLM abstraction + Continual Harness + 递归子 agent + Agents View + IPython REPL
  • 关键数据:ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%——v33 以来 single-step harness 提升幅度最大实测
  • 评测方法学延革完整 6 锚链触发:HarnessEval-W(8-19 #2 111▲)+ StateM(8-19 #1 130▲)+ EnvHarness(8-22 #1 235▲)+ Zetta(8-23 #3 141▲)+ Harness-Evolution-Eval-Rethink(8-22 critical-read)+ Prime Agent(8-26 #7 32▲)= v33 以来首次完整 6 件锚链

与 knowledge/evaluation.md R57 现有脉络的关系

  • 现有脉络:R57 §2.5 反方 44→46 层(R55 Rethink "harness evolution 算力等价不优于 parallel sampling/sequential refinement" + R56 ReliabilityBench "memory scaffold 普遍伤害");Prime Agent 的 ARC-AGI-3 30%→95.5% 与 ReliabilityBench memory scaffold 普遍伤害形成直接张力——前者是 harness 增益的强证明,后者是 memory-augmented scaffold 普遍伤害的强反方;二者同时成立意味着 harness 类型决定效果,memory scaffold 特指特定架构而非所有外部化记忆
  • 建议归入节:§2.5 反方体系 → Prime Agent(self-improving RLM harness ARC-AGI-3 30%→95.5%);§2.1 评测方法学延革第 19 例候选

矛盾 / 待核实

  • Prime Agent 30%→95.5% 是否依赖 test-time training 或其他 leak——需 PDF 核实;flyp 8-26 multimodal-e1prep 已标注"是否有 evaluator leak"为 v58 预备触发
  • Continual Harness vs ReliabilityBench memory scaffold 是否同构或互斥——前者通过递归子 agent 实现 self-improving,后者是 memory-augmented scaffold architecture;关键区别在于"显式递归 self-improvement loop"vs"静态 memory 外部化"
  • Prime Agent 评测是否在 ARC-AGI-3 公开 leaderboard 有独立验证

arXiv 列表

  • 2608.23552(❌ paper_card 未建;eval 邻接 ★★★;HF Daily 8-26 #7 32▲;评测方法学延革第 19 例候选)

条目六:GameXpert-Bench — 编码 Agent 游戏开发过程评测(eval 邻接 ★,paper_card 1073 已建)

来源paper_cards/1073-2608-21833.md(2026-08-25 新建);inbox/tom/_candidates/2026-08-25-agent-rag-longcontext-candidates.json arXiv2608.21833 主分类:agent;形态:benchmark;副分类:evaluation

要点

  • 核心问题:游戏开发需要程序逻辑、视觉音频内容、界面、交互和可玩性在同一可执行制品中协同工作。现有基准只评测最终制品或孤立开发阶段,忽略完整开发过程
  • 关键贡献:GameXpert-Bench——同时评测游戏产品和开发过程;评测对象从"最终 artifact"扩展到"人机协作开发轨迹"
  • 立标信号:paper_card 1073 2026-08-25 新建;agent 主分类 eval 副分类

与 knowledge/evaluation.md R57 现有脉络的关系

  • 现有脉络:R57 §2.7 评测对象 90 维(GameXpert-Bench 不新增维度,但扩展评测对象时空范围);§2.6 失败模式反方体系(AgentDebug 17×5 + 41种失败模式);GameXpert-Bench 将"过程评测"引入 coding agent benchmark,与 ClawProBench trace 级别评测理念呼应——但 GameXpert-Bench 是垂直领域,ClawProBench 是通用框架
  • 建议归入节:§2.7 评测对象邻接 → GameXpert-Bench(游戏开发过程评测)

矛盾 / 待核实

  • GameXpert-Bench 的评测指标(产品维度 + 过程维度如何量化)

arXiv 列表

  • 2608.21833(✅ paper_card 1073 已建;agent 主分类 eval 邻接 ★)

值得警惕的矛盾或待核实说法

① Prime Agent 30%→95.5% 的 ARC-AGI-3 提升是否有 evaluator leak?

Prime Agent(2608.23552)ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5% 是 HF Daily 8-26 #7 32▲ 的核心数据,但 evaluator leak 风险尚未核实。ARC-AGI-3 作为公开 benchmark 应有独立验证,若无独立验证则该数据可信度打折。建议:等待 paper_card 新建并核实独立验证结果

② ClawProBench 的 OpenClaw runtime 特异性是否限制泛化?

ClawProBench 实例化于 OpenClaw(Tom 所在 runtime)。虽然方法论通用,但具体 surface 映射到 OpenClaw 特定工具集(browsing/memory/messaging/scheduling/skills/subagents),跨 runtime 泛化需额外验证。与 R57 §2.6.47 HORIZON 跨域 harness 异质性同构

③ Prime Agent Continual Harness 与 ReliabilityBench memory scaffold 的张力

ReliabilityBench(2603.29231)发现 memory-augmented scaffold 普遍伤害长视性能(10 模型无一例外)。Prime Agent 通过 Continual Harness + 递归子 agent 实现 30%→95.5% 提升。若 Prime Agent 的 harness 不属于 memory-augmented scaffold 范畴,则二者不矛盾;若属于,则需解释为何 ReliabilityBench 的 10 模型无一例外与此矛盾。关键区别可能是:Continual Harness 有显式 self-improvement loop,memory-augmented scaffold 是静态外部记忆

④ Task-CoEvolve 与 Rethink 的张力

Rethink(2607.12227)认为 harness evolution 在 Terminal-Bench 上算力等价不优于 parallel sampling/sequential refinement。Task-CoEvolve 通过自适应验证任务选择降低 harness 优化成本——若其成本降低恰好使"算力等价"变成"算力优势",则与 Rethink 直接冲突。需 PDF 核实 Task-CoEvolve 的实验设置是否覆盖 Terminal-Bench

⑤ LongWoF-Bench EvoMap 基因的领域依赖性

LongWoF-Bench 依赖"严格端到端验证器",不同领域(代码/游戏/科学)的验证器设计差异巨大。EvoMap 基因外部化的通用性尚未证明。建议:关注 EvoMap schema 是否公开


可引用 arXiv 号列表(本次预消化涉及的)

arXiv ID 名称 状态 分类
2608.22510 ClawProBench ✅ paper_card 1085 已建(2026-08-26 新建) eval 专项 ★★★(work-queue Top15 #1;trace 感知 runtime-native 评测)
2608.20169 Task-CoEvolve ✅ paper_card 1070 已建(2026-08-25 新建) eval 专项 ★★(自适应验证任务选择)
2608.23035 MobilePA-Bench ✅ paper_card 1069 已建(2026-08-25 新建) eval 专项 ★(HF Daily 8-26 #6 34▲)
2608.23200 LongWoF-Bench ✅ paper_card 1081 已建(2026-08-26 新建) eval 专项 ★(EvoMap 基因外部化)
2608.21833 GameXpert-Bench ✅ paper_card 1073 已建(2026-08-25 新建) agent 主分类 eval 邻接 ★
2608.23552 Prime Agent ❌ paper_card 未建 eval 邻接 ★★★(HF Daily 8-26 #7 32▲;评测方法学延革第 19 例候选;完整 6 锚链触发)
2608.21360 OmniAssistBench ❌ paper_card 未建(跨轮遗留) eval 邻接 ★(HF Daily 8-25 #12 27▲ 新晋锚)
2608.12781 Beyond Correctness ❌ paper_card 未建(跨轮遗留) eval 邻接 ★(HF Daily 8-25 #14 19▲ 新晋锚)
2603.29231 ReliabilityBench ✅ 来源追溯 eval 邻接 ★★★(P0 反方立基础锚;memory scaffold 普遍伤害)
2604.11978 HORIZON ✅ 来源追溯 eval 邻接 ★★★(COLM 2026;长视 Agent 元评测)
2607.28802 41 种 Agent 失败模式分类学 ❌ paper_card 未建 eval 邻接 ★★(Cohen's κ=0.76;评测方法学延革第 18 例)
2607.12227 Harness-Evolution-Eval-Rethink ✅ 来源追溯 eval 邻接 ★★★(flyp critical-read 8-22 落盘;算力等价质疑)
2608.16590 Zetta ζ ✅ paper_card 1027 已建 eval 邻接 ★★★(HF Daily 142▲)
2608.17271 ASI-Bench ❌ paper_card 未建 eval 邻接(衰减跌出确认;连续四日跌出)
2608.20438 PV-SST ❌ paper_card 未建(跨轮遗留) eval 邻接 ★
2608.20574 FlavourBench ❌ paper_card 未建(跨轮遗留) eval 邻接 ★

本轮检查过的来源

来源 文件 Evaluation 相关性
/shared/research-kb/organized/queue/work-queue.md 2026-08-26 14:00 ClawProBench 2608.22510 Top15 #1 高价值待深度解读
inbox/tom/HF Daily 2026-08-26 8-26 09:00 Prime Agent 32▲ #7(RLM Harness)+ MobilePA-Bench 34▲ #6
inbox/flyp/2026-08-26-multimodal-e1prep.md 8-26 09:40 Prime Agent 评测方法学延革完整 6 锚链触发 + EchoWM/LongWoF-Bench EvoMap 预备
inbox/tom/2026-08-26T1440-agent-rag-longcontext-radar.md 8-26 14:40 UTC Evidence Blindness in DCI 新概念(arXiv:2608.24764);无 eval 专项 ✓
inbox/jay/2026-08-26T0820-csdn-highvalue-inference-rag-multimodal.md 8-26 08:20 RAGAS + LLM-as-Judge 评测体系邻接 ✓
inbox/jay/2026-08-26T0935-hf-state-open-models-vecdb-benchmark-agent-memory.md 8-26 09:35 RAGAS + LLM-as-Judge 评测体系邻接 ✓
inbox/jay/2026-08-26T1335-evening-briefing-ai-agents-stack-inference-github-aug26.md 8-26 13:35 Agent eval 邻接(evaluator 评估成本 + Agent 经济学)✓
inbox/tom/2026-08-25-evaluation-e1prep.md 8-25 15:40 R57 基线确认 ✓
paper_cards/1085-2608-22510(ClawProBench) 2026-08-26 新建 ✅ evaluation 主分类 ★★★
paper_cards/1069-2608-23035(MobilePA-Bench) 2026-08-25 新建 ✅ evaluation 主分类 ★
paper_cards/1070-2608-20169(Task-CoEvolve) 2026-08-25 新建 ✅ evaluation 主分类 ★★
paper_cards/1081-2608-23200(LongWoF-Bench) 2026-08-26 新建 ✅ evaluation 主分类 ★
paper_cards/1073-2608-21833(GameXpert-Bench) 2026-08-25 新建 ✅ agent 主分类 eval 邻接 ★
paper_cards/1060-2608-21249(Dis2Pat) 8-25 新建 ✅ evaluation 主分类(已入 R57)
knowledge/evaluation.md R57 R57 2026-08-25 确认现有脉络:R57 基线 ✓

结论

本轮(E1-R58,2026-08-26)eval 主题 eval 专项 net-new paper_card 新增 4 条(ClawProBench + MobilePA-Bench + Task-CoEvolve + LongWoF-Bench);eval 邻接新增 2 条(GameXpert-Bench agent 主分类 eval 副分类 + Prime Agent paper_card 未建)。

本轮最重要增量ClawProBench(2608.22510 ★★★,work-queue Top15 #1)——trace 感知 runtime-native benchmark,将评测单元从"最终答案"扩展到"声明式 model-plus-runtime 配置",failure 可定位于 evidence acquisition / runtime routing / safety boundaries / repeated execution,与 R57 ReliabilityBench(时序可靠性)/ HORIZON(跨域诊断)/ AgentDebug(错误分类)形成方法学层面的三维互补。Task-CoEvolve(2608.20169 ★★) 自适应验证任务选择使 harness 优化成本大幅降低,与 Rethink"算力等价"批判形成张力。Prime Agent(2608.23552,HF Daily 8-26 #7 32▲) 触发 v33 以来首次评测方法学延革完整 6 锚链,同时与 ReliabilityBench "memory scaffold 普遍伤害"形成反向验证预备。

立标池结构性变化(R58 第 1 日): - Prime Agent 32▲ 新晋锚 #7(RLM self-improving harness) - MobilePA-Bench 34▲ 新晋锚 #6(交互式移动端 Agent benchmark) - OmniAssistBench 28▲ #10(延续,HF Daily 8-26 延续 8-25) - ASI-Bench 连续五日跌出确认

涉及 arXiv 号:2608.22510(✅已建卡/eval专项★★★Top15#1)/ 2608.20169(✅已建卡/eval专项★★)/ 2608.23035(✅已建卡/eval专项★HF Daily#6 34▲)/ 2608.23200(✅已建卡/eval专项★)/ 2608.21833(✅已建卡/agent主分类eval邻接★)/ 2608.23552(❌未建卡/eval邻接★★★HF Daily#7 32▲完整6锚链触发)/ 2608.21360(❌未建卡/eval邻接★跨轮遗留)/ 2608.12781(❌未建卡/eval邻接★跨轮遗留)/ 2603.29231(✅来源追溯/eval邻接★★★P0反方立基础锚)/ 2604.11978(✅来源追溯/eval邻接★★★COLM2026)/ 2607.28802(❌未建卡/eval邻接★★评测方法学延革第18例)/ 2607.12227(✅来源追溯/eval邻接★★★flyp critical-read)/ 2608.16590(✅已建卡/eval邻接★★★HF Daily 142▲)/ 2608.17271(❌未建卡/eval邻接衰减跌出确认连续五日)/ 2608.20438(❌未建卡/eval邻接★跨轮遗留)/ 2608.20574(❌未建卡/eval邻接★跨轮遗留)


建议后续动作

  • [ ] ClawProBench(2608.22510) paper_card 已建(1085 ✅),建议深度解读(work-queue Top15 #1)
  • [ ] Prime Agent(2608.23552) paper_card 新建(eval 邻接 ★★★,HF Daily 8-26 #7 32▲;评测方法学延革第 19 例候选;需核实 evaluator leak)
  • [ ] OmniAssistBench(2608.21360) paper_card 新建(跨轮 R57→R58 遗留,eval 邻接 ★)
  • [ ] Beyond Correctness(2608.12781) paper_card 新建(跨轮 R57→R58 遗留,eval 邻接 ★)
  • [ ] AgentDebug(GitHub ulab-uiuc/AgentDebug) paper_card 新建(跨轮 R57→R58 遗留,eval 邻接 ★★★)
  • [ ] 41 种失败模式分类学(2607.28802) paper_card 新建(跨轮遗留,eval 邻接 ★★,Cohen's κ=0.76)
  • [ ] PV-SST(2608.20438) paper_card 新建(跨轮 R57→R58 遗留,eval 邻接 ★)
  • [ ] FlavourBench(2608.20574) paper_card 新建(跨轮 R57→R58 遗留,eval 邻接 ★)
  • [ ] ASI-Bench(2608.17271) paper_card 新建(连续五日跌出,衰减确认,需归档)
  • [ ] Prime Agent ARC-AGI-3 30%→95.5% evaluator leak 核实(截止待定,flyp 已标注)
  • [ ] Task-CoEvolve vs Rethink 实验设置交叉核实(Task-CoEvolve 是否覆盖 Terminal-Bench)
  • [ ] ReliabilityBench memory scaffold 普遍伤害 vs Prime Agent Continual Harness 反向验证预备(v58 预备触发)

Tom · 2026-08-26 15:40 CST · E1 预消化简报 · evaluation 主题 · 4 条 eval 专项 net-new paper_card(ClawProBench ★★★ + Task-CoEvolve ★★ + MobilePA-Bench ★ + LongWoF-Bench ★)+ 2 条 eval 邻接(GameXpert-Bench ★ + Prime Agent ★★★ paper_card 未建)+ Prime Agent 32▲ 触发评测方法学延革完整 6 锚链(v33 以来首次)+ ASI-Bench 连续五日衰减跌出确认 · 涉及 arXiv:2608.22510(✅)/ 2608.20169(✅)/ 2608.23035(✅)/ 2608.23200(✅)/ 2608.21833(✅)/ 2608.23552(❌未建卡 ★★★)/ 2608.21360(❌跨轮遗留)/ 2608.12781(❌跨轮遗留)/ 2603.29231(✅来源追溯 ★★★P0反方)/ 2604.11978(✅来源追溯 ★★★COLM2026)/ 2607.28802(❌未建卡★★)/ 2607.12227(✅来源追溯★★★)/ 2608.16590(✅已建★★★)/ 2608.17271(❌衰减跌出确认连续五日)/ 2608.20438(❌跨轮遗留)/ 2608.20574(❌跨轮遗留)