evaluation · 知识库活文档

  • 更新:R64 LoopArena 87▲ 新上榜立 harness 候选十六角+PILOT 30▲ 维持衰减+三件 R63 锚定续升

0. 范围与定调

本活文档面向 LLM / Agent / RAG / 多模态系统评测 主题,覆盖 benchmark 设计、指标体系、judge / harness 工程、可信评测方法学、跨模态评测、EDD 等。与 agent.mdrag.mdmultimodal.mdllm-infra.md 平行。时间锚定 2026 年中。

五十四重范式跃迁(R64 终态,简版):R0-R55 早期范式 + trace-runtime 评测 + 长视元评测 + self-improving harness(详见 archive);R56 harness 生态七角 + R57 trace-runtime + reverse verification + R58 推理训练目标偏差 + agent 安全防御 + 并发多 Agent + 跨运行拓扑 + 开放世界 + 可审计性六轴;R59 多语言 self-play + test-time policy optimization + 空间关系绑定诊断 + 高效 test-time scaling + 视频视觉智能 五件合流;R60 PILOT live self-improvement trace × live harness update 二阶评测立基础锚候选;R61 评测诚信 + test-time scaling 三轴 + JIT harness intelligence + 可验证奖励信号 + harness 共同进化 五件合流;R62 PAWBench 概率对齐世界建模评测 + VGI-Bench 双日锁立标极显著 + Agentic Game Dev 四日锁 + PILOT 增速放缓 + paper_card 待建 4 件警示 + 立标池饱和度 v44-v63 二十日连续 六件合流;R63 PAWBench 129▲ 立基础锚预备阈值触发(82▲→129▲ +47▲ 48h 暴涨 v33 以来同档涨幅第 1)+Agentic Game Dev 180▲ 登顶 HF Daily #1(v33 以来 agent 主分类立标信号最高 +46▲ 48h)+UrbanGround 100▲ ★☆→★ 升档预备触发(72▲→100▲ +28▲ 48h 首次破百)+Human-Centric Intelligence Survey(2608.18184)eval 主分类论文锚定第 5 维+ Gaming Without an Attacker(2608.08722)评测诚信/基准指纹化方法学批判论文锚定 §6.97 邻接+VGI-Bench 四日锁 173▲ 续立+Agentic Game Dev 五日锁 +WarpSAC 五日锁 137▲ 续立+PILOT 30▲ 正式进入衰减期确认(27▲→30▲ 仅+3)+JIT-Agent 109▲ 续立+TTPO 73▲ 新上榜+Self-OPD/ACE-perspective 续立+ASI-Bench 连续 11+ 日跌出确认+立标池饱和度 v44-v63 → v44-v64 廿一日连续(R63 +1)+flyp 双精读 VGI-Bench / PAWBench 触发候选升级 ★★→★★★ 观察预备+§2.6 失败模式反方体系 65 → 67 层(R63 +2:§2.6.71 Agentic Game Dev grounded reward 大规模可重复性 + §2.6.72 UrbanGround 城市空间评测 vs 真实城市部署分布对位)+反方预备 58 → 61 层(R63 +3:§2.5.61 PAWBench outcome schema 完备性 + §2.5.62 Agentic Game Dev grounded reward 缩放 + §2.5.63 UrbanGround 城市代理泛化)+harness 生态候选十四角 → 候选十五角候选(UrbanGround 空间智能评测层 第 15 节点 R63 候选延伸)+评测方法学社区内容补全二十三联 → 二十四联立标(R63 +1:flyp 双精读)+立标池双向锚第 21 日 PAWBench 129▲ +47▲ +Agentic Game Dev 180▲ +46▲ +UrbanGround 100▲ +28▲ 三峰周六暴涨实测 = R63 11 件 net-new(1 立基础锚预备阈值触发 + 2 立标极显著 + 3 论文锚定 + 1 双向锚 + 2 失败模式 + 3 反方预备 + 1 harness 候选延伸 + 1 社区立标 + 1 饱和度 +1):1)PAWBench 概率对齐世界建模评测立基础候选(arXiv:2608.27345 HF Daily 8-30 82▲ 第 1 日 paper_card 未建)——50 scenarios × 8 physical mechanism groups(PAW-Calibration 25 + PAW-Coverage 25),TVD ×100 指标,11 video generators 对照实测无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance;首次把"概率对齐"作为世界模型 evaluation 的 distributional criterion;GitHub Andrew0613/PAWBench 已公开透明,发布 arXiv:2608.27345 cs.CV;与 Agentic Game Dev 评测 reward signal 质量 + WarpSAC 评测 off-policy RL 共同构成"world model 评测三向耦合"(分布对齐 + reward grounded + off-policy scaling);2)VGI-Bench 170▲ 双日锁(arXiv:2608.19583)——v33 以来视频生成视觉智能评测基准立标信号最高,跨三日 139▲→170▲→170▲ 持续上扬立标极显著;3)Agentic Game Dev 四日锁 134▲(arXiv:2608.25518)+ PILOT 27▲ 增速放缓进入可能衰减期(立标强度梯度变化预警)+ paper_card 待建 4 件警示(JIT-Agent / TaoLive / WarpSAC / PAWBench)+ 立标池饱和度 v44-v62 → v44-v63 二十日连续(R62 +1)+ 评测方法学延革第 37 例预备(PAWBench 概率对齐分布级对齐立基础候选);4)§2.6 失败模式反方体系 63 → 65 层(R62 +2:§2.6.69 PAWBench 终端 outcome 不足以捕捉 trajectory-level dynamics 与 intermediate physical processes + §2.6.70 VGI-Bench 视频生成视觉智能与 Agentic Game Dev 可验证奖励评测粒度对位);5)反方预备 56 → 58 层(R62 +2:§2.5.59 PAWBench 终端 outcome 评测充分性边界 + §2.5.60 VGI-Bench 视觉智能评测是否独立于具体模型能力);6)harness 生态候选十三角 → 候选十四角候选(PAWBench 概率对齐评测层 第 14 节点 R62 候选延伸);7)评测方法学社区内容补全二十二联 → 二十三联立标(R62 +1:PAWBench);8)立标池双向锚第 20 日 PAWBench HF Daily 82▲ 新晋立基础候选 + VGI-Bench 双日锁 170▲ + Agentic Game Dev 四日锁 134▲ + 立标池饱和度 v44-v63 二十日连续 = R62 8 件 net-new(1 立基础候选 + 2 票数极显著校准 + 4 paper_card 待建警示 + 2 失败模式 + 2 反方预备 + 1 harness 候选延伸 + 1 社区立标)

2.8.1 R48 §2.8.1 历史链接 artifact 标注保留(原文逐字保留以满足 atomic missing=0 协议)

R48 §2.8.1 历史链接 artifact 标注保留:https://github.com/zjunlp/OneDayAgent;(xiii / https://lilianweng.github.io/posts/2026-07-04-harness/(邻接 / https://lilianweng.github.io/posts/2026-07-04-harness/(非 / https://arxiv.org/abs/2608.09888 (BDH-CQ R46 立标池双向锚 衰减锚链接,plain URL 引用补全)。

2.8.2 R00-R62 续)

R62 full historical arXiv ID list(atomic missing=0 保留,155 IDs 单一长行):arXiv:2501.05444+arXiv:2507.00310+arXiv:2512.02282+arXiv:2512.02882+arXiv:2512.14629+arXiv:2601.04043+arXiv:2601.14242+arXiv:2603.08835+arXiv:2603.29231+arXiv:2604.10352+arXiv:2604.11978+arXiv:2605.10286+arXiv:2605.18032+arXiv:2605.23950+arXiv:2605.27922+arXiv:2605.30434+arXiv:2606.08367+arXiv:2606.14747+arXiv:2607.08028+arXiv:2607.12227+arXiv:2607.27616+arXiv:2607.27816+arXiv:2607.27853+arXiv:2607.27888+arXiv:2607.28609+arXiv:2607.28661+arXiv:2607.28802+arXiv:2607.28887+arXiv:2607.29241+arXiv:2607.29677+arXiv:2608.00267+arXiv:2608.00677+arXiv:2608.01964+arXiv:2608.03451+arXiv:2608.03507+arXiv:2608.03700+arXiv:2608.03764+arXiv:2608.04003+arXiv:2608.04205+arXiv:2608.04302+arXiv:2608.04397+arXiv:2608.05013+arXiv:2608.05139+arXiv:2608.05747+arXiv:2608.05850+arXiv:2608.06301+arXiv:2608.06312+arXiv:2608.06329+arXiv:2608.06614+arXiv:2608.06729+arXiv:2608.06867+arXiv:2608.07545+arXiv:2608.08119+arXiv:2608.08160+arXiv:2608.08311+arXiv:2608.08466+arXiv:2608.08676+arXiv:2608.08722+arXiv:2608.08814+arXiv:2608.08975+arXiv:2608.09096+arXiv:2608.09158+arXiv:2608.09766+arXiv:2608.09802+arXiv:2608.09805+arXiv:2608.09867+arXiv:2608.09888+arXiv:2608.09900+arXiv:2608.10708+arXiv:2608.10744+arXiv:2608.10875+arXiv:2608.11341+arXiv:2608.11745+arXiv:2608.11947+arXiv:2608.12036+arXiv:2608.12149+arXiv:2608.12314+arXiv:2608.12571+arXiv:2608.12743+arXiv:2608.12781+arXiv:2608.12875+arXiv:2608.13010+arXiv:2608.13120+arXiv:2608.13160+arXiv:2608.13417+arXiv:2608.13489+arXiv:2608.13505+arXiv:2608.13546+arXiv:2608.13547+arXiv:2608.13552+arXiv:2608.13558+arXiv:2608.13560+arXiv:2608.13588+arXiv:2608.13606+arXiv:2608.13760+arXiv:2608.13951+arXiv:2608.14022+arXiv:2608.14036+arXiv:2608.14106+arXiv:2608.14284+arXiv:2608.14457+arXiv:2608.14546+arXiv:2608.14905+arXiv:2608.15022+arXiv:2608.15089+arXiv:2608.15669+arXiv:2608.16425+arXiv:2608.16590+arXiv:2608.16798+arXiv:2608.16859+arXiv:2608.17253+arXiv:2608.17271+arXiv:2608.17379+arXiv:2608.17393+arXiv:2608.17426+arXiv:2608.17528+arXiv:2608.17597+arXiv:2608.17950+arXiv:2608.18077+arXiv:2608.18184+arXiv:2608.18484+arXiv:2608.18489+arXiv:2608.18565+arXiv:2608.18580+arXiv:2608.18613+arXiv:2608.18701+arXiv:2608.18940+arXiv:2608.19197+arXiv:2608.19269+arXiv:2608.19583+arXiv:2608.19799+arXiv:2608.19854+arXiv:2608.19880+arXiv:2608.20169+arXiv:2608.20202+arXiv:2608.20335+arXiv:2608.20336+arXiv:2608.20438+arXiv:2608.20574+arXiv:2608.20910+arXiv:2608.21031+arXiv:2608.21156+arXiv:2608.21159+arXiv:2608.21208+arXiv:2608.21249+arXiv:2608.21252+arXiv:2608.21360+arXiv:2608.21500+arXiv:2608.21832+arXiv:2608.21833+arXiv:2608.22510+arXiv:2608.23035+arXiv:2608.23200+arXiv:2608.23552+arXiv:2608.23670+arXiv:2608.23691+arXiv:2608.23740+arXiv:2608.24479+arXiv:2608.25518+arXiv:2608.25529+arXiv:2608.25593+arXiv:2608.25798+arXiv:2608.25832+arXiv:2608.26070+arXiv:2608.26200+arXiv:2608.26530+arXiv:2608.26872+arXiv:2608.27260+arXiv:2608.27345+arXiv:2608.27448+arXiv:2608.27455+arXiv:2608.27456

R62 新增 1 条 arXiv ID:arXiv:2608.27345(PAWBench R62 立基础候选 ★★ HF Daily 8-30 82▲ paper_card 未建) = atomic missing=0 保留(R62 0 删 URL)。

R63 新增 7 条 arXiv ID:arXiv:2608.26005(VoiceMem 8-31 HF Daily #3 168▲ +2▲ inference-time 流式双脑记忆评测邻接)+ arXiv:2608.19098(Open-MOPD 8-31 HF Daily #15 20▲ 新上榜 多教师 on-policy distillation)+ arXiv:2608.23256(Next-Chunk Reasoning RL 8-31 HF Daily #14 21▲ 新上榜 reasoning RL vs SFT 评测邻接)+ arXiv:2608.26872(Self-OPD 8-31 HF Daily #9 71▲ +2▲ 续立 Flow Matching on-policy distillation)+ arXiv:2608.27260(ACE-perspective 8-31 HF Daily #10 61▲ 新上榜 Agentic 数据生成评测邻接)+ arXiv:2608.26200(GameWAM 8-31 HF Daily #12 43▲ +4▲ 续立 电子游戏 world action model)+ arXiv:2608.27456(UrbanGround 8-31 HF Daily #7 100▲ +28▲ 48h 暴涨 ★☆→★ 升档预备触发 城市空间智能体评测 paper_card 未建);§2.8 R63 主索引 168 → 175 IDs(R63 +7 净增) = atomic missing=0 保留(R63 0 删 URL)。

R62 full historical URL list(atomic missing=0 保留,comprehensive single line,228 URLs R62 沿用)::https://21yrm.github.io/Apple-PI-homepage https://academ.us/article/2608.10875 https://aclanthology.org/2026.acl-demo.19/ https://aclanthology.org/2026.acl-demo.3/ https://aclanthology.org/2026.acl-demo.34/ https://aclanthology.org/volumes/2026.acl-demo https://aiweekly.co/alerts/acl-2026-publishes-demo-track-list-heavy-on-llm-safety-tools https://aiweekly.co/alerts/coercion-benchmark-claude-never-threatens-deletion-rivals-do https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal https://artificialanalysis.ai/evaluations/apex-agents-aa https://arxiv.org/abs/2501.05444 https://arxiv.org/abs/2512.02282 https://arxiv.org/abs/2512.14629(MuseCP https://arxiv.org/abs/2601.04043 https://arxiv.org/abs/2601.14242 https://arxiv.org/abs/2603.08835 https://arxiv.org/abs/2603.29231 https://arxiv.org/abs/2603.29231(ReliabilityBench https://arxiv.org/abs/2604.10352(ClawVM https://arxiv.org/abs/2604.11978 https://arxiv.org/abs/2604.11978(HORIZON https://arxiv.org/abs/2605.10286(AgentRx https://arxiv.org/abs/2605.18032 https://arxiv.org/abs/2605.23950 https://arxiv.org/abs/2605.27922 https://arxiv.org/abs/2605.30434 https://arxiv.org/abs/2606.08367 https://arxiv.org/abs/2606.14747(MMLongEmbed https://arxiv.org/abs/2607.08028(From https://arxiv.org/abs/2607.12227 https://arxiv.org/abs/2607.12227(Harness-Evolution-Eval-Rethink https://arxiv.org/abs/2607.12227(Rethink https://arxiv.org/abs/2607.27616 https://arxiv.org/abs/2607.27816 https://arxiv.org/abs/2607.27853 https://arxiv.org/abs/2607.27888 https://arxiv.org/abs/2607.28609 https://arxiv.org/abs/2607.28661 https://arxiv.org/abs/2607.28802 https://arxiv.org/abs/2607.28802(41种失败模式分类学 https://arxiv.org/abs/2607.28887 https://arxiv.org/abs/2607.29241 https://arxiv.org/abs/2607.29677(ExtractBench https://arxiv.org/abs/2608.00267 https://arxiv.org/abs/2608.00677(OpenART https://arxiv.org/abs/2608.01964 https://arxiv.org/abs/2608.03451 https://arxiv.org/abs/2608.03507 https://arxiv.org/abs/2608.03700 https://arxiv.org/abs/2608.03764 https://arxiv.org/abs/2608.04003 https://arxiv.org/abs/2608.04205 https://arxiv.org/abs/2608.04302 https://arxiv.org/abs/2608.04397 https://arxiv.org/abs/2608.05013 https://arxiv.org/abs/2608.05139 https://arxiv.org/abs/2608.05747 https://arxiv.org/abs/2608.05850 https://arxiv.org/abs/2608.06301 https://arxiv.org/abs/2608.06312 https://arxiv.org/abs/2608.06329 https://arxiv.org/abs/2608.06614 https://arxiv.org/abs/2608.06729 https://arxiv.org/abs/2608.06867(LLMRouter https://arxiv.org/abs/2608.07545(DarwinX https://arxiv.org/abs/2608.08119(TSDS-Toolbox https://arxiv.org/abs/2608.08160(Can https://arxiv.org/abs/2608.08311 https://arxiv.org/abs/2608.08466(HSI https://arxiv.org/abs/2608.08676(UniSpace https://arxiv.org/abs/2608.08722 https://arxiv.org/abs/2608.08814(360CityArena https://arxiv.org/abs/2608.08975 https://arxiv.org/abs/2608.09096 https://arxiv.org/abs/2608.09158 https://arxiv.org/abs/2608.09766 https://arxiv.org/abs/2608.09802 https://arxiv.org/abs/2608.09805 https://arxiv.org/abs/2608.09867(Stealing https://arxiv.org/abs/2608.09888 https://arxiv.org/abs/2608.09888(BDH-CQ https://arxiv.org/abs/2608.09900(Decoding-Level https://arxiv.org/abs/2608.10708 https://arxiv.org/abs/2608.10744(Latent-to-4D https://arxiv.org/abs/2608.10875(VibeLifeBench https://arxiv.org/abs/2608.11341(Apodex https://arxiv.org/abs/2608.11745(LiveAnimate https://arxiv.org/abs/2608.12036(Mechanist https://arxiv.org/abs/2608.12149 https://arxiv.org/abs/2608.12314(StateFlow https://arxiv.org/abs/2608.12571(Is https://arxiv.org/abs/2608.12743 https://arxiv.org/abs/2608.12781(Beyond https://arxiv.org/abs/2608.12875 https://arxiv.org/abs/2608.12875(Embedder's https://arxiv.org/abs/2608.12875(The https://arxiv.org/abs/2608.13010 https://arxiv.org/abs/2608.13120(SkillEvo https://arxiv.org/abs/2608.13160 https://arxiv.org/abs/2608.13417 https://arxiv.org/abs/2608.13417(超越最终分数 https://arxiv.org/abs/2608.13489 https://arxiv.org/abs/2608.13505 https://arxiv.org/abs/2608.13546 https://arxiv.org/abs/2608.13547(QuoteBench https://arxiv.org/abs/2608.13552(PlayWorld https://arxiv.org/abs/2608.13560(AutoDesign https://arxiv.org/abs/2608.13588 https://arxiv.org/abs/2608.13606(MobileMem https://arxiv.org/abs/2608.13951(HELIX https://arxiv.org/abs/2608.14022(ForgeWM https://arxiv.org/abs/2608.14036 https://arxiv.org/abs/2608.14106(Forecast https://arxiv.org/abs/2608.14284(PRM-as-a-Judge https://arxiv.org/abs/2608.14457(信息满足度 https://arxiv.org/abs/2608.14546(CPI-Bench https://arxiv.org/abs/2608.14905(ARFT https://arxiv.org/abs/2608.15022 https://arxiv.org/abs/2608.15089(StateM https://arxiv.org/abs/2608.15669(LDM https://arxiv.org/abs/2608.16425(ParaTempo https://arxiv.org/abs/2608.16590(Zetta https://arxiv.org/abs/2608.16798(ClawGym https://arxiv.org/abs/2608.16859(HarnessEval-W https://arxiv.org/abs/2608.17253(Co-RL https://arxiv.org/abs/2608.17271(ASI-Bench https://arxiv.org/abs/2608.17379(PTXBench https://arxiv.org/abs/2608.17393(LEGO-RL https://arxiv.org/abs/2608.17426(SemComp-Bench https://arxiv.org/abs/2608.17528(Agent https://arxiv.org/abs/2608.17597(HarnessRisk https://arxiv.org/abs/2608.17950(Six https://arxiv.org/abs/2608.18077(Hydra-0 https://arxiv.org/abs/2608.18184(Human-Centric https://arxiv.org/abs/2608.18484(SparsePR https://arxiv.org/abs/2608.18489(MissDiag https://arxiv.org/abs/2608.18565(SemaPLC https://arxiv.org/abs/2608.18580(FACET https://arxiv.org/abs/2608.18701(SoftVTBench https://arxiv.org/abs/2608.19799(SWE-bench https://arxiv.org/abs/2608.19854(Repo0 https://arxiv.org/abs/2608.19880(EnvHarness https://arxiv.org/abs/2608.20169(Task-CoEvolve https://arxiv.org/abs/2608.20202(MemTrapBench https://arxiv.org/abs/2608.20335(4DAnyone https://arxiv.org/abs/2608.20336(WithEveryone https://arxiv.org/abs/2608.20438(PV-SST https://arxiv.org/abs/2608.20574(FlavourBench https://arxiv.org/abs/2608.20910(InfinityEdit https://arxiv.org/abs/2608.21031(PhysCaP https://arxiv.org/abs/2608.21156(Graph https://arxiv.org/abs/2608.21159(AID-Guard https://arxiv.org/abs/2608.21208(SpecPort https://arxiv.org/abs/2608.21249(Dis2Pat https://arxiv.org/abs/2608.21252(EnSI-RAG https://arxiv.org/abs/2608.21360(OmniAssistBench https://arxiv.org/abs/2608.21833(GameXpert-Bench https://arxiv.org/abs/2608.22510(ClawProBench https://arxiv.org/abs/2608.23035(MobilePA-Bench https://arxiv.org/abs/2608.23200(LongWoF-Bench https://arxiv.org/abs/2608.23552(Prime https://arxiv.org/abs/2608.15763(TaoLive https://arxiv.org/abs/2608.26530(PILOT https://arxiv.org/abs/2608.19269(Inspect https://arxiv.org/abs/2608.27455(CritICL https://arxiv.org/abs/2608.25593(JIT-Agent https://arxiv.org/abs/2608.25518(Agentic https://arxiv.org/abs/2608.15763(TaoLive+https://arxiv.org/abs/2608.13760(Amplified+https://arxiv.org/abs/2608.21500(SecOPD+https://arxiv.org/abs/2608.23670(Automata+https://arxiv.org/abs/2608.23691(Autonomous+https://arxiv.org/abs/2608.23740(AgentRoom+https://arxiv.org/abs/2608.25529(Video-IFBench https://arxiv.org/html/2608.06312v1 https://arxiv.org/html/2608.10875v1(VibeLifeBench https://arxiv.org/html/2608.14905v1(ARFT https://cameronrwolfe.substack.com/p/agent-evals https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation https://github.com/21yrm/Apple-PI https://github.com/AmamiSora1228/MMLongEmbed https://github.com/Gen-Verse/Skill-Entropy-RL(Skill²-Bench https://github.com/ModalityDance/Awesome-Agent-as-a-Judge https://github.com/ai-boost/awesome-harness-engineering https://github.com/hkust-nlp/LOCA-bench https://github.com/maseval/MASEval https://github.com/pathwaycom/bdh https://github.com/run-llama/ExtractBench https://github.com/ulab-uiuc/AgentDebug(AgentDebug https://github.com/ulab-uiuc/AgentDebug(R56 https://github.com/umwyf/CRITICL(CritICL https://github.com/zjunlp/DataMind https://github.com/zjunlp/OneDayAgent https://github.com/zjunlp/OneDayAgent** https://huggingface.co/blog/security-incident-july-2026 https://huggingface.co/datasets/mercor/apex-agents https://huggingface.co/papers/2608.00677(OpenART https://huggingface.co/papers/2608.05747 https://huggingface.co/papers/2608.06867(LLMRouter https://huggingface.co/papers/2608.07545(DarwinX https://huggingface.co/papers/2608.08160(Can https://huggingface.co/papers/2608.09867(Stealing https://huggingface.co/papers/2608.10875(VibeLifeBench https://huggingface.co/papers/2608.11745(LiveAnimate https://huggingface.co/papers/2608.13552(PlayWorld https://huggingface.co/papers/2608.13560(AutoDesign https://huggingface.co/papers/2608.14905(ARFT https://huggingface.co/papers/2608.16859(HarnessEval-W https://huggingface.co/papers/2608.19269(Inspect https://huggingface.co/papers/2608.19269(What https://huggingface.co/papers/2608.25593(JIT-Agent https://huggingface.co/papers/2608.27455(CritICL https://hugobowne.substack.com/p/stop-overengineering-your-agent-harness https://hyper.ai/en/papers/2608.10875 https://lilianweng.github.io/posts/2026-07-04-harness/ https://lilianweng.github.io/posts/2026-07-04-harness/(邻接 https://lilianweng.github.io/posts/2026-07-04-harness/(非 https://maseval.readthedocs.io https://martinfowler.com/articles/engineering-practices-llm.html https://mirros-lab.github.io/HarnessEval-W https://mirros-lab.github.io/HarnessEval-W(HarnessEval-W https://mirros-lab.github.io/HarnessEval-W(R55新增 https://openreview.net/forum?id=EPQi0v0OxL(MMLongBench https://papers.cool/arxiv/2608.14905(ARFT https://randcorporation.github.io/judge-reliability-harness https://stolen-thoughts.com https://theaiengineer.substack.com/ https://usersim.ai/bibliography https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026 https://www.alphaxiv.org/abs/2608.05747 https://www.alphaxiv.org/abs/2608.09867(Stealing https://www.alphaxiv.org/abs/2608.25593(JIT-Agent https://www.braintrust.dev/articles/best-ai-agent-debugging-tools-2026 https://www.datadoghq.com/state-of-ai-engineering(R56 https://www.freecodecamp.org/news/ai-evaluation-engineering-build-a-production-grade-llm-evaluation-platform-handbook https://www.mercor.com/blog/introducing-apex-agents https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 https://www.vibeleaderboard.ai/intel/3eb3f658-723d-4c4c-92ce-0439fbd62c41 https://x.com/jerryjliu0/status/2090204727091093841(ExtractBench https://x.com/omarsar0/status/2038627572108743001(异步协调编码 https://xwang2775.github.io/horizon-leaderboard https://xwang2775.github.io/horizon-leaderboard(R56 https://xwang2775.github.io/horizon-leaderboard/ https://huggingface.co/papers/2608.26530(PILOT https://arxiv.org/abs/2608.26530(PILOT

R62 新增 3 条 URL(本轮核心立基础候选 + 平台):https://arxiv.org/abs/2608.27345(PAWBench R62 概率对齐世界建模评测立基础候选 ★★ HF Daily 8-30 82▲ paper_card 未建)+ https://github.com/Andrew0613/PAWBench(PAWBench 官方 GitHub R62 透明度确认 · vs R61 Agentic Game Dev GitHub 未公开)+ https://www.alphaxiv.org/abs/2608.27345(PAWBench alphaXiv 索引 R62);R62 0 删 URL = atomic missing=0 保留。

R63 新增 7 条 URL(HF Daily 8-31 立标池实测 + paper_card 邻接):https://arxiv.org/abs/2608.26005(VoiceMem 8-31 HF Daily #3 168▲ +2▲ inference-time 流式双脑记忆评测邻接)+ https://arxiv.org/abs/2608.19098(Open-MOPD 8-31 HF Daily #15 20▲ 新上榜)+ https://arxiv.org/abs/2608.23256(Next-Chunk Reasoning RL 8-31 HF Daily #14 21▲ 新上榜)+ https://arxiv.org/abs/2608.26872(Self-OPD 8-31 HF Daily #9 71▲ +2▲ 续立)+ https://arxiv.org/abs/2608.27260(ACE-perspective 8-31 HF Daily #10 61▲ 新上榜)+ https://arxiv.org/abs/2608.26200(GameWAM 8-31 HF Daily #12 43▲ +4▲ 续立)+ https://arxiv.org/abs/2608.27456(UrbanGround 8-31 HF Daily #7 100▲ +28▲ ★☆→★ 升档预备触发 paper_card 未建);R63 0 删 URL = atomic missing=0 保留。

R64 新增 1 条 arXiv ID:arXiv:2608.28281(LoopArena R64 ★ 邻接立基础候选 HF Daily 9-01 #4 87▲ 新上榜 paper_card 1142 R64 已建)= atomic missing=0 保留(R64 0 删 URL)

R64 新增 1 条 URL:https://arxiv.org/abs/2608.28281(LoopArena R64 paper_card 1142 已建;评测 loop 调度质量与 agent 执行能力各自贡献 vs 端到端成功率);R64 0 删 URL = atomic missing=0 保留

R63 沿用 1 条 URL(PAWBench 锚):https://arxiv.org/abs/2608.27345(PAWBench R62 概率对齐 + R63 立基础锚预备阈值触发 82▲→129▲ +47▲ 48h 暴涨 flyp 8-31 1550 critical-read 候选升级 ★★→★★★ 预备实测)。

R61 沿用 1 条 URL:https://arxiv.org/abs/2608.26530(PILOT R60 paper_card 1121 votes:25→27▲)+ https://huggingface.co/papers/2608.26530(PILOT)+ Martin Fowler https://martinfowler.com/articles/engineering-practices-llm.html(Evaluate the Evaluator R61 ★★ 工程实践锚)


3. 评测工程化:harness/judge/可信评测平台/CI gate/Harness自演进

3.1 Harness

R60 134 → 138 件;§3.5 harness 生态十一角延伸(R60 PILOT live self-improvement)

3.2 Judge

R60 94 → 96 件套;Judge 校准 38 → 39

3.3 评测平台与 CI Gate

R60 97 → 99 条(新增 Inspect Evals Census + CritICL)

3.4 EDD(Eval-Driven Development)

R60 107 → 110 件(新增 Inspect Evals Census + JIT-Agent + Agentic Game Dev)

3.5 Harness 生态候选十六角候选(R64 LoopArena loop engineering runtime controller 评测层 第 16 节点)

§3.5 harness 生态候选十四角:StateM(执行层)+ HarnessEval-W(评测层)+ HarnessRisk(安全层)+ Zetta ζ(具身 self-evolution 层)+ HSI(任务特定可热替换 harness 层)+ EnvHarness(环境侧 harness 化)+ HarnessEval-W cs.CV 视觉世界 harness 化 + AgentDebug 错误归因 harness 层 + Task-CoEvolve harness 高效优化层 + SecOPD token-level 安全防御层(R58 候选延伸) + Prefix Sliding test-time scaling 效率层(R59 候选延伸) = 候选十一角;PILOT live self-improvement harness 自演进评测层(R60 候选延伸:trace × live harness update 二阶单元 + 5 实例 5+ 时间点印证 + 27▲→30▲ 跨四日增速放缓) = 候选十二角;JIT-Agent JIT harness intelligence 层(R61 候选延伸:首个 purpose-built JIT harness 生成模型) = 候选十三角;PAWBench 概率对齐世界建模评测层(R62 候选延伸:50 scenarios × 8 physical mechanism groups + PAW-Calibration 25 + PAW-Coverage 25 + TVD ×100 + 11 video generators 实测 + GitHub Andrew0613/PAWBench 已公开透明) = 候选十四角候选;工具:uvx agent-harnesses-mcp

harness 生态候选十五角候选(R63 候选延伸 UrbanGround 空间智能评测层 第 15 节点):harness 候选十四角基础上 + UrbanGround(空间智能评测层 R63 候选延伸:城市空间智能体 benchmark + 局部感知到真实规模城市空间推理 + agent × 具身 AI 评测维度 + HF Daily 8-31 #7 100▲ +28▲ 48h 暴涨首次破百 + ★☆→★ 升档预备触发 + paper_card 未建 ⚠️) = 候选十五角候选;是否升级为正式第 15 节点候选待 R63 paper_card 新建 + P1 缺口补强;工具:uvx agent-harnesses-mcp


4. 维度化指标体系(R60 → R62)

R60新增维度(R57-R60 沿用,核心新增): - PILOT in the Loop / Live Self-Improvement for Long-Horizon Agents(arXiv:2608.26530,paper_card 1121 R60 新建 agent 主分类 evaluation 邻接) ★★ votes:25▲ HF Daily 8-29 #13 — self-improvement 应是 live 的;评测单元扩展到 trace × live harness update 二阶;与 Prime Agent(train-time)/ClawProBench(trace-runtime)形成 harness 自演进 × 时间维度三阶评测体系;评测方法学延革第 32 例预备

R61新增维度(沿用 R61 基线,详见 §6.97-§6.102 六节): - What Does an Evaluation License? / Inspect Evals Census(arXiv:2608.19269,paper_card 1133 R61 新建 llm-infra 主分类 evaluation 副分类) ★★★ work-queue Top15 #1 — 评测诚信立基础锚 - CritICL / Critique-based Test-Time Weak-to-Strong Generalization(arXiv:2608.27455,paper_card 1129 R61 新建 llm-infra 主分类 RAG-adjacent) ★★ HF Daily 8-29 沿用 GitHub umwyf/CRITICL 已公开 - JIT-Agent / Just-in-Time Harness Intelligence(arXiv:2608.25593,R61 新建 paper_card 未建) ★★ HF Daily 8-29 #5 107▲ - Agentic Game Dev / Verifiable Trajectory Data Engine(arXiv:2608.25518,paper_card 1125 R61 新建 agent 主分类 engineering 副分类) ★★ HF Daily 8-29 #1 119▲→134▲ 四日锁(R62 续立) - TaoLive / 让 Agent 随 Harness 共同进化(arXiv:2608.15763,R61 新建 paper_card 未建) ★ HF Daily 8-30 44▲ - Evaluate the Evaluator / Martin Fowler 工程实践(R61 新建 ★★ jay 8-29 llm-engineering-sieve)

R62新增维度: - PAWBench / Probabilistic Alignment for World Modeling(arXiv:2608.27345,R62 新建 paper_card 未建) ★★ HF Daily 8-30 82▲ — 评测诚信延伸 + 概率对齐世界建模评测立基础候选;首次把"概率对齐"作为世界模型 evaluation 的 distributional criterion;50 scenarios × 8 physical mechanism groups;PAW-Calibration(25 scenarios 解析或对称性参考分布)测试 probability-mass alignment(TVD ×100 指标,conditional TVD ×100);PAW-Coverage(25 scenarios 可枚举有效结果)测试 valid-support 恢复;11 video generators 实测,无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance(SOTA 最佳模型仅在部分机制组通过);GitHub Andrew0613/PAWBench 已公开透明(vs R61 Agentic Game Dev GitHub 仍未公开 ⚠️);发布 arXiv:2608.27345 cs.CV 2026-08-27 作者团队 Yuandong Pu 等 14 人(Meta/ByteDance/Kuaishou/THU/UCSC 跨机构);harness 候选十四角候选第 14 节点(概率对齐评测层);评测方法学延革第 37 例预备(继 R61 第 33-36 例后)

R62 立标池结构性变化:PAWBench HF Daily 82▲ 立基础候选 + VGI-Bench 双日锁 170▲(8-28 139▲→8-29 170▲→8-30 170▲ = +31▲ 续立)+ Agentic Game Dev 四日锁 134▲(8-27 119▲→8-28 132▲→8-29 134▲→8-30 134▲ = +15▲ 续立)+ WarpSAC 135▲ 三日续立(8-28 129▲→8-29 135▲→8-30 135▲ = +6▲ 续立)+ PILOT 22▲→27▲ 跨三日(R60 → R61 → R62 续立但 8-29 → 8-30 增速放缓至 +2 vs 前日 +7 进入可能衰减期)+ TTPO 64▲→69▲ 续立 + VGI-Bench 170▲ 立标极显著 v33 以来视频评测基准最高;ASI-Bench 连续 10 日跌出确认(R62 +1)

R63新增维度(沿用): - UrbanGround / 城市空间智能体评测(arXiv:2608.27456,R63 新建 paper_card 未建) ★→★★ 升档预备触发 — HF Daily 8-30 72▲→R63 100▲ +28▲ 48h 暴涨首次破百 ★☆→★ 升档;城市空间智能体 benchmark 从局部感知到真实规模城市空间推理;涉及 agent × 具身 AI 评测维度;评测方法学延革第 38 例预备;harness 生态候选十五角候选第 15 节点(空间智能评测层);flyp 立标等级升级 ★→★★ 预备触发实测(P1 paper_card 待建) - VGI-Bench 立标候选升级 ★★→★★★ 预备触发实测(arXiv:2608.19583,flyp 8-31 0950 critical-read) ★★→★★★ EMNLP 2026 Main 录用 + 微软 Jianfeng Gao + Michel Galley 顶配 + 数据代码已开源 + v33 以来视频生成评测基准立标信号第 1 高持续 173▲ 四日锁 + 与 R63 PAWBench 形成"过程 ↔ 分布"互补双锚 - Agentic Game Dev 票数极显著校准 ★★★ 立基础锚预备实测(arXiv:2608.25518,flyp 8-31 VGI-Bench + PAWBench 双精读触发,GitHub 仍未公开 ⚠️) — 180▲ 登顶 HF Daily 8-31 #1 v33 以来 agent 主分类立标信号最高 - PAWBench 立基础锚预备阈值触发实测(arXiv:2608.27345,flyp 8-31 1550 critical-read) ★★ 候选升级 ★★★ 预备触发实测 — 129▲ +47▲ 48h 暴涨 v33 以来同档涨幅第 1 + 顶配团队 + 概率对齐形式化创新 + GitHub 公开透明 - VoiceMem / Streaming Dual-Brain Memory for Real-Time Interaction(arXiv:2608.26005) ★★ HF Daily 8-31 #3 168▲ +2▲ 续立三日锁 — inference-time 实时交互式流式双脑记忆评测邻接 - Self-OPD / On-Policy Distillation without Teacher for Flow Matching Models(arXiv:2608.26872) ★ HF Daily 8-31 #9 71▲ +2▲ 续立 — 训练侧 mode collapse 缓解与评测侧 PAWBench 形成"训练 ↔ 评测"对位 - ACE-perspective / What Makes Good Agentic Data? LLM Agent Data Generation from ACE Perspective(arXiv:2608.27260) ★ HF Daily 8-31 #10 61▲ 新上榜 — agentic 数据质量评测邻接 - Open-MOPD / Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation(arXiv:2608.19098) ☆ HF Daily 8-31 #15 20▲ 新上榜 — 多教师蒸馏能力不均衡评测邻接 - Next-Chunk Reasoning RL / Next-Chunk Reasoning RL really outperform SFT?(arXiv:2608.23256) ☆ HF Daily 8-31 #14 21▲ 新上榜 — reasoning RL vs SFT 评测邻接 - GameWAM / World Action Model for Video Games(arXiv:2608.26200) ★ HF Daily 8-31 #12 43▲ +4▲ 续立 — 电子游戏 world action model 评测邻接

R64新增维度: - LoopArena / Benchmarking Models as Runtime Controllers for Loop Engineering(arXiv:2608.28281,R64 新建 paper_card 1142 已建 主分类 agent 副分类 evaluation) ★ HF Daily 9-01 #4 87▲ 新上榜 — 将模型作为 loop 工程运行时控制器评测;关键反方论点:一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力;把 harness 评测从「harness 进化 vs parallel sampling」(R57 §6.81-6.82 引 arXiv:2607.12227 Terminal-Bench 2.1)推向「loop 调度质量 vs agent 能力」可分解评测;harness 生态候选十六角候选第 16 节点(loop engineering runtime controller 评测层);评测方法学延革第 39 例预备

R64 立标池结构性变化:Agentic Game Dev 185▲ +5▲ 再创新高 v33 以来 agent 主分类最高纪录延续 + PAWBench 138▲ +9▲ 续升 立基础锚预备阈值仍满足(stephen 冲突 #6 v71 棒位前核实状态沿用)+ UrbanGround 106▲ +6▲ 续升 ★→★★ 升档预备观察持续 + LoopArena 87▲ 新上榜 harness 候选十六角候选第 16 节点 + TTPO 72▲ 维持 + AgenticArtifact 52▲ 新上榜 综述形态 eval 邻接 + DART-SD 61▲ 新上榜 多轮工具调用 Agent 自蒸馏 eval 邻接 + TaoLive 47▲ +1▲ 续立 + GameWAM 45▲ +2▲ 续立 + J-Zero 35▲ 新上榜 challenger-solver-judge 三元协同 eval 邻接 + PILOT 30▲ 维持 正式进入衰减期确认(无增长 衰减信号延续)+ VGI-Bench 9-01 未在 Top15(~173▲ 估算 立标极显著 维持)+ 立标池饱和度 v44-v64 廿一日连续 → v44-v65 廿二日连续(R64 +1)

R63 立标池结构性变化:PAWBench 129▲ +47▲ 48h 暴涨 立基础锚预备 + Agentic Game Dev 180▲ +46▲ 48h 暴涨 登顶 v33 以来 agent 主分类最高 + UrbanGround 100▲ +28▲ 48h 暴涨 ★☆→★ 升档预备 + VGI-Bench 173▲ 四日锁 续立立标极显著 + WarpSAC 137▲ 五日锁 +2▲ 续立立标中-高 + VoiceMem 168▲ 三日锁 +2▲ 续立 + PILOT 30▲ 正式进入衰减确认(27▲→30▲ 仅+3 vs 前日 +2 立标强度梯度变化延续)+ JIT-Agent 109▲ 续立 +2▲ + TTPO 73▲ 新上榜 + Self-OPD 71▲ +2▲ 续立 + ACE-perspective 61▲ 新上榜 + TaoLive 46▲ +2▲ 续立 + GameWAM 43▲ +4▲ 续立 + Next-Chunk RL 21▲ 新上榜 + Open-MOPD 20▲ 新上榜 + ASI-Bench 连续 11+ 日跌出确认 + 立标池双向锚第 21 日 PAWBench 129▲ +47▲ + Agentic Game Dev 180▲ +46▲ + UrbanGround 100▲ +28▲ 三峰周六暴涨实测触发 + 立标池饱和度 v44-v63 二十日连续 → v44-v64 廿一日连续(R63 +1)


5. 评测对象分化(R60 → R62)

R60 终态:93维+48邻接维+149子领域+1 件立基础锚候选(PILOT live self-improvement)

R61 终态:93→94 维 + 48→50 邻接维 + 149→152 子领域(R61 +1 +2 +3)+ 5 件立基础锚/邻接(Inspect Evals Census ★★★ + CritICL ★★ + JIT-Agent ★★ + Agentic Game Dev ★★ + TaoLive ★)+ 评测方法学延革第 33 例实测 + 第 34-36 例预备三件

R62 终态:94 → 95 维 + 50 → 50 邻接维(维持) + 152 → 153 子领域(R62 +1 维 +0 邻接维 +1 子领域)+ 1 件立基础锚候选(PAWBench 概率对齐世界建模评测 ★★)+ 评测方法学延革第 37 例预备(PAWBench 概率对齐分布级对齐立基础候选)

R63 终态:95 → 96 维(R63 +1:Human-Centric Intelligence Survey 锚定第 5 维 human-centric evaluation)+ 50 → 51 邻接维(R63 +1:UrbanGround 空间智能评测邻接)+ 153 → 155 子领域(R63 +2)+ 2 件立基础锚候选(R62 PAWBench 升预备 + R63 UrbanGround 升预备)+ 2 件立基础锚预备阈值触发(R63 PAWBench ★★→★★★ + Agentic Game Dev ★★→★★★ 预备)+ 评测方法学延革第 38 例预备(UrbanGround)+ 评测方法学社区内容补全二十三联 → 二十四联立标(R63 +1:flyp 双精读 VGI-Bench / PAWBench)

R64 终态:96 维(R64 +0)+ 51→52 邻接维(R64 +1:LoopArena loop 调度质量评测邻接)+ 155 子领域(R64 +0)+ 2 件立基础锚候选 + 1 件 ★ 邻接立基础候选(R64 LoopArena loop engineering runtime controller 评测层 第 16 节点)+ 评测方法学延革第 39 例预备(LoopArena)+ 立标池饱和度 v44-v65 廿二日连续(R64 +1)+ 反方预备 61 → 62 层(R64 +1:§2.5.64 LoopArena loop 调度与 agent 能力隔离协议工程可实现性)

立标池第 21→22 日(2026-08-31 → 2026-09-01):R64 单日 0 张 eval 专项 net-new paper_card(周一单日实测)+ 3 张 eval 邻接 net-new paper_card(LoopArena 1142 + AgenticArtifact 1143 + DART-SD 1149)+ 0 件 HF Daily eval 专项新上榜但 1 件 eval 邻接新上榜(LoopArena 87▲ #4)+ 3 件 R63 锚定条目票数再续升(Agentic Game Dev +5▲ / PAWBench +9▲ / UrbanGround +6▲)+ PILOT 30▲ 维持衰减确认(无增长): - Agentic Game Dev 2608.25518 9-01 HF Daily #1 185▲ +5▲ 再创新高 v33 以来 agent 主分类立标信号最高纪录延续 — R63 ★★→★★★ 预备实测维持(GitHub 仍未公开 ⚠️) - PAWBench 2608.27345 9-01 HF Daily #2 138▲ +9▲ 续升 立基础锚预备阈值仍满足 — stephen 冲突 #6 沿用 - UrbanGround 2608.27456 9-01 HF Daily #3 106▲ +6▲ 续升 ★→★★ 升档预备观察持续 - LoopArena 2608.28281 9-01 HF Daily #4 87▲ 新上榜 — harness 候选十六角候选第 16 节点 - TTPO 2608.27448 9-01 72▲ 维持(8-31 73▲ → 9-01 72▲) - DART-SD 2608.18524 9-01 #7 61▲ 新上榜 — 多轮工具调用 Agent 自蒸馏 eval 邻接(paper_card 1149 已建) - AgenticArtifact 2608.28122 9-01 #8 52▲ 新上榜 — Agentic 制品创建综述形态 eval 邻接(paper_card 1143 已建) - TaoLive 2608.15763 9-01 #9 47▲ +1▲ 续立 - GameWAM 2608.26200 9-01 #10 45▲ +2▲ 续立 - J-Zero 2608.26582 9-01 #12 35▲ 新上榜 — challenger-solver-judge 三元协同 eval 邻接 - PILOT 2608.26530 9-01 #13 30▲ 维持 衰减确认

harness 生态候选十五角 → 候选十六角(R64):StateM + HarnessEval-W + HarnessRisk + Zetta ζ + HSI + EnvHarness + HarnessEval-W cs.CV + AgentDebug + Task-CoEvolve + SecOPD + Prefix Sliding + PILOT live self-improvement + JIT-Agent JIT harness intelligence + PAWBench 概率对齐世界建模评测层 + UrbanGround 空间智能评测层 = 候选十五角(R63 锚定)+ LoopArena loop engineering runtime controller 评测层 = 候选十六角候选(R64 候选延伸);立标池饱和度 v44-v65 廿二日连续(R64 +1)

立标池第 20→21 日(2026-08-30 → 2026-08-31):R63 单日 0 张 net-new paper_card;v33 首次"周末单日 paper_card 净增 0 张实测"第 2 日 + 0 件 eval 专项 net-new paper_card + 5 件票数极显著暴涨实测(Agentic Game Dev +46▲ / PAWBench +47▲ / UrbanGround +28▲ / VGI-Bench +3▲ / WarpSAC +2▲)+ 6 件新上榜(JIT-Agent 109▲ 沿用 / TTPO 73▲ / Self-OPD 71▲ / ACE-perspective 61▲ / Next-Chunk RL 21▲ / Open-MOPD 20▲): - PAWBench 2608.27345 8-31 HF Daily #5 129▲ 48h 暴涨 +47▲ 立基础锚预备阈值触发(82▲→129▲ +47▲ v33 以来同档涨幅第 1)+ flyp 8-31 1550 critical-read 候选升级 ★★→★★★ 预备触发实测 — 概率对齐世界建模评测分布级对齐 = 评测方法学延革第 37 例预备实测触发;GitHub Andrew0613/PAWBench 已公开透明 vs R61 Agentic Game Dev 仍未公开 ⚠️ - VGI-Bench 2608.19583 8-31 HF Daily #2 173▲ 四日锁 续立+ flyp 8-31 0950 critical-read 候选升级 ★★→★★★ 预备触发实测(EMNLP 2026 Main 录用 + 微软 / UIUC 顶配) — 视频生成视觉智能评测 - Agentic Game Dev 2608.25518 8-31 HF Daily #1 180▲ 48h 暴涨 +46▲ 48h 暴涨 登顶 v33 以来 agent 主分类立标信号最高+ flyp 双精读触发 候选升级 ★★→★★★ 预备实测(但 GitHub 仍未公开 ⚠️ 维持 ★★)— grounded reward 信号 + world model data engine - UrbanGround 2608.27456 8-31 HF Daily #7 100▲ 首次破百 48h 暴涨 +28▲ ★☆→★ 升档预备触发 — 城市空间智能体评测 - WarpSAC 2608.24479 8-31 HF Daily #4 137▲ 五日锁 +2▲ 续立立标中-高 — RL off-policy scaling - VoiceMem 2608.26005 8-31 HF Daily #3 168▲ 三日锁 +2▲ 续立 — inference-time 流式双脑记忆评测邻接 - PILOT 2608.26530 8-31 HF Daily #13 30▲ 正式进入衰减确认(27▲→30▲ 仅+3 vs 前日 +2 立标强度梯度变化延续衰减信号) - JIT-Agent 2608.25593 8-31 HF Daily #6 109▲ 续立(107▲→持平 8-30→109▲ +2▲ R63) - TTPO 2608.27448 8-31 HF Daily #8 73▲ 新上榜 — test-time policy optimization - Self-OPD 2608.26872 8-31 HF Daily #9 71▲ +2▲ 续立 — Flow Matching on-policy distillation - ACE-perspective 2608.27260 8-31 HF Daily #10 61▲ 新上榜 — Agentic 数据生成 - GameWAM 2608.26200 8-31 HF Daily #12 43▲ +4▲ 续立 — 电子游戏世界动作模型 - TaoLive 2608.15763 8-31 HF Daily #11 46▲ +2▲ 续立(44▲→46▲) - Next-Chunk RL 2608.23256 8-31 HF Daily #14 21▲ 新上榜 — reasoning RL vs SFT - Open-MOPD 2608.19098 8-31 HF Daily #15 20▲ 新上榜 — 多教师 on-policy distillation

harness 生态候选十四角 → 候选十五角(R63):StateM + HarnessEval-W + HarnessRisk + Zetta ζ + HSI + EnvHarness + HarnessEval-W cs.CV + AgentDebug + Task-CoEvolve + SecOPD + Prefix Sliding + PILOT live self-improvement + JIT-Agent JIT harness intelligence + PAWBench 概率对齐世界建模评测层 = 候选十四角候选;UrbanGround 空间智能评测层 R63 候选延伸 = 候选十五角候选;立标池饱和度 v44-v63 二十日连续 → v44-v64 廿一日连续(R63 +1 日)

立标池第 19→20 日(2026-08-29 → 2026-08-30):R62 单日 0 张 net-new paper_card;v33 首次"周末单日 paper_card 净增 0 张"实测触发 + 1 件 HF Daily 新上榜(PAWBench 82▲ 立基础候选)+ 3 条票数续立校准: - PAWBench 2608.27345 8-30 HF Daily #6 82▲ 新晋立基础候选 — 概率对齐世界建模评测分布级对齐 = 评测方法学延革第 37 例预备预备;GitHub Andrew0613/PAWBench 已公开透明 - VGI-Bench 2608.19583 8-30 HF Daily #1 170▲ 双日锁 续立极显著(139▲→170▲→170▲ = +31▲) - Agentic Game Dev 2608.25518 8-30 HF Daily #4 134▲ 四日锁 续立(119▲→132▲→134▲→134▲ = +15▲) - WarpSAC 2608.24479 8-30 HF Daily #3 135▲ 三日续立(129▲→135▲→135▲ = +6▲) - PILOT 2608.26530 8-30 HF Daily #13 27▲ 增速放缓(25▲→27▲ 仅 +2 vs 前日 +7,进入可能衰减期) - TTPO 2608.27448 8-30 HF Daily #8 69▲ 续立(64▲→69▲) - CritICL 2608.27455 8-30 HF Daily 立标级(沿用) - JIT-Agent 2608.25593 8-30 HF Daily #5 107▲ 续立(107▲→持平) - TaoLive 2608.15763 8-30 HF Daily #11 44▲ 续立(43▲→44▲) - ASI-Bench 连续 10 日跌出确认(R62 +1)

harness 生态候选十三角 → 候选十四角(R62):StateM + HarnessEval-W + HarnessRisk + Zetta ζ + HSI + EnvHarness + HarnessEval-W cs.CV + AgentDebug + Task-CoEvolve + SecOPD + Prefix Sliding + PILOT live self-improvement + JIT-Agent JIT harness intelligence = 候选十三(已锚)+ PAWBench 概率对齐世界建模评测层 R62 候选延伸 = 候选十四角候选;立标池饱和度 v44-v62 十九日连续 → v44-v63 二十日连续(R62 +1 日)


6. 评测方法学批判(R60 → R62)

§6.1-§6.96:沿用 R25-R59 + R60(见 archive)

§6.97 What Does an Evaluation License? / Inspect Evals Census 评测诚信 claim-replay layer(R61 新增 ★★★ 立基础锚)

核心:评测 artifacts(task + scorer + reported metric)声明"前向计算"但未必授权该指标所附 claim——因为 replay 所需历史证据与替代语义可能是 unbound;通过 frozen substrate D + grounded family F + claim query q + resulting identified set 形式化"missing claim-replay layer" 关键实测:对 124 个 Inspect Evals 单元 pinned commit 机械审查 → 110 在确定性推理前就停(缺历史证据/语义 grounding)= 系统性 meta-evaluation 审计预备 立标信号:paper_card 1133 R61 新建 llm-infra 主分类 evaluation 副分类;work-queue Top15 #1;评测方法学延革第 33 例实测 R61 链首;v33 以来"评测诚信 / claim-replay layer"首次独立预备 关键区分:与 §6.91 Skill Issue 评测设计正交;与 §6.92 TTPO 评测对象正交;与 §6.93 GUI-Primitives 评测粒度正交;与 R55 EvalMetaCheck(meta-evaluation 理论层)形成"理论 × 实证"互补

§6.98 CritICL / Critique-based Test-Time Weak-to-Strong Generalization(R61 新增 ★★ 邻接)

核心:利用"同族弱模型的失败模式"作为 critique 信号;GitHub 已公开(umwyf/CRITICL);与 TTPO(arXiv:2608.27448 R59 邻接 多数票伪标签)和 Prefix Sliding(arXiv:2608.26070 R59 邻接 token 重要性)共同构成 test-time scaling 方法学三轴 立标信号:paper_card 1129 R61 新建 llm-infra 主分类 RAG-adjacent;HF Daily 8-29 沿用;评测方法学延革第 34 例预备

§6.99 JIT-Agent / Just-in-Time Harness Intelligence(R61 新增 ★★ 邻接立基础候选)

核心:首个 purpose-built 模型用于 JIT harness generation;"harness intelligence 是 trainable, transferable, compounding 维度";DeepSeek-V4-Flash + JIT-Agent vs GPT-5.6 on DeepSearchQA +9.1 / OdysseyBench +4.3 / GLM-5.2 +20.2 立标信号:HF Daily 8-30 #5 107▲(持平);paper_card 未建;评测方法学延革第 35 例预备;harness 生态候选十四角候选第 13 节点(JIT harness intelligence 层)

§6.100 Agentic Game Dev / Verifiable Trajectory Data Engine(R61 新增 ★★ 邻接立基础候选)

核心:Reward-Signal Scarcity 是世界模型 scaling 的真正瓶颈;代码 Agent 可执行性 = grounded reward;HF Daily 8-30 #4 134▲ 四日锁(8-27 119▲→8-28 132▲→8-29 134▲→8-30 134▲ = +15▲ 续立) 立标信号:paper_card 1125 R61 新建 agent 主分类 engineering 副分类;HF Daily 8-30 134▲ 四日锁;评测方法学延革第 36 例预备

§6.101 TaoLive / 让 Agent 随 Harness 共同进化(R61 新增 ★ 邻接立基础候选)

核心:Agent 与 harness 协同演化的数字人 Agent 技术报告;HF Daily 8-30 #11 44▲ 立标信号:HF Daily 8-30 #11 44▲(续立 43▲→44▲);paper_card 未建

§6.102 Evaluate the Evaluator / Martin Fowler 工程实践(R61 新增 ★★ 邻接立基础候选)

核心:Inference 和 Testing 解耦;Auto-evaluator 视觉产物;验证评分系统 false positive/negative 率 立标信号:Martin Fowler 知名软件工程作者;jay 8-29 llm-engineering-sieve ★★★★★

§6.103 PAWBench / Probabilistic Alignment for World Modeling(R62 新增 ★★ 邻接立基础候选)

核心:首次把"概率对齐"(probabilistic alignment)作为世界模型 evaluation 的 distributional criterion;50 scenarios × 8 physical mechanism groups;PAW-Calibration(25 scenarios) 测试 probability-mass alignment(conditional TVD ×100 指标,70/30 模型分布 vs 50/50 参考分布 = 20,exact match = 0,lower is better);PAW-Coverage(25 scenarios) 测试 valid-support 恢复(valid-support recovery 百分比,higher is better) 关键实测:11 video generators 系统性对照,无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance;SOTA 最佳模型仅在部分机制组通过 gate;测试形式:fixed initial observation + action → 重复 rollout → PAWEval 转换为 empirical outcome distributions → 比较两个对齐方向 形态 position:world model 评测第三个独立锚(继 Agentic Game Dev 评测 reward signal 质量 + WarpSAC 评测 off-policy RL 后);与 R61 Agentic Game Dev 形成"reward grounded vs probability alignment"评测对象对位 关键区分:与 §6.100 Agentic Game Dev 形成"reward signal 可验证性 vs outcome distribution 对齐"对位;与 §6.97 Inspect Evals Census 形成"评测对象对齐(claim vs metric) vs 评测结果对齐(outcome distribution)"两轴;与 R57 SWE-bench Pro(评测方差主要来自 harness)正交(PAWBench 控制 harness,聚焦模型本身) 立标信号:HF Daily 8-30 #6 82▲(8-29 74▲→8-30 82▲ +8▲ 续立);paper_card 未建;评测方法学延革第 37 例预备;harness 生态候选十四角候选第 14 节点(概率对齐评测层)

R64 续升校准:HF Daily 9-01 #2 138▲ +9▲(vs R63 +47▲ 涨速放缓但持续立基础锚预备状态);stephen 冲突 #6 PAWBench 立标追踪 = 「flyp 立标极显著升级判断待 v71 棒位前核实」状态沿用;★★→★★★ 候选升级判断待 v71 棒位前核实 反方意义:§2.6.69 失败模式层(PAWBench 终端 outcome 是否足以捕捉 trajectory-level dynamics,arXiv:2608.27345 PDF §6 limitations 明确承认:terminal outcome 让分布比较 tractable 但不能完整捕捉 trajectory-level dynamics 或 intermediate physical processes;finite rollouts 估计误差 + 提升 budget 提升 reliability 但提升 evaluation cost);§2.5.59 反方预备层(PAWBench vs Agentic Game Dev 边界模糊 — 评测对象都涉及 reward signal 但角度不同);立标池第 20 日 PAWBench HF Daily 双向锚

§6.104 PILOT 增速放缓 衰减期预警(R62 沿用 R60 ★★ 立基础锚)

核心:PILOT 8-29 → 8-30 票数从 25▲ 增至 27▲,增速从 +7(8-28→8-29)放缓到 +2(8-29→8-30),进入可能衰减期;5 实例 5+ 时间点印证是否仍然成立需核实最新数据 立标信号:R60 立基础锚;R62 衰减期预警观察

§6.105 VGI-Bench 候选升级 ★★→★★★ 预备触发实测(R63 flyp 0950 critical-read)

核心:VGI-Bench(arXiv:2608.19583)候选升级 ★★→★★★ 预备触发实测 — EMNLP 2026 Main 录用 + 微软 Jianfeng Gao + Michel Galley + UIUC Xuan He 顶配 + 数据代码已开源(HF + GitHub Apache-2.0)+ 三向差异化设计(photorealistic + process-sensitive + calibrated difficulty)系统论证 + 评测覆盖广(9 video + 5 image models) + 失败模式诊断有启发性(later steps mainly refine early hypotheses rather than correct reasoning errors 与 Self-OPD 形成训练 ↔ 评测双锚) 关键实测:Seedance 2.0 仅 51.0% — 当前 SOTA 视频生成模型的"视觉智能"半数以下;27 tasks / 810 instances;4 互斥 task domains + 7 非互斥 skill tags 反方与缺口(P1 待补):视觉智能定义边界模糊(生成能力 vs 推理能力混淆);人类 baseline 缺失(51.0% 看起来低但无法判断难题 vs 模型弱);variance / 多次运行未报告(扩散模型生成质量方差大,不报告 variance 等同于不报告 confidence interval);评测协议对模型厂商不公(Seedance 2.0 / Veo 3.1 / Sora 2 闭源 API 内部生成策略不一);calibrated difficulty 预生成过滤机制不透明 立标信号:HF Daily 8-31 #2 173▲ 四日锁(8-28 139▲ → 8-29 170▲ → 8-30 170▲ → 8-31 173▲ = +34▲ v33 以来视频生成评测基准立标信号第 1 高持续);flyp 0950 critical-read 候选升级 ★★→★★★ 预备触发实测;评测方法学延革第 38 例预备(与 UrbanGround 并列) 关键区分:与 §6.103 PAWBench 形成"过程敏感 ↔ 分布级"互补双锚;与 §6.100 Agentic Game Dev 形成"reward grounded vs visual intelligence"评测对象对位;与 R57 Self-OPD 形成"训练 ↔ 评测"双向交叉

§6.106 PAWBench 候选升级 ★★→★★★ 预备触发实测(R63 flyp 1550 critical-read)

核心:PAWBench(arXiv:2608.27345)候选升级 ★★→★★★ 预备触发实测 — Yu Qiao(Shanghai AI Lab)+ Jinbo Xing(Kuaishou)+ Xi Chen 顶配 13 人团队(Meta/ByteDance/Kuaishou/THU/UCSC 跨机构)+ 概率对齐形式化创新(video benchmark 领域稀缺)+ Calibration + Coverage 双 track 设计 + 数据集 + 代码已开源(HF + GitHub Apache-2.0)+ 项目主页 https://pawbench.github.io 已公开透明(vs R61 Agentic Game Dev 仍未公开 ⚠️) 关键实测:50 scenarios × 8 physical mechanism groups(dice rolling / bouncing balls / domino chain / 多体碰撞 / 流体行为 / 折射反射 / 弹性形变 / 抛体运动);PAW-Calibration 25 scenarios 解析或对称性参考分布 + PAW-Coverage 25 scenarios valid outcome 可枚举;11 video generators 系统性对照,无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance;SOTA 最佳模型仅在部分机制组通过 gate 反方与缺口(P1 待补):人类 baseline 缺失(整篇论文未报告人类在该 benchmark 上的分布对齐表现)

R64 续升校准:HF Daily 9-01 #2 138▲ +9▲ 持续 vs R63 +47▲ 涨速放缓;stephen 冲突 #6 状态沿用;★★→★★★ 候选升级判断待 v71 棒位前核实(PDF §6 limitations + 社区冷启动 + 录用状态未明 P1 三项缺口沿用);outcome schema 完备性(rubric-based scoring 依赖"valid outcome"的可枚举性);8 机制组选择偏置(选择标准未公开"为什么是这 8 个而非其他");闭源模型评测对厂商不公(11 个模型中闭源占多数);社区冷启动(GitHub 仓库 5 stars / 0 forks 第三方复现/扩展尚未启动);录用状态未明(arXiv preprint 无 ICLR/NeurIPS/CVPR/ICML 投稿/录用公开信息) 立标信号:HF Daily 8-31 #5 129▲ 48h 暴涨 +47▲(82▲→129▲)v33 以来同档涨幅第 1;flyp 1550 critical-read 候选升级 ★★→★★★ 预备触发实测;评测方法学延革第 37 例预备 R62 沿用 关键区分:与 §6.105 VGI-Bench 形成"分布级 ↔ 过程敏感"互补双锚;与 §6.100 Agentic Game Dev 形成"概率对齐 ↔ reward grounded"对位;与 v68 §2.39.244 FIRM-Video 同属 outcome schema 设计方法学

§6.107 UrbanGround / 城市空间智能体评测(R63 新增 ★→★★ 升档预备触发)

核心:从局部感知到真实规模城市空间推理的智能体 benchmark;填补具身 AI × 城市空间推理评测空白;评测方法学延革第 38 例预备(继 R62 第 37 例 / R63 §6.105 VGI-Bench 第 38 例并列) R63 关键校准:HF Daily 8-31 #7 100▲ 48h 暴涨 +28▲(72▲→100▲)★☆→★ 升档预备触发 — 首次破 100▲ 门槛;立标等级 ★→★★ 升档预备

R64 续升校准:HF Daily 9-01 #3 106▲ +6▲ 续升;★→★★ 升档预备观察持续;paper_card 仍未建 ⚠️ P1 缺口 立标信号:v33 首次 ★☆→★ 升档预备触发;paper_card 未建 ⚠️ P1;harness 生态候选十五角候选第 15 节点(空间智能评测层)

§6.108 Gaming Without an Attacker / Benchmark Fingerprinting(R63 新增 ★ 邻接)

核心:选择压力下 LLM 驱动搜索中的基准指纹化;held-out probes 仅在不可枚举轴上保持有效性;门控必须衡量保留集性能,而非仅正确性;迁移率只有附带每类失败机制评级才可解读 立标信号:paper_card 895 R43 已建(R63 归口化锚定 §6.97 邻接 ★);主分类 evaluation;OpenAlex backfill 2026-08-30 关键区分:与 §6.97 Inspect Evals Census(claim-replay layer)同属评测诚信/基准设计方法学批判方向;R63 归口化锚定确认评测延革预备接续案例

§6.109 Human-Centric Intelligence Survey(R63 新增 第 5 维锚定)

§6.110 LoopArena / Loop Engineering Runtime Controller Benchmark(R64 新增 ★ 邻接立基础候选) 核心:LoopArena(arXiv:2608.28281)将模型作为 loop 工程的运行时控制器评测;关键反方论点:一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力;把 harness 评测从「harness 进化 vs parallel sampling」(R57 §6.81-§6.82 引 arXiv:2607.12227)推向「loop 调度质量 vs agent 能力」可分解评测 立标信号:HF Daily 9-01 #4 87▲ 新上榜;paper_card 1142 R64 已建(主分类 agent / 副分类 evaluation / 形态 benchmark);评测方法学延革第 39 例预备;harness 候选十六角候选第 16 节点(loop engineering runtime controller 评测层);反方预备 §2.5.64:loop 调度与 agent 能力隔离协议的工程可实现性 — loop 与 agent 耦合度(如动态 prompt injection)abstract 未给;loop pattern 4 类(progress note / verification / budget allocation / stop condition)PDF §3 待 9-10 核 反方与缺口(P0 待补):loop vs agent 分解协议 abstract 未给具体方法;评测集规模与 baseline abstract 未给;loop 与 agent 耦合度动态 prompt injection 隔离工程可实现性未给;loop pattern 4 类标签体系边界是否有重叠未给;GitHub 仓库可复现度未核实 立标信号:v33 首次「loop 调度 vs agent 能力可分解评测」独立预备;R64 ★ 邻接立基础候选;harness 候选十六角候选第 16 节点 关键区分:与 §6.99 JIT-Agent(JIT harness intelligence)同属 harness generation 但 LoopArena 是「loop 调度质量」评测对象更上位;与 §6.103 PAWBench(概率对齐 world modeling 评测)形成「loop controller 评测 vs world modeling 评测」垂直互补;与 arXiv:2607.12227(Rethink Terminal-Bench 2.1)形成「harness 进化算力等价 vs loop 调度 vs agent 能力分解」三轴 核心:基础模型时代以人为本的智能综述;全谱系的人类上下文分类法,六个相互关联的层级:① 可观测主体(视觉外观 + 空间几何)② 动态行动者(运动学动态 + 交互建模)③ 处境化 Agent(世界仿真 + 具身智能) 立标信号:paper_card 1067 R63 新建 evaluation 主分类 survey 形态(OpenAlex 2026-08-31 backfill);评测对象分化第 5 维锚定(human-centric evaluation);评测方法学延革第 38 例预备(与 UrbanGround / VGI-Bench 并列)


7. 共识、争议与开放问题

7.1 共识(50→55→56 条,R62+1)

(沿用 R61 共识 R61-1 至 R61-5 全部,详见 archive)

共识 R62-1:world model 评测三向耦合预备 — PAWBench(arXiv:2608.27345 概率对齐分布级评测)+ Agentic Game Dev(arXiv:2608.25518 grounded reward signal 可验证性评测)+ WarpSAC(arXiv:2608.24479 off-policy RL scaling 评测)三个独立机制分别从"分布对齐""reward grounded""scaling 可达性"三个角度拓展 world model evaluation;与 Inspect Evals Census(评测诚信 claim-replay layer)+ CritICL + JIT-Agent + TaoLive 共同构成 R61-R62 评测方法学延革第 33-37 例预备预备合流;GitHub 透明度上 PAWBench 已公开 vs Agentic Game Dev 仍未公开 ⚠️

共识 R64-1:harness 评测向 loop vs agent 可分解阶段跃迁预备 — LoopArena(arXiv:2608.28281 loop engineering runtime controller 评测 R64 ★ 邻接立基础候选) + PAWBench(arXiv:2608.27345)+ VGI-Bench(arXiv:2608.19583)+ Agentic Game Dev(arXiv:2608.25518)+ WarpSAC(arXiv:2608.24479)+ JIT-Agent(arXiv:2608.25593)六机制从「loop 调度」「分布对齐」「过程敏感」「reward grounded」「scaling」「JIT harness」六角度拓展;v33 首次「harness 评测向 loop vs agent 可分解阶段跃迁」独立预备;harness 候选十六角候选第 16 节点

共识 R63-1:视频生成评测双锚稳态化 — PAWBench(arXiv:2608.27345 概率对齐分布级评测 评测方法学延革第 37 例预备)+ VGI-Bench(arXiv:2608.19583 过程敏感 + calibrated difficulty 评测方法学延革第 38 例预备)+ Agentic Game Dev(arXiv:2608.25518 grounded reward signal 可验证性评测 评测方法学延革第 36 例预备)+ WarpSAC(arXiv:2608.24479 off-policy RL scaling 评测)四个独立机制分别从"分布对齐""过程敏感""reward grounded""scaling 可达性"四个角度拓展 world model evaluation;两两组合形成"过程 ↔ 分布"互补 + "reward ↔ scaling"互补 + "概率 ↔ reward"对位;flyp 8-31 VGI-Bench + PAWBench 双精读触发 v33 以来首次完整"视频生成评测互补双锚"成型;GitHub 透明度上 PAWBench 已公开 vs Agentic Game Dev 仍未公开 ⚠️

7.2 争议(116→117 条,R62+1)

(沿用 R61 争议 R61-1 至 R61-5 全部,详见 archive)

争议 R62-1:PAWBench 终端 outcome 评测充分性边界 — arXiv:2608.27345 PDF §6 limitations 明确承认 terminal outcome 让分布比较 tractable 但不能完整捕捉 trajectory-level dynamics 或 intermediate physical processes;finite rollouts 估计误差与 evaluation cost 之间的张力;立标票数中(82▲)但 vs VGI-Bench 170▲ / VoiceMem 166▲ 立标信号梯度差异大

争议 R63-1:PAWBench outcome schema 完备性 — arXiv:2608.27345 rubric-based scoring 依赖"valid outcome"的可枚举性;人类 baseline 缺失(整篇论文未报告人类在该 benchmark 上的分布对齐表现);8 机制组选择偏置(选择标准未公开"为什么是这 8 个而非其他");立标票数快速增长(82▲→129▲ +47▲ 48h)但 GitHub 仓库 5 stars / 0 forks 社区冷启动

争议 R63-2:Agentic Game Dev grounded reward 大规模可重复性 — arXiv:2608.25518 "代码 Agent 可执行性 = grounded reward"的可重复性在大规模 RL 后训练下的稳定性如何;180▲ 登顶 v33 以来 agent 主分类最高但 GitHub 仍未公开 ⚠️ 严守 ★★ 不升 ★★★

争议 R63-3:UrbanGround 城市代理评测泛化边界 — arXiv:2608.27456 "局部感知到真实规模城市"评测大规模可重复性 + 城市代理分布 vs 真实城市部署分布对位 + 闭源模型评测对厂商不公

争议 R64-1:LoopArena loop 调度 vs agent 能力隔离协议工程可实现性 — arXiv:2608.28281 "一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力"在工程上是否可解耦;loop 与 agent 耦合度(动态 prompt injection)abstract 未给;loop pattern 4 类评估维度 PDF §3 待 9-10 核;GitHub 仓库可复现度未核实

7.3 开放问题(161→167 条,R62+6)

(沿用 R61 开放 R61-1 至 R61-6 全部,详见 archive)

开放 R62-1:PAWBench(arXiv:2608.27345)PDF §3-§6 验证 50 scenarios 具体清单 + 8 physical mechanism groups 划分依据 + 11 video generators baseline + TVD ×100 计算细节 + GitHub Andrew0613/PAWBench 工程化验证 + paper_card 新建(截止 9-10,P1) 开放 R62-2:PILOT(arXiv:2608.26530)票数衰减核实 — 27▲ 仅+2 vs 前日 +7,是否进入衰减期;5 实例 5+ 时间点印证是否仍然成立(截止 9-5,P1) 开放 R62-3:JIT-Agent(arXiv:2608.25593)harness 生成评测协议 PDF 核实 + paper_card 新建(截止 9-10,P1) 开放 R62-4:TaoLive(arXiv:2608.15763)PDF 核实 harness 共同进化具体方法学 + paper_card 新建(截止 9-10,P2) 开放 R62-5:WarpSAC(arXiv:2608.24479)paper_card 新建(截止 9-10,P2) 开放 R62-6:VGI-Bench(arXiv:2608.19583)paper_card 新建(截止 9-10,P2)

开放 R63-1:PAWBench(arXiv:2608.27345)候选升级 ★★→★★★ 确认 — flyp 6 项 P1 缺口补强截止 9-30(人类 baseline + outcome schema 完备性 + 8 机制组选择偏置 + 闭源评测对厂商不公 + 社区冷启动 + 录用状态);GitHub Andrew0613/PAWBench 工程化验证 + paper_card 新建(截止 9-10,P1)

开放 R63-2:VGI-Bench(arXiv:2608.19583)候选升级 ★★→★★★ 确认 — flyp 4 项 P1 缺口补强截止 9-15(人类 baseline + variance 多次运行 + calibrated difficulty 不透明 + 闭源评测);EMNLP 2026 camera-ready 人类实验补充可能性 + paper_card 新建(截止 9-10,P2)

开放 R63-3:Agentic Game Dev(arXiv:2608.25518)GitHub 仓库三源核实 + 候选升级 ★★→★★★ 确认(截止 9-15,P0) — 180▲ 登顶 v33 以来 agent 主分类最高但 GitHub 仍未公开 ⚠️;stephen noon check 建议 evening 棒 arXiv + Google + GitHub 三源核对

开放 R63-4:UrbanGround(arXiv:2608.27456)paper_card 新建 + 立标等级 ★→★★ 升档确认(截止 9-10,P1);★★★ 升档候选升级预备触发需 P1 缺口补强

开放 R63-5:Human-Centric Intelligence Survey(arXiv:2608.18184)paper_card 已建归口化 + §5 评测对象分化第 5 维锚定确认(截止 9-15,P2)

开放 R63-6:Gaming Without an Attacker(arXiv:2608.08722)paper_card 已建归口化 + §6.108 邻接锚定确认(截止 9-10,P2)

开放 R63-7:PILOT(arXiv:2608.26530)正式衰减观察 — 30▲ vs R62 27▲ 仅+3 vs R61 同期 +2 vs R61 同期 +7 = R63 正式进入衰减期;5 实例 5+ 时间点印证是否仍然成立(截止 9-5,P1)

开放 R64-1:LoopArena(arXiv:2608.28281)PDF §3 loop 调度 vs agent 能力分解协议公开 + 4 类 loop pattern(progress note / verification / budget allocation / stop condition)评测维度边界 + baseline 名单 + GitHub 仓库可复现度核实(截止 9-10,P0)

R63 七项硬约束:a)9-1 09:00 HF Daily 复核 PAWBench 是否续立 + Agentic Game Dev 维持 #1 + UrbanGround 维持 100▲ + VGI-Bench 续立;b)PAWBench PDF 6 项 P1 缺口补强(截止 9-30);c)VGI-Bench PDF 4 项 P1 缺口补强(截止 9-15);d)Agentic Game Dev GitHub 仓库三源核实(截止 9-15);e)UrbanGround paper_card 新建 + §5 维度锚定(截止 9-10);f)PILOT 正式衰减观察(截止 9-5);g)Human-Centric Gaming paper_card 归口化锚定(截止 9-15)

R62 六项硬约束:a)8-31 09:00 HF Daily 复核 PAWBench 是否续立 + VGI-Bench 维持 170▲ + Agentic Game Dev 维持 134▲;b)PAWBench PDF §3-§6 验证(截止 9-10,P1);c)JIT-Agent harness 生成评测协议 PDF 核实(截止 9-10,P1);d)PILOT 票数衰减核实(截止 9-5,P1);e)VGI-Bench paper_card 新建(截止 9-10,P2);f)TaoLive / WarpSAC paper_card 新建(截止 9-10,P2)


8. 趋势预判(2026 H2,R60 → R62)

R60 趋势主线(沿用 R59 5 条 + R60 1 条,见 archive):多语言 self-play 跨语言技能不变性评测 + test-time policy optimization 多数票伪标签 + 空间关系绑定失败诊断 + test-time scaling 效率优化 + 视频生成视觉智能探测 + PILOT live self-improvement trace × live harness update

R61 趋势主线(+5,沿用 R61):21. 评测诚信 / claim-replay layer 立基础锚(Inspect Evals Census ★★★);22. critique-based test-time evaluation(CritICL ★★);23. JIT harness intelligence(JIT-Agent ★★);24. Agent-as-Data-Engine grounded reward 信号(Agentic Game Dev ★★);25. harness 共同进化(TaoLive ★)

R62 趋势主线(+1):

  1. 概率对齐世界建模评测分布级对齐预备:PAWBench(arXiv:2608.27345)★★ HF Daily 8-30 82▲ — 50 scenarios × 8 physical mechanism groups;PAW-Calibration(conditional TVD ×100)+ PAW-Coverage(valid-support recovery %);11 video generators 系统性对照无完美模型;GitHub Andrew0613/PAWBench 已公开透明;与 Agentic Game Dev(reward signal 可验证性)+ WarpSAC(off-policy RL scaling)形成 world model 评测三向耦合预备;harness 候选十四角候选第 14 节点(概率对齐评测层);评测方法学延革第 37 例预备

R63 趋势主线(+2):

  1. 视频生成评测互补双锚稳态化 + 候选升级预备实测触发:PAWBench(arXiv:2608.27345)+47▲ 48h 暴涨 129▲ 立基础锚预备 + VGI-Bench(arXiv:2608.19583)173▲ 四日锁 + Agentic Game Dev(arXiv:2608.25518)+46▲ 48h 暴涨 180▲ 登顶 v33 以来 agent 主分类最高;flyp 8-31 双精读 VGI-Bench(EMNLP 2026 Main 录用 + 微软 Jianfeng Gao)+ PAWBench(Shanghai AI Lab / Kuaishou / Meta / ByteDance / UCSC 顶配团队)触发 ★★→★★★ 升档预备观察;v33 以来首次"视频生成评测互补双锚 + 候选升级预备"成型;评测方法学延革第 37-38 例预备实测触发

  2. 城市空间智能体评测空间分布对位立基础预备:UrbanGround(arXiv:2608.27456)★→★★ 升档预备 +28▲ 48h 暴涨首次破百 100▲ — 城市空间智能体 benchmark 从局部感知到真实规模城市空间推理填补具身 AI × 城市空间推理评测空白;harness 候选十五角候选第 15 节点;评测方法学延革第 38 例预备(与 VGI-Bench 并列)

  3. harness 评测向 loop vs agent 可分解阶段跃迁立基础预备:LoopArena(arXiv:2608.28281)★ HF Daily 9-01 #4 87▲ 新上榜 — 将模型作为 loop 工程运行时控制器评测,把 harness 评测从「harness 进化 vs parallel sampling」推向「loop 调度质量 vs agent 能力」可分解评测;harness 候选十六角候选第 16 节点;评测方法学延革第 39 例预备(继 R62 PAWBench 第 37 例 / R63 VGI-Bench 第 38 例 / R63 UrbanGround 第 38 例并列后);paper_card 1142 已建


9. 平台、基础设施与生态

9.1 评测平台总览

32 平台(R60 0 新增)

9.2 评测 harness/benchmark 套件

252 件(R60 +5:PILOT)+ 5 件(R61 新增:Inspect Evals Census + CritICL + JIT-Agent + Agentic Game Dev + TaoLive)+ 1 件(R62 新增:PAWBench)+ 1 件(R63 新增:UrbanGround)= 259 件(R63)+ 1 件(R64 新增:LoopArena) = 260 件(R64)

9.3 评测方法学 toolkit

114 件(R60 +5:PILOT)+ 邻接 8 件 + 5 件(R61 新增)+ 1 件(R62 新增)+ 1 件(R63 新增:VoiceMem / Self-OPD / ACE-perspective / GameWAM / Open-MOPD / Next-Chunk RL 沿用 + UrbanGround 升档 = 邻接 9 件)= 121 件 + 邻接 9 件(R63)+ 邻接 1 件(R64 新增:LoopArena) = 122 件(R64)

9.4 EDD 案例库

115 件(R60 +3:PILOT)+ 5 件(R61 新增)+ 1 件(R62 新增:PAWBench)+ 1 件(R63 新增:UrbanGround)= 122 件(R63)+ 1 件(R64 新增:LoopArena) = 123 件(R64)

9.5 评测平台对比

94→95 维(R62 PAWBench)→96 维(R63 +1:Human-Centric)+ 50→51 邻接维(R63 +1:UrbanGround)→ 52 邻接维(R64 +1:LoopArena)

9.6 Harness 生态候选十五角候选(R63 UrbanGround 空间智能评测层 第 15 节点)

StateM(执行层)+ HarnessEval-W(评测层)+ HarnessRisk(安全层)+ Zetta ζ(具身 self-evolution 层)+ HSI(任务特定可热替换 harness 层)+ EnvHarness(环境侧 harness 化 R54 新增)+ HarnessEval-W cs.CV 视觉世界 harness 化 R55 新增 + AgentDebug 错误归因 harness 层 R56 候选 + Task-CoEvolve harness 高效优化层 R57 延伸 = 候选九角;SecOPD token-level 安全防御层 R58 候选延伸 = 候选十角候选;Prefix Sliding test-time scaling 效率层 R59 候选延伸 = 候选十一角候选;PILOT live self-improvement harness 自演进评测层 R60 候选延伸 = 候选十二角候选;JIT-Agent JIT harness intelligence 层 R61 候选延伸 = 候选十三角候选;PAWBench 概率对齐世界建模评测层 R62 候选延伸 = 候选十四角候选;UrbanGround 空间智能评测层 R63 候选延伸 = 候选十五角候选(R63 已锚定);LoopArena loop engineering runtime controller 评测层 R64 候选延伸 = 候选十六角候选;工具:uvx agent-harnesses-mcp


历史 arXiv ID 回引(R00-R61 沿用):完整列表见 §2.8.2(单一长行,atomic missing=0 保留 154 arXiv IDs + 全部 URL)。


10. 反问与遗留清单(R60 → R62)

10.1 本主题内反问

135→136 条(R62 +1)+ 136→139 条(R63 +3);R64 +1 争议(LoopArena loop 调度 vs agent 能力隔离协议工程可实现性)= 140 条(R64)

10.2 待补/待核验(R62 +6,共 234 条)

R60待补/待核验(沿用,见 archive):PILOT §2-3 验证 trace × live harness update 二阶单元具体 API + live harness update 的 evaluator runtime 接口(截止 9-10,P1)

R61 新增 6 条(沿用):Inspect Evals Census(arXiv:2608.19269)PDF §4 验证 + CritICL GitHub 实证 + JIT-Agent PDF §3-5 harness 生成评测协议核实 + Agentic Game Dev grounded reward 信号可重复性 + TaoLive PDF 核实 + Evaluate the Evaluator auto-evaluator visual artifacts 具体方法

R62 新增 6 条:PAWBench(arXiv:2608.27345)PDF §3-§6 验证 50 scenarios + 8 mechanisms + 11 baselines + TVD ×100 计算 + GitHub Andrew0613/PAWBench 工程化验证 + paper_card 新建(截止 9-10,P1);PILOT 票数衰减核实 — 27▲ 仅+2 vs 前日 +7,5 实例 5+ 时间点印证是否仍然成立(截止 9-5,P1);JIT-Agent harness 生成评测协议 PDF 核实 + paper_card 新建(截止 9-10,P1);TaoLive PDF 核实 harness 共同进化具体方法学 + paper_card 新建(截止 9-10,P2);WarpSAC paper_card 新建(截止 9-10,P2);VGI-Bench paper_card 新建(截止 9-10,P2);paper_card 已建:Inspect Evals Census 1133 / CritICL 1129 / Agentic Game Dev 1125;paper_card 未建:JIT-Agent / TaoLive / WarpSAC / PAWBench / VGI-Bench / Skill Issue 1116 已建;paper_card 未建累计:6 件(JIT-Agent/TaoLive/WarpSAC/PAWBench/VGI-Bench/HORIZON 2604.11978 / Benchmarking the Benchmarks 2608.06329 / NOLLI 2608.04397 / OneDayAgent 2608.05013 / Skill-Native LLM 2608.05139 / MameLoshnLM 2608.05850 R43 沿用)

R63 新增 7 条:PAWBench 候选升级 ★★→★★★ 确认(6 项 P1 缺口截止 9-30);VGI-Bench 候选升级 ★★→★★★ 确认(4 项 P1 缺口截止 9-15);Agentic Game Dev GitHub 仓库三源核实(截止 9-15,P0);UrbanGround paper_card 新建 + §5 维度锚定(截止 9-10,P1);Human-Centric Intelligence Survey §5 评测对象第 5 维锚定确认(截止 9-15,P2);Gaming Without an Attacker §6.108 邻接锚定确认(截止 9-10,P2);PILOT 正式衰减观察(截止 9-5,P1)

R64 新增 1 条:LoopArena(arXiv:2608.28281)PDF §3 loop 调度 vs agent 能力分解协议公开 + 4 类 loop pattern 评测维度边界 + baseline 名单 + GitHub 仓库可复现度核实(截止 9-10,P0);paper_card 已建 R64:LoopArena 1142 / AgenticArtifact 1143 / DART-SD 1149;累计未建仍 6 件(PAWBench / WarpSAC / VGI-Bench / UrbanGround / JIT-Agent / TaoLive) paper_card 已建:Inspect Evals Census 1133 / CritICL 1129 / Agentic Game Dev 1125 / Human-Centric Intelligence Survey 1067 / Gaming Without an Attacker 895 R43 paper_card 未建:PAWBench / WarpSAC / VGI-Bench / UrbanGround / JIT-Agent / TaoLive / Skill Issue 1116 已建 paper_card 未建累计:6 件(PAWBench / WarpSAC / VGI-Bench / UrbanGround / JIT-Agent / TaoLive)

10.3 与其他主题交叉(R60 +1 + R61 +5 + R62 +1,共 63 件)

R62 新增 1 件:PAWBench(arXiv:2608.27345,概率对齐世界建模评测分布级对齐评测邻接)→multimodal.md(world model 评测方法论候选延伸 §2.39 候补级)+ agent.md(world model 三向耦合预备)+ llm-infra.md(world model RL 后训练 grounded reward 路径延展)

R63 新增 1 件:UrbanGround(arXiv:2608.27456,城市空间智能体评测,具身 × 城市空间推理评测邻接)→multimodal.md(world model 评测方法论候选延伸 + 城市具身空间)+ agent.md(world model 三向耦合预备 + 城市空间代理评测)+ llm-infra.md(world model RL 后训练 grounded reward 路径延展 + 城市推理基础设施)

R64 新增 1 件:LoopArena(arXiv:2608.28281,loop engineering runtime controller 评测)→ agent.md(loop 工程运行时控制器评测邻接 + harness 候选十六角候选第 16 节点)+ llm-infra.md(后端诱导 harness 化评测邻接 + INFERENCEBENCH 沿用)


本次变更

  • 2026-09-01 16:50(R64,本轮新增):针对 2026-08-31 16:50 → 2026-09-01 16:50 24h 窗口期材料(tom 9-01 evaluation-e1prep 15.4KB / 0 张 eval 专项 net-new paper_card / 3 张 eval 邻接 net-new paper_card:LoopArena 1142 + AgenticArtifact 1143 + DART-SD 1149 / 1 件新 arXiv ID LoopArena arXiv:2608.28281)聚焦 「LoopArena 2608.28281 ★ HF Daily 9-01 #4 87▲ eval 邻接新上榜(将模型作为 loop 工程运行时控制器评测,分解 loop 调度质量与 Agent 执行能力 vs 端到端成功率,补 harness 候选十六角候选第 16 节点)+ Agentic Game Dev +5▲ 185▲ 再创新高 v33 以来 agent 主分类最高纪录延续(GitHub 未公开 ⚠️)+ PAWBench +9▲ 138▲ 续升 立基础锚预备(stephen 冲突 #6 v71 棒位前核实状态沿用)+ UrbanGround +6▲ 106▲ 续升 ★→★★ 升档预备 + PILOT 30▲ 维持衰减确认 + 0 件 eval 专项 net-new + 立标池饱和度 v44-v65 廿二日连续 + 评测方法学延革第 39 例预备(LoopArena)+ §6.110 LoopArena loop 工程 vs agent 能力可分解评测立基础预备」母题。具体变更:(i)整篇覆盖写入 —— 主候选 .evaluation-candidate.md;(ii)首行更新:R64 一句话(96 字 ≤120 字);(iii)§0 R63 五十三重 → R64 五十四重(LoopArena + 三件锚定续升 + harness 候选十六角 + 延革第 39 例 + PILOT 维持衰减 + 饱和度 v44-v65 八件合流);(iv)§2.8.2 R63 + R64 1 件=177 IDs / R64 新增 1 URL = atomic missing=0;(v)§3.5 harness 候选十五角 → 候选十六角(LoopArena 第 16 节点);(vi)§4 维度矩阵 R64 +1(LoopArena ★)+ R63 4 件延续;(vii)§5 96 维(R64 +0)+ 51→52 邻接维(R64 +1:LoopArena)+ 155 子领域(R64 +0)+ 立标池第 22 日 0 张 eval 专项 + 3 张 eval 邻接;(viii)§6.110 LoopArena(R64 新增 ★)+ §6.100/§6.103/§6.106/§6.107 R64 续升校准 + §2.5.64 LoopArena loop 调度 vs agent 能力隔离协议工程可实现性;(ix)§7.1/§7.2/§7.3 R64+1/+1/+1(共识 R64-1:loop vs agent 可分解跃迁 / 争议 R64-1:loop 调度 vs agent 隔离协议 / 开放 R64-1:PDF §3 loop vs agent 分解协议公开);(x)§8 趋势 +1(第 29 条:LoopArena loop vs agent 可分解评测立基础预备);(xi)§9 harness/benchmark 260 件 + toolkit 122 件 + EDD 123 件 + 评测平台对比 96 维 + 52 邻接维;(xii)§10.1 反问 139 → 140 + §10.2 待核验 +1 + §10.3 跨主题 +1;(xiii)字数:主文件 77745 字节 ≈ 75.9KB <80KB → 候选 ≤80KB(R64 全文紧凑增量 §6.110 / §7 / §8 / §10);(xiv)R64 核心:LoopArena 2608.28281 ★ 87▲ 新上榜 = harness 评测向 loop vs agent 可分解跃迁 + R63 3 件锚定条目 +5/+9/+6▲ 续升 + Agentic Game Dev 185▲ #1 v33 以来 agent 最高 + PAWBench 138▲ #2 立基础预备持续 + UrbanGround 106▲ #3 ★→★★ 升档预备 + harness 候选十六角候选第 16 节点 + 延革第 39 例 + PILOT 30▲ 衰减确认 + cron 信号全消化(tom 9-01 + stephen + spark + jay + flyp + paper_cards 1134-1156 + 1 件新 arXiv ID = atomic missing=0 验证通过);R63 详细段已归档至 archive evaluation-changelog.md 第 R63 段;本轮 R64 主文件保留 R63 简略段对照

  • 2026-08-31 16:50(R63,简略段,前两轮对照):聚焦 PAWBench 129▲ 立基础锚预备(82→129 +47 +flyp 候选升级预备实测)+ Agentic Game Dev 180▲ 48h 暴涨登顶(flyp 双精读预备 但 GitHub 未公开 维持 ★★)+ UrbanGround 100▲ 首次破百 ★→★★ 升档 + VGI-Bench 173▲ 四日锁(flyp 预备)+ WarpSAC 137▲ 五日锁 + PILOT 30▲ 正式衰减 + paper_cards 归口化锚定 2 件(Human-Centric Survey 1067 + Gaming Without Attacker 895)+ 饱和度 v44-v64 廿一日(R63 +1)+ harness 候选十五角(UrbanGround 第 15)+ 评测方法学第 38 例预备 + 立标池双向锚第 21 日三峰暴涨触发;R63 详细段已归档至 archive evaluation-changelog.md 第 R63 段

  • 2026-08-30 16:50(R62,简略段,前一轮对照):针对 2026-08-29 16:50 → 2026-08-30 16:50 24h 窗口期材料(tom 8-30 1540 evaluation-e1prep + tom 8-30 0900 HF Daily 15 件 + flyp 8-30 0950 + stephen 8-30 1245 noon check + 1 次 web_search PAWBench 一手溯源)聚焦 「PAWBench 2608.27345 ★★ HF Daily 8-30 82▲ 立基础候选(评测方法学延革第 37 例预备)+ VGI-Bench 170▲ 双日锁 续立立标极显著(v33 以来视频评测基准立标信号最高 +31▲)+ Agentic Game Dev 134▲ 四日锁 续立(+15▲)+ WarpSAC 135▲ 三日续立(+6▲ RL off-policy scaling)+ PILOT 27▲ 增速放缓进入可能衰减期(8-29 → 8-30 +2 vs 前日 +7)+ paper_card 待建 4 件警示(JIT-Agent / TaoLive / WarpSAC / PAWBench)+ 立标池饱和度 v44-v63 二十日连续(R62 +1)+ §2.6 失败模式反方体系 63 → 65 层(R62 +2)+ 反方预备 56 → 58 层(R62 +2)+ harness 生态候选十三角 → 候选十四角候选(PAWBench 概率对齐评测层 第 14 节点 R62 候选延伸)+ 评测方法学社区内容补全二十二联 → 二十三联立标(R62 +1:PAWBench)」母题。变更:(i)整篇覆盖;(ii)首行 R62 一句话(118 字);(iii)§0 R61→R62 五十二重;(iv)§2.8.2 R61 全列表 +R62 1 件=155 IDs / 228 URLs(R62 +1 ID +3 URL);(v)§3.5 harness 候选十三角 → 候选十四角;(vi)§4 R62 +1(PAWBench);(vii)§5 R62 +1 维 +1 子领域 +立标池第 20 日;(viii)§6.103 PAWBench 立基础候选新增 + §6.104 PILOT 增速放缓 衰减期预警;(ix)§7.1/§7.2/§7.3 R62+1/+1/+6;(x)§8 趋势 +1(第 26 条);(xi)§9 harness/benchmark 257 → 258 + toolkit 119 → 120 + EDD 120 → 121 + 评测平台对比 94→95;(xii)§10.1/§10.2/§10.3 R62+1/+6/+1;(xiii)字数 58985(57.6KB) ≤80KB(R62 全文紧凑增量 atomic missing=0)