evaluation · E1 预消化简报(2026-08-23)

信源检查记录

本次覆盖: - work-queue.md ✓(Top 15 无 evaluation 专项净新增;ASI-Bench 已衰减跌出;无 eval 专项) - inbox/jay(8/21~8/23):无 eval 专项 inbox 件 ✓;Jay 8-23 工程 benchmarks substack 含 eval 邻接高价值条目(ClawVM / MemoHarness / From Prompts to Contracts)✓ - inbox/flyp(8/21~8/23):2026-08-23 09:50 Zetta+SemaPLC critical-read(eval 邻接双锚)✓;2026-08-22 22:50 Harness-Evolution-Eval-Rethink critical-read(eval 方法学批判)✓ - inbox/spark(8/21~8/23):无 eval 专项 inbox 件 ✓ - inbox/stephen(8/21~8/23):无 eval 直接增量 ✓ - inbox/tom(8/22~8/23):HF Daily Aug 23(EnvHarness 246▲ #1 + SemComp-Bench 155▲ #2 + Zetta 141▲ #3 + SemaPLC 115▲ #4 + FACET 112▲ #5 + Co-RL 91▲ #6 + ASI-Bench 衰减跌出确认)✓;Aug 23 Tom radar 下午版(The Embedder's Dilemma eval 邻接 + Context Leakage + HSI + QuoteBench + Task-CoEvolve Cool Papers 线索)✓;Aug 22 evaluation-e1prep R54 基线 ✓;Aug 23 rag-e1prep(非 eval 专项)✓ - paper_cards 近 3 天新卡(989~1057 范围):992(HarnessEval-W,evaluation 主分类,paper_card 新建 8-23,eval 专项 net-new)✓;998(Large Discovery Models,evaluation 主分类,paper_card 新建 8-23,eval 专项 net-new)✓;1043(Quantifying Benchmark Optimization in ASR,evaluation 主分类 benchmark,paper_card 已建 8-21邻接)✓;1050(NARU,evaluation 主分类 benchmark,paper_card 已建邻接)✓;1054(TinyCast,evaluation 主分类,paper_card 已建邻接)✓;其余无 eval 专项 - Cool Papers 8-23:Task-CoEvolve(2608.20169,harness 高效优化,paper_card 未建,eval 邻接新线索)✓ - knowledge/evaluation.md R54 基线 ✓


增量摘要

本轮(E1-R55,窗口 2026-08-22 下午 ~ 2026-08-23 下午)eval 主题 eval 专项 net-new paper_card 为 2 条(HarnessEval-W + Large Discovery Models),另有 5 条 eval 邻接候选含新线索(Zetta+SemaPLC critical-read 出炉 + Harness-Evolution-Eval-Rethink 方法学批判落盘 + Task-CoEvolve 新出 + The Embedder's Dilemma eval 邻接 + ClawVM/MemoHarness)。ASI-Bench 在 HF Daily Aug 23 确认跌出 top 15(连续攀升后衰减确认),ASI 超对齐评测信号中断。立标池无结构性变化,但关键方法学张力出现。


条目一:HarnessEval-W — 将世界模型评测 Agent 化(eval 专项 net-new paper_card ★★★,paper_card 新建 8-23)

来源paper_cards/992-2608-16859.md(paper_card 新建,2026-08-23);inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json(来源追溯);HF Daily 未上榜 arXiv2608.16859 主分类:evaluation;形态:benchmark

要点

  • 核心问题:世界模型(world model)评测依赖人工设计评测协议,扩展性差且评测结果难以跨模型可比——能否将 LLM 生态中成熟的 harness 范式引入世界模型评测?
  • 核心方案:HarnessEval-W——将评测 pipeline 本身 agent 化,在 330 个评估用例上对 18 个代表性世界模型进行评测;引入"agentified evaluation pipeline"概念
  • 关键贡献:首次将 harness 范式系统性地从 LLM 评测迁移到 world model 评测;18 个世界模型 × 330 个用例的规模化评测提供了跨模型可比基准
  • 立标信号:paper_card 992 新建(2026-08-23);HF Daily 未上榜(8-23 票数未入选);与 v54 沿用的 StateM / EnvHarness / Zetta / SemaPLC 同属 harness 体系;立标等级 候选级中档 ★★★

与 knowledge/evaluation.md R54 现有脉络的关系

  • 现有脉络:R54 §2.207 评测方法学 23 元组(HarnessEval-W 尚未在 R54 基线中);harness 生态体系(StateM / HarnessEval-W / HarnessRisk / Zetta ζ / HSI / EnvHarness / SemaPLC);HarnessEval-W 补充"world model 评测 harness 化"方向,是 harness 自演进谱系的第 6 条分支(world model harness)
  • 建议归入节:§2.207 评测方法学 23 元组 → 第 24 元组候选新增(HarnessEval-W,world model agentified evaluation);harness 生态体系 → 第 6 节点候选(HarnessEval-W,world model harness)

矛盾 / 待核实

  • 具体是哪 18 个世界模型、330 个用例的评测维度分布需 PDF 核验
  • agentified evaluation pipeline 的具体实现(用了哪些 sub-agent、如何保证评测一致性)需核实
  • 与 SemComp-Bench(视频生成语义任务完成度)是否重叠或互补

arXiv 列表

  • 2608.16859(✅ paper_card 992 新建;eval 专项 net-new;候选级中档 ★★★)

条目二:Large Discovery Models — 经验驱动的开放式搜索评测(eval 专项 net-new paper_card ★★★,paper_card 新建 8-23)

来源paper_cards/998-2608-15669.md(paper_card 新建,2026-08-23);inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json(来源追溯) arXiv2608.15669 主分类:evaluation;形态:method

要点

  • 核心问题:开放域发现(open-ended discovery)任务的评测——模型在开放式搜索空间中如何权衡探索与利用?现有评测难以捕捉"意外发现"的质量
  • 核心方案:Large Discovery Model(LDM)——将生成模型与贝叶斯非参数奖励代理模型耦合,产生感知不确定性的价值信号引导候选生成与选择;经验驱动(empirically-grounded)的循环架构
  • 关键贡献:对"发现质量"提供可量化的评测框架——不确定性感知价值填补了"探索-利用"评测空白;首次在 discovery 任务上提供端到端可比较的评测指标
  • 立标信号:paper_card 998 新建(2026-08-23);HF Daily 未上榜;与 R54 的 ASI-Bench / MissDiag 同属"评测方法学新维度"方向;立标等级 候选级中档 ★★★(评测方法学新维度)

与 knowledge/evaluation.md R54 现有脉络的关系

  • 现有脉络:R54 §2.1 评测方法学 32 轴(无"开放式发现/探索-利用"评测轴);§2.207 评测方法学 23 元组;Large Discovery Models 填补"开放式发现任务评测"空白,属于 §2.1 方法学轴第 33 轴候选(开放式发现/探索-利用评测轴)
  • 建议归入节:§2.1 评测方法学 32 轴 → 第 33 轴候选新增(Large Discovery Models,开放式发现/探索-利用评测方法);§2.207 邻接 → LDM(经验驱动的开放式搜索评测框架)

矛盾 / 待核实

  • 贝叶斯非参数奖励代理模型的具体形式需 PDF 核验
  • 与现有 MCTS / AlphaFold-type discovery 评测的具体差异
  • 330 个用例是否与 HarnessEval-W 的 330 个用例有重叠

arXiv 列表

  • 2608.15669(✅ paper_card 998 新建;eval 专项 net-new;候选级中档 ★★★)

条目三:Zetta ζ + SemaPLC critical-read — 真实执行是最终裁判(eval 邻接 ★★★,flyp 8-23 精读落盘)

来源inbox/flyp/2026-08-23-0950-Zetta-and-SemaPLC-closed-loop-harness-critical-read.md(flyp critical-read,2026-08-23);HF Daily 8-23 Zetta 141▲ #3 + SemaPLC 115▲ #4 延续信号 arXiv:Zetta 2608.16590;SemaPLC 2608.18565

要点

  • Zetta ζ:三时间尺度闭环具身 harness(action-frequency 高频治理层 / rollout 级 critic-recovery / validation-gated skill 更新);base policy 冻结,runtime 在线演化 code-based critics 和 recovery skills;LIBERO-Pro 90.8% / RoboCasa 93.6%,11.1× 推理加速
  • SemaPLC:三层验证门(specification check / compilation check / behavior check);动态行为 trace 比对(22.4→52.2 分差)揭示静态评测高估问题
  • 双锚共构叙事:"真实执行而非自评或静态验证才是 Agent 能力的最终裁判"——对 coding-agent leaderboard 设计是负面暗示(verifier-rich 但与真实运行环境脱钩)
  • 与 Harness-Evolution-Eval-Rethink 的张力:Rethink 在 Terminal-Bench(命令式任务)上证明 harness evolution 算力等价下不优于 sequential refinement;但 Zetta/SemaPLC 在真实物理/工业 runtime 上仍有效——两者实验环境不同,结论不直接矛盾,但共同指向"评测协议必须与真实执行环境对齐"

与 knowledge/evaluation.md R54 现有脉络的关系

  • 现有脉络:R54 §2.207 评测方法学 23 元组(Zetta ζ 第 20 / SemaPLC 第 22);harness 生态体系;本次 critical-read 补充了方法学层面的"真实执行"判定逻辑,填补了 R54 中有 paper_card 但无 critical-read 落盘的空白
  • 建议归入节:§2.207 评测方法学邻接 → Zetta ζ + SemaPLC("真实执行是最终裁判"方法学主张);R54 未归口条目 → 建议归口

矛盾 / 待核实

  • Zetta 11.1× 加速的基线定义(是否同 base policy + 不开 harness)需 PDF §4 核验
  • SemaPLC 65 个项目上下文任务样本量小 + 数据集私有风险需核实
  • 两篇论文均在 verifier-rich setting 下,verifier-free 部署下优势是否缩水

arXiv 列表

  • 2608.16590(✅ paper_card 1027 已建;eval 邻接;HF Daily 141▲ #3)
  • 2608.18565(✅ paper_card 已建;eval 邻接;HF Daily 115▲ #4)

条目四:Harness-Evolution-Eval-Rethink — 控制预算后 harness evolution 并不稳定超越序贯优化(eval 邻接 ★★★,flyp 8-22 精读落盘)

来源inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md(flyp critical-read,2026-08-22);arXiv 2607.12227(2026-07-14) arXiv2607.12227

要点

  • 核心发现:控制了 inference/feedback 预算后,harness evolution 并不稳定地超越 parallel sampling 或 sequential refinement;在 hold-out 任务上泛化有限
  • 关键切片:无 unit-test feedback 时 harness evolution 输给简单 test-time scaling;三模型平均 pass@1 在 Terminal-Bench 2.1 上测试
  • 方法学贡献:提出"公平预算协议"——每个方法收到等价的任务反馈、推理预算和轨迹/编辑面(edit surface)
  • 与 Zetta/SemaPLC 的关系:在同一问题(harness evolution 有效性)的两端——Terminal-Bench 2.1 上 Rethink 否定了 harness evolution 的稳定优势;但 Zetta/SemaPLC 在真实物理/工业 runtime 上仍有优势;关键差异是实验环境(命令式任务 vs 物理/工业 runtime)和 verifier 可用性

与 knowledge/evaluation.md R54 现有脉络的关系

  • 现有脉络:R54 无此条目;Rethink 填补"评测方法学批判"方向,属于 §2.207 评测方法学邻接(harness evolution 有效性边界),是 Zetta/SemaPLC 的对立方
  • 建议归入节:§2.207 评测方法学邻接 → Harness-Evolution-Eval-Rethink(harness evolution 有效性边界批判);与 Zetta/SemaPLC 配对 → "真实执行 vs Terminal-Bench"双面锚

矛盾 / 待核实

  • 单基准依赖(Terminal-Bench 2.1 是命令式任务,harness 自由度天然小)——在 WebArena/OSWorld 上是否可复现
  • "无 verifier 时弱于 parallel sampling"是否循环论证

arXiv 列表

  • 2607.12227(✅ 来源追溯;eval 邻接;flyp critical-read 8-22 落盘)

条目五:The Embedder's Dilemma — LLM vs Embedding 评测范式各有所长(eval 邻接 ★★,Tom radar 8-23 高价值)

来源inbox/tom/2026-08-23T1440-agent-rag-longcontext-radar.md(Tom radar 高价值条目 #1);paper_cards/1055-2608-12875.md(rag 主分类 eval 邻接) arXiv2608.12875 主分类:rag;副分类:evaluation

要点

  • 核心发现:37 任务(分类/STS/聚类/检索/配对分类),10 个 LLM × 26 个 embedding 模型(118M–14B);最佳 LLM Gemini 3.1 Pro 77.6 vs 最佳 embedding 77.2,仅差 0.4 分
  • 关键洞察:LLM 在推理密集型检索上领先,embedding 模型在分类任务上领先——两种范式"有效持平"但各有所长;这对 RAG 评测设计有直接意义:benchmark 必须按任务类型分层,而非用单一总分排名
  • 立标信号:Tom radar 高价值条目;paper_card 1055 已建;HF Daily 未上榜(8-23)

与 knowledge/evaluation.md R54 现有脉络的关系

  • 现有脉络:R54 §2.2 评测对象 80 维(无"embedding vs LLM 评测范式比较"专项);§2.1 评测方法学 32 轴;The Embedder's Dilemma 填补"RAG/检索中 embedding 范式 vs LLM 范式评测比较"空白,属于 §2.1 方法学轴邻接
  • 建议归入节:§2.1 评测方法学邻接 → The Embedder's Dilemma(embedding vs LLM 评测范式比较);§2.2 评测对象邻接 → RAG 检索评测维度

矛盾 / 待核实

  • 37 个任务的具体分布和规模需核实
  • 成本数据($/query)是否被纳入比较

arXiv 列表

  • 2608.12875(✅ paper_card 1055 已建;rag 主分类 eval 邻接;Tom radar 高价值条目)

条目六:ClawVM / MemoHarness / From Prompts to Contracts — Agent 生产评测工程三件(eval 邻接 ★★,Jay 8-23 工程 substack)

来源inbox/jay/2026-08-23-1450-jay-engineering-benchmarks-harness-substack.md(Jay 8-23 下午工程二次筛选) arXiv:ClawVM 2604.10352(EuroMLSys '26);MemoHarness 2607.14159;From Prompts to Contracts 2607.08028

要点

  • ClawVM(2604.10352,EuroMLSys '26):将 VM 思想引入 agent harness,stateful tool-use 的虚拟内存管理;引用 Long-MemEval benchmark;首次把虚拟内存管理引入 harness 设计
  • MemoHarness(2607.14159):harness 本身可被搜索/适应的新范式;区分于 training-time artifact;概念前沿但无源码,暂存作线索
  • From Prompts to Contracts(2607.08028):企业 agent 可审计性 harness;提供 JSONL eval results;生产可审计性是 2026 agent 工程盲点

与 knowledge/evaluation.md R54 现有脉络的关系

  • 现有脉络:R54 §2.207 评测方法学 23 元组(无生产可审计性 harness 专项);ClawVM 补充"stateful tool-use harness 虚拟内存管理"邻接;MemoHarness 暂存作线索;From Prompts to Contracts 补充"企业级可审计 harness"邻接
  • 建议归入节:§2.207 评测方法学邻接 → ClawVM(虚拟内存 harness);From Prompts to Contracts(企业可审计 harness)

矛盾 / 待核实

  • ClawVM 是 EuroMLSys '26 论文,有正式 DOI,但需核实 GitHub 是否公开
  • MemoHarness 无源码,需等 GitHub 出现再入知识库

arXiv 列表

  • 2604.10352(ClawVM,EuroMLSys '26,eval 邻接,Jay substack 高价值)
  • 2607.08028(From Prompts to Contracts,eval 邻接,Jay substack 线索)

综合:立标池双向锚第 10 日信号(R55 窗口)

HF Daily 8-23 立标池双向锚进入第 10 日: - EnvHarness 8-22 235▲ → 8-23 246▲(#1,+11▲ 续立极显著)——维持锚,但增幅收窄(+11▲ vs 前日 +11▲,两日等幅) - SemComp-Bench 8-22 155▲ → 8-23 155▲(#2,+0▲ 持平)——连续第二日持平,衰减信号持续 - Zetta ζ 8-22 140▲ → 8-23 141▲(#3,+1▲ 微强)——维持高位,flyp critical-read 确认方法学价值 - SemaPLC 8-22 114▲ → 8-23 115▲(#4,+1▲ 微强)——维持,flyp critical-read 确认动态行为评测价值 - FACET 8-22 107▲ → 8-23 112▲(#5,+5▲ 中等)——延续,稳升 - ASI-Bench 8-22 跌出 top 15 → 8-23 跌出确认——连续两日跌出,信号衰减确认 - Co-RL 8-23 新晋 #6 91▲——新晋邻接,多智能体强化学习协同推理 - StateM 无 8-23 数据(8-20 374▲ 维持衰减预判)

立标池双向锚第 10 日:EnvHarness 246▲ 锚1 + Zetta/SemaPLC/FACET 三件微强续立 + Co-RL 新晋邻接 + ASI-Bench 衰减确认 = 立标池无结构性新增,harness 生态方向持续高位但未扩张


综合:矛盾与待核实清单

  1. arXiv:2608.16859(HarnessEval-W):paper_card 992 ✅ 新建;eval 专项 net-new ★★★;world model agentified evaluation
  2. arXiv:2608.15669(Large Discovery Models):paper_card 998 ✅ 新建;eval 专项 net-new ★★★;经验驱动开放式搜索评测
  3. Zetta ζ(2608.16590)+ SemaPLC(2608.18565):flyp 8-23 critical-read 落盘;"真实执行是最终裁判"叙事 vs Harness-Evolution-Eval-Rethink 在 Terminal-Bench 上的否定结论——关键矛盾:两派实验环境不同(物理/工业 runtime vs Terminal-Bench 命令式任务),结论不直接对立,但共同指向"评测协议必须与真实执行对齐"
  4. Harness-Evolution-Eval-Rethink(2607.12227):flyp 8-22 critical-read 落盘;无 unit-test feedback 时 harness evolution 输给 parallel sampling;在 hold-out 上泛化有限;单基准依赖(Terminal-Bench)批判有效,但向 WebArena/OSWorld 的迁移性待核实
  5. The Embedder's Dilemma(2608.12875):paper_card 1055 ✅ 已建;rag 主分类 eval 邻接;Tom radar 高价值条目;Benchmark 必须按任务类型分层(分类 vs 检索)而非单一总分
  6. ClawVM(2604.10352):EuroMLSys '26;eval 邻接;Jay substack 高价值;Long-MemEval benchmark 引用
  7. MemoHarness(2607.14159):无源码,暂存作线索;eval 邻接
  8. ASI-Bench(2608.17271):8-23 跌出确认;paper_card ❌ 仍未建(跨轮遗留)
  9. Is this Citation on Point?(2608.12571):eval.md 仍未归口(跨轮 R45→R55 遗留)
  10. CPI-Bench(2608.14546):eval.md 仍未归口(跨轮遗留)
  11. Forecast Collapse(2608.14106):eval.md 仍未归口(跨轮遗留)
  12. MobileMem(2608.13606):eval.md 仍未归口(跨轮遗留)
  13. ClawGym II(2608.16798):paper_card ❌ 仍未建(eval 邻接,跨轮未建卡)
  14. 信息满足度(2608.14457):paper_card ❌ 仍未建(eval 邻接,跨轮未建卡)
  15. LongHorizon-Harness(2608.01964):paper_card ❌ 仍未建(eval 副分类,邻接)
  16. Task-CoEvolve(2608.20169):Cool Papers 8-23 新出;paper_card ❌ 未建;eval 邻接(自适应验证任务选择 harness 优化)
  17. MMLongEmbed(2606.14747):paper_card ❌ 未建(flyp 精读待 A4 核实,跨轮遗留)
  18. AgentRx(2605.10286):paper_card ❌ 仍未建(跨轮遗留)

可引用 arXiv 号列表(本次预消化涉及的)

arXiv ID 名称 状态 分类
2608.16859 HarnessEval-W ✅ paper_card 992 新建(8-23) eval 专项 net-new ★★★
2608.15669 Large Discovery Models ✅ paper_card 998 新建(8-23) eval 专项 net-new ★★★
2608.16590 Zetta ζ ✅ 已建卡 eval 邻接 ★★★(HF Daily 141▲;flyp critical-read 8-23)
2608.18565 SemaPLC ✅ 已建卡 eval 邻接 ★★★(HF Daily 115▲;flyp critical-read 8-23)
2607.12227 Harness-Evolution-Eval-Rethink ✅ 来源追溯 eval 邻接 ★★★(flyp critical-read 8-22)
2608.12875 The Embedder's Dilemma ✅ 已建卡 eval 邻接 ★★(Tom radar 高价值)
2608.17426 SemComp-Bench ✅ 已建卡 eval 邻接(HF Daily 155▲;8-23 +0▲ 持平)
2608.19880 EnvHarness ✅ 已建卡 eval 邻接(HF Daily 246▲ #1;+11▲ 续立极显著)
2604.10352 ClawVM ❌ 未建卡 eval 邻接(EuroMLSys '26;Jay substack 高价值)
2607.08028 From Prompts to Contracts ❌ 未建卡 eval 邻接(Jay substack 线索)
2607.14159 MemoHarness ❌ 未建卡 eval 邻接(暂存线索)
2608.20169 Task-CoEvolve ❌ 未建卡 eval 邻接(Cool Papers 8-23 新出)
2608.17271 ASI-Bench ❌ 未建卡 eval 邻接(8-23 衰减跌出确认)
2608.19799 SWE-bench Science ✅ paper_card 1044 已建 eval 副分类(HF Daily 58▲)

本轮检查过的来源

来源 文件 Evaluation 相关性
/shared/research-kb/organized/queue/work-queue.md 2026-08-23 14:00 无 eval 专项净新增 ✓
inbox/tom/HF Daily 2026-08-23 8-23 09:00 EnvHarness 246▲ #1 +11▲ ✓;SemComp-Bench 155▲ +0▲ ✓;Zetta 141▲ +1▲ ✓;SemaPLC 115▲ +1▲ ✓;FACET 112▲ +5▲ ✓;Co-RL 91▲ 新晋邻接 ✓;ASI-Bench 衰减确认 ✓
inbox/tom/2026-08-23T1440-agent-rag-longcontext-radar.md 8-23 下午 The Embedder's Dilemma 高价值 #1 ✓;Context Leakage #2 ✓;HSI #3 ✓;QuoteBench #4 ✓;Task-CoEvolve Cool Papers 线索 ✓
inbox/flyp/2026-08-23-0950-Zetta-and-SemaPLC-critical-read.md 8-23 09:50 Zetta+SemaPLC 双锚 critical-read 落盘(eval 邻接 ★★★)✓
inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md 8-22 22:50 Harness-Evolution-Eval-Rethink critical-read 落盘(eval 方法学批判 ★★★)✓
inbox/jay/2026-08-23-1450-jay-engineering-benchmarks-harness-substack.md 8-23 14:50 ClawVM / MemoHarness / From Prompts to Contracts(eval 邻接工程线索 ★★)✓
inbox/tom/2026-08-22-evaluation-e1prep.md 8-22 E1 简报 R54 基线确认(HSI + EnvHarness + FACET + MemTrapBench + QuoteBench + ASI-Bench + SWE-bench Science + LongHorizon-Harness)✓
inbox/jay(8/21~8/23) jay inbox 无 eval 专项 inbox 件 ✓
inbox/flyp(8/21~8/23) flyp inbox 无独立 eval e1prep,但 2 件 critical-read eval 邻接 ✓
inbox/spark(8/21~8/23) spark inbox 无 eval 专项 inbox 件 ✓
inbox/stephen(8/21~8/23) stephen inbox 无 eval 直接增量 ✓
paper_cards/992-2608-16859(HarnessEval-W) evaluation ✅ paper_card 新建(8-23);eval 专项 net-new ★★★
paper_cards/998-2608-15669(Large Discovery Models) evaluation ✅ paper_card 新建(8-23);eval 专项 net-new ★★★
paper_cards/1043-2608-19936(Quantifying Benchmark Optimization in ASR) evaluation ✅ paper_card 已建;eval benchmark 邻接
paper_cards/1044-2608-19799(SWE-bench Science) agent ✅ paper_card 1044 已建;eval 副分类;HF Daily 58▲
paper_cards/1050-2608-13210(NARU) evaluation ✅ paper_card 已建;eval benchmark 邻接
paper_cards/1054-2608-15767(TinyCast) evaluation ✅ paper_card 已建;eval 方法邻接
paper_cards/1055-2608-12875(The Embedder's Dilemma) rag ✅ paper_card 已建;eval 邻接;Tom radar 高价值
Cool Papers 8-23 cs.CL Task-CoEvolve(2608.20169,harness 高效优化)新线索
knowledge/evaluation.md R54 2026-08-22 15:40 确认现有脉络:R54 基线(harness 生态 7 节点 + 23 元组 + 80 维 + 32 轴 + 立标池双向锚第 9 日)✓

结论

本轮(E1-R55,2026-08-23)eval 主题 eval 专项 net-new paper_card 2 条(HarnessEval-W ★★★ + Large Discovery Models ★★★)。

立标池结构性变化(R55 第 10 日): - EnvHarness 246▲ 锚1 维持,+11▲ 续立极显著但增幅未扩大——两日等幅(+11▲/+11▲),可能接近饱和 - Zetta 141▲ / SemaPLC 115▲ / FACET 112▲ 三件微强续立——harness 生态高位稳定 - SemComp-Bench +0▲ 连续第二日持平——衰减信号持续(与 flyp 8-22 critical-read 6 条反方形成共振) - ASI-Bench 衰减跌出确认(8-22 跌出 → 8-23 维持跌出)——ASI 超对齐评测信号中断,R53-R54 立标池锚消失 - Co-RL 91▲ 新晋邻接(多智能体强化学习协同推理)

关键方法学张力出现(R55 最重要增量): - flyp 8-23 critical-read(Zetta+SemaPLC) vs flyp 8-22 critical-read(Harness-Evolution-Eval-Rethink)——两者共同指向"评测协议必须与真实执行环境对齐",但结论方向相反:Rethink 在 Terminal-Bench 上否定 harness evolution 稳定优势;Zetta/SemaPLC 在真实物理/工业 runtime 上确认优势;两者不直接对立,但实验环境的根本差异(命令式任务 vs 物理/工业 runtime)使其结论不可直接比较

eval 专项净增 2 条 + eval 邻接候选 6 条: - eval 专项(net-new paper_card): - HarnessEval-W(2608.16859,paper_card 992 新建 8-23,world model agentified evaluation,★★★) - Large Discovery Models(2608.15669,paper_card 998 新建 8-23,经验驱动开放式搜索评测,★★★)

  • eval 邻接候选
  • Zetta ζ + SemaPLC(2608.16590/2608.18565,flyp 8-23 critical-read,"真实执行是最终裁判"叙事 ★★★)
  • Harness-Evolution-Eval-Rethink(2607.12227,flyp 8-22 critical-read,harness evolution 有效性边界批判 ★★★)
  • The Embedder's Dilemma(2608.12875,Tom radar 高价值,embedding vs LLM 评测范式比较 ★★)
  • ClawVM(2604.10352,EuroMLSys '26,虚拟内存 harness,Jay substack 高价值 ★★)
  • Task-CoEvolve(2608.20169,Cool Papers 8-23 新出,自适应验证任务选择,paper_card 未建)

涉及 arXiv 号:2608.16859(✅已建卡/net-new ★★★)/ 2608.15669(✅已建卡/net-new ★★★)/ 2607.12227(✅critical-read落盘/eval邻接★★★)/ 2608.16590(✅已建卡/eval邻接/141▲)/ 2608.18565(✅已建卡/eval邻接/115▲)/ 2608.12875(✅已建卡/eval邻接★)/ 2604.10352(❌未建卡/eval邻接★)

建议后续动作: - [ ] HarnessEval-W(2608.16859)候选级中档 ★★★(paper_card 992 新建;world model agentified evaluation) - [ ] Large Discovery Models(2608.15669)候选级中档 ★★★(paper_card 998 新建;经验驱动开放式搜索评测) - [ ] Zetta ζ + SemaPLC eval.md 归口(R54 §2.207 未归口,flyp critical-read 已落盘) - [ ] Harness-Evolution-Eval-Rethink(2607.12227)eval.md 归口(R54 无此条目,flyp critical-read 已落盘) - [ ] The Embedder's Dilemma(2608.12875)eval.md 归口(rag 主分类 eval 邻接) - [ ] ClawVM(2604.10352)paper_card 新建(EuroMLSys '26,eval 邻接) - [ ] From Prompts to Contracts(2607.08028)paper_card 新建(eval 邻接) - [ ] Task-CoEvolve(2608.20169)paper_card 新建(Cool Papers 8-23 新出) - [ ] ASI-Bench(2608.17271)paper_card 新建(8-23 衰减跌出确认,但仍需建卡归档) - [ ] MemoHarness(2607.14159)暂存作线索(无源码) - [ ] ASI-Bench(2608.17271)eval.md 归口(衰减,但仍需归档) - [ ] Is this Citation on Point?(2608.12571)eval.md 归口(跨轮 R45→R55 遗留) - [ ] CPI-Bench(2608.14546)eval.md 归口(跨轮遗留) - [ ] Forecast Collapse(2608.14106)eval.md 归口(跨轮遗留) - [ ] MobileMem(2608.13606)eval.md 归口(跨轮遗留) - [ ] ClawGym II(2608.16798)paper_card 新建(eval 邻接,跨轮未建卡) - [ ] LongHorizon-Harness(2608.01964)paper_card 新建(eval 副分类,邻接,跨轮未建卡)


Tom · 2026-08-23 15:40 CST · E1 预消化简报 · evaluation 主题 · 2 条 eval 专项 net-new(HarnessEval-W ★★★ + Large Discovery Models ★★★)+ 6 条 eval 邻接候选(Zetta+SemaPLC critical-read ★★★ + Harness-Evolution-Eval-Rethink ★★★ + The Embedder's Dilemma ★★ + ClawVM ★★ + Task-CoEvolve 新出)+ 立标池无结构性新增 + 关键方法学张力出现(真实执行 vs Terminal-Bench)+ ASI-Bench 衰减跌出确认 · 涉及 arXiv:2608.16859(✅已建卡/net-new ★★★)/ 2608.15669(✅已建卡/net-new ★★★)/ 2607.12227(✅critical-read落盘/eval邻接★★★)/ 2608.16590(✅已建卡/eval邻接/141▲)/ 2608.18565(✅已建卡/eval邻接/115▲)/ 2608.12875(✅已建卡/eval邻接★)/ 2604.10352(❌未建卡/eval邻接★)