evaluation · E1 预消化简报(2026-08-22)

信源检查记录

本次覆盖: - work-queue.md ✓(Top 15 含 QuoteBench #2 + Hierarchical Self-Improvement #1 eval 专项候选;无 evaluation 主题净新增) - inbox/jay(8/20~8/22):无 eval 专项 inbox 件 ✓ - inbox/flyp(8/20~8/22):无 eval 专项 inbox 件 ✓ - inbox/spark(8/20~8/22):无 eval 专项 inbox 件 ✓ - inbox/stephen(8/20~8/22):无 eval 专项 inbox 件 ✓ - inbox/tom(8/21~8/22):HF Daily Aug 22(EnvHarness 235▲ #1 + FACET 107▲ #5 + MemTrapBench 29▲ eval 邻接;SemComp-Bench 155▲ / Zetta ζ 140▲ / SemaPLC 114▲ / SWE-bench Science 56▲ 延续信号)✓;Aug 22 candidates 无 eval 专项净增 ✓;Aug 21 evaluation-e1prep R53 基线 ✓ - paper_cards 近 3 天新卡(705-721 范围):1057(Hierarchical Self-Improvement/HSI,evaluation 主分类,eval 专项 net-new,paper_card 新建 8-22)✓;1056(QuoteBench,agent 主分类 eval 邻接,paper_card 新建 8-22)✓;705(CAPA,evaluation 主分类 benchmark,paper_card 新建 8-22,非本轮窗口)✓;713(LongHorizon-Harness,agent 主分类 eval 副分类,仅 URL 列表存证,无 paper_card)✓;其余(706-712/714-721)无 eval 专项 - knowledge/evaluation.md R53 基线 ✓


增量摘要

本轮(E1-R54,窗口 2026-08-21 下午 ~ 2026-08-22 下午)eval 主题净增量为 5 条(含 1 条 eval 专项 paper_card net-new + 4 条 eval 相关候选含 paper_card 新建或 HF Daily 新晋)。立标池双向锚信号:EnvHarness 8-22 首日登顶 235▲(HF Daily #1),超越 Zetta ζ / SemComp-Bench 成为新晋锚;SemComp-Bench 155▲ / Zetta ζ 140▲ / SemaPLC 114▲ 三件延续信号但均未登顶;ASI-Bench 8-22 跌出 top 15(连续两日攀升后衰减确认);Co-RL 107▲ 新晋邻接。立标池饱和度连续。以下如实记录检查结果。


条目一:Hierarchical Self-Improvement(HSI)— 任务特定可进化 Agent Harness 分层框架(eval 专项 paper_card net-new ★★★,work-queue Top15 #1)

来源HF Daily 2026-08-22(未上榜,paper_card 新建);work-queue.md Top 15 #1(0.5 优先级)paper_cards/1057-2608-08466.md(paper_card 新建,2026-08-22) arXiv2608.08466(paper_card 1057 新建,eval 主分类 agent 副分类,形态 application) 主分类:evaluation;副分类:agent

要点

  • 核心问题:现代 LLM Agent 通常通过人工修改 prompt / 工具 / 工作流改进,而 harness 在部署后通常被视为固定不变的——能否让 harness 任务特定且持续可进化?
  • 核心方案:Hierarchical Self-Improvement(HSI)——三层可进化 harness 框架;每个任务族维护各自的 harness,通过固定任务注入接缝在迭代间热替换,并依据环境反馈改写;单个冻结 LLM M 在三层运作
  • 关键贡献:提出任务特定 + 持续进化的 harness 替代方案;对标 Zetta ζ(闭环具身自进化)但更通用;属于 harness 自演进谱系的第五条分支(HSI:任务特定可热替换 harness)
  • 与 Zetta ζ 的关系:Zetta ζ 面向具身智能 runtime critics;HSI 面向通用 Agent 的任务特定可进化 harness;两者同属"harness 持续改进"方向但抽象层次不同
  • 立标信号:paper_card 1057 新建(2026-08-22);work-queue Top 15 #1(0.5 优先级);eval 专项;立标等级 立基础锚候选 ★★★

与 knowledge/evaluation.md R53 现有脉络的关系

  • 现有脉络:R53 §2.207 评测方法学 22 元组(Zetta ζ 第 20 / SoftVTBench 第 21 / SemaPLC 第 22);harness 生态四角(StateM / HarnessEval-W / HarnessRisk / Zetta ζ);HSI 以"任务特定可进化 harness"补充 harness 自演进谱系第 5 条分支,与 Zetta ζ 形成通用 vs 具身的互补
  • 建议归入节:§2.207 评测方法学 22 元组 → 第 23 元组候选新增(HSI,任务特定可进化 harness 框架);harness 生态四角 → 第 5 节点候选(HSI,任务特定可热替换 harness)

矛盾 / 待核实

  • 三层架构的具体形式(每层职责边界、层间接口)需 PDF 核验
  • 任务注入接缝的具体机制(如何热替换 + 避免破坏运行环境状态)需核实
  • 与 Zetta ζ 的具体差异(是否在同一层次或互补)需 PDF 核验

arXiv 列表

  • 2608.08466(✅ paper_card 1057 新建;eval 专项 net-new;立基础锚候选 ★★★)

条目二:EnvHarness — 唤醒静态世界以支持 Agent 学习(HF Daily 8-22 #1 235▲,eval 邻接候选 ★★★)

来源HF Daily 2026-08-22 #1,235▲inbox/tom/_candidates/2026-08-22-agent-rag-longcontext-candidates.json arXiv2608.19880(paper_card 未建主分类:agent(邻接 evaluation)

要点

  • 核心问题:LLM Agent 通过与环境交互学习,但环境是人工构建且静态的——对 Agent 的弱点视而不见,随 Agent 改进快速过时——能否减轻从头重建环境的工程负担?
  • 核心方案:Environment Harness(EnvHarness)——唤醒静态世界以支持 Agent 学习;将现有环境改造为可感知 Agent 弱点的动态 harness;不需要领域特定管道,不依赖昂贵或不可靠的验证器
  • 关键区分:Zetta ζ 是在线演化 runtime critics;EnvHarness 是唤醒/改造静态环境本身;两者互补——Zetta ζ 改进 Agent 执行,EnvHarness 改进 Agent 学习环境
  • 立标信号:HF Daily 8-22 235▲ = 今日 HF Daily #1(超越 SemComp-Bench 155▲ / Zetta ζ 140▲);paper_card 未建当前所有 eval 相关候选中 HF Daily 最高票,强信号
  • 立标等级eval 邻接候选 ★★★(环境 harness 化方向,harness 生态邻接)

与 knowledge/evaluation.md R53 现有脉络的关系

  • 现有脉络:R53 harness 生态四角(StateM / HarnessEval-W / HarnessRisk / Zetta ζ);EnvHarness 以"环境唤醒 + 静态世界动态化"补充 harness 体系第 5 邻接方向(学习环境自适应),与 Zetta ζ 形成"执行改进 vs 学习环境改进"的正交互补
  • 建议归入节:§2.207 评测方法学邻接 → EnvHarness(环境 Harness,静态世界唤醒支持 Agent 学习);harness 生态四角 → 第 5 邻接节点候选(EnvHarness,学习环境自适应)

矛盾 / 待核实

  • paper_card 未建;需新建
  • "唤醒静态世界"的具体技术路径(重放 / 动态调整 / 环境状态迁移)需 PDF 核验
  • 与现有 environment generation 方法(ProcGEN / IDE/World-Building 等)的具体差异

arXiv 列表

  • 2608.19880(❌ paper_card 未建;eval 邻接 EnvHarness;HF Daily 235▲ top-1)

条目三:FACET — 终端任务合成中保留源代码意图与可执行状态(HF Daily 8-22 #5 107▲,eval 邻接候选)

来源HF Daily 2026-08-22 #5,107▲inbox/tom/_candidates/2026-08-22-agent-rag-longcontext-candidates.json arXiv2608.18580(paper_card 未建主分类:agent(邻接 evaluation)

要点

  • 核心问题:终端 Agent 训练需要可扩展的可执行监督,但高质量终端任务合成仍具挑战性——任务耦合了指令、初始化环境、参考解决方案和可执行验证器,若这些构件从不一致假设生成,可能导致任务无法解决或评估错误
  • 核心方案:FACET——Preserving Source Intent and Executable State in Terminal Task Synthesis;在多阶段合成中保留目标、依赖、状态转换和程序约束;精确最终状态验证
  • 关键贡献:解决"执行合约与执行传输交叉处"的问题——模型生成正确命令但接口序列化/包装后引入错误(与 QuoteBench 同一问题族);精确最终状态验证可区分生成阶段错误与生成后引入的错误
  • 与 QuoteBench 的关系:FACET 解决终端任务合成中 artifact 一致性问题;QuoteBench 量化"匹配得分如何掩盖命令路径失败"——两者同一问题族但互补(FACET 合成端 / QuoteBench 评测端)
  • 立标信号:HF Daily 8-22 #5 107▲;paper_card 未建

与 knowledge/evaluation.md R53 现有脉络的关系

  • 现有脉络:R53 §2.207 评测方法学 22 元组候选;FACET 以"终端任务合成中源代码意图与可执行状态保留"补充 harness 生态邻接(终端 Agent 可审计评测环境构建);与 QuoteBench 同属"命令执行边界评测"簇
  • 建议归入节:§2.207 评测方法学邻接 → FACET(终端任务合成中源代码意图与可执行状态保留);与 QuoteBench 配对 → 终端 Agent 执行边界评测族

矛盾 / 待核实

  • paper_card 未建;需新建
  • 14 个 incident-derived 家族 / 56 个一次性任务的具体分类需 PDF 核验
  • FACET 与 QuoteBench 的具体技术差异(FACET 合成端 / QuoteBench 评测端)需确认

arXiv 列表

  • 2608.18580(❌ paper_card 未建;eval 邻接 FACET;HF Daily 107▲ #5)

条目四:MemTrapBench — LLM 内存使用中认知陷阱的基准测试(HF Daily 8-22 29▲,eval 邻接候选)

来源HF Daily 2026-08-22 #13,29▲inbox/tom/_candidates/2026-08-22-agent-rag-longcontext-candidates.json arXiv2608.20202(paper_card 未建主分类:agent(邻接 evaluation)

要点

  • 核心问题:现有内存基准主要评估信息是否正确提取、存储和检索,但几乎完全忽略"检索到的记忆如何重塑模型推理并影响当前任务表现"——即使忠实记录且语义相关的记忆也可能扭曲模型推理(memory-induced cognitive traps)
  • 核心方案:MemTrapBench——识别 LLM 内存使用中的认知陷阱;benchmark 评测检索记忆对当前任务的扭曲效应
  • 关键发现:faithfully recorded + semantically relevant memories can distort model reasoning;现有 memory benchmark 测不准这个维度
  • 与 eval 的关联:属于 Agent Memory 评测的第五维(memory-induced reasoning distortion);是 eval 邻接(memory 评测方法学)
  • 立标信号:HF Daily 8-22 #13,29▲(低票新晋);paper_card 未建

与 knowledge/evaluation.md R53 现有脉络的关系

  • 现有脉络:R53 §2.2 评测对象 80→84 维(无"memory reasoning distortion"评测);MemTrapBench 填补"Agent memory 推理扭曲评测"空白,属于 §2.2 评测对象邻接维候选(Agent Memory 五维纵向评估第五维:memory reasoning distortion)
  • 建议归入节:§2.2 评测对象邻接 → MemTrapBench(LLM 内存使用认知陷阱 benchmark)

矛盾 / 待核实

  • paper_card 未建;需新建
  • cognitive traps 的具体分类体系(几类陷阱 / 评测指标)需 PDF 核验

arXiv 列表

  • 2608.20202(❌ paper_card 未建;eval 邻接 MemTrapBench;HF Daily 29▲ #13)

条目五:QuoteBench — 匹配得分如何掩盖命令路径失败(work-queue Top15 #2,eval 邻接候选)

来源work-queue.md Top 15 #2(0.5 优先级)paper_cards/1056-2608.13547.md(paper_card 新建,2026-08-22) arXiv2608.13547(paper_card 1056 新建,agent 主分类 eval 邻接) 主分类:agent;副分类:evaluation

要点

  • 核心问题:LLM 编程 Agent 通过接口下发 Bash 命令,这些接口可能对模型输出进行序列化、包装与再解析——仅凭匹配的执行得分无法区分命令生成阶段的错误与生成后引入的失败
  • 核心方案:QuoteBench——围绕一道刻意未转义的额外解析器,将生成合约与执行传输交叉;在 14 个源自真实事件的家族、共 56 个一次性任务上以精确最终状态校验度量该边界
  • 关键发现:在插值点进行转义可复现原始路径结果——任何在已声明边界下取得的恢复成效都必须被重新评估
  • 与 FACET 的关系:FACET 解决合成端 artifact 一致性;QuoteBench 解决评测端"命令路径边界在哪里"——同一问题族(命令生成 vs 执行传输边界)但互补
  • 立标信号:work-queue Top 15 #2(0.5 优先级);paper_card 1056 新建(2026-08-22);HF Daily 未上榜(8-22 票数不足以入选 top 15);立标等级 eval 邻接候选 ★★

与 knowledge/evaluation.md R53 现有脉络的关系

  • 现有脉络:R53 §2.207 评测方法学 22 元组候选;QuoteBench 以"命令执行边界量化"补充 harness 生态邻接(终端 Agent 可审计评测方法);与 FACET 配对形成"合成端 + 评测端"完整图谱
  • 建议归入节:§2.207 评测方法学邻接 → QuoteBench(命令路径失败边界量化);与 FACET 配对 → 终端 Agent 执行边界评测族

矛盾 / 待核实

arXiv 列表

  • 2608.13547(✅ paper_card 1056 新建;agent 主分类 eval 邻接;work-queue Top15 #2)

综合:立标池双向锚第 9 日信号(R54 窗口)

HF Daily 8-22 立标池双向锚进入第 9 日: - EnvHarness 8-22 首日 235▲(HF Daily #1)——新晋锚登顶,超越 Zetta ζ 140▲ / SemComp-Bench 155▲,环境 harness 化方向首日确认 - SemComp-Bench 8-21 153▲(#2)→ 8-22 155▲(#2)——延续信号,维持高位 - Zetta ζ 8-21 130▲(#3)→ 8-22 140▲(#3)——延续信号,维持高位 - SemaPLC 8-21 111▲(#4)→ 8-22 114▲(#4)——延续信号,维持高位 - ASI-Bench 8-20 51▲ / 8-21 55▲(#7)→ 8-22 跌出 top 15——连续两日攀升后衰减确认,ASI 超对齐评测信号中断 - SWE-bench Science 8-21 邻接 → 8-22 56▲(#8)——新晋邻接锚 - FACET 8-22 #5 107▲——新晋邻接锚(终端任务合成) - Co-RL 8-22 90▲(#6)——新晋邻接(多智能体强化学习协同推理) - LLMRouter 8-20 跌出 / 8-21 跌出 → 8-22 维持跌出(衰减确认) - DarwinX / Mechanist / PlayWorld / LiveAnimate 连续跌出维持

立标池双向锚第 9 日:EnvHarness 235▲ 新锚登顶(环境harness化方向确认)+ SemComp-Bench / Zetta ζ / SemaPLC 三件延续高位 + ASI-Bench 衰减确认 + FACET / SWE-bench Science / Co-RL 三件新晋邻接


综合:矛盾与待核实清单

  1. arXiv:2608.08466(Hierarchical Self-Improvement/HSI):paper_card 1057 ✅ 新建;eval 专项 net-new ★★★;立基础锚候选
  2. arXiv:2608.19880(EnvHarness):paper_card ❌ 未建;eval 邻接;HF Daily 235▲ top-1
  3. arXiv:2608.18580(FACET):paper_card ❌ 未建;eval 邻接;HF Daily 107▲ #5
  4. arXiv:2608.20202(MemTrapBench):paper_card ❌ 未建;eval 邻接;HF Daily 29▲ #13
  5. arXiv:2608.13547(QuoteBench):paper_card 1056 ✅ 新建;agent 主分类 eval 邻接;work-queue Top15 #2
  6. ASI-Bench(2608.17271):R53 立标池邻接锚;8-22 跌出 top 15(连续两日攀升后衰减确认);paper_card ❌ 仍未建
  7. Is this Citation on Point?(2608.12571):eval.md 仍未归口(跨轮 R45→R54 遗留)
  8. CPI-Bench(2608.14546):eval.md 仍未归口(跨轮遗留)
  9. Forecast Collapse(2608.14106):eval.md 仍未归口(跨轮遗留)
  10. MobileMem(2608.13606):eval.md 仍未归口(跨轮遗留)
  11. arXiv:2608.13417(超越最终分数):paper_card ❌ 仍未建(跨轮 R50→R54 仍未建卡)
  12. AgentRx(2605.10286):R53 §2.207 第 13 元组候选;paper_card ❌ 仍未建(跨轮遗留)
  13. ClawGym II(2608.16798):R53 eval 邻接;paper_card ❌ 仍未建
  14. 信息满足度(2608.14457):R53 eval 邻接;paper_card ❌ 仍未建
  15. LongHorizon-Harness(2608.01964):agent 主分类 eval 副分类;仅 URL 列表存证;paper_card ❌ 仍未建
  16. MMLongEmbed(2606.14747):paper_card ❌ 未建

可引用 arXiv 号列表(本次预消化涉及的)

arXiv ID 名称 状态 分类
2608.08466 Hierarchical Self-Improvement(HSI) ✅ paper_card 1057 新建 eval 专项 ★★★
2608.19880 EnvHarness ❌ paper_card 未建 eval 邻接 ★★★
2608.18580 FACET ❌ paper_card 未建 eval 邻接 ★★
2608.20202 MemTrapBench ❌ paper_card 未建 eval 邻接 ★★
2608.13547 QuoteBench ✅ paper_card 1056 新建 eval 邻接 ★★
2608.17271 ASI-Bench ❌ paper_card 未建 eval 邻接(衰减确认)
2608.19799 SWE-bench Science ❌ paper_card 未建 eval 邻接
2608.17426 SemComp-Bench ✅ paper_card 1026 已建 eval 邻接(延续)
2608.16590 Zetta ζ ✅ paper_card 1027 已建 eval 专项(延续)
2608.18565 SemaPLC ❌ paper_card 未建 eval 邻接(延续)
2608.01964 LongHorizon-Harness ❌ paper_card 未建 eval 副分类(邻接)

本次净新增 eval 相关条目 5 条(HSI + EnvHarness + FACET + MemTrapBench + QuoteBench),其中 eval 专项 1 条(HSI)。