evaluation · E1 预消化简报(2026-08-19)
信源检查记录
本次覆盖: - work-queue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜候选无 eval 主分类净增) - inbox/jay(8/17~8/19):无 eval 专项新件;AI Agents Stack 2026(eval 邻接)✓;Large Discovery Models 49▲(eval 邻接)✓;cool papers 8-19 含信息满足度摘要评估(2608.14457,eval 邻接候选)✓ - inbox/flyp(8/17~8/19):agent-evals-cameron-wolfe critical-read(eval 邻接)✓;mm-long-context-evaluation(已在 R50 锚入 MMLongBench/MMLongEmbed)✓;无 eval 专项新件 - inbox/spark(8/17~8/19):无 eval 专项新件 ✓ - inbox/stephen(8/17~8/19):无 eval 直接增量 ✓ - inbox/tom(8/18~8/19):HF Daily × 2(8-19 HarnessEval-W 111▲ + Accuracy&Order 标新 + GRIP 邻接 + Large Discovery 49▲;8-18 2608.13417 超越最终分数)✓;radar 含 HarnessRisk(8-19,eval 邻接)✓;8-18 evaluation-e1prep R50 基线 ✓ - paper_cards 近 3 天新卡(986~1005 范围):992(HarnessEval-W eval benchmark 新卡)✓;994(Gathered Not Admitted eval benchmark 新卡)✓;1005(Accuracy and Order Sensitivity eval benchmark 新卡)✓;998(Large Discovery Models eval 已归 Jay e1prep)✓;983(Is this Citation on Point? eval 已建卡 eval.md 仍未归口)✓;984(Apodex Discovery eval 已建卡 eval.md 仍未归口)✓;985(Agents Catching Agents agent 主分类)✓;988(GRIP rag benchmark 邻接)✓;1004(StateM agent 副分类 eval 邻接)✓;1001(Agentic Transaction agent 副分类 eval 邻接)✓;999-1003/993/995-997(无 eval 专项)✓ - knowledge/evaluation.md R50 基线 ✓
增量摘要
本轮(E1-R51,窗口 2026-08-18 下午 ~ 2026-08-19 下午)eval 主题净增量为 3 条 eval 专项 net-new paper_card(HarnessEval-W 111▲ + Accuracy&Order Sensitivity + Gathered Not Admitted)。立标池双向锚信号:HarnessEval-W 8-19 首日 111▲ 强势净增(HF Daily top 2),与前轮 StateM(Terminal-Bench 95.3%)共同锚定 harness 化评测方法学方向。以下如实记录检查结果。
条目一:HarnessEval-W — 将视觉世界模型的评估 Agent 化(eval 专项 net-new ★★★,HF Daily 8-19 #2 111▲)
来源:HF Daily 2026-08-19 #2,111▲;paper_cards/992-2608-16859.md(paper_card 新建,2026-08-19)
arXiv:2608.16859(paper_card 992 已建,eval benchmark)
主分类:evaluation;形态:benchmark
要点
- 核心问题:现有 world model benchmark 以暴力方式计算指标,不留推理链,无法验证"物理/因果/世界状态演化是否正确"——人类能自然发现此类违规,但现有系统无法自动化
- 核心方案:HarnessEval-W——将 LLM 生态的 harness 范式引入世界模型评估;benchmark 输出的不只是标量分数,还有支撑分数的推理链(可审查、可验证)
- 关键主张:评估的可信度来自为分数提供支撑的推理过程,而非分数本身;对 world model 尤为关键(评判 rollout 需要理解物理因果是否正确演化)
- 立标信号:HF Daily 8-19 #2,111▲ = eval 专项最高信号(top 2,仅次于 #1 StateM 130▲);paper_card 992 新建(2026-08-19);立标等级 立基础锚候选 ★★★
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 §2.207 评测方法学 13 元组候选;前轮已锚入 StateM(Terminal-Bench 2.1,harness 化 Agent 评测);HarnessEval-W 以 world model 专项 harness 补充 §2.207 评测方法学候选谱系——"harness 范式从 LLM 扩展到 world model 评测"是新锚点
- 建议归入节:§2.207 评测方法学 13 元组候选 → 第 14 元组候选新增(HarnessEval-W,world model harness 化评测,与 StateM harness 形成横向互补:Terminal/Agent harness ↔ World Model harness)
矛盾 / 待核实
- "agentified evaluation pipeline"具体实现机制需 PDF 核验
- 评测脚本和数据集可访问性待确认(GitHub 公开?)
- 与现有 world model benchmark(GAIA、WorldLab 等)的差异化定位需对照表确认
arXiv 列表
- 2608.16859(✅ paper_card 992 已建;eval 专项 net-new;立基础锚候选 ★★★)
条目二:Accuracy and Order Sensitivity Diverge Under Label-Free Strategies(eval 专项 net-new ★★)
来源:paper_cards/1005-2608-11947.md(paper_card 新建,2026-08-19)
arXiv:2608.11947(paper_card 1005 已建,eval benchmark)
主分类:evaluation;形态:benchmark
要点
- 核心问题:阻止模型看到选项标签(label-free)的同时要求其给出答案,是否能消除位置影响并提升性能?现有 LLM 评测多以选项标签可见为前提,忽略了位置敏感性问题
- 核心方案:测试两种 label-free 策略对位置偏差的缓解效果;在多个 benchmark 上对比有无标签条件下的准确率差异
- 立标信号:paper_card 1005 新建(2026-08-19);主分类 evaluation;HF Daily 未上榜(票数低或新卡尚未上票);立标等级 候选级低档 ★★
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 §2.1 评测方法学 32 轴(无 label-free 策略专项);§2.6 失败模式分析(无位置偏差专项)——本篇填补"label-free 评测条件下的位置敏感性"空白,属于 §2.1 方法学轴候选
- 建议归入节:§2.1 评测方法学 32 轴 → 新增第 33 轴候选(label-free 评测条件下的位置偏差分析);§2.6 失败模式分析 → 新增位置偏差 failure mode
矛盾 / 待核实
- 评测数据集的具体构成和规模需 PDF 核验
- "label-free"策略的具体定义与"chain-of-thought without options"的关系需明确区分
- 与传统 MMLU/BBQ 等 benchmark 的关系(是否复现现有数据集的 label-free 版本)待确认
arXiv 列表
- 2608.11947(✅ paper_card 1005 已建;eval 专项 net-new;候选级低档 ★★)
条目三:Gathered, Not Admitted — 注意力将潜变量带入可言语化形式(eval 专项 net-new ★★)
来源:paper_cards/994-2608-15022.md(paper_card 新建,2026-08-19);work-queue.md 选题榜候选 2608.15022
arXiv:2608.15022(paper_card 994 已建,eval benchmark)
主分类:evaluation;形态:benchmark
要点
- 核心问题:语言模型以可报告形式持有潜变量,但什么让表征进入"可报告形式"?"workspace 理论"提出有"闸门"决定准入——但实验发现没有闸门在预测位置
- 核心方案:使用 Jacobian lens 在开源权重模型上测试 workspace 理论;在五条支路共享相同上下文的 benchmark 上验证闸门假说
- 关键发现:需求(demand)提升概念的 lens 可见性,超出对供应值施加算子产生的结果(+0.050 [+0.045, +0.057] percentile)——workspace 闸门假说被证伪
- 立标信号:paper_card 994 新建(2026-08-19);主分类 evaluation;work-queue 选题榜候选;立标等级 候选级中档 ★★★(work-queue 选题榜 + 证伪性发现)
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 无 workspace/潜变量评测专项 benchmark;本篇以"workspace 闸门假说证伪实验"填补"LLM 表征可报告性评测"空白,属于 §2.2 评测对象第 80 维候选邻接(可解释性/表征评测)
- 建议归入节:§2.2 评测对象 79 维 + 邻接维 → 新增"LLM 表征可报告性/workspace 评测"子领域;§2.6 失败模式分析 → 新增"workspace 闸门假说证伪"条目
矛盾 / 待核实
- benchmark 五条支路的具体任务类型和难度分层需 PDF 核验
- Jacobian lens 方法的具体实现与现有可解释性工具( TransformerLens 等)的关系待确认
- 证伪性发现("no gate where it predicts one")是否可复现在其他架构/LLM 上需核实
arXiv 列表
- 2608.15022(✅ paper_card 994 已建;eval 专项 net-new;候选级中档 ★★★)
条目四:Large Discovery Models(eval 邻接候选,HF Daily 8-19 #4 49▲,前轮已锚)
来源:HF Daily 2026-08-19 #4,49▲;paper_cards/998-2608-15669.md(eval 主分类)
arXiv:2608.15669(paper_card 998 已建,eval 主分类;已在 Jay 8-19 engineering-e1prep 中锚入 §2.7)
要点(补充评价视角)
- 核心:科学发现场景的 LLM 评估难题——似然和自评估对分布外候选不可靠;LDM 将认知不确定性显式建模
- 与 eval 的关联:本质上是一个科学发现评测框架(评估目标 = 分子/蛋白质/程序优化);是 eval 邻接的核心候选
- 立标信号:HF Daily 8-19 #4,49▲(与前轮 R50 的 StateM/HarnessEval-W 方向一致——HF Daily top 票的论文中有 3 篇与 harness/评测方法学相关)
- 立标等级:已在 Jay e1prep 中锚入 §2.7;本简报补充其 eval 主分类确认
与 knowledge/evaluation.md R50 现有脉络的关系
- 已有锚入:Jay 8-19 engineering-e1prep 已锚入 §2.7(科学发现 Agent 工程线索);eval.md 视角补充:本篇以"认知不确定性建模"填补"开放搜索评测"空白,属于 §2.207 评测方法学候选邻接
- 建议归入节:§2.207 评测方法学候选邻接 → Large Discovery Models(科学发现开放搜索评测,与 HarnessEval-W/StateM 同属"评测方法学新方向"簇)
矛盾 / 待核实
- 已在 Jay engineering-e1prep 中记录(科学发现场景适用边界 + 认知不确定性建模的可复现性)
arXiv 列表
- 2608.15669(✅ paper_card 998 已建;eval 主分类;已在 Jay e1prep 锚入)
条目五:GRIP — query dominance 失效模式 benchmark(eval 邻接候选,paper_card 已建)
来源:paper_cards/988-2608-16776.md(rag benchmark,paper_card 988 已建)
arXiv:2608.16776(paper_card 988 已建,rag benchmark)
主分类:rag;形态:benchmark
要点
- 核心问题:RAG 高容量编码器会让 query 主导潜在状态,使检索证据功能上无关(query dominance 失效模式)
- 核心方案:GRIP — 强制证据通道仅编码 query 中不可用的残余信息(容量不对称设计);5 个推理 benchmark 验证
- 与 eval 的关联:虽然是 rag benchmark,但 query dominance 是 RAG 评测中的重要 failure mode,属于 eval 邻接
- 立标信号:paper_card 988 已建;本简报补充其 eval 邻接定位
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 §2.207 评测方法学候选;§2.6 失败模式分析(query dominance 作为 RAG 评测的新型 failure mode 候选)
- 建议归入节:§2.6 失败模式分析 → GRIP query dominance 新增为 RAG 评测 failure mode 典型案例
矛盾 / 待核实
- 无
arXiv 列表
- 2608.16776(✅ paper_card 988 已建;rag benchmark;eval 邻接 query dominance failure mode)
条目六:ClawGym II — Agent Harness 上的黑盒强化学习(eval 邻接候选)
来源:inbox/jay/2026-08-19-1001-rss-cool-papers.md(Cool Papers cs.CL 8-19);HF Daily 8-19 #7 34▲
arXiv:2608.16798(paper_card 未建)
主分类:agent(邻接 evaluation)
要点
- 核心问题:Agent harness 通过协调 Agent 与环境交互提升长程任务性能,但如何通过黑盒强化学习优化 harness 本身?
- 核心方案:ClawGym II — 在 Agent harness 环境中探索黑盒 RL 方法,提升 harness 协调效率
- 与 eval 的关联:Agent harness 本身就是评测基础设施;ClawGym II 探索如何用 RL 优化 harness,属于 eval 邻接的邻接
- 立标信号:HF Daily 8-19 #7,34▲;Cool Papers 精选;paper_card 未建(需新建)
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 §2.207 评测方法学 13 元组(StateM harness + HarnessEval-W);ClawGym II 以黑盒 RL 优化 harness 本身,属于 harness 生态的自我改进机制,与 StateM/HarnessEval-W 同方向簇
- 建议归入节:§2.207 评测方法学候选邻接 → ClawGym II(harness 自我改进,黑盒 RL 优化方向)
矛盾 / 待核实
- paper_card 未建;需新建
- 具体 RL 方法和实验设置需 PDF 核验
arXiv 列表
- 2608.16798(❌ paper_card 未建;eval 邻接 ClawGym II;HF Daily 34▲)
条目七:信息满足度 — 面向读者的摘要评估新维度(eval 邻接候选)
来源:inbox/jay/2026-08-18-1001-rss-cool-papers.md(Cool Papers cs.CL 8-18)
arXiv:2608.14457(paper_card 未建)
主分类:evaluation(邻接);形态:method/beyond benchmark
要点
- 核心问题:现有摘要评估多关注整体质量(ROUGE/BERTScore)或特定属性(可读性/事实性),缺乏"面向读者"的信息满足度维度
- 核心方案:提出"信息满足度"(Information Satisfaction)作为摘要评估的新维度——从读者视角评估摘要是否提供了足够的信息来回答原文能回答的问题
- 与 eval 的关联:属于 eval 方法学创新(超越 ROUGE/BERTScore 的新评估维度),eval 邻接候选
- 立标信号:Cool Papers 精选;paper_card 未建
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 §2.1 评测方法学 32 轴(无"信息满足度"维度);本篇填补"面向读者的摘要评估"空白,属于 §2.1 评测方法学新增轴候选
- 建议归入节:§2.1 评测方法学 32 轴 → 新增第 34 轴候选(信息满足度:面向读者的摘要评估维度)
矛盾 / 待核实
- paper_card 未建;需新建
- "信息满足度"操作性定义的具体测量方法需 PDF 核验
arXiv 列表
- 2608.14457(❌ paper_card 未建;eval 邻接信息满足度新维度;Cool Papers 精选)
条目八:HarnessRisk — Agent Harness 生命周期安全基准(eval 邻接候选)
来源:inbox/tom/2026-08-19-agent-rag-longcontext-radar.md(Tom radar 8-19);HF Daily 8-19
arXiv:2608.17597(paper_card 未建)
主分类:agent/benchmark(邻接 evaluation)
要点
- 核心问题:Agent Harness 安全评估缺失——harness 运行时有哪几类安全风险?
- 核心方案:HarnessRisk — 将 Agent Harness 安全分解为 6 个运营阶段(配置/能力扩展/运行时操作/状态持久化/动作控制/事故恢复);含 128 个安全场景
- 与 eval 的关联:这是首个覆盖完整 Agent 生命周期的安全基准,属于 eval 邻接(安全评测)
- 立标信号:Tom radar 高价值条目;HF Daily 8-19;paper_card 未建
与 knowledge/evaluation.md R50 现有脉络的关系
- 现有脉络:R50 §2.207 评测方法学 13 元组候选(StateM + HarnessEval-W);HarnessRisk 以"harness 安全评测"补充 harness 生态,填补 §2.207 安全维度空白
- 建议归入节:§2.207 评测方法学候选邻接 → HarnessRisk(harness 安全评测,6 阶段 128 场景)
矛盾 / 待核实
- paper_card 未建;需新建
- 128 个安全场景的具体分类和覆盖范围需 PDF 核验
arXiv 列表
- 2608.17597(❌ paper_card 未建;eval 邻接 harness 安全评测)
综合:立标池双向锚第 6 日信号(R51 窗口)
HF Daily 8-19 立标池双向锚进入第 6 日: - HarnessEval-W 8-19 首日 111▲(HF Daily #2)——新晋 eval 专项立锚,方向与 StateM harness 一致 - StateM 8-19 首日 130▲(HF Daily #1)——延续强信号,Terminal-Bench 2.1 锚定 harness 化方向 - LLMRouter 8-15 90▲ → 8-16 94▲ → 8-17 102▲ → 8-18 42▲ → 8-19 #10 10▲(维持但绝对值低) - DarwinX 8-15 59▲ → 8-16 66▲ → 8-17 84▲ → 8-18 35▲ → 8-19 #12 8▲(维持) - PlayWorld 8-15 33▲ → 8-16 35▲ → 8-17 42▲ → 8-18 4▲ → 8-19 跌出 top 15(衰减确认) - Mechanist 8-15 82▲ → 8-16 82▲ → 8-17 84▲ → 8-18 6▲ → 8-19 #14 5▲(维持) - LiveAnimate 8-15 跌出 → 8-16 跌出 → 8-17 #15 21▲ → 8-18 #9 6▲ → 8-19 跌出(重入后再次跌出) - ClawGym II 8-19 首日 34▲(HF Daily #7)——新晋 harness 相关 eval 邻接锚
立标池双向锚第 6 日:HarnessEval-W + StateM 双新锚 + PlayWorld 衰减确认 + LiveAnimate 二次跌出 = eval 评测方法学方向结构性强化信号
综合:矛盾与待核实清单
- arXiv:2608.16859(HarnessEval-W):paper_card 992 ✅ 已建;eval 专项 net-new;立基础锚候选 ★★★;数据集/评测脚本可访问性待核
- arXiv:2608.11947(Accuracy and Order Sensitivity):paper_card 1005 ✅ 已建;eval 专项 net-new;候选级低档 ★★
- arXiv:2608.15022(Gathered Not Admitted):paper_card 994 ✅ 已建;eval 专项 net-new;候选级中档 ★★★(work-queue 选题榜 + 证伪性发现)
- arXiv:2608.16798(ClawGym II):paper_card ❌ 未建;eval 邻接;HF Daily 34▲
- arXiv:2608.14457(信息满足度):paper_card ❌ 未建;eval 邻接;Cool Papers 精选
- arXiv:2608.17597(HarnessRisk):paper_card ❌ 未建;eval 邻接;Tom radar 高价值条目
- Is this Citation on Point?(2608.12571):paper_card 983 ✅ 已建;eval.md R50 仍未归口(跨轮遗留)
- Apodex Discovery(2608.11341):paper_card 984 ✅ 已建;eval.md R50 仍未归口(跨轮 R47→R51 遗留)
- CPI-Bench(2608.14546):paper_card ✅ 已建;eval.md 仍未归口(跨轮遗留)
- Forecast Collapse(2608.14106):paper_card ✅ 已建;eval.md 仍未归口(跨轮遗留)
- MMLongEmbed(2606.14747):paper_card ❌ 未建;flyp critical-read 精读草稿(eval 邻接,§2.207 候选)
- MerchantBench(2607.29677):arXiv ID 截断待核实(Jay X-tech-radar 引用);paper_card ❌ 未建
- AgentRx(2605.10286):R50 §2.207 第 13 元组候选;paper_card ❌ 仍未建;AHLI 2026 会议归属待核实
- MobileMem(2608.13606):paper_card 971 ✅ 已建;eval.md 仍未归口
本轮检查过的来源(无新增时列出)
| 来源 | 文件 | Evaluation 相关性 |
|---|---|---|
| /shared/research-kb/organized/queue/work-queue.md | 2026-08-19 14:00 | Top 15 backlog 无 eval 专项;选题榜 2608.15022(Gathered Not Admitted)✓ |
| inbox/jay/2026-08-19-1001-rss-cool-papers.md | 8-19 Cool Papers | 信息满足度 2608.14457(eval 邻接)✓;ClawGym II 2608.16798(eval 邻接)✓ |
| inbox/jay/2026-08-19-technical-briefing.md | 8-19 15:05 | 无 eval 直接新增;database/vecdb/RAG/llm-infra 专项 ✓ |
| inbox/jay/2026-08-19-1000-rss-raschka.md | 8-19 Raschka RSS | 参考:无 eval 专项新件(KV Sharing/mHC/压缩注意力)✓ |
| inbox/jay/2026-08-18-1001-rss-cool-papers.md | 8-18 Cool Papers | 信息满足度 2608.14457(eval 邻接候选)✓ |
| inbox/jay/2026-08-18-engineering-e1prep.md | 8-18 E1 简报 | Large Discovery Models 49▲(eval 主分类邻接)✓ |
| inbox/tom/2026-08-19-0900-hf-daily-2026-08-19.md | 8-19 HF Daily | HarnessEval-W 111▲ #2(eval 专项 net-new)✓;StateM 130▲(eval 邻接)✓;GRIP 邻接✓ |
| inbox/tom/2026-08-19-agent-rag-longcontext-radar.md | 8-19 Tom radar | HarnessRisk 2608.17597(eval 邻接)✓;无 eval 候选净增 ✓ |
| inbox/tom/2026-08-18-evaluation-e1prep.md | 8-18 E1 简报 | R50 基线(1 eval 专项 net-new + 5 eval 邻接候选)✓ |
| inbox/flyp/2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md | 8-18 flyp critical-read | eval 邻接(Agent evals 综述);已在 R50 锚入 MMLongBench/MMLongEmbed ✓ |
| inbox/spark/2026-08-18/2026-08-19 | 8-18~8-19 spark inbox | 无 eval 专项新件 ✓ |
| inbox/stephen/2026-08-18/2026-08-19 | 8-18~8-19 stephen inbox | 无 eval 直接增量 ✓ |
| paper_cards/992-2608-16859(HarnessEval-W) | evaluation | ✅ paper_card 新建;eval 专项 net-new ★★★ |
| paper_cards/994-2608-15022(Gathered Not Admitted) | evaluation | ✅ paper_card 新建;eval 专项 net-new ★★★ |
| paper_cards/1005-2608-11947(Accuracy and Order Sensitivity) | evaluation | ✅ paper_card 新建;eval 专项 net-new ★★ |
| paper_cards/998-2608-15669(Large Discovery Models) | evaluation | ✅ paper_card 已建;eval 主分类;已在 Jay e1prep 锚入 |
| paper_cards/983-2608-12571(Is this Citation on Point?) | evaluation | ✅ paper_card 已建;❌ eval.md R50 仍未归口 |
| paper_cards/984-2608-11341(Apodex Discovery) | evaluation | ✅ paper_card 已建;❌ eval.md R50 仍未归口 |
| paper_cards/988-2608-16776(GRIP) | rag | ✅ paper_card 已建;eval 邻接(query dominance failure mode) |
| paper_cards/985-2608-03744(Agents Catching Agents) | agent | agent 主分类,非 eval 专项 |
| paper_cards/1004-2608-15089(StateM) | agent | ✅ paper_card 已建;eval 邻接(Terminal-Bench harness) |
| paper_cards/1001-2608-14905(Agentic Transaction) | agent | ✅ paper_card 已建;eval 邻接(Agent 评测邻接) |
| knowledge/evaluation.md R50 | 2026-08-18 15:40 | 确认现有脉络:79 维 + 33 邻接 + 130 子领域 + §2.207 13 元组 + 立标池双向锚第 5 日 + AgentRx 邻接级候选 |
结论
本轮(E1-R51,2026-08-19)eval 主题eval 专项 net-new paper_card 3 条(HarnessEval-W 111▲ ★★★ + Gathered Not Admitted ★★★ + Accuracy and Order Sensitivity ★★)。
立标池双向锚结构性变化(R51 第 6 日): - HarnessEval-W(111▲)+ StateM(130▲)双新锚:共同锚定"harness 化评测方法学"方向(Terminal-Bench harness ↔ World Model harness ↔ Agent harness 安全) - PlayWorld 衰减确认(8-15→8-16→8-17→8-18→8-19 跌出 top 15) - LiveAnimate 二次跌出(重入后再次跌出 top 15) - LLMRouter/DarwinX/Mechanist 全部维持但绝对值持续下降
eval 专项净增 3 条 + eval 邻接候选 5 条: - eval 专项: - HarnessEval-W(2608.16859,111▲,world model harness 化评测,★★★ - Gathered Not Admitted(2608.15022,workspace 闸门假说证伪,★★★) - Accuracy and Order Sensitivity(2608.11947,label-free 策略位置偏差,★★)
- eval 邻接候选:
- Large Discovery Models(2608.15669,49▲,科学发现开放搜索评测)
- GRIP(2608.16776,query dominance failure mode benchmark)
- ClawGym II(2608.16798,34▲,harness 自我改进黑盒 RL,paper_card 未建)
- 信息满足度(2608.14457,Cool Papers 精选,面向读者摘要评估维度,paper_card 未建)
- HarnessRisk(2608.17597,harness 生命周期安全 128 场景,paper_card 未建)
涉及 arXiv 号:2608.16859(✅ paper_card 已建/net-new ★★★)、2608.15022(✅ paper_card 已建/net-new ★★★)、2608.11947(✅ paper_card 已建/net-new ★★)、2608.15669(✅ 已建卡/eval 主分类)、2608.16776(✅ 已建卡/eval 邻接)、2608.16798(❌ paper_card 未建)、2608.14457(❌ paper_card 未建)、2608.17597(❌ paper_card 未建)
建议后续动作: - [ ] HarnessEval-W(2608.16859)立基础锚 ★★★(HF Daily #2 111▲ + eval 专项最高信号) - [ ] Gathered Not Admitted(2608.15022)立基础锚 ★★★(work-queue 选题榜 + 证伪性发现) - [ ] ClawGym II(2608.16798)paper_card 新建(HF Daily #7 34▲) - [ ] 信息满足度(2608.14457)paper_card 新建(Cool Papers 精选,eval 方法学新维度) - [ ] HarnessRisk(2608.17597)paper_card 新建(harness 安全评测) - [ ] Is this Citation on Point?(2608.12571)eval.md 归口(跨轮 R45→R51 遗留) - [ ] Apodex Discovery(2608.11341)eval.md 归口(跨轮 R47→R51 遗留) - [ ] CPI-Bench(2608.14546)eval.md 归口(跨轮遗留) - [ ] Forecast Collapse(2608.14106)eval.md 归口(跨轮遗留) - [ ] MobileMem(2608.13606)eval.md 归口(跨轮遗留) - [ ] MMLongEmbed(2606.14747)paper_card 新建 + §2.207 候选(flyp 精读待 A4 核实) - [ ] MerchantBench(2607.29677)arXiv ID 官方核实 + paper_card 新建 - [ ] AgentRx(2605.10286)paper_card 新建(R50 §2.207 第 13 元组候选)
Tom · 2026-08-19 15:40 CST · E1 预消化简报 · evaluation 主题 · 3 条 eval 专项 net-new(HarnessEval-W ★★★ + Gathered Not Admitted ★★★ + Accuracy&Order Sensitivity ★★)+ 5 条 eval 邻接候选 + 立标池 harness 化方向结构性强化 · 涉及 arXiv:2608.16859(✅已建卡/net-new ★★★)/ 2608.15022(✅已建卡/net-new ★★★)/ 2608.11947(✅已建卡/net-new ★★)/ 2608.15669(✅已建卡/eval主分类)/ 2608.16776(✅已建卡/eval邻接)/ 2608.16798(❌未建卡/ClawGym)/ 2608.14457(❌未建卡/信息满足度)/ 2608.17597(❌未建卡/HarnessRisk)