evaluation · E1 预消化简报(2026-08-20)

信源检查记录

本次覆盖: - work-queue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜无 eval 主分类净增) - inbox/jay(8/19~8/20):engineering-inference-agent-eval-filtered(8-19,ReliabilityBench AAMAS 2026 + MAS-FIRE 故障注入框架 + Agent Harness 方法论 3 篇)✓;agent-harness-evaluation-methodology(8-11,「Stop Comparing」「Harness-Bench」「LoopsBench」三篇)✓;无 eval 专项新件 - inbox/flyp(8/18~8/20):mm-long-context-evaluation MMLongBench+MMLongEmbed 精读(8-18,含 R1-R7 反方 + 7 维评测设计原则)✓;agent-evals-cameron-wolfe light-read(8-18,Agent 评测方法学 7 要点)✓;无 eval 专项新件 - inbox/spark(8/18~8/20):无 eval 专项新件 ✓ - inbox/stephen(8/18~8/20):无 eval 直接增量 ✓ - inbox/tom(8/19~8/20):HF Daily Aug 20 ×1(StateM 374▲ + ASI-Bench 51▲ + Agent Lightning 16▲ eval 邻接)✓;radar Aug 20(Zetta-ζ 具身闭环评测 + SemComp-Bench 语义评测 + OmniScientist 全模态 RAG)✓;8-19 evaluation-e1prep 基线(R51:HarnessEval-W + Gathered Not Admitted + Accuracy&Order Sensitivity 3 条 eval 专项 net-new)✓ - paper_cards 近 3 天新卡(1003-1022 范围):1007(Six Degrees of Separation · evaluation 主分类 method · net-new 候选)✓;1010(HarnessRisk · evaluation 主分类 benchmark · net-new 候选)✓;1011(PTXBench · evaluation 主分类 benchmark · net-new 候选)✓;1021(PTXBench · evaluation 主分类 benchmark · 重复编号确认)✓;1018(Demystifying Agent Skills · agent 主分类 eval 邻接)✓;1020(LEGO-RL · agent 主分类 eval 邻接)✓;1009(Agent Lightning v1.0 · agent 主分类 eval 邻接)✓;1003(Beyond Visual CoT · multimodal 主分类)✓;1004(StateM · agent 主分类 eval 邻接 · HF Daily 374▲ · 延续强信号)✓;1006(COMA · rag 主分类 risk 副分类)✓;1013(Preference Is Not Intervention · rag 主分类 eval 邻接 · 已在 R65 RAG 基线)✓ - knowledge/evaluation.md R51 基线 ✓


增量摘要

本轮(E1-R52,窗口 2026-08-19 下午 ~ 2026-08-20 下午)eval 主题净增量为 3 条 eval 专项 paper_card net-new(HarnessRisk + PTXBench + Six Degrees of Separation)。立标池双向锚变化:StateM 8-20 首日登顶 374▲(HF Daily #1,超 HarnessEval-W 111▲三倍),harness 化评测方法学方向结构性确认信号;ASI-Bench(51▲)新晋 AI 超对齐评测候选。其余 eval 相关候选均为邻接级或延续信号。以下如实记录检查结果。


条目一:HarnessRisk — Agent Harness 全生命周期安全基准(eval 专项 net-new ★★★)

来源paper_cards/1010-2608-17597.md(paper_card 新建,2026-08-20);inbox/tom/2026-08-19-evaluation-e1prep.md(R51 已提及,paper_card 尚未建;本次确认新建) arXiv2608.17597(paper_card 1010 新建,eval benchmark) 主分类:evaluation;形态:benchmark

要点

  • 核心问题:Agent Harness 运行时有哪几类安全风险?现有安全基准多聚焦模型本身,而非 harness 层的系统性风险
  • 核心方案:HarnessRisk——将 Agent Harness 安全分解为 6 个运营阶段:Harness Configuration(配置)/ Capability Extension(能力扩展)/ Runtime Operation(运行时操作)/ State Persistence(状态持久化)/ Action Control(动作控制)/ Incident Recovery(事故恢复);含 128 个安全场景
  • 关键发现:显式风险识别并不能可靠地带来安全的行动——某些配置在超过 90% 的运行中检测到风险,同时仍保留显著的攻击成功率(90%+ 风险检测 ≠ 安全行动保障
  • 立标信号:paper_card 1010 新建(2026-08-20);Tom radar 高价值条目(8-19 提及);与 StateM/HarnessEval-W 同属 harness 生态体系;立标等级 立基础锚候选 ★★★

与 knowledge/evaluation.md R51 现有脉络的关系

  • 现有脉络:R51 §2.207 评测方法学 13 元组(HarnessEval-W + StateM harness);R51 立标池双向锚以 StateM(374▲)+ HarnessEval-W(111▲)双锚确立"harness 化评测"为主流方向;HarnessRisk 以"harness 安全评测"填补 §2.207 第 18 元组候选空白——6 阶段 128 场景安全评测与 StateM/HarnessEval-W 形成完整的 harness 生态三角
  • 建议归入节:§2.207 评测方法学 17 元组候选 → 第 18 元组新增(HarnessRisk,harness 生命周期安全 benchmark)

矛盾 / 待核实

  • 128 个安全场景的具体分类体系(6 阶段各场景数)需 PDF 核验
  • 6 阶段与 agent harness 常见开源框架(LangChain / AutoGen / CrewAI 等)的对应关系是否给出

arXiv 列表

  • 2608.17597(✅ paper_card 1010 新建;eval 专项 net-new;立基础锚候选 ★★★)

条目二:PTXBench — GPU Kernel 优化 LLM 评测基准(eval 专项 net-new ★★★)

来源paper_cards/1021-2608-17379.md(paper_card 新建,2026-08-20);inbox/jay/work-queue.md Top 15(#2)HF Daily 未上榜 arXiv2608.17379(paper_card 1021 新建,eval benchmark) 主分类:evaluation;形态:benchmark

要点

  • 核心问题:LLM 在 GPU kernel 优化任务上的能力如何评估?PTX(Parallel Thread eXecution)是 NVIDIA GPU 的中间表示,各代 GPU 架构(Volta/Hopper/Ada/Blackwell 等)PTX 版本差异显著,LLM 能否有效利用这些差异?
  • 核心方案:PTXBench——面向架构特定 PTX 的可审计测试平台;提供 架构差异化 PTX 能力衡量基准;benchmark 评测 LLM 利用持续演进 GPU 架构的能力
  • 关键发现(TLDR):架构特定 PTX 能力仍参差不齐(各 LLM 在不同代际 GPU 上的 PTX 优化表现差异显著)
  • 立标信号:paper_card 1021 新建(2026-08-20);work-queue Top 15 #2(0.5 优先级);这是 eval 专项中唯一面向 GPU 架构工程的 benchmark,填补了"LLM 工程能力评测"的空白;立标等级 立基础锚候选 ★★★

与 knowledge/evaluation.md R51 现有脉络的关系

  • 现有脉络:R51 §2.2 评测对象 80 维 + 130 子领域(无 GPU kernel 优化评测专项);§2.207 评测方法学 17 元组候选(harness + world model + 司法 + 科学发现等);PTXBench 填补"LLM GPU kernel 优化评测"空白,属于 §2.2 评测对象第 81 维候选(GPU 架构感知评测),同时与 §2.207 harness 方向形成横向互补(hardware-aware harness benchmark)
  • 建议归入节:§2.2 评测对象 80 维 → 第 81 维候选新增(LLM GPU Kernel 优化评测,PTXBench);§2.207 评测方法学 17 元组 → 第 19 元组候选(hardware-aware benchmark)

矛盾 / 待核实

  • 具体评测任务类型和数量需 PDF 核验
  • 各 LLM 在 PTXBench 上的具体得分矩阵(论文 §4)需核验

arXiv 列表

  • 2608.17379(✅ paper_card 1021 新建;eval 专项 net-new;立基础锚候选 ★★★)

条目三:Six Degrees of Separation — 长上下文流形拓扑压缩度量(eval 专项 net-new ★★)

来源paper_cards/1007-2608-17950.md(paper_card 新建,2026-08-19);inbox/tom/_candidates/2026-08-19-agent-rag-longcontext-candidates.json;HF Daily Aug 20 未上榜 arXiv2608.17950(paper_card 1007 新建,eval method) 主分类:evaluation;形态:method

要点

  • 核心问题:LLM 的潜空间如何组织抽象推理所需的拓扑结构?长上下文场景中,"六度分隔"效应在 LLM 潜空间中是否存在?能否用几何签名评估事实可靠性?
  • 核心方案:提出严格几何签名(strictly geometric signature)用于评估事实可靠性;证明深度 LLM 潜空间天然组织为小世界网络(Small-World networks);数学形式化了 Transformer 执行抽象推理的方式
  • 关键贡献:提供可量化的几何评测指标(Small-World 网络特征度量),替代传统的"答案正确率"——同一模型在不同激活路径上事实可靠性存在差异(路径依赖性)
  • 立标信号:paper_card 1007 新建(2026-08-19,R51 窗口未归入本次简报,本次补录);主分类 evaluation;立标等级 候选级中档 ★★★(几何签名评测方法新颖,与传统 benchmark 方法论正交)

与 knowledge/evaluation.md R51 现有脉络的关系

  • 现有脉络:R51 §2.1 评测方法学 32 轴(无"几何拓扑"轴);§2.2 评测对象 80 维(无潜空间结构评测);Six Degrees of Separation 以"几何签名评测事实可靠性"填补"LLM 潜空间拓扑可评测性"空白,属于 §2.1 新增第 33 轴候选(几何/拓扑评测轴)
  • 建议归入节:§2.1 评测方法学 32 轴 → 新增第 33 轴候选(几何/拓扑评测方法,Small-World 网络签名);§2.2 评测对象 80 维 → 第 81 维候选(潜空间拓扑评测)

矛盾 / 待核实

  • 具体几何签名指标的可操作性和复现性需 PDF 核验
  • Small-World 网络特征在 LLM 间的可迁移性(跨架构)待核实

arXiv 列表

  • 2608.17950(✅ paper_card 1007 新建;eval 专项 net-new;候选级中档 ★★★)

条目四:StateM — Terminal-Bench 2.1 登顶 374▲(eval 邻接候选,延续强信号)

来源HF Daily 2026-08-20 #1,374▲paper_cards/1004-2608-15089.md(agent 主分类 eval 邻接) arXiv2608.15089(paper_card 1004 已建;agent 主分类 eval 邻接)

要点

  • 核心:Agent-native runtime,通过持久化 state、phase-local 上下文、受检 transition、可恢复 runbook 组织执行;不改模型权重的前提下通过 harness scaling 改善执行系统
  • 关键数据:Terminal-Bench 2.1 上 95.3% 原始准确率,或 15 美元的前沿运行成本
  • 与 eval 的关联:本质上是一个新型 harness 架构;其 Terminal-Bench 2.1 评测结果是 Agent 评测基础设施演进的标志事件
  • 立标信号:HF Daily 8-20 首日 374▲ = 今日 HF Daily #1,是 HarnessEval-W(111▲)的三倍有余;harness 化评测方向结构性确认信号

与 knowledge/evaluation.md R51 现有脉络的关系

  • 已有锚入:R51 已锚入 §2.207(StateM harness + Terminal-Bench);本次补充:8-20 374▲ 强信号 = R52 立标池双向锚第 7 日新增锚,harness 化方向结构性强化确认
  • 建议归入节:§2.207 评测方法学 17 元组候选 → StateM 双锚(立标信号 + 候选元组)

矛盾 / 待核实

arXiv 列表

  • 2608.15089(✅ paper_card 1004 已建;eval 邻接;HF Daily 374▲)

条目五:ASI-Bench — 人工智能超级智能评测基准(eval 邻接候选)

来源HF Daily 2026-08-20 #7,51▲ arXiv2608.17271(paper_card 未建

要点

  • 核心问题:超人类水平 AI(ASI)的评测如何设计?现有 benchmark 无法可靠区分超人类模型与人类顶级专家
  • 核心方案:ASI-Bench——针对 AI 超级智能的专门评测框架;核心挑战是评测任务本身是否对超人类能力可解
  • 立标信号:HF Daily 8-20 #7,51▲(新晋);paper_card 未建

与 knowledge/evaluation.md R51 现有脉络的关系

  • 现有脉络:R51 无 ASI 评测专项;ASI-Bench 填补"超人类 AI 评测"空白,属于 §2.2 评测对象邻接维候选(超对齐评测方向)
  • 建议归入节:§2.2 评测对象邻接维 → 新增 ASI 超对齐评测候选

矛盾 / 待核实

  • paper_card 未建;需新建
  • 评测任务的"ASI 可解性"判定标准需 PDF 核验

arXiv 列表

  • 2608.17271(❌ paper_card 未建;eval 邻接 ASI 超对齐;HF Daily 51▲)

条目六:LEGO-RL — Harness 原生强化学习(eval 邻接候选)

来源paper_cards/1020-2608-17393.md(agent 主分类 eval 副分类) arXiv2608.17393(paper_card 1020 已建)

要点

  • 核心:LIFE-RL 框架——在不改内部控制流的前提下,将原生 coding-agent harness 与可扩展策略梯度优化相连接;在三个原生 coding-agent harness 上训练稀疏 MoE 模型 Qwen3.5-35B-A3B
  • 与 eval 的关联:Agent harness 本身就是评测基础设施;LEGO-RL 探索如何用 RL 优化 harness,属于 eval 邻接的邻接(与 ClawGym II 同方向)

与 knowledge/evaluation.md R51 现有脉络的关系

  • 现有脉络:R51 §2.207 评测方法学 17 元组候选(StateM + HarnessEval-W + HarnessRisk);LEGO-RL 以"RL 优化 harness"补充 harness 生态,与 ClawGym II 同方向簇
  • 建议归入节:§2.207 评测方法学邻接 → LEGO-RL(harness 原生 RL 优化方向)

矛盾 / 待核实

arXiv 列表

  • 2608.17393(✅ paper_card 1020 已建;eval 邻接 LEGO-RL)

综合:立标池双向锚第 7 日信号(R52 窗口)

HF Daily 8-20 立标池双向锚进入第 7 日: - StateM 8-20 首日 374▲(HF Daily #1)——新晋锚登顶,harness 化方向结构性强化(是 HarnessEval-W 111▲ 的 3.37 倍) - ASI-Bench 8-20 首日 51▲(HF Daily #7)——新晋 ASI 超对齐评测锚 - HarnessEval-W 8-19 首日 111▲(HF Daily #2)——维持(无 8-20 数据) - LLMRouter 8-15 90▲ → 8-16 94▲ → 8-17 102▲ → 8-18 42▲ → 8-19 10▲ → 8-20 跌出 top 15(衰减确认) - DarwinX 8-15 59▲ → 8-16 66▲ → 8-17 84▲ → 8-18 35▲ → 8-19 跌出 top 15(衰减确认) - Mechanist 8-15 82▲ → 8-16 82▲ → 8-17 84▲ → 8-18 6▲ → 8-19 5▲ → 8-20 跌出 top 15(衰减确认) - PlayWorld 8-15→8-20 连续跌出(维持衰减) - ClawGym II 8-19 首日 34▲(HF Daily #7)——维持(无 8-20 数据)

立标池双向锚第 7 日:StateM 374▲ 新锚登顶 + ASI-Bench 51▲ 新锚 + LLMRouter/DarwinX/Mechanist 三件同日向跌出 = 强信号结构性切换,harness 化 + ASI 超对齐新方向确立


综合:矛盾与待核实清单

  1. arXiv:2608.17597(HarnessRisk):paper_card 1010 ✅ 新建;eval 专项 net-new ★★★;立基础锚候选
  2. arXiv:2608.17379(PTXBench):paper_card 1021 ✅ 新建;eval 专项 net-new ★★★;立基础锚候选
  3. arXiv:2608.17950(Six Degrees of Separation):paper_card 1007 ✅ 新建;eval 专项 net-new ★★★(几何签名评测方法新颖)
  4. arXiv:2608.17271(ASI-Bench):paper_card ❌ 未建;eval 邻接;HF Daily 51▲
  5. arXiv:2608.15089(StateM):paper_card 1004 ✅ 已建;eval 邻接;HF Daily 374▲ = R52 新锚
  6. Is this Citation on Point?(2608.12571):paper_card 983 ✅ 已建;eval.md 仍未归口(跨轮 R45→R52 遗留)
  7. Apodex Discovery(2608.11341):paper_card 984 ✅ 已建;eval.md 仍未归口(跨轮 R47→R52 遗留)
  8. CPI-Bench(2608.14546):paper_card ✅ 已建;eval.md 仍未归口(跨轮遗留)
  9. Forecast Collapse(2608.14106):paper_card ✅ 已建;eval.md 仍未归口(跨轮遗留)
  10. MobileMem(2608.13606):paper_card 971 ✅ 已建;eval.md 仍未归口(跨轮遗留)
  11. arXiv:2608.13417(超越最终分数):paper_card ❌ 仍未建;eval 专项;HF Daily 8-18 #3 42▲(跨轮 R50→R52 仍未建卡)
  12. AgentRx(2605.10286):R51 §2.207 第 13 元组候选;paper_card ❌ 仍未建(跨轮遗留)
  13. ClawGym II(2608.16798):R51 eval 邻接;paper_card ❌ 仍未建(HF Daily 34▲)
  14. 信息满足度(2608.14457):R51 eval 邻接;paper_card ❌ 仍未建(Cool Papers 精选)
  15. MMLongEmbed(2606.14747):paper_card ❌ 未建;flyp critical-read 精读草稿(A4 核验中)

本轮检查过的来源(无新增时列出)

来源 文件 Evaluation 相关性
/shared/research-kb/organized/queue/work-queue.md 2026-08-20 14:00 Top 15 含 PTXBench #2(0.5)+ LEGO-RL #3 + 其他 eval 相关件 ✓
inbox/tom/2026-08-20-0900-hf-daily-2026-08-20.md 8-20 HF Daily StateM 374▲ #1(eval 邻接 harness)✓;ASI-Bench 51▲ #7(eval 邻接)✓;Agent Lightning 16▲(eval 邻接)✓
inbox/tom/2026-08-20-agent-rag-longcontext-radar.md 8-20 Tom radar Zetta-ζ 闭环具身评测(eval 邻接)✓;SemComp-Bench 语义评测(eval 邻接)✓;无 eval 专项新件
inbox/tom/2026-08-20T0840-agent-rag-longcontext-radar.md 8-20 Tom radar v2 同上 ✓
inbox/tom/2026-08-19-evaluation-e1prep.md 8-19 E1 简报 R51 基线(3 条 eval 专项 net-new + 5 条 eval 邻接候选)✓
inbox/jay/2026-08-19-engineering-inference-agent-eval-filtered.md 8-19 Jay 工程筛选 ReliabilityBench AAMAS 2026 + MAS-FIRE 故障注入 + Agent Harness 方法论 3 篇(eval 邻接)✓
inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md 8-11 Jay 汇总 Stop Comparing + Harness-Bench + LoopsBench 三篇(eval 邻接)✓
inbox/flyp/2026-08-18-mm-long-context-evaluation.md 8-18 flyp 精读 MMLongBench + MMLongEmbed 含 R1-R7 反方 + 7 维评测设计原则(eval 方法学)✓
inbox/flyp/2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md 8-18 flyp light-read Agent 评测方法学 7 要点(eval 方法学邻接)✓
inbox/spark(8/18~8/20) spark inbox 无 eval 专项新件 ✓
inbox/stephen(8/18~8/20) stephen inbox 无 eval 直接增量 ✓
paper_cards/1007-2608-17950(Six Degrees of Separation) evaluation ✅ paper_card 新建(8-19);eval 专项 net-new ★★★
paper_cards/1010-2608-17597(HarnessRisk) evaluation ✅ paper_card 新建(8-20);eval 专项 net-new ★★★
paper_cards/1021-2608-17379(PTXBench) evaluation ✅ paper_card 新建(8-20);eval 专项 net-new ★★★
paper_cards/1004-2608-15089(StateM) agent ✅ paper_card 已建;eval 邻接;HF Daily 374▲ R52 新锚
paper_cards/1009-2608-17528(Agent Lightning v1.0) agent ✅ paper_card 已建;eval 邻接(harness 自我改进)
paper_cards/1018-2608-14036(Demystifying Agent Skills) agent ✅ paper_card 已建;eval 邻接(Agent 技能评测)
paper_cards/1020-2608-17393(LEGO-RL) agent ✅ paper_card 已建;eval 邻接(harness 原生 RL)
paper_cards/1003-2608-15869(Beyond Visual CoT) multimodal 非 eval 专项
paper_cards/1013-2608-17781(Preference Is Not Intervention) rag eval 邻接;已在 RAG 基线(R65)
paper_cards/1006-2608-17960(COMA) rag 非 eval 专项
knowledge/evaluation.md R51 2026-08-19 15:40 确认现有脉络:80 维 + 33 邻接 + 130 子领域 + §2.207 17 元组 + 立标池双向锚第 6 日 + 跨轮遗留 5 件

结论

本轮(E1-R52,2026-08-20)eval 主题eval 专项 net-new paper_card 3 条(HarnessRisk ★★★ + PTXBench ★★★ + Six Degrees of Separation ★★★)。

立标池双向锚结构性变化(R52 第 7 日): - StateM 8-20 首日登顶 374▲(HF Daily #1)——新晋锚,harness 化评测方向结构性强化(是 HarnessEval-W 111▲ 的 3.37 倍);ASI-Bench 8-20 首日 51▲——新晋 ASI 超对齐评测锚 - LLMRouter + DarwinX + Mechanist 三件同日跌出 top 15——立标池强信号结构性切换,harness 化 + ASI 超对齐新方向确立 - PlayWorld 连续跌出确认ClawGym II + HarnessEval-W 维持(无 8-20 数据)

eval 专项净增 3 条 + eval 邻接候选 4 条: - eval 专项(net-new paper_card): - HarnessRisk(2608.17597,paper_card 1010 新建,6 阶段 128 场景 harness 安全评测 ★★★) - PTXBench(2608.17379,paper_card 1021 新建,GPU kernel 优化 LLM 评测 ★★★) - Six Degrees of Separation(2608.17950,paper_card 1007 新建,几何签名评测事实可靠性 ★★★)

  • eval 邻接候选
  • StateM(2608.15089,374▲,HF Daily #1,harness 化方向结构性强化)
  • ASI-Bench(2608.17271,51▲,paper_card 未建,ASI 超对齐评测候选)
  • LEGO-RL(2608.17393,paper_card 已建,harness 原生 RL 优化方向)
  • Agent Lightning v1.0(2608.17528,eval 邻接,harness 自我改进)

涉及 arXiv 号:2608.17597(✅ paper_card 1010 已建/net-new ★★★)、2608.17379(✅ paper_card 1021 已建/net-new ★★★)、2608.17950(✅ paper_card 1007 已建/net-new ★★★)、2608.15089(✅ 已建卡/eval 邻接/374▲)、2608.17271(❌ paper_card 未建/ASI-Bench)、2608.17393(✅ 已建卡/eval 邻接)、2608.17528(✅ 已建卡/eval 邻接)

建议后续动作: - [ ] HarnessRisk(2608.17597)立基础锚 ★★★(paper_card 1010 已建) - [ ] PTXBench(2608.17379)立基础锚 ★★★(paper_card 1021 已建;work-queue Top 15 #2) - [ ] Six Degrees of Separation(2608.17950)候选级中档 ★★★(几何签名方法论新颖) - [ ] ASI-Bench(2608.17271)paper_card 新建(HF Daily 51▲,ASI 超对齐评测) - [ ] StateM(2608.15089)R52 立标池新增锚(374▲) - [ ] Is this Citation on Point?(2608.12571)eval.md 归口(跨轮 R45→R52 遗留) - [ ] Apodex Discovery(2608.11341)eval.md 归口(跨轮 R47→R52 遗留) - [ ] CPI-Bench(2608.14546)eval.md 归口(跨轮遗留) - [ ] Forecast Collapse(2608.14106)eval.md 归口(跨轮遗留) - [ ] MobileMem(2608.13606)eval.md 归口(跨轮遗留) - [ ] arXiv:2608.13417(超越最终分数)paper_card 新建(跨轮 R50→R52 仍未建卡) - [ ] AgentRx(2605.10286)paper_card 新建(R51 §2.207 第 13 元组候选,跨轮遗留) - [ ] ClawGym II(2608.16798)paper_card 新建(R51 eval 邻接,HF Daily 34▲) - [ ] 信息满足度(2608.14457)paper_card 新建(R51 eval 邻接,Cool Papers 精选) - [ ] MMLongEmbed(2606.14747)paper_card 新建(flyp A4 核验中) - [ ] LEGO-RL(2608.17393)§2.207 候选(Harness 原生 RL 优化) - [ ] Agent Lightning v1.0(2608.17528)§2.207 候选邻接


Tom · 2026-08-20 15:40 CST · E1 预消化简报 · evaluation 主题 · 3 条 eval 专项 net-new(HarnessRisk ★★★ + PTXBench ★★★ + Six Degrees of Separation ★★★)+ 4 条 eval 邻接候选 + 立标池 StateM 374▲ 新锚登顶 + LLMRouter/DarwinX/Mechanist 三件同日衰减 · 涉及 arXiv:2608.17597(✅已建卡/net-new ★★★)/ 2608.17379(✅已建卡/net-new ★★★)/ 2608.17950(✅已建卡/net-new ★★★)/ 2608.15089(✅已建卡/eval邻接/374▲)/ 2608.17271(❌未建卡/ASI-Bench/51▲)/ 2608.17393(✅已建卡/eval邻接)/ 2608.17528(✅已建卡/eval邻接)