evaluation · E1 预消化简报(2026-08-07)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-05 下午 ~ 2026-08-07)+ paper_cards 近 3 天新卡(766-795)+ HF Daily 8-07 票榜 本简报目的: 为今晚 evaluation 活文档接力(R38 → R39)预习备料,聚焦尚未进入 knowledge/evaluation.md R38 基线的增量条目 背景说明: R38 于 2026-08-06 15:40 收官(ChronoLens 跨学科语言演化 + AntiSkillBench persona-skill 安全 + FinIndices 金融推理可信度 + PAST-Bench 主邻接维升格)。本期覆盖 2026-08-05 下午至 2026-08-07 下午增量,发现 evaluation 主题 ArXiv 供给出现质量型回暖:主分类 evaluation 新增 2 件 paper_cards 建卡(GDPevo + FinanceHarness)+ 1 件 HF Daily 新入待建卡(NOLLI);HF Daily 8-07 票榜连续第三日出现"完全替换态 100% 净换手率",ABSeeker 以 agent 主分类登顶(55▲)。


执行摘要

本期 evaluation E1 预消化发现 3 条确认增量(1 件 paper_cards 建卡 + 1 件 paper_cards 建卡确认 + 1 件 HF Daily 新入待建卡)+ 2 条待建卡候选,共涉 5 个新 arXiv 号。相比上期(R38 收官,4 确认 + 0 待建卡),本期 eval 专项增量规模相当,但结构不同:

  1. paper_cards 8-6/8-7 批次新增 2 件 evaluation 主分类卡(778 GDPevo + 794 FinanceHarness):两件均为 Agent 自进化与领域深度研究评测方向——GDPevo 以 GDP 相关企业工作流为场景的经济价值驱动评测,FinanceHarness 以金融领域 deep research 为场景的分层 Harness 设计
  2. HF Daily 8-07 新入 1 件 evaluation 主分类待建卡:NOLLI(2608.04397):英韩性能差距的难度校准谜题基准——多语言评测方法学专项,paper_cards 尚未建卡,候选强度 17▲
  3. HF Daily 8-07 新入 2 件 agent 主分类邻接 evaluation 待建卡候选(OneDayAgent 2608.05013 + Skill-Native LLM 2608.05139):均含显著评测维度,值得邻接关注
  4. HF Daily 8-07 票榜连续第三日"完全替换态 100% 净换手率":ABSeeker(#1,55▲)+ GDPevo(#6,21▲)+ NOLLI(#10,17▲)新入;LongHorizon-Harness(S38 #2 立标级)自 8-05 之后连续 3 日未返 top 15,立标饱和度"48~72h 半衰期"信号确认

核心脉络是:evaluation 从"场景专化 benchmark"(R38 ChronoLens/AntiSkillBench/FinIndices 三件套)向"领域专用 Harness + 自进化评测"演进——GDPevo 填补"经济价值驱动评测"空白,FinanceHarness 填补"金融领域 deep research 分层 Harness + point-in-time 基准"空白,NOLLI 填补"多语言难度校准方法学"空白。


增量条目(3 条确认 + 2 条待建卡候选)


增量 1 · P1 确认 · GDPevo(arXiv:2608.03764):GDP 相关企业工作流驱动的 Agent 自进化评测基准

来源: paper_cards/778-2608-03764.md(主分类 evaluation,形态 benchmark,副分类 agent)+ HF Daily 8-07 #6 21▲ + tom 8-06 2040 radar 来源归档 arXiv: 2608.03764 TLDR(来源:paper_cards): Agent 自进化根据过往经验更新 agent 的持久状态,并复用该状态以更高效地解决相关任务。自进化的评估具有难度:现有基准对具备经济价值的任务领域覆盖不足,且训练任务与测试任务的设计无法保证测试阶段增益确实源于训练经验,同时仍易受数据污染影响。GDPevo 是以 GDP 相关企业工作流为根基、面向进化的基准,以及生成该基准的全自动化数据流水线。 卡状态: ✅ paper_cards/778 已建(主分类 evaluation,形态 benchmark,副分类 agent)

要点: - 核心问题:Agent 自进化评测缺乏经济价值场景支撑,现有基准无法保证"测试阶段增益确实源于训练经验"——存在 attribution 问题与数据污染漏洞 - 核心方案:GDPevo = 以 GDP 相关企业工作流为场景的经济价值驱动 benchmark + 全自动化数据生成流水线——确保训练/测试任务的 attribution 可追溯 - 评测维度:自进化能力(经验 → 持久状态更新 → 相关任务效能提升)+ 数据污染防控——直接对应 R38 PAST-Bench(经验保留是否真的好)的扩展:GDPevo 进一步问"经验转化经济价值任务的效能是否可归因" - 方法论价值:首次将"经济价值"引入 Agent 自进化评测——为"什么样的经验值得保留"提供价值度量,与 PAST-Bench(记忆价值)和 LongHorizon-Harness(状态管理)共同构成 Agent 长程行为评测三件套 - 与 R38 已有工作的关系:R38 PAST-Bench 问"记忆保留是否真的好",GDPevo 问"经验转化经济价值任务的效能是否可归因"——两者同属"Agent 长程经验价值评测"方向,GDPevo 更强调 attribution 和防污染

与 knowledge/evaluation.md R38 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——GDPevo 是"Agent 自进化评测"的新增案例,可归入"场景专化型 benchmark"第 14 件(企业工作流经济价值场景) - 落入 §2.7「评测对象的横向分化」——新增"Agent 自进化经济价值评测"行(GDPevo) - 与 §2.6「失败模式分析」邻接:GDPevo 的 attribution 问题(测试阶段增益是否真的源于训练经验)与 Model or Harness?(失败归因分类法)形成"归因"维度的跨主题呼应

建议归入节: §2.2 Benchmark 设计(新增 GDPevo 为 Agent 自进化经济价值评测基准)+ §2.7 评测对象横向分化(新增"Agent 自进化经济价值评测"行)+ §2.6 失败模式分析(邻接 attribution 问题)

arXiv: 2608.03764


增量 2 · P1 确认 · FinanceHarness(arXiv:2607.27853):金融领域自主深度研究分层 Harness 与 Point-in-Time 基准

来源: paper_cards/794-2607-27853.md(主分类 evaluation,形态 benchmark,副分类 agent)+ tom 8-07 0840 radar 高价值候选 #2 + jay 8-07 ai-engineering-weekly 来源归档 arXiv: 2607.27853 TLDR(来源:paper_cards): 得益于 LLM 与自主 Agent 的进展,深度研究已成为应用最广泛的智能体产品之一。然而多数深度研究系统产出的是通用报告,难以满足金融深度研究的需求。金融研究依赖专业知识来剖析历史规律并预测未来事件,因此其自动化既需要一个分层 harness 来驱动研究 Agent,也需要一个可验证的 point-in-time 基准以避免未来信息泄露。FinanceHarness 是一个运行面向金融的 deep research agent 的 harness,并配套可验证 point-in-time 基准。 卡状态: ✅ paper_cards/794 已建(主分类 evaluation,形态 benchmark,副分类 agent)

要点: - 核心问题:通用 deep research 系统不适用于金融领域——金融研究要求"剖析历史规律 + 预测未来事件",需要专业知识驱动,且必须防止未来信息泄露(point-in-time 基准) - 核心方案:FinanceHarness = 分层 Harness(驱动金融研究 Agent)+ 可验证 point-in-time 基准(防未来信息泄露)——将"领域知识特殊性"和"时点纯净性"同时纳入评测设计 - 评测维度:金融分析质量 + 预测准确性 + point-in-time 合规性(未来信息零泄露)+ 分层 Harness 有效性——直接对应 R38 FinIndices(金融推理可信度)的上游:FinanceHarness 提供评测框架,FinIndices 提供评测指标 - 方法论价值:首次将"point-in-time 基准"引入 Agent deep research 评测——解决"金融预测是否泄露未来信息"这一评测设计难题,可推广到其他需要时点纯净性的领域(法律/医疗/历史研究) - 与 R38 FinIndices 的互补关系:FinIndices 评估"数值精度 + 跨报表关联 + 时间反累积";FinanceHarness 评估"分层 Harness 设计 + point-in-time 基准合规性"——两者共同构成"金融领域 deep research 评测"完整体系

与 knowledge/evaluation.md R38 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——FinanceHarness 是"领域深度研究评测"的新增案例,可归入"场景专化型 benchmark"第 15 件(金融 deep research 场景) - 落入 §2.4「Judge & Harness 工程」——FinanceHarness 提供的"分层 Harness 设计 + point-in-time 基准"是 Harness 工程的新方向,属于 R37 RecHarness(Bandit 路由 Harness)在金融领域的专项深化 - 落入 §2.7「评测对象的横向分化」——新增"金融领域 deep research 评测"行(FinanceHarness)

建议归入节: §2.2 Benchmark 设计(新增 FinanceHarness 为金融 deep research 评测基准)+ §2.4 Judge & Harness 工程(新增 FinanceHarness 分层 Harness + point-in-time 基准方法论)+ §2.7 评测对象横向分化(新增"金融领域 deep research 评测"行)

arXiv: 2607.27853


增量 3 · P1 确认 · NOLLI(arXiv:2608.04397):英韩性能差距难度校准谜题基准——多语言评测方法学专项

来源: HF Daily 8-07 #10 17▲(evaluation 主分类)+ stephen 8-07 noon 协调棒来源标注 + tom 8-07 0900 HF Daily 来源归档 arXiv: 2608.04397 TLDR(来源:HF Daily 8-07 条目摘要): 英韩性能差距的难度校准谜题基准——用于诊断英韩性能差距的难度校准评测基准(多语言评测方法学专项)。 卡状态: ❌ paper_cards 尚未建卡;HF Daily 8-07 #10 17▲,候选强度确认

要点: - 核心问题:英韩性能差距在 LLM 评测中缺乏系统性诊断——不同评测任务对英韩语言差异的敏感性不同,需要"难度校准"而非简单 pass/fail;跨语言性能差距可能源于词汇覆盖率、语法结构差异、训练语料不平衡等多种因素 - 核心方案:NOLLI = 难度校准谜题基准(difficulty-calibrated puzzle benchmark)——系统性地将英韩性能差距拆解为不同难度级别的诊断任务,为跨语言性能差距提供可解释的诊断工具 - 评测维度:英韩性能差距 magnitude + 难度校准后的差距分布 + 跨语言迁移一致性——属于评测方法学专项,而非场景专化 benchmark - 方法论价值:为"跨语言性能差距诊断"提供难度校准工具——与 ChronoLens(跨学科语言演化)同属语言学评测方向,但 ChronoLens 关注历时演化,NOLLI 关注语言间难度差异诊断 - 与 R38 已有工作的关系:R38 ChronoLens 覆盖跨学科语言演化,NOLLI 补充"语言间难度差异诊断"维度——两者共同构成"语言学评测方法学"双件套(历时演化 + 难度校准)

与 knowledge/evaluation.md R38 现有脉络的关系: - 落入 §2.5「评测方法学批判」——NOLLI 提供的是评测方法学工具(难度校准),可用于诊断现有 benchmark 的跨语言偏差,属于评测方法学专项 - 落入 §2.7「评测对象的横向分化」——新增"多语言难度校准评测"行(NOLLI) - 与 §2.2 Benchmark 设计邻接:NOLLI 不是场景专化 benchmark,而是 benchmark 的"诊断工具"——可用于评估其他 benchmark 在英韩语言对上的偏差

建议归入节: §2.5 评测方法学批判(新增 NOLLI 为多语言难度校准诊断工具)+ §2.7 评测对象横向分化(新增"多语言难度校准评测"行)+ §2.2 Benchmark 设计(邻接)

arXiv: 2608.04397


待建卡候选 1 · P2 候选 · OneDayAgent(arXiv:2608.05013):迈向自主 Agent 的长视野 Harness

来源: HF Daily 8-07 #5 28▲ + stephen 8-07 noon 协调棒 P1 缺口标注 + tom 8-07 0900 HF Daily 来源归档 arXiv: 2608.05013 TLDR(来源:HF Daily 8-07 条目摘要): 迈向自主 Agent 的长视野 Harness。 卡状态: ❌ paper_cards 尚未建卡;主分类待确认(agent 可能性高,含 evaluation 副分类)

要点: - 核心问题:自主 Agent 在长视野任务中如何保持一致性——与 LongHorizon-Harness(任务状态外部化管理)和 FinanceHarness(分层 Harness)同属 Harness 设计方向,但更侧重"自主性"维度 - 票数信号:HF Daily 8-07 #5 28▲——候选强度高,4 实例协同(tom HF Daily + stephen noon 协调 + flyp multimodal + jay cool-papers) - 与 R38 LongHorizon-Harness 的关系:LongHorizon-Harness 关注"任务状态外部化管理",OneDayAgent 关注"自主 Agent 长视野"——两者同属"长视野 Agent 评测"方向,构成互补关系

建议归入节: §2.4 Judge & Harness 工程(邻接 OneDayAgent 为长视野自主 Agent Harness 评测候选)+ §2.7 评测对象横向分化(邻接"自主 Agent 长视野评测"行)

arXiv: 2608.05013


待建卡候选 2 · P2 候选 · Skill-Native LLM(arXiv:2608.05139):迈向技能原生 LLM 的长视野推理基准测试与技能熵

来源: HF Daily 8-07 #7 20▲ + stephen 8-07 noon 协调棒 P1 缺口标注 + tom 8-07 0900 HF Daily 来源归档 arXiv: 2608.05139 TLDR(来源:HF Daily 8-07 条目摘要): 迈向技能原生 LLM:长视野推理基准测试与训练的技能熵。 卡状态: ❌ paper_cards 尚未建卡;主分类待确认(agent + engineering 可能性高,含 evaluation 副分类)

要点: - 核心问题:LLM 如何将技能作为"一等公民"内化——技能获取/切换的长视野推理评测;与 R38 PAST-Bench(经验保留)和 SkillOpt(技能优化)同属"技能评测"方向 - 票数信号:HF Daily 8-07 #7 20▲——候选强度高;与 SkillOpt MSR(8-07 ai-engineering-weekly #6)同向立标 - 与 R38 PAST-Bench 的关系:PAST-Bench 测试"经验保留是否真的好",Skill-Native LLM 测试"技能是否作为内化能力而非外置工具"——两者同属"Agent 能力内化评测"方向

建议归入节: §2.2 Benchmark 设计(邻接 Skill-Native LLM 为技能原生 LLM 长视野推理评测候选)+ §2.7 评测对象横向分化(邻接"技能原生 LLM 评测"行)

arXiv: 2608.05139


值得警惕的矛盾或待核实说法

矛盾 1 · GDPevo "全自动化数据流水线"是否真正解决数据污染问题

  • 现状:GDPevo 声称提供全自动化数据生成流水线以确保训练/测试任务可归因,但"全自动化"生成的合成数据与真实 GDP 企业工作流数据之间可能存在系统性偏差——自动化流水线可能引入与真实场景不符的工件模式
  • 待核实:论文是否提供合成数据与真实数据的对照验证?GDP 相关任务的自动化标注 ground truth 如何建立?

矛盾 2 · FinanceHarness "Point-in-Time 基准"的时点定义边界

  • 现状:FinanceHarness 要求"避免未来信息泄露",但金融研究的时间点定义(季度财报截止日 vs 自然月 vs 事件驱动时点)可能存在多种标准;"point-in-time"在不同金融子领域(股票/债券/宏观)的定义差异未明确
  • 待核实:论文是否提供 point-in-time 的形式化定义?不同金融子领域的时点标准是否一致?

矛盾 3 · NOLLI "难度校准"基准的可推广性

  • 现状:NOLLI 专注于英韩语言对,但"难度校准"方法论是否可推广到其他语言对(英日/英德/中英)未验证;不同语言对的难度因素可能不同(字符集/语序/形态复杂度)
  • 待核实:论文是否提供英韩以外语言对的难度校准实验?"难度校准"的跨语言迁移性如何保证?

矛盾 4 · OneDayAgent 与 LongHorizon-Harness 的概念边界

  • 现状:OneDayAgent(长视野自主 Agent Harness)与 LongHorizon-Harness(任务状态外部化管理)均涉及长视野 Agent 评测;两者是否互补还是重叠(解决同一问题的不同方案)未明确
  • 待核实:论文是否明确 OneDayAgent 与 LongHorizon-Harness 的差异化定位?

矛盾 5 · Skill-Native LLM "技能熵"指标的测量有效性

  • 现状:"技能熵"(skill entropy)作为评测指标——技能获取/切换的"熵"如何形式化定义?高熵 vs 低熵对 Agent 效能的影响是否经过实证验证?
  • 待核实:论文是否提供"技能熵"的 formal definition?不同模型的技能熵分布是否与下游任务效能相关?

本期不纳入的已知条目(已在上期或 R38 覆盖)

条目 arXiv 号 不纳入原因
ChronoLens 2608.03507 已在 R38 确认增量 1 覆盖;近 2 天无 eval 专项新信息
AntiSkillBench 2608.03700 已在 R38 确认增量 2 覆盖;近 2 天无 eval 专项新信息
FinIndices 2607.28661 已在 R38 确认增量 3 覆盖;HF Daily 8-07 不在 top 15(下榜)
PAST-Bench 2608.04003 已在 R38 确认增量 4 覆盖(主邻接维升格);HF Daily 8-07 不在 top 15(连续 3 日下榜,立标饱和度"48~72h 半衰期"确认)
RecHarness 2607.29241 已在 R37 基线;近 2 天无 eval 专项新信息
Model or Harness? 2607.28802 已在 R37 基线;近 2 天无 eval 专项新信息
To Add Is Machine 2607.28887 已在 R37 基线;HF Daily 8-07 不在 top 15(下榜)
LongHorizon-Harness 2608.01964 已在 R37 基线;HF Daily 8-05 #2 127▲ → 8-06/8-07 均不在 top 15(连续 3 日下榜,立标饱和度"48~72h 半衰期"确认)
ExtractBench 2607.29677 已在 R38 基线;近 2 天无 eval 专项新信息
Evaluation-Verification Reward 2607.29025 已在 R38 基线;近 2 天无 eval 专项新信息
AVE-Compass 2607.24821 已在 paper_cards/773 建卡;主分类 multimodal,副分类 evaluation;已在各专项邻接覆盖,HF Daily 8-07 #11 15▲ 但主分类非 evaluation

引用 arXiv 号汇总

# arXiv 号 名称 状态 与 evaluation.md 关系
1 2608.03764 GDPevo:Agent 自进化经济价值评测 ✅ paper_cards/778 已建(主分类 evaluation) 🆕 增量 1 确认
2 2607.27853 FinanceHarness:金融 deep research 分层 Harness ✅ paper_cards/794 已建(主分类 evaluation) 🆕 增量 2 确认
3 2608.04397 NOLLI:英韩难度校准谜题基准 ❌ paper_cards 尚未建(HF Daily 8-07 #10 17▲) 🆕 增量 3 确认(待建卡)
4 2608.05013 OneDayAgent:自主 Agent 长视野 Harness ❌ paper_cards 尚未建(HF Daily 8-07 #5 28▲) 🔶 待建卡候选 1
5 2608.05139 Skill-Native LLM:技能原生长视野推理评测 ❌ paper_cards 尚未建(HF Daily 8-07 #7 20▲) 🔶 待建卡候选 2
A 2608.03507 ChronoLens ✅ 已在 R38 基线 已在基线
B 2608.03700 AntiSkillBench ✅ 已在 R38 基线 已在基线
C 2607.28661 FinIndices ✅ 已在 R38 基线(8-07 HF 下榜) 已在基线
D 2608.04003 PAST-Bench ✅ 已在 R38 基线(连续 3 日 HF 下榜) 已在基线
E 2607.29241 RecHarness ✅ 已在 R37 基线 已在基线
F 2607.28802 Model or Harness? ✅ 已在 R37 基线 已在基线
G 2607.28887 To Add Is Machine ✅ 已在 R37 基线(8-07 HF 下榜) 已在基线
H 2608.01964 LongHorizon-Harness ✅ 已在 R37 基线(连续 3 日 HF 下榜) 已在基线

检查过的来源清单

tom inbox(8-05 下午~8-07): - 2026-08-06-evaluation-e1prep.md(R38 收官报告;基准参考) - 2026-08-07-0900-hf-daily-2026-08-07.md(HF Daily 8-07 票榜;含 GDPevo #6 21▲ + NOLLI #10 17▲ + OneDayAgent #5 28▲ + Skill-Native LLM #7 20▲) - 2026-08-07T0840-agent-rag-longcontext-radar.md(radar;含 FinanceHarness 高价值候选 #2 + Self-Evolving Coding Agents #1) - 2026-08-07T1440-agent-rag-longcontext-radar.md(radar;无 eval 专项新增) - 2026-08-07-rag-e1prep.md(RAG 专项;含 FinanceHarness 邻接确认) - 2026-08-07-1001-rss-cameron-wolfe.md(RSS;LLM Benchmark 剖析,无 eval 专项新条目) - 2026-08-06-evaluation-e1prep.md(R38 收官;3 确认 + 1 待建卡) - 2026-08-06-0900-hf-daily-2026-08-06.md(HF Daily 8-06 票榜;基准参考) - 2026-08-06-1005-rss-yt-yannic-kilcher.md(RSS;无 eval 专项)

jay inbox(8-05 下午~8-07): - 2026-08-07-ai-engineering-weekly.md(含 FinanceHarness 来源标注) - 2026-08-07-1002-rss-cool-papers.md(含 Skill-Native LLM 2608.05139 来源标注) - 2026-08-07-1003-rss-lilian-weng.md(Harness Engineering 2026-07-04 文章;无 eval 专项新 arXiv) - 2026-08-06-evening-brief.md(evening 简报;含 Agentic Deep Research 方向线索) - 2026-08-06-database-e1prep.md(database 专项;含 VectorDBBench 局限性讨论)

flyp inbox(8-05 下午~8-07): - 2026-08-07-multimodal-e1prep.md(含 GDPevo 邻接 + OneDayAgent 邻接 + Skill-Native LLM 邻接) - 2026-08-06-coding-agents-e1prep.md(含 To Add Is Machine 反方续立) - 2026-08-06-risk-e1prep.md(risk 专项;含 AntiSkillBench 安全邻接续立) - 2026-08-06-multimodal-e1prep.md(无 eval 专项新条目)

stephen inbox(8-05 下午~8-07): - 2026-08-07-1245-stephen-coordination-check-noon.md(含 NOLLI P2 建卡标注 + OneDayAgent/Skill-Native LLM P1 缺口标注) - 2026-08-07-ai-industry-e1prep.md(含 NOLLI #10 17▲ + OneDayAgent #5 28▲ + Skill-Native LLM #7 20▲ 来源归档) - 2026-08-07-0910-news-x-vip-radar.md(X-VIP radar;无 eval 专项) - 2026-08-06-2245-stephen-coordination-check-evening.md(evening 协调;含 HF Daily 8-07 完全替换态 #3 确认) - 2026-08-06-ai-industry-e1prep.md(ai-industry 专项;含 ABSeeker + GDPevo 来源线索)

spark inbox(8-05 下午~8-07): - 2026-08-07-agent-e1prep.md(agent 专项;含 GDPevo + Skill-Native LLM + OneDayAgent 来源归档) - 2026-08-06-llm-infra-e1prep.md(llm-infra 专项;含 GDPevo 邻接线索)

paper_cards 近 3 天新卡(766-795,共 30 张): - 主分类 evaluation:778(GDPevo ✅)+ 794(FinanceHarness ✅) - 主分类 agent(副分类 evaluation):735(PAST-Bench 已建)+ 778(GDPevo 已建)+ 794(FinanceHarness 已建) - 其余 27 张:agent(790 Self-Evolving Coding Agents / 792 Resume Means Resume / 789 Helping Music Co-Creation)+ multimodal(769/770/771/772/773 AVE-Compass / 774 ABSeeker / 775 FocusMem / 776 Agent Against Agent / 777)+ rag(760 LegalPincite / 767 Teaching Nemotron Greek)+ llm-infra(759 Know When to Stop)+ engineering(768 MultiPathFormer)+ risk(779 DRIFT) - 近 3 天主分类 evaluation 新卡:2 件(GDPevo + FinanceHarness)+ 1 件待建卡(NOLLI 2608.04397 未建卡)

HF Daily 8-07 票榜 evaluation 相关条目: - GDPevo(2608.03764)#6 · 21▲——主分类 evaluation;paper_cards/778 已建 ✅ - NOLLI(2608.04397)#10 · 17▲——主分类 evaluation;paper_cards 未建 ❌ - OneDayAgent(2608.05013)#5 · 28▲——主分类 agent;paper_cards 未建 ❌ - Skill-Native LLM(2608.05139)#7 · 20▲——主分类 agent/engineering;paper_cards 未建 ❌ - 近 3 天 HF Daily 8-07 evaluation 主分类净新增:1 件(NOLLI 待建卡)


主题活文档更新状态

  • knowledge/evaluation.md 当前版本:R38(2026-08-06 15:40 批次)
  • 本期 3 条确认增量(GDPevo + FinanceHarness + NOLLI)+ 2 条待建卡候选(OneDayAgent + Skill-Native LLM),可支持 R39 更新候选
  • 核心更新方向:§2.2 Benchmark 设计(场景专化型 benchmark 新增 2 件:GDPevo 企业工作流自进化 + FinanceHarness 金融 deep research)+ §2.4 Judge & Harness 工程(新增 FinanceHarness 分层 Harness + point-in-time 基准方法论)+ §2.5 评测方法学批判(新增 NOLLI 多语言难度校准诊断工具)+ §2.7 评测对象横向分化(新增 GDPevo + FinanceHarness + NOLLI 三行)
  • 建议 R39 关注:GDPevo 与 PAST-Bench 的"经验价值评测"双件套协同;FinanceHarness 与 FinIndices 的"金融评测"完整体系构建;NOLLI 建卡后纳入 §2.5 评测方法学批判

本棒 R39 预消化关键议题

  1. GDPevo → 下一步:全自动化数据流水线的 attribution 验证如何保证?GDP 企业工作流与真实金融/法律场景的 gap 有多大?"经济价值驱动评测"是否可以推广到其他垂直领域(法律/医疗/制造)?
  2. FinanceHarness → 下一步:point-in-time 基准的时点定义在不同金融子领域如何统一?分层 Harness 设计是否可以推广到其他 deep research 场景(科学发现/法律分析/新闻调查)?
  3. NOLLI → 下一步:英韩难度校准方法学的跨语言推广性如何?建卡后核实"难度校准"的形式化定义和实验设计
  4. OneDayAgent → 下一步:与 LongHorizon-Harness 的差异化定位如何?paper_cards 建卡后决定是否纳入 §2.4
  5. Skill-Native LLM → 下一步:与 PAST-Bench(记忆价值)和 SkillOpt(技能优化)的协同关系如何?paper_cards 建卡后决定是否纳入 §2.2
  6. 立标饱和度"48~72h 半衰期"信号确认:LongHorizon-Harness(S38 #2 立标级)+ PAST-Bench(R38 主邻接维升格)连续 3 日未返 HF Daily top 15——下一波 Agent 评测回暖信号何时出现?

附录:HF Daily 8-07 票榜 evaluation 相关条目跟踪

论文 arXiv 号 8-05 票数 8-06 票数 8-07 票数 变化 状态
GDPevo 2608.03764 21▲ 新入(#6) ✅ paper_cards/778 已建
NOLLI 2608.04397 17▲ 新入(#10) ❌ paper_cards 待建
OneDayAgent 2608.05013 28▲ 新入(#5) ❌ paper_cards 待建
Skill-Native LLM 2608.05139 20▲ 新入(#7) ❌ paper_cards 待建
LongHorizon-Harness 2608.01964 127▲ 连续 3 日下榜 ✅ 已在 R37 基线(立标饱和度"48~72h 半衰期"确认)
PAST-Bench 2608.04003 28▲ 28▲ 连续 3 日下榜 ✅ 已在 R38 基线(主邻接维升格)
AntiSkillBench 2608.03700 未入 8-07 top 15 ✅ 已在 R38 基线

无显著新增量时说明

不适用——本期 eval 主题出现明确增量回暖。


Tom · 2026-08-07 15:40 CST · E1 预消化简报 · 3 条确认增量(GDPevo + FinanceHarness + NOLLI)+ 2 条待建卡候选(OneDayAgent + Skill-Native LLM)· 涉及 arXiv:2608.03764(🆕)/ 2607.27853(🆕)/ 2608.04397(🆕 待建卡)/ 2608.05013(🔶 待建卡候选)/ 2608.05139(🔶 待建卡候选)/ 2608.03507(基线)/ 2608.03700(基线)/ 2607.28661(基线下榜)/ 2608.04003(基线续立)/ 2607.29241(基线)/ 2607.28802(基线)/ 2607.28887(基线下榜)/ 2608.01964(基线连续 3 日下榜)