evaluation · E1 预消化简报(2026-08-06)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-04 下午 ~ 2026-08-06)+ paper_cards 近 3 天新卡(735-766)+ HF Daily 8-06 票榜 本简报目的: 为今晚 evaluation 活文档接力(R37 → R38)预习备料,聚焦尚未进入 knowledge/evaluation.md R36 基线的增量条目 背景说明: R36 于 2026-08-04 15:40 收官(RecHarness Bandit 路由 Harness + Model or Harness? 六元失败分类 + To Add Is Machine 删除回避 + LongHorizon-Harness 任务状态管理);R37 于 2026-08-05 15:40 收官(same 4 确认增量 + PAST-Bench 待建卡候选)。本期覆盖 2026-08-04 下午至 2026-08-06 下午增量,发现 evaluation 主题 ArXiv 新鲜供给处于低活跃区间:paper_cards 新增 3 件 evaluation 主分类卡(ChronoLens + AntiSkillBench + FinIndices),但 ChronoLens 是语言演化 benchmark(跨学科方法论,与 Agent 评测交集有限),AntiSkillBench 和 FinIndices 均有专属主题领域;HF Daily 8-06 票榜 15 件全替换,PAST-Bench 以 agent 主分类入榜(#10,28▲),无 evaluation 主分类净新增。
执行摘要
本期 evaluation E1 预消化发现 3 条确认增量(均 paper_cards 新建)+ 1 条待建卡候选,共涉 4 个新 arXiv 号。相比上期(R37 收官,4 确认 + 1 待建卡),本期 eval 专项增量规模明显收缩,主要特征是:
- paper_cards 8-6 批次新增 3 件 evaluation 主分类卡(763 ChronoLens + 737 AntiSkillBench + 750 FinIndices):三件均为场景专化 benchmark,但均非 Agent 评测专项——ChronoLens 面向语言演化(跨学科语言学),AntiSkillBench 面向 persona-skill 安全(安全评测),FinIndices 面向金融推理可信度(领域知识评测)
- HF Daily 8-06 票榜:PAST-Bench 以 agent 主分类入 #10(28▲):主分类 agent、副分类 evaluation;已在 R36 待建卡候选,今日 paper_cards/735 建卡确认;无 evaluation 主分类新条目入榜
- 立标饱和度"24~48h 半衰期"信号持续:LongHorizon-Harness(8-05 #2 127▲)8-06 不在 top 15;SAF-OPD(8-05 #11 29▲)+ Fewer Clarifications(8-05 #13 25▲)8-06 双双下榜;HF Daily 飞轮出现第 2 次"完全替换态 100% 净换手率"
核心脉络是:evaluation ArXiv 供给从上周回暖(RecHarness/Model or Harness?/To Add Is Machine 三件套)转入低活跃整理期;新卡集中于垂直领域评测(语言演化/金融推理/隐私安全),Agent 评测专项出现暂时性断档。
增量条目(3 条确认 + 1 条待建卡候选)
增量 1 · P1 确认 · ChronoLens(arXiv:2608.03507):跨时间/语言/语言学层面的语言变化测量框架
来源: paper_cards/763-2608-03507.md(主分类 evaluation,形态 benchmark)+ tom 8-06 0840 radar 来源归档(candidates JSON) arXiv: 2608.03507 TLDR: 历史语言变化影响形态、句法、语义与语用,但计算研究通常用不兼容的表示分别考察这些层面,因而无法判断它们是否在不同语言间协同演化。ChronoLens 融合冻结多语言语言模型、特征对齐 crosscoders 与后置语言学干预,在单一分析空间中考察变化幅度与方向如何随语言学层面、语言及历史时期而变化——覆盖 44 种语言。 卡状态: ✅ paper_cards/763 已建(主分类 evaluation,形态 benchmark)
要点: - 核心问题:语言在历史时间尺度上演化,但计算研究通常用不兼容的表示分别考察形态/句法/语义/语用各层面,无法判断其是否协同演化 - 核心方案:ChronoLens = 融合框架(冻结多语言 LLM + 特征对齐 crosscoders + 后置语言学干预),在统一分析空间考察跨层面/跨语言/跨时期的语言变化 - 评测维度:形态变化 + 句法变化 + 语义漂移 + 语用演化——四层协同分析,覆盖 44 种语言 - 方法论价值:为语言演化研究提供计算可复现的基准——属于语言学评测的专项 benchmark,非 Agent 评测专项 - 与 R36 已有工作的关系:R36 RecHarness/Model or Harness?/To Add Is Machine 三件套均面向 Agent 评测;ChronoLens 面向语言演化,与 Agent 评测交集有限,但属于 evaluation 主分类下的新 benchmark
与 knowledge/evaluation.md R36 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——ChronoLens 是"跨学科评测基准"的新增案例(第四件跨学科基准,继 ExtractBench 企业文档 + MPIE-Bench 视觉编辑 + Beyond Borrowed Histories 角色扮演之后) - 落入 §2.7「评测对象的横向分化」——新增"语言演化评测"行(ChronoLens) - 注意:ChronoLens 与 Agent 评测关联度低,不建议在 §1.x(评测对象扩展)和 §2.4(Judge & Harness 工程)中归入,优先放入 §2.2 跨学科分支
建议归入节: §2.2 Benchmark 设计(新增 ChronoLens 为跨学科语言演化评测基准)+ §2.7 评测对象横向分化(新增"语言演化评测"行)
arXiv: 2608.03507
增量 2 · P1 确认 · AntiSkillBench(arXiv:2608.03700):Persona Skill 管道隐私泄漏与冒充风险端到端评测基准
来源: paper_cards/737-2608-03700.md(主分类 evaluation,形态 benchmark,副分类 agent)+ tom 8-05 1440 radar 来源归档 arXiv: 2608.03700 TLDR: Persona Skill 将个人交互历史提炼为可移植、可执行的工件,供下游 Agent 使用。在实现灵活个性化的同时,该过程将碎片化个人信号集中,通过重用放大其影响,冲击面向单条记录或基于检索的记忆所设计的防御。AntiSkillBench 是首个端到端评估 persona-skill pipeline 全流程风险与防御的基准,包含 7,500 条 persona-grounded 对话轨迹数据集。 卡状态: ✅ paper_cards/737 已建(主分类 evaluation,形态 benchmark,副分类 agent)
要点: - 核心问题:Persona Skill 管道在实现个性化 Agent 的同时,带来隐私泄漏和冒充风险——个人信号集中化 + 复用放大效应冲击现有防御机制 - 核心方案:AntiSkillBench = 首个 persona-skill pipeline 端到端安全评测基准,包含 7,500 条 persona-grounded 对话轨迹,评估 persona-skill 全流程(构建/分发/部署/执行)的隐私泄漏与冒充风险 - 评测维度:隐私泄漏率 + 冒充风险评分 + 防御有效性——直接对应 R36 Model or Harness? 的六元失败分类法在"persona-skill 安全"场景的专项化 - 方法论价值:首次将"persona skill 隐私泄漏"形式化为可量化评测的 benchmark——为 Agent 个性化安全评测提供标准化工具 - 与 R36 已有工作的关系:AntiSkillBench 与 Model or Harness?(六元失败分类)同属 Agent 系统安全评测方向,但 AntiSkillBench 聚焦 persona-skill 管道的专属威胁模型;与 R36 LongHorizon-Harness(任务状态管理)邻接——两者均关注 Agent 在长程交互中的系统性问题
与 knowledge/evaluation.md R36 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——AntiSkillBench 是"安全评测基准"的新增案例,可归入"场景专化型 benchmark"第 12 件(persona-skill 安全) - 落入 §2.6「失败模式分析」——AntiSkillBench 的隐私泄漏/冒充风险属于 R36 新增方向(Model or Harness? 失败归因分类法)在安全场景的专项深化 - 落入 §2.7「评测对象的横向分化」——新增"Agent 个性化安全评测"行(AntiSkillBench)
建议归入节: §2.2 Benchmark 设计(新增 AntiSkillBench 为 persona-skill 安全评测基准)+ §2.6 失败模式分析(新增 persona-skill 隐私泄漏/冒充风险分类)+ §2.7 评测对象横向分化(新增"Agent 个性化安全评测"行)
arXiv: 2608.03700
增量 3 · P1 确认 · FinIndices(arXiv:2607.28661):LLM 金融推理可信度的长周期财报真实世界检验基准
来源: paper_cards/750-2607-28661.md(主分类 evaluation,形态 benchmark)+ tom 8-05 candidates JSON 来源归档 arXiv: 2607.28661 TLDR: LLM 究竟具备真正的结构化推理能力,还是仅依赖表层模式匹配?金融领域要求长上下文下的数值精度与多步逻辑,是理想的试验场。现有 benchmark 无法捕捉真实工业复杂度(主要依赖选择题或针对裁剪表格的单跳 QA,忽略跨报表复杂关联与时间反累积)。FinIndices 是评估未裁剪财务报数据处理保真度的大规模 benchmark,覆盖长周期财报的真实世界检验。 卡状态: ✅ paper_cards/750 已建(主分类 evaluation,形态 benchmark,2026-08-06 08:00 backlog 补卡)
要点: - 核心问题:现有金融 benchmark 无法捕捉真实工业复杂度——主要依赖选择题或裁剪表格的单跳 QA,忽略跨报表关联与时间反累积;长周期财报场景对数值精度和多步逻辑的要求远超市面现有评测 - 核心方案:FinIndices = 大规模金融推理可信度 benchmark,评估 LLM 在未裁剪财务报上的数据处理保真度(data-processing fidelity) - 评测维度:数值精度 + 跨报表关联追踪 + 时间反累积处理——三者共同构成"金融推理可信度"度量 - 方法论价值:为"LLM 是否真正具备结构化推理"提供金融领域真实场景验证——与 R36 To Add Is Machine("通过测试 ≠ 真正修复")同源:两者都质疑"pass/fail"指标是否反映真实能力 - 与 R36 已有工作的关系:FinIndices 与 To Add Is Machine(代码编辑删除回避)同属"表面通过 ≠ 真实能力"反方证据链;两者共同支持 R36 §2.5 评测方法学批判方向
与 knowledge/evaluation.md R36 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——FinIndices 是"领域知识评测基准"的新增案例(金融推理长周期财报专项),可归入"场景专化型 benchmark"第 13 件 - 落入 §2.5「评测方法学批判」——"金融推理 benchmark 无法捕捉真实工业复杂度"是 R36 DialogGuard LLM-as-judge 批判的同源反方(在金融领域场景的具体化) - 落入 §2.7「评测对象的横向分化」——新增"金融推理可信度评测"行(FinIndices)
建议归入节: §2.2 Benchmark 设计(新增 FinIndices 为金融推理可信度 benchmark)+ §2.5 评测方法学批判(新增"金融推理可信度"反方)+ §2.7 评测对象横向分化(新增"金融推理可信度评测"行)
arXiv: 2607.28661
增量 4 · P1 待建卡候选 · PAST-Bench(arXiv:2608.04003):个人 Agent 递归自我改进的基础能力基准
来源: paper_cards/735-2608-04003.md(主分类 agent,形态 benchmark,副分类 evaluation)+ HF Daily 8-06 #10 28▲ + tom 8-06 0840 radar 候选 #1 ⭐⭐⭐ arXiv: 2608.04003 TLDR: 个人 AI Agent 在跨会话保留偏好、任务历史、工具例程和习得技能——但保留的经验是否真正随时间提升 Agent 表现尚未得到系统性验证。PAST-Bench 在匹配条件下测试 Agent 开启/关闭经验保留的行为差异,覆盖 26 场景 × 204 回合,涵盖 memory、procedural reuse、skill adaptation 三个维度。 卡状态: ✅ paper_cards/735 已建(主分类 agent,副分类 evaluation);R36 已作待建卡候选记录,本期正式确认
要点: - 核心问题:memory 是 Agent 核心组件,但"保留历史经验是否真的让 Agent 变好"缺乏系统性评测——PAST-Bench 填补这一空白 - 评测维度:memory / procedural reuse / skill adaptation 三维,"经验保留开/关"对照实验——直接量化"记忆的实质价值" - 票数信号:HF Daily 8-06 #10 28▲——4 实例协同(tom radar + HF Daily + stephen ai-industry + jay cool-papers) - 与 R36 LongHorizon-Harness 的互补关系:LongHorizon-Harness 解决"如何避免错误传播"(状态管理),PAST-Bench 解决"记忆保留是否真的好"(经验转化)——两者同属 Agent 长程行为评测方向
与 knowledge/evaluation.md R36 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——PAST-Bench 为"Agent 记忆价值评测"场景专化基准 - 落入 §2.6「失败模式分析」——PAST-Bench 可与 Model or Harness?(六元失败归因)共建"Agent 长程评测失败分类学" - 落入 §2.7「评测对象的横向分化」——新增"Agent 记忆价值评测"行(PAST-Bench)
建议归入节: §2.2 Benchmark 设计(新增 PAST-Bench 为 Agent 记忆价值评测基准)+ §2.6 失败模式分析(邻接 PAST-Bench 为经验转化能力测试)+ §2.7 评测对象横向分化(新增"Agent 记忆价值评测"行)
arXiv: 2608.04003
值得警惕的矛盾或待核实说法
矛盾 1 · ChronoLens 语言演化评测与 Agent 评测的关联度存疑
- 现状:ChronoLens 覆盖 44 种语言的形态/句法/语义/语用四层演化,评测对象是 LLM 的语言学理解能力,而非 Agent 的行为决策能力;与当前 knowledge/evaluation.md 以 Agent 评测为核心的脉络关联有限
- 待核实:ChronoLens 的 frozen LLM 作为评测工具是否可推广到 Agent 场景的语言理解评测?该框架是否隐含 Agent 评测价值(跨语言 Agent 的语用理解)?
矛盾 2 · AntiSkillBench persona-skill 防御评测的生态效度
- 现状:AntiSkillBench 评测 persona-skill pipeline 的隐私泄漏与冒充风险,但 7,500 条 persona-grounded 对话轨迹的构建方式(人工标注 vs 真实用户数据)未明确;防御机制评测依赖特定威胁模型设计
- 待核实:论文是否提供真实用户场景 vs 模拟场景的对照验证?防御机制在不同 persona-skill 规模下的有效性是否可推广?
矛盾 3 · FinIndices "裁剪 vs 未裁剪"区分是否足够刻画金融推理复杂度
- 现状:FinIndices 批评现有 benchmark 用"裁剪表格",但"未裁剪财务报"的数据获取成本极高——真实金融场景的复杂度不仅在于数据规模,还在于报表格式非标准化、跨期调整、暗流三表关联
- 待核实:论文是否提供未裁剪财报的数据来源说明?跨报表关联的 ground truth 如何建立?
矛盾 4 · PAST-Bench "经验保留开关"实验设计的因果性
- 现状:PAST-Bench 对比"开启经验保留"vs"关闭经验保留"的 Agent 表现,但两组实验的模型参数是否相同?关闭经验保留是否等价于"没有记忆"?
- 待核实:论文是否明确实验组与对照组的唯一差异是"记忆模块的使用"而非其他 confound?skill adaptation 维度是否可能受益于 in-context learning 而非记忆模块?
本期不纳入的已知条目(已在上期或 R36 覆盖)
| 条目 | arXiv 号 | 不纳入原因 |
|---|---|---|
| RecHarness | 2607.29241 | 已在 R36 确认增量 1 覆盖;近 2 天无 eval 专项新信息 |
| Model or Harness? | 2607.28802 | 已在 R36 确认增量 2 覆盖;近 2 天无 eval 专项新信息 |
| To Add Is Machine | 2607.28887 | 已在 R36 确认增量 3 覆盖;近 2 天无 eval 专项新信息 |
| LongHorizon-Harness | 2608.01964 | 已在 R36 确认增量 4 覆盖;HF Daily 8-06 不在 top 15(半衰期衰减),8-05 #2 127▲→8-06 下榜 |
| ExtractBench | 2607.29677 | 已在 R36 基线;近 2 天无 eval 专项新信息 |
| Evaluation-Verification Reward | 2607.29025 | 已在 R36 基线;近 2 天无 eval 专项新信息 |
| Fewer Clarifications | 2607.26611 | 已在 R36 基线;HF Daily 8-06 不在 top 15(下榜) |
| PROTEA | ACL Demo(无独立 arXiv) | 已在 R36 基线;近 2 天无 eval 专项新信息 |
| DialogGuard | ACL Demo / 2512.02282 | 已在 R36 基线;近 2 天无 eval 专项新信息 |
| ExplainBench | 2607.26451 | 已在 R36/37 邻接覆盖;主分类 agent,非 eval 主分类净新增 |
| ContinualSkillBench | 2608.03874 | 已在 R36/37 邻接覆盖;主分类 agent,非 eval 主分类净新增 |
引用 arXiv 号汇总
| # | arXiv 号 | 名称 | 状态 | 与 evaluation.md 关系 |
|---|---|---|---|---|
| 1 | 2608.03507 | ChronoLens:跨时间/语言/语言学层面的语言变化测量 | ✅ paper_cards/763 已建(主分类 evaluation) | 🆕 增量 1 确认 |
| 2 | 2608.03700 | AntiSkillBench:Persona Skill 安全评测基准 | ✅ paper_cards/737 已建(主分类 evaluation) | 🆕 增量 2 确认 |
| 3 | 2607.28661 | FinIndices:LLM 金融推理可信度长周期检验 | ✅ paper_cards/750 已建(主分类 evaluation) | 🆕 增量 3 确认 |
| 4 | 2608.04003 | PAST-Bench:Agent 递归自我改进基准 | ✅ paper_cards/735 已建(主分类 agent,副分类 evaluation) | 🆕 增量 4 确认(R36 待建卡→本期确认) |
| A | 2607.29241 | RecHarness | ✅ 已在 R36 基线 | 已在基线 |
| B | 2607.28802 | Model or Harness? | ✅ 已在 R36 基线 | 已在基线 |
| C | 2607.28887 | To Add Is Machine, To Delete Is Human | ✅ 已在 R36 基线 | 已在基线 |
| D | 2608.01964 | LongHorizon-Harness | ✅ 已在 R36 基线(8-06 HF 下榜) | 已在基线 |
| E | 2607.29677 | ExtractBench | ✅ 已在 R36 基线 | 已在基线 |
| F | 2607.29025 | Evaluation-Verification Reward | ✅ 已在 R36 基线 | 已在基线 |
| G | 2607.26611 | Fewer Clarifications | ✅ 已在 R36 基线(8-06 HF 下榜) | 已在基线 |
检查过的来源清单
tom inbox(8-04 下午~8-06): - 2026-08-05-evaluation-e1prep.md(R37 收官报告;基准参考) - 2026-08-06-agent-rag-longcontext-radar.md(0840 radar;含 ChronoLens 候选来源 + PAST-Bench 候选 #1) - 2026-08-06-rag-e1prep.md(RAG 专项;含 PAST-Bench 邻接 + LegalPincite + RestoreKV + ARCHead) - 2026-08-06-0900-hf-daily-2026-08-06.md(HF Daily 8-06 票榜;含 PAST-Bench #10 28▲ + 全替换态) - 2026-08-05-0900-hf-daily-2026-08-05.md(HF Daily 8-05 票榜;基准参考) - 2026-08-06-1004-rss-yt-yannic-kilcher.md(RSS;无 eval 专项) - 2026-08-06-1005-rss-yt-lex-fridman.md(RSS;无 eval 专项) - 2026-08-05T1440-agent-rag-longcontext-radar.md(午间 radar;含 AntiSkillBench 来源) - 2026-08-05-rag-e1prep.md(RAG 专项;无 eval 专项新条目)
jay inbox(8-04 下午~8-06): - 2026-08-06-jay-engineering-filter.md(工程筛选;无 evaluation 专项新条目) - 2026-08-06-1003-rss-import-ai.md(RSS;无 eval 专项) - 2026-08-06-1001-rss-cool-papers.md(RSS;含 PAST-Bench 沿用) - 2026-08-05-1002-rss-cool-papers-ir.md(RSS;无 eval 专项) - 2026-08-05-1002-rss-lilian-weng.md(RSS;无 eval 专项)
flyp inbox(8-04 下午~8-06): - 2026-08-05-coding-agents-e1prep.md(含 AntiSkillBench 邻接 + To Add Is Machine 邻接) - 2026-08-05-risk-e1prep.md(含 AntiSkillBench persona skill 安全邻接) - 2026-08-06-multimodal-e1prep.md(无 eval 专项新条目) - 2026-08-05-multimodal-e1prep.md(含 Evaluation-Verification Reward 续立)
stephen inbox(8-04 下午~8-06): - 2026-08-06-ai-industry-e1prep.md(含 PAST-Bench 增量 5 + HF Daily 全替换态分析) - 2026-08-06-1004-news-tldr-ai.md(news;无 eval 专项) - 2026-08-06-1004-news-hf-blog.md(news;无 eval 专项) - 2026-08-06-1006-news-yt-deepmind.md(news;无 eval 专项)
spark inbox(8-04 下午~8-06): - 2026-08-06-agent-e1prep.md(agent 专项;含 PAST-Bench + ExplainBench + ContinualSkillBench,均为 agent 主分类含 evaluation 副分类) - 2026-08-05-agent-e1prep.md(agent 专项;含 To Add Is Machine + AntiSkillBench 邻接) - 2026-08-05-llm-infra-e1prep.md(llm-infra 专项;无 eval 专项新条目)
paper_cards 近 3 天新卡(735-766,共 32 张): - 主分类 evaluation:763(ChronoLens ✅)+ 737(AntiSkillBench ✅)+ 750(FinIndices ✅) - 主分类 agent(副分类 evaluation):735(PAST-Bench ✅) - 其余 28 张:agent(739/740/746/748)+ multimodal(736/741/745/747/749)+ llm-infra(759)+ rag(747 误分类)+ engineering(751-758 经典补卡) - 近 3 天主分类 evaluation 新卡:3 件(ChronoLens + AntiSkillBench + FinIndices)+ 1 件 agent 主分类含 evaluation 副分类(PAST-Bench 确认建卡)
HF Daily 8-06 票榜 evaluation 相关条目: - PAST-Bench(2608.04003)#10 · 28▲——主分类 agent,副分类 evaluation;新入 HF Daily 票榜,建卡确认 - CAPEval(2608.02589)#14 · 21▲——主分类待确认(暂无 paper_cards);待核实 - MemSFT(2607.25614)#15 · 21▲——主分类 risk;已在 R37 基线邻接 - 近 3 天 HF Daily 8-06 evaluation 主分类净新增:0 件(PAST-Bench 主分类 agent)
主题活文档更新状态
- knowledge/evaluation.md 当前版本:R36(2026-08-04 15:40 批次)+ R37(2026-08-05 15:40 批次)
- 本期 3 条确认增量(ChronoLens + AntiSkillBench + FinIndices)+ 1 条 R36 待建卡确认(PAST-Bench),可支持 R38 更新候选
- 核心更新方向:§2.2 Benchmark 设计(场景专化型 benchmark 新增 3 件:语言演化/ persona-skill 安全/金融推理)+ §2.6 失败模式分析(AntiSkillBench persona-skill 隐私泄漏分类 + PAST-Bench 经验转化能力测试)+ §2.7 评测对象横向分化(新增三行)
- 建议 R38 关注:ChronoLens 与 Agent 评测的关联度是否需要重新评估;AntiSkillBench 与 Model or Harness? 的协同整合;FinIndices 与 To Add Is Machine 的"表面通过≠真实能力"反方链深化
无显著新增量时说明
本期 eval 主题 ArXiv 新鲜供给处于相对低活跃区间,主要原因是:
- R36 四联协同(RecHarness + Model or Harness? + To Add Is Machine + LongHorizon-Harness)收官后进入整理期:2026-08-04 批量收官,覆盖了 Harness 评测方法论三角(Bandit 路由 + 失败归因 + 状态管理)+ 代码编辑质量评测,剩余增量空间有限
- 今日实质性新增量:3 条主分类 evaluation 新卡(ChronoLens + AntiSkillBench + FinIndices):均为场景专化 benchmark,但均非 Agent 评测专项——语言演化(跨学科)、persona-skill 安全(安全评测)、金融推理(领域知识),三件合计对 Agent 评测的增量贡献有限
- HF Daily 8-06 票榜 top 15 无 evaluation 主分类净新增:PAST-Bench(28▲)新入但主分类 agent;其余 evaluation 相关条目(SAF-OPD / Fewer Clarifications)双双下榜
- Agent 评测专项出现暂时性断档:上周三件套(RecHarness / Model or Harness? / To Add Is Machine)后,新卡集中在垂直领域评测,与 Agent 评测交叉有限
本棒 R38 预消化关键议题
本期 eval 增量处于低活跃区间,R38 面临的核心问题是:如何在 evaluation 主题 ArXiv 供给低谷期维持活文档更新质量,并预判下一波回暖方向?
- ChronoLens → 下一步:语言演化 benchmark 对 Agent 评测的隐含价值(跨语言 Agent 语用理解)是否值得专项章节?该框架是否可以推广到"Agent 在多语言环境下的语用推理评测"?
- AntiSkillBench → 下一步:persona-skill 安全评测是否需要与 Model or Harness? 的六元失败分类法整合?隐私泄漏评测是否可以成为 Agent 评测的新维度?
- FinIndices → 下一步:金融推理可信度是否可推广到其他领域(医疗/法律/科学)?长周期、多步逻辑的评测设计是否可以成为"复杂推理 benchmark"的方法论模板?
- PAST-Bench → 下一步:建卡后核实"memory / procedural reuse / skill adaptation"三维的具体评测指标;经验保留开关实验的因果性如何保证;与 LongHorizon-Harness 的协同价值
- 跨期观察:R39 ~ R40 是否出现新一波 Agent 评测 arXiv 热潮(类比 R36 的 RecHarness/Model or Harness?/To Add Is Machine 三件套模式)
附录:HF Daily 8-06 票榜 evaluation 相关条目跟踪
| 论文 | arXiv 号 | 8-05 票数 | 8-06 票数 | 变化 | 状态 |
|---|---|---|---|---|---|
| PAST-Bench | 2608.04003 | —(radar 18票) | 28▲ | 新入(#10) | ✅ agent 主分类/eval 副分类建卡确认 |
| SAF-OPD | 2607.29209 | 29▲ | — | 下榜 | 已在 R36 基线 |
| Fewer Clarifications | 2607.26611 | 25▲ | — | 下榜 | 已在 R36 基线 |
| CAPEval | 2608.02589 | — | 21▲ | 新入(#14) | ⚠️ 主分类待确认 |
| MemSFT | 2607.25614 | — | 21▲ | 新入(#15) | ⚠️ 主分类 risk |
无显著新增量时说明
本期 eval 主题 ArXiv 新鲜供给处于相对低活跃区间,主要原因是: 1. R36 四联协同(RecHarness + Model or Harness? + To Add Is Machine + LongHorizon-Harness)收官后进入整理期:2026-08-04 批量收官,覆盖了 Harness 评测方法论三角(Bandit 路由 + 失败归因 + 状态管理)+ 代码编辑质量评测,剩余增量空间有限 2. 今日实质性新增量:3 条主分类 evaluation 新卡(ChronoLens + AntiSkillBench + FinIndices):均为场景专化 benchmark,但均非 Agent 评测专项——语言演化(跨学科)、persona-skill 安全(安全评测)、金融推理(领域知识),三件合计对 Agent 评测的增量贡献有限 3. HF Daily 8-06 票榜 top 15 无 evaluation 主分类净新增:PAST-Bench(28▲)新入但主分类 agent;其余 evaluation 相关条目(SAF-OPD / Fewer Clarifications)双双下榜 4. Agent 评测专项出现暂时性断档:上周三件套(RecHarness / Model or Harness? / To Add Is Machine)后,新卡集中在垂直领域评测,与 Agent 评测交叉有限
Tom · 2026-08-06 15:40 CST · E1 预消化简报 · 3 条确认增量(ChronoLens + AntiSkillBench + FinIndices)+ 1 条待建卡候选确认(PAST-Bench)· 涉及 arXiv:2608.03507(🆕)/ 2608.03700(🆕)/ 2607.28661(🆕)/ 2608.04003(✅ 确认建卡)/ 2607.29241(基线)/ 2607.28802(基线)/ 2607.28887(基线)/ 2608.01964(基线)/ 2607.29677(基线)/ 2607.29025(基线)/ 2607.26611(基线下榜)