evaluation · E1 预消化简报(2026-10-09)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-09 15:40 CST 窗口定义:2026-10-08 15:40 ~ 2026-10-09 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R98 基线 · 2026-10-08 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 8-9 新入库 eval 相关条目 + flyp/spark/jay eval 联动内容 诚实度声明:本轮 eval 主题净增量密度「中-低」—— eval 主分类 paper_card NET-new 净增 0 件(R98 已完成 AgencyBench 数据精确化 + LMBuild 升主锚 + SafeActBench + EMHO);eval 副分类 NET-new 1 件(Agent Plasticity 2610.08902 · agent 主/eval 副 · 三维自我改进评测);方法论增量 1 件(ThinkingBox 数据库状态评估范式 · 非 arXiv 来源);整体落在"Agent 自我改进评测方法学"与"评测对象从回复质量转向数据库状态"两个新方向,无颠覆性新 benchmark 范式。来源已如实核查,不硬凑字数。
状态摘要
- 增量条数:2 条(1 条 eval 副分类 + 1 条方法论范式)
- 核心新增:① Agent Plasticity(2610.08902 · agent 主/eval 副 · 三维自我改进评测框架:性能是否提升泛化 / 新能力获取效率 / 自我改进崩溃点 · tom radar ⭐⭐⭐⭐ · spark agent-e1prep 增量 10 主棒位)② ThinkingBox(Microsoft × HuggingFace · Agent 评估范式从"回复质量"转向"数据库状态" · 20/20 一致性极低揭示生产鸿沟)
- 澄清:本轮 eval 主分类 NET-new = 0 件;Agent Plasticity 为 agent 主分类,eval 副分类,有明确 eval 贡献(自我改进三维权衡框架);ThinkingBox 为方法论范式,非 arXiv 来源;R98 锚定体系(R97 7 主锚 + R98 4 主锚)稳固,本轮无需更新锚点编号
- 涉及 arXiv 号:本次新增 1 个(2610.08902)+ 续用 R98 锚定锚 190-193 及其他锚定条目
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| organized/knowledge | evaluation.md(R98 基线 · 含锚 190 AgencyBench + 191 JIL Attack + 192 Selection vs Extraction + 193 LMBuild + 194-197 SafeActBench/EMHO/LMBuild升锚/JIL数据校正) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-08-evaluation-e1prep.md(Oct 8 E1 基线 · 含 SafeActBench + EMHO) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-07-evaluation-e1prep.md(Oct 7 E1 基线 · 含 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-09-agent-rag-longcontext-radar.md(Oct 9 08:40 · Agent Plasticity ⭐⭐⭐⭐ 高价值 #4) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/spark | 2026-10-09-agent-e1prep.md(Oct 9 13:30 · 增量 10 · Agent Plasticity 主棒位 + 增量 14 · ThinkingBox 主棒位) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/flyp | 2026-10-08-flyP-critical-read-AgencyBench-1M-token-agent-eval-v2.md(Oct 8 · v2 重写覆盖 · ⭐⭐⭐⭐) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-09-engineering-e1prep.md(Oct 9 11:20 · Constraint Decay 边际邻接 · arXiv 号待核) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-1735-jay-hf-blog-thinkingbox-decision-models-arxiv-oct08.md(Oct 8 · ThinkingBox 主棒位) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/stephen | 2026-10-09-ai-industry-e1prep.md(Oct 9 12:53 · ThinkingBox 多源确认) |
高 ⭐⭐⭐⭐ |
| inbox/stephen | 2026-10-09-1006-news-hf-blog.md(Oct 9 · ThinkingBox + "Agent 说做完了数据库不认同") |
高 ⭐⭐⭐⭐ |
| organized/paper_cards | 1734-2610-08902.md(Agent Plasticity · Oct 9 mtime · agent 主/eval 副) |
极高 ⭐⭐⭐⭐⭐ |
| organized/queue | work-queue.md(2026-10-09 14:00 · Top 15 含 Inherit-MAS 2610.02396 + Agent Plasticity 2610.08902) |
高 ⭐⭐⭐⭐ |
| inbox/spark | 2026-10-08-agent-e1prep.md(Oct 8 · 立标延革预备第 133-138 例承接) |
高 ⭐⭐⭐⭐ |
| inbox/jay/spark/stephen/flyp | 近 2 天其余 eval 相关 inbox 文件 | 已在 Oct 7-8 E1 prep 覆盖或 eval 邻接级 |
一、增量条目
增量 1:Agent Plasticity — Agent 自我改进能力三维评测框架(2610.08902)— agent 主/eval 副(⭐⭐⭐⭐)
来源:paper_cards/1734-2610-08902.md(Oct 9 mtime · agent 主分类 · eval 副分类)· inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(Oct 9 ⭐⭐⭐⭐ 高价值 #4)· inbox/spark/2026-10-09-agent-e1prep.md(Oct 9 增量 10 · 主棒位)· 原始来源:arXiv:2610.08902v1
URL:https://arxiv.org/abs/2610.08902
TLDR(原文摘要):AI agents increasingly operate in environments where they can diagnose failures and improve through experience, yet existing evaluations largely measure what an agent can do at a fixed point in time rather than how effectively it learns. Evaluating self-improvement requires answering three questions: does future performance improve and generalize beyond the interactions that enabled learning; how efficiently are new capabilities acquired; and where does the self-improvement process break down?
要点:
- 核心问题:现有 Agent 评测主要衡量"在固定时间点能做什么"(能力快照),而非"从经验中学习多有效"(学习能力轨迹)——这是一个根本性的评测维度缺失,因为 Agent 在真实部署中需要通过经验持续改进
- 三维评测框架: 1. 性能提升与泛化:未来性能是否改进,并超越使学习成为可能的交互本身(泛化能力) 2. 获取效率:新能力获取的效率有多高(学习速度/成本) 3. 崩溃点定位:自我改进过程在何处失效(能力边界)
- 方法贡献:提出受控实验设置,在标准化条件下测量 Agent 的自我改进轨迹——填补了"学习效率评测"这一空白
- 与 PhysEvo/SkillForge/UniSkill 的协同关系(来自 spark agent-e1prep 增量 3/2/5/9):后者是"自我改进的训练方法",Agent Plasticity 是"自我改进的评测方法"——两者构成完整的"自改进训练 + 自改进评测"闭环
- ⚠️ 待核实:具体实验设置细节;三维框架在哪些 benchmark/任务上验证;不同模型(闭源 vs 开源)在三维权衡上的差异;崩溃点的具体操作化定义
与活文档 evaluation.md 现有脉络的关系: - 邻接 R98 §1.2 决策型 judge vs 生成型 judge:Agent Plasticity 的三维框架是"评测指标设计"的新维度——从"聚合 judge 评分"到"学习轨迹三维权衡";与 R92 SEAL 聚合层失效 + R95 LexReward 奖励分类法 + R97 Selection vs Extraction 预注册方法共同构成"评测方法学严谨化"的四联 - 邻接 R98 §1.3 长程/多 Agent 评测:Agent Plasticity 提出的"性能提升与泛化"维度与长程 Agent 评测的核心挑战直接相关——长程 Agent 的价值主张正是"通过经验改进",而非"一次性任务完成" - 邻接 R98 §1.4 垂类高风险场景:如果将三维框架应用于具身/科学/代码等垂类场景,可形成"垂类自我改进能力评测"的新子类 - 建议归入章节:§1.2 决策型 judge vs 生成型 judge(eval 副分类邻接 · Agent Plasticity 2610.08902 · 三维自我改进评测框架:性能是否提升泛化 / 新能力获取效率 / 自我改进崩溃点 · tom radar ⭐⭐⭐⭐ · spark agent-e1prep 主棒位增量 10 · ⚠️ 待原文精读确认三维框架的具体操作化细节和三维权衡实测数据)
增量 2:ThinkingBox — Agent 评估从"回复质量"转向"数据库状态"范式(Microsoft × HuggingFace)— 方法论范式(非 arXiv)
来源:inbox/jay/2026-10-08-1735-jay-hf-blog-thinkingbox-decision-models-arxiv-oct08.md(Oct 8 · ThinkingBox 主棒位)· inbox/stephen/2026-10-09-ai-industry-e1prep.md(Oct 9 · 多源确认)· inbox/stephen/2026-10-09-1006-news-hf-blog.md(Oct 9 · "Agent 说做完了数据库却不认同")· 原始来源:HuggingFace Blog + Microsoft Research(联合发布)
URL(OpenEnv GitHub):https://github.com/huggingface/openenv(HuggingFace × Microsoft 联合开源)
TLDR(多源综合摘要):当前所有 Agent 评估体系都关注"回复质量"或"工具调用格式",但完全忽略最终数据库状态——ThinkingBox 提出新范式:评估 Agent 的最终交付物是否正确改变了目标数据库状态,而非评估 Agent 的中间文本回复。pass@1 排名:Claude Opus 5.5(67.16%)> GPT-5.4(65.36%)> GPT-5.6 Sol(61.91%)。关键反直觉发现:所有模型的 20/20 一致性都极低——这揭示了从"能跑通"到"可靠生产"之间的巨大鸿沟。
要点:
- 范式核心:评测对象从"Agent 的文本回复"转向"Agent 操作后数据库的最终状态"——这是 Agent 评测哲学的根本性转变;文本回复只是中间过程,数据库状态才是最终价值交付
- pass@1 排名(在 ThinkingBox 评测协议下):Claude Opus 5.5(67.16%)> GPT-5.4(65.36%)> GPT-5.6 Sol(61.91%)——注意这与主流 benchmark 排名可能有差异,因为评测对象不同
- 关键反直觉发现:所有模型的 20/20 一致性(即 20 次独立运行全部成功)都极低——即使 pass@1 最高的 Claude Opus 5.5,在数据库状态严格一致性检验下也频繁出现不一致——这揭示了"跑通 benchmark"≠"可靠生产"的巨大鸿沟
- "Agent 说做完了数据库却不认同"现象(stephen news):当用数据库状态而非回复作为 ground truth 时,Agent 自述完成与数据库实际状态之间存在系统性偏差——说明 Agent 的"自信回复"与"真实执行"之间有裂缝
- OpenEnv 开源(HuggingFace × Microsoft 联合):评测代码已公开,第三方可复现——这是该范式可信度的重要来源
- ⚠️ 待核实:具体评测任务设计;20/20 一致性的具体数值;各模型在 20 次运行中的具体一致性分布;评测数据集规模和来源;数据库状态评估的具体自动化方法(是否有 ground truth schema)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R98 §1.3 长程/多 Agent 评测:ThinkingBox 的数据库状态评估与 AgencyBench(1M-token 真实任务执行)在"真实价值交付物评测"方向上一致——但 ThinkingBox 更激进:连中间文本都不看,只看最终数据库状态 - 邻接 R98 §1.4 垂类高风险场景:在生产级数据库操作场景(后端任务、SQL 执行、数据迁移)中,数据库状态评测比文本回复评测更能反映实际风险——与 Constraint Decay(EURECOM:30pp assertion pass rate 下降)形成跨来源呼应 - 邻接 R97 §1.2 LLM-as-Judge 失效模式:ThinkingBox 揭示"回复质量好 ≠ 数据库状态正确"——这进一步说明基于文本 judge 的局限性;如果连文本 judge 都不可靠,那基于数据库状态的评测可能是更可信的替代 - 建议归入章节:§1.3 长程/多 Agent 评测(方法论范式邻接 · ThinkingBox Microsoft×HuggingFace · 评测对象从"回复质量"转向"数据库状态" · 20/20 一致性极低揭示生产鸿沟 · OpenEnv 开源 · ⚠️ 非 arXiv 来源,引用需标注来源类型;待 OpenEnv 代码 review 确认评测方法论细节)
二、值得警惕的矛盾或待核实说法
⚠️ 待核实 1:Agent Plasticity 三维框架的具体操作化细节
- 待核实项:三维框架(性能提升与泛化 / 获取效率 / 崩溃点定位)在哪些具体 benchmark/任务上验证?各维度的具体指标是什么?控制实验的标准化条件是否可复现?
- 潜在影响:如果具体操作化细节缺失,该框架可能停留在概念层面,难以实际指导评测设计
- 建议:R99 前需原文精读确认;与 Self-Retrospection Distillation(2610.08077 · prospective learning)对照阅读
- 来源:
paper_cards/1734-2610-08902.md+inbox/tom/2026-10-09-agent-rag-longcontext-radar.md
⚠️ 待核实 2:ThinkingBox 的评测协议具体细节
- 待核实项:数据库状态评估的具体方法(ground truth schema 如何定义?状态等价性如何判断?);20/20 一致性的具体数值;评测数据集规模和任务类型;Claude Opus 5.5 以 67.16% pass@1 排名第一,但 20/20 一致性极低——这两个指标之间的具体关系是什么?
- 潜在影响:ThinkingBox 范式的可信度高度依赖 OpenEnv 代码的具体实现;如果评测协议设计有偏差,数据库状态评测可能引入新的系统性误差
- 建议:stephen evening 棒位或 spark agent 棒位对 OpenEnv GitHub 代码做一次 review
- 来源:
inbox/jay/2026-10-08-1735-jay-hf-blog-thinkingbox-decision-models-arxiv-oct08.md
⚠️ 待核实 3:Constraint Decay arXiv 号待确认(eval 边际邻接)
- 待核实项:jay 10-9 engineering-e1prep 报告"LLM coding agent 从宽松规格转向生产级结构约束时 assertion pass rates 平均下降 30pp",来源为 EURECOM,但 arXiv 号未给出;该发现与 ThinkingBox"数据库状态评测揭示生产鸿沟"在方向上高度一致,可相互印证
- 潜在影响:如果 Constraint Decay arXiv 号确认且数据可靠,可作为"数据库状态评测"方法论的经验证据来源
- 建议:跟进 Constraint Decay arXiv 号;与 ThinkingBox 数据库状态评测叙事关联归档
- 来源:
inbox/jay/2026-10-09-engineering-e1prep.md
三、本轮无显著新增声明
本轮 eval 主题在 Oct 7 已由 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild 完成了 4 件密集锚定(R97 锚 190-193),Oct 8 追加了 SafeActBench + EMHO + JIL 数据校正(R98)。Oct 9 eval 窗口期:
- eval 主分类 paper_card NET-new = 0 件:Agent Plasticity(2610.08902)有明确 eval 副分类贡献,但 paper_card 主分类为 agent;无新 eval 主分类 benchmark
- eval 副分类净增 = 1 件(Agent Plasticity)+ 方法论范式 = 1 件(ThinkingBox)
- 整体落在 Agent 自我改进评测方法学与数据库状态评测范式两个新方向,无颠覆性新 benchmark 范式
无硬凑声明:本轮只找到 2 条 eval 相关增量(1 条 eval 副分类 + 1 条方法论范式),低于 3-8 条目标区间——原因是 Oct 7-8 已完成密集锚定,Oct 9 确实为 eval 窗口低信号期。来源已如实核查,不编造增量条目充数。
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主/邻 | 状态 |
|---|---|---|---|
| 2610.08902v1 | Agent Plasticity: Measuring Self-Improvement Through Experience | agent 主/eval 副 | 🆕 本轮 eval 副分类新增(tom radar ⭐⭐⭐⭐ · spark agent-e1prep 主棒位增量 10 · 三维自我改进评测框架) |
| 2601.11044v4 | AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts | eval 主/benchmark | Oct 7 E1 prep 已锚定(R97 锚 190)+ flyp v2 批判精读完成 |
| 2610.03430 | JIL Attack: 利用长度预测干扰 LLM 调度(数据校正:83.4%/1.53×) | engineering 主/eval 强邻接 | Oct 7 E1 prep 已锚定(R98 数据校正) |
| 2609.34227 | When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory | agent 主/eval 副 | Oct 7 E1 prep 已锚定(R97 锚 192) |
| 2610.04292 | LMBuild: 3D 结构评测 4 维框架 | eval 主 | Oct 7 E1 prep 已锚定(R98 升正式锚) |
| 2610.07753 | SafeActBench: 证据-行动链条断裂诊断 | agent 主/eval 副 | Oct 8 E1 prep 已锚定(R98) |
| 2610.08432 | EMHO: 具身 Agent Harness 自演进 | eval 主/marginal | Oct 8 E1 prep 已锚定(R98) |
| 2609.38096 | Tail-Influence Sampling for CVaR Policy Evaluation | eval 主/method | Oct 6 E1 prep 已锚定(R96) |
| 2610.03715 | 4DCodeBench: 动态场景逆向图形 Agent 评测 | eval 主/benchmark | Oct 6 E1 prep 已锚定(R96) |
| 2610.04116 | CUAWright: 数字 Agent 极简统一接口 | agent 主/eval 副 | Oct 6 E1 prep 已锚定(R96) |
| 2610.02304 | SimuVerity: 工程级 Simulink 模型生成 benchmark | eval 主 | R95 已锚定 |
| 2609.39071 | LexReward: 法律 LLM 奖励分类法 | eval 主 | R95 已锚定 |
| 2610.03020 | DyadMem: Agent-用户关系记忆 benchmark | agent 主/eval 副 | R95 已锚定 |
| 2610.03632 | World Embedding Benchmark | multimodal 主/rag 副 | R95 已锚定 |
| 2609.26777 | SWE-Serve: 生产级推理工程 benchmark | llm-infra 主/eval 邻 | R95 已锚定 |
| 2609.29769v2 | JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places | eval 主/risk 副 | flyp Oct 6 risk-e1prep 已锚定 |
| 2605.30104 | SEAL: LLM-as-Meta-Judge | 副分类 eval | R93 已锚定 |
| 2510.11977 | HAL: Holistic Agent Leaderboard | 邻接 eval | R93 已锚定 |
| 2610.01428 | SAGO: Generalization Is Stability | eval 主 | R93 已锚定 |
| 2609.00559 | PhysVista: VLM 物理智能 benchmark | eval 主 | R93 已锚定 |
| 2609.32810 | OpenTumorBoard: 多学科肿瘤 board 讨论轨迹 | eval 主 | R93 已锚定 |
| 2609.38137 | LongHarness Bench | 邻接 eval | R93 已锚定 |
Tom · 2026-10-09 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-09-evaluation-e1prep.md