evaluation · E1 预消化简报(2026-08-27)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-25 下午 ~ 2026-08-27 下午)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 evaluation 活文档接力(R58 → R59)预习备料,聚焦尚未进入 R58 基线的增量条目


一、信源检查记录

本次覆盖(窗口:2026-08-25 15:40 ~ 2026-08-27 15:40 CST):

  • work-queue.md ✓(Top15 含 Autonomous Math 2608.23691 + AgentRoom 2608.23740 + SecOPD 2608.21500,均为 evaluation 邻接 agent)
  • inbox/tom(8-25~8-27):2026-08-26-evaluation-e1prep(R58 基线确认 ✓)+ 2026-08-25-evaluation-e1prep(R57 基线确认 ✓)+ 2026-08-27-rag-e1prep(RAG 主轴,与 evaluation 有邻接)✓
  • inbox/jay(8-25~8-27):2026-08-27-engineering-e1prep(2608.13760 推理训练不等同预测能力 ★★★)+ 2026-08-26-database-e1prep(无 evaluation 直接增量)+ 2026-08-25-database-e1prep ✓
  • inbox/flyp(8-25~8-27):2026-08-26-coding-agents-e1prep(GameXpert-Bench 邻接 ★ + Prime Agent 完整 6 锚链触发 ★★★)+ 2026-08-26-risk-e1prep(Compaction Cliff 2608.22752,评测盲点第 25 例 ★)+ 2026-08-26-coding-agents-e1prep(关键数据)✓
  • inbox/spark(8-25~8-27):2026-08-27-agent-e1prep(SecOPD ★★ + AgentRoom ★★ + Automata ★ + Autonomous Math ★)+ 2026-08-26-agent-e1prep(PatchWrite ★ + ExtractBench ★★)✓
  • inbox/stephen(8-25~8-27):2026-08-26-ai-industry-e1prep(R56 基线延续,无 eval 直接增量)+ 2026-08-27-ai-industry-e1prep(P0 警示修正,无 eval 直接新增)✓
  • paper_cards 近 3 天新卡(1099~1102 范围)
  • 1099(Automata 2608.23670,agent 主分类 eval 邻接 ★)
  • 1098(AgentRoom 2608.23740,agent 主分类 eval 邻接 ★★)
  • 1100(Autonomous Math 2608.23691,agent 主分类 eval 邻接 ★)
  • 1101(SecOPD 2608.21500,agent 主分类 eval 邻接 ★★)
  • 1102(GigaBrain-0.7 2608.15875,multimodal 主分类 eval 邻接)
  • 1085(ClawProBench 2608.22510,evaluation 主分类 ★★★,R58 已锚)
  • 1069(MobilePA-Bench 2608.23035,evaluation 主分类 ★,R58 已锚)
  • 1070(Task-CoEvolve 2608.20169,evaluation 主分类 ★★,R58 已锚)
  • 1081(LongWoF-Bench 2608.23200,evaluation 主分类 ★,R58 已锚)
  • 1073(GameXpert-Bench 2608.21833,agent 主分类 eval 邻接 ★,R58 已锚)
  • knowledge/evaluation.md R58 基线确认 ✓(R57→R58:ClawProBench ★★★ + Task-CoEvolve ★★ + MobilePA-Bench ★ + LongWoF-Bench ★ + GameXpert-Bench ★ + Prime Agent ★★★ + 评测方法学延革完整 6 锚链触发 + ASI-Bench 衰减跌出确认)

二、增量摘要

本轮(E1-R59,窗口 2026-08-25 下午 ~ 2026-08-27 下午)eval 主题 eval 专项 net-new paper_card 新增 0 条eval 邻接新增 5 条(均为 agent 主分类 eval 副分类),eval 邻接延续确认 3 条关键方法学发现 1 条(Jay engineering 8-27)。

本轮最重要增量:Jay 8-27 engineering-e1prep 提出的 2608.13760 "推理训练不等于放大可预测行为"——面向推理的训练(reasoning-oriented training)并不优先放大具有最高 Lift 的行为,过程级目标(奖励校准且有依据的推理)比仅奖励表面形式效果更好。这一发现对 RLVR 的 reward shaping 有直接指导意义,与 evaluation 主题的 harness evolution / RLVR 方向高度相关,属于 eval 邻接 ★★★ 级新增

另有 SecOPD(2608.21500 ★★)——on-policy 蒸馏缓解 adaptive prompt injection,DPO/GRPO 序列级反馈的改进方向——在 stephen 8-27 noon 协调棒中被标注为 agent-security 主题簇归并,新增为 evaluation 邻接候选。


三、增量条目


增量 1 · ⭐⭐⭐ 高 · 推理训练不等于放大可预测行为(arXiv:2608.13760,2026-08)

来源: Jay/inbox/jay/2026-08-27-engineering-e1prep.md(2026-08-27 11:20 ✓)+ paper_cards 最新批次(主分类 engineering,形态 benchmark) arXiv: 2608.13760

TLDR(来源:Jay 8-27 engineering-e1prep): 发现面向推理的训练(reasoning-oriented training)并不优先放大具有最高 Lift(预测提升)的行为。这意味着过程级目标(奖励校准且有依据的推理)比仅奖励表面形式效果更好。

要点: - 核心问题:推理训练(reasoning-oriented training,如 RLVR)的目标与"放大可预测行为"之间存在偏差;当前训练信号不能有效区分"正确的推理过程"和"正确答案的偶然推理" - 核心发现:过程级目标(奖励校准且有依据的推理)比仅奖励表面形式(结果正确性)效果更好;面向推理的训练不优先放大具有最高 Lift 的行为 - 工程意义:对 RLVR(Reinforcement Learning from Verifiable Reasoning)和 Agent 的 reward shaping 有直接指导意义;对 harness engineering 中"何种 reward signal 真正有效"有评测方法学层面的质疑 - 副分类 evaluation:属于 benchmark 类——评估推理训练的 actual effect vs claimed effect,与 evaluation 主题的 harness evolution 方向形成交叉

与活文档 knowledge/evaluation.md R58 现有脉络的关系: - 现有脉络:R58 §2.5 反方体系(R57 Rethink "harness evolution 算力等价不优于 parallel sampling" + Prime Agent "Continual Harness 与 ReliabilityBench memory scaffold 张力");R58 §2.1 评测方法学 35 轴;2608.13760 提出推理训练与预测能力之间的目标偏差——过程级 reward 比 outcome reward 更能激励校准推理,属于 §2.1 评测方法学邻接(reward shaping 有效性验证轴候选);与 R58 §2.5 反方体系形成互补(Rethink 质疑 harness evolution 算力等价,2608.13760 质疑 reasoning-oriented training 的 reward 设计有效性) - 建议归入节: §2.1 评测方法学邻接 → 2608.13760(推理训练目标偏差 + 过程级 reward > outcome reward);§2.5 反方体系邻接(reward shaping 有效性)


增量 2 · ⭐⭐ 中高 · SecOPD:on-policy 蒸馏缓解 adaptive prompt injection(arXiv:2608.21500,2026-08)

来源: Tom/inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(#2 高价值 36票)+ Tom/inbox/tom/2026-08-27-0900-hf-daily-2026-08-27.md(#8 36▲)+ paper_cards/1101(2026-08-27 新建)+ spark/inbox/spark/2026-08-27-agent-e1prep.md arXiv: 2608.21500

TLDR(来源:paper_card 1101): SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation——prompt injection 列为 AI Agent #1 威胁;现有防御微调方法依赖 DPO 或 GRPO 序列级反馈信号,将整个输出等权对待导致接近 100% ASR;on-policy 蒸馏精准定位被攻击 token 位。

要点: - 核心问题:adaptive prompt injection 是 AI Agent 的 #1 威胁;现有防御微调方法(DPO/GRPO)将整个输出等权对待,导致 near 100% 攻击成功率(ASR) - 核心方案:on-policy 蒸馏精准定位被攻击的 token 位——改进序列级反馈的不足,为每个 token 独立提供反馈信号 - 关键洞察:SecOPD 从"prompt injection 防御"维度延伸了 agent 评测的边界——现有 agent 评测基准(如 GAIA/WebArena)未覆盖 prompt injection 场景;SecOPD 填补了"agent 安全防御评测"空白 - 与活文档 knowledge/evaluation.md R58 现有脉络的关系: - 现有脉络:R58 无 agent 安全防御评测专项;SecOPD 可邻接于 §2.207 评测方法学候选——作为 agent 安全防御评测的方法学补充(on-policy 蒸馏 vs 序列级 DPO/GRPO);与 R58 ClawProBench trace 级别评测形成垂直互补(后者关注 runtime trace,前者关注 token-level 安全防御) - 建议归入节: §2.207 评测方法学候选邻接 → SecOPD(on-policy 蒸馏缓解 adaptive prompt injection + token-level 防御评测);§2.6 失败模式反方体系邻接(prompt injection = Agent 失败模式第 26 类候选)


增量 3 · ⭐⭐ 中高 · AgentRoom:CRDT-Backed Shared Workspace 并发多 Agent 编码(arXiv:2608.23740,2026-08)

来源: Tom/inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(#3,4票)+ paper_cards/1098(2026-08-27 新建)+ spark/inbox/spark/2026-08-27-agent-e1prep.md arXiv: 2608.23740

TLDR(来源:paper_card 1098): 并发多 Agent 编码有望在多文件项目的自然粒度上分工,并通过冗余实现鲁棒性。现有方案要么通过 phase handoffs 序列化 Agent,要么将独立样本池化而不协调——单个 Agent 以 one-shot policy 放弃多达一半的困难任务。AgentRoom 将整个轨迹语料库折叠为一部紧凑的有限状态机(FSM)作为 LLM Agent 不可预测行为的结构性基底。

要点: - 核心问题:现有 multi-agent coding 系统继承 LLM 单 token 生成限制——要么序列化 Agent(phase handoffs),要么无协调池化(independent samples);单 Agent 以 one-shot policy 放弃多达 50% 的困难任务 - 核心方案:AgentRoom——CRDT-backed shared workspace,实现真正的并发多 Agent 协作;FSM 压缩轨迹用于安全审计和运行时监控 - 评测维度:AgentRoom 提出了新的评测维度——多 Agent 协作的"并发效率"(concurrency efficiency)和"冲突解决质量"(conflict resolution quality);跨 Agent trace 可解释性(FSM compact 7-43 states) - 关键洞察:AgentRoom 与 ClawProBench(trace 感知 runtime-native 评测)形成垂直互补——ClawProBench 关注单 Agent 的 trace 级别 failure attribution,AgentRoom 关注多 Agent 协作的并发冲突和跨 Agent trace 可解释性 - 与活文档 knowledge/evaluation.md R58 现有脉络的关系: - 现有脉络:R58 §2.207 评测方法学候选(ClawProBench trace 感知 runtime-native 评测);AgentRoom 邻接于 §2.207——作为 multi-agent 评测的新维度(并发效率 + 冲突解决质量 + FSM trace 可解释性);与 ClawProBench 形成单 Agent vs multi-agent 评测的互补覆盖 - 建议归入节: §2.207 评测方法学候选邻接 → AgentRoom(并发多 Agent 协作评测 + CRDT 工作区 + FSM 轨迹可解释性);§2.7 评测对象邻接(multi-agent 评测维度)


增量 4 · ⭐⭐ 中 · Automata from Agent Traces:FSM 压缩用于失败与下一步预测(arXiv:2608.23670,2026-08)

来源: Tom/inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(#4,4票)+ paper_cards/1099(2026-08-27 新建)+ spark/inbox/spark/2026-08-27-agent-e1prep.md arXiv: 2608.23670

TLDR(来源:paper_card 1099): 基于 LLM 的 Agent 执行多步任务,但其行为结构仍不透明——长且非结构化的轨迹难以支撑部署所需的安全审计与运行时监控。现有方法按单条轨迹或仅基于成功案例运作,因此遗漏了连接下一步预测与失败预测的跨运行拓扑。为恢复这一共有结构,我们将整条轨迹语料库折叠为一部紧凑的有限状态机(FSM),在 12 个公开数据集上 FSM 紧凑(7–43 个状态)。

要点: - 核心贡献:将整个轨迹语料库折叠为一部紧凑的 FSM——作为 LLM Agent 不可预测行为的结构性基底;用于 failure prediction 和 next-step prediction - 关键数据:12 个公开数据集;FSM 紧凑(7-43 个状态) - 评测意义:FSM 提供了一种新的 Agent 行为抽象——可用于"跨运行拓扑"的评测(而非仅单次运行);与 ClawProBench 的 trace 级别 failure attribution 互补(单次 trace vs 跨运行拓扑) - 关键洞察:Automata 的 FSM 表征可用于量化"Agent 行为的可预测性"——为 Agent 评测提供了一种新的度量维度(行为拓扑一致性) - 与活文档 knowledge/evaluation.md R58 现有脉络的关系: - 现有脉络:R58 §2.207 评测方法学候选(ClawProBench trace 感知 runtime-native 评测);Automata 邻接于 §2.207——作为跨运行拓扑的 Agent 行为可解释性评测方法(FSM compact representation);与 ClawProBench 形成单次 trace vs 跨运行拓扑的互补 - 建议归入节: §2.207 评测方法学候选邻接 → Automata(跨运行拓扑 Agent 行为评测 + FSM 压缩用于 failure/next-step prediction);§2.6 失败模式反方体系邻接


增量 5 · ⭐⭐ 中 · Autonomous Math Discovery:开放世界多 Agent 环境中的自主数学发现(arXiv:2608.23691,2026-08)

来源: Tom/inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(#6,2票)+ paper_cards/1100(2026-08-27 新建)+ spark/inbox/spark/2026-08-27-agent-e1prep.md arXiv: 2608.23691

TLDR(来源:paper_card 1100): Station 是一个开放世界多 Agent 环境,来自不同模型家族的 AI Agent 追求共同的科研目标,无需中心协调器或脚本化 pipeline。Agent 选择自己的研究方向,进行实验,协作,并构建共享的科学文献。Station 在 12 个构造问题和 2 个案例研究中获得了 5 个相对于先前文献的新结果:新无限族有限域 Kakeya 集等。

要点: - 核心问题:多 Agent 协作的评测通常在封闭的、预定义的环境中;Station 提供了开放世界的多 Agent 科研协作评测 - 关键数据:12 个 AlphaEvolve 构造问题 + 2 个额外案例研究;Station 获得 5 个新结果(相对于先前文献);包括新无限族有限域 Kakeya 集等 - 评测维度:Station 开创了"开放世界多 Agent 科研协作评测"——评估 Agent 在无中心协调情况下的自主研究方向选择、实验设计和协作质量 - 关键洞察:Station 的 5 个新数学结果是真实贡献,说明 multi-agent 开放世界评测可以产生有意义的科学成果;但这也意味着评测任务本身的客观性(ground truth 明确),与真实开放世界评测的困难形成对比 - 与活文档 knowledge/evaluation.md R58 现有脉络的关系: - 现有脉络:R58 §2.7 评测对象(GameXpert-Bench 过程评测 + MobilePA-Bench 移动端交互评测);Autonomous Math Station 邻接于 §2.7——作为开放世界 multi-agent 科研协作评测的新实例;与 GameXpert-Bench(游戏开发过程评测)形成垂直领域对比(数学 vs 游戏) - 建议归入节: §2.7 评测对象邻接 → Autonomous Math Station(开放世界多 Agent 科研协作评测);与 GameXpert-Bench 形成垂直领域对比


增量 6 · ⭐⭐ 中高 · ExtractBench arXiv:2607.29677 · 14 VLM 横评揭示 grounding 缺失(补录)

来源: spark/inbox/spark/2026-08-26-agent-e1prep.md(spark 8-26 agent-e1prep §增量 3)+ jay/inbox/jay/2026-08-26-1140-news-x-tech-radar.md(@jerryjliu0)+ paper_card 696(8-3 已建) arXiv: 2607.29677(8-3 建卡,本次补录到 evaluation)

TLDR(来源:paper_card 696): 首个企业文档结构化提取的可验证视觉溯源评测基准;PDF/企业文档 Agent 提取需返回精确来源坐标(word-level bounding box)才具备生产可审计性;14 系统评测揭示通用 VLM 和 coding agent 均不支持 grounding;LlamaExtract Agentic Plus 领先。

要点: - 核心发现:通用 VLM 和 coding agent 均不支持 grounding(精确来源坐标定位);word-level IoU 0.5 严格评分;4869 pages / 67 类 / 8 领域 - 评测意义:ExtractBench 填补了"Agent 提取输出的可审计性"评测空白——答案正确不等于来源可追溯,生产级 RAG 需要 word-level grounding - 关键洞察:14 VLM 横评 + coding agent 横评均不支持 grounding,说明当前评测体系缺少"可审计性"维度;这与 evaluation 主题的 benchmark 设计质量直接相关 - 与活文档 knowledge/evaluation.md R58 现有脉络的关系: - 现有脉络:R58 §2.207 评测方法学候选(ClawProBench trace 感知评测);ExtractBench 邻接于 §2.207——作为 RAG 输出可审计性的评测维度补充(word-level grounding);与 R58 MobilePA-Bench(移动端交互评测)和 GameXpert-Bench(过程评测)共同构成"评测对象时空范围扩展"趋势 - 建议归入节: §2.207 评测方法学候选邻接 → ExtractBench(14 VLM grounding 缺失 + word-level IoU 0.5 + 企业文档提取可审计性评测);§2.7 评测对象邻接


四、R58 基线确认(已覆盖条目)

以下条目在本日窗口中再次出现,已在 R58 中有完整记录:

条目 arXiv R58 状态
ClawProBench 2608.22510 ✅ R58 增量 1,§2.207 ★★★(work-queue Top15 #1)
Task-CoEvolve 2608.20169 ✅ R58 增量 2,§2.1 ★★
MobilePA-Bench 2608.23035 ✅ R58 增量 3,§2.7 ★
LongWoF-Bench 2608.23200 ✅ R58 增量 4,§2.207 ★
GameXpert-Bench 2608.21833 ✅ R58 增量 5,§2.7 ★(agent 主分类 eval 邻接)
Prime Agent 2608.23552 ✅ R58 增量 6,§2.5 ★★★(HF Daily 8-26 #7 32▲;完整 6 锚链)
OmniAssistBench 2608.21360 ✅ R57 已有(paper_card 未建)
Beyond Correctness 2608.12781 ✅ R57 已有(paper_card 未建)
AgentDebug GitHub UIUC ✅ R57 已有(paper_card 未建)
ReliabilityBench 2603.29231 ✅ R57 P0 反方立基础锚
HORIZON 2604.11978 ✅ R57 P0 反方立基础锚
41 种失败模式分类学 2607.28802 ✅ R57 已有(paper_card 未建)

五、值得警惕的矛盾或待核实说法

  1. SecOPD(2608.21500)paper_card 1101 于 2026-08-27 新建,但 HF Daily 8-27 未上榜:该 paper 在 Tom 8-27 0840 radar 中有 36 票(#2 高价值),但 HF Daily 8-27 无此 paper;可能是 radar 来源不同于 HF Daily;需核实该 paper 的真实社区关注度
  2. SecOPD 与 Trustworthy RAG(2608.21095)的攻击/防御边界:SecOPD 对 adaptive prompt injection,Trustworthy RAG 对 instruction injection + contradiction + entity swap;两者均属 agent 安全但攻击面不同;引用时需区分
  3. Automata(2608.23670)FSM 7-43 states 的紧凑度边界条件:具体哪些数据集达到 7 states、哪些达到 43 states?FSM compactness 与数据集复杂度/任务难度的关系需核实原文
  4. Autonomous Math Station(2608.23691)5 个新结果的质量验证:5 个新结果是否经过同行验证(论文未 peer-reviewed)?新无限族有限域 Kakeya 集的具体数学价值需要数学专家核实
  5. ExtractBench(2607.29677)grounding 缺失 14 VLM 横评:具体是哪 14 个 VLM?LlamaExtract Agentic Plus "领先"的具体指标(准确率/F1/IoU)未在 TLDR 中体现;引用时需注明"数据待核实原文"
  6. 2608.13760 推理训练目标偏差的实验覆盖范围:该发现基于哪些模型/哪些推理任务?泛化性尚未证明;引用时需注明"需核实原文 §3-4 实验细节"

六、可引用 arXiv 号列表

arXiv ID 名称 状态 分类
2608.13760 推理训练不等于放大可预测行为 ✅ Jay 8-27 engineering-e1prep eval 邻接 ★★★(reward shaping 有效性)
2608.21500 SecOPD · on-policy 蒸馏缓解 adaptive prompt injection ✅ paper_card 1101 今日入库(8-27) eval 邻接 ★★(agent 安全防御评测)
2608.23740 AgentRoom · CRDT-Backed Shared Workspace ✅ paper_card 1098 今日入库(8-27) eval 邻接 ★★(并发多 Agent 评测)
2608.23670 Automata from Agent Traces · FSM 压缩 ✅ paper_card 1099 今日入库(8-27) eval 邻接 ★★(跨运行拓扑评测)
2608.23691 Autonomous Math Discovery · Station ✅ paper_card 1100 今日入库(8-27) eval 邻接 ★★(开放世界多 Agent 评测)
2607.29677 ExtractBench · 14 VLM grounding 缺失 ✅ paper_card 696 已建(8-3);补录 evaluation eval 邻接 ★★(可审计性评测)
2608.22510 ClawProBench ✅ R58 已有(paper_card 1085) eval 专项 ★★★(work-queue Top15 #1)
2608.20169 Task-CoEvolve ✅ R58 已有(paper_card 1070) eval 专项 ★★
2608.23035 MobilePA-Bench ✅ R58 已有(paper_card 1069) eval 专项 ★
2608.23200 LongWoF-Bench ✅ R58 已有(paper_card 1081) eval 专项 ★
2608.21833 GameXpert-Bench ✅ R58 已有(paper_card 1073) eval 邻接 ★
2608.23552 Prime Agent ✅ R58 已有(paper_card 未建) eval 邻接 ★★★(完整 6 锚链)
2608.21360 OmniAssistBench ✅ R57 已有(paper_card 未建) eval 邻接 ★
2608.12781 Beyond Correctness ✅ R57 已有(paper_card 未建) eval 邻接 ★
2603.29231 ReliabilityBench ✅ 来源追溯 eval 邻接 ★★★(P0 反方立基础锚)
2604.11978 HORIZON ✅ 来源追溯 eval 邻接 ★★★(COLM 2026)
2607.28802 41 种 Agent 失败模式分类学 ✅ 来源追溯 eval 邻接 ★★
2607.12227 Harness-Evolution-Eval-Rethink ✅ 来源追溯 eval 邻接 ★★★
2608.16590 Zetta ζ ✅ paper_card 1027 已建 eval 邻接 ★★★

七、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(2026-08-27 08:40)→ SecOPD(#2,36票) + AgentRoom(#3,4票) + Automata(#4,4票) + Autonomous Math(#6,2票) = 4 条 eval 邻接候选 - /inbox/tom/2026-08-27-0900-hf-daily-2026-08-27.md(2026-08-27 09:00)→ 无 eval 专项(模型发布动态为主) - /inbox/tom/2026-08-26-evaluation-e1prep.md(2026-08-26 15:40)→ R58 基线确认 ✓ - /inbox/tom/2026-08-25-evaluation-e1prep.md(2026-08-25 15:40)→ R57 基线确认 ✓

Jay inbox(RAG 相关,近 2 天): - /inbox/jay/2026-08-27-engineering-e1prep.md(2026-08-27 11:20)→ 2608.13760 推理训练目标偏差 ★★★ + C²KV + Lynx 等工程增量 - /inbox/jay/2026-08-27-1050-jay-engineering-filter.md(2026-08-27 10:50)→ Harbor Framework + strands-agents + browser-use - /inbox/jay/2026-08-26-1140-news-x-tech-radar.md(2026-08-26 11:40)→ ExtractBench 2607.29677 ★★ + LFM2.5

Flyp inbox(RAG 相关,近 2 天): - /inbox/flyp/2026-08-26-coding-agents-e1prep.md(2026-08-26 23:20)→ GameXpert-Bench(agent 主分类 eval 邻接 ★)+ Prime Agent 完整 6 锚链触发 ★★★ - /inbox/flyp/2026-08-26-risk-e1prep.md(2026-08-26 16:38)→ Compaction Cliff(2608.22752,评测盲点第 25 例 ★)

Spark inbox(RAG 相关,近 2 天): - /inbox/spark/2026-08-27-agent-e1prep.md(2026-08-27 13:30)→ SecOPD ★★ + AgentRoom ★★ + Automata ★ + Autonomous Math ★ + 6 条 net-new agent 增量 - /inbox/spark/2026-08-26-agent-e1prep.md(2026-08-26 13:30)→ PatchWrite ★ + ExtractBench ★★ + paper_cards 25 张新卡核对

Stephen inbox(RAG 相关,近 2 天): - /inbox/stephen/2026-08-26-ai-industry-e1prep.md(2026-08-26 10:20)→ 无 eval 直接增量 ✓ - /inbox/stephen/2026-08-27-ai-industry-e1prep.md(2026-08-27 10:20)→ P0 警示修正,无 eval 直接新增 ✓

Paper_cards(近 3 天新卡,共 4 张 eval 邻接): - 1101-2608-21500 SecOPD = 增量 2 ⭐⭐(今日入库) - 1098-2608-23740 AgentRoom = 增量 3 ⭐⭐(今日入库) - 1099-2608-23670 Automata = 增量 4 ⭐⭐(今日入库) - 1100-2608-23691 Autonomous Math = 增量 5 ⭐⭐(今日入库) - 1097-2608-24877 Smart Glasses = multimodal,非 eval 直接 - 1098-2608-23740 已锚;1099-2608-23670 已锚;1100-2608-23691 已锚;1101-2608-21500 已锚;1102-2608-15875 GigaBrain-0.7 = multimodal,eval 邻接

知识基线: - organized/knowledge/evaluation.md(R58 活文档,2026-08-26 更新,ClawProBench + Task-CoEvolve + MobilePA-Bench + LongWoF-Bench + GameXpert-Bench + Prime Agent + 完整 6 锚链触发 + ASI-Bench 衰减跌出)


八、结论

本轮(E1-R59,窗口 2026-08-25 下午 ~ 2026-08-27 下午)eval 主题 eval 专项 net-new paper_card 新增 0 条eval 邻接新增 5 条(均为 agent 主分类 eval 副分类,来自今日入库的 4 张新 paper_card);eval 邻接延续确认 1 条(2608.13760,推理训练目标偏差,★叁)。

本轮最重要增量2608.13760 "推理训练不等于放大可预测行为"(★叁)——对 RLVR 的 reward shaping 有直接指导意义,过程级目标(奖励校准且有依据的推理)比 outcome reward 更能激励校准推理。SecOPD(2608.21500,★★) on-policy 蒸馏缓解 adaptive prompt injection,填补 agent 安全防御评测空白。AgentRoom(2608.23740,★★) CRDT-backed 并发多 Agent 编码,与 ClawProBench 形成单 Agent vs multi-agent 评测的互补覆盖。

立标池结构性变化(R59 第 1 日): - SecOPD 36票 新晋锚(agent 安全防御评测) - AgentRoom 4票 候选级(并发多 Agent 协作评测) - Automata 4票 候选级(跨运行拓扑 Agent 行为评测) - Autonomous Math 2票 候选级(开放世界多 Agent 科研协作) - ASI-Bench 连续六日跌出确认

涉及 arXiv 号:2608.13760(✅ Jay 8-27 engineering-e1prep / eval 邻接 ★★★)/ 2608.21500(✅ paper_card 1101 今日入库 / eval 邻接 ★★)/ 2608.23740(✅ paper_card 1098 今日入库 / eval 邻接 ★★)/ 2608.23670(✅ paper_card 1099 今日入库 / eval 邻接 ★★)/ 2608.23691(✅ paper_card 1100 今日入库 / eval 邻接 ★★)/ 2607.29677(✅ paper_card 696 已建(8-3)/ eval 邻接 ★★ 补录)


九、建议后续动作

  • [ ] 2608.13760 paper_card 新建(eval 邻接 ★★★,Jay 8-27 engineering-e1prep;reward shaping 有效性验证)
  • [ ] SecOPD(2608.21500) paper_card 1101 今日入库确认 ✓,建议深度解读(36票高价值)
  • [ ] ExtractBench(2607.29677) 补录到 evaluation 主题(paper_card 696 已建,但归类 rag;建议确认双口径)
  • [ ] Prime Agent(2608.23552) paper_card 新建(eval 邻接 ★★★,HF Daily 8-26 #7 32▲;完整 6 锚链触发)
  • [ ] OmniAssistBench(2608.21360) paper_card 新建(eval 邻接 ★,R57 遗留)
  • [ ] Beyond Correctness(2608.12781) paper_card 新建(eval 邻接 ★,R57 遗留)
  • [ ] AgentDebug(GitHub UIUC) paper_card 新建(eval 邻接 ★★★,R57 遗留)
  • [ ] 2608.13760 推理训练目标偏差 PDF §3-4 实验细节核实(模型范围、任务类型、泛化性)
  • [ ] SecOPD 与 Trustworthy RAG(2608.21095) 攻击/防御边界核实(不同攻击面)

Tom · 2026-08-27 15:40 CST · E1 预消化简报 · evaluation 主题 · 0 条 eval 专项 net-new paper_card + 5 条 eval 邻接(SecOPD ★★ + AgentRoom ★★ + Automata ★★ + Autonomous Math ★★ + ExtractBench ★★ 补录)+ 1 条 eval 邻接延续确认(2608.13760 ★★★ 推理训练目标偏差)+ ASI-Bench 连续六日衰减跌出确认 · 涉及 arXiv:2608.13760(✅Jay 8-27 ★★★)/ 2608.21500(✅1101 今日入库 ★★)/ 2608.23740(✅1098 今日入库 ★★)/ 2608.23670(✅1099 今日入库 ★★)/ 2608.23691(✅1100 今日入库 ★★)/ 2607.29677(✅696 已建补录 ★★)/ 2608.22510(✅R58已有★★★)/ 2608.20169(✅R58已有★★)/ 2608.23035(✅R58已有★)/ 2608.23200(✅R58已有★)/ 2608.21833(✅R58已有★)/ 2608.23552(✅R58已有★★★)/ 2608.21360(✅R57已有★)/ 2608.12781(✅R57已有★)/ 2603.29231(✅来源追溯★★★)/ 2604.11978(✅来源追溯★★★)/ 2607.28802(✅来源追溯★★)/ 2607.12227(✅来源追溯★★★)/ 2608.16590(✅1027已建★★★)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-08-27-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。