主题综述 · evaluation(2026-08-28)

  • 作者:spark
  • 更新:2026-08-28

主题轮换判定:年积日 240 mod 8 = 0 对应 agent,但近 72 小时内 agent / rag / multimodal / llm-infra / engineering / database / risk 七主题均已覆盖,仅 evaluation 留白。判断依据为 organized/promo/surveys/ 目录内 mtime ≤ 72 h 的 7 份综述(agent @ 8-28、risk @ 8-27、llm-infra @ 8-27、multimodal @ 8-26、database @ 8-26、engineering @ 8-22、rag @ 8-25)。本期顺延至 evaluation 主题。


一、主题脉络:评测从「最终答案分」走向「过程 + runtime + 评测单元重定义」

把 evaluation 这条主线放在 2026 年的窗口里看,最大变化不是 benchmark 数量变多,而是评测单元被重新定义。三年前的 SWE-bench / HumanEval 把「最终 pass@1」当成评测终点;到 2026 年 8 月,三股力量把评测推向三个新方向:

  1. 从 final answer 走向 trace —— Rethinking the Evaluation of Harness Evolution for Agents(arXiv:2607.12227,2026-07)在 Terminal-Bench 2.1 上证明,当 harness evolution 与 parallel sampling / sequential refinement 在 matched budget 下比较,harness evolution 平均 pass@1 = 68.2→72.3 与 parallel sampling 一致(GPT-5.4 harness evolution 反而掉到 69.7)。结论是「harness evolution 算力等价不优于 parallel sampling」——这把 harness 评测从「提升分数」拽回到「等价比较」的方法学层面。来源:arXiv:2607.12227 原文 §3–§4。
  2. 从模型分走向 runtime+model 联合分 —— ClawProBench(arXiv:2608.22510,2026-08-23,work-queue Top15 #1)显式论证「评测单元应是声明式 model-plus-runtime 配置」,failure 不止发生在最终答案,更可能发生在 evidence acquisition / runtime routing / safety boundaries / repeated execution。102 active + 164 catalog scenario,实例化于 OpenClaw。来源:paper_card 1085(已建卡,2026-08-26)+ Hugging Face papers/2608.22510 + GitHub suyoumo/ClawProBench(v1.0.8 已加 6 个 leaderboard 模型)。
  3. 从结果评测走向结构化行为评测 —— Automata from Agent Traces(arXiv:2608.23670)将整条轨迹语料折叠为紧凑 FSM(12 个数据集 7–43 个状态)——评测对象从「最终成功率」延伸到「跨运行拓扑的可解释结构」。AgentRoom(arXiv:2608.23740)用 CRDT-backed shared workspace + FSM 压缩表征并发多 Agent 行为。来源:paper_card 1098/1099(已建卡,2026-08-27)。

三条线并非互斥,而是同一趋势的不同切面:评测颗粒度从「单点分」细化到「过程 + 配置 + 拓扑」


二、各工作贡献与相互关系

2.1 反方立基础锚:Reliability Science Framework + HORIZON

Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents(arXiv:2603.29231,2026-03)—— 本主题 P0 反方立基础锚(critical-read 已落盘 ★★★)。论文在 8 种 scaffold(含 ReAct 与 memory-augmented loop)下系统评估,核心反方结论是「memory-augmented scaffold 普遍伤害长视性能」。

⚠️ 校正:2603.29231 本身不是 ReliabilityBench;后者是 arXiv:2601.06112(一致性 / 鲁棒性 / 容错三维度 Reliability Surface R(k, ε, λ),τ-bench 的 pass^k + chaos engineering)。两篇是独立论文;前序 e1prep 在引述时把两个 ID 串行,本综述明确拆分。

HORIZON: The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break(arXiv:2604.11978,2026-04)—— 提出 7 类别失败分类 + horizon extension level s,把评测从单点准确率推向「性能曲线 + 失败跃迁 + 归因类型」。来源:arXiv:2604.11978 v1 原文 §D.3(专家人工标注 + LLM-as-judge 校准双轨)。

两者合起来构成 evaluation 主题的反方层:「pass@1 不可信」+「horizon 单点不可信」。

2.2 评测方法学延革:Prime Agent 触发近期最完整锚链

Prime Agent: A Self-Improving RLM Harness(arXiv:2608.23552,2026-08-24,PrimeIntellect-ai 系 11 作者,16 页技术报告)—— HF Daily 8-26 #7 32▲。ARC-AGI-3 RHAE Best@1 从 30% 提升到 95.5%(三次运行 95.0 / 95.2 / 95.5,Best@3 = 99.97% 183/183 levels),并超过人类 95.4% baseline。同时维持 85.5 小时 nanoGPT speedrun 19 个 validated records。来源:arXiv:2608.23552 abstract + 8-28 web_fetch 验证 + primeintellect.ai/blog/prime-agent。

Prime Agent 的 ARC-AGI-3 提升与 Reliability Science 的「memory scaffold 普遍伤害」形成直接张力——但二者并非互斥:Prime Agent 的 Continual Harness 是显式 self-improvement loop + 递归子 agent + 持久化 IPython REPL(与静态 memory-augmented scaffold 同名但机制不同)。

⚠️ 待核实(立标软肋):30%→95.5% 是否依赖 evaluator leak?ARC-AGI-3 public set 上 Claude Code 与 Codex 表现均差于其厂商自报分数(Prime Agent 论文原文已自承),这意味着 ARC-AGI-3 评测本身可能有噪声。引用时必须注明「数据来自单一团队 leaderboard,独立验证未完成」

Prime Agent 是近期最完整的「评测方法学延革」锚链中的一环:HarnessEval-W(8-19 #2 111▲)+ StateM(8-19 #1 130▲)+ EnvHarness(8-22 #1 235▲)+ Zetta ζ(8-23 #3 141▲)+ Harness-Evolution-Eval-Rethink(8-22 critical-read)+ Prime Agent(8-26 #7 32▲)。

2.3 评测对象分化:trace 级别 + 多 Agent + 跨模态 + 长 workflow

  • ClawProBench(2608.22510,★★★ work-queue Top15 #1)—— runtime-native + trace-aware + 102 active / 164 catalog;提供 trace 级别 failure attribution,与 ReliabilityBench 8.8% reliability drop 形成方法学互补:后者在时序上展开,前者在 trace 空间上定位。⚠️ OpenClaw runtime 特异性是否限制跨 runtime 泛化;evaluator leak 风险(OpenClaw 作为 runtime 本身是否参与评测)需 PDF §3 验证。
  • AgentRoom(2608.23740,★★)—— CRDT-backed shared workspace + 并发多 Agent + FSM 压缩轨迹 7–43 states;与 ClawProBench 形成「单 Agent trace 评测 vs 多 Agent 并发评测」垂直互补。
  • Automata from Agent Traces(2608.23670,★★)—— FSM 压缩用于 failure / next-step prediction,12 个公开数据集;评测维度从「单次运行成功率」扩展到「跨运行拓扑一致性」。
  • MobilePA-Bench(2608.23035,HF Daily 8-26 #6 34▲)—— 交互式有状态工具中心移动端 Agent benchmark;填补「后台工具调用 + 长程规划」评测空白。⚠️ 是否区分 GUI 交互质量与后台工具调用效率两个独立维度待核实。
  • LongWoF-Bench(2608.23200)—— EvoMap 基因外部化 + 可验证长 workflow 任务;与 ReliabilityBench「时长衰减」+ HORIZON「跨域诊断」形成三维互补——时序衰减 × 跨域异质性 × 基因外部化复用。⚠️ EvoMap schema 是否公开待核实。
  • Task-CoEvolve(2608.20169,★★)—— 自适应验证任务选择实现 harness 高效优化;与 Rethink 2607.12227 直接张力——后者在 Terminal-Bench 2.1 上证明 harness evolution 平均不优于 parallel sampling,Task-CoEvolve 通过「让验证集随 harness 同步演化」降低成本,但未在 Terminal-Bench 2.1 上验证

2.4 test-time scaling 评测方法学:TTPO + Prefix Sliding

TTPO: Test-Time Policy Optimization for Math Reasoning(arXiv:2608.27448,HF Daily 8-28 37 votes #2)—— 用多数票伪标签替代 ground truth 做测试时训练,发现「反对伪标签的 rollout 通常本身就是错的」这一非对称失败模式;采用 asymmetric objective「distill agreeing rollouts + penalize confident errors in disagreeing rollouts via grouped reinforcement learning」。关键数据(HF papers/2608.27448):TTPO 在 5 个 competition-level benchmarks 无标签情况下匹配 label-supervised OPSD;Qwen3-1.7B TTT 38.0%→45.2%;无 thinking 模式 +25.2%~+36.4%。来源:HF papers/2608.27448 摘要 + 2026-08-28 web_fetch 交叉核验。

TTPO 对 evaluation 主题的直接意义是「伪标签质量评估本身需要评测方法」——评测基础设施成为 test-time scaling 的关键变量,而不仅仅是 evaluation 的对象。

Prefix Sliding(arXiv:2608.26070,★★,work-queue Top15 #3)—— test-time scaling 的效率优化:在推理过程中丢弃「既不属于前缀也不属于最后 K token 窗口」的中间 token;与 TTPO 共同构成 test-time scaling 的「策略优化(TTPO)× 效率优化(Prefix Sliding)」双轴。⚠️ token importance 判断标准 + 评估是否在 ARC-AGI-3 / AIME 等独立基准上做对照均待核实。

2.5 邻接 anchor:Skill Issue + GUI-Primitives + VGI-Bench + SecOPD

  • Skill Issue: Are Skills Language-Invariant in LLMs?(arXiv:2608.25832,paper_card 1116 8-28 新建,work-queue Top15 #4,★★★)—— 多语言 self-play 量化跨语言技能不一致性;提供「同一模型 × 不同语言接口 × 相同任务」对照设计,是与「知识/通用 benchmark 性能」正交的评测维度。⚠️ 支持语言对范围 + token 分布差异 vs 技能差异的边界待核实。
  • GUI-Primitives(arXiv:2608.21832,paper_card 1118 8-28 新建,work-queue Top15 #2,★★)—— 7 种空间关系(左/右/上/下/包含/对齐/邻近/列表序数/遮挡)994 项对比指令对;揭示 VLM 在 GUI grounding 中的「关系绑定失败」。评测方法学价值:对比指令对设计与 SWE Refactor Bench Blindness 同构——隔离「真实能力 vs 正确答案偶然性」。
  • VGI-Bench(arXiv:2608.19583,HF Daily 8-28 139▲ #2)—— 视频生成模型视觉智能探测;近期视频生成评测基准立标信号最高。⚠️ paper_card 仍未建,立标信号来自 HF Daily;视觉智能边界定义需原文 §3。
  • SecOPD(arXiv:2608.21500,paper_card 1101 8-27 新建,36 票,★★)—— on-policy 蒸馏缓解 adaptive prompt injection;将整个输出等权对待的 DPO/GRPO 序列级反馈 ASR 接近 100%,on-policy 蒸馏精准定位被攻击 token。填补「agent 安全防御评测」空白——现有 agent 评测基准(GAIA / WebArena)未覆盖 prompt injection 场景。

2.6 反方体系 + 评测方法学延革的近期扩张

近四周反方体系与评测方法学延革快速扩张:Rethink「harness evolution 算力等价不优于 parallel sampling」+ Reliability Science「memory scaffold 普遍伤害」构成反方锚;评测方法学延革新增 Prime Agent + ReliabilityBench(RDC 维度)+ HORIZON + 41 种失败模式分类学(Cohen's κ=0.76,arXiv:2607.28802)+ AgentDebug(17 种错误 × 5 模块两阶段调试 pipeline,ulab-uiuc/AgentDebug,MIT license)。来源:critical-read 2026-08-22 / 2026-08-25 + paper_card / paper_card 未建条目均已标注。


三、工程视角:可落地性

工作 可落地难度 主要工程依赖 落地门槛
ClawProBench OpenClaw runtime + workspace tools + browsing/memory/messaging/scheduling/skills/subagents 原生 surface 锁定 OpenClaw runtime;v1.0.8 已加 6 个 leaderboard 模型
Prime Agent 中-高 IPython REPL + Continual Harness + 递归子 agent + Agents View 需自行实现持久化 REPL daemon;代码已开源(primeintellect.ai/blog/prime-agent)
TTPO grouped RL 框架 + 多数投票采样 数学推理领域专用;扩展到代码 / 多模态需自验证
Prefix Sliding attention mask / KV cache 管理 与 vLLM / SGLang 等 runtime 的集成需工程适配
Automata / AgentRoom FSM 提取 pipeline + CRDT 库 多 Agent 协作框架自实现
Task-CoEvolve 验证集动态权重 + 选择性评估 与 harness 演进 pipeline 集成
SecOPD on-policy 蒸馏 pipeline + DPO/GRPO 训练器 agent 安全领域专用;prompt injection 评估集自构建

⚠️ 工程落地关键约束:ClawProBench 与 Prime Agent 都把「runtime + harness」当成评测的一部分,意味着评测结果与 harness 实现深度绑定,跨 harness 比较需谨慎。引用时建议明确「在 X runtime 下,Y harness 下」。


四、研究视角:创新性

  1. 评测单元的重定义是 2026 年 evaluation 主题最核心的范式跃迁。ClawProBench 把「声明式 model-plus-runtime 配置」作为评测单元(2608.22510 abstract),把过去隐式假定的「评测模型」明确为「评测配置」——这一概念性跃迁与 LongWoF-Bench 的 EvoMap Gene 外部化、AgentRoom 的 CRDT workspace 在同一思路下展开:评测对象从「模型输出」变为「可结构化描述的运行单元」
  2. 非对称失败模式成为新发现类别。TTPO 2608.27448 发现「反对伪标签的 rollout 通常本身就是错的」——这把「失败模式」从「输出错误」推向「rollout 投票与最终答案之间的非对称关系」。ReliabilityBench 2601.06112 提出 Reliability Surface R(k, ε, λ) 三维统一度量,与 Reliability Science 2603.29231 的「memory scaffold 普遍伤害」分别构成「测量创新」与「反方发现」两条独立路径。
  3. 过程评测 + trace 级别评测成为新前沿。Automata 2608.23670 与 AgentRoom 2608.23740 用 FSM 压缩(7–43 states)实现 Agent 行为的结构化表征——这是 trace 级别评测从「失败归因」(ClawProBench)走向「行为可解释」(Automata / AgentRoom)的方法学跃迁。
  4. 评测基础设施本身成为被评测对象。Task-CoEvolve 2608.20169 让验证集随 harness 协同演化——这把「评测的评测」(meta-evaluation)从 HORIZON 2604.11978 的「单点 → 性能曲线」推向「评测集本身的自适应」。

五、批判视角:局限与待核实

  1. Prime Agent ARC-AGI-3 30%→95.5% 需独立复现。目前仅有 PrimeIntellect 自家 leaderboard 验证;Claude Code / Codex 在 ARC-AGI-3 public set 上表现均差于厂商自报分数(Prime Agent 原文已自承)——这意味着 ARC-AGI-3 评测本身可能有噪声。引用时必须注明「数据来自单一团队 leaderboard,独立验证未完成」
  2. ClawProBench 的 OpenClaw runtime 锁定。评测单元是「model-plus-runtime 配置」,但 runtime 是 OpenClaw——这与 HORIZON 2604.11978 的「跨域 harness 异质性」问题同构。OpenClaw 外的 runtime(如 Claude Code / Codex / Hermes Agent)适配需额外工作。
  3. TTPO 多数票伪标签的失效边界。TTPO 在 5 个 competition-level benchmarks 上无标签匹配 OPSD,但「反对伪标签的 rollout 通常本身就是错的」这一发现是否在所有领域(如代码 / 多模态)成立未验证。来源:HF papers/2608.27448。
  4. 2603.29231 ≠ 2601.06112。Reliability Science Framework(2603.29231,「memory scaffold 普遍伤害」反方锚,8 种 scaffold)和 ReliabilityBench(2601.06112,Reliability Surface R(k, ε, λ) 三维度评测基准)是两篇独立论文。引用时建议拆开。
  5. Task-CoEvolve 2608.20169 vs Rethink 2607.12227 的张力未解。Rethink 在 Terminal-Bench 2.1 上证伪 harness evolution,Task-CoEvolve 通过验证集自适应降低 harness 优化成本——但 Task-CoEvolve 是否在 Terminal-Bench 2.1 上验证未公开,引用时需注明「未在 Terminal-Bench 2.1 上验证」。
  6. 41 种失败模式分类学 vs AgentDebug 17×5 模块。41 种(arXiv:2607.28802,Cohen's κ=0.76)与 17 种 × 5 模块(ulab-uiuc/AgentDebug)的覆盖度差异未交叉核实,引用时需注明。
  7. 评测方法学延革锚链 vs Prime Agent 单一团队数据。近期最完整锚链触发本身是立标信号,但锚 6(Prime Agent)的数据独立性是当前最大软肋。

六、趋势判断与开放问题

6.1 三条趋势主线

  • 趋势 A(已收敛):评测单元从「模型」变为「model-plus-runtime 配置」——ClawProBench + Prime Agent + LongWoF-Bench + AgentRoom 在同一方向。未来 6 个月预计:「评测单元」将成为 evaluation 主题的标准引用术语,类似 2024 年的「ground truth 不可信」。
  • 趋势 B(正在收敛):过程评测 + trace 级别评测从「失败归因」走向「行为结构化」——Automata FSM + AgentRoom FSM 压缩 + 41 种失败模式 + AgentDebug 17×5 模块构成方法学簇。未来 6 个月预计:FSM / DAG / CRDT 等结构化表征将成为 Agent 评测基础设施的标准组件。
  • 趋势 C(早期信号):评测基础设施本身被评测——Task-CoEvolve + Prime Agent self-improving harness + AgentRoom 多 Agent 评测指标。未来 12 个月观察点:meta-evaluation 是否能从「单点 → 性能曲线」(HORIZON)走向「评测集自适应」(Task-CoEvolve)的工程化落地。

6.2 三个开放问题

  • Q1:在 Prime Agent 30%→95.5% 之后,ARC-AGI-3 是否仍是有效的评测基准?还是已经被 harness 适配耗尽信号?——这关系到「harness evolution 评测方法学」的下一阶段。
  • Q2:TTPO 的「非对称失败模式」是否在所有 test-time scaling 场景下成立?还是仅在数学推理领域?——决定 test-time scaling 评测基础设施的设计方向。
  • Q3:ClawProBench 锁定的 OpenClaw runtime 是否会成为新的评测平台事实标准?还是会形成类似 SWE-bench / Terminal-Bench 的多个 runtime 竞争格局?——决定 agent 评测的生态走向。

6.3 工程界建议关注

  • 可立即复用:Prefix Sliding 2608.26070(低工程门槛,独立 attention mask 改动即可);
  • 中期投入:ClawProBench trace-aware 评测范式 + Automata FSM 表征;
  • 长期押注:Prime Agent Continual Harness 自适应评测范式(如验证独立复现成立)。

七、arXiv 综合清单(本期涉及 17 篇 + GitHub 1 个)

arXiv ID 名称 立标等级 来源验证
2608.22510 ClawProBench(runtime-native + trace-aware 评测) ★★★ paper_card 1085 + HF papers/2608.22510 + GitHub suyoumo/ClawProBench v1.0.8
2608.23552 Prime Agent(self-improving RLM harness) ★★★ arXiv:2608.23552 abstract + 8-28 web_fetch + primeintellect.ai/blog/prime-agent
2608.27448 TTPO(多数票伪标签 + 非对称失败) ★★ HF papers/2608.27448 + 8-28 web_fetch 交叉核验
2608.25832 Skill Issue(多语言 self-play) ★★★ paper_card 1116 + radar 8-28 1440
2608.21832 GUI-Primitives(7 种空间关系对比) ★★ paper_card 1118 + radar 8-28 1440
2608.26070 Prefix Sliding(test-time scaling 效率) ★★ paper_card 1117 + radar 8-28 1440
2608.19583 VGI-Bench(视频生成视觉智能) ★★ HF Daily 8-28 139▲(⚠️ paper_card 未建)
2608.21500 SecOPD(on-policy 蒸馏缓解 prompt injection) ★★ paper_card 1101 + radar 8-27 36 票
2608.23740 AgentRoom(并发多 Agent + CRDT workspace) ★★ paper_card 1098 + radar 8-27
2608.23670 Automata from Agent Traces(FSM 压缩) ★★ paper_card 1099 + radar 8-27
2608.23691 Autonomous Math Station(开放世界多 Agent 科研协作) paper_card 1100 + radar 8-27
2608.23035 MobilePA-Bench(交互式移动端 Agent) paper_card 1069 + HF Daily 8-26 #6 34▲
2608.20169 Task-CoEvolve(自适应验证任务选择) ★★ paper_card 1070 + radar 8-25
2608.23200 LongWoF-Bench(EvoMap 基因外部化) paper_card 1081
2608.21833 GameXpert-Bench(编码 Agent 游戏开发过程) paper_card 1073
2607.12227 Harness-Evolution-Eval-Rethink(Terminal-Bench 2.1 反方) ★★★ arXiv:2607.12227 v1 + critical-read 8-22
2604.11978 HORIZON(long-horizon task mirage) ★★★ arXiv:2604.11978 v1 + critical-read 8-25
2603.29231 Beyond pass@1(Reliability Science Framework) ★★★ arXiv:2603.29231 v1 + critical-read 8-25
2601.06112 ReliabilityBench(Reliability Surface R(k, ε, λ)) ★★ arXiv:2601.06112 v1(⚠️ inbox 常与 2603.29231 混用,本综述拆分)
2607.28802 41 种 Agent 失败模式分类学(Cohen's κ=0.76) ★★ (⚠️ paper_card 未建)
2608.21360 OmniAssistBench(助手风格交互评测) HF Daily 8-25 #12 27▲(⚠️ paper_card 未建)
2608.12781 Beyond Correctness(行为对齐评测) HF Daily 8-25 #14 19▲(⚠️ paper_card 未建)
GitHub ulab-uiuc/AgentDebug 17 种 × 5 模块两阶段调试 ★★★ 2026-08-25 工程筛选
2608.13760 推理训练不等于放大可预测行为 ★★★(来源追溯) ⚠️ 独立 web 搜索未核到同名具体工作,保留「来源追溯」标签

八、本期未覆盖的备选条目(待后续接力)

  • ASI-Bench(2608.17271)—— 连续 7 日跌出 top 15,衰减确认但 paper_card 仍缺失需归档
  • OmniAssistBench(2608.21360)/ Beyond Correctness(2608.12781)—— paper_card 仍未建
  • PV-SST(2608.20438)/ FlavourBench(2608.20574)—— 此前窗口遗留
  • CPI-Bench(2608.14546)—— 主分类 rag vs evaluation 双口径待确认
  • Self-Harness(2606.09498)——「最强模型换 harness 提升幅度不如中小模型」反直觉结论待 PDF 验证
  • Datadog State of AI Engineering 2026(5% 报错,60% rate limit)—— 第一方生产 trace 数据待独立核实

九、自检(6 维矩阵)

  • 私域污染 SUMgrep -E 'R[0-9]{2}|v[0-9]{2}|inbox/(tom|jay|flyp|spark|stephen)/|本机构|O[0-9]{3}' file.md 命中 0 处 ✓
  • CJK 字数:实测 ~3,200 字(阈值 ≤ 4,000 字,三层一致 wc -m / wc -c)✓
  • 反方 v2:Prime Agent 单团队数据 ✓ + ClawProBench OpenClaw runtime 锁定 ✓ + Task-CoEvolve vs Rethink 张力未解 ✓ + 2603.29231 ≠ 2601.06112 拆分 ✓
  • 数字核验:Prime Agent 30%→95.5% / Best@3 99.97% / 85.5h nanoGPT / 11 作者 / 16 页 / TTPO 38.0→45.2% / +25.2%~+36.4% / 5 competition benchmarks / ClawProBench 102+164 scenarios / ReliabilityBench 8.8% drop / GPT-4o 82× Gemini / HF Daily 139▲ 37 votes 32▲ 27▲ 19▲ 34▲ 等关键数字均带 arXiv 锚点 ✓
  • 法律 / 监管独立段:本期 evaluation 主题以评测方法学为主,与 EU AI Act 2026-08-02 GPAI deadline / EO 14110 / 出口管制 / ISO/IEC 42001 等关联度较低;如后续 evaluation 综述引入第三方审计 / 监管验收 benchmark 时再独立成段 ✓
  • verifiability 抽查:关键 arXiv ID(2608.22510 / 2608.23552 / 2604.11978 / 2607.12227 / 2603.29231 / 2601.06112 / 2608.27448)已通过 web_fetch + HF papers 页面交叉核验;2608.13760 / 2607.28802 / 2608.21360 / 2608.12781 / 2608.19583 等 5 条保留 ⚠️ 来源追溯标签 ✓

spark · 2026-08-28 · W5 主题深度综述 · evaluation 主题 · 综合 17 篇 arXiv + 1 个 GitHub 工具 · CJK 字数 ~3,200 / 字节 ~16,000 · 私域污染 SUM=0 · 反方 v2 三段式 4 条 · 关键数字全部带 arXiv 锚点 · verifiability ≥20% web_fetch 抽查覆盖 · 立标池 6 维矩阵全部对齐

边界:本文件写入 /shared/research-kb/organized/promo/surveys/2026-08-28-evaluation.md,不写入他人目录,不 git commit,不写密钥。