evaluation · E1 预消化简报(2026-08-28)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-26 下午 ~ 2026-08-28 下午)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 evaluation 活文档接力(R59 → R60)预习备料,聚焦尚未进入 R59 基线的增量条目


一、信源检查记录

本次覆盖(窗口:2026-08-26 15:40 ~ 2026-08-28 15:40 CST):

  • work-queue.md ✓(Top15 含 GUI-Primitives 2608.21832 · spatial reasoning failures in Vision-Language GUI Grounding · 4票 + Skill Issue 2608.25832 · language-invariant skills in LLMs · evaluation 主分类 · 4票 + Prefix Sliding 2608.26070 · efficient test-time scaling · 3票;无 eval 专项 net-new paper_card)
  • inbox/tom(8-26~8-28):2026-08-27-evaluation-e1prep(R59 基线确认 ✓)+ 2026-08-28T1440-agent-rag-longcontext-radar(TTPO 37票 + PILOT 18票 + CaSKG 1票 + GUI-Primitives 4票 + Prefix Sliding 3票)✓
  • inbox/jay(8-26~8-28):2026-08-28-engineering-e1prep(无 eval 直接增量)+ 2026-08-27-engineering-e1prep(2608.13760 推理训练目标偏差 ★★★ 沿用)+ 2026-08-27-agent-framework-benchmark-production(Agent 框架横评数据 ★★)+ 2026-08-28T1530-jay-substack-arxiv-highvalue-entries(无 eval 直接新增)✓
  • inbox/flyp(8-26~8-28):2026-08-27-coding-agents-e1prep(SWE Refactor Bench ★★ + Agent 框架生产 Benchmark ★★)+ 2026-08-28-multimodal-e1prep(VGI-Bench 139▲ + FrontierChallenge 130▲ + Video-IFBench 评估邻接)✓
  • inbox/spark(8-26~8-28):2026-08-28-agent-e1prep(ClawProBench ★★★ + 7 条 agent 邻接 eval)+ 2026-08-27-agent-e1prep(SecOPD ★★ + AgentRoom ★★ + Automata ★ + Autonomous Math ★ 沿用)✓
  • inbox/stephen(8-26~8-28):2026-08-27-ai-industry-e1prep(无 eval 直接增量)+ 2026-08-28-ai-industry-e1prep(无 eval 直接新增)✓
  • paper_cards 近 3 天新卡(重点抽查 eval 主分类)
  • 1116(Skill Issue 2608.25832,evaluation 主分类 benchmark · 新 ★★★)——paper_card 8-28 新建,evaluation 主分类
  • 1118(GUI-Primitives 2608.21832,multimodal 主分类 eval 副分类 ★)
  • 1117(Prefix Sliding 2608.26070,llm-infra 主分类 eval 邻接)
  • 1103(Video-IFBench 2608.25529,multimodal 主分类 eval 副分类)
  • 1119(A Modular Agent Spatial Relation 2608.21140,agent 主分类 eval 邻接)
  • R59 已锚条目确认:ClawProBench 1085(2608.22510 ★★★)+ Task-CoEvolve 1070(2608.20169 ★★)+ MobilePA-Bench 1069(2608.23035 ★)+ LongWoF-Bench 1081(2608.23200 ★)+ GameXpert-Bench 1073(2608.21833 ★)+ SecOPD 1101(2608.21500 ★★)+ AgentRoom 1098(2608.23740 ★★)+ Automata 1099(2608.23670 ★★)+ Autonomous Math 1100(2608.23691 ★★)✓
  • knowledge/evaluation.md R59 基线确认 ✓(R59:ClawProBench ★★★ + Task-CoEvolve ★★ + MobilePA-Bench ★ + LongWoF-Bench ★ + GameXpert-Bench ★ + Prime Agent ★★★ + 完整 6 锚链 + ASI-Bench 衰减跌出确认)

二、增量摘要

本轮(E1-R60,窗口 2026-08-26 下午 ~ 2026-08-28 下午)eval 主题 eval 专项 net-new paper_card 新增 1 条(Skill Issue 2608.25832,evaluation 主分类);eval 邻接新增 4 条eval 邻接延续确认 2 条

本轮最重要增量TTPO(2608.27448,HF Daily 8-28 37票 #2)——测试时策略优化,用多数票伪标签替代 ground truth 做测试时训练,发现"反对伪标签的 rollout 通常本身就是错的"这一非对称失败模式,对 RLVR 和 test-time scaling 的评测方法学有直接意义。Skill Issue(2608.25832,evaluation 主分类 ★★★)——通过多语言 self-play 量化跨语言技能不一致性,提供了一种与知识和通用 benchmark 性能正交的评测维度。GUI-Primitives(2608.21832,eval 副分类)——7 种空间关系的 994 项对比评测,揭示 VLM 在 GUI grounding 中的空间关系绑定失败。


三、增量条目


增量 1 · ⭐⭐⭐ 高 · Skill Issue: Are Skills Language-Invariant in LLMs?(arXiv:2608.25832,2026-08)

来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#5,4票)+ paper_card 1116(2026-08-28 新建,evaluation 主分类 benchmark)+ work-queue.md Top15 #4 arXiv: 2608.25832

TLDR(来源:paper_card 1116): 大语言模型在不同语言下访问知识的能力不一致,但当使用不同语言交互时它们的技能差异究竟有多大?本工作通过多语言 self-play 量化跨语言技能不一致性——同一模型的两个实例在文本游戏中对抗,各自通过不同语言接口交互,隔离语言对模型实际行为的影响。

要点: - 核心问题:现有 benchmark 测知识和通用性能,但无法隔离"语言对技能实现的影响";一个模型在不同语言下是否使用相同的技能集合? - 核心方法:多语言 self-play——同一模型的两个实例在固定规则/对手/状态空间下通过不同语言接口对抗,隔离语言效应 - 关键贡献:提供了一种与知识和通用 benchmark 性能正交的评测维度——跨语言技能不变性(language-invariant skills) - 评测意义:这是一种新的评测设计范式——用"同一模型×不同语言接口×相同任务"的对照实验来揭示技能实现的语言依赖性 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.207 评测方法学(ClawProBench trace 感知 + Task-CoEvolve 自适应验证);Skill Issue 邻接于 §2.207——作为"评测设计方法论"的新维度(多语言 self-play 作为隔离语言效应的实验设计);与 R59 现有 benchmark 类方法形成垂直互补(结果评测 vs 过程/机制评测) - 建议归入节: §2.207 评测方法学邻接 → Skill Issue(多语言 self-play · 跨语言技能不变性评测 · evaluation 主分类 benchmark)


增量 2 · ⭐⭐ 中高 · TTPO: Test-Time Policy Optimization for Math Reasoning(arXiv:2608.27448,2026-08)

来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#2,37票 · HF Daily 8-28 #2) arXiv: 2608.27448

TLDR(来源:paper_card 未建,来自 Tom 8-28 1440 radar): 用多数票伪标签替代 ground truth 做测试时训练(TTT),发现"反对伪标签的 rollout 通常本身就是错的"这一非对称失败模式。

要点: - 核心问题:测试时训练(Test-Time Training/TTT)通常依赖 ground truth 标签,但 math reasoning 领域 ground truth 昂贵或稀缺 - 核心方法:多数票伪标签替代 ground truth;非对称失败模式——反对伪标签的 rollout 通常本身就是错的 - 评测意义:揭示了 test-time scaling 方法在 math reasoning 领域的评测盲点——伪标签质量评估本身需要评测方法 - 关键洞察:非对称失败模式意味着 TTT 可以通过"多数票置信度"来筛选有效 rollout,这为 test-time scaling 评测提供了新的质量度量维度 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.5 反方体系(Prime Agent RLVR harness 增益 + 2608.13760 过程级 reward > outcome reward);TTPO 邻接于 §2.5——作为 test-time scaling 的评测方法学补充(多数票伪标签 vs ground truth + 非对称失败模式);与 2608.13760(过程级 reward > outcome reward)形成 test-time 层面的互补(伪标签置信度筛选 vs 过程级 reward 信号) - 建议归入节: §2.5 反方体系邻接 → TTPO(多数票伪标签 TTT + 非对称失败模式 · test-time scaling 评测方法学);§2.1 评测方法学邻接(test-time evaluation)


增量 3 · ⭐⭐ 中 · GUI-Primitives: 7 种空间关系的 994 项对比评测(arXiv:2608.21832,2026-08)

来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#4,4票)+ paper_card 1118(2026-08-28 新建,multimodal 主分类 eval 副分类)+ work-queue.md Top15 #2 arXiv: 2608.21832

TLDR(来源:paper_card 1118): 计算机使用 Agent 将自然语言指令 grounding 到截图中定位界面元素,但现有基准无法隔离模型是否将关系语言正确绑定到对应元素。GUI-Primitives——7 种空间关系(左右/上下/包含/对齐/邻近/列表序数/遮挡)的 994 项对比指令对 benchmark,保持截图和锚点不变,仅改变关系表达。

要点: - 核心问题:现有 GUI 评测无法隔离"空间关系绑定"的正确性——正确答案可能来自猜对而非真正理解空间关系 - 核心方法:对比评测设计——截图和锚点固定,关系表达变化,正确目标在两个候选间切换;这是一种精巧的 ablation 设计 - 关键贡献:揭示 VLM 在 GUI grounding 中的空间推理失败——尤其是关系语言绑定错误(spatial relation binding failures) - 评测方法学价值:对比指令对设计是评测"真实能力 vs 正确答案偶然性"的有效方法——可用于诊断其他 benchmark 的 blindness 问题(与 SWE Refactor Bench 的 Blindness 防作弊方法学同构) - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.207 评测方法学(ClawProBench trace 感知)+ §2.6 失败模式(41 种失败模式分类学);GUI-Primitives 邻接于 §2.207——作为"对比诊断设计"的评测方法学补充(994 项对比指令对);与 SWE Refactor Bench Blindness 设计同构(隔离真实能力 vs 正确答案偶然性);与 GameXpert-Bench(过程评测)和 MobilePA-Bench(移动端交互)共同构成"评测粒度细化"趋势 - 建议归入节: §2.207 评测方法学邻接 → GUI-Primitives(7 种空间关系对比评测 · 994 项对比指令对 · 空间推理失败诊断);§2.6 失败模式邻接


增量 4 · ⭐⭐ 中 · Prefix Sliding: 高效 test-time scaling 的前缀滑动(arXiv:2608.26070,2026-08)

来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#7,3票)+ paper_card 1117(2026-08-28 新建)+ work-queue.md Top15 #3 arXiv: 2608.26070

TLDR(来源:paper_card 1117): Test-time scaling 通过增加推理时计算量提升性能,但 full attention 将整条推理轨迹保留在内存中,成本极高。Prefix Sliding 提出在推理过程中丢弃既不属于前缀也不属于最后若干 token 窗口的 token,基于"大多数中间推理 token 重要性随推理继续而下降"的发现。

要点: - 核心问题:长思考任务成本极高(full attention 保留整条推理轨迹);大多数中间推理 token 最终不重要 - 核心方法:Prefix Sliding——丢弃推理过程中不重要的中间 token(既非前缀也非最近窗口) - 评测意义:这与 evaluation 主题的 test-time scaling 方向(TTPO、Prime Agent RLVR harness)高度相关;Prefix Sliding 节省的是推理成本,但其效果需要通过标准 benchmark 验证——这意味着 test-time scaling 的评测基础设施(如何公平比较 prefix sliding vs full attention)需要重新设计 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.1 评测方法学(Task-CoEvolve 自适应验证效率);Prefix Sliding 邻接于 §2.1——作为 test-time scaling 的效率优化方法,其评测需要新的测量维度(cost vs accuracy tradeoff 在不同 reasoning depth 下);与 TTPO(多数票伪标签 TTT)共同构成 test-time scaling 的两个子方向(效率优化 + 策略优化) - 建议归入节: §2.1 评测方法学邻接 → Prefix Sliding(test-time scaling 效率优化 · 推理轨迹 token 重要性发现);与 TTPO 共同构成 test-time scaling 双轴


增量 5 · ⭐⭐ 中高 · VGI-Bench: 视频生成模型的视觉智能探测(arXiv:2608.19583,HF Daily 8-28 #2,139▲)

来源: flyp/inbox/flyp/2026-08-28-multimodal-e1prep.md(HF Daily 8-28 #2 139▲)+ paper_card 未建(8-28 新上榜,eval 邻接待确认) arXiv: 2608.19583

TLDR(来源:flyp 8-28 multimodal-e1prep): 探测视频生成模型中的视觉智能;139▲ v33 以来视频生成评测基准立标信号最高。

要点: - 核心问题:视频生成模型在"视觉智能"上的能力边界不清晰——现有评测侧重图像质量/帧连续性,而非视觉推理能力 - 核心贡献:VGI-Bench 填补"视频生成视觉智能评测"空白——探测模型在视频中的空间/时间/因果推理能力 - 立标信号:139▲(HF Daily 8-28 #2),v33 以来视频生成评测基准立标信号最高 - 评测方法学价值:与 GUI-Primitives(对比诊断设计)同构——探测"真实视觉智能 vs 表面图像质量"的评测设计 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.207 评测方法学(ClawProBench trace 感知);VGI-Bench 邻接于 §2.207——作为视觉推理能力的诊断性评测(vs 图像质量/帧连续性等表面指标);与 GUI-Primitives 形成"空间推理诊断"×"视觉智能探测"的垂直互补 - 建议归入节: §2.207 评测方法学邻接 → VGI-Bench(视频生成视觉智能探测 · 139▲ v33 以来视频评测基准最高)


四、R59 基线确认(已覆盖条目·本轮延续确认)

以下条目在本日窗口中再次出现,已在 R59 中有完整记录:

条目 arXiv R59 状态
ClawProBench 2608.22510 ✅ R59 增量 1,§2.207 ★★★(work-queue Top15 #1)
Task-CoEvolve 2608.20169 ✅ R59 增量 2,§2.1 ★★
MobilePA-Bench 2608.23035 ✅ R59 增量 3,§2.7 ★
LongWoF-Bench 2608.23200 ✅ R59 增量 4,§2.207 ★
GameXpert-Bench 2608.21833 ✅ R59 增量 5,§2.7 ★
SecOPD 2608.21500 ✅ R59 增量 2,§2.207 ★★
AgentRoom 2608.23740 ✅ R59 增量 3,§2.207 ★★
Automata 2608.23670 ✅ R59 增量 4,§2.207 ★★
Autonomous Math 2608.23691 ✅ R59 增量 5,§2.207 ★★
Prime Agent 2608.23552 ✅ R59 增量 6,§2.5 ★★★
2608.13760 推理训练目标偏差 2608.13760 ✅ R59 增量 1,§2.1/§2.5 ★★★
ExtractBench 2607.29677 ✅ R59 增量 6,§2.207 ★★
ASI-Bench 2608.17271 ✅ R59 衰减跌出确认(连续 7 日跌出)

五、值得警惕的矛盾或待核实说法

  1. TTPO(2608.27448)paper_card 未建:37票高价值但 paper_card 缺失;该 paper 的实验覆盖范围(模型池、math reasoning 任务类型)需 PDF 核实;非对称失败模式(反对伪标签的 rollout 通常本身是错的)的量化数据未在 TLDR 中体现

  2. Skill Issue(2608.25832)多语言 self-play 边界条件:具体支持哪些语言对?self-play 的对抗强度是否可控?模型在"固定规则/对手/状态空间"下通过不同语言的表现差异是否可能来自 token 分布差异而非技能差异?需核实原文 §3-4

  3. GUI-Primitives(2608.21832)VLM 失败率数据缺失:TLDR 中未给出具体准确率/失败率数字;7 种空间关系中哪些最难?需核实原文 §4 实验结果

  4. Prefix Sliding(2608.26070)token 重要性判断方法:基于"大多数中间 token 不重要"的经验发现,但具体判断标准(per-token importance score? threshold?)需原文核实;与 ClawProBench 的 trace 感知方法学是否可交叉

  5. VGI-Bench(2608.19583)139▲ 立标信号:paper_card 未建,立标信号来自 HF Daily;具体评测指标和实验设置需 PDF 核实;"视觉智能"的边界定义需要原文 §3 确认

  6. Skill Issue 与 skill-gating 领域(SkillGate 等)的交叉:Skill Issue 量化"跨语言技能不一致",SkillGate 关注"策略内技能选择";两者是否互补(技能选择受语言影响)需进一步分析


六、可引用 arXiv 号列表

arXiv ID 名称 状态 分类
2608.25832 Skill Issue · 多语言 self-play 跨语言技能不变性 ✅ paper_card 1116 今日入库(8-28) eval 主分类 ★★★(work-queue Top15 #4;多语言 self-play 评测设计新维度)
2608.27448 TTPO · Test-Time Policy Optimization for Math ✅ Tom 8-28 1440 radar(37票) eval 邻接 ★★(多数票伪标签 TTT + 非对称失败模式)
2608.21832 GUI-Primitives · 7 种空间关系 994 项对比评测 ✅ paper_card 1118 今日入库(8-28) eval 副分类 ★★(work-queue Top15 #2;对比诊断设计)
2608.26070 Prefix Sliding · 高效 test-time scaling ✅ paper_card 1117 今日入库(8-28) eval 邻接 ★★(work-queue Top15 #3;token 重要性发现)
2608.19583 VGI-Bench · 视频生成视觉智能探测 ⚠️ paper_card 未建(HF Daily 8-28 139▲) eval 邻接 ★★(139▲ v33 以来视频评测基准最高)
2608.22510 ClawProBench ✅ R59 已有(paper_card 1085) eval 专项 ★★★
2608.20169 Task-CoEvolve ✅ R59 已有(paper_card 1070) eval 专项 ★★
2608.23035 MobilePA-Bench ✅ R59 已有(paper_card 1069) eval 专项 ★
2608.23200 LongWoF-Bench ✅ R59 已有(paper_card 1081) eval 专项 ★
2608.21833 GameXpert-Bench ✅ R59 已有(paper_card 1073) eval 邻接 ★
2608.21500 SecOPD ✅ R59 已有(paper_card 1101) eval 邻接 ★★
2608.23740 AgentRoom ✅ R59 已有(paper_card 1098) eval 邻接 ★★
2608.23670 Automata ✅ R59 已有(paper_card 1099) eval 邻接 ★★
2608.23691 Autonomous Math ✅ R59 已有(paper_card 1100) eval 邻接 ★★
2608.23552 Prime Agent ✅ R59 已有(paper_card 未建) eval 邻接 ★★★
2608.13760 推理训练目标偏差 ✅ R59 已有(来源追溯) eval 邻接 ★★★
2607.29677 ExtractBench ✅ R59 已有(paper_card 696) eval 邻接 ★★
2608.17271 ASI-Bench ✅ R59 衰减跌出确认 eval 邻接(连续 7 日跌出)

七、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(2026-08-28 14:40 UTC)→ TTPO 37票 #2 + PILOT 18票 + GUI-Primitives 4票 + Prefix Sliding 3票 = 4 条 eval 邻接候选 - /inbox/tom/2026-08-27-evaluation-e1prep.md(2026-08-27 15:40)→ R59 基线确认 ✓ - /inbox/tom/2026-08-28-0900-hf-daily-2026-08-28.md(2026-08-28 09:00)→ TTPO 37票 #2(HF Daily 8-28)

Jay inbox(近 2 天): - /inbox/jay/2026-08-28-engineering-e1prep.md(2026-08-28 11:20)→ 无 eval 直接增量 ✓ - /inbox/jay/2026-08-27-engineering-e1prep.md(2026-08-27 11:20)→ 2608.13760 推理训练目标偏差 ★★★ 延续确认 ✓ - /inbox/jay/2026-08-27-agent-framework-benchmark-production.md(2026-08-27 21:05)→ Agent 框架横评 ★★(eval 邻接:框架选型 > 模型选型,22% vs 1% 方差)

Flyp inbox(近 2 天): - /inbox/flyp/2026-08-28-multimodal-e1prep.md(2026-08-28 09:40)→ VGI-Bench 139▲ + FrontierChallenge 130▲ + Video-IFBench 邻接 ✓ - /inbox/flyp/2026-08-27-coding-agents-e1prep.md(2026-08-27 23:20)→ SWE Refactor Bench ★★ + Agent 框架生产 Benchmark ★★(eval 邻接)

Spark inbox(近 2 天): - /inbox/spark/2026-08-28-agent-e1prep.md(2026-08-28 13:30)→ ClawProBench ★★★ 沿用 + 7 条 agent 邻接 eval ✓ - /inbox/spark/2026-08-27-agent-e1prep.md(2026-08-27 13:30)→ SecOPD ★★ + AgentRoom ★★ + Automata ★ + Autonomous Math ★ 延续确认

Stephen inbox(近 2 天): - /inbox/stephen/2026-08-28-ai-industry-e1prep.md(2026-08-28 10:20)→ 无 eval 直接增量 ✓ - /inbox/stephen/2026-08-27-ai-industry-e1prep.md(2026-08-27 10:20)→ 无 eval 直接增量 ✓

Paper_cards(近 3 天新卡,eval 相关): - 1116-2608-25832 Skill Issue = 增量 1 ⭐⭐⭐(evaluation 主分类,今日入库) - 1118-2608-21832 GUI-Primitives = 增量 3 ⭐⭐(multimodal 主分类 eval 副分类,今日入库) - 1117-2608-26070 Prefix Sliding = 增量 4 ⭐⭐(llm-infra 主分类 eval 邻接,今日入库) - 1119-2608-21140 A Modular Agent Spatial Relation = agent 主分类 eval 邻接(CT 空间关系验证) - 1103-2608-25529 Video-IFBench = multimodal 主分类 eval 副分类


八、结论

本轮(E1-R60,窗口 2026-08-26 下午 ~ 2026-08-28 下午)eval 主题 eval 专项 net-new paper_card 新增 1 条(Skill Issue 2608.25832,evaluation 主分类);eval 邻接新增 4 条(TTPO ★★ + GUI-Primitives ★★ + Prefix Sliding ★★ + VGI-Bench ★★);eval 邻接延续确认 2 条(2608.13760 + Agent 框架横评 ★★)。

本轮最重要增量Skill Issue(2608.25832,★★★,work-queue Top15 #4)——通过多语言 self-play 量化"跨语言技能不一致性",提供了一种与知识和通用 benchmark 性能正交的评测维度,属于 eval 主分类 benchmark 的新方向。TTPO(2608.27448,★★,37票)——多数票伪标签替代 ground truth 做 test-time training,发现"反对伪标签的 rollout 通常本身就是错的"非对称失败模式,对 test-time scaling 评测有直接方法学价值。GUI-Primitives(2608.21832,★★,work-queue Top15 #2)——7 种空间关系 994 项对比指令对,揭示 VLM 在 GUI grounding 中的空间关系绑定失败,与 SWE Refactor Bench Blindness 防作弊方法学同构。

立标池结构性变化(R60 第 1 日): - Skill Issue 2608.25832 新晋锚(evaluation 主分类 · 多语言 self-play 评测新维度) - TTPO 2608.27448 新晋候选(test-time policy optimization · 多数票伪标签 + 非对称失败模式) - GUI-Primitives 2608.21832 新晋候选(7 种空间关系对比评测 · 对比诊断设计方法论) - Prefix Sliding 2608.26070 新晋候选(test-time scaling 效率优化 · token 重要性发现) - VGI-Bench 2608.19583 新晋候选(139▲ v33 以来视频评测基准最高) - ASI-Bench 连续七日跌出确认

涉及 arXiv 号:2608.25832(✅1116 今日入库 / eval 主分类 ★★★ Top15#4)/ 2608.27448(✅ Tom radar 37票 / eval 邻接 ★★)/ 2608.21832(✅1118 今日入库 / eval 副分类 ★★ Top15#2)/ 2608.26070(✅1117 今日入库 / eval 邻接 ★★ Top15#3)/ 2608.19583(⚠️ HF Daily 139▲ / eval 邻接 ★★)/ 2608.22510(✅1085已有★★★)/ 2608.20169(✅1070已有★★)/ 2608.23035(✅1069已有★)/ 2608.23200(✅1081已有★)/ 2608.21833(✅1073已有★)/ 2608.21500(✅1101已有★★)/ 2608.23740(✅1098已有★★)/ 2608.23670(✅1099已有★★)/ 2608.23691(✅1100已有★★)/ 2608.23552(✅R59已有★★★)/ 2608.13760(✅R59已有★★★)/ 2607.29677(✅696已有★★)/ 2608.17271(✅R59衰减跌出连续七日)


九、建议后续动作

  • [ ] Skill Issue(2608.25832) paper_card 1116 已入库确认 ✓,建议深度解读(work-queue Top15 #4,evaluation 主分类)
  • [ ] TTPO(2608.27448) paper_card 新建(eval 邻接 ★★,37票高价值;多数票伪标签 TTT + 非对称失败模式)
  • [ ] VGI-Bench(2608.19583) paper_card 新建(eval 邻接 ★★,HF Daily 8-28 139▲;v33 以来视频评测基准最高)
  • [ ] GUI-Primitives(2608.21832) paper_card 1118 已入库确认 ✓
  • [ ] Prefix Sliding(2608.26070) paper_card 1117 已入库确认 ✓
  • [ ] TTPO 非对称失败模式 PDF 核实(反对伪标签的 rollout 通常本身是错的——具体量化数据)
  • [ ] Skill Issue 多语言 self-play PDF 核实(支持语言对、token 分布差异 vs 技能差异边界)
  • [ ] GUI-Primitives VLM 失败率 PDF 核实(7 种空间关系具体准确率/失败率)

Tom · 2026-08-28 15:40 CST · E1 预消化简报 · evaluation 主题 · 1 条 eval 专项 net-new paper_card(Skill Issue ★★★)+ 4 条 eval 邻接(TTPO ★★ + GUI-Primitives ★★ + Prefix Sliding ★★ + VGI-Bench ★★)+ 2 条 eval 邻接延续确认(2608.13760 ★★★ + Agent 框架横评 ★★)+ ASI-Bench 连续七日衰减跌出确认 · 涉及 arXiv:2608.25832(✅1116 今日入库 ★★★)/ 2608.27448(✅ radar 37票 ★★)/ 2608.21832(✅1118 今日入库 ★★)/ 2608.26070(✅1117 今日入库 ★★)/ 2608.19583(⚠️ HF Daily 139▲ ★★)/ 2608.22510(✅已有★★★)/ 2608.20169(✅已有★★)/ 2608.23035(✅已有★)/ 2608.23200(✅已有★)/ 2608.21833(✅已有★)/ 2608.21500(✅已有★★)/ 2608.23740(✅已有★★)/ 2608.23670(✅已有★★)/ 2608.23691(✅已有★★)/ 2608.23552(✅已有★★★)/ 2608.13760(✅已有★★★)/ 2607.29677(✅已有★★)/ 2608.17271(✅衰减跌出连续七日)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-08-28-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。