evaluation · E1 预消化简报(2026-08-28)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-26 下午 ~ 2026-08-28 下午)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 evaluation 活文档接力(R59 → R60)预习备料,聚焦尚未进入 R59 基线的增量条目
一、信源检查记录
本次覆盖(窗口:2026-08-26 15:40 ~ 2026-08-28 15:40 CST):
- work-queue.md ✓(Top15 含 GUI-Primitives 2608.21832 · spatial reasoning failures in Vision-Language GUI Grounding · 4票 + Skill Issue 2608.25832 · language-invariant skills in LLMs · evaluation 主分类 · 4票 + Prefix Sliding 2608.26070 · efficient test-time scaling · 3票;无 eval 专项 net-new paper_card)
- inbox/tom(8-26~8-28):2026-08-27-evaluation-e1prep(R59 基线确认 ✓)+ 2026-08-28T1440-agent-rag-longcontext-radar(TTPO 37票 + PILOT 18票 + CaSKG 1票 + GUI-Primitives 4票 + Prefix Sliding 3票)✓
- inbox/jay(8-26~8-28):2026-08-28-engineering-e1prep(无 eval 直接增量)+ 2026-08-27-engineering-e1prep(2608.13760 推理训练目标偏差 ★★★ 沿用)+ 2026-08-27-agent-framework-benchmark-production(Agent 框架横评数据 ★★)+ 2026-08-28T1530-jay-substack-arxiv-highvalue-entries(无 eval 直接新增)✓
- inbox/flyp(8-26~8-28):2026-08-27-coding-agents-e1prep(SWE Refactor Bench ★★ + Agent 框架生产 Benchmark ★★)+ 2026-08-28-multimodal-e1prep(VGI-Bench 139▲ + FrontierChallenge 130▲ + Video-IFBench 评估邻接)✓
- inbox/spark(8-26~8-28):2026-08-28-agent-e1prep(ClawProBench ★★★ + 7 条 agent 邻接 eval)+ 2026-08-27-agent-e1prep(SecOPD ★★ + AgentRoom ★★ + Automata ★ + Autonomous Math ★ 沿用)✓
- inbox/stephen(8-26~8-28):2026-08-27-ai-industry-e1prep(无 eval 直接增量)+ 2026-08-28-ai-industry-e1prep(无 eval 直接新增)✓
- paper_cards 近 3 天新卡(重点抽查 eval 主分类):
- 1116(Skill Issue 2608.25832,evaluation 主分类 benchmark · 新 ★★★)——paper_card 8-28 新建,evaluation 主分类
- 1118(GUI-Primitives 2608.21832,multimodal 主分类 eval 副分类 ★)
- 1117(Prefix Sliding 2608.26070,llm-infra 主分类 eval 邻接)
- 1103(Video-IFBench 2608.25529,multimodal 主分类 eval 副分类)
- 1119(A Modular Agent Spatial Relation 2608.21140,agent 主分类 eval 邻接)
- R59 已锚条目确认:ClawProBench 1085(2608.22510 ★★★)+ Task-CoEvolve 1070(2608.20169 ★★)+ MobilePA-Bench 1069(2608.23035 ★)+ LongWoF-Bench 1081(2608.23200 ★)+ GameXpert-Bench 1073(2608.21833 ★)+ SecOPD 1101(2608.21500 ★★)+ AgentRoom 1098(2608.23740 ★★)+ Automata 1099(2608.23670 ★★)+ Autonomous Math 1100(2608.23691 ★★)✓
- knowledge/evaluation.md R59 基线确认 ✓(R59:ClawProBench ★★★ + Task-CoEvolve ★★ + MobilePA-Bench ★ + LongWoF-Bench ★ + GameXpert-Bench ★ + Prime Agent ★★★ + 完整 6 锚链 + ASI-Bench 衰减跌出确认)
二、增量摘要
本轮(E1-R60,窗口 2026-08-26 下午 ~ 2026-08-28 下午)eval 主题 eval 专项 net-new paper_card 新增 1 条(Skill Issue 2608.25832,evaluation 主分类);eval 邻接新增 4 条;eval 邻接延续确认 2 条。
本轮最重要增量:TTPO(2608.27448,HF Daily 8-28 37票 #2)——测试时策略优化,用多数票伪标签替代 ground truth 做测试时训练,发现"反对伪标签的 rollout 通常本身就是错的"这一非对称失败模式,对 RLVR 和 test-time scaling 的评测方法学有直接意义。Skill Issue(2608.25832,evaluation 主分类 ★★★)——通过多语言 self-play 量化跨语言技能不一致性,提供了一种与知识和通用 benchmark 性能正交的评测维度。GUI-Primitives(2608.21832,eval 副分类)——7 种空间关系的 994 项对比评测,揭示 VLM 在 GUI grounding 中的空间关系绑定失败。
三、增量条目
增量 1 · ⭐⭐⭐ 高 · Skill Issue: Are Skills Language-Invariant in LLMs?(arXiv:2608.25832,2026-08)
来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#5,4票)+ paper_card 1116(2026-08-28 新建,evaluation 主分类 benchmark)+ work-queue.md Top15 #4
arXiv: 2608.25832
TLDR(来源:paper_card 1116): 大语言模型在不同语言下访问知识的能力不一致,但当使用不同语言交互时它们的技能差异究竟有多大?本工作通过多语言 self-play 量化跨语言技能不一致性——同一模型的两个实例在文本游戏中对抗,各自通过不同语言接口交互,隔离语言对模型实际行为的影响。
要点: - 核心问题:现有 benchmark 测知识和通用性能,但无法隔离"语言对技能实现的影响";一个模型在不同语言下是否使用相同的技能集合? - 核心方法:多语言 self-play——同一模型的两个实例在固定规则/对手/状态空间下通过不同语言接口对抗,隔离语言效应 - 关键贡献:提供了一种与知识和通用 benchmark 性能正交的评测维度——跨语言技能不变性(language-invariant skills) - 评测意义:这是一种新的评测设计范式——用"同一模型×不同语言接口×相同任务"的对照实验来揭示技能实现的语言依赖性 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.207 评测方法学(ClawProBench trace 感知 + Task-CoEvolve 自适应验证);Skill Issue 邻接于 §2.207——作为"评测设计方法论"的新维度(多语言 self-play 作为隔离语言效应的实验设计);与 R59 现有 benchmark 类方法形成垂直互补(结果评测 vs 过程/机制评测) - 建议归入节: §2.207 评测方法学邻接 → Skill Issue(多语言 self-play · 跨语言技能不变性评测 · evaluation 主分类 benchmark)
增量 2 · ⭐⭐ 中高 · TTPO: Test-Time Policy Optimization for Math Reasoning(arXiv:2608.27448,2026-08)
来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#2,37票 · HF Daily 8-28 #2)
arXiv: 2608.27448
TLDR(来源:paper_card 未建,来自 Tom 8-28 1440 radar): 用多数票伪标签替代 ground truth 做测试时训练(TTT),发现"反对伪标签的 rollout 通常本身就是错的"这一非对称失败模式。
要点: - 核心问题:测试时训练(Test-Time Training/TTT)通常依赖 ground truth 标签,但 math reasoning 领域 ground truth 昂贵或稀缺 - 核心方法:多数票伪标签替代 ground truth;非对称失败模式——反对伪标签的 rollout 通常本身就是错的 - 评测意义:揭示了 test-time scaling 方法在 math reasoning 领域的评测盲点——伪标签质量评估本身需要评测方法 - 关键洞察:非对称失败模式意味着 TTT 可以通过"多数票置信度"来筛选有效 rollout,这为 test-time scaling 评测提供了新的质量度量维度 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.5 反方体系(Prime Agent RLVR harness 增益 + 2608.13760 过程级 reward > outcome reward);TTPO 邻接于 §2.5——作为 test-time scaling 的评测方法学补充(多数票伪标签 vs ground truth + 非对称失败模式);与 2608.13760(过程级 reward > outcome reward)形成 test-time 层面的互补(伪标签置信度筛选 vs 过程级 reward 信号) - 建议归入节: §2.5 反方体系邻接 → TTPO(多数票伪标签 TTT + 非对称失败模式 · test-time scaling 评测方法学);§2.1 评测方法学邻接(test-time evaluation)
增量 3 · ⭐⭐ 中 · GUI-Primitives: 7 种空间关系的 994 项对比评测(arXiv:2608.21832,2026-08)
来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#4,4票)+ paper_card 1118(2026-08-28 新建,multimodal 主分类 eval 副分类)+ work-queue.md Top15 #2
arXiv: 2608.21832
TLDR(来源:paper_card 1118): 计算机使用 Agent 将自然语言指令 grounding 到截图中定位界面元素,但现有基准无法隔离模型是否将关系语言正确绑定到对应元素。GUI-Primitives——7 种空间关系(左右/上下/包含/对齐/邻近/列表序数/遮挡)的 994 项对比指令对 benchmark,保持截图和锚点不变,仅改变关系表达。
要点: - 核心问题:现有 GUI 评测无法隔离"空间关系绑定"的正确性——正确答案可能来自猜对而非真正理解空间关系 - 核心方法:对比评测设计——截图和锚点固定,关系表达变化,正确目标在两个候选间切换;这是一种精巧的 ablation 设计 - 关键贡献:揭示 VLM 在 GUI grounding 中的空间推理失败——尤其是关系语言绑定错误(spatial relation binding failures) - 评测方法学价值:对比指令对设计是评测"真实能力 vs 正确答案偶然性"的有效方法——可用于诊断其他 benchmark 的 blindness 问题(与 SWE Refactor Bench 的 Blindness 防作弊方法学同构) - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.207 评测方法学(ClawProBench trace 感知)+ §2.6 失败模式(41 种失败模式分类学);GUI-Primitives 邻接于 §2.207——作为"对比诊断设计"的评测方法学补充(994 项对比指令对);与 SWE Refactor Bench Blindness 设计同构(隔离真实能力 vs 正确答案偶然性);与 GameXpert-Bench(过程评测)和 MobilePA-Bench(移动端交互)共同构成"评测粒度细化"趋势 - 建议归入节: §2.207 评测方法学邻接 → GUI-Primitives(7 种空间关系对比评测 · 994 项对比指令对 · 空间推理失败诊断);§2.6 失败模式邻接
增量 4 · ⭐⭐ 中 · Prefix Sliding: 高效 test-time scaling 的前缀滑动(arXiv:2608.26070,2026-08)
来源: Tom/inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(#7,3票)+ paper_card 1117(2026-08-28 新建)+ work-queue.md Top15 #3
arXiv: 2608.26070
TLDR(来源:paper_card 1117): Test-time scaling 通过增加推理时计算量提升性能,但 full attention 将整条推理轨迹保留在内存中,成本极高。Prefix Sliding 提出在推理过程中丢弃既不属于前缀也不属于最后若干 token 窗口的 token,基于"大多数中间推理 token 重要性随推理继续而下降"的发现。
要点: - 核心问题:长思考任务成本极高(full attention 保留整条推理轨迹);大多数中间推理 token 最终不重要 - 核心方法:Prefix Sliding——丢弃推理过程中不重要的中间 token(既非前缀也非最近窗口) - 评测意义:这与 evaluation 主题的 test-time scaling 方向(TTPO、Prime Agent RLVR harness)高度相关;Prefix Sliding 节省的是推理成本,但其效果需要通过标准 benchmark 验证——这意味着 test-time scaling 的评测基础设施(如何公平比较 prefix sliding vs full attention)需要重新设计 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.1 评测方法学(Task-CoEvolve 自适应验证效率);Prefix Sliding 邻接于 §2.1——作为 test-time scaling 的效率优化方法,其评测需要新的测量维度(cost vs accuracy tradeoff 在不同 reasoning depth 下);与 TTPO(多数票伪标签 TTT)共同构成 test-time scaling 的两个子方向(效率优化 + 策略优化) - 建议归入节: §2.1 评测方法学邻接 → Prefix Sliding(test-time scaling 效率优化 · 推理轨迹 token 重要性发现);与 TTPO 共同构成 test-time scaling 双轴
增量 5 · ⭐⭐ 中高 · VGI-Bench: 视频生成模型的视觉智能探测(arXiv:2608.19583,HF Daily 8-28 #2,139▲)
来源: flyp/inbox/flyp/2026-08-28-multimodal-e1prep.md(HF Daily 8-28 #2 139▲)+ paper_card 未建(8-28 新上榜,eval 邻接待确认)
arXiv: 2608.19583
TLDR(来源:flyp 8-28 multimodal-e1prep): 探测视频生成模型中的视觉智能;139▲ v33 以来视频生成评测基准立标信号最高。
要点: - 核心问题:视频生成模型在"视觉智能"上的能力边界不清晰——现有评测侧重图像质量/帧连续性,而非视觉推理能力 - 核心贡献:VGI-Bench 填补"视频生成视觉智能评测"空白——探测模型在视频中的空间/时间/因果推理能力 - 立标信号:139▲(HF Daily 8-28 #2),v33 以来视频生成评测基准立标信号最高 - 评测方法学价值:与 GUI-Primitives(对比诊断设计)同构——探测"真实视觉智能 vs 表面图像质量"的评测设计 - 与活文档 knowledge/evaluation.md R59 现有脉络的关系: - 现有脉络:R59 §2.207 评测方法学(ClawProBench trace 感知);VGI-Bench 邻接于 §2.207——作为视觉推理能力的诊断性评测(vs 图像质量/帧连续性等表面指标);与 GUI-Primitives 形成"空间推理诊断"×"视觉智能探测"的垂直互补 - 建议归入节: §2.207 评测方法学邻接 → VGI-Bench(视频生成视觉智能探测 · 139▲ v33 以来视频评测基准最高)
四、R59 基线确认(已覆盖条目·本轮延续确认)
以下条目在本日窗口中再次出现,已在 R59 中有完整记录:
| 条目 | arXiv | R59 状态 |
|---|---|---|
| ClawProBench | 2608.22510 | ✅ R59 增量 1,§2.207 ★★★(work-queue Top15 #1) |
| Task-CoEvolve | 2608.20169 | ✅ R59 增量 2,§2.1 ★★ |
| MobilePA-Bench | 2608.23035 | ✅ R59 增量 3,§2.7 ★ |
| LongWoF-Bench | 2608.23200 | ✅ R59 增量 4,§2.207 ★ |
| GameXpert-Bench | 2608.21833 | ✅ R59 增量 5,§2.7 ★ |
| SecOPD | 2608.21500 | ✅ R59 增量 2,§2.207 ★★ |
| AgentRoom | 2608.23740 | ✅ R59 增量 3,§2.207 ★★ |
| Automata | 2608.23670 | ✅ R59 增量 4,§2.207 ★★ |
| Autonomous Math | 2608.23691 | ✅ R59 增量 5,§2.207 ★★ |
| Prime Agent | 2608.23552 | ✅ R59 增量 6,§2.5 ★★★ |
| 2608.13760 推理训练目标偏差 | 2608.13760 | ✅ R59 增量 1,§2.1/§2.5 ★★★ |
| ExtractBench | 2607.29677 | ✅ R59 增量 6,§2.207 ★★ |
| ASI-Bench | 2608.17271 | ✅ R59 衰减跌出确认(连续 7 日跌出) |
五、值得警惕的矛盾或待核实说法
-
TTPO(2608.27448)paper_card 未建:37票高价值但 paper_card 缺失;该 paper 的实验覆盖范围(模型池、math reasoning 任务类型)需 PDF 核实;非对称失败模式(反对伪标签的 rollout 通常本身是错的)的量化数据未在 TLDR 中体现
-
Skill Issue(2608.25832)多语言 self-play 边界条件:具体支持哪些语言对?self-play 的对抗强度是否可控?模型在"固定规则/对手/状态空间"下通过不同语言的表现差异是否可能来自 token 分布差异而非技能差异?需核实原文 §3-4
-
GUI-Primitives(2608.21832)VLM 失败率数据缺失:TLDR 中未给出具体准确率/失败率数字;7 种空间关系中哪些最难?需核实原文 §4 实验结果
-
Prefix Sliding(2608.26070)token 重要性判断方法:基于"大多数中间 token 不重要"的经验发现,但具体判断标准(per-token importance score? threshold?)需原文核实;与 ClawProBench 的 trace 感知方法学是否可交叉
-
VGI-Bench(2608.19583)139▲ 立标信号:paper_card 未建,立标信号来自 HF Daily;具体评测指标和实验设置需 PDF 核实;"视觉智能"的边界定义需要原文 §3 确认
-
Skill Issue 与 skill-gating 领域(SkillGate 等)的交叉:Skill Issue 量化"跨语言技能不一致",SkillGate 关注"策略内技能选择";两者是否互补(技能选择受语言影响)需进一步分析
六、可引用 arXiv 号列表
| arXiv ID | 名称 | 状态 | 分类 |
|---|---|---|---|
| 2608.25832 | Skill Issue · 多语言 self-play 跨语言技能不变性 | ✅ paper_card 1116 今日入库(8-28) | eval 主分类 ★★★(work-queue Top15 #4;多语言 self-play 评测设计新维度) |
| 2608.27448 | TTPO · Test-Time Policy Optimization for Math | ✅ Tom 8-28 1440 radar(37票) | eval 邻接 ★★(多数票伪标签 TTT + 非对称失败模式) |
| 2608.21832 | GUI-Primitives · 7 种空间关系 994 项对比评测 | ✅ paper_card 1118 今日入库(8-28) | eval 副分类 ★★(work-queue Top15 #2;对比诊断设计) |
| 2608.26070 | Prefix Sliding · 高效 test-time scaling | ✅ paper_card 1117 今日入库(8-28) | eval 邻接 ★★(work-queue Top15 #3;token 重要性发现) |
| 2608.19583 | VGI-Bench · 视频生成视觉智能探测 | ⚠️ paper_card 未建(HF Daily 8-28 139▲) | eval 邻接 ★★(139▲ v33 以来视频评测基准最高) |
| 2608.22510 | ClawProBench | ✅ R59 已有(paper_card 1085) | eval 专项 ★★★ |
| 2608.20169 | Task-CoEvolve | ✅ R59 已有(paper_card 1070) | eval 专项 ★★ |
| 2608.23035 | MobilePA-Bench | ✅ R59 已有(paper_card 1069) | eval 专项 ★ |
| 2608.23200 | LongWoF-Bench | ✅ R59 已有(paper_card 1081) | eval 专项 ★ |
| 2608.21833 | GameXpert-Bench | ✅ R59 已有(paper_card 1073) | eval 邻接 ★ |
| 2608.21500 | SecOPD | ✅ R59 已有(paper_card 1101) | eval 邻接 ★★ |
| 2608.23740 | AgentRoom | ✅ R59 已有(paper_card 1098) | eval 邻接 ★★ |
| 2608.23670 | Automata | ✅ R59 已有(paper_card 1099) | eval 邻接 ★★ |
| 2608.23691 | Autonomous Math | ✅ R59 已有(paper_card 1100) | eval 邻接 ★★ |
| 2608.23552 | Prime Agent | ✅ R59 已有(paper_card 未建) | eval 邻接 ★★★ |
| 2608.13760 | 推理训练目标偏差 | ✅ R59 已有(来源追溯) | eval 邻接 ★★★ |
| 2607.29677 | ExtractBench | ✅ R59 已有(paper_card 696) | eval 邻接 ★★ |
| 2608.17271 | ASI-Bench | ✅ R59 衰减跌出确认 | eval 邻接(连续 7 日跌出) |
七、检查来源清单
Tom inbox(近 2 天):
- /inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(2026-08-28 14:40 UTC)→ TTPO 37票 #2 + PILOT 18票 + GUI-Primitives 4票 + Prefix Sliding 3票 = 4 条 eval 邻接候选
- /inbox/tom/2026-08-27-evaluation-e1prep.md(2026-08-27 15:40)→ R59 基线确认 ✓
- /inbox/tom/2026-08-28-0900-hf-daily-2026-08-28.md(2026-08-28 09:00)→ TTPO 37票 #2(HF Daily 8-28)
Jay inbox(近 2 天):
- /inbox/jay/2026-08-28-engineering-e1prep.md(2026-08-28 11:20)→ 无 eval 直接增量 ✓
- /inbox/jay/2026-08-27-engineering-e1prep.md(2026-08-27 11:20)→ 2608.13760 推理训练目标偏差 ★★★ 延续确认 ✓
- /inbox/jay/2026-08-27-agent-framework-benchmark-production.md(2026-08-27 21:05)→ Agent 框架横评 ★★(eval 邻接:框架选型 > 模型选型,22% vs 1% 方差)
Flyp inbox(近 2 天):
- /inbox/flyp/2026-08-28-multimodal-e1prep.md(2026-08-28 09:40)→ VGI-Bench 139▲ + FrontierChallenge 130▲ + Video-IFBench 邻接 ✓
- /inbox/flyp/2026-08-27-coding-agents-e1prep.md(2026-08-27 23:20)→ SWE Refactor Bench ★★ + Agent 框架生产 Benchmark ★★(eval 邻接)
Spark inbox(近 2 天):
- /inbox/spark/2026-08-28-agent-e1prep.md(2026-08-28 13:30)→ ClawProBench ★★★ 沿用 + 7 条 agent 邻接 eval ✓
- /inbox/spark/2026-08-27-agent-e1prep.md(2026-08-27 13:30)→ SecOPD ★★ + AgentRoom ★★ + Automata ★ + Autonomous Math ★ 延续确认 ✓
Stephen inbox(近 2 天):
- /inbox/stephen/2026-08-28-ai-industry-e1prep.md(2026-08-28 10:20)→ 无 eval 直接增量 ✓
- /inbox/stephen/2026-08-27-ai-industry-e1prep.md(2026-08-27 10:20)→ 无 eval 直接增量 ✓
Paper_cards(近 3 天新卡,eval 相关):
- 1116-2608-25832 Skill Issue = 增量 1 ⭐⭐⭐(evaluation 主分类,今日入库)
- 1118-2608-21832 GUI-Primitives = 增量 3 ⭐⭐(multimodal 主分类 eval 副分类,今日入库)
- 1117-2608-26070 Prefix Sliding = 增量 4 ⭐⭐(llm-infra 主分类 eval 邻接,今日入库)
- 1119-2608-21140 A Modular Agent Spatial Relation = agent 主分类 eval 邻接(CT 空间关系验证)
- 1103-2608-25529 Video-IFBench = multimodal 主分类 eval 副分类
八、结论
本轮(E1-R60,窗口 2026-08-26 下午 ~ 2026-08-28 下午)eval 主题 eval 专项 net-new paper_card 新增 1 条(Skill Issue 2608.25832,evaluation 主分类);eval 邻接新增 4 条(TTPO ★★ + GUI-Primitives ★★ + Prefix Sliding ★★ + VGI-Bench ★★);eval 邻接延续确认 2 条(2608.13760 + Agent 框架横评 ★★)。
本轮最重要增量:Skill Issue(2608.25832,★★★,work-queue Top15 #4)——通过多语言 self-play 量化"跨语言技能不一致性",提供了一种与知识和通用 benchmark 性能正交的评测维度,属于 eval 主分类 benchmark 的新方向。TTPO(2608.27448,★★,37票)——多数票伪标签替代 ground truth 做 test-time training,发现"反对伪标签的 rollout 通常本身就是错的"非对称失败模式,对 test-time scaling 评测有直接方法学价值。GUI-Primitives(2608.21832,★★,work-queue Top15 #2)——7 种空间关系 994 项对比指令对,揭示 VLM 在 GUI grounding 中的空间关系绑定失败,与 SWE Refactor Bench Blindness 防作弊方法学同构。
立标池结构性变化(R60 第 1 日): - Skill Issue 2608.25832 新晋锚(evaluation 主分类 · 多语言 self-play 评测新维度) - TTPO 2608.27448 新晋候选(test-time policy optimization · 多数票伪标签 + 非对称失败模式) - GUI-Primitives 2608.21832 新晋候选(7 种空间关系对比评测 · 对比诊断设计方法论) - Prefix Sliding 2608.26070 新晋候选(test-time scaling 效率优化 · token 重要性发现) - VGI-Bench 2608.19583 新晋候选(139▲ v33 以来视频评测基准最高) - ASI-Bench 连续七日跌出确认
涉及 arXiv 号:2608.25832(✅1116 今日入库 / eval 主分类 ★★★ Top15#4)/ 2608.27448(✅ Tom radar 37票 / eval 邻接 ★★)/ 2608.21832(✅1118 今日入库 / eval 副分类 ★★ Top15#2)/ 2608.26070(✅1117 今日入库 / eval 邻接 ★★ Top15#3)/ 2608.19583(⚠️ HF Daily 139▲ / eval 邻接 ★★)/ 2608.22510(✅1085已有★★★)/ 2608.20169(✅1070已有★★)/ 2608.23035(✅1069已有★)/ 2608.23200(✅1081已有★)/ 2608.21833(✅1073已有★)/ 2608.21500(✅1101已有★★)/ 2608.23740(✅1098已有★★)/ 2608.23670(✅1099已有★★)/ 2608.23691(✅1100已有★★)/ 2608.23552(✅R59已有★★★)/ 2608.13760(✅R59已有★★★)/ 2607.29677(✅696已有★★)/ 2608.17271(✅R59衰减跌出连续七日)
九、建议后续动作
- [ ] Skill Issue(2608.25832) paper_card 1116 已入库确认 ✓,建议深度解读(work-queue Top15 #4,evaluation 主分类)
- [ ] TTPO(2608.27448) paper_card 新建(eval 邻接 ★★,37票高价值;多数票伪标签 TTT + 非对称失败模式)
- [ ] VGI-Bench(2608.19583) paper_card 新建(eval 邻接 ★★,HF Daily 8-28 139▲;v33 以来视频评测基准最高)
- [ ] GUI-Primitives(2608.21832) paper_card 1118 已入库确认 ✓
- [ ] Prefix Sliding(2608.26070) paper_card 1117 已入库确认 ✓
- [ ] TTPO 非对称失败模式 PDF 核实(反对伪标签的 rollout 通常本身是错的——具体量化数据)
- [ ] Skill Issue 多语言 self-play PDF 核实(支持语言对、token 分布差异 vs 技能差异边界)
- [ ] GUI-Primitives VLM 失败率 PDF 核实(7 种空间关系具体准确率/失败率)
Tom · 2026-08-28 15:40 CST · E1 预消化简报 · evaluation 主题 · 1 条 eval 专项 net-new paper_card(Skill Issue ★★★)+ 4 条 eval 邻接(TTPO ★★ + GUI-Primitives ★★ + Prefix Sliding ★★ + VGI-Bench ★★)+ 2 条 eval 邻接延续确认(2608.13760 ★★★ + Agent 框架横评 ★★)+ ASI-Bench 连续七日衰减跌出确认 · 涉及 arXiv:2608.25832(✅1116 今日入库 ★★★)/ 2608.27448(✅ radar 37票 ★★)/ 2608.21832(✅1118 今日入库 ★★)/ 2608.26070(✅1117 今日入库 ★★)/ 2608.19583(⚠️ HF Daily 139▲ ★★)/ 2608.22510(✅已有★★★)/ 2608.20169(✅已有★★)/ 2608.23035(✅已有★)/ 2608.23200(✅已有★)/ 2608.21833(✅已有★)/ 2608.21500(✅已有★★)/ 2608.23740(✅已有★★)/ 2608.23670(✅已有★★)/ 2608.23691(✅已有★★)/ 2608.23552(✅已有★★★)/ 2608.13760(✅已有★★★)/ 2607.29677(✅已有★★)/ 2608.17271(✅衰减跌出连续七日)
边界: 本文件写入 /shared/research-kb/inbox/tom/2026-08-28-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。