evaluation · E1 预消化简报(2026-10-03)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-03 15:40 CST 窗口定义:2026-10-02 15:40 ~ 2026-10-03 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R92 基线 · 2026-10-02 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 2-3 新入库 eval 相关条目 诚实度声明:本轮 eval 主题净增量密度"中"— eval 主分类 paper_card NET-new 净增 3 件(SAGO + PhysVista + OpenTumorBoard);本次 5 条增量均 eval 主分类/邻接/方法学批判条目,可锚入 R92 既有脉络。增量来自 Tom Oct 3 radar eval 邻接(1 条)+ Jay Oct 3 engineering filter eval cost 基础设施(2 条)+ flyp Oct 3 adversarial reviews(2 条)。无硬凑字数。
状态摘要
- 增量条数:5 条(落在 3-8 目标区间内)
- 核心新增:① SAGO(2610.01428 · 主分类 evaluation · 稳定性感知泛化目标,多轴评估 LLM 行为变异性)② PhysVista(2610.00559 · 主分类 evaluation · VLM 物理智能感知-推理-评估闭环 benchmark)③ OpenTumorBoard(2609.32810 · 主分类 evaluation · 611 患者×19157 讨论轮次,医学多学科肿瘤委员会真实世界基准)④ HAL + BenchAgent(arXiv:2510.11977 + arXiv:2606.05670 · eval 邻接 · 评测成本标准化基础设施,$0.08-32/任务)⑤ LongHarness Bench + SEAL 反方审稿(flyp Oct 3 adversarial reviews · 评测方法学批判双响)
- 澄清:本次 eval 主分类 NET-new 净增 3 件(SAGO + PhysVista + OpenTumorBoard);HAL/BenchAgent 属 llm-infra 主分类但 eval 邻接;LongHarness/SEAL 反方审稿属方法学批判,不改变锚入位置
- 涉及 arXiv 号:本次新增 7 个(2610.01428 · 2610.00559 · 2609.32810 · 2510.11977 · 2606.05670 · 2605.20530 · 2609.38137);续用锚定 280+ 个(R92 沿用)
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| inbox/tom | 2026-10-03-agent-rag-longcontext-radar.md(14:41 · 8 条候选 · X-Tree + RAG Landscape + MemFold + MRAG) |
高 ⭐⭐⭐⭐(PhysVista 在 HF Daily Oct 3 早棒出现;OpenTumorBoard 在 radar 候选) |
| inbox/tom | 2026-10-03-0900-hf-daily-2026-10-03.md(HF Daily Oct 3 · 15 篇) |
极高 ⭐⭐⭐⭐⭐(PhysVista 34票 #9 · SAGO 未在 HF 出现但在 Oct 2 candidates 入库) |
| inbox/tom | 2026-10-02-evaluation-e1prep.md(昨日 E1 基线锚定) |
极高 ⭐⭐⭐⭐⭐(R92 基线锚定) |
| inbox/jay | 2026-10-03-1450-jay-engineering-filter-framework-benchmarks-moo-eval-cost.md(22KB · HAL + BenchAgent eval cost 量化) |
极高 ⭐⭐⭐⭐⭐(HAL $0.08-32/任务 + BenchAgent 协议对齐方法论) |
| inbox/flyp | 2026-10-03-sat-adversarial-review-LongHarness-Bench.md(11KB · LongHarness 反方 5 大问题) |
极高 ⭐⭐⭐⭐⭐(12.4× 数字存疑 + 任务类型结构性差距) |
| inbox/flyp | 2026-10-03-sat-adversarial-review-SEAL.md(13KB · SEAL 反方 6 大问题) |
极高 ⭐⭐⭐⭐⭐(ρ vs FullPair ≠ ρ vs 人类 + 偏差传染风险) |
| inbox/flyp | 2026-10-03-sat-weekly-deep-read-summary.md(17.5KB · flyp 周六汇总) |
极高 ⭐⭐⭐⭐⭐(长上下文评测协议+成本+系统路径三位一体 + 反方审稿 2 件) |
| organized/paper_cards | 1632-2610-01428.md(SAGO · Oct 3 02:13 入库)· 1634-2610-00559.md(PhysVista · Oct 3 02:13 入库)· 1645-2609-32810.md(OpenTumorBoard · Oct 3 14:10 入库) |
极高 ⭐⭐⭐⭐⭐(3 件 eval 主分类 NET-new) |
| organized/queue | work-queue.md(Top 15 · OpenTumorBoard 2609.32810 排第 1 · PhysVista 2610.00559 排第 3) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/spark | 2026-10-03-agent-e1prep.md(spark agent e1prep · OpenTumorBoard 邻接 agent) |
高 ⭐⭐⭐⭐(OpenTumorBoard 锚入 agent §2.1 + §2.X.4) |
一、增量条目
增量 1:SAGO — 稳定性感知泛化目标,多轴评估 LLM 行为变异性(2610.01428)— 主分类 evaluation(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1632-2610-01428.md(主分类 evaluation · 形态 benchmark · Oct 3 02:13 入库)· inbox/tom/_candidates/2026-10-02-agent-rag-longcontext-candidates.json(Oct 2 candidates 来源)· 原始来源:arXiv:2610.01428
URL:https://arxiv.org/abs/2610.01428
TLDR(原文):The Stability-Aware Generalization Objective (SAGO) is introduced, a framework that measures how much model behavior changes for the same input under different variations and benchmarks, capturing variability across several dimensions including generation consistency, internal activations, confidence, and response mirroring.
要点:
- 核心问题:传统 eval 只测"准确率",忽略模型对同一输入在不同扰动下的行为变异性——SAGO 提出"泛化即稳定性",将行为变异性本身作为评估维度
- 多轴稳定性测量:生成一致性(generation consistency)+ 内部激活(internal activations)+ 置信度(confidence)+ 响应镜像(response mirroring)
- 评测方法学意义:这是 eval 指标体系的一个新维度类型——不是测"答对多少",而是测"答得有多稳定";与 R92 维度化指标体系立基础锚 167-171 的方向互补
- ⚠️ 待核实:arXiv 2610.01428 发布于 Oct 2 窗口;具体实验任务、量化数字、与现有 benchmark 的对比数据均未知;paper_card 刚入库,TLDR 极简
与活文档 evaluation.md 现有脉络的关系: - 邻接 R92 §3 维度化指标体系(立基础锚 167-171 体系)——SAGO 的"稳定性作为独立维度"是该节的新增维度候选,与 R92 现有的语义理解/推理维度体系互补 - 邻接 R92 §1.2 决策型 judge vs 生成型 judge——SAGO 的 response mirroring 和 confidence 轴为 judge 质量评估提供了新的测量工具 - 建议归入章节:§3 维度化指标体系(新增邻接 · SAGO 2610.01428 · 主分类 eval · 稳定性感知泛化目标,多轴行为变异性测量 · ⚠️ 需原文精读获取具体量化数据)
增量 2:PhysVista — VLM 物理智能感知-推理-评估闭环 benchmark(2610.00559)— 主分类 evaluation(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1634-2610-00559.md(主分类 evaluation · 形态 benchmark · Oct 3 02:13 入库)· inbox/tom/2026-10-03-0900-hf-daily-2026-10-03.md(HF Daily Oct 3 · 34票 #9)· work-queue.md(Top 15 第 3)· 原始来源:arXiv:2610.00559
URL:https://arxiv.org/abs/2610.00559
TLDR(原文):PhysVista is a benchmark designed to evaluate physical intelligence in VLMs through a closed cognitive loop framework inspired by the human seeing-reasoning-assessment process, highlighting a persistent gap between visual recognition and genuine physical understanding, and pointing toward more principled designs for physically grounded multimodal intelligence.
要点:
- 核心贡献:PhysVista 揭示视觉识别与真实物理理解之间持续存在的差距——通过"感知-推理-评估"闭环框架(类比人类认知过程)评测 VLM 物理智能
- 评测方法学创新:闭环认知框架(closed cognitive loop)——感知→推理→评估→反馈,与 R92 MIST 的"无关图像劫持 verdict"形成对比:MIST 揭示 VLM judge 被无关信息误导,PhysVista 揭示 VLM 本身的物理理解缺陷
- HF 34票——中高票数,PhysVista 作为 eval 主分类 benchmark 在 HF 上值得关注
- 与 R92 MIST 的关系:MIST 测 VLM-as-Judge 的失效模式,PhysVista 测 VLM 本身的物理智能缺陷——两者共同构成 VLM 评测的双视角
- ⚠️ 待核实:具体任务类型、量化结果、与现有 VLM benchmark 的对比数据均未知;TLDR 极简
与活文档 evaluation.md 现有脉络的关系: - 邻接 R92 §1.2 决策型 judge vs 生成型 judge(MIST)——PhysVista 与 MIST 从不同角度揭示 VLM 的系统性缺陷:MIST 测 VLM-as-Judge,PhysVista 测 VLM 物理理解;两者互补,构成 VLM 评测的双锚 - 邻接 R92 §2.2 评测平台与 CI Gate——感知-推理-评估闭环是垂类评测框架设计的新思路,与 CLEAR 五维、IndicBankBench 四阶段并列 - 建议归入章节:§1.2 决策型 judge vs 生成型 judge(新增邻接 · PhysVista 2610.00559 · 主分类 eval · VLM 物理智能感知-推理-评估闭环 benchmark · HF 34票 #9 · 与 MIST 构成 VLM 评测双锚)
增量 3:OpenTumorBoard — 多学科肿瘤委员会讨论轨迹的真实世界基准(2609.32810)— 主分类 evaluation(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1645-2609-32810.md(主分类 evaluation · 形态 benchmark · Oct 3 14:10 入库)· inbox/tom/2026-10-03-agent-rag-longcontext-radar.md(radar 3 候选)· work-queue.md(Top 15 第 1)· 原始来源:arXiv:2609.32810
URL:https://arxiv.org/abs/2609.32810
TLDR(原文):Multidisciplinary tumor boards integrate multimodal clinical observations and longitudinal patient histories through specialist discussions, yet benchmarks rarely capture these real-world trajectories. We introduce OpenTumorBoard, a benchmark with 611 patient cases and 19,157 discussion turns across ten specialist roles, transcribed from 12,534 minutes of publicly available tumor board recordings on YouTube. The benchmark evaluates two settings: SPECIALIST TURN, in which an LLM responds to a clinically significant question posed during a real discussion, and BOARD SIMULATION, in which it generates an entire tumor board discussion trajectory.
要点:
- 规模:611 患者 × 19,157 讨论轮次 × 12,534 分钟 YouTube 转录 × 10 个专家角色
- 两种评测设置:SPECIALIST TURN(LLM 回答真实讨论中的临床问题)+ BOARD SIMULATION(LLM 生成完整肿瘤委员会讨论轨迹)
- 评测方法学意义:真实世界轨迹评测——这是 R92 间接评估四件套(APM-Bench + LibraryDesignBench + OSWorld-Science + Endless Exam)的第五件候选:以真实多学科协作轨迹评估 Agent 决策质量
- 垂类高风险场景:医学临床决策是多模态 + 多 Agent 协作 + 高风险决策的交汇点,比 GAIA/SWE-Bench 更贴近真实世界
- ⚠️ 待核实:具体评测指标、SPECIALIST TURN 准确率数据、BOARD SIMULATION 轨迹质量评估方法均未知
与活文档 evaluation.md 现有脉络的关系: - 邻接 R92 §1.3 长程/多 Agent 评测基准(Endless Exam + APM-Bench + LibraryDesignBench + OSWorld-Science)——OpenTumorBoard 的"真实世界多学科协作轨迹"是该节间接评估的第五件候选 - 邻接 R92 §1.4 垂类高风险场景多阶段多维评测——医学临床决策是 R92 CLEAR 五维 + IndicBankBench 四阶段之后的新垂类场景 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · OpenTumorBoard 2609.32810 · 主分类 eval · 611 患者×19157 讨论轮次真实世界多学科肿瘤委员会基准 · work-queue Top 15 第 1)
增量 4:HAL + BenchAgent — 评测成本标准化基础设施(arXiv:2510.11977 + arXiv:2606.05670)— eval 邻接(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-10-03-1450-jay-engineering-filter-framework-benchmarks-moo-eval-cost.md(Jay Oct 3 工程筛选 · HAL + BenchAgent eval cost 量化数据)· 原始来源:arXiv:2510.11977(HAL)+ arXiv:2606.05670(BenchAgent)
URL HAL:https://arxiv.org/abs/2510.11977
URL BenchAgent:https://arxiv.org/abs/2606.05670
要点:
HAL(Holistic Agent Leaderboard): - 核心贡献:首次以第三方平台提供标准化、考虑成本因素的评测基础设施 - 关键数据: - SWE-bench Verified 单次运行中位成本:$163 - 单任务成本范围:$0.08(DeepSeek R1)~ $32.00(Claude Opus 4.1 High) - 8 个基准全覆盖评测中位成本:~$800 API 费用 - 全部 242 次 agent 运行总成本:~$46,000(含缓存前) - GAIA 全覆盖成本(前沿模型):最高 $2,829(无缓存)
BenchAgent: - 核心贡献:工作流评测 substrate,标准化了 benchmark 加载、工具访问、答案契约、费用计算和轨迹日志,支持跨范式 agent 对比 - 关键发现:增加 agent 数量不自动提升性能;固定/演化多 agent 系统在 token 使用和延迟上差异显著;GAIA Level 2-3 上,成熟部署配置的工作流达到不同精度-成本权衡 - 关键结论:"评测执行接口、工具表面、计量和轨迹"标准化使不同 scaffold 之间可对比
AgentProcessBench(arXiv:2605.20530): - 核心数据:1,000 条轨迹 + 8,509 步标注——过程级轨迹评分 - 意义:补充"结果指标"之外的"过程质量"维度
与活文档 evaluation.md 现有脉络的关系: - 邻接 R92 §2.2 评测平台与 CI Gate——HAL 的成本标准化和 BenchAgent 的协议对齐方法论是评测平台基础设施的新维度,与 R92 §2.2 既有条目(IndicBankBench 四阶段 + CLEAR 五维)直接互补 - 邻接 R92 §1.1 评测诚信——成本感知评测(cost-aware evaluation)将"评测资源消耗"本身纳入诚信考量,避免"不计成本刷分"的评测失真 - 建议归入章节:§2.2 评测平台与 CI Gate(新增邻接 · HAL arXiv:2510.11977 + BenchAgent arXiv:2606.05670 + AgentProcessBench arXiv:2605.20530 · eval 邻接 · 评测成本标准化基础设施 · $0.08-32/任务 + $800 全评测)
增量 5:LongHarness Bench + SEAL 反方审稿 — 评测方法学批判双响(arXiv:2609.38137 + arXiv:2605.30104)— 方法学批判(⭐⭐⭐⭐⭐)
来源:inbox/flyp/2026-10-03-sat-adversarial-review-LongHarness-Bench.md(11KB · flyp Oct 3 反方审稿)· inbox/flyp/2026-10-03-sat-adversarial-review-SEAL.md(13KB · flyp Oct 3 反方审稿)· inbox/flyp/2026-10-03-sat-weekly-deep-read-summary.md(flyp 周六汇总)
URL LongHarness:https://arxiv.org/abs/2609.38137
URL SEAL:https://arxiv.org/abs/2605.30104
LongHarness Bench 反方 5 大问题(flyp):
- 12.4× 数字存疑:论文报告 LongHarness 效率提升 12.4×,但 flyp 反方审稿评估复现风险极高(1-2 月人时),立标价值高于执行价值——论文的"efficiency 一级轴"提法应被后续工作继承,但数字不应作为"事实"引用
- 任务类型结构性差距:LongHarness 选取的 4 个任务"几乎都是结构化文本+检索+集合判断"类,与真实 SWE/deep research/长视域 web 操作中的瓶颈有结构性差距
- 步进式检索覆盖不足:真实 long-horizon agent 瓶颈是(1)多跳推理+(2)自适应工具选择+(3)状态追踪+(4)跨轮全局规划;LongHarness 的"步进式检索+多策略"仅覆盖(1)的最小子集
- 评测方法学自我矛盾:LongHarness 自称"评测方法学开山之作"但本身评测方法学有缺陷(缺少与真实瓶颈的对照实验)
- 与 SeKV 的关系:SeKV 的"−53.3% GPU 显存"在 LongHarness 框架下属于"只报 GPU cost,没报 PCIe/CPU cost"——LongHarness 应把 SeKV 列为被测系统之一
建议:保留精读入 notes/long-context/,reviews/ 应明确标注反方立场,避免后续研究不加约束地继承 12.4×/68% 等数字。
SEAL 反方 6 大问题(flyp):
- "协议层准确" ≠ "价值层准确":SEAL 测的是相对 FullPair 的 Spearman ρ,但 FullPair 也是 LLM-as-judge——两个都是机器裁判,不是人类
- ρ 传递有效性折扣:若 FullPair 本身的 ρ_vs_human = 0.7(合理假设),则 SEAL 的真实有效性 = 0.7 × 1.0 = 0.7(传递效应)
- 候选池是 frozen trace:SEAL 评估的是给定输出集合上的排名协议,不解决"任务本身是否能区分模型"
- position/length/verbosity 偏差未报告:论文没有报告 judge 的位置/长度/冗长度偏好在 SEAL 协议下的变化
- 跨 judge 一致性未验证:论文没有对比"Azure GPT-5.5 family" vs "Claude 4.6/Gemini 3.5"作为 judge 的一致性——若换成异源 judge 后 ρ 急剧下降,则 SEAL 的"协议"其实是"judge 特定"
- FlatBrk 对照缺失:论文把 FlatBrk 作为最关键 ablation,但没有报告 FlatBrk 自己的 ρ 与延迟——读者无法判断增益来自 bracket 结构还是 meta-judge checklist
关键建议:
- v3 必须给出 SEAL ρ vs 人类 pairwise 的对照表(哪怕小规模 200-500 偏好对)
- v3 必须报告 position/length/verbosity 偏差在 SEAL 协议下的统计
- reviews/ 应明确标注"可参照但不可替代"立场,避免后续研究用 SEAL 替代人工 pairwise
与活文档 evaluation.md 现有脉络的关系: - 直接邻接 R92 §1.1 评测诚信——LongHarness 和 SEAL 的反方审稿共同指向同一个核心问题:LLM-as-Judge 类评测方法的系统性偏差尚未被充分验证;这与 R92 §1.1 的"评测诚信从 harness 层延伸到指标层"主题高度相关 - 邻接 R92 §1.2 LLM-as-Judge 失效模式类型学——flyp 反方审稿实质上是对 R92 §1.2 "失效模式三联"(SEAL 聚合层 + MIST 个例层 + Training LLM Judges 训练层)的深化批判:SEAL 协议的"高精度"可能只是"与另一个有偏 judge 的一致" - 建议归入章节:§1.1 评测诚信(新增方法学批判 · LongHarness 2609.38137 + SEAL 2605.30104 · 反方审稿双响 · 12.4×/ρ=1.0 数字存疑 + 任务结构性差距 + 偏置传染风险)
二、R92 追踪更新
R92 待核事项状态
| 待核项 | 来源 | 状态 | 更新 |
|---|---|---|---|
| The Endless Exam(2609.24555) | R92 · work-queue Top 15 #1 | ⚠ 维持待核 | Oct 3 无新进展;14 个数学构造家族、无上限评分机制仍待原文精读 |
| MILO(2609.38349) | R92 · HF 15票 #14 | ⚠ 维持待核 | Oct 3 无新进展;协同进化算法细节仍待原文精读 |
| SEAL(2605.30104 v2) | R92 · flyp Oct 1 精读 | ⚠ flyp Oct 3 升级反方审稿 | 6 大反方问题 + 偏差传染风险;建议标注"可参照但不可替代" |
| BiasReducer(2609.32720) | R92 · HF 18票 #12 | ⚠ 维持待核 | Oct 3 无新进展;具体算法和量化数据仍未知 |
| MIST(2609.37863) | R92 · HF 36票 #7 | ⚠ 维持待核 | Oct 3 无新进展;200 句 benchmark 具体数据仍待核 |
| Training LLM Judges(2609.38792) | R92 · HF 5票 | ⚠ 维持待核 | Oct 3 无新进展;具体实验数据仍未知 |
| SAGO(2610.01428) | Oct 3 paper_card 1632 | ⚠ 新增待核 | Oct 3 02:13 入库;多轴稳定性测量具体数据未知 |
| PhysVista(2610.00559) | Oct 3 HF 34票 #9 + work-queue Top 15 #3 | ⚠ 新增待核 | Oct 3 02:13 入库;感知-推理-评估闭环具体数据待核 |
| OpenTumorBoard(2609.32810) | Oct 3 paper_card 1645 + work-queue Top 15 #1 | ⚠ 新增待核 | Oct 3 14:10 入库;SPECIALIST TURN + BOARD SIMULATION 评估细节待核 |
| LongHarness(2609.38137) | flyp Oct 3 反方审稿 | ⚠ 新增待核(反方) | 12.4× 数字存疑;任务类型与真实 agent 瓶颈结构性差距;建议标注反方立场 |
| RRSI 154▲ #1 | R92 · ⚠⚠⚠⚠⚠⚠⚠⚠ | ⚠⚠⚠⚠⚠⚠⚠ | Oct 3 HF Daily 仍跌出;连续第 10+ 日 |
| 物体永久性 198▲ #1 | R92 · 顶置续涨→跌出 | ⚠⚬⚬⚬⚬⚬⚬⚬ | Oct 2 跌出第 8 日 → Oct 3 跌出第 9 日 |
三、矛盾与警示
⚠️ 方法学警示 1:LongHarness 12.4× 数字存疑
问题:flyp Oct 3 反方审稿明确指出——LongHarness Bench 的 12.4× 效率提升数字复现风险极高(1-2 月人时),论文的"efficiency 一级轴"提法应被后续工作继承,但数字不应作为"事实"引用。任务类型结构性差距:LongHarness 的 4 个任务(结构化文本+检索+集合判断)与真实 SWE/deep research 瓶颈有系统性差距。
⚠️ 方法学警示 2:SEAL ρ=1.0 传递有效性折扣
问题:flyp Oct 3 反方审稿明确指出——SEAL 的 Spearman ρ 是"vs FullPair"而非"vs 人类偏好",FullPair 本身也是 LLM-based。若 FullPair ρ_vs_human = 0.7(合理假设),则 SEAL 的真实有效性 = 0.7 × 1.0 = 0.7(传递效应)。建议:reviews/ 应标注"可参照但不可替代",避免后续研究用 SEAL 替代人工 pairwise。
⚠️ 趋势警示:RRSI 和物体永久性 HF 跌出加速
问题:RRSI 154▲ 连续第 10+ 日跌出 HF 榜单;物体永久性 198▲ 从 Oct 2 跌出第 8 日加速到 Oct 3 跌出第 9 日——立标极显著 → 跌出信号连续 9 日。这可能影响 R92 §6.174.4 的"立标持续性检验"结论。
⚠️ 数据可靠性警示:SAGO/PhysVista/OpenTumorBoard 均 TLDR 极简
问题:arXiv 2610.01428(SAGO)、2610.00559(PhysVista)、2609.32810(OpenTumorBoard)三件 NET-new eval 主分类 paper_card 均刚入库(Oct 3),TLDR 极简。在原文精读前,不得将具体数字锚入评测维度体系。
四、本轮 eval 主题 eval 主分类 NET-new(Oct 2-3 窗口)
eval 主分类 paper_card 新入库(Oct 2-3 窗口):
- 1632-2610.01428 SAGO · 主分类 eval · benchmark · Oct 3 02:13 入库
- 1634-2610.00559 PhysVista · 主分类 eval · benchmark · Oct 3 02:13 入库(HF 34票 #9 · work-queue Top 15 #3)
- 1645-2609.32810 OpenTumorBoard · 主分类 eval · benchmark · Oct 3 14:10 入库(work-queue Top 15 #1)
eval 邻接新入库(Oct 2-3 窗口):
- 1644-2609.32993 X-Tree · 主分类 agent(eval 邻接)
- 1643-2609.37690 Honeycomb · 主分类 multimodal(eval 邻接)
- 1633-2609.40222 LOCI · 主分类 multimodal(eval 邻接)
五、可引用 arXiv 号列表
| arXiv 号 | 名称 | 本轮角色 | 主分类 |
|---|---|---|---|
| 2610.01428 | SAGO | NET-new 主分类 eval ⭐⭐⭐⭐⭐ · 稳定性感知泛化目标,多轴行为变异性测量 · ⚠️ 需原文精读 | evaluation |
| 2610.00559 | PhysVista | NET-new 主分类 eval ⭐⭐⭐⭐⭐ · VLM 物理智能感知-推理-评估闭环 benchmark · HF 34票 #9 | evaluation |
| 2609.32810 | OpenTumorBoard | NET-new 主分类 eval ⭐⭐⭐⭐⭐ · 611 患者×19157 讨论轮次真实世界多学科肿瘤委员会基准 · work-queue Top 15 #1 | evaluation |
| 2510.11977 | HAL | NET-new 邻接 eval ⭐⭐⭐⭐⭐ · 评测成本标准化基础设施 · $0.08-32/任务 + $800 全评测 | llm-infra |
| 2606.05670 | BenchAgent | NET-new 邻接 eval ⭐⭐⭐⭐⭐ · 协议对齐评测方法论 · 跨 scaffold 可比标准化 | llm-infra |
| 2605.20530 | AgentProcessBench | NET-new 邻接 eval ⭐⭐⭐⭐ · 过程质量评测 · 1,000 条轨迹 + 8,509 步标注 | — |
| 2609.38137 | LongHarness Bench | 方法学批判 ⭐⭐⭐⭐⭐ · 反方审稿 · 12.4× 数字存疑 + 任务结构性差距 | long-context |
| 2605.30104 | SEAL | 方法学批判 ⭐⭐⭐⭐⭐ · 反方审稿 · ρ vs FullPair ≠ ρ vs 人类 + 偏差传染风险 | engineering |
| 2609.24555 | The Endless Exam | 续用锚定 · 无上限评分数学构造 benchmark · work-queue Top 15 #1 | evaluation |
| 2609.38349 | MILO | 续用锚定 · Agent Harness 自动发现协同进化框架 | evaluation |
| 2609.39982 | Mid-Harness | 续用锚定 · 模型-harness 边界可靠性 | evaluation |
| 2609.39903 | OSWorld-Science | 续用锚定 · VLM Agent 科学软件评测 | evaluation |
| 2609.39102 | False Frontiers | 续用锚定 · 共舞弊问题 | agent |
| 2609.37559 | APM-Bench | 续用锚定 · 多会话持久记忆 benchmark | multimodal |
| 2609.36730 | LibraryDesignBench | 续用锚定 · Agent 设计能力两阶段 benchmark | agent |
| 2609.31415 | KV Cache Reuse Eval | 续用锚定 · 评测失真批判 | llm-infra |
| 2609.29167 | IndicBankBench | 续用锚定 · 四阶段银行 Agent 评测 | evaluation |
| 2609.30867 | ARGUS | 续用锚定 · 11 维审计框架 73% vs 18% | evaluation |
| 2609.30192 | SAGE | 续用锚定 · 符号闭包分析 SCA 框架 | evaluation |
六、下游建议
-
SAGO / PhysVista / OpenTumorBoard 三件套建卡(高优先级):2610.01428 + 2610.00559 + 2609.32810 均 eval 主分类且刚入库,建议建卡并标注待精读状态;OpenTumorBoard work-queue Top 15 第 1 优先级最高
-
HAL + BenchAgent 成本基础设施锚入(高优先级):arXiv:2510.11977 + arXiv:2606.05670 是 R92 §2.2 评测平台的新维度锚点;建议在维度化指标体系(§3)中增加 cost-aware evaluation 维度
-
LongHarness 反方审稿落实(高优先级):flyp Oct 3 反方审稿已将 LongHarness 2609.38137 升级为反方立场;建议在 R92 §1.1 增加"反方警示"标注,12.4× 数字不应作为事实引用
-
SEAL 反方审稿落实(高优先级):flyp Oct 3 反方审稿已将 SEAL 2605.30104 升级为反方立场;建议在 R92 §1.2 增加"反方警示"标注,ρ=1.0 是"与有偏 judge 的一致"而非"与人类判断的一致"
-
SAGO 多轴稳定性量化核实(中优先级):2610.01428 的多轴稳定性测量(生成一致性 + 内部激活 + 置信度 + 响应镜像)需原文精读获取量化数字后才能正式锚入§3维度化指标体系
-
RRSI 和物体永久性跌出第 9 日信号归档(低优先级):连续多日跌出,建议在 §6.174.4 标注信号衰减趋势
七、边界声明
- ✅ 本稿仅写入
/shared/research-kb/inbox/tom/2026-10-03-evaluation-e1prep.md(整篇覆盖) - ✅ 不写
organized/knowledge/、organized/reflection/、organized/paper_cards/(由其他实例/棒位承接) - ✅ 不写 inbox/{jay,tom,spark,stephen}/ 目录
- ✅ 不写 review/
- ✅ 不 git commit / git push / gh pr
- ✅ 不输出密钥 / Token / Cookie / 验证码 / 证券账户
- ✅ 仅基于已读 inbox + paper_cards 元数据 + work-queue + evaluation.md R92 基线做轻量综合
Tom · evaluation · E1 · 2026-10-03 15:40 CST · 增量 5 条 · 19 个 arXiv 号(含续用)· 下游建议 6 条