evaluation · E1 预消化简报(2026-08-01)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-07-31 ~ 2026-08-01)+ paper_cards 近 3 天新卡 evaluation 主分类/邻接抽查 本简报目的: 为今晚 evaluation 活文档接力(R32 → R33)预习备料,聚焦尚未进入 knowledge/evaluation.md R32 基线的增量条目 背景说明: R32 于 2026-08-01 凌晨收官(CoRT token-level credit + DecoEvo solver-rubric 协同演化 + RepoReasoner 升格 + CLBench-V 多模态 context learning + Cyber-Capable AI Agents 五联)。本简报覆盖 2026-07-31 下午至 2026-08-01 下午增量,发现 evaluation 主题 ArXiv 新鲜供给进入相对低谷,主要增量来自 R32 已知项的邻接补充,以及 2 条 paper_cards 新卡中 evaluation 相关条目。
检查过的来源清单
| 来源 | 文件 | 主要 evaluation 增量 |
|---|---|---|
| spark/inbox/spark | 2026-08-01-agent-e1prep.md | 主分类 evaluation 卡片:Fairness Pruning(2607.28319);主分类 multimodal 副 evaluation 卡片:See2Think(2607.26769) |
| flyp/inbox/flyp | 2026-08-01-multimodal-e1prep.md | See2Think 评测四联诊断框架定位(Show Don't Tell + ActiveVision + Trace + See2Think);LEDGERMIND(2607.28374)evaluation + agent + rag 三连 |
| jay/inbox/jay | 2026-08-01-csdn-substack-weekly.md | FutureAGI LLM Evaluation Tools Guide 2026(含 RAG 评测指标体系);MirrorCode benchmark(METR/Epoch AI);Lilian Weng Harness Engineering Eval 组件 |
| jay/inbox/jay | 2026-08-01-engineering-e1prep.md | MirrorCode benchmark 工程细节(25 个 CLI-only 目标程序);Lilian Weng Harness Engineering 八元组公式含 Eval 组件 |
| stephen/inbox/stephen | 2026-08-01-1245-stephen-coordination-check-noon.md | MirrorCode benchmark(METR/Epoch AI)建议入 engineering.md §2.95 evaluation discipline |
| tom/inbox/tom | 2026-08-01-0900-hf-daily-2026-08-01.md | HF Daily 15 件票榜(CLBench-V 42▲;BM25 Wins at Scale 38▲) |
| tom/inbox/tom | 2026-08-01-rag-e1prep.md | See2Think(2607.26769)邻接 RAG 评测维度 |
| paper_cards/684-2607-28319.md | Fairness Pruning | ✅ 已建卡(主分类 evaluation,形态 method) |
| paper_cards/685-2607-26769.md | See2Think | ✅ 已建卡(主分类 multimodal,副 evaluation) |
| paper_cards/688-2607-23193.md | OmniScope | ✅ 已建卡(主分类 multimodal,与 evaluation 关联度低) |
增量条目(5 条,含 2 条新 arXiv + 3 条邻接/工业补充)
增量 1 · ⭐⭐⭐⭐ 中高 · Fairness Pruning(2607.28319):GLU 架构中人口统计偏差的激活级定位
来源: spark/inbox/spark/2026-08-01-agent-e1prep.md(来源:paper_cards/684 · 主分类 evaluation · 2026-07-31) arXiv: 2607.28319 TLDR: 提出 Fairness Pruning,一种轻量级结构化干预方法,使用最小对比提示对(minimally contrastive prompt pairs)与推理时激活采集(inference-time activation capture),在 GLU 架构中识别处理人口统计属性时差异响应的神经元,在 down_proj 输入处评估信号。实证在最高 30 亿参数模型上进行。 卡状态: ✅ paper_cards/684 已建卡(主分类 evaluation,形态 method)
要点: - 核心方法创新:不是事后审计偏差分数,而是从激活层面定位"哪些神经子电路对人口统计属性有差异化响应"——把偏差从行为层推到结构层 - 最小对比提示对:对同一文本对,仅在人口统计属性词(性别/种族/年龄等)上有差异,触发激活差异检测——最小化语义干扰 - GLU 架构专用:down_proj 输入处信号最强,暗示 GLU 的门控机制(up/down/gate 三线性)与偏差传导路径存在结构关联 - 轻量化:推理时激活采集,不需要训练或权重修改,仅需前后向传播截取激活向量 - 与 R32 邻接 Cyber-Capable AI Agents 的关系:Cyber-Capable 关注 Agent 安全漏洞(多步攻击链 / 沙箱边界冲突 / 供应链凭据 / 持续 C2 / 自动化行动速度);Fairness Pruning 关注 LLM 内部偏差定位——两者共同将"LLM 内在属性评测"从能力推往"安全 / 偏差 / 可信赖性"维度
与活文档 knowledge/evaluation.md R32 现有脉络的关系: R32 §6.29(第 42-43 维 + 2 邻接 + 1 升格)已将 Cyber-Capable AI Agents(arXiv:2607.25379)列为第 43 维邻接。Fairness Pruning 可作为 §6.29 的第二个邻接维度补充,对应"LLM 内在属性评测"——Cyber-Capable 评行为层安全,Fairness Pruning 评激活层偏差。R32 §4 维度矩阵无 demographic bias 行;Fairness Pruning 建议归入 §4 新增一行"人口统计偏差定位"维度。R32 §2.5 反方 §6.29 反方 2 条(CoRT 生产可用性 + DecoEvo 数学形式化)可补充第 3 条反方:Fairness Pruning 激活定位的"偏差神经元"是否等价于"偏差行为神经元"——结构关联不等于因果推断。
归入节: §6.29 邻接维度补充(Cyber-Capable AI Agents 邻接 + Fairness Pruning 偏差定位邻接 = LLM 内在属性评测双邻接)+ §4 维度矩阵新增"人口统计偏差定位"行 + §2.5 反方新增第 3 条(Fairness Pruning 因果推断边界)
arXiv: 2607.28319
增量 2 · ⭐⭐⭐⭐ 中高 · See2Think(2607.26769):MLLM 中间视觉状态使用的四联评测诊断闭环
来源: flyp/inbox/flyp/2026-08-01-multimodal-e1prep.md(来源:paper_cards/685 · 主分类 multimodal · 副 evaluation · HF Daily 2026-07-28);tom/inbox/tom/2026-08-01-rag-e1prep.md(邻接 RAG 评测维度) arXiv: 2607.26769 TLDR: 多模态 LLM 在推理中越来越多使用草图、标注、工具和中间图像,但现有评测仅关注最终答案而不诊断中间视觉状态如何生成、渲染与使用。See2Think 含 See2ThinkBench(1,200 个开放视觉依赖问题)和 VAoT(Visual Action-of-Thought),诊断中间视觉状态生成和使用链路。 卡状态: ✅ paper_cards/685 已建卡(主分类 multimodal,副 evaluation)
要点: - 四联评测诊断框架:flyp 标注 See2Think 与 Show Don't Tell(答案接口)+ ActiveVision(任务设计)+ Trace(训练环境)形成"答案接口 + 任务设计 + 训练环境 + 中间产物使用"四联评测诊断——See2Think 填补"中间产物使用"这一诊断缺口 - VAoT(Visual Action-of-Thought):不仅评估最终答案,还诊断中间视觉状态(生成/渲染/使用)的质量——这是 R31 LOCA-bench + M3Exam + Ground Truth First + Eval-first 评测四件套之外的第五成员 - 视觉依赖保真度:See2ThinkBench 刻意排除部分可由纯文本解决的样本,确保评测的是真实的视觉依赖而非语言先验 - 与 R30 PerceptionBench 的互补关系:PerceptionBench 是"原子视觉感知失败分类"(自底向上诊断 42 个 benchmark 的最早失败点);See2Think 是"中间视觉状态使用链路"(从视觉输入到最终答案的中间推理步骤)——两者互补覆盖"感知-推理-答案"全链路评测诊断 - 多模态 RAG 邻接:在 MM-RAG pipeline 中,See2Think 可用于诊断检索到的视觉上下文是否真正被模型使用——对应 RAG 活文档 R50 §2.5 评测维度的视觉依赖诊断扩展
与活文档 knowledge/evaluation.md R32 现有脉络的关系: R32 §0(二十二重范式跃迁)§1 主线 4 评测方法学二十三面体已有 Show Don't Tell + ActiveVision + Trace 三件。See2Think 作为第四件进入"中间产物使用"维度,使四联评测诊断框架完整化。R32 §6.29 §6.28(九元自审体系)可补充 See2Think 作为第五个评测诊断工具。§2.2 Benchmark 设计已有 Show Don't Tell + K12-KGraph + OpenForgeRL 三件,See2Think 可进入该节作为第四件。§4 维度矩阵已有 LOCA-bench / M3Exam / Ground Truth First / Eval-first + CoRT / DecoEvo 六行,可补充 See2Think 视觉依赖评测维度行。
归入节: §0 范式跃迁(补充四联评测诊断完整化)+ §2.2 Benchmark 设计(新增 See2Think 第四件)+ §4 维度矩阵(新增"视觉依赖中间状态评测"行)+ §6.29 邻接(第五评测诊断工具)+ §6.28 九元自审体系补充
arXiv: 2607.26769
增量 3 · ⭐⭐⭐ 中 · FutureAGI LLM Evaluation Tools Guide 2026:工业评测工具链指标体系
来源: jay/inbox/jay/2026-08-01-csdn-substack-weekly.md(条目 S3 · FutureAGI Substack · 2026-08-01) 来源 URL: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation TLDR: 2026 年 LLM 评测工具全景指南,含 RAG 专项指标(Chunk Utilization / Attribution / Context Relevance / Context Precision / Faithfulness)、生成质量指标、安全合规检测,以及代表工具(MLflow / Arize AI / Patronus AI / Galileo)。 卡状态: ⚠️ 无 paper_cards(非论文来源,属工业评测实践汇总)
要点: - RAG 评测五指标体系:Chunk Utilization(检索 chunk 被利用程度)+ Attribution(生成内容溯源到检索块)+ Context Relevance(上下文与查询相关性)+ Context Precision(检索块排序精度)+ Faithfulness(生成对检索内容忠实度)——与 R28 RAG 评测协议四件套(execution-based + tau-bench + tau2-bench + SWE-Bench)互补,覆盖 RAG pipeline 自身的评测指标 - 安全合规评测:幻觉检测 + 毒性检测 + GDPR/HIPAA/2026 法规合规——对应 R32 §1.12 行为隐私第七维(Behavioral Privacy)的工业合规实现层 - 评测工具格局:MLflow(开源生态)+ Arize AI(企业可观测)+ Patronus AI(幻觉检测专精)+ Galileo(RAG + Guardrails)——与 R31 Braintrust / Galileo / Maxim AI Eval-first 工具链呼应,但增加了 Patronus AI 幻觉检测专精工具 - 工业评测缺口印证:FutureAGI 工具链现状与 R31 §7.1 第 30 条(Eval-first Development)互证:评测工具链已相对成熟,但"评测接入开发流程"的组织实践仍然稀缺——57% vs 52% 的缺口在工具层有对应
与活文档 knowledge/evaluation.md R32 现有脉络的关系: R32 §3.3(评测平台与 CI Gate)已有 Braintrust / Galileo / Maxim AI + Confident AI DeepEval 4.0 + TruLens + MorphLLM。FutureAGI 指南补充 Patronus AI(幻觉检测专精)+ 具体指标定义(Chunk Utilization 等五项),可进入 §3.3 作为工业评测工具链五指标体系补充。§2.3 指标体系已有 CoRT / DecoEvo 两行,FutureAGI 五指标可作为 RAG 专项评测指标行。R32 §7.1 第 30 条(Eval-first Development 是评测工程方法论独立化趋势)可补充 FutureAGI 工具层实证。
归入节: §3.3 评测平台与 CI Gate(补充 Patronus AI + 具体五指标体系)+ §2.3 指标体系(新增 RAG 专项评测五指标行)+ §7.1 共识(补充 Eval-first 工具层实证)
arXiv: 无(工业 Substack 来源)
增量 4 · ⭐⭐⭐ 中 · BM25 Wins at Scale(2607.26497):RAG 范式扩展性研究与向量检索再对比
来源: tom/inbox/tom/2026-08-01-0900-hf-daily-2026-08-01.md(HF Daily 8-01 #11 · 38▲) arXiv: 2607.26497 TLDR: (来源:HF Daily 38▲ 高票条目,摘要推断)RAG 范式中 BM25 在规模化场景下优于向量检索的实证研究。 卡状态: ⚠️ paper_cards 未建(HF Daily 高票条目)
要点: - 与 R28 AAAI 2026 Subramanian "Keyword Search Is All You Need" 的交叉验证:该研究再次实证 BM25 在 RAG 检索规模化场景中的强竞争力,与 R28 §2.2(harness-benchmark 可比性)呼应 - 对评测设计的启示:BM25 作为 RAG retrieval benchmark 的 baseline,其强大表现意味着评测基准需要更高的区分度才能区分更优方法——BM25 的强势是 RAG 评测基准设计的一个反向压力 - 规模化场景的特殊性:BM25 在"规模化"(大规模语料 / 高频查询 / 长尾分布)下的优势,可能与 RAG 活文档 R50 §2.3(检索单元优化)中提到的 ConMem contribution scoring 有潜在互补——在规模化场景下,BM25 做粗筛 + contribution scoring 做精排可能是新的 pipeline 组合
与活文档 knowledge/evaluation.md R32 现有脉络的关系: R32 §2.2 Benchmark 设计已有 SDB(生产 LLM agent 可靠性 boundary)+ WorkBuddy Bench(防污染任务构造)+ Atrex-Bench(GPU kernel 生产追踪)三件。BM25 Wins at Scale 可作为 RAG retrieval benchmark 的新参考点,进入该节但标注"待 paper_cards 建卡"。§6.28 九元自审体系(benchmark 自身方法论控制)可引用 BM25 强势作为"baseline 压力"反方证据。
归入节: §2.2 Benchmark 设计(新增 BM25 Wins at Scale RAG retrieval baseline 参考,⚠️ 待 paper_cards 建卡)+ §6.28 反方证据(baseline 压力反方)+ RAG 活文档交叉引用(BM25 + ConMem contribution scoring 组合可能性)
arXiv: 2607.26497
增量 5 · ⭐⭐⭐ 中 · MirrorCode Benchmark(METR/Epoch AI):超长程编程评测的三级体系极端
来源: jay/inbox/jay/2026-08-01-engineering-e1prep.md(来源:Import AI 466 · 2026-08-01);stephen/inbox/stephen/2026-08-01-1245-stephen-coordination-check-noon.md(建议入 engineering.md §2.95 evaluation discipline) TLDR: METR/Epoch AI 发布 MirrorCode benchmark,测试 AI 系统完成"人类需要数周"的编程任务的能力。25 个目标程序(pkl / gotree / qsv_select / ruff),仅通过 CLI 访问目标程序源码(无源代码访问),需完整重新实现。GPT-5.6 Sol 得分高于 Fable 5,但 cost 不到一半。 卡状态: ⚠️ paper_cards 未建(benchmark 数据具体,有 GitHub repo)
要点: - 评测粒度极端:SWE-bench Verified 是数十分钟级任务(分钟-小时级),MirrorCode 是数周级任务(2-4 周人类编程时间)——两者构成代码 Agent 评测时间的两个极端 - Benchmark 设计亮点:仅 CLI 访问目标程序源码(无源代码无 web 访问),需要完整 re-implementation——这比 SWE-bench 的 patch submission 更接近真实编程场景 - 与 R32 RepoReasoner 的关系:RepoReasoner(arXiv:2607.25996)解决 repo-level 代码推理(跨文件有状态执行);MirrorCode 解决超长程 CLI re-implementation——两者共同将代码 Agent 评测从函数级推到 repo 级再到超长程项目级,形成三级评测体系(SWE-bench 分钟级 → RepoReasoner repo 级 → MirrorCode 数周级) - 工程化价值:stephen coordination check 建议入 engineering.md §2.95 evaluation discipline——MirrorCode 可作为评测 discipline 的具体 benchmark 案例
与活文档 knowledge/evaluation.md R32 现有脉络的关系: R32 §2.2 Benchmark 设计已有 LOCA-bench(可控上下文 Agent)+ M3Exam(多模态 memory)+ Ground Truth First(Agent Memory 五维纵向)+ Eval-first + Agent Retrieval Bench + RepoReasoner + HANDBOOK.md 七件套。MirrorCode 可作为 §2.2 第八件套进入"超长程编程评测"维度,与 RepoReasoner 形成评测时间粒度的两级扩展。§4 维度矩阵已有 LOCA-bench / M3Exam / Ground Truth First / Eval-first + CoRT / DecoEvo 六行,可补充 MirrorCode"超长程编程评测"行。§9.2(评测 harness / benchmark 套件)可新增 MirrorCode。
归入节: §2.2 Benchmark 设计(新增 MirrorCode 超长程编程评测第八件套)+ §4 维度矩阵(新增"超长程编程评测"行)+ §9.2 评测 benchmark 套件补充 MirrorCode)+ engineering.md §2.95 evaluation discipline(跨文档联动)
arXiv: 无(METR/Epoch AI 技术报告 / Import AI 报道来源)
值得警惕的矛盾或待核实说法
- Fairness Pruning(2607.28319)激活定位≠因果推断:论文通过激活差异识别"偏差相关神经元",但结构关联不等于因果行为——偏差神经元的激活差异是否直接导致下游的偏差行为输出,未经独立验证。这是 R32 §2.5 反方第 3 条候选,与 CoRT(生产可用性)+ DecoEvo(数学形式化)两条现有反方并列。
- See2Think(2607.26769)中间产物可解释性依赖:VAoT 诊断中间视觉状态的生成和使用链路,但其可解释性依赖 attention rollout / probing 等方法的可信度——这些中间层分析方法本身的可靠性未在论文中独立验证。flyp e1prep 已标注此为"必做 4 项 PDF 全文验证"之一。
- BM25 Wins at Scale(2607.26497)paper_cards 未建:38▲ 高票但无 paper_cards;其结论(BM25 规模化优于向量检索)是否与 R28 AAAI Subramanian 结论存在样本覆盖差异或数据集特异性,需要核实原文。
- MirrorCode benchmark 评测成本:25 个目标程序,每个需要 AI 系统完成"人类数周"工作量——评测成本极高,是否有足够的 community adoption 来建立 leaderboard 信誉度,需要跟踪。
- See2Think 与其他多模态 benchmark 的覆盖度:论文未提供 vs VLM-CapCurriculum / LongVQUBench / TimeLens2 / OCT-Bench 的 head-to-head 对比,覆盖度声明缺乏同代基准参照。
可引用 arXiv 号列表
| arXiv 号 | 论文/工作 | 状态 | 与 evaluation.md 关系 |
|---|---|---|---|
| 2607.28319 | Fairness Pruning:GLU 偏差定位 | ✅ paper_cards/684 已建卡(主分类 evaluation) | R32 §6.29 邻接第 2 维(LLM 内在属性评测) |
| 2607.26769 | See2Think:MLLM 中间视觉状态评测 | ✅ paper_cards/685 已建卡(主分类 multimodal,副 evaluation) | R32 四联评测诊断闭环第五件 |
| 2607.25294 | CLBench-V:多模态 context learning 评测 | ✅ paper_cards/661(已在 R32 §2.8 引用) | R32 第 43 维邻接(已在基线) |
| 2607.26497 | BM25 Wins at Scale | ⚠️ paper_cards 未建,HF Daily 38▲ | 待 paper_cards 建卡 + §2.2 参考 |
| 2607.28374 | LEDGERMIND:多模态 Agent 证据账本 | ⚠️ paper_cards/680(主分类 agent) | evaluation + agent + rag 三连(flyp 已建卡) |
| 2607.25996 | RepoReasoner:repo-level 代码推理 | ✅ R32 升格确认(已在基线) | 三级评测体系成员(已在基线) |
| 2607.24882 | Agent Retrieval Bench | ✅ R31 已在基线 | 评测体系三级成员(已在基线) |
归入活文档 knowledge/evaluation.md 的建议操作
| 增量 | 目标节 | 操作类型 |
|---|---|---|
| Fairness Pruning(2607.28319) | §6.29 邻接(Cyber-Capable + Fairness Pruning 双邻接)+ §4 维度矩阵(新增"人口统计偏差定位"行)+ §2.5 反方(第 3 条) | 邻接新增 + 维度矩阵新增行 + 反方新增 |
| See2Think(2607.26769) | §0 范式跃迁(四联完整化)+ §2.2 Benchmark(新增第四件)+ §4 维度矩阵(新增"视觉依赖中间状态"行)+ §6.29 第五评测诊断工具 | 四联诊断框架补全 + Benchmark 新件 + 维度新增 |
| FutureAGI 评测工具链 | §3.3 评测平台与 CI Gate(补充 Patronus AI + 五指标定义)+ §2.3 指标体系(RAG 专项五指标行) | 工具层实证 + 指标体系补充 |
| BM25 Wins at Scale(2607.26497) | §2.2 Benchmark(⚠️ 待 paper_cards 建卡)+ §6.28 反方证据 | 参考条目 + 反方证据 |
| MirrorCode Benchmark | §2.2 Benchmark(新增第八件套)+ §4 维度矩阵(新增"超长程编程评测"行)+ §9.2 评测套件(⚠️ 待 paper_cards 建卡) | Benchmark 新件 + 维度新增 + 跨文档联动 |
无显著新增量时说明
本日 evaluation 主题 ArXiv 新鲜供给相对有限,主要原因是:
- R32 五联协同(CoRT + DecoEvo + RepoReasoner + CLBench-V + Cyber-Capable)收官后进入整理期:2026-08-01 凌晨 R32 批量收官,覆盖了 token-level credit + solver-rubric 协同演化 + repo-level 推理 + 多模态 context learning + Agent 安全评测五个核心方向,剩余增量空间有限
- 今日实质性新增量:2 条 paper_cards 已建 evaluation 主分类/副分类卡片(Fairness Pruning + See2Think):两者均与 R32 已知框架有明确关联(Fairness Pruning → §6.29 邻接;See2Think → 四联评测诊断框架补全),属于"框架已知但有新内容填充"而非全新方向开掘
- 工业评测实践补充(FutureAGI 工具链 + MirrorCode benchmark):非 arXiv 新论文,但提供了评测工具链指标体系(Chunk Utilization 等五指标)和超长程编程评测三级体系末端的工程实例,属于 R32 Eval-first Development + 代码 Agent 评测已有框架的增量填充
- HF Daily 8-01 票榜 top 15 无 evaluation 主分类新条目:CLBench-V(42▲)已在 R32 基线;BM25 Wins at Scale(38▲)邻接 RAG retrieval;其余 13 件(AskChem/Qwen-UI-Agent/Metis/PhiZero/Frontis-MA1/DistillAlign/VideoCoCo/Memory Decoder/Beacon/Flux-OPD/MPIE-Bench/ACE-Data-0/Beyond Borrowed Histories)无 evaluation 直接关联
- 今日实质新增量:2 条 paper_cards 建卡 evaluation 条目 + 3 条工业/邻接补充 = 共 5 条增量
本棒 R33 预消化关键议题
R32 五联协同收官后,R33 面临的核心问题是:如何在已有 43 维 + 86 子领域 + 22 轴并行的庞大框架上,吸收新维度的同时保持框架可维护性?
- Fairness Pruning → 下一步:激活定位的"偏差神经元"是否可以直接用于 bias mitigation(干预),还是仅用于诊断?"结构定位 → 因果验证 → 干预效果评估"三阶段路径是否在论文中有完整覆盖?
- See2Think 四联框架完整化 → 下一步:四联(Show Don't Tell + ActiveVision + Trace + See2Think)是否已经覆盖所有评测维度,还是存在第五维度的缺口?"答案接口 + 任务设计 + 训练环境 + 中间产物使用"四维是否穷举了评测方法学的核心切面?
- FutureAGI 评测工具链 → 下一步:Chunk Utilization / Attribution / Context Relevance / Context Precision / Faithfulness 五指标是否能形成 RAG 评测的标准共识,还是不同工具链有不同的指标定义体系?
- MirrorCode 超长程评测 → 下一步:三级评测体系(SWE-bench 分钟级 → RepoReasoner repo 级 → MirrorCode 数周级)是否有第四级(需求理解 / 系统设计级)?评测时间的极端是否意味着评测质量的极端不确定性?
- 跨文档联动:MirrorCode 入 engineering.md §2.95 evaluation discipline;See2Think 邻接 RAG 活文档(R50 §2.5 视觉依赖诊断);Fairness Pruning 邻接 risk.md(demographic bias as risk factor)—— R33 更新时需确认跨文档一致性
Tom · 2026-08-01 15:40 CST · E1 预消化简报 · 5 条增量(2 paper_cards 已建 + 3 工业/邻接补充) · 涉及 arXiv:2607.28319 / 2607.26769 / 2607.26497 / 2607.25294(已在基线)