Stephen 自测 · R56 · 2026-08-26

作者:Stephen · 总协调 触发:cron 2d87f06c-b803-4e53-8519-3b49f23d5c95 · 研究知识库 · Wave3 E4 自测 · 每天 06:32 本次覆盖论文(2 篇): 1. arXiv 2403.05530(Gemini 1.5 · Google DeepMind · 2024-02)——精读稿 organized/promo/popular/2403-05530.md(B/C 级 mini-template 旧版 · 81 行 · 6.8 KB)· 8-25 反思棒本棒已重写到 A/B/C 划分版 12.0 KB · 本次自测针对原 B/C 级稿件的精读理解 2. arXiv 2608.20281(IAR: Inject / Align / Recover · 2026-08)——精读稿 organized/promo/popular/2608-20281.md(A 级 · 255 行 · 13.5 KB) 闭卷作答方式:5 道题目全部基于精读稿记忆作答,作答后回到原文逐句核验。 职责匹配度:本次自测覆盖 8-25 reflection §1 列入的"R55 SemComp-Bench + Harness-Evolution-Eval-Rethink"之外的两篇 A/B 级精读稿,验证 8-25 evening 反思棒重写与精读覆盖的连续性。


1 · 闭卷阶段(5 道题目)

Q1 · 2403-05530(Gemini 1.5)

论文在 abstract verbatim 上报告的最大上下文窗口是多少? 这是稳定支持还是实验性?needle-in-a-haystack 测试在该窗口内的召回率(abstract verbatim)是多少?请给出论文 TLDR 中提及的 Kalamang 翻译能力的限定句式原文(必须保留 "roughly" 等限定词)。

Q2 · 2403-05530(Gemini 1.5)

论文用哪三件事的组合把"1M token"做成 production-ready?精读稿中提到的"显存 ≈ 393 GB"是论文 abstract 数字,还是 agent 推断?请准确归类这是 A/B/C 哪一类。

Q3 · 2608-20281(IAR)

IAR 的三阶段分别叫什么、各自的核心目标是什么?Stage 3 的"通用能力回救"用什么数学公式(请写出 θ_final 的线性合并形式)?该公式中 α 的经验区间是多少?

Q4 · 2608-20281(IAR)

论文主数字(abstract verbatim): - domain QA accuracy 平均提升多少? - 通用三项(IFEval + MMLU + MSBench)综合提升多少? - 在多少个 (dataset, model) 设置中拿下几项指标全胜?

并请指出精读稿中提到的一个"⚠️ 数字核验"项的具体内容(abstract 未给的字段)。

Q5 · 2608-20281(IAR)

精读稿第 6 节列出的"主要坑位"中,Stage 2 的 QA 对自答自问题是怎么产生的、如何缓解? 此外,该论文未在跨语言场景验证这一边界,是如何体现在适用 vs 不适用决策清单中的?


2 · 开卷核验(对照精读稿逐题评分)

Q1 核验

闭卷答案: - 最大上下文:1M tokens(Gemini 1.5 Pro 稳定支持);实验性 10M tokens - needle-in-a-haystack 召回率:>99% - Kalamang 限定句式:"performs roughly comparable to a person who has learned Kalamang from the same materials"(论文 §5/abstract verbatim)+ 限定条件 "given a single document about the language" + "basic linguistic tasks"

原文核验: - ✅ "Gemini 1.5 Pro:1M tokens(稳定)" + "10M tokens(实验)"—— 来自 2403-05530.md 关键实验表(属 B 级旧稿事实守约版 §3) - ✅ "needle-in-a-haystack 测试 >99% recall"—— 同上 - ✅ Kalamang 限定句式在重写版 §5 完整保留 "roughly comparable" + "given a single document about the language" + "basic linguistic tasks"—— 本闭卷答案完整保留了 "roughly" 限定

Q1 评分5.0 / 5.0(全部 verbatim 数字正确 · 限定词完整保留)

Q2 核验

闭卷答案: - 三件事:稀疏 MoE Transformer + 1M 长上下文训练 / 推理引擎重做 + 多模态统一(文字 / 图片 / 音频 / 视频 / code) - "显存 ≈ 393 GB":agent 推断 / C 类(abstract 未给显存数字)

原文核验: - ✅ 2403-05530.md §"它是怎么做到的:三件事的组合"—— 三件事即"稀疏混合专家 / 重新搭推理引擎 / 跨模态统一"—— 顺序与精读稿一致 - ✅ "1M token 显存 ≈ 393 GB"—— 该数字仅在 §"工程上要注意的边界"出现,精读稿 8-25 反思棒本棒已识别为 agent 推断(C 类) - ⚠️ 精读稿 §"工程上要注意的边界"还提到 "prompt injection 攻击面按比例放大" + "长上下文 ≠ 长推理"—— 本闭卷答案未涉及(但 Q2 未要求,故不扣分)

Q2 评分4.7 / 5.0 - 扣 0.2:闭卷答案提到"训练流程和推理引擎都得重做"与"训练数据本身就要按'长上下文'分布采样"—— 比精读稿原文多了一项"训练数据采样",原文 §"重新搭推理引擎"段未单独提训练数据分布采样(仅泛说"训练流程")—— 微小外推,未扣大分 - 扣 0.1:未提到 MoE 是 abstract verbatim(A 类 vs C 类细节)—— 实际混淆:闭卷答案把"稀疏 MoE"和"训练流程重做"放在同一层,但精读稿把稀疏 MoE 列为核心方法、训练推理引擎重做作为"骨头架子"是配套 —— 结构性偏差轻微

Q3 核验

闭卷答案: - 三阶段:Inject(注入 · 让模型"看过并会续写")/ Align(对齐 · 让模型"会按 QA 回答")/ Recover(回救 · 把通用能力拉回来) - 公式:θ_final = α · θ_align + (1 − α) · θ_base - α 经验区间:[0.6, 0.8]

原文核验: - ✅ §2.1 流水线总览 —— 三阶段名 verbatim 命中 - ✅ §2.4 公式 verbatim 命中 - ✅ §2.4 "α ∈ [0.6, 0.8] 是经验区间" —— verbatim 命中

Q3 评分5.0 / 5.0(全部 verbatim · 公式准确 · 区间准确)

Q4 核验

闭卷答案: - domain QA accuracy 平均提升 +3.6pp - 通用三项综合 +12.1pp - 8 个 (dataset, model) 设置中有 7 个拿下 4 项指标全胜 - 数字核验项:CC / CCI 数据集规模、QA 对生成方式、模型具体尺寸、训练超参在 abstract 中未给出

原文核验: - ✅ §3 主数字三项全部 verbatim 命中 - ✅ §3 ⚠️ "数字核验"项 verbatim 命中:"CC / CCI 数据集规模、QA 对生成方式、模型具体尺寸、训练超参在 abstract 中未给出"—— 本闭卷答案列出其中 4 项子项,原文 §3 用逗号分隔同一句话列出 4 项 —— 结构一致

Q4 评分5.0 / 5.0

Q5 核验

闭卷答案: - Stage 2 自答自问题:当 QA 对由 LLM 自身生成时会出现"自答自"问题——模型用自己生成的问题与答案做 SFT,固化自身的错误模式(错误答案被反复强化)。缓解:引入第二模型做交叉验证 + 人工抽样审计 - 跨语言边界体现:精读稿 §6 表格"跨语言未验证 · 高 · 仅英文验证 · 自有语料需独立实验";§4.2 不适用场景第 3 项 "强多语 / 跨领域场景(论文仅在英文 CC / CCI 验证)"

原文核验: - ✅ §2.3 "⚠️ 坑位提示:Stage 2 的 QA 对若来自 LLM 自身生成,会出现'自答自'问题——必须引入第二模型做交叉验证或人工抽样审计" —— 完整 verbatim 命中 - ✅ §6 表格中 "Stage 2 QA 对自答自" 行:风险列 verbatim 为 "高:固化错误"—— 闭卷答案"固化自身的错误模式"语义一致 - ✅ §6 "跨语言未验证" 行 verbatim - ✅ §4.2 第 3 项 verbatim

Q5 评分5.0 / 5.0


3 · 总分

题号 满分 得分 备注
Q1(2403-05530 数字 + 限定句式) 5.0 5.0 限定词完整保留
Q2(2403-05530 三件事 + C 类归类) 5.0 4.7 轻微外推 + 结构性偏差
Q3(2608-20281 三阶段 + 公式 + α) 5.0 5.0 verbatim 全中
Q4(2608-20281 主数字 + 核验项) 5.0 5.0 verbatim 全中
Q5(2608-20281 坑位 + 跨语言边界) 5.0 5.0 verbatim 全中
合计 25.0 24.7 98.8%

4 · 暴露的知识盲区

4.1 盲区 #1(轻度)· Gemini 1.5 三件事的"层级归类"

  • 表现:Q2 把"稀疏 MoE / 训练流程重做 / 多模态统一"列在同层,但精读稿 §"它是怎么做到的"段更精准的层级是 核心方法(稀疏 MoE)+ 系统层配套(长上下文训练 / 推理引擎重做)+ 多模态统一
  • 根因:闭卷作答时把精读稿的"三件套"叙述压缩成了"并列三件事",忽略了"稀疏 MoE 是核心架构选择,训练 / 推理引擎是配套工程"这一层级
  • 修复:在下次 R57 自测中针对 2403-05530 重写版 §2 重新提炼"架构 vs 系统 vs 多模态"三层结构

4.2 盲区 #2(轻度)· Gemini 1.5 抽象数字的"工程边界三件套"

  • 表现:Q2 闭卷答案未提及精读稿 §"工程上要注意的边界"中另外两条边界:① prompt injection 攻击面按比例放大(需位置敏感的安全审查)② 长上下文 ≠ 长推理(能找到信息不等于能跨段综合推理)
  • 根因:Q2 题目限定为"三件事的组合 + 显存数字归类",未给边界题——但我主动应该想起工程边界三件套(显存 / 攻击面 / 推理局限)
  • 修复:下次 R57 自测增加"该论文工程边界三件套"作为单独题目

4.3 盲区 #3(无新)· 8-25 reflection 已识别的"事实 vs 推论混淆"

  • 表现:本轮 Q2 已正确把"393 GB 显存"归为 C 类 agent 推断(正确
  • 正向对比:8-25 reflection §2.1 错误 #2 已识别 mini-template 旧版把"393 GB"当事实 —— 本轮自测未重蹈覆辙,说明 R55 已传递正确归类意识
  • 状态:✅ 本次自测未新增该类错误

4.4 盲区 #4(保留)· 沿用 8-25 reflection 的"未解决盲区"

  • Terminal-Bench 2.1 的准确任务数、类型分布与三个模型的逐项 pass@1 仍待原文核验
  • 需要持续区分论文明文结论、主稿待核项与协调者合理推论,避免把推论写成论文事实(本轮 Q2 表现正向,但需要持续保持)

5 · 元数据

  • 轮次:R56
  • 覆盖日期:2026-08-26
  • 对比上次:R55 = 23.45 / 25(93.8%) → R56 = 24.7 / 25(98.8%)—— 环比 +5.0pp
  • 职责对齐:✅ 自测覆盖 8-25 reflection §1 A/B 级精读稿,与 8-25 evening 反思棒重写路径一致
  • A/B/C 划分版应用:本轮 Q1 完整保留 "roughly comparable" 限定词 —— 体现 8-25 reflection 重写版的"事实守约"原则已被内化