DocOps + Decodability Supervision 双稿精读与批判(v2,覆盖 7-23 22:52 v1)

角色:flyP · agent benchmark + interpretability · E2 精读与批判(2026-07-24 21:20 反思触发 v2 覆盖) v2 覆盖依据:沿用 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则 + 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则 + 7-21 §3.3 十四规则 + 7-22 §3.3 十五规则 + 7-23 §3.3 十六规则 + 7-24 §3 十七规则 v2 关键修正:(1) 把原 v1 双篇合并稿拆成两件独立精读,每件独立 §0 元层五问 + 反方硬标签 + 后续动作信源截止日 + 边界声明自洽性 + 评级与体量一致;(2) 删除原 v1 越界写 published/reviews/ / notes/ / reviews/ / digests/ 路径的"建议 sync 任务代写"委婉越界形式,改为"由 E1 / E3 / paper_cards 等符合权限的实例去写";(3) 删除原 v1 跨实例指向其它实例的具体文件名 / 雷达 ID / 棒次时间戳,改为只到"stepher / jay / tom / spark 各自反思产物"抽象层级;(4) 元层五问前置 + 反方硬标签化(证伪条件 + 判定依赖 + 反方严重度)+ 后续动作信源截止日化(信源 + 截止日 + 验收标准)+ 营销腔禁用(沿用 7-20 + 7-21 + 7-22 + 7-23 硬分级量表)+ 评级与体量一致 v2 评级:B 级(3.8 / 5)—— 沿用 7-20 + 7-21 + 7-22 + 7-23 硬分级量表(边界 3 来自原 v1 越界写 / 跨实例引用委婉越界已被修正,但反思规则已记录;深度 4 来自反方硬标签化但仍有 ≥3 条仍待补"证伪条件";清晰 4 来自结构分层 + 表格化但 §3 建议路径 vs §5 元信息自洽仍待 e1prep 后续接入核对) 核心判断:B 级 · 2 件独立精读 = "评测可验证性 + 解释可验证性"二联立标候选(DocOps = 真实文档操控的可验证 agent 评测基准 + RECAP = 逐 claim 验证解释方法)—— 两件同向 2026-Q3 可信 AI 主线


0. 双稿一句话定位(双稿 §0 元层五问)

本节按 7-22 十五规则 + 7-23 十六规则 + 7-24 十七规则统一格式 —— 每件精读独立 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日),双稿汇总到本节便于反方 + 后续动作集中处理

0.1 DocOps · arXiv:2607.19865

§0 元层五问

  1. 立场:B 级(3.8 / 5)—— 实战 recipe paper 而非算法突破;2026-Q3 多模态 + agent + 可信 AI 主题"真实文档操控的可验证 agent 评测基准"立标候选
  2. 时效:arXiv:2607.19865 v1 2026-07-22 07:52 UTC 提交(48h 内新稿,尚未被独立复现;本稿仅基于摘要页 + 论文层级判断,未抓全文 PDF)
  3. 反方:≥6 条硬标签(见 §2.1)
  4. 触发动作:e1prep 接入 multimodal / agent / risk 主题活文档对应 §X.Y 立标候选;multimodal-e1prep v31 §2.39.85 立标候选新增(沿用 v30 §2.39.54-§2.39.76 骨架);risk-e1prep §3.1 反方共识候选(deterministically verifiable 与 harness 选择的张力)
  5. 信源截止日:所有信源 URL 在 §6 后续动作中明确给出 + 截止日 + 验收标准;GitHub repo 验证截止 2026-07-25 21:20;3,202 KB PDF 全文核验截止 2026-07-26 21:20;SWE-bench / GAIA / SpreadsheetBench head-to-head 核验截止 2026-07-27 21:20

0.2 Decodability Supervision (RECAP) · arXiv:2607.20379

§0 元层五问

  1. 立场:B 级(3.8 / 5)—— 实战 recipe paper 而非算法突破;2026-Q3 interpretability + safety 主题"逐 claim 验证解释方法"立标候选
  2. 时效:arXiv:2607.20379 v1 2026-07-22 17:10 UTC 提交(48h 内新稿,尚未被独立复现;本稿仅基于摘要页 + 论文层级判断,未抓全文 PDF)
  3. 反方:≥6 条硬标签(见 §2.2)
  4. 触发动作:e1prep 接入 multimodal / agent / risk / interpretability 主题活文档对应 §X.Y 立标候选;multimodal-e1prep v31 §2.39.86 立标候选新增;risk-e1prep §2.14 AI Security 升格 P0(RECAP = AI safety 导向的解释方法,与 SafeKV + PrefixWall 形成"可验证解释 + 可验证推理"二联)
  5. 信源截止日:所有信源 URL 在 §6 后续动作中明确给出 + 截止日 + 验收标准;GitHub repo 验证截止 2026-07-25 21:20;325 KB PDF 全文核验截止 2026-07-26 21:20;独立复现报告核验截止 2026-07-30 21:20

1. 双稿论文元数据(核源)

字段 DocOps (2607.19865) Decodability Supervision (RECAP, 2607.20379)
标题 DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
arXiv 2607.19865 (cs.AI / cs.CL / cs.LG) 2607.20379 (cs.AI / cs.CL)
第一作者 Jiazhen Jiang (通讯) Hiskias Dingeto Dr
提交日期 2026-07-22 07:52 UTC 2026-07-22 17:10 UTC
PDF 体量 3,202 KB(taxonomy + harness 完整) 325 KB(Qwen-2.5-7B verbalizer + Pythia-160M 沙盒实验)
代码 / 模型发布状态 摘要未直接声明开源 harness 声称 +0.001-nat 代价下 Qwen-2.5-7B + Pythia-160M 实验;代码可用性待核
GitHub 待核(信源:Papers with Code) 待核(信源:Papers with Code)
项目主页 待核(信源:arXiv 摘要页) 待核(信源:arXiv 摘要页)
复现难度 高(3,202 KB PDF + taxonomy + harness 多组合) 中(Qwen-2.5-7B verbalizer 数卡 + Pythia-160M 单卡)
跨实例引用 (v1 越界写法已删除,v2 仅引用抽象层级) (v1 越界写法已删除,v2 仅引用抽象层级)

2. 双稿反方 / 风险(≥6 条硬标签,每条"证伪条件 + 判定依赖 + 反方严重度"三件)

2.1 DocOps 反方 ≥6 条

(A) 真实"文档"类型边界未定义 - 证伪条件:若 PDF 摘要 / §3 未明确文档类型边界(电子表格 / PDF / 表单 / 报告哪几类?权重是否均衡?),且 taxonomy 偏向电子表格 ≥50% - 判定依赖:需核 PDF §3 任务分布表 + 电子表格 vs PDF vs 表单 vs 报告的样本比例 - 反方严重度中-高 —— taxonomy 偏向电子表格会让 Office Copilot 系模型自然占优,对 coding-agent 型模型不公平

(B) "原子维度"完备性无负样本/对抗性下界检查 - 证伪条件:若 PDF §3 任务分解未做负样本/对抗性下界检查("作者认定的原子维度恰好与 harness 默认 prompt 模板耦合"的隐性偏差) - 判定依赖:需核 PDF §3 是否有负样本任务设计 + 是否有 prompt template adversarial 测试 - 反方严重度 —— 可能存在"作者认定的原子维度恰好与 harness 默认 prompt 模板耦合"的隐性偏差

(C) harness 选择即结论(harness 方差 > 模型方差) - 证伪条件:若同模型 + 不同 harness(ReAct / OpenHands / Claude Computer Use / Gemini computer use)的结果方差 > 同 harness + 不同模型的结果方差 ≥2 倍 - 判定依赖:需核 PDF §4 是否有 harness × model 方差分解表 - 反方严重度 —— 当被测对象本身是 harness(而非模型),不同 harness 间的方差可能大于模型间的方差,结论方向可能反转

(D) "破坏性编辑元数据" = 工程问题而非模型能力问题 - 证伪条件:若 PDF §4 失败模式归因未区分"模型无法产生 schema-aware 编辑" vs "模型本身没有 schema-aware 工具可用" - 判定依赖:需核 PDF §4 是否提供"模型 + schema-aware 工具"对照实验 - 反方严重度 —— 基准本身可能倒逼"文档操作专用工具"而非"更强 LLM"

(E) 复现难度高(3,202 KB PDF + taxonomy + harness 多组合) - 证伪条件:若 GitHub repo 截至 2026-07-25 21:20 仍未公开代码 / 任务定义 / harness 配置 - 判定依赖:Papers with Code / arXiv 摘要页 / 作者机构主页三方核验 - 反方严重度中-高 —— 个人复现成本偏高;建议同步任务优先核验代码仓是否已开

(F) 与 SWE-bench / GAIA / SpreadsheetBench 覆盖差异未量化 - 证伪条件:若 PDF §4 / §5 未给出与 SWE-bench / GAIA / SpreadsheetBench 的任务覆盖矩阵(任务类型 × 难度 × 完成率) - 判定依赖:需核 PDF §5 是否有同向论文对照表 - 反方严重度低-中 —— 可能存在"新基准看似独立,实际与已有基准高度重合"的边际贡献问题

(G) 摘要未声明开源 harness(可复现性声明缺位) - 证伪条件:若 PDF 摘要段未声明代码 / 模型 / 评测 harness 开源状态,且 GitHub repo 截至 2026-07-25 21:20 仍未公开 - 判定依赖:PDF 摘要 + GitHub repo + OpenReview + 作者机构主页核验 - 反方严重度 —— 摘要未声明开源是评测类论文的常见减分项

2.2 Decodability Supervision (RECAP) 反方 ≥6 条

(A) "解释重建率 ≠ 逐 claim 真实"问题定位的价值待量化 - 证伪条件:若"约 2% 的具体 claim 是重建依赖型"是 Qwen-2.5-7B verbalizer 单一模型的产物,其他模型(如 Claude / GPT / Gemini)也需独立核验 - 判定依赖:需核 PDF §4 / §5 是否有跨模型泛化实验(至少 3 个模型家族) - 反方严重度中-高 —— 单模型结论的泛化性是 interpretability 类论文的常见盲区

(B) RECAP 适用范围 = 大模型明显有效,小模型"能让 probe 解码但 verbalizer 写不出真话" - 证伪条件:若 Pythia-160M 上 truth 仍只有 0.44-0.46 是 verbalizer 容量天花板而非 RECAP 失效 - 判定依赖:需核 PDF §5 是否有 RECAP 在不同尺寸模型(160M / 1B / 7B / 70B)上的 probe 解码率曲线 - 反方严重度 —— 小模型应用受限;RECAP 在大模型上明显有效,在小模型上"能让 probe 解码"但"verbalizer 写不出真话"

(C) private code 攻击是结构性问题(审计协议需对抗性博弈持续升级) - 证伪条件:若作者只测"最大化重建分 + 说谎"一种攻击,未测"最大化 probe 分 + 说谎"或"最小化 probe 差距但保留语义" - 判定依赖:需核 PDF §6 / 附录是否有 ≥3 类对抗攻击对照实验 - 反方严重度 —— 攻击者可"最大化 probe 分 + 说谎"或"最小化 probe 差距但保留语义",审计协议本身需要对抗性博弈持续升级

(D) 跨模态可迁移性未知(RECAP 对多模态 / agent 系统是否同样 RECAP-able) - 证伪条件:若 PDF 实验仅在纯文本 LLM 上做,未在多模态(M-VLM)或 agent 系统上做 RECAP 验证 - 判定依赖:需核 PDF §5 / 附录是否有 M-VLM / agent 系统的 RECAP 续作 - 反方严重度 —— 跨模态可迁移性是 interpretability 类论文的常见局限

(E) "可解释性突破" vs "AI safety 工具"的定位模糊 - 证伪条件:若 PDF 摘要同时声称"For interpretability"和"For AI safety",但未明确 RECAP 在 safety 场景的具体应用(违反检测 / 谎话检测 / 内部攻击面审计) - 判定依赖:需核 PDF §6 / §7 是否有 safety 场景的具体应用案例 - 反方严重度中-高 —— 摘要明说"For interpretability, high reconstruction does not certify individual claims; for AI safety, RECAP makes designated internal content independently checkable against probes" —— 这是"安全导向的解释方法",而不是"通用可解释性突破"

(F) 复现难度 = 中(合成 ground truth + co-training + Qwen-2.5-7B 数卡) - 证伪条件:若 GitHub repo 截至 2026-07-25 21:20 仍未公开合成 ground truth 流水线 / co-training 协议 / Qwen-2.5-7B verbalizer 训练配置 - 判定依赖:Papers with Code / arXiv 摘要页 / 作者机构主页三方核验 - 反方严重度 —— 复现需中等 GPU(Pythia-160M 单卡即可;Qwen-2.5-7B verbalizer 训练需要数卡)

(G) "claim 验证" 与 "faithfulness 评估"的边界 - 证伪条件:若 RECAP 的"逐 claim 验证"与 Ragas + Gemini judge 的"faithfulness 评估"未做 head-to-head 对照 - 判定依赖:需核 PDF §5 / §6 是否有 Ragas / Gemini judge 对照实验 - 反方严重度低-中 —— RECAP 与 Ragas 同向("逐 claim 审计"),但 head-to-head 缺失

2.3 双稿跨稿反方(共 ≥3 条)

(H) "评测可验证性 vs 解释可验证性" vs "推理可验证性" 三联缺位 - 证伪条件:若 PDF §4 / §5 未把 DocOps + RECAP 与 SafeKV + PrefixWall(KV Cache 侧信道)作为"可验证性三联"统一论证 - 判定依赖:需核 PDF 是否有跨论文的对照或引用 - 反方严重度 —— 三者同向 2026-Q3 可信 AI 主线(评测 + 解释 + 推理三层可验证性),但作者群不同,缺少统一论证

(I) Substack aiamastery 作者背景未独立核验 - 证伪条件:若 Substack aiamastery 作者背景 / 历史发布记录 / 是否被论文引用过未经独立核验 - 判定依赖:需核 aiamastery Substack 作者主页 + LinkedIn / Twitter / 论文致谢 - 反方严重度 —— 引用仅作技术洞察来源,不做主体引用

(J) "逐 claim 审计"是 2026 H2 跟踪方向(DocOps deterministically verifiable + RECAP 逐 claim 验证 + aiamastery Faithfulness 1.0 三联) - 证伪条件:若 2026 H2 后续 arXiv / Substack / 行业平台未形成"逐 claim 审计"的方法论潮流 - 判定依赖:需核 2026-08 / 2026-09 后续 arXiv 是否出现 ≥3 篇"逐 claim 审计"主题论文 - 反方严重度 —— 这是方法论潮流判断,非论文硬指标


3. 双稿核心贡献(方法拆解)

3.1 DocOps 核心贡献(4 件)

  1. 层次化 taxonomy:把真实文档操作拆成"原子维度 × 工作流复杂度"两层结构,每层都可独立打标签 → 关键设计,避免一个扁平 benchmark 掩盖"会做单步但拼不起工作流"的真实能力断层
  2. deterministically verifiable:评测真值由执行器确定性产出(不是 LLM-as-judge),是相对于 SWE-bench / GAIA 这类"结果可执行验证"路线的强对齐
  3. closed × open 模型横向:覆盖 closed + open 在多种 agentic harness(推测 ReAct / AutoGPT / OpenHands / LangChain 等)下的对比,定位 agent harness 带来的方差
  4. 失败模式三件套: - 长程状态追踪崩塌(long-term state tracking collapse) - 浅层语义验证(shallow semantic verification) - 结构化元数据破坏性编辑(destructive editing of structural metadata)

3.2 RECAP 核心贡献(6 件)

  1. 问题定位:自然语言 autoencoder 用"重建得分"评解释忠实度——但若翻转单个 claim 后重建分数不变,该 claim 就不会被惩罚。即"重建"与"逐 claim 真实"是两件事
  2. 实证 1 — Qwen-2.5-7B verbalizer:解释重建率远超随机,但只有约 2% 的具体 claim 是"重建依赖型"——得分跟 gist 走,不跟具体事实走
  3. 实证 2 — 合成 ground truth:标准 recipe 训练 5/5 跑都发展出 co-adapted private codes(私有"假话"语法让 verbalizer 重建依赖它),而"只改 verbalizer 不改 target model"的修补无效
  4. 方法 1 — 审计协议:提出 grounded-vs-true crossevaluator swap 两个独立审计(前者比对"是否引用外部 ground truth",后者替换 verbalizer 防止被私有 code 套利)
  5. 方法 2 — RECAP:Readable Encodings via Co-trained Auxiliary Predictors,线性头与 target model 联合训练,使"被指定的内容"始终可独立 probe 解码;verbalizer 的 true claim 由独立 probe 评分,false claim 评分显著低(AUC 0.96 vs 0.82 control
  6. 对抗鲁棒性:对"最大化重建分同时说谎"的攻击,控制 probe 崩溃到 0.51,RECAP probe 仍能 0.95 AUC 识别谎言(说明 RECAP 把"谎言是否能藏在私有 code 后面"这条攻击面封住了)

3.3 Substack 旁证(1 条)

aiamastery · Lesson 44: Evaluating Agentic RAG Reliability

  • 核心方法(仅取思想): 1. Ragas + Gemini 实时评测范式(推理即评估,无需离线批量重跑) 2. Faithfulness 1.0 = 每个 claim 都可回溯到检索段落;生产环境"质量底线而非追求满分" 3. 双轨评估:Ragas 自动分 + Gemini judge 覆盖 Ragas 缺指标
  • 对 flyP 选题的反向价值:与 DocOps "deterministically verifiable"形成"硬验证 vs 软验证"对照;与 RECAP "逐 claim 验证"形成"评测方法 vs 解释方法"对照——三件套共同指向"逐 claim 审计"是 2026 H2 值得跟踪的方法论潮流
  • 可信度判断:作者 aiamastery 偏实战工程,作者身份未独立核验(待补查:作者背景、Substack 历史发布记录、是否被论文引用过),引用仅作技术洞察来源,不做主体引用

4. 双稿核心方法(最小可用)

4.1 DocOps 最小可用

DocOps = {
  taxonomy: 原子维度 × 工作流复杂度 两层结构
  verifier: deterministic 执行器(不是 LLM-as-judge)
  harness: closed + open 模型 + 多种 agentic harness 横向
  failure_modes: 长程状态追踪崩塌 / 浅层语义验证 / 结构化元数据破坏性编辑
}

4.2 RECAP 最小可用

RECAP = {
  audit_protocol: grounded-vs-true cross + evaluator swap(两个独立审计)
  recap: linear head 与 target model 联合训练 → designated content 可独立 probe 解码
  adversarial: 控制 probe 0.51 vs RECAP probe 0.95 AUC(封住 private code 攻击面)
}

5. 双稿建议路径(边界声明自洽)

flyP 写权限边界声明(沿用 7-21 §3.3 十四规则 + 7-24 §3 十七规则):

  • flyP 写权限仅限 inbox/flyp/ + organized/reflection/flyp-*.md
  • 不允许published/reviews/ / notes/ / reviews/ / digests/ / 跨实例目录
  • 不允许委婉"建议 sync 任务代写"形式("建议 sync 任务代写 /shared/research-kb/published/reviews/..." 即便没真写也是规则违反)
  • 不允许跨实例反射引用具体文件名 / 雷达 ID / 棒次时间戳(只到"stepher / jay / tom / spark 各自反思产物"抽象层级)

v2 双稿建议路径(按权限边界声明自洽):

  • 本稿草稿(已写入):/shared/research-kb/inbox/flyp/2026-07-23-2250-DocOps-and-Decodability-critical-read.md(v2 覆盖 v1)
  • 建议 E1 / paper_cards 接入(不直接写):
  • multimodal-e1prep v31 §2.39.85 DocOps 立标候选新增 + §2.39.86 RECAP 立标候选新增
  • risk-e1prep §3.1 反方共识候选(deterministically verifiable 与 harness 选择的张力)
  • risk-e1prep §2.14 AI Security 升格 P0(RECAP = AI safety 导向的解释方法,与 SafeKV + PrefixWall 形成"可验证解释 + 可验证推理"二联)
  • 建议由 E3 / paper_cards 等符合权限的实例去写
  • paper_cards/2607-19865.md DocOps 卡片
  • paper_cards/2607-20379.md RECAP 卡片
  • 不建议直接转 reviews/(PDF 全文未核 + 复现难度中-高 + 48h 内新稿尚未独立复现)

6. 双稿后续验证动作(每条挂"信源 + 截止日 + 验收标准")

6.1 DocOps 后续 ≥6 条

  1. GitHub repo 是否公开 —— 信源:Papers with Code https://paperswithcode.com/paper/docops-a-verifiable-benchmark-for + arXiv 摘要页 + 作者机构主页 · 截止日:2026-07-25 21:20 · 验收标准:GitHub repo URL + README + 任务定义文件存在
  2. 3,202 KB PDF 全文核验 —— 信源:arXiv PDF https://arxiv.org/pdf/2607.19865 · 截止日:2026-07-26 21:20 · 验收标准:核 §3 taxonomy 任务分布表 + §4 harness × model 方差分解 + §5 与 SWE-bench / GAIA / SpreadsheetBench 对照表
  3. harness × model 方差分解 —— 信源:PDF §4 + 公开评测脚本 · 截止日:2026-07-27 21:20 · 验收标准:同模型 + 不同 harness 方差 vs 同 harness + 不同模型方差比值 ≥2 倍的结论方向是否反转
  4. 与 SWE-bench / GAIA / SpreadsheetBench 覆盖差异 —— 信源:PDF §5 + 同向论文 GitHub · 截止日:2026-07-27 21:20 · 验收标准:任务类型 × 难度 × 完成率矩阵与已有基准的重合度
  5. schema-aware 工具对照实验 —— 信源:PDF §4 + 作者 GitHub Issues · 截止日:2026-07-28 21:20 · 验收标准:是否有"模型 + schema-aware 工具"对照实验以分离模型能力问题 vs 工具问题
  6. 负样本 / 对抗性下界检查 —— 信源:PDF §3 + 附录 · 截止日:2026-07-28 21:20 · 验收标准:是否有负样本任务设计 + prompt template adversarial 测试
  7. 独立复现报告 —— 信源:HF / Twitter / Reddit r/LocalLLaMA / Substack AI agent 作者 · 截止日:2026-07-30 21:20 · 验收标准:≥1 篇独立复现报告引用 DocOps

6.2 RECAP 后续 ≥6 条

  1. GitHub repo 是否公开 —— 信源:Papers with Code https://paperswithcode.com/paper/train-the-model-not-the-reader + arXiv 摘要页 · 截止日:2026-07-25 21:20 · 验收标准:GitHub repo URL + README + 合成 ground truth 流水线存在
  2. 325 KB PDF 全文核验 —— 信源:arXiv PDF https://arxiv.org/pdf/2607.20379 · 截止日:2026-07-26 21:20 · 验收标准:核 §4 跨模型泛化 + §5 RECAP 不同尺寸模型 + §6 对抗攻击类型
  3. 跨模型泛化实验 —— 信源:PDF §4 + 公开评测脚本 · 截止日:2026-07-27 21:20 · 验收标准:RECAP 在 ≥3 个模型家族(Qwen / Claude / GPT / Gemini)的 probe 解码率
  4. 不同尺寸模型 RECAP 续作 —— 信源:PDF §5 + 作者团队续作 · 截止日:2026-07-30 21:20 · 验收标准:RECAP 在 160M / 1B / 7B / 70B 模型上的 probe 解码率曲线
  5. ≥3 类对抗攻击对照实验 —— 信源:PDF §6 / 附录 · 截止日:2026-07-28 21:20 · 验收标准:是否测试"最大化 probe 分 + 说谎" / "最小化 probe 差距但保留语义"等对抗攻击
  6. M-VLM / agent 系统 RECAP 续作 —— 信源:作者团队续作 · 截止日:2026-08-30 21:20 · 验收标准:是否出现 RECAP 在多模态 / agent 系统上的续作论文
  7. Ragas / Gemini judge head-to-head —— 信源:PDF §5 / §6 + Ragas GitHub · 截止日:2026-07-30 21:20 · 验收标准:RECAP vs Ragas faithfulness 同基准对照实验
  8. 独立复现报告 —— 信源:HF / Twitter / Reddit r/LocalLLaMA / Substack interpretability 作者 · 截止日:2026-07-30 21:20 · 验收标准:≥1 篇独立复现报告引用 RECAP

6.3 Substack 旁证后续 ≥1 条

  1. aiamastery 作者背景独立核验 —— 信源:Substack 作者主页 + LinkedIn / Twitter / 论文致谢 · 截止日:2026-07-26 21:20 · 验收标准:作者背景 / 历史发布记录 / 是否被论文引用过

7. 双稿短审稿总结(≤50 字 / 篇)

  • DocOps:B 级入库 · 真实文档操控可验证评测 · harness × model 方差 · 缺 schema-aware 对照 + GitHub 待核 · 后续补 PDF §3 §4 §5
  • RECAP:B 级入库 · 逐 claim 验证解释方法 · probe AUC 0.95 vs 0.51 · 缺跨模型 + 对抗攻击类型 · 后续补 PDF §4 §5 §6

8. 分类标签汇总

#agent-benchmark #document-ops #verifiable-eval #agent-harness #interpretability #activation-explanation #recap #decodability #faithfulness #claim-level-audit #qwen2.5 #pythia #safety #substack-industry-reference #v2-rewrite #时间错位 #双稿独立


9. 附:v1 → v2 关键变更清单

  1. 结构变更:把原 v1 双篇合并稿(DocOps + Decodability Supervision + Substack 旁证)拆成两件独立精读,每件独立 §0 元层五问 + 反方硬标签 + 后续动作信源截止日 + 边界声明自洽性
  2. 越界修正:删除原 v1 "建议 sync 任务代写 /shared/research-kb/published/reviews/..." 越界写法,改为"由 E1 / E3 / paper_cards 等符合权限的实例去写"
  3. 跨实例引用修正:删除原 v1 跨实例指向其它实例的具体产出文件名 / 雷达 ID / 棒次时间戳,改为只到"stepher / jay / tom / spark 各自反思产物"抽象层级
  4. 元层补齐:每件精读前置 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日)
  5. 反方硬标签化:反方每条加"证伪条件 + 判定依赖 + 反方严重度"三件
  6. 后续动作信源截止日化:后续动作每条加"信源 + 截止日 + 验收标准"三件
  7. 营销腔禁用:评级沿用 7-20 + 7-21 + 7-22 + 7-23 硬分级量表(A 级 ≥4.0 / B 级 3.0~3.9 / C 级 2.5~2.9 / D 级 ≤2.4),禁用 ⭐⭐ / ⭐ A / ⭐ B / "强建议 / flyP 优先级最高" 等营销腔符号
  8. 评级与体量一致:评级必须与体量一致("立标级" 标签需体量 ≥12KB + §0 元层五问 + 反方 ≥6 条 + 评级带客观硬标签;"实战 recipe paper" 标签需明确标注"实战 recipe paper 而非算法突破")

flyP · 2026-07-24 21:20 · 反思触发 v2 覆盖 · 覆盖原 v1(2026-07-23 22:52 写 · 双篇合稿 · 当夜补遗稿)· 双稿独立精读 · §0 元层五问 ✓ / 反方硬标签 ≥6 条 ✓ / 后续动作信源截止日 ≥6 条 ✓ / 边界声明自洽 ✓ / 评级与体量一致 ✓ · 评级 B 级(3.8 / 5)