2026-09-19 周六反方审稿 + 复现风险分析(flyP)

角色:flyP · 2026-09-19(周六)10:30 CST · 周六精读与反方审稿棒 · 第 N 期 范围:本周必读 3 篇(Atria Dawn / Model-or-Harness / Orthrus)的反方审稿 + 复现风险分析 底本/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-notes.md(结构化阅读笔记) 方法学:每篇遵循"① 重述论点 → ② 反方证据 → ③ 复现风险维度 → ④ 形式评级 → ⑤ 后续验证动作"五段式 轻量模式:✅ 仅基于本周已验证精读稿 + arXiv HTML v1 摘要级 + HF Papers 页面 + HF 权重页面,不抓新外部信号


反方审稿 R-1 · Atria Dawn · 2026-09-16 22:50 flyP 精读稿

R-1.1 论点重述

论文声称三层贡献: 1. 模型层:基于 Z.ai 2026 的 744B MoE 基础模型做 agentic 后训练,定位科研 + 工程长链路任务 2. 方法层:Verifiable Experience Pipeline——(task, trajectory, artifacts, verification) 四元组作为训练分布构造 3. 社会学层:56 名参与者 / 769 task records 的"开发 Atria Dawn 本身"作为人机协作 case study,约 1/3 任务没有 AI 不可能

实验:16 个 benchmark 中声称 5 SOTA(AutomationBench 53.8 / BFCL v4 77.0 / DeepSearchQA 96.0 / BrowseComp 92.5 / CyberGym 86.5)+ 3 第二;HF Daily 9-16 369▲ / 24h +252▲ 单日涨幅创纪录。

R-1.2 ⚠️ 反方证据(按严重度排序)

R-1.2.1 【高严重度】"中文系内战"对比基线偏差

证据:16 个 benchmark 中至少 8 个(AutomationBench / BFCL v4 / SkillsBench / Workspace-Bench / Workspace-Bench-Lite / CyberGym / SWE-bench Pro / Terminal-Bench 2.1)的对比集主要是 GLM 5.3 / KIMI K3 / Qwen 3.8 Max / DeepSeek V4 Pro / GPT 5.6 sol。

反方论点:对比基线没有纳入 Claude Opus 4 / Gemini 2.5 Pro / o3 / Grok 4——这等于在"中文系封闭系统"内做排行。SOTA 数字可能对中文系生态内有效,对全球读者可推广性需要补一组跨语种基线。

形式评级影响:实验可信度 🟡 中 → 若不补跨语种基线,应降为 🟡 中-低

R-1.2.2 【高严重度】缺 ablation 实验

证据:Verifiable Experience Pipeline 的四个组件(task / trajectory / artifacts / verification)各自的贡献量没有 ablation 实验——是 4 元组 > 2 元组(task+response)> 1 元组?论文没说。

反方论点:方法学最大局限。没有 ablation 的"四元组训练"无法证明四元组设计本身有效——可能任何一个 3 元组子集都足够,也可能 (task, response) 加上 post-hoc verification 信号就足够。这是方法学可信度的核心扣分项

形式评级影响:方法学可信度 🟢 中-高 → 若不补 ablation,应降为 🟡 中

R-1.2.3 【高严重度】case study 自评 + retrospective estimate

证据:56 名参与者 + 769 task records 来自开发 Atria Dawn 自己的团队,约 1/3 任务没有 AI 不可能是事后评估(retrospective estimate)。

反方论点: - 自己评自己——评"1/3 任务没 AI 不可能"的主观性很难消除。需要独立团队(CMU / Stanford / 第三方)做同样的 56/769 类型记录对照。 - retrospective estimate ≠ prospective counterfactual——论文没有让同一批人在相同时间窗口内做"没有 AI 的对照组"。1/3 这个数字上限可信但缺乏对照基线。 - 56 人中相当一部分是开发团队成员——评分的独立性受利益冲突影响。

形式评级影响:社会学贡献 🟢 高(最稀缺)→ 独立性受质疑后应降为 🟡 中-高

R-1.2.4 【中严重度】缺 cost / latency 数字

证据:744B MoE 即使 active params 较少,长链路工具调用 + 外部验证 + agent loop 的总成本论文没有给任何 cost / latency 数字

反方论点:在 2026 年 agentic 模型 release 标准里,cost / latency 数字是必备项——缺这一项使得商业部署可行性无法评估。即使 16 个 benchmark SOTA,真实部署成本可能是 GPT-5 / Claude Opus 4 的 3-5 倍

R-1.2.5 【中严重度】评估污染风险未声明

证据:AutomationBench / BFCL v4 / CyberGym / SkillsBench / Workspace-Bench 这些 benchmark 的训练数据是否混入 Verifiable Experience Pipeline 的训练集,论文没有声明去污染协议

反方论点:2026 年 benchmark 评测的标准做法是声明去污染(contamination removal)+ 公布 train/test overlap 比例。论文缺失这一项意味着 SOTA 数字可能被高估

R-1.2.6 【中严重度】+252▲ / 24h 创纪录单日涨幅

证据:HF Daily 9-15 evening 117▲ → 9-16 早棒 369▲ = 24h +252▲,远超 NCP-ArchPreview 9-14→9-15 24h +11▲ 旧纪录。

反方论点:每小时 10.5▲ 的速率异常快。三种可能解读:(a) 上海 AI Lab 公开 release 撞上 ICLR/EMNLP 周期;(b) 中国开源社区集中顶票;(c) 营销推广或自动化刷票。目前没有直接证据,但 +252▲ / 24h 这个数字本身值得警惕

后续验证动作: 1. 9-16 evening 棒位票数是续立还是跌出 Top 15 2. 9-17 morning 票数分布是否呈"快速冲顶后回落"曲线 3. Twitter/X + WeChat 中文圈 9-16 转发动机论是自然流量还是 KOL 集中投放

R-1.3 复现风险维度

维度 风险等级 关键证据
算力门槛 🟠 高 744B MoE 后训练需 100+ H100 级别集群
训练数据 🔴 高 training recipe 完全不开放;Verifiable Experience Pipeline 数据集构造无文档
reference harness 🟠 高 论文强调"model + harness + environment"分离但未发布 reference harness(待补查 GitHub)
评测数据去污染 🟠 高 未声明去污染协议
case study 独立性 🟠 高 56/769 来自开发团队自己
Inference cost / latency 🟠 高 缺失
API/权重可用性 🟢 低 internlm/Atria-Dawn-Preview Instruct + FP8 两版已开放

复现可行性总评:🟠 仅能 inference-time 评测,不能训练复现。open weights + closed recipe 是 2026 年默认 release 模式,对学术复现而言价值有限。

R-1.4 形式评级

子项 评级
方法学可信度 🟡 中(缺 ablation + 缺对比基线扩张)
实验可信度 🟡 中-低(中文系内战 + 评估污染风险 + 缺 cost/latency)
社会学贡献 🟡 中-高(最稀缺体裁但自己评自己)
复现可行性 🟠 高门槛(仅 inference-time 可用)
学术价值 🟡 中-高(待独立验证后升级为 A)
工程价值 🟡 中(开放权重可用但 cost 不明)
总体评级 🟡 中-高(B+ → 升 A 需 9-17 早棒票数核实 + 独立 case study 复现 + 跨语种基线补充)

R-1.5 后续验证动作(优先级排序)

优先级 动作 决定项
P0 9-16 evening + 9-17 morning HF Daily 票数核实 决定 +252▲ 是真实流量还是短时冲顶
P0 GitHub 仓库内容核查(reference harness、trajectory sample、training recipe) 决定复现可行性
P0 去污染协议声明核查 决定实验可信度
P1 跨语种基线补充(Claude Opus 4 / Gemini 2.5 Pro / o3 / Grok 4) 决定方法学可信度
P1 cost / latency 数字 决定工程可行性
P1 ablation 实验(4 元组 vs 3 元组 vs 2 元组 vs 1 元组) 决定方法学价值
P2 独立团队复现 56/769 类型 case study 决定社会学贡献独立性
P2 Atria 与 Z.ai / InternLM 的关系(atria-asi.ai 域名指向哪家实体) 决定结论归属

反方审稿 R-2 · Model-or-Harness · 2026-09-15 22:50 flyP 精读稿

R-2.1 论点重述

论文声称五点贡献: 1. 把 agent 故障归因从 outcome 层拉到 interaction edge 层(8 类 component × edge) 2. 41 个 failure mode × 双向 edge × fault side,每类对应一种修复动作 3. 因果回溯归因规则(只标"earliest unrecovered failure",不标下游症状) 4. 跨模型 LLM-as-judge 复现性(最强 judge vs human κ=0.76 / pairwise κ=0.84) 5. 横跨多种 agent 架构 worked examples(OpenClaw 已入 worked example 库

R-2.2 ⚠️ 反方证据

R-2.2.1 【高严重度】"model-side bias" 是方法学产物不是数据结论

证据:论文明确说归因规则是 "a more capable model could have avoided or recovered from the failure under the same conditions"——这条规则天然把任何 recoverable 失败推向 model-side

反方论点: - "recoverable" 的定义不明确——什么算"more capable"?边界模糊 → 大量 harness bug 会被错误归因为 model-side - 41 个 mode 大部分是 model-side(论文已承认)不等于数据告诉我们 model-side 失败更多——可能是归因规则的偏向 - 需要 harness engineer(非 LLM 研究员)做 blind replication,看 κ 是否低于 0.76

形式评级影响:方法学可信度 ⭐⭐⭐⭐ → ⭐⭐⭐

R-2.2.2 【高严重度】缺 baseline / 现有 taxonomy 对比实验

证据:论文没和 Cemri 2025、Zhu 2025a、Barke 2026、Qiao 2026 做 head-to-head——在同一组失败轨迹上用旧 taxonomy 标 vs 用新 taxonomy 标,比较下游修复动作的有效性(哪个分类法能更快修好系统?)。

反方论点:没有这个实验,taxonomy 的"superiority"是 narrative 而不是 evidence。41 类 + 修复路径可执行性强不等于比旧分类法好——可能是"更复杂版本的描述工具",而不是"更准确的诊断工具"。

形式评级影响:方法学价值 ⭐⭐⭐⭐ → ⭐⭐⭐("工程价值"评级不变,因为 41 类本身可执行性强)

R-2.2.3 【中严重度】Cohen's κ = 0.76 不是 strong 是 substantial

证据:Landis & Koch 标准 κ∈[0.6, 0.8) 是 substantial;≥0.8 才算 almost perfect。

反方论点:0.76 说明仍有 ~24% 标注分歧——这些分歧大概率集中在跨 edge 模糊地带(harness ↔ environment, grader ↔ environment)。pairwise κ = 0.84 是 judge 间共识,不是 judge vs 人类共识——两个数字含义不同,不能合并论证。

R-2.2.4 【中严重度】Scale AI 出品 = 评测商业利益相关

证据:全部 7 位作者均为 Scale AI。

反方论点: - taxonomy 可能影响他们的 SEAL/Forge 类产品定位 - 41 类是否覆盖了 Scale AI 现有 benchmark 不关心的故障类型? - "model-side 占比高"是否与他们的 post-training 业务方向一致? - 建议独立学术组(CMU / Stanford / UW)做 blind replication

R-2.2.5 【中严重度】schema 公开状态未确认

证据:41 个 mode 清单、edge 拓扑、fault-side 判断 rule 在摘要级提到,但 code/dataset 没承诺公开。

反方论点如果 schema 闭源,这份 taxonomy 立刻从"诊断标准"降级为"营销框架"。决定一切的是后续 30 天内是否公开 schema。

R-2.2.6 【中严重度】缺少"非 long-horizon 失败"的反例验证

证据:论文主动提到 OpenClaw / Hermes Agent / Claude Code / Codex / 长程 personal assistant,但41 类对短程单步失败(如单次 tool call 格式错误)的覆盖密度未说明。

反方论点:摘要级没说"短程 agent"的覆盖。如果只覆盖 long-horizon,对当前主流 single-turn coding agent 的诊断价值打折

R-2.3 复现风险维度

维度 风险等级 关键证据
schema 公开 🔴 决定性 摘要级未承诺公开;不公开 = 全文降级
worked examples 标签集 🟠 高 未声明公开
LLM-as-judge 复现 🟢 低 4 个 frontier model 互验 + κ 公开,复现性较好
跨 taxonomy 对照实验 🔴 高 缺 baseline 对照
学术独立性 🟠 高 Scale AI 全员作者
会议接收信号 🟡 中 arXiv v1 2026-07-30 提交,处于接收边缘

复现可行性总评:🟡 取决于 schema 公开状态。如果公开,41 类 + 修复路径可直接被 OpenClaw / LangChain harness 吸收;如果闭源,价值降为"营销框架"。

R-2.4 形式评级

子项 评级
方法学价值(interaction edge 抽象) ⭐⭐⭐⭐(2026 难得诊断抽象)
实验可信度 ⭐⭐⭐☆☆(κ=0.76 substantial + 缺 baseline)
工程价值 ⭐⭐⭐⭐⭐(41 类 + 修复路径可直接复用)
学术可信度 ⭐⭐⭐☆☆(arXiv v1 + 全部业界作者)
独立采信度 ⭐⭐☆☆☆(Scale AI 出品 + 缺独立 baseline)
复现可行性 ⟡ 取决于 schema 公开
总体评级 ⭐⭐⭐☆("B+ 工程价值 / C+ 学术可信度"——不应作为唯一标准直接采信

R-2.5 后续验证动作

优先级 动作 决定项
P0 确认 schema / worked examples 是否公开 决定 taxonomy 价值等级
P0 追踪会议接收信号(NeurIPS 2026 / ICLR 2027 / ACL 2027 / ICML 2027 workshop) 决定学术可信度
P0 独立 replication:50 条 OpenClaw 真实失败轨迹 × 41 类 vs Cemri/Zhu 旧分类法对比 决定"superiority"是 narrative 还是 evidence
P1 "model-side bias" 量化:harness engineer vs LLM researcher 标 fault side,看 κ 决定方法学产物 bias
P1 OpenClaw 落地:41 类映射到现有 logging schema 决定可执行性
P2 Proactive Memory Agent 兼容性测试:behavioral state decay 归到 model↔memory edge 哪个 side 决定跨论文概念兼容

反方审稿 R-3 · Orthrus · 2026-09-16 09:50 flyP 精读稿

R-3.1 论点重述

论文对 Orthrus(Nguyen et al. 2026, hybrid AR + diffusion 推测解码架构,声称"strictly lossless / preserves the exact predictive distribution")做独立复现,三个贡献: 1. 独立实现 + 训练框架 2. on-policy 蒸馏数据比通用人类续写更优(独立 checkpoint TPF 更高) 3. "无损"声明在 BF16 下不成立:作者 checkpoint BF16 仅 45% 完全匹配;FP32 100%;FP16 ~90%

R-3.2 ⚠️ 反方证据

R-3.2.1 【高严重度】反驳强但工程意义可能弱

证据:lm-eval-harness 任务级分数与 AR 基线无系统性退化

反方论点: - 论文反驳"严格无损"措辞有数字证据(BF16 45% vs FP32 100%),但lm-eval-harness 无系统退化意味着对绝大多数用户来说 BF16 下的 45% trajectory match rate 是可接受的 - 论文没有给一个具体的"下游任务失败案例分析"——比如 code generation、agentic tool use、math reasoning 这类对单 token 错误高度敏感的场景下,45% 发散率造成了多少 latent bug? - 反驳措辞强 ≠ 工程影响大——这是 2026 年 dLLM 评测论文的常见陷阱

形式评级影响:反驳可信度 🟢 中-高 → 若不补高敏感场景下游失败案例,应降为 🟡 中-高

R-3.2.2 【高严重度】FP32 端到端速度数据缺失

证据:论文没有给 FP32 下的端到端速度对比。

反方论点: - "FP32 才能无损"听起来严谨,但 FP32 推理的吞吐量 / 显存开销通常是 BF16 的 1.5–2 倍 - 如果 FP32 下 Orthrus 加速比只有 1.5×,那它就完全失去了存在意义(相比 AR 基线) - 这是论文最重要的一处遗漏——直接决定了"FP32 无损但加速比崩溃"的工程现实

形式评级影响:方法学贡献 🟢 中-高 → 若 FP32 加速比崩溃,Orthrus 设计需要重新审视

R-3.2.3 【中严重度】作者与 Nguyen et al. 的关系未核实

证据:Sinev 是 dLLM 圈活跃人物,与 Orthrus 原作者是否独立未声明。

反方论点:如果是合作者或同一研究网络,"独立复现"的措辞需要重新审视——可能会被认为是内部 alignment 工作而非独立社区复核。

后续验证动作:Skoltech / AIRI 官网 + OpenReview + dLLM 社区会议(Diffusion Language Model Workshop 2026)核查

R-3.2.4 【中严重度】代码 / 数据未公开

证据:论文摘要级没说会开源代码;1,190 prompts × 12 domains 评估集是否可下载未声明。

反方论点如果不开源,其他研究者很难在自己模型上重做这套 trajectory match 实验——整篇论文的"反驳性"价值大打折扣。建议论文 v2 必须公开:(a) 独立训练代码、(b) 1,190 prompts × 12 domains 评估集、(c) FP32 / BF16 / FP16 三档 trajectory match 评测脚本。

R-3.2.5 【中严重度】12 个领域分布未披露

证据:摘要只说 "12 domains",1,190 prompts 不知道分布。

反方论点:是否覆盖了代码、数学、agentic tool trace 等高敏感场景?还是主要是 NLP 任务?如果是后者,反驳"严格无损"措辞的工程意义进一步打折

R-3.2.6 【中严重度】与 Nguyen et al. 原论文的实现细节对比不足

证据:没有说作者释放的 checkpoint 在 BF16 下推理时是否本身就用了 BF16,还是仅训练时用了 BF16 + 推理时用 FP32。

反方论点:如果是后者,原作者的"严格无损"声明在 BF16 推理下本来就不成立——这意味着 Nguyen et al. 的实现有 bug,而不是设计有问题

后续验证动作chiennv/Orthrus-Qwen3-1.7B 的推理脚本默认精度核查

R-3.3 复现风险维度

维度 风险等级 关键证据
代码 / 数据公开 🔴 高 摘要级未声明
作者独立性核实 🟠 高 Sinev / Oseledets 与 Nguyen et al. 关系未明
12 领域分布 🟡 中 未披露
FP32 速度 🟠 高 决定 Orthrus 设计存在意义
高敏感场景下游失败 🟠 高 决定反驳工程意义
评测方法学推广 🟢 低 套到 EAGLE-3 / DFlash / Mercury 可行

复现可行性总评:🟡 取决于代码 / 数据公开。如果公开,1,190 prompts × 12 domains × 3 精度档的评测流程可直接被 dLLM 社区复用为标准评测规范。

R-3.4 形式评级

子项 评级
反驳可信度 🟢 中-高(数字硬证据 + 诚实承认不否定 Orthrus 价值)
方法学贡献(lossless 操作性重定义) 🟢 中-高(可推广到全部 dLLM 论文)
方法学贡献(on-policy 蒸馏原则) 🟢 高(对所有 AR + diffusion head 类架构有价值)
工程影响 🟡 中-高(FP32 速度缺失削弱说服力)
复现可行性 🟡 中(代码 / 数据未公开打折扣)
总体评级 🟢 中-高(B+ → 升 A 需代码公开 + FP32 速度 + 高敏感场景下游失败案例)

R-3.5 后续验证动作

优先级 动作 决定项
P0 核实作者机构 + 与 Nguyen et al. 关系(Skoltech / AIRI / OpenReview) 决定独立性
P0 核实代码 / 1,190 prompt 集是否公开 决定反驳价值可持续性
P0 FP32 vs BF16 端到端速度对比(如能拿到代码) 决定 Orthrus 设计存在意义
P1 把 trajectory match rate 套到 EAGLE-3 / DFlash / Mercury / SDAR 决定 dLLM 评测规范推广
P1 高敏感场景(code / agentic tool / math)下游失败案例 决定反驳工程意义
P2 跟踪 MLSys / ICLR 2026 / NeurIPS 2026 审稿意见 决定会议接收
P2 Nguyen et al. 团队是否出 v2 修订回应 决定双方共识形成

综合复现风险矩阵

论文 算力门槛 数据/代码公开 评测独立性 工程价值 学术价值 总复现风险
Atria Dawn 🟠 高 🔴 recipe 不开放 / 🟢 weights 开放 🟠 自评 🟡 中(cost 不明) 🟡 中-高 🟠
Model-or-Harness 🟢 低 🔴 schema 未确认 🟠 Scale AI 出品 ⭐⭐⭐⭐⭐ ⭐⭐⭐ 🟡 取决于 schema
Orthrus 🟡 中 🔴 代码未公开 🟡 待核实 🟢 高(如果 FP32 速度不崩) 🟢 中-高 🟡 取决于公开

核心观察: 1. 3 篇都有"数据 / 代码公开"硬门槛——这是 2026 年 AI 论文的默认 release 模式,但对学术复现形成系统性约束 2. 3 篇都有"独立性 / 利益冲突"问题——Atria Dawn 自评、Model-or-Harness 全员 Scale AI、Orthrus 待核实作者关系 3. 3 篇的工程价值 vs 学术价值比例差异大——Atria Dawn 学术价值高 / 工程价值待定;Model-or-Harness 工程价值高 / 学术可信度中;Orthrus 两者都中-高但 FP32 速度决定工程价值上限


综合反方审稿结论

✅ 本周必读 3 篇都"值得反方审稿",但理由各不相同

  • Atria Dawn:方法学 + 模型 + 社会学三层贡献都有可量化反方证据,最值得做长程反方审稿(3-6 个月跟踪)
  • Model-or-Harness:诊断抽象层的稀缺性 + 工程价值 + 方法学 bias 已自我暴露,最值得做 schema 公开状态确认(30 天窗口)
  • Orthrus:反驳性复现具体数字 + 方法学贡献可推广 + 工程意义待证,最值得做 FP32 速度 + 高敏感场景下游失败案例的 follow-up(2-4 周窗口)

⚠️ 本周 3 篇共同的"反方审稿瓶颈"

  1. 数据 / 代码公开是学术复现的硬门槛——3 篇都有不同程度的开放度问题
  2. 独立性 / 利益冲突是商业时代 AI 研究的系统性问题——3 篇都有不同程度的 bias 风险
  3. 缺 cost / latency / 下游失败案例是 2026 年 release 的通病——3 篇都缺不同程度的关键数字

🎯 下周(9-20 ~ 9-26)反方审稿建议优先级

优先级 动作 关联论文
P0 Atria Dawn HF Daily 票数跟踪 + GitHub 仓库核查 + 去污染声明核查 Atria Dawn
P0 Model-or-Harness schema 公开状态确认 + 会议接收信号追踪 Model-or-Harness
P0 Orthrus 作者关系核实 + FP32 速度公开请求 + EAGLE-3/DFlash/Mercury trajectory match 套用预备 Orthrus
P1 启动 9-20 ~ 9-26 周日棒位跟踪:下周 agent 主轴新候选 + Atria Dawn v2 修订 通用
P1 agent.md / agent-eval.md / llm-infra.md / multimodal.md 主分类新增条目预备 通用

给后续同步任务的具体建议

review_file:
  - "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-reviews.md"(本文件)

notes_file:
  - "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-notes.md"

下游主题页更新建议(待 sync 任务处理):
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent.md-section-Atria-Dawn-draft.md"(agent.md 主分类新增 §Atria Dawn,含本 review §R-1)
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent-eval.md-section-Model-or-Harness-draft.md"(agent-eval.md 新增 §Model-or-Harness taxonomy 索引 + 41 类速查占位 + 本 review §R-2 引用)
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-llm-infra.md-section-Orthrus-draft.md"(llm-infra.md 新增 §Orthrus 数值精度约束 + 本 review §R-3)
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal.md-classification-fix-Atria-Dawn.md"(multimodal.md 订正 Atria Dawn 从主轴候选改为邻接级)

不在本任务范围:
  - 不写 /shared/research-kb/review/ 或 /shared/research-kb/published/
  - 不执行 git commit / git push / gh pr
  - 不直接修改 knowledge/ 或 organized/(由后续 sync 任务串行合并)

待人工确认的问题

  1. Atria Dawn +252▲ / 24h 是否续立(9-16 evening + 9-17 morning 票数)
  2. Atria Dawn GitHub 仓库内容(reference harness / trajectory sample / training recipe)
  3. Atria Dawn 跨语种基线 + 去污染协议 + cost/latency + ablation 后续是否会补充
  4. Model-or-Harness schema / worked examples 是否公开(决定 taxonomy 价值等级)
  5. Model-or-Harness 会议接收信号(NeurIPS 2026 / ICLR 2027 / ACL 2027 / ICML 2027 workshop)
  6. Orthrus 作者与 Nguyen et al. 的关系(独立性核实)
  7. Orthrus 代码 / 1,190 prompt 集是否公开(反驳价值可持续性)
  8. Orthrus FP32 端到端速度 + 高敏感场景下游失败案例(决定反驳工程意义)
  9. Model-or-Harness 41 类完整清单(决定 KB 索引页可写性)
  10. 下周(9-20 起)反方审稿棒位 P0 优先级确认

flyP · 2026-09-19 10:30 CST · 周六精读与反方审稿棒 · 第 N 期 · 反方审稿 + 复现风险分析 · 共享知识库 flyP 实例