2026-09-19 周六反方审稿 + 复现风险分析(flyP)
角色:flyP · 2026-09-19(周六)10:30 CST · 周六精读与反方审稿棒 · 第 N 期 范围:本周必读 3 篇(Atria Dawn / Model-or-Harness / Orthrus)的反方审稿 + 复现风险分析 底本:
/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-notes.md(结构化阅读笔记) 方法学:每篇遵循"① 重述论点 → ② 反方证据 → ③ 复现风险维度 → ④ 形式评级 → ⑤ 后续验证动作"五段式 轻量模式:✅ 仅基于本周已验证精读稿 + arXiv HTML v1 摘要级 + HF Papers 页面 + HF 权重页面,不抓新外部信号
反方审稿 R-1 · Atria Dawn · 2026-09-16 22:50 flyP 精读稿
R-1.1 论点重述
论文声称三层贡献: 1. 模型层:基于 Z.ai 2026 的 744B MoE 基础模型做 agentic 后训练,定位科研 + 工程长链路任务 2. 方法层:Verifiable Experience Pipeline——(task, trajectory, artifacts, verification) 四元组作为训练分布构造 3. 社会学层:56 名参与者 / 769 task records 的"开发 Atria Dawn 本身"作为人机协作 case study,约 1/3 任务没有 AI 不可能
实验:16 个 benchmark 中声称 5 SOTA(AutomationBench 53.8 / BFCL v4 77.0 / DeepSearchQA 96.0 / BrowseComp 92.5 / CyberGym 86.5)+ 3 第二;HF Daily 9-16 369▲ / 24h +252▲ 单日涨幅创纪录。
R-1.2 ⚠️ 反方证据(按严重度排序)
R-1.2.1 【高严重度】"中文系内战"对比基线偏差
证据:16 个 benchmark 中至少 8 个(AutomationBench / BFCL v4 / SkillsBench / Workspace-Bench / Workspace-Bench-Lite / CyberGym / SWE-bench Pro / Terminal-Bench 2.1)的对比集主要是 GLM 5.3 / KIMI K3 / Qwen 3.8 Max / DeepSeek V4 Pro / GPT 5.6 sol。
反方论点:对比基线没有纳入 Claude Opus 4 / Gemini 2.5 Pro / o3 / Grok 4——这等于在"中文系封闭系统"内做排行。SOTA 数字可能对中文系生态内有效,对全球读者可推广性需要补一组跨语种基线。
形式评级影响:实验可信度 🟡 中 → 若不补跨语种基线,应降为 🟡 中-低。
R-1.2.2 【高严重度】缺 ablation 实验
证据:Verifiable Experience Pipeline 的四个组件(task / trajectory / artifacts / verification)各自的贡献量没有 ablation 实验——是 4 元组 > 2 元组(task+response)> 1 元组?论文没说。
反方论点:方法学最大局限。没有 ablation 的"四元组训练"无法证明四元组设计本身有效——可能任何一个 3 元组子集都足够,也可能 (task, response) 加上 post-hoc verification 信号就足够。这是方法学可信度的核心扣分项。
形式评级影响:方法学可信度 🟢 中-高 → 若不补 ablation,应降为 🟡 中。
R-1.2.3 【高严重度】case study 自评 + retrospective estimate
证据:56 名参与者 + 769 task records 来自开发 Atria Dawn 自己的团队,约 1/3 任务没有 AI 不可能是事后评估(retrospective estimate)。
反方论点: - 自己评自己——评"1/3 任务没 AI 不可能"的主观性很难消除。需要独立团队(CMU / Stanford / 第三方)做同样的 56/769 类型记录对照。 - retrospective estimate ≠ prospective counterfactual——论文没有让同一批人在相同时间窗口内做"没有 AI 的对照组"。1/3 这个数字上限可信但缺乏对照基线。 - 56 人中相当一部分是开发团队成员——评分的独立性受利益冲突影响。
形式评级影响:社会学贡献 🟢 高(最稀缺)→ 独立性受质疑后应降为 🟡 中-高。
R-1.2.4 【中严重度】缺 cost / latency 数字
证据:744B MoE 即使 active params 较少,长链路工具调用 + 外部验证 + agent loop 的总成本论文没有给任何 cost / latency 数字。
反方论点:在 2026 年 agentic 模型 release 标准里,cost / latency 数字是必备项——缺这一项使得商业部署可行性无法评估。即使 16 个 benchmark SOTA,真实部署成本可能是 GPT-5 / Claude Opus 4 的 3-5 倍。
R-1.2.5 【中严重度】评估污染风险未声明
证据:AutomationBench / BFCL v4 / CyberGym / SkillsBench / Workspace-Bench 这些 benchmark 的训练数据是否混入 Verifiable Experience Pipeline 的训练集,论文没有声明去污染协议。
反方论点:2026 年 benchmark 评测的标准做法是声明去污染(contamination removal)+ 公布 train/test overlap 比例。论文缺失这一项意味着 SOTA 数字可能被高估。
R-1.2.6 【中严重度】+252▲ / 24h 创纪录单日涨幅
证据:HF Daily 9-15 evening 117▲ → 9-16 早棒 369▲ = 24h +252▲,远超 NCP-ArchPreview 9-14→9-15 24h +11▲ 旧纪录。
反方论点:每小时 10.5▲ 的速率异常快。三种可能解读:(a) 上海 AI Lab 公开 release 撞上 ICLR/EMNLP 周期;(b) 中国开源社区集中顶票;(c) 营销推广或自动化刷票。目前没有直接证据,但 +252▲ / 24h 这个数字本身值得警惕。
后续验证动作: 1. 9-16 evening 棒位票数是续立还是跌出 Top 15 2. 9-17 morning 票数分布是否呈"快速冲顶后回落"曲线 3. Twitter/X + WeChat 中文圈 9-16 转发动机论是自然流量还是 KOL 集中投放
R-1.3 复现风险维度
| 维度 | 风险等级 | 关键证据 |
|---|---|---|
| 算力门槛 | 🟠 高 | 744B MoE 后训练需 100+ H100 级别集群 |
| 训练数据 | 🔴 高 | training recipe 完全不开放;Verifiable Experience Pipeline 数据集构造无文档 |
| reference harness | 🟠 高 | 论文强调"model + harness + environment"分离但未发布 reference harness(待补查 GitHub) |
| 评测数据去污染 | 🟠 高 | 未声明去污染协议 |
| case study 独立性 | 🟠 高 | 56/769 来自开发团队自己 |
| Inference cost / latency | 🟠 高 | 缺失 |
| API/权重可用性 | 🟢 低 | internlm/Atria-Dawn-Preview Instruct + FP8 两版已开放 |
复现可行性总评:🟠 仅能 inference-time 评测,不能训练复现。open weights + closed recipe 是 2026 年默认 release 模式,对学术复现而言价值有限。
R-1.4 形式评级
| 子项 | 评级 |
|---|---|
| 方法学可信度 | 🟡 中(缺 ablation + 缺对比基线扩张) |
| 实验可信度 | 🟡 中-低(中文系内战 + 评估污染风险 + 缺 cost/latency) |
| 社会学贡献 | 🟡 中-高(最稀缺体裁但自己评自己) |
| 复现可行性 | 🟠 高门槛(仅 inference-time 可用) |
| 学术价值 | 🟡 中-高(待独立验证后升级为 A) |
| 工程价值 | 🟡 中(开放权重可用但 cost 不明) |
| 总体评级 | 🟡 中-高(B+ → 升 A 需 9-17 早棒票数核实 + 独立 case study 复现 + 跨语种基线补充) |
R-1.5 后续验证动作(优先级排序)
| 优先级 | 动作 | 决定项 |
|---|---|---|
| P0 | 9-16 evening + 9-17 morning HF Daily 票数核实 | 决定 +252▲ 是真实流量还是短时冲顶 |
| P0 | GitHub 仓库内容核查(reference harness、trajectory sample、training recipe) | 决定复现可行性 |
| P0 | 去污染协议声明核查 | 决定实验可信度 |
| P1 | 跨语种基线补充(Claude Opus 4 / Gemini 2.5 Pro / o3 / Grok 4) | 决定方法学可信度 |
| P1 | cost / latency 数字 | 决定工程可行性 |
| P1 | ablation 实验(4 元组 vs 3 元组 vs 2 元组 vs 1 元组) | 决定方法学价值 |
| P2 | 独立团队复现 56/769 类型 case study | 决定社会学贡献独立性 |
| P2 | Atria 与 Z.ai / InternLM 的关系(atria-asi.ai 域名指向哪家实体) | 决定结论归属 |
反方审稿 R-2 · Model-or-Harness · 2026-09-15 22:50 flyP 精读稿
R-2.1 论点重述
论文声称五点贡献: 1. 把 agent 故障归因从 outcome 层拉到 interaction edge 层(8 类 component × edge) 2. 41 个 failure mode × 双向 edge × fault side,每类对应一种修复动作 3. 因果回溯归因规则(只标"earliest unrecovered failure",不标下游症状) 4. 跨模型 LLM-as-judge 复现性(最强 judge vs human κ=0.76 / pairwise κ=0.84) 5. 横跨多种 agent 架构 worked examples(OpenClaw 已入 worked example 库)
R-2.2 ⚠️ 反方证据
R-2.2.1 【高严重度】"model-side bias" 是方法学产物不是数据结论
证据:论文明确说归因规则是 "a more capable model could have avoided or recovered from the failure under the same conditions"——这条规则天然把任何 recoverable 失败推向 model-side。
反方论点: - "recoverable" 的定义不明确——什么算"more capable"?边界模糊 → 大量 harness bug 会被错误归因为 model-side - 41 个 mode 大部分是 model-side(论文已承认)不等于数据告诉我们 model-side 失败更多——可能是归因规则的偏向 - 需要 harness engineer(非 LLM 研究员)做 blind replication,看 κ 是否低于 0.76
形式评级影响:方法学可信度 ⭐⭐⭐⭐ → ⭐⭐⭐
R-2.2.2 【高严重度】缺 baseline / 现有 taxonomy 对比实验
证据:论文没和 Cemri 2025、Zhu 2025a、Barke 2026、Qiao 2026 做 head-to-head——在同一组失败轨迹上用旧 taxonomy 标 vs 用新 taxonomy 标,比较下游修复动作的有效性(哪个分类法能更快修好系统?)。
反方论点:没有这个实验,taxonomy 的"superiority"是 narrative 而不是 evidence。41 类 + 修复路径可执行性强不等于比旧分类法好——可能是"更复杂版本的描述工具",而不是"更准确的诊断工具"。
形式评级影响:方法学价值 ⭐⭐⭐⭐ → ⭐⭐⭐("工程价值"评级不变,因为 41 类本身可执行性强)
R-2.2.3 【中严重度】Cohen's κ = 0.76 不是 strong 是 substantial
证据:Landis & Koch 标准 κ∈[0.6, 0.8) 是 substantial;≥0.8 才算 almost perfect。
反方论点:0.76 说明仍有 ~24% 标注分歧——这些分歧大概率集中在跨 edge 模糊地带(harness ↔ environment, grader ↔ environment)。pairwise κ = 0.84 是 judge 间共识,不是 judge vs 人类共识——两个数字含义不同,不能合并论证。
R-2.2.4 【中严重度】Scale AI 出品 = 评测商业利益相关
证据:全部 7 位作者均为 Scale AI。
反方论点: - taxonomy 可能影响他们的 SEAL/Forge 类产品定位 - 41 类是否覆盖了 Scale AI 现有 benchmark 不关心的故障类型? - "model-side 占比高"是否与他们的 post-training 业务方向一致? - 建议独立学术组(CMU / Stanford / UW)做 blind replication
R-2.2.5 【中严重度】schema 公开状态未确认
证据:41 个 mode 清单、edge 拓扑、fault-side 判断 rule 在摘要级提到,但 code/dataset 没承诺公开。
反方论点:如果 schema 闭源,这份 taxonomy 立刻从"诊断标准"降级为"营销框架"。决定一切的是后续 30 天内是否公开 schema。
R-2.2.6 【中严重度】缺少"非 long-horizon 失败"的反例验证
证据:论文主动提到 OpenClaw / Hermes Agent / Claude Code / Codex / 长程 personal assistant,但41 类对短程单步失败(如单次 tool call 格式错误)的覆盖密度未说明。
反方论点:摘要级没说"短程 agent"的覆盖。如果只覆盖 long-horizon,对当前主流 single-turn coding agent 的诊断价值打折。
R-2.3 复现风险维度
| 维度 | 风险等级 | 关键证据 |
|---|---|---|
| schema 公开 | 🔴 决定性 | 摘要级未承诺公开;不公开 = 全文降级 |
| worked examples 标签集 | 🟠 高 | 未声明公开 |
| LLM-as-judge 复现 | 🟢 低 | 4 个 frontier model 互验 + κ 公开,复现性较好 |
| 跨 taxonomy 对照实验 | 🔴 高 | 缺 baseline 对照 |
| 学术独立性 | 🟠 高 | Scale AI 全员作者 |
| 会议接收信号 | 🟡 中 | arXiv v1 2026-07-30 提交,处于接收边缘 |
复现可行性总评:🟡 取决于 schema 公开状态。如果公开,41 类 + 修复路径可直接被 OpenClaw / LangChain harness 吸收;如果闭源,价值降为"营销框架"。
R-2.4 形式评级
| 子项 | 评级 |
|---|---|
| 方法学价值(interaction edge 抽象) | ⭐⭐⭐⭐(2026 难得诊断抽象) |
| 实验可信度 | ⭐⭐⭐☆☆(κ=0.76 substantial + 缺 baseline) |
| 工程价值 | ⭐⭐⭐⭐⭐(41 类 + 修复路径可直接复用) |
| 学术可信度 | ⭐⭐⭐☆☆(arXiv v1 + 全部业界作者) |
| 独立采信度 | ⭐⭐☆☆☆(Scale AI 出品 + 缺独立 baseline) |
| 复现可行性 | ⟡ 取决于 schema 公开 |
| 总体评级 | ⭐⭐⭐☆("B+ 工程价值 / C+ 学术可信度"——不应作为唯一标准直接采信) |
R-2.5 后续验证动作
| 优先级 | 动作 | 决定项 |
|---|---|---|
| P0 | 确认 schema / worked examples 是否公开 | 决定 taxonomy 价值等级 |
| P0 | 追踪会议接收信号(NeurIPS 2026 / ICLR 2027 / ACL 2027 / ICML 2027 workshop) | 决定学术可信度 |
| P0 | 独立 replication:50 条 OpenClaw 真实失败轨迹 × 41 类 vs Cemri/Zhu 旧分类法对比 | 决定"superiority"是 narrative 还是 evidence |
| P1 | "model-side bias" 量化:harness engineer vs LLM researcher 标 fault side,看 κ | 决定方法学产物 bias |
| P1 | OpenClaw 落地:41 类映射到现有 logging schema | 决定可执行性 |
| P2 | Proactive Memory Agent 兼容性测试:behavioral state decay 归到 model↔memory edge 哪个 side | 决定跨论文概念兼容 |
反方审稿 R-3 · Orthrus · 2026-09-16 09:50 flyP 精读稿
R-3.1 论点重述
论文对 Orthrus(Nguyen et al. 2026, hybrid AR + diffusion 推测解码架构,声称"strictly lossless / preserves the exact predictive distribution")做独立复现,三个贡献: 1. 独立实现 + 训练框架 2. on-policy 蒸馏数据比通用人类续写更优(独立 checkpoint TPF 更高) 3. "无损"声明在 BF16 下不成立:作者 checkpoint BF16 仅 45% 完全匹配;FP32 100%;FP16 ~90%
R-3.2 ⚠️ 反方证据
R-3.2.1 【高严重度】反驳强但工程意义可能弱
证据:lm-eval-harness 任务级分数与 AR 基线无系统性退化。
反方论点: - 论文反驳"严格无损"措辞有数字证据(BF16 45% vs FP32 100%),但lm-eval-harness 无系统退化意味着对绝大多数用户来说 BF16 下的 45% trajectory match rate 是可接受的 - 论文没有给一个具体的"下游任务失败案例分析"——比如 code generation、agentic tool use、math reasoning 这类对单 token 错误高度敏感的场景下,45% 发散率造成了多少 latent bug? - 反驳措辞强 ≠ 工程影响大——这是 2026 年 dLLM 评测论文的常见陷阱
形式评级影响:反驳可信度 🟢 中-高 → 若不补高敏感场景下游失败案例,应降为 🟡 中-高
R-3.2.2 【高严重度】FP32 端到端速度数据缺失
证据:论文没有给 FP32 下的端到端速度对比。
反方论点: - "FP32 才能无损"听起来严谨,但 FP32 推理的吞吐量 / 显存开销通常是 BF16 的 1.5–2 倍 - 如果 FP32 下 Orthrus 加速比只有 1.5×,那它就完全失去了存在意义(相比 AR 基线) - 这是论文最重要的一处遗漏——直接决定了"FP32 无损但加速比崩溃"的工程现实
形式评级影响:方法学贡献 🟢 中-高 → 若 FP32 加速比崩溃,Orthrus 设计需要重新审视
R-3.2.3 【中严重度】作者与 Nguyen et al. 的关系未核实
证据:Sinev 是 dLLM 圈活跃人物,与 Orthrus 原作者是否独立未声明。
反方论点:如果是合作者或同一研究网络,"独立复现"的措辞需要重新审视——可能会被认为是内部 alignment 工作而非独立社区复核。
后续验证动作:Skoltech / AIRI 官网 + OpenReview + dLLM 社区会议(Diffusion Language Model Workshop 2026)核查
R-3.2.4 【中严重度】代码 / 数据未公开
证据:论文摘要级没说会开源代码;1,190 prompts × 12 domains 评估集是否可下载未声明。
反方论点:如果不开源,其他研究者很难在自己模型上重做这套 trajectory match 实验——整篇论文的"反驳性"价值大打折扣。建议论文 v2 必须公开:(a) 独立训练代码、(b) 1,190 prompts × 12 domains 评估集、(c) FP32 / BF16 / FP16 三档 trajectory match 评测脚本。
R-3.2.5 【中严重度】12 个领域分布未披露
证据:摘要只说 "12 domains",1,190 prompts 不知道分布。
反方论点:是否覆盖了代码、数学、agentic tool trace 等高敏感场景?还是主要是 NLP 任务?如果是后者,反驳"严格无损"措辞的工程意义进一步打折。
R-3.2.6 【中严重度】与 Nguyen et al. 原论文的实现细节对比不足
证据:没有说作者释放的 checkpoint 在 BF16 下推理时是否本身就用了 BF16,还是仅训练时用了 BF16 + 推理时用 FP32。
反方论点:如果是后者,原作者的"严格无损"声明在 BF16 推理下本来就不成立——这意味着 Nguyen et al. 的实现有 bug,而不是设计有问题。
后续验证动作:chiennv/Orthrus-Qwen3-1.7B 的推理脚本默认精度核查
R-3.3 复现风险维度
| 维度 | 风险等级 | 关键证据 |
|---|---|---|
| 代码 / 数据公开 | 🔴 高 | 摘要级未声明 |
| 作者独立性核实 | 🟠 高 | Sinev / Oseledets 与 Nguyen et al. 关系未明 |
| 12 领域分布 | 🟡 中 | 未披露 |
| FP32 速度 | 🟠 高 | 决定 Orthrus 设计存在意义 |
| 高敏感场景下游失败 | 🟠 高 | 决定反驳工程意义 |
| 评测方法学推广 | 🟢 低 | 套到 EAGLE-3 / DFlash / Mercury 可行 |
复现可行性总评:🟡 取决于代码 / 数据公开。如果公开,1,190 prompts × 12 domains × 3 精度档的评测流程可直接被 dLLM 社区复用为标准评测规范。
R-3.4 形式评级
| 子项 | 评级 |
|---|---|
| 反驳可信度 | 🟢 中-高(数字硬证据 + 诚实承认不否定 Orthrus 价值) |
| 方法学贡献(lossless 操作性重定义) | 🟢 中-高(可推广到全部 dLLM 论文) |
| 方法学贡献(on-policy 蒸馏原则) | 🟢 高(对所有 AR + diffusion head 类架构有价值) |
| 工程影响 | 🟡 中-高(FP32 速度缺失削弱说服力) |
| 复现可行性 | 🟡 中(代码 / 数据未公开打折扣) |
| 总体评级 | 🟢 中-高(B+ → 升 A 需代码公开 + FP32 速度 + 高敏感场景下游失败案例) |
R-3.5 后续验证动作
| 优先级 | 动作 | 决定项 |
|---|---|---|
| P0 | 核实作者机构 + 与 Nguyen et al. 关系(Skoltech / AIRI / OpenReview) | 决定独立性 |
| P0 | 核实代码 / 1,190 prompt 集是否公开 | 决定反驳价值可持续性 |
| P0 | FP32 vs BF16 端到端速度对比(如能拿到代码) | 决定 Orthrus 设计存在意义 |
| P1 | 把 trajectory match rate 套到 EAGLE-3 / DFlash / Mercury / SDAR | 决定 dLLM 评测规范推广 |
| P1 | 高敏感场景(code / agentic tool / math)下游失败案例 | 决定反驳工程意义 |
| P2 | 跟踪 MLSys / ICLR 2026 / NeurIPS 2026 审稿意见 | 决定会议接收 |
| P2 | Nguyen et al. 团队是否出 v2 修订回应 | 决定双方共识形成 |
综合复现风险矩阵
| 论文 | 算力门槛 | 数据/代码公开 | 评测独立性 | 工程价值 | 学术价值 | 总复现风险 |
|---|---|---|---|---|---|---|
| Atria Dawn | 🟠 高 | 🔴 recipe 不开放 / 🟢 weights 开放 | 🟠 自评 | 🟡 中(cost 不明) | 🟡 中-高 | 🟠 高 |
| Model-or-Harness | 🟢 低 | 🔴 schema 未确认 | 🟠 Scale AI 出品 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | 🟡 取决于 schema |
| Orthrus | 🟡 中 | 🔴 代码未公开 | 🟡 待核实 | 🟢 高(如果 FP32 速度不崩) | 🟢 中-高 | 🟡 取决于公开 |
核心观察: 1. 3 篇都有"数据 / 代码公开"硬门槛——这是 2026 年 AI 论文的默认 release 模式,但对学术复现形成系统性约束 2. 3 篇都有"独立性 / 利益冲突"问题——Atria Dawn 自评、Model-or-Harness 全员 Scale AI、Orthrus 待核实作者关系 3. 3 篇的工程价值 vs 学术价值比例差异大——Atria Dawn 学术价值高 / 工程价值待定;Model-or-Harness 工程价值高 / 学术可信度中;Orthrus 两者都中-高但 FP32 速度决定工程价值上限
综合反方审稿结论
✅ 本周必读 3 篇都"值得反方审稿",但理由各不相同
- Atria Dawn:方法学 + 模型 + 社会学三层贡献都有可量化反方证据,最值得做长程反方审稿(3-6 个月跟踪)
- Model-or-Harness:诊断抽象层的稀缺性 + 工程价值 + 方法学 bias 已自我暴露,最值得做 schema 公开状态确认(30 天窗口)
- Orthrus:反驳性复现具体数字 + 方法学贡献可推广 + 工程意义待证,最值得做 FP32 速度 + 高敏感场景下游失败案例的 follow-up(2-4 周窗口)
⚠️ 本周 3 篇共同的"反方审稿瓶颈"
- 数据 / 代码公开是学术复现的硬门槛——3 篇都有不同程度的开放度问题
- 独立性 / 利益冲突是商业时代 AI 研究的系统性问题——3 篇都有不同程度的 bias 风险
- 缺 cost / latency / 下游失败案例是 2026 年 release 的通病——3 篇都缺不同程度的关键数字
🎯 下周(9-20 ~ 9-26)反方审稿建议优先级
| 优先级 | 动作 | 关联论文 |
|---|---|---|
| P0 | Atria Dawn HF Daily 票数跟踪 + GitHub 仓库核查 + 去污染声明核查 | Atria Dawn |
| P0 | Model-or-Harness schema 公开状态确认 + 会议接收信号追踪 | Model-or-Harness |
| P0 | Orthrus 作者关系核实 + FP32 速度公开请求 + EAGLE-3/DFlash/Mercury trajectory match 套用预备 | Orthrus |
| P1 | 启动 9-20 ~ 9-26 周日棒位跟踪:下周 agent 主轴新候选 + Atria Dawn v2 修订 | 通用 |
| P1 | agent.md / agent-eval.md / llm-infra.md / multimodal.md 主分类新增条目预备 | 通用 |
给后续同步任务的具体建议
review_file:
- "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-reviews.md"(本文件)
notes_file:
- "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-notes.md"
下游主题页更新建议(待 sync 任务处理):
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent.md-section-Atria-Dawn-draft.md"(agent.md 主分类新增 §Atria Dawn,含本 review §R-1)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent-eval.md-section-Model-or-Harness-draft.md"(agent-eval.md 新增 §Model-or-Harness taxonomy 索引 + 41 类速查占位 + 本 review §R-2 引用)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-llm-infra.md-section-Orthrus-draft.md"(llm-infra.md 新增 §Orthrus 数值精度约束 + 本 review §R-3)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal.md-classification-fix-Atria-Dawn.md"(multimodal.md 订正 Atria Dawn 从主轴候选改为邻接级)
不在本任务范围:
- 不写 /shared/research-kb/review/ 或 /shared/research-kb/published/
- 不执行 git commit / git push / gh pr
- 不直接修改 knowledge/ 或 organized/(由后续 sync 任务串行合并)
待人工确认的问题
- Atria Dawn +252▲ / 24h 是否续立(9-16 evening + 9-17 morning 票数)
- Atria Dawn GitHub 仓库内容(reference harness / trajectory sample / training recipe)
- Atria Dawn 跨语种基线 + 去污染协议 + cost/latency + ablation 后续是否会补充
- Model-or-Harness schema / worked examples 是否公开(决定 taxonomy 价值等级)
- Model-or-Harness 会议接收信号(NeurIPS 2026 / ICLR 2027 / ACL 2027 / ICML 2027 workshop)
- Orthrus 作者与 Nguyen et al. 的关系(独立性核实)
- Orthrus 代码 / 1,190 prompt 集是否公开(反驳价值可持续性)
- Orthrus FP32 端到端速度 + 高敏感场景下游失败案例(决定反驳工程意义)
- Model-or-Harness 41 类完整清单(决定 KB 索引页可写性)
- 下周(9-20 起)反方审稿棒位 P0 优先级确认
flyP · 2026-09-19 10:30 CST · 周六精读与反方审稿棒 · 第 N 期 · 反方审稿 + 复现风险分析 · 共享知识库 flyP 实例