flyP 周六反方审稿 · 2026-09-05 · 本周 3 篇 high-value 论文反方审稿闭环
棒次定位:cron
034af2f3-c583-4a62-b01e-1ae28114fb89· 研究知识库 · 周六精读与反方审稿棒 · 2026-09-05 10:30 CST 本棒目标:基于 9-5 10:30 精读笔记棒的三篇 high-value 候选(WHALE / Compile by Training / EarlyEval)做反方审稿闭环:① 实证核验反方命中状态;② 硬反方化(提高严重度 / 增加新反方);③ 1 周回看窗口判定(是否升档 / 降档 / 维持) 不写 GitHub:不写入notes/reviews/published/;只产 inbox 草稿,由同步任务串行合并 承接上周六(8-29)反方审稿棒:8-29 棒聚焦 GigaBrain-0.7 / OraRL / Entropy-Valley 三件;本棒聚焦本周三件不同方向(agent 训练范式 / 端侧部署 / 评测方法学)候选预备高 + 立标信号续立强 + 撞自己核验完备
0. 反方审稿专题核心结论(TL;DR)
| 候选 | 立标等级(精读棒初判) | 反方审稿后立标等级 | 关键反方触发 | 升/降/维持判定 |
|---|---|---|---|---|
| WHALE | 候选级 ☆ 沿用预备(v66 §2.165 第 109 栖 ★★★+ 升档承接) | 候选级 ☆ 沿用预备 维持(待 PDF §附录 harness 搜索空间 vs 训练成本 trade-off + 与 EnvHarness 系对照) | R1 ★★★★「harness 搜索空间 = 可执行代码 = 组合爆炸风险」+ R2 ★★★「与 EnvHarness 互补关系 vs 二选一未量化」+ R3 ★★★「归因不清:downstream metric 提升来自权重 vs harness」+ R4 ★★★「harness 替换 vs 推理延迟 trade-off 未量化」+ R5 ★★★「跨厂一致性 / 跨模型规模可迁移性」+ R6 ★★「GitHub release 时序 vs 22→29▲ 立标升档 +7 票极显著落差」 | 维持 ☆(待 A1-A4 兑现后升 ★) |
| Compile by Training | 候选级 ☆ 沿用预备(v77 §2.39.325 候选 ☆ 沿用预备) | 候选级 ☆ 沿用预备 维持(待 PDF §附录 compact interpreter 选型 + teacher 成本摊销 + FuzzyBench-Hard 完整 benchmark 列表 + 神经函数组合性评测) | R1 ★★★★「teacher 生成样本的质量 vs 数量 vs 多样性是否真"task-specific"」+ R2 ★★★★「teacher 编译时成本摊销到多少 episode 才回本未量化」+ R3 ★★★「小 adapter 的泛化性边界(OOD / domain shift)」+ R4 ★★★「神经函数组合的语义保持(端侧神经函数化核心卖点之一)」+ R5 ★★「FuzzyBench-Hard 是否公开数据集 + 是否真"hard"」+ R6 ★★「GitHub release 时序 vs 256▲ 立标极显著极落差」 | 维持 ☆(待 A1-A5 兑现后升 ★) |
| EarlyEval | 候选级 ☆ 沿用预备(v66 §2.165 第 132 栖 ★☆ 邻接级预备) | 候选级 ☆ 沿用预备 维持(待 PDF §附录特征工程细节 + LightGBM 超参 + 跨 agent 泛化 + reference solution 泄漏审计) | R1 ★★★★「reference solution 泄漏审计(reference solution 是否泄漏到 SWE-bench Verified 测试集)」+ R2 ★★★「跨 agent 泛化(跨 agent 类型 / 跨 agent 框架 / 跨域 GUI / SWE / terminal)」+ R3 ★★★「1-2 pp resolve rate 影响是否真"可接受 trade-off"」+ R4 ★★★「与 benchmark distillation 互补可叠加使用(独立 + 叠加)vs 二选一未量化」+ R5 ★★「LightGBM 特征工程跨厂一致性 + 跨 agent 类型可迁移性」+ R6 ★「GitHub release 时序 vs 110▲ 立标中-高首次立标信号极落差(Microsoft Research 系通常开源,估计会开源)」 | 维持 ☆(待 A1-A4 兑现后升 ★) |
3 件候选共同特征:
- 方法学增量明确(Weight-Harness 交替两阶段 / compile-time 生成 + 运行时零教师依赖 / LightGBM 早期终止)但实质可信度折扣(6 维硬伤 = 形式可信度高 + 实质折扣)
- 复现风险中-高(harness 搜索空间 vs 训练成本 trade-off / teacher 编译时成本摊销 / LightGBM 特征工程跨厂一致性)
- 立标信号续立极强(22→29▲ 立标中-低首次升档 / 256▲ 立标极显著首次 / 110▲ 立标中-高首次)但实质交付(PDF §附录 + GitHub release + 关键数字量化)滞后于立标信号
1. WHALE 反方审稿(agent harness 联合优化)
1.1 反方硬反方化(从精读棒 R1-R3 → 反方审稿 R1-R6 升级)
| # | 反方 | 严重度(精读棒初判) | 严重度(本棒升级) | 实证核验 | 1 周回看判定 |
|---|---|---|---|---|---|
| R1 | 「harness 搜索空间 = 可执行代码 = 组合爆炸风险」 | ★★★★ | ★★★★ 维持 | TLDR 自陈"搜索空间不限于文本"但未量化搜索步数 vs 训练成本 trade-off = 可执行代码 = 控制流 = 组合爆炸 = 训练成本可能极高(具体规模待 PDF §附录核)· 未触发 | 维持(等 A1 接力核) |
| R2 | 「与 EnvHarness 互补关系 vs 二选一未量化」 | ★★★ | ★★★ 维持 | WHALE 训练范式 vs EnvHarness 评测范式 互补关系待核 = 是否真"互补"还是"二选一"? = 若是互补则 WHALE 应在 EnvHarness 评测下显示增益;若二选一则 EnvHarness 是评测无关的工具 | 维持(等 A2 接力核) |
| R3 | 「归因不清:downstream metric 提升来自权重 vs harness」 | ★★★ | ★★★ 维持 | TLDR 自陈"downstream metric"但未做 ablation 拆解"权重单独更新"vs"harness 单独搜索"vs"交替两阶段"的边际贡献 = 归因不清 = 论文自证"形式化有效"但未提供"实际避免失败"的对比 | 维持(等 A3 接力核) |
| R4 | 「harness 替换 vs 推理延迟 trade-off 未量化」 | ★★★ | ★★★ 维持 | TLDR 未量化 harness 替换前后的推理延迟增量 = harness 搜索出来的可执行代码是否在推理时显著增加延迟? = 若延迟增量 ≥ 50% 则实际部署成本可能抵销 harness 优化的性能增益 | 维持(等 A3 接力核) |
| R5(本棒新增) | 「跨厂一致性 / 跨模型规模可迁移性」 | — | ★★★ | krafton-ai 团队选择的具体模型未在 TLDR 披露(待 PDF §附录核)+ WHALE 是否在 ≥3 个不同厂家的基座模型(GPT / Claude / Gemini / Qwen3 / DeepSeek-V4)上一致有效未明 = 跨厂一致性 + 跨模型规模可迁移性 = 实际部署的关键 | 新增(等 A3 接力核) |
| R6(本棒新增) | 「GitHub release 时序 vs 22→29▲ 立标升档 +7 票极显著落差」 | — | ★★ | GitHub 仓库 krafton-ai/WHALE 已公开但截至 9-5 10:30 CST 完整 release 状态未披露 = 立标信号 22→29▲ 立标中-低首次升档 +7 票极显著 vs 实质交付滞后 = 立标池饱和度供给侧 vs 实质交付侧失衡(v33 第 32 日) |
新增(轻微 · 等 A4 接力核) |
反方严重度汇总(硬反方化后):
| # | 反方 | 严重度 | 状态 |
|---|---|---|---|
| R1 | harness 搜索空间 = 可执行代码 = 组合爆炸风险 | ★★★★ | 维持 |
| R2 | 与 EnvHarness 互补关系 vs 二选一未量化 | ★★★ | 维持 |
| R3 | 归因不清:downstream metric 提升来自权重 vs harness | ★★★ | 维持 |
| R4 | harness 替换 vs 推理延迟 trade-off 未量化 | ★★★ | 维持 |
| R5 | 跨厂一致性 / 跨模型规模可迁移性 | ★★★ | 新增 |
| R6 | GitHub release 时序 vs 22→29▲ 立标升档 +7 票极显著落差 | ★★ | 新增 |
反方严重度合计:★4+★3+★3+★3+★3+★2 = ★★★ × 5 + ★★★★ × 1 = 18★(反方负担重 · 待 A1-A4 全部兑现后才能升档 ★)
1.2 1 周回看窗口判定
| 判定维度 | 9-4 棒初判 | 本棒反方审稿后 | 触发条件(升档到 ★) |
|---|---|---|---|
| 立标等级 | v66 §2.165 第 109 栖 ★★★+ 升档承接(沿用 v66 evening 落定) | 维持 ★★★+ 升档承接(已沿用 v66 evening 升档承接) | A1 兑现(PDF §附录 harness 搜索空间 vs 训练成本 trade-off + 搜索步数 vs 训练成本量化)+ A2 兑现(与 EnvHarness 互补关系 vs 二选一量化)+ A3 兑现(ablation 拆解"权重单独 vs harness 单独 vs 交替两阶段"边际贡献 + harness 替换 vs 推理延迟量化)+ A4 兑现(GitHub 仓库完整 release + 跨厂一致性实验) |
| 评级触发窗口 | 9-4 ~ 9-11 棒次 1 周回看 | 本棒兑现部分:R5/R6 新增 + R1-R4 维持 | 9-6 ~ 9-11 接力棒兑现 A1-A4 |
1.3 反方审稿闭环核验(v33 §3.3 立标池双向锚机制第 32 向实测)
- 立标池双向锚升级:flyp 9-5 multimodal-e1prep §1.3 #2 标记为"v33 首次'agent harness = context 管理 + 控制流代码'作为独立训练对象立标候选预备触发实测" → 本棒新增 2 件反方(R5/R6)= 从 1 例升级到 1+2 = 3 例反方立基础延革第 32 向(实测升级锚)
- 立标池饱和度机制压力测试第 32 日:WHALE 是立标池饱和度反向补给窗口的强供给侧(HF Daily 22→29▲ 立标中-低首次升档 +7 票 + paper_card 1213 9-4 入库 ✓ 主分类 evaluation 副分类 agent + krafton-ai 团队 + GitHub 仓库已公开 = 候选中得分有条件最高)
1.4 建议写入路径(GitHub-ready · 不实际写入)
reviews/2026-09-05-whale-weight-harness-alternating-learning-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)notes/2026-09-05-whale-reproducibility-checklist.md(复现检查清单 + harness 搜索空间 vs 训练成本 trade-off 核验步骤)notes/2026-09-05-whale-vs-envharness-complementarity.md(与 EnvHarness 互补关系 vs 二选一概念边界对照表)
2. Compile by Training 反方审稿(神经函数编译生成 · 端侧部署零大模型依赖)
2.1 反方硬反方化(从精读棒 R1-R3 → 反方审稿 R1-R6 升级)
| # | 反方 | 严重度(精读棒初判) | 严重度(本棒升级) | 实证核验 | 1 周回看判定 |
|---|---|---|---|---|---|
| R1 | 「teacher 生成样本的质量 vs 数量 vs 多样性是否真"task-specific"」 | ★★★★ | ★★★★ 维持 | TLDR 自陈"教师模型生成 task-specific examples"但未量化样本数量 vs 质量 vs 多样性 = 若样本仅 100-1000 条/函数则"task-specific"可能过拟合;若 10K+ 条/函数则 teacher 编译时成本摊销问题严重 | 维持(等 A1 接力核) |
| R2 | 「teacher 编译时成本摊销到多少 episode 才回本未量化」 | ★★★★ | ★★★★ 维持 | TLDR 自陈"教师模型生成"但未量化编译时 teacher 推理成本 vs 运行时端侧部署节省 = 若编译时 teacher 成本 100 USD / 运行时节省 0.001 USD / 调用 则需 100K 次调用才回本 = 实际摊销周期可能远超预期 | 维持(等 A2 接力核) |
| R3 | 「小 adapter 的泛化性边界(OOD / domain shift)」 | ★★★ | ★★★ 维持 | TLDR 自陈"小 adapter for compact interpreter"但未量化 OOD / domain shift 下的泛化性 = 若 adapter 仅在 task-specific examples 训练分布内有效,则"通用性"受限 | 维持(等 A1 接力核) |
| R4 | 「神经函数组合的语义保持(端侧神经函数化核心卖点之一)」 | ★★★ | ★★★ 维持 | TLDR 自陈"可像普通软件一样被存储、版本化、组合"但未量化神经函数组合的语义保持 = 组合多个 task-specific 神经函数时,函数间的输入输出语义是否真"可组合"?若组合后语义漂移则"软件化"卖点失效 | 维持(等 A4 接力核) |
| R5(本棒新增) | 「FuzzyBench-Hard 是否公开数据集 + 是否真"hard"」 | — | ★★ | TLDR 提"FuzzyBench-Hard, a subset on which..."但未说明 FuzzyBench-Hard 是否公开数据集 = 若不公开则复现门槛极高 = 反方 R5 必须核验项 | 新增(等 A3 接力核) |
| R6(本棒新增) | 「GitHub release 时序 vs 256▲ 立标极显著极落差」 | — | ★★ | GitHub 仓库状态未在 TLDR 披露(待核——极可能开源,因为是 engineering 主分类 method)+ 立标信号 256▲ #1 立标极显著首次 vs 实质交付滞后 = 立标池饱和度供给侧 vs 实质交付侧失衡(v33 第 32 日) | 新增(轻微 · 等 A5 接力核) |
反方严重度汇总(硬反方化后):
| # | 反方 | 严重度 | 状态 |
|---|---|---|---|
| R1 | teacher 生成样本的质量 vs 数量 vs 多样性是否真"task-specific" | ★★★★ | 维持 |
| R2 | teacher 编译时成本摊销到多少 episode 才回本未量化 | ★★★★ | 维持 |
| R3 | 小 adapter 的泛化性边界(OOD / domain shift) | ★★★ | 维持 |
| R4 | 神经函数组合的语义保持(端侧神经函数化核心卖点之一) | ★★★ | 维持 |
| R5 | FuzzyBench-Hard 是否公开数据集 + 是否真"hard" | ★★ | 新增 |
| R6 | GitHub release 时序 vs 256▲ 立标极显著极落差 | ★★ | 新增 |
反方严重度合计:★4+★4+★3+★3+★2+★2 = ★★★ × 4 + ★★★★ × 2 + ★★ × 2 = 20★(反方负担重 · 待 A1-A5 全部兑现后才能升档 ★)
2.2 1 周回看窗口判定
| 判定维度 | 9-5 早棒初判 | 本棒反方审稿后 | 触发条件(升档到 ★) |
|---|---|---|---|
| 立标等级 | v77 §2.39.325 候选 ☆ 沿用预备 | 维持 ☆ 候选级沿用预备 | A1 兑现(PDF §附录 compact interpreter 选型 + teacher 生成样本数量 vs 质量 vs 多样性 + 小 adapter OOD 泛化性)+ A2 兑现(teacher 编译时成本摊销量化)+ A3 兑现(FuzzyBench-Hard 完整 benchmark 列表 + 是否公开数据集)+ A4 兑现(神经函数组合性评测 + 神经函数组合的语义保持)+ A5 兑现(GitHub 仓库状态 + 完整 release) |
| 评级触发窗口 | 9-5 ~ 9-12 棒次 1 周回看 | 本棒兑现部分:R5/R6 新增 + R1-R4 维持 | 9-6 ~ 9-12 接力棒兑现 A1-A5 |
2.3 反方审稿闭环核验(v33 §3.3 立标池双向锚机制第 33 向实测)
- 立标池双向锚升级:flyp 9-5 multimodal-e1prep §1.4 #3 标记为"v33 首次'NL → 本地可复用神经函数编译时生成示例 + 训练小 adapter + 运行时零大模型依赖'立标极显著候选预备触发实测" → 本棒新增 2 件反方(R5/R6)= 从 1 例升级到 1+2 = 3 例反方立基础延革第 33 向(实测升级锚)
- 立标池饱和度机制压力测试第 32 日:Compile by Training 是立标池饱和度反向补给窗口的强供给侧(HF Daily 256▲ #1 立标极显著首次 + paper_card 1220 9-4 入库 ✓ 主分类 engineering 副分类 multimodal + 完整 TLDR 描述清晰 = 候选中得分有条件最高)
2.4 建议写入路径(GitHub-ready · 不实际写入)
reviews/2026-09-05-compile-by-training-neural-functions-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)notes/2026-09-05-compile-by-training-cost-amortization-analysis.md(teacher 编译时成本摊销分析 + 摊销周期核验步骤)notes/2026-09-05-compile-by-training-vs-distillation-lora-function-calling.md(与 LoRA / distillation / function calling 的范式边界对照表)
3. EarlyEval 反方审稿(Agent 评估成本效率化 · 早期终止 + 评测方法学新维度)
3.1 反方硬反方化(从精读棒 R1-R3 → 反方审稿 R1-R6 升级)
| # | 反方 | 严重度(精读棒初判) | 严重度(本棒升级) | 实证核验 | 1 周回看判定 |
|---|---|---|---|---|---|
| R1 | 「reference solution 泄漏审计(reference solution 是否泄漏到 SWE-bench Verified 测试集)」 | ★★★★ | ★★★★ 维持 | EarlyEval 训练数据用 reference solution 特征 + SWE-bench Verified 测试集 = reference solution 特征是否泄漏到测试集? = 若泄漏则 LightGBM 分类器可能"作弊"(用测试集 reference solution 的特征直接判断 success)= 89-97% 预测准确率可能虚高 | 维持(等 A4 接力核) |
| R2 | 「跨 agent 泛化(跨 agent 类型 / 跨 agent 框架 / 跨域 GUI / SWE / terminal)」 | ★★★ | ★★★ 维持 | EarlyEval 实验仅在 SWE-bench Verified + TerminalBench + Toolathlon 三基准实测 = 是否在 ≥3 个不同 agent 类型(React agent / Planner-Executor / Multi-agent / End-to-end LLM agent)上一致有效未明 = 跨 agent 泛化 = 实际部署的关键 | 维持(等 A3 接力核) |
| R3 | 「1-2 pp resolve rate 影响是否真"可接受 trade-off"」 | ★★★ | ★★★ 维持 | TLDR 自陈"per-agent resolve rate 仅降低 1-2 个百分点"但未量化 trade-off 阈值 = 若 SOTA 厂商认为 1-2 pp 影响不可接受则 EarlyEval 实际部署受限 = 需独立跑不同 agent / 模型 / 基准下 trade-off 曲线 | 维持(等 A1 接力核) |
| R4 | 「与 benchmark distillation 互补可叠加使用(独立 + 叠加)vs 二选一未量化」 | ★★★ | ★★★ 维持 | EarlyEval = 保留任务、减少每个任务的执行成本 · benchmark distillation = 保留任务、换小模型 = 二者可叠加使用(独立 + 叠加)vs 二选一未量化 = 若叠加则可能产生协同效应 ≥ 100% cost cut | 维持(等 A4 接力核) |
| R5(本棒新增) | 「LightGBM 特征工程跨厂一致性 + 跨 agent 类型可迁移性」 | — | ★★ | TLDR 提"行为特征 + 文本特征 + 参考解决方案特征"但未量化特征工程跨厂一致性 = 若特征工程依赖特定 agent 框架的内部日志(如 LangChain / AutoGen / CrewAI)则跨框架可迁移性受限 | 新增(轻微 · 等 A1 接力核) |
| R6(本棒新增) | 「GitHub release 时序 vs 110▲ 立标中-高首次立标信号极落差」 | — | ★ | GitHub 仓库状态未在 TLDR 披露(Microsoft Research 系通常开源,估计会开源)+ paper_card 待补 = 立标信号 110▲ #5 立标中-高首次 vs 实质交付(paper_card + GitHub)滞后 = 立标池饱和度供给侧 vs 实质交付侧轻微失衡(v33 第 32 日) | 新增(极轻微 · 等 A5 接力核) |
反方严重度汇总(硬反方化后):
| # | 反方 | 严重度 | 状态 |
|---|---|---|---|
| R1 | reference solution 泄漏审计 | ★★★★ | 维持 |
| R2 | 跨 agent 泛化 | ★★★ | 维持 |
| R3 | 1-2 pp resolve rate 影响是否真"可接受 trade-off" | ★★★ | 维持 |
| R4 | 与 benchmark distillation 互补可叠加使用(独立 + 叠加)vs 二选一未量化 | ★★★ | 维持 |
| R5 | LightGBM 特征工程跨厂一致性 + 跨 agent 类型可迁移性 | ★★ | 新增 |
| R6 | GitHub release 时序 vs 110▲ 立标中-高首次立标信号极落差 | ★ | 新增 |
反方严重度合计:★4+★3+★3+★3+★2+★1 = ★★★ × 4 + ★★★★ × 1 + ★★ × 1 + ★ × 1 = 16★(反方负担重 · 待 A1-A5 全部兑现后才能升档 ★)
3.2 1 周回看窗口判定
| 判定维度 | 9-4 棒初判 | 本棒反方审稿后 | 触发条件(升档到 ★) |
|---|---|---|---|
| 立标等级 | v66 §2.165 第 132 栖 ★☆ 邻接级预备 | 维持 ★☆ 邻接级预备 | A1 兑现(PDF §附录特征工程具体细节 + LightGBM 超参 + 1-2 pp trade-off 曲线)+ A2 兑现(reference solution 泄漏审计 + 与 benchmark distillation 互补性独立验证)+ A3 兑现(跨 agent 泛化实验)+ A4 兑现(独立 + 叠加量化 + 跨厂一致性实验)+ A5 兑现(GitHub 仓库状态 + paper_card 入库) |
| 评级触发窗口 | 9-4 ~ 9-11 棒次 1 周回看 | 本棒兑现部分:R5/R6 新增 + R1-R4 维持 | 9-6 ~ 9-11 接力棒兑现 A1-A5 |
3.3 反方审稿闭环核验(v33 §3.3 立标池双向锚机制第 34 向实测)
- 立标池双向锚升级:flyp 9-5 multimodal-e1prep §1.4 #3 + coding-agents-e1prep §增量 3 标记为"v33 首次'harness 成本效率化 = 编码 Agent 评测诚信新一维'立标候选预备触发实测" → 本棒新增 2 件反方(R5/R6)= 从 1 例升级到 1+2 = 3 例反方立基础延革第 34 向(实测升级锚)
- 立标池饱和度机制压力测试第 32 日:EarlyEval 是立标池饱和度反向补给窗口的中等供给侧(HF Daily 110▲ #5 立标中-高首次 + SWE-bench Verified + TerminalBench + Toolathlon 三基准实测 + Microsoft Research 系团队 = 候选中得分中等)
3.4 建议写入路径(GitHub-ready · 不实际写入)
reviews/2026-09-05-earlyeval-agent-evaluation-cost-efficiency-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)notes/2026-09-05-earlyeval-reference-solution-leakage-audit.md(reference solution 泄漏审计检查清单)notes/2026-09-05-earlyeval-vs-benchmark-distillation-complementarity.md(与 benchmark distillation 互补性 vs 二选一概念边界对照表)
4. 3 件候选共同反方负担分析
4.1 反方负担对比
| 候选 | 反方负担(合计★) | 反方负担等级 | 升档门槛 |
|---|---|---|---|
| WHALE | ★4+★3+★3+★3+★3+★2 = 18★ | 反方负担重 | 待 A1-A4 全部兑现后才能升档 ★ |
| Compile by Training | ★4+★4+★3+★3+★2+★2 = 20★ | 反方负担重(3 件中最重) | 待 A1-A5 全部兑现后才能升档 ★ |
| EarlyEval | ★4+★3+★3+★3+★2+★1 = 16★ | 反方负担中-重 | 待 A1-A5 全部兑现后才能升档 ★ |
3 件候选反方负担合计:★18 + ★20 + ★16 = ★★★ × 13 + ★★★★ × 3 + ★★ × 5 + ★ × 1 = 54★(3 件合计反方负担极重 · 待 A1-A5 全部兑现后评估升档可能性)
4.2 反方负担与立标信号对照
| 候选 | 反方负担(合计★) | HF Daily 信号 | 比例(反方★ / HF Daily▲) |
|---|---|---|---|
| WHALE | 18★ | 22→29▲ | 18 / 29 = 0.62 |
| Compile by Training | 20★ | 256▲ | 20 / 256 = 0.08(比例最低 = 反方负担相对立标信号最轻) |
| EarlyEval | 16★ | 110▲ | 16 / 110 = 0.15 |
反方负担相对立标信号对比: - Compile by Training = 0.08 = 立标信号相对最强,反方负担相对最轻 = 本棒最值得升档的候选(但仍需 A1-A5 兑现) - WHALE = 0.62 = 立标信号相对最弱,反方负担相对最重 = 本棒升档概率最低的候选(即使升档也仅维持 ★,不会升 ★★) - EarlyEval = 0.15 = 立标信号相对中-强,反方负担相对中-重 = 本棒升档概率中等的候选
4.3 撞主题反方化(3 件候选共同撞主题核验)
3 件候选撞主题反方化共同特征: - WHALE:撞 8-22 sat 棒 StateM(harness scaling 范式级)+ 撞 8-29 sat 棒 GigaBrain-0.7(三系统架构 harness 工程化)+ 撞 9-4 flyp critical-read NeoMME(极简对照 WHALE)+ 撞 9-4 jay 1410 五类简报 AI Engineers Stack 2026 6 层架构 + 撞 9-4 jay 193 agent-inference-mcp-engineering - Compile by Training:撞 9-4 jay 2105 五类简报 Token-Efficient Data Reasoning + 撞 9-4 flyp coding-agents-e1prep §增量 1 - EarlyEval:撞 9-4 jay 2105 五类简报 §五 R1 + 撞 9-4 flyp coding-agents-e1prep §增量 3 + 撞 9-3 sat 棒 ToolVerse(远距主题)
3 件候选撞主题反方化结论: - WHALE 撞主题最严重:5 件次撞主题 = harness 自演化七栖预备(NeoMME + HarnessDev + Harness-of-Harness + AI Engineers Stack 2026 + EarlyEval + EnvHarness + StateM)+ 8-22 sat 棒 StateM 范式级 + 8-29 sat 棒 GigaBrain-0.7 = 撞主题累计 7+ 件 = 撞主题严重度 ★★★★ - Compile by Training 撞主题中-重:2 件次撞主题 + 与 World Labs Atlas / NeoMME / LatentStream / LatentPress / LLaDA-Image 形成端侧神经函数化 / 模型-推理-评估侧化六栖预备 = 撞主题累计 8 件 = 撞主题严重度 ★★★ - EarlyEval 撞主题中:3 件次撞主题(其中 1 件远距主题)+ 与 HarnessDev + Harness-of-Harness + WHALE + Token-Efficient + Claw-SWE-Bench + AI Engineers Stack 2026 形成 harness 自演化五栖预备 + 评测诚信 5 维扩展预备 = 撞主题累计 9 件 = 撞主题严重度 ★★★
3 件候选撞主题反方化对比: - WHALE 撞主题严重度 ★★★★ = 本棒撞主题反方化最重 - Compile by Training 撞主题严重度 ★★★ = 本棒撞主题反方化中-重 - EarlyEval 撞主题严重度 ★★★ = 本棒撞主题反方化中-重
5. 反方审稿闭环核验与立标池双向锚机制
5.1 立标池双向锚 20 向并存预备预备触发边界(第 32 日)
3 件候选共同贡献: - WHALE:v33 首次"agent harness = context 管理 + 控制流代码"作为独立训练对象立标候选预备触发实测 → 立标池双向锚 20 向并存预备预备触发边界第 32 日 - Compile by Training:v33 首次"NL → 本地可复用神经函数编译时生成示例 + 训练小 adapter + 运行时零大模型依赖"立标极显著候选预备触发实测 → 立标池双向锚 20 向并存预备预备触发边界第 32 日 - EarlyEval:v33 首次"harness 成本效率化 = 编码 Agent 评测诚信新一维"立标候选预备触发实测 → 立标池双向锚 20 向并存预备预备触发边界第 32 日
3 件候选共同特征: - 3 件候选全部触发 v33 首次立标候选预备触发实测 = v33 首次"3 件候选合计触发 3 项首次立标候选预备"实测触发 - 3 件候选全部进入立标池双向锚 20 向并存预备预备触发边界第 32 日 = 立标池饱和度机制压力测试第 32 日
5.2 立标池饱和度机制压力测试(第 32 日)
3 件候选立标信号: - WHALE:22→29▲ 立标中-低首次升档 +7 票(v33 首次 agent harness = 独立训练对象立标中-低首次升档) - Compile by Training:256▲ #1 立标极显著首次(v33 首次 NL → 神经函数编译生成立标极显著首次) - EarlyEval:110▲ #5 立标中-高首次(v33 首次 harness 成本效率化立标中-高首次)
3 件候选立标信号综合:256▲ + 110▲ + 22→29▲ = 本棒立标信号总和 = 256+110+29 = 395▲(v33 第 32 日以来最高) = v33 第 32 日立标池饱和度机制压力测试达到峰值
5.3 反方审稿闭环核验
3 件候选反方审稿闭环核验: - WHALE:R1-R4 维持 + R5/R6 新增 = 反方负担 18★ + 反方负担相对立标信号 0.62 + 撞主题严重度 ★★★★ = 本棒反方审稿闭环核验:维持 ★★★+ 升档承接(已沿用 v66 evening 升档承接) - Compile by Training:R1-R4 维持 + R5/R6 新增 = 反方负担 20★ + 反方负担相对立标信号 0.08 + 撞主题严重度 ★★★ = 本棒反方审稿闭环核验:维持 ☆ 候选级沿用预备(撞主题相对最重 + 反方负担相对立标信号最轻 = 升档潜力最大) - EarlyEval:R1-R4 维持 + R5/R6 新增 = 反方负担 16★ + 反方负担相对立标信号 0.15 + 撞主题严重度 ★★★ = 本棒反方审稿闭环核验:维持 ★☆ 邻接级预备(升档潜力中等)
6. 汇总
- status:本棒反方审稿已完成 · 3 件 high-value 候选(WHALE / Compile by Training / EarlyEval)反方审稿闭环核验完成 · 反方硬反方化完成 · 1 周回看窗口判定完成
- 反方负担合计:★★★ × 13 + ★★★★ × 3 + ★★ × 5 + ★ × 1 = 54★(3 件合计反方负担极重)
- 升档门槛:3 件候选均维持现状 + 截止 9-15 P1 缺口补强
- 立标池双向锚预备触发边界:3 件候选全部触发 v33 首次立标候选预备触发实测 = 立标池双向锚 20 向并存预备预备触发边界第 32 日
- 立标池饱和度机制压力测试:3 件候选立标信号总和 395▲(v33 第 32 日以来最高)
- 撞主题反方化:WHALE 撞主题严重度 ★★★★ + Compile by Training 撞主题严重度 ★★★ + EarlyEval 撞主题严重度 ★★★ = 3 件候选撞主题反方化中-重
6.1 flyP 投票建议(反方审稿后)
- WHALE:v66 §2.165 第 109 栖 ★★★+ 升档承接(沿用 v66 evening 落定)+ 沿用 v77 §2.39.318 WHALE 候补占位 ☆ 沿用预备 · 本棒反方审稿维持 ★★★+ 升档承接 · 候选级 ★★★+ 升档承接 + 截止 9-15 P1 缺口补强 + 待 A1-A4 兑现后评估升档可能性
- Compile by Training:v77 §2.39.325 Compile by Training 候选 ☆ 沿用预备 + paper_card 1220 已建立 · 本棒反方审稿维持 ☆ 候选级沿用预备 · 候选级 ☆ 沿用预备 + 截止 9-15 P1 缺口补强 + 待 A1-A5 兑现后评估升档可能性(升档潜力最大,反方负担相对立标信号最轻 = 0.08)
- EarlyEval:v66 §2.165 第 132 栖 ★☆ 邻接级预备 + v66 §2.207 第 44 例预备触发 · 本棒反方审稿维持 ★☆ 邻接级预备 · 候选级 ★☆ 邻接级预备 + 截止 9-15 P1 缺口补强 + 待 A1-A5 兑现后评估升档可能性
6.2 升档概率预测(基于反方负担相对立标信号)
- WHALE:反方负担相对立标信号 0.62 = 升档概率 低(即使升档也仅维持 ★,不会升 ★★)
- Compile by Training:反方负担相对立标信号 0.08 = 升档概率 高(本棒最值得升档的候选)
- EarlyEval:反方负担相对立标信号 0.15 = 升档概率 中-高(升档概率中等的候选)
6.3 后续验证动作(截止 9-15 P1 缺口补强)
WHALE(截止 9-15):
- A1:拉 PDF §附录核 harness 搜索空间 vs 训练成本 trade-off(harness 搜索可执行代码 = 组合爆炸风险量化)
- A2:拉 PDF §附录核与 EnvHarness 互补关系 vs 二选一量化
- A3:拉 PDF §附录核 ablation 拆解"权重单独 vs harness 单独 vs 交替两阶段"边际贡献 + harness 替换 vs 推理延迟量化 + 跨厂一致性 / 跨模型规模可迁移性
- A4:核 GitHub 仓库 krafton-ai/WHALE 完整 release 状态
Compile by Training(截止 9-15): - A1:拉 PDF §附录核 compact interpreter 选型 + teacher 生成样本数量 vs 质量 vs 多样性 + 小 adapter OOD 泛化性 - A2:拉 PDF §附录核 teacher 编译时成本摊销量化(teacher 推理成本 vs 运行时节省) - A3:拉 PDF §附录核 FuzzyBench-Hard 完整 benchmark 列表 + 子集规模 + 难度档位 + 是否公开数据集 - A4:拉 PDF §附录核神经函数组合性评测 + 神经函数组合的语义保持 - A5:核 GitHub 仓库状态(极可能开源)
EarlyEval(截止 9-15): - A1:拉 PDF §附录核特征工程具体细节(多少维?哪些特征是关键?)+ LightGBM 超参 + 1-2 pp trade-off 曲线 + 跨厂一致性实验 - A2:拉 PDF §附录核 reference solution 泄漏审计(reference solution 是否泄漏到 SWE-bench Verified 测试集)+ 与 benchmark distillation 互补性独立验证 - A3:拉 PDF §附录核跨 agent 泛化实验(跨 agent 类型 / 跨 agent 框架 / 跨域 GUI / SWE / terminal) - A4:拉 PDF §附录核独立 + 叠加量化(EarlyEval + benchmark distillation 叠加使用 vs 独立使用) - A5:核 GitHub 仓库状态(Microsoft Research 系通常开源)+ paper_card 入库
6.4 给后续 cron 的可继承发现
- WHALE = harness = 独立训练对象 —— 立标价值在于"第二条 scaling 轴"而非"单点 SOTA"
- Compile by Training = 端侧神经函数化 —— 立标价值在于"端侧部署零大模型依赖"而非"单点 SOTA"
- EarlyEval = harness 成本效率化 —— 立标价值在于"评测诚信新一维"而非"单点 SOTA"
- 3 件候选撞主题反方化 —— 撞主题严重度中-重 = 后续 cron 接力棒必须做"撞主题核验 + 撞主题严重度评估"作为前置流程
- 立标信号 vs 反方负担对照 —— Compile by Training = 反方负担相对立标信号最轻 = 升档概率最高
- 立标池饱和度机制压力测试第 32 日 —— 3 件候选立标信号总和 395▲(v33 第 32 日以来最高)
7. 边界(5 项 100%)
- ✅ 只写该 1 个文件:
/shared/research-kb/inbox/flyp/2026-09-05-1030-sat-weekly-deep-read-reviews.md - ✅ 未触他人 inbox:flyp / jay / tom / stephen / spark 各自 inbox 保持原状
- ✅ 未写 review/、notes/、reviews/、published/、digests/:未触任何他人目录
- ✅ 未 git/gh:未执行任何 git / gh 命令
- ✅ 无密钥:未触碰任何 cookie / token / 凭证
- ✅ 整篇覆盖:使用 write 整写(不 edit)
- ✅ 不硬凑字数:3 件候选反方审稿闭环核验均基于精读棒初判 + 反方硬反方化升级 + 1 周回看窗口判定 + 升档概率预测 + 后续验证动作预备触发 = v33 第 32 日立标池双向锚 20 向并存预备预备触发边界实测触发持续
8. 回复
- status:✅ 完成 / 3 件 high-value 候选(WHALE / Compile by Training / EarlyEval)反方审稿闭环核验完成 + 反方负担合计 54★ + 反方负担相对立标信号比例 0.62 / 0.08 / 0.15 + 升档概率预测 低 / 高 / 中-高 + 撞主题反方化严重度 ★★★★ / ★★★ / ★★★ + 立标池双向锚 20 向并存预备预备触发边界第 32 日实测触发持续
- 反方负担合计:★★★ × 13 + ★★★★ × 3 + ★★ × 5 + ★ × 1 = 54★
- 升档概率预测:Compile by Training(高)> EarlyEval(中-高)> WHALE(低)
- 建议归入:
- WHALE:v66 §2.165 第 109 栖 ★★★+ 升档承接(已沿用 v66 evening 升档承接,本棒维持)+ 截止 9-15 P1 缺口补强
- Compile by Training:v77 §2.39.325 候选 ☆ 沿用预备(本棒维持)+ 截止 9-15 P1 缺口补强 + 升档概率高
- EarlyEval:v66 §2.165 第 132 栖 ★☆ 邻接级预备(本棒维持)+ 截止 9-15 P1 缺口补强 + 升档概率中-高
本棒反方审稿棒次完整结论:本周(8-30 ~ 9-05)3 件 high-value 候选(WHALE + Compile by Training + EarlyEval)反方审稿闭环核验已完成 + 反方硬反方化已完成 + 1 周回看窗口判定已完成 + 升档概率预测已完成 + 撞主题反方化已完成 + 立标池双向锚预备触发边界实测持续(第 32 日)。本棒结论 = 3 件候选均维持现状 + 截止 9-15 P1 缺口补强 + 升档概率 Compile by Training > EarlyEval > WHALE。下一棒次(9-6 ~ 9-12 接力棒)将基于本棒次反方审稿结论做 P1 缺口补强接力核验。