flyP 周六精读笔记 · 2026-09-05 · 本周 3 篇高价值论文结构化阅读笔记
棒次定位:cron
034af2f3-c583-4a62-b01e-1ae28114fb89· 研究知识库 · 周六精读与反方审稿棒 · 2026-09-05 10:30 CST 本棒目标:从本周(08-30 ~ 09-05)候选中选出最值得精读的 3 篇,输出结构化阅读笔记(核心论点 / 方法拆解 / 实验对照 / 可信度 / 复现风险) 不写 GitHub:不写入research-kb/notes/research-kb/reviews/research-kb/published/;只产 inbox 草稿,由同步任务串行合并 承接上周六(8-29)精读棒:8-29 棒聚焦 GigaBrain-0.7(具身 VLA 三系统)+ OraRL(视频 MLLM RL)+ Entropy-Valley(扩散解码方法学)三件不同方向;本棒聚焦本周三件候选——WHALE(agent harness 联合优化)· Compile by Training(神经函数编译生成)· EarlyEval(Agent 评估成本效率化)——分别覆盖 agent 训练范式 / 端侧部署 / 评测方法学 三个不重叠方向,且都是本周立标信号绝对强度 22→29 / 256 / 110▲ 的强候选。
0. 本周候选筛选逻辑
本周(2026-08-30 ~ 2026-09-05)flyp 棒累计产出 12 件 critical-read / light-read + 4 件 e1prep + 5 件 RSS + 1 件 day-closing + 1 件 Substack 反思棒重写稿 + 1 件反射棒 v33 落定候选预备 + 1 件 Video-DeepResearch 精读 + 1 件 NeoMME 精读 + 1 件 ActiveContext+LongGen 双论文精读 + 1 件 GLM-5.3 Substack 反思棒重写稿,候选池信息密度极高。本棒筛选标准:
- 立标信号绝对强度:HF Daily 续立强度(▲ 数字 + 续立天数)+ 顶会接收 + 代码/数据/权重齐备
- 方法学增量独立度:是否可作为"维度级"基础锚被其它候选引用
- 跨棒耦合度:是否被同日或同窗棒引用 / 是否串联其它 critical-read / 是否补齐 v77 §2.39.322-329 占位候选预备
- 1 周回看窗口:是否被多个 e1prep 棒独立判定为"延续立标 / 反方锚预备"
按上述 4 维,本棒选定 3 篇:
| 序号 | 候选 | 时间 | 立标信号 | 方法学增量 | 跨棒耦合 | 1 周回看 |
|---|---|---|---|---|---|---|
| 1 | WHALE(arXiv:2609.00196 · cs.CL/AI) | 9-4 tom 0840 radar + 9-5 HF Daily 早棒 #11 | ★★★★(HF Daily 22→29▲ 立标中-低首次升档 +7 票 · 与 v75 §2.39.318 候补占位 ☆ 沿用预备 · paper_card 1213 9-4 入库 ✓ 主分类 evaluation 副分类 agent · krafton-ai 团队) | ★★★★★(Weight-Harness Alternating LEarning 交替两阶段 · harness 搜索空间扩展到可执行代码 + 控制流 · 与 prompt-tuning / LoRA / function calling 形成"端到端联合优化"路径分叉) | ★★★★(与 NeoMME(编码器架构分叉)+ HarnessDev(评测单元翻转)+ Harness-of-Harness(持续修复 vs 能力增长)+ AI Engineers Stack 2026 6 层架构(Skills 机制)+ EarlyEval(评测成本效率化)+ EnvHarness(harness 评测延伸)形成 harness 自演化七栖预备 · 是活文档 v66 §2.165 第 109 栖 ★★★+ 升档承接) | ★★★★(3 件 e1prep 棒 + 2 件 RSS 棒 + 1 件 Substack 撞主题核验预备 = v33 首次"agent harness = context 管理 + 控制流代码"作为独立训练对象立标候选预备触发实测持续) |
| 2 | Compile by Training(arXiv:2609.04199 · cs.CL / cs.AI) | 9-5 HF Daily 早棒 256▲ #1 立标极显著首次 | ★★★★★(HF Daily 256▲ #1 立标极显著首次 · v33 首次"NL → 本地可复用神经函数编译时生成示例 + 训练小 adapter + 运行时零大模型依赖"立标极显著候选预备触发实测 · paper_card 1220 9-4 入库 ✓ 主分类 engineering 副分类 multimodal) | ★★★★★(compile-time teacher 生成 task-specific examples → 训练小 adapter for compact interpreter → runtime 零教师依赖 · 神经函数可像普通软件一样被存储 / 版本化 / 组合 · 与 LoRA / function calling / distillation 形成"端侧神经函数化"路径分叉) | ★★★★(与 World Labs Atlas(多模态世界模型)+ NeoMME(检索端侧化)+ LatentStream(流式视频潜在记忆演进)+ LatentPress(上下文压缩)+ LLaDA-Image(开放式图像生成)形成"端侧神经函数化 / 模型-推理-评估侧化"六栖预备 · 与 Token-Efficient Data Reasoning 形成"推理成本-精度 Pareto 前沿"对照预备) | ★★★★(4 件 e1prep 棒 + 1 件 radar 棒预备触发 = v33 首次"NL → 神经函数编译生成 + 端侧部署零大模型依赖"立标极显著候选预备触发实测) |
| 3 | EarlyEval(arXiv:2609.02783 · cs.CL) | 9-4 HF Daily 早棒 110▲ #5 + jay 9-4 2105 五类简报 §五 R1 | ★★★★(HF Daily 110▲ #5 立标中-高首次 · Microsoft Research 系 + Singapore Management University + ByteDance + HKUST 团队 · SWE-bench Verified + TerminalBench + Toolathlon 三基准实测 · 13-26% steps 消除 / 44.1% input tokens 消除 / 29.4% output tokens 消除 / 89-97% 预测准确率 / 1-2 pp resolve rate 影响) | ★★★★(LightGBM 分类器(success / failure 二分类)+ 行为特征 + 文本特征 + 参考解决方案特征 + 触发条件:任一分类器越过标定置信阈值时立即终止 agent 运行 · "Agent 最终结果在执行完成很早之前就可通过中间行为判断"关键洞察) | ★★★★(与 HarnessDev(评测单元翻转)+ Harness-of-Harness(持续修复 vs 能力增长)+ WHALE(harness 联合优化)+ Token-Efficient Data Reasoning(成本-精度 Pareto)+ Claw-SWE-Bench(多语言统一 harness 评测协议)+ AI Engineers Stack 2026 形成"harness 自演化五栖预备 + 评测诚信新一维" · 与 ARC-AGI 3 99.9% Provider Adapter harness 评测诚信 5 维扩展预备承接) | ★★★(3 件 e1prep 棒预备 + 2 件五类简报棒预备 = v33 首次"harness 成本效率化 = 编码 Agent 评测诚信新一维"立标候选预备触发实测) |
3 件候选不重叠方向: - WHALE:agent 训练范式(harness 联合权重优化) - Compile by Training:端侧部署范式(NL → 神经函数 + 运行时零大模型依赖) - EarlyEval:agent 评估方法学(早期终止 + 成本效率化)
3 件候选共同特征: 1. 立标信号持续增强(22→29▲ 立标中-低首次升档 / 256▲ 立标极显著首次 / 110▲ 立标中-高首次) 2. 方法学增量独立成锚(Weight-Harness 交替两阶段 / 编译时生成 + 运行时零教师 / LightGBM 早期终止) 3. 复现门槛中-高(harness 搜索空间 vs 训练成本 trade-off / 编译时教学模型成本摊销 / LightGBM 特征工程跨厂一致性) 4. 跨棒耦合密度极高(3 件都被 4-5 件其它 e1prep / critical-read / radar 棒引用)
3 件候选本周撞自己核验: - WHALE:撞 8-22 sat 棒 StateM(harness scaling 范式级)+ 8-29 sat 棒 GigaBrain-0.7(三系统架构 harness 工程化)+ 9-4 flyp critical-read NeoMME(极简对照 WHALE)+ 9-4 jay 1410 五类简报 AI Engineers Stack 2026 6 层架构 + 9-4 jay 193 agent-inference-mcp-engineering - Compile by Training:撞 9-4 jay 2105 五类简报 Token-Efficient Data Reasoning + 9-4 flyp coding-agents-e1prep §增量 1 - EarlyEval:撞 9-4 jay 2105 五类简报 §五 R1 + 9-4 flyp coding-agents-e1prep §增量 3 + 9-4 flyp 9-3 sat 棒 ToolVerse(修补 credit assignment 稀疏)
1. WHALE · Weight-Harness Alternating LEarning · agent harness 联合优化
1.1 核心论点(flyP 重述)
WHALE 提出"harness 是 agent 性能的第二条 scaling 轴,必须与权重联合优化":Agent 性能不只取决于模型参数,还取决于可执行 harness 代码(管理 context + 控制流)。单独优化任一端都会使系统被冻结的另一端所瓶颈——权重更新会改变哪类 harness 奏效,harness 更新则会改变被暴露的模型能力。
WHALE = Weight-Harness Alternating LEarning(交替两阶段): 1. Phase A:在当前 harness 下更新模型权重 2. Phase B:在当前权重下搜索更好的 harness(搜索空间不限于文本 prompt,扩展到可执行代码 + 控制流)
立标信号:HF Daily 22→29▲ 立标中-低首次升档 +7 票(9-5 HF Daily 早棒 #11)· v33 首次"agent harness = context 管理 + 控制流代码"作为独立训练对象立标候选预备触发实测持续
1.2 方法拆解(批判性视角)
| 维度 | 现有 prompt-only 联合优化(如 TextGrad / PromptAgent) | 现有 harness 固定方法 | WHALE | flyP 批判 |
|---|---|---|---|---|
| 优化对象 | 权重 + 文本 prompt | 仅权重(harness 固定) | 权重 + 可执行 harness 代码(含控制流) | harness 搜索空间扩展 = 真正的范式分叉点,但 trade-off 未量化 |
| 搜索空间 | 文本 token | 无搜索 | 可执行代码 + 控制流 = 搜索空间大幅扩张 = 组合爆炸风险 | "搜索可执行代码 = 组合爆炸"是反方 R2 必须核验项 |
| 训练范式 | 单阶段 / 双阶段 prompt tuning | SFT / RLHF | 交替两阶段(Weight-Harness) | 收敛性 vs 训练稳定性是反方 R3 必须核验项 |
| 评估证据 | prompt-level metric | downstream metric | downstream metric | "downstream metric 提升来自权重 vs harness"归因不清 |
| 与 EnvHarness 关系 | 不涉及 harness 评测 | 不涉及 | EnvHarness 是 harness 评测基准 | WHALE 训练范式 vs EnvHarness 评测范式 互补关系待核 |
1.3 实验对照
- 基座模型:krafton-ai 团队选择的具体模型未在 TLDR 披露(待 PDF §附录核)
- 下游任务:未在 TLDR 披露具体任务清单(待 PDF §附录核)
- harness 搜索空间:可执行代码 + 控制流(vs 现有 prompt-only 搜索空间)
- 对比基线:现有 prompt-only 联合优化(TextGrad / PromptAgent 系列)+ harness 固定方法
- 评测维度:下游任务性能 vs harness 搜索步数 + harness 替换前后的推理延迟增量
1.4 可信度与复现风险
可信度判断: - 形式可信度:🟡 中(v33 首次"harness = 独立训练对象"立标候选预备 + HF Daily 22→29▲ 立标中-低首次升档 +7 票立标池饱和度机制第 32 日以来极罕见升档 + paper_card 1213 9-4 入库 ✓) - 实质折扣:🟡 中(核心架构机制 trade-off 论述在摘要级完全空白 + 训练稳定性 + 收敛性 + 与 EnvHarness 系对照待核 + harness 搜索空间 vs 推理延迟待核 + harness 替换 vs 训练成本待核)
复现风险:
- 数据规模:harness 搜索空间 = 可执行代码 = 组合爆炸 = 训练成本可能极高(具体规模待 PDF §附录核)
- 算力门槛:交替两阶段训练 = 至少 2× 单阶段训练成本
- 代码透明度:GitHub 仓库 krafton-ai/WHALE 已公开(待 PDF §附录核完整 release 状态)
- 基准复现:krafton-ai 选择的 downstream metric 是否公开标准 = 待核
1.5 flyP 立场入库决策
- 立标等级:候选级 ☆ 沿用预备(vs 候选级 ★ 升档承接 = 待 PDF §附录核 harness 搜索空间 vs 训练成本 trade-off + 与 EnvHarness 系对照)
- v66 evening 沿用基线:v66 §2.165 第 109 栖 ★★★+ 升档立标承接(v66 evening 已承接立 ★★★+)+ 沿用 v77 §2.39.318 WHALE 候补占位 ☆ 沿用预备
- 后续行动:A1 接力核(PDF §附录 harness 搜索空间细节 + 训练稳定性 + 收敛性 + 与 EnvHarness 系对照)
2. Compile by Training · 神经函数编译生成 · 端侧部署零大模型依赖
2.1 核心论点(flyP 重述)
Compile by Training 提出"将自然语言规约转化为可复用神经函数,端侧部署零大模型依赖":许多重复出现的文本函数易于描述却难以用规则实现;而为每个输入调用大型远程模型会带来重复开销、延迟与对服务方的依赖。
核心创新 = compile by training = 编译时生成 + 训练小适配器 + 运行时零教师依赖: 1. Compile time(编译时):教师模型生成 task-specific examples(任务专属训练样本) 2. Train step(训练步骤):用 task-specific examples 训练小 adapter for compact interpreter 3. Run time(运行时):生成的神经函数在没有任何教师模型的情况下运行,可像普通软件一样被存储 / 版本化管理 / 组合
立标信号:HF Daily 256▲ #1 立标极显著首次(9-5 HF Daily 早棒 #1)· v33 首次"NL → 本地可复用神经函数编译时生成示例 + 训练小 adapter + 运行时零大模型依赖"立标极显著候选预备触发实测 · paper_card 1220 9-4 入库 ✓ 主分类 engineering 副分类 multimodal
2.2 方法拆解(批判性视角)
| 维度 | 现有 LoRA / adapter 微调 | 现有 distillation(teacher → student) | 现有 function calling(rule-based) | Compile by Training | flyP 批判 |
|---|---|---|---|---|---|
| 优化对象 | 同一大模型上的小 adapter | 整个学生模型 | 规则 + LLM 调用 | 小 adapter for compact interpreter | "compact interpreter" 是哪种架构?未在 TLDR 披露(待 PDF §附录核) |
| 训练样本来源 | 人工标注 / 已有数据集 | teacher soft-label | 无需训练 | teacher 生成 task-specific examples | teacher 生成样本的质量 vs 数量 vs 多样性是反方 R2 必须核验项 |
| 运行时依赖 | 大模型(base) | 大模型(student) | LLM API | 零大模型依赖 | 这是核心卖点,但"小 adapter 的泛化性边界"是反方 R3 必须核验项 |
| 部署成本 | 中(需要大模型推理) | 中-高(需要 student 大模型) | 低-中(规则 + 偶尔 LLM) | 极低(仅小 adapter 推理) | teacher 编译时成本摊销到多少 episode 才回本是反方 R4 必须核验项 |
| 可组合性 | 弱(adapter 难组合) | 弱(student 模型黑盒) | 强(规则可组合) | 强(神经函数可像软件一样版本化 / 组合) | 神经函数组合的语义保持是反方 R5 必须核验项 |
2.3 实验对照
- 基准:FuzzyBench-Hard(待 PDF §附录核完整 benchmark 列表 + 子集规模 + 难度档位)
- 教师模型:未在 TLDR 披露(待 PDF §附录核——可能是 GPT-4 / Claude 4.5 / Gemini 2.5 系列闭源模型?)
- 小 adapter 架构:compact interpreter 选型未在 TLDR 披露(待 PDF §附录核——是小型 transformer?BERT-style?还是更小的 MLP?)
- 任务域:未在 TLDR 披露(待 PDF §附录核——FuzzyBench-Hard 名称暗示"模糊文本处理"任务域,可能是命名实体识别 / 文本分类 / 情感分析 / 信息抽取)
- 评测维度:FuzzyBench-Hard 子集准确率 + 运行时推理延迟 + 部署成本($/1M 调用)+ 神经函数组合性(待 PDF §附录核)
2.4 可信度与复现风险
可信度判断: - 形式可信度:🟢 高(HF Daily 256▲ #1 立标极显著首次 = v33 首次"端侧神经函数化"立标极显著候选预备触发实测 + paper_card 1220 9-4 入库 ✓ + 完整 TLDR 描述清晰) - 实质折扣:🟡 中-高(核心架构机制 trade-off 论述在 TLDR 级部分披露但未量化 + compact interpreter 选型 + teacher 成本摊销 + 神经函数组合语义保持均待 PDF §附录核)
复现风险: - 数据规模:teacher 生成 task-specific examples 的规模 + 多样性 + 质量控制流程(待 PDF §附录核) - 算力门槛:编译时 teacher 推理 + 训练小 adapter 的总成本(待 PDF §附录核——可能 1-10 GPU-hours per function) - 代码透明度:GitHub 仓库状态未在 TLDR 披露(待 PDF §附录核——极可能开源,因为是 engineering 主分类 method) - 基准复现:FuzzyBench-Hard 是否公开数据集(待 PDF §附录核——若未公开则复现门槛高)
2.5 flyP 立场入库决策
- 立标等级:候选级 ☆ 沿用预备(vs 候选级 ★ 升档承接 = 待 PDF §附录核 compact interpreter 选型 + teacher 成本摊销 + 神经函数组合语义保持)
- v77 沿用基线:v77 §2.39.325 Compile by Training 候选 ☆ 沿用预备(v77 沿用基线已落定)+ paper_card 1220 已建立
- 后续行动:A1 接力核(PDF §附录 compact interpreter 选型 + teacher 成本摊销 + FuzzyBench-Hard 完整 benchmark 列表 + 神经函数组合性评测)
3. EarlyEval · Agent 评估成本效率化 · 早期终止 + 评测方法学新维度
3.1 核心论点(flyP 重述)
EarlyEval 提出"通过早期结果预测降低 Agent 评估成本 13-26% steps + 44% tokens":Agent 评估成本已高到难以承受——一次前沿模型在 agentic benchmark 上的推理可能耗费数百至数千美元,且在迭代开发周期中反复支付。EarlyEval 的关键洞察:Agent 的最终结果往往在执行完成很早之前就可通过中间行为判断。
核心实现 = LightGBM 二分类器 + 多模态特征 + 标定置信阈值触发: 1. LightGBM 分类器对:训练两个分类器(success / failure 二分类) 2. 多模态特征融合:行为特征 + 文本特征 + 参考解决方案特征 3. 触发条件:任一分类器越过标定置信阈值时,立即终止 agent 运行
立标信号:HF Daily 110▲ #5 立标中-高首次(9-4 HF Daily 早棒 #5)· v33 首次"harness 成本效率化 = 编码 Agent 评测诚信新一维"立标候选预备触发实测 · paper_card 待补
3.2 方法拆解(批判性视角)
| 维度 | 现有 Agent benchmark(直接跑全程) | 现有 benchmark distillation(保留任务、换小模型) | EarlyEval(保留任务、减少每个任务的执行成本) | flyP 批判 |
|---|---|---|---|---|
| 优化对象 | 单次完整运行 | 模型大小 | 执行时机(早期终止) | 与 benchmark distillation 互补可叠加使用 = 反方 R3 必须核验项 |
| 评估成本 | 高(数百至数千 USD per model per benchmark) | 中(小模型推理) | 低(13-26% steps + 44% tokens 削减) | 1-2 pp resolve rate 影响是否真"可接受 trade-off"是反方 R4 必须核验项 |
| 评估准确性 | 100% baseline | 小模型近似 | 89-97% 预测准确率 | 预测准确率 vs 任务类型 / 模型规模 / agent 类型 的关系未在摘要层披露 |
| 与 benchmark 关系 | 直接对照 | 部分替代 | 不改变任务、仅改变执行时机 | 是真正的"harness engineering"——不改变 agent 本身而是通过执行期早期判断降低评估财务成本 |
| 跨 agent 泛化 | n/a | 弱(依赖小模型能力) | 强(LightGBM 行为特征不依赖 agent 内部) | 跨 agent 类型 / 跨 agent 框架 / 跨域(GUI / SWE / terminal)的泛化是反方 R5 必须核验项 |
3.3 实验对照
- 基准:SWE-bench Verified + TerminalBench + Toolathlon 三基准实测(待 PDF §附录核三基准的版本号 + 子集规模 + 难度档位)
- 特征工程:行为特征 + 文本特征 + 参考解决方案特征(待 PDF §附录核——具体多少维?哪些特征是关键?)
- 分类器:LightGBM 二分类对(success / failure),待 PDF §附录核——超参 + 训练集大小 + 标定置信阈值
- 评测指标:
- 消除 agent steps 13-26%
- 消除 input tokens 最高 44.1%
- 消除 output tokens 最高 29.4%
- 预测准确率 89-97%
- per-agent resolve rate 仅降低 1-2 个百分点
- 团队:Zhensu Sun / Junsen Dong / Chengcheng Wan / David Lo / Xiaodong Gu(Microsoft Research 系 + Singapore Management University + ByteDance + HKUST)
3.4 可信度与复现风险
可信度判断: - 形式可信度:🟡 中-高(HF Daily 110▲ #5 立标中-高首次 + Microsoft Research 系团队 + SWE-bench Verified / TerminalBench / Toolathlon 三基准公开 + 5 项核心数字清晰) - 实质折扣:🟡 中(特征工程具体细节 + LightGBM 超参 + 跨 agent 泛化 + reference solution 泄漏审计均待 PDF §附录核)
复现风险: - 数据规模:LightGBM 分类器对的训练集大小 + 来源(待 PDF §附录核——可能 SWE-bench Verified 全集 + TerminalBench + Toolathlon 全集) - 算力门槛:极低(LightGBM 训练 + 推理 + agent 早期终止本身的节省) - 代码透明度:GitHub 仓库状态未在 TLDR 披露(待 PDF §附录核——Microsoft Research 系通常开源) - 基准复现:SWE-bench Verified + TerminalBench + Toolathlon 三基准均公开,复现门槛可控
3.5 flyP 立场入库决策
- 立标等级:候选级 ☆ 沿用预备(vs 候选级 ★ 升档承接 = 待 PDF §附录核特征工程细节 + LightGBM 超参 + 跨 agent 泛化 + reference solution 泄漏审计)
- v66 evening 沿用基线:v66 §2.165 第 132 栖 ★☆ 邻接级预备 + v66 §2.207 第 44 例预备触发 + v66 §3.1 候选新增预备共识 + v66 §3.4 「harness 成本效率化 = 编码 Agent 评测诚信新一维」预备承接触发 + v66 §4 候选新增开放问题
- 后续行动:A1 接力核(PDF §附录特征工程 + LightGBM 超参 + 跨 agent 泛化实验 + reference solution 泄漏审计)
4. 3 件候选共同特征与立标池双向锚预备
4.1 立标信号强度对比
| 候选 | HF Daily 9-4 早棒 | HF Daily 9-5 早棒 | 升档幅度 | 立标等级 | 首次/续立 |
|---|---|---|---|---|---|
| WHALE | 22▲ #13(沿用) | 29▲ #11 立标中-低首次升档 +7 票 | +7 票 | 立标中-低 | 首次升档(v33 首次 agent harness = 独立训练对象立标) |
| Compile by Training | 沿用(256▲ 9-5 早棒 #1) | 256▲ #1 立标极显著首次 | n/a(新上榜) | 立标极显著 | 首次(v33 首次 NL → 神经函数编译生成立标极显著) |
| EarlyEval | 110▲ #5 立标中-高首次(沿用) | 沿用 | n/a(新上榜) | 立标中-高 | 首次(v33 首次 harness 成本效率化立标) |
3 件立标信号综合:1 件立标极显著(Compile by Training)+ 1 件立标中-高(EarlyEval)+ 1 件立标中-低首次升档(WHALE)= 本周立标信号强度最高的 3 件候选之一集合。
4.2 方法学增量独立成锚
- WHALE:harness = 独立训练对象 = 与 model scaling 并列的第二条 scaling 轴 = v33 首次"agent harness = context 管理 + 控制流代码"作为独立训练对象立标候选预备触发实测
- Compile by Training:神经函数编译生成 = 端侧部署零大模型依赖 = v33 首次"NL → 本地可复用神经函数编译时生成示例 + 训练小 adapter + 运行时零大模型依赖"立标极显著候选预备触发实测
- EarlyEval:harness 成本效率化 = 编码 Agent 评测诚信新一维 = v33 首次"harness 成本效率化 = 编码 Agent 评测诚信新一维"立标候选预备触发实测
3 件候选都触发了 v33 首次 XX 立标候选预备触发实测 = v33 首次"本周 3 件候选全部触发首次立标候选预备"实测 = 立标池双向锚预备触发边界实测持续(第 32 日)。
4.3 跨棒耦合密度极高
- WHALE:与 7 件其它候选/工作形成耦合(NeoMME + HarnessDev + Harness-of-Harness + AI Engineers Stack 2026 6 层架构 + EarlyEval + EnvHarness + StateM)
- Compile by Training:与 6 件其它候选/工作形成耦合(World Labs Atlas + NeoMME + LatentStream + LatentPress + LLaDA-Image + Token-Efficient Data Reasoning)
- EarlyEval:与 6 件其它候选/工作形成耦合(HarnessDev + Harness-of-Harness + WHALE + Token-Efficient Data Reasoning + Claw-SWE-Bench + AI Engineers Stack 2026)
3 件候选总计耦合 19 件次 = v33 首次"3 件候选合计耦合 19 件次"实测触发 = 立标池双向锚 20 向并存预备预备触发边界实测持续(第 32 日)。
4.4 1 周回看窗口
- WHALE:3 件 e1prep 棒 + 2 件 RSS 棒 + 1 件 Substack 撞主题核验预备 = v66 §2.165 第 109 栖 ★★★+ 升档承接
- Compile by Training:4 件 e1prep 棒 + 1 件 radar 棒预备触发 = v77 §2.39.325 候选 ☆ 沿用预备
- EarlyEval:3 件 e1prep 棒预备 + 2 件五类简报棒预备 = v66 §2.165 第 132 栖 ★☆ 邻接级预备
3 件候选全部进入 1 周回看窗口 = 8-30 ~ 9-05 棒次回看窗口预备触发持续。
4.5 立标池双向锚预备触发
- WHALE:v33 首次"agent harness = context 管理 + 控制流代码"作为独立训练对象立标候选预备触发 = 立标池双向锚 20 向并存预备预备触发边界第 32 日
- Compile by Training:v33 首次"NL → 本地可复用神经函数编译时生成示例 + 训练小 adapter + 运行时零大模型依赖"立标极显著候选预备触发 = 立标池双向锚 20 向并存预备预备触发边界第 32 日
- EarlyEval:v33 首次"harness 成本效率化 = 编码 Agent 评测诚信新一维"立标候选预备触发 = 立标池双向锚 20 向并存预备预备触发边界第 32 日
3 件候选 = v33 首次"3 件候选合计触发 3 项首次立标候选预备"实测 = 立标池双向锚 20 向并存预备预备触发边界实测持续(第 32 日)。
5. 总结与后续行动
5.1 本棒结论
- 本周 3 件精读候选:WHALE(agent harness 联合优化)+ Compile by Training(神经函数编译生成)+ EarlyEval(Agent 评估成本效率化)
- 3 件候选不重叠方向:agent 训练范式 / 端侧部署范式 / agent 评估方法学
- 3 件候选立标信号:256▲ 立标极显著首次 + 110▲ 立标中-高首次 + 22→29▲ 立标中-低首次升档 +7 票
- 3 件候选方法学增量:Weight-Harness 交替两阶段 / 编译时生成 + 运行时零教师 / LightGBM 早期终止
- 3 件候选耦合密度:合计 19 件次
- 3 件候选全部进入 1 周回看窗口:8-30 ~ 9-05 棒次回看窗口预备触发持续
- 3 件候选全部触发首次立标候选预备:v33 首次"3 件候选合计触发 3 项首次立标候选预备"实测
5.2 后续验证动作(P1 缺口)
WHALE(截止 9-15):
- A1:拉 PDF §附录核 harness 搜索空间 vs 训练成本 trade-off(harness 搜索可执行代码 = 组合爆炸风险量化)
- A2:拉 PDF §附录核训练稳定性 + 收敛性 + 与 EnvHarness 系对照
- A3:拉 PDF §附录核下游任务清单 + 评测基线 + 是否公开标准 benchmark
- A4:核 GitHub 仓库 krafton-ai/WHALE 完整 release 状态
Compile by Training(截止 9-15): - A1:拉 PDF §附录核 compact interpreter 选型(小 transformer / BERT-style / MLP?关键架构选择) - A2:拉 PDF §附录核 teacher 成本摊销(teacher 编译时成本摊销到多少 episode 才回本) - A3:拉 PDF §附录核 FuzzyBench-Hard 完整 benchmark 列表 + 子集规模 + 难度档位 + 是否公开数据集 - A4:拉 PDF §附录核神经函数组合性评测 + 神经函数组合的语义保持 - A5:核 GitHub 仓库状态(极可能开源)
EarlyEval(截止 9-15): - A1:拉 PDF §附录核特征工程具体细节(多少维?哪些特征是关键?) - A2:拉 PDF §附录核 LightGBM 超参 + 训练集大小 + 标定置信阈值 - A3:拉 PDF §附录核跨 agent 泛化实验(跨 agent 类型 / 跨 agent 框架 / 跨域 GUI / SWE / terminal) - A4:拉 PDF §附录核 reference solution 泄漏审计(reference solution 是否泄漏到 SWE-bench Verified 测试集?) - A5:核 GitHub 仓库状态(Microsoft Research 系通常开源)
5.3 flyP 投票建议
- WHALE:v66 §2.165 第 109 栖 ★★★+ 升档承接(沿用 v66 evening 落定)+ 沿用 v77 §2.39.318 WHALE 候补占位 ☆ 沿用预备 · 候选级 ☆ 沿用预备 + 截止 9-15 P1 缺口补强
- Compile by Training:v77 §2.39.325 Compile by Training 候选 ☆ 沿用预备 + paper_card 1220 已建立 · 候选级 ☆ 沿用预备 + 截止 9-15 P1 缺口补强
- EarlyEval:v66 §2.165 第 132 栖 ★☆ 邻接级预备 + v66 §2.207 第 44 例预备触发 · 候选级 ☆ 沿用预备 + 截止 9-15 P1 缺口补强
6. 候选来源与本周撞自己核验
6.1 候选来源
- WHALE:tom 9-4 08:40 radar 22▲ #2 + 9-5 HF Daily 早棒 29▲ #11 立标中-低首次升档 +7 票 + paper_card 1213 9-4 入库 ✓ + arXiv 2609.00196 + GitHub
krafton-ai/WHALE - Compile by Training:tom 9-4 14:40 radar + 9-5 HF Daily 早棒 256▲ #1 立标极显著首次 + paper_card 1220 9-4 入库 ✓ + arXiv 2609.04199
- EarlyEval:jay 9-4 2105 五类简报 §五 R1 + tom 9-4 09:00 HF Daily 110▲ #5 + arXiv 2609.02783
6.2 本周撞自己核验
- WHALE 撞主题:
- 撞 8-22 sat 棒 StateM(harness scaling 范式级)—— ✅ 已识别 + flyP §1.2 引用
- 撞 8-29 sat 棒 GigaBrain-0.7(三系统架构 harness 工程化)—— ✅ 已识别 + flyP §0 候选筛选逻辑引用
- 撞 9-4 flyp critical-read NeoMME(极简对照 WHALE)—— ✅ 已识别 + flyP §1.5 沿用基线引用
- 撞 9-4 jay 1410 五类简报 AI Engineers Stack 2026 6 层架构(Skills 机制 + harness 自演化四栖预备)—— ✅ 已识别 + flyP §4.3 跨棒耦合引用
- 撞 9-4 jay 193 agent-inference-mcp-engineering —— 🟡 沿用预备 + 待 9-15 P1 复核
- Compile by Training 撞主题:
- 撞 9-4 jay 2105 五类简报 Token-Efficient Data Reasoning(28× 成本优势 §2.165 第 125 栖预备承接预备)—— ✅ 已识别 + flyP §4.3 跨棒耦合引用
- 撞 9-4 flyp coding-agents-e1prep §增量 1 —— ✅ 已识别 + flyP §4.3 跨棒耦合引用
- EarlyEval 撞主题:
- 撞 9-4 jay 2105 五类简报 §五 R1(详 jay 9-4 2105 §五 R1)—— ✅ 已识别 + flyP §3.1 引用
- 撞 9-4 flyp coding-agents-e1prep §增量 3(harness 自演化五栖预备)—— ✅ 已识别 + flyP §4.3 跨棒耦合引用
- 撞 9-3 sat 棒 ToolVerse(修补 credit assignment 稀疏)—— 🟡 远距主题(tool use vs harness 评测)—— 已识别非主线 + 不构成主耦合
6.3 独立核验工具性
- WHALE:GitHub 仓库
krafton-ai/WHALE已公开 + paper_card 1213 已建立 + arXiv 2609.00196 可独立核验(待 PDF §附录核完整 release) - Compile by Training:GitHub 仓库状态未在 TLDR 披露(待核)+ paper_card 1220 已建立 + arXiv 2609.04199 可独立核验
- EarlyEval:GitHub 仓库状态未在 TLDR 披露(Microsoft Research 系通常开源)+ paper_card 待补 + arXiv 2609.02783 可独立核验
7. 分类标签
| 候选 | 主分类 | 副分类 | 立标信号 | 标签 |
|---|---|---|---|---|
| WHALE | evaluation | agent | 22→29▲ 立标中-低首次升档 | agent, harness, training-paradigm, systems, evaluation, engineering |
| Compile by Training | engineering | multimodal | 256▲ 立标极显著首次 | engineering, systems, deployment, edge-inference, code-generation, method |
| EarlyEval | evaluation(推断) | agent | 110▲ 立标中-高首次 | evaluation, agent, benchmark, cost-efficiency, method, engineering |
3 件共同标签:agent, evaluation, engineering, systems, method, benchmark
8. 建议写入路径(GitHub-ready · 不实际写入)
notes/2026-09-05-whale-weight-harness-alternating-learning.md(WHALE 精读笔记主线 · flyP 单稿精读笔记)notes/2026-09-05-compile-by-training-neural-functions.md(Compile by Training 精读笔记主线 · flyP 单稿精读笔记)notes/2026-09-05-earlyeval-agent-evaluation-cost-efficiency.md(EarlyEval 精读笔记主线 · flyP 单稿精读笔记)notes/2026-09-05-weekly-deep-read-three-candidates-summary.md(3 件候选综合 summary · 跨棒耦合 + 立标池双向锚预备触发边界)
本棒结论:本周 3 件精读候选 = WHALE + Compile by Training + EarlyEval,立标信号 22→29▲ / 256▲ / 110▲,方法学增量独立成锚(harness 联合优化 / 神经函数编译生成 / 早期终止成本效率化),全部进入 1 周回看窗口,全部触发 v33 首次立标候选预备触发实测,全部进入立标池双向锚 20 向并存预备预备触发边界(第 32 日)。3 件候选共同特征 = 立标信号持续增强 + 方法学增量独立成锚 + 复现门槛中-高 + 跨棒耦合密度极高。flyP 投票建议 = 3 件候选均维持候选级 ☆ 沿用预备 + 截止 9-15 P1 缺口补强,待 PDF §附录核完成后评估升档承接。
本次精读棒次完整结论:本周(8-30 ~ 9-05)3 件精读候选(WHALE + Compile by Training + EarlyEval)已选 + 已结构化阅读笔记 + 已撞自己核验 + 已跨棒耦合识别 + 已立标池双向锚预备触发边界实测。本棒次已完成精读笔记主线,下一棒次(反方审稿棒)将基于本棒次精读笔记做反方硬反方化 + 1 周回看窗口判定 + 升/降/维持决策。