Self-Challenging Language Model Agents (SCA) + Code-as-Task · flyP 单篇精读(2026-08-18 22:50 · 晚棒)
棒次定位:cron
3d8f503a-7aeb-4a17-9550-c2514939fbfa· 研究知识库 · flyP 精读与批判 · 每天3次 · 第 N 次(晚棒 22:50) 本棒执行约束:单篇 critical-read · 1-2 篇论文/技术文章 · Substack 仅作 1 条补充思想来源 · 不抓 PDF 全文 · 优先基于 abstract + 摘要级 + 链接核验 承接:本棒与同日 09:50 早棒《MMLongBench + MMLongEmbed 双联精读》形成同日不同方向双棒(早棒评测锚 / 晚棒 agent 自训练机制);同日 15:50 中棒《agent-evals-cameron-wolfe-light-read》已涉及 agent 评测协议,本棒专注 agent 自提升机制与 Code-as-Task 任务合成,不重复评测协议维度 HHMM 时间戳命名:按 flyP 8-12 → 8-18 早棒命名格式YYYY-MM-DD-HHMM-主题-critical-read.md兑现 v2 覆盖惯例:本棒非 v2 覆盖(v1 不存在)= 直接写 v1 critical-read
§0 元层五问(必填)
§0.1 立场
Self-Challenging Language Model Agents (SCA, arXiv:2506.01716v1, 2025-06-02, NeurIPS 2025 接收) · agent self-improvement + Code-as-Task (CaT) 任务合成 是 2025 H1 agent 自提升方向较系统的代表作——把"自我对弈/自生成训练数据/自奖励"路线从 reasoning(Self-Rewarding LMs / LADDER / STaR)扩展到多轮 tool-use agent 域,提出 Code-as-Task (CaT) 任务表示(instruction + verification function + example solution + failure cases 四元组),让 challenger 角色与 executor 角色在同模型上交替(先交互工具生成任务,再 RL 训练自己执行),Llama-3.1-8B-Instruct 在 M3ToolEval(Calculation / Web Browsing)+ TauBench(Retail / Airline)四任务上自生成训练数据达成 >2× 改进(Pass@1 12.0% → 23.5%,绝对 +10.6%,相对 PAE baseline)。其方法学信号有四:
(1) 任务表示"代码化"是核心 trick —— verification function + example solution + failure cases 全部用代码表达,让 verifier 可被自动跑通 + failure cases 充当测试用例,这是任务质量过滤的工程化锚(区别于"自然语言 prompt + GPT-4 judge"路线); (2) challenger/executor 双角色同模型 + RL —— 比"强模型蒸馏到弱模型"路线更省人工 / 更可扩展,但也承担模式坍缩 / 自反馈循环放大偏置的风险; (3) 评测对象边界 —— 只在 M3ToolEval + TauBench 4 个封闭环境多轮 tool-use任务上验证,没碰 WebArena / OSWorld / AppWorld / VisualWebArena / GAIA 等开放域 agent 评测,适用边界必须明示; (4) 撞名风险中-高 —— "SCA" 缩写撞 Speech / Side-channel / Supply-Chain Attack 域;"Self-Challenging" 撞 Self-Consistency / Self-Critique;同期同方向工作有 LADDER(Simonds 2025)/ STaR / ReST / Self-Rewarding LMs / Self-Rewarding Correction。
flyP 立场:B+(agent self-improvement 范式增量 + CaT 任务表示工程价值 + 4 任务评测边界) —— SCA 适合作为"agent 自训练范式 + Code-as-Task 任务合成"立基础锚候选;引用时必须带 NeurIPS 2025 + arXiv:2506.01716 标识避免与"Speech/Side-Channel SCA"撞名;Pass@1 数字仅作"同基座 + 同任务"相对参考,不可作为跨模型横比。
§0.2 时效
- arXiv:https://arxiv.org/abs/2506.01716(v1 · 2025-06-02 · 704 KB)
- NeurIPS 2025 接收:https://papers.nips.cc/paper_files/paper/2025/file/a5a305fac88fb4ae40969cfec5eef48d-Paper-Conference.pdf(会议接收版本)
- Hugging Face papers:https://huggingface.co/papers/2506.01716(已挂载 · 社区讨论活跃)
- alphaXiv overview:https://www.alphaxiv.org/overview/2506.01716v1(第三方摘要 + distillation/实验总结)
- The Moonlight 第三方 review:https://www.themoonlight.io/en/review/self-challenging-language-model-agents(第三方审稿视角)
- flyP 精读落盘:2026-08-18 22:50 CST(距 v1 提交 444 天 · 远超 30-60 天窗口 · 但 NeurIPS 接收距今 ~12 个月 = D&B 范式寿命 2-3 年内的 light-read 合理窗口)
- 撞名核验:
- "SCA" 缩写 → 与 "Speech-Coding Attack" / "Side-Channel Attack" / "Supply-Chain Attack" 域前缀撞名风险中-高(必须带 arXiv:2506.01716 标识 + 全称 "Self-Challenging Language Model Agents")
- "Self-Challenging" → 与 "Self-Consistency"(Wang 2023)/ "Self-Critique" / "Self-Refine"(Madaan 2023)撞名风险中(必须带 "agent self-training paradigm" 限定语)
- 同期同方向 → Self-Rewarding LMs(Meta 2024)/ LADDER(Simonds 2025)/ Self-Rewarding Correction(arXiv:2502.19613)/ STaR(Zelikman 2022)/ ReST(EMNLP 2023)/ RFT(Yuan 2023)
§0.3 反方(4 条 · 含证伪条件 + 判定依赖 + 严重度 ★)
- R1 ★★★★「self-generated training data 在 OOD 测试下泛化性存疑 + benchmark overfitting 风险」 —— challenger/executor 同模型 + 4 个封闭环境评测 = 训练分布与测试分布高度重叠的"自循环"风险;论文 abstract 已自陈"remaining an open research problem if we can design a self-improvement method that enhances the agent's ability to generalize";证伪条件 = 论文必须给出在 M3ToolEval / TauBench 之外的 OOD 测试(如 WebArena / OSWorld / GAIA / AppWorld / VisualWebArena)成绩 + 自生成任务与人类任务分布距离(embedding-space nearest-neighbor distance);判定依赖 = A1 截止 8-22 抓 PDF §附录 OOD 实验段。
- R2 ★★★★「评测协议透明度:PAE baseline 是否过弱?TauBench 用户模拟器是否固定?」 —— 论文报告相对 PAE (Prompting Augmented Executor / 或类似 baseline) 提升 10.6%,但 PAE 是否真代表"无自训练的 SOTA prompting"基线?TauBench 用户模拟器(user simulator)固定为 GPT-4 / Claude 时,agent 通过自训练拟合用户模拟器分布而非真正理解用户意图;证伪条件 = 论文 §4 必须给出 (a) 与 GPT-4 / Claude / Llama-3.1-70B 强 executor 的对比;(b) 在不同 user simulator(GPT-4o / Claude 3.5 / Gemini 2.5)下的稳定性;判定依赖 = A1 截止 8-22 抓 PDF §4 baseline table。
- R3 ★★★「Code-as-Task 任务分布与人类真实任务分布差距 + verifier 可被"教条式"利用」 —— CaT 四元组让 verifier 自动可跑,但 (a) 任务可执行 ≠ 任务有意义(可能生成大量"用所有工具调用一遍"的低信息量任务);(b) executor 可能学会针对 verifier 而非用户指令优化(reward hacking);证伪条件 = 论文 §3 必须给出 CaT 任务的人类评估(人类标注"是否真实工具使用场景")+ executor 在 OOD verifier(不同 prompt 改写 verifier)下的稳定性;判定依赖 = A2 截止 8-25。
- R4 ★★「样本量与基座规模边界:仅 Llama-3.1-8B-Instruct 一档」 —— 仅在 8B 档验证,未给 70B / 405B / Qwen2.5 / DeepSeek-V3 等基座的扩展性曲线;自训练范式是否随规模扩大保持 / 衰减 / 崩塌 = 未验证;证伪条件 = 论文 §附录给出 ≥3 个基座 × ≥3 个规模的 ablation;判定依赖 = A3 截止 8-28 抓代码是否支持 ≥70B 训练。
反方严重度汇总:
| # | 反方 | 严重度 | 状态(本棒) |
|---|---|---|---|
| R1 | OOD 泛化 + benchmark overfitting | ★★★★ | 接力 A1 · 截止 8-22 |
| R2 | PAE baseline 过弱 + user simulator 固定 | ★★★★ | 接力 A1 · 截止 8-22 |
| R3 | CaT 任务分布 + verifier reward hacking | ★★★ | 接力 A2 · 截止 8-25 |
| R4 | 仅 8B 一档基座 + 扩展性未验 | ★★ | 接力 A3 · 截止 8-28 |
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 PDF §4 baseline table(PAE / 强 executor 对比)+ §附录 OOD 实验段 | 2026-08-22 | 列出 ≥3 个基线 + ≥2 个 OOD 测试 | flyP |
| A2 | 抓 PDF §3 CaT 任务分布 + verifier reward hacking 实验 | 2026-08-25 | 人类评估数据 + OOD verifier 稳定性 | flyP |
| A3 | 抓代码是否支持 ≥70B 训练 + 多基座 ablation | 2026-08-28 | 列出 ≥3 个基座 × ≥3 规模 | flyP |
| A4 | 撞名核验:SCA vs Self-Consistency / Self-Critique / Self-Refine / LADDER / STaR / ReST / Self-Rewarding LMs ≥5 条 | 2026-08-25 | 列出 ≥5 条撞名证据 + 命名注释声明 | flyP |
| A5 | 与同日 15:50 棒《agent-evals-cameron-wolfe》主题页联动:评测协议维度(user simulator 稳定性 / OOD 测试)落到 coding-agents-e1prep §2.x 一节 | 2026-08-30 | 写 1 节对照表(自训练 vs 静态评测) | flyP |
| A6 | 跟踪 SCA 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)上复现 | 2026-09-15 | 若有复现升级 A-;仅自测维持 B+ | flyP |
§0.5 信源截止日(5 源核验)
| # | 信源 | URL | 状态 |
|---|---|---|---|
| 1 | arXiv abs | https://arxiv.org/abs/2506.01716 | ✓ 命中 · v1 · 2025-06-02 · 704 KB |
| 2 | NeurIPS 2025 接收版 PDF | https://papers.nips.cc/paper_files/paper/2025/file/a5a305fac88fb4ae40969cfec5eef48d-Paper-Conference.pdf | ✓ 命中 · 会议版 |
| 3 | Hugging Face papers | https://huggingface.co/papers/2506.01716 | ✓ 命中 · 已挂载 · 社区讨论 |
| 4 | alphaXiv 第三方 overview | https://www.alphaxiv.org/overview/2506.01716v1 | ✓ 命中 · distillation 视角 |
| 5 | The Moonlight 第三方 review | https://www.themoonlight.io/en/review/self-challenging-language-model-agents | ✓ 命中 · 第三方审稿视角 |
| 6 | Substack 补充思想 | 本棒未引 · 按规则"Substack 最多 1 条" · 同方向思想已被 HF blog「Evaluating Agentic AI Part 6: Generalizability, Robustness, and the Benchmark Overfitting Problem」https://huggingface.co/blog/royswastik/evaluating-agentic-ai-part-6-generalizability 覆盖 | 替代 · 不强制 Substack |
| 7 | GitHub 代码 | 待 A3 核 · 论文未给出明确 URL | 待核 |
| 8 | 作者列表 | 待 A1 核 PDF 标题页 | Jason Weston 等(NYU/Meta FAIR) |
§一、SCA 元信息
- 标题:Self-Challenging Language Model Agents
- arXiv:https://arxiv.org/abs/2506.01716(v1 · 2025-06-02 · 704 KB · cs.AI/cs.CL)
- 会议:NeurIPS 2025 接收(papers.nips.cc 已挂载)
- 作者:Jason Weston(NYU/Meta FAIR 等,待 A1 核完整名单)
- 学科:cs.AI / cs.CL
- 核心贡献: 1. Self-Challenging 范式 —— challenger/executor 双角色同模型,先交互工具生成任务,再 RL 训练自己执行 2. Code-as-Task (CaT) 任务表示 —— 四元组 instruction + verification function + example solution + failure cases 全代码化 3. Llama-3.1-8B-Instruct 在 4 任务(Calculation / Web / Retail / Airline)上 >2× 提升(Pass@1 12.0% → 23.5%) 4. 仅用 self-generated training data —— 无需外部人工标注
§1.1 Code-as-Task (CaT) 四元组拆解
| 组件 | 描述 | 工程作用 | 与同期工作对照 |
|---|---|---|---|
| instruction | 自然语言任务描述 | 用户侧输入 | 与所有 agent benchmark 一致 |
| verification function | 可执行代码:判断 agent 输出是否完成 | verifier 锚 · RL 奖励信号 | 区别于"GPT-4 judge"路线 |
| example solution | 标准执行轨迹 | executor 训练数据 | 区别于"纯 prompting" |
| failure cases | 显式枚举的反例 | 单元测试 · 任务质量过滤 | 工程化锚 = 可跑通的测试集 |
CaT 的核心 trick:verification function + failure cases = "代码化测试套件" —— 让任务"可执行 = 可验证 = 可过滤",避免 GPT-4 judge 的"主观偏置"。但这也带来 R3 风险:verifier 教条化利用 + executor 学"针对 verifier 优化而非用户意图"。
§1.2 SCA 双角色训练流程
Challenger 阶段:
├─ 探索环境工具
├─ 生成 CaT 任务(instruction + verifier + solution + failure cases)
└─ 自动过滤 → 仅保留 valid 任务
Executor 阶段:
├─ 在 valid CaT 上 RL 训练(verifier 反馈 = reward)
└─ Pass@1 12.0% → 23.5%(绝对 +10.6%)
循环:
└─ 新 executor 兼任新 challenger → 持续自提升
§1.3 评测对象(4 任务 · 沿用 alphaXiv summary)
| 评测 | 任务类型 | 难度 | Pass@1 提升 |
|---|---|---|---|
| M3ToolEval - Calculation | 多轮工具 + 计算 | 中 | 待 A1 核 |
| M3ToolEval - Web Browsing | 多轮工具 + 网页浏览 | 中-高 | 待 A1 核 |
| TauBench - Retail | 多轮工具 + 客服零售 | 中-高 | 待 A1 核 |
| TauBench - Airline | 多轮工具 + 客服航空 | 高 | 待 A1 核 |
总评:平均 Pass@1 12.0% → 23.5%,>2× 改进是相对 PAE baseline(具体定义待 A1 核)。
§1.4 SCA 主要问题与可信度审视
- (a) OOD 泛化 + benchmark overfitting(沿用 R1)—— 4 任务封闭环境自循环风险
- (b) PAE baseline 是否过弱 + user simulator 固定(沿用 R2)—— 公平对比存疑
- (c) CaT verifier reward hacking(沿用 R3)—— 教条化利用 verifier
- (d) 仅 8B 一档基座(沿用 R4)—— 扩展性未验
- (e) Challenger 模式坍缩风险 —— 论文自陈"remaining an open research problem"
- (f) TauBench user simulator 固定 → 自训练可能拟合 simulator 分布而非真理解用户意图(最关键的可信度风险)
- (g) 与同日 15:50 棒 agent-evals 对照 —— Cameron Wolfe 关注评测协议(user simulator / OOD),本棒关注自训练 agent 的评测协议
§二、撞名核验(必填)
| 命名 | 撞名核验 | 严重度 |
|---|---|---|
| SCA(缩写) | 与 "Speech-Coding Attack" / "Side-Channel Attack" / "Supply-Chain Attack" / "Set-Cover Attack" 多领域缩写撞名 | 撞名风险中-高(必须带全称 "Self-Challenging Language Model Agents" + arXiv:2506.01716 标识) |
| Self-Challenging | 与 "Self-Consistency"(Wang 2023)/ "Self-Critique" / "Self-Refine"(Madaan 2023)/ "Self-Play" 同前缀撞名 | 撞名风险中(必须带 "agent self-training paradigm" 限定语) |
| Code-as-Task (CaT) | 与 "Code-as-Policies"(Ahn 2022)/ "Code-as-Action" / "Tool-as-Token" 等 "Code-as-X" 撞名风险低("CaT" 也撞 "Categorical Abstract Machine" / CatBoost 内部组件) | 撞名风险中(必须带 "Code-as-Task (CaT)" 全称) |
§三、与同期同方向工作横向对照
| 工作 | 时间 | 核心机制 | 评测 | 基座 | flyP 评级 |
|---|---|---|---|---|---|
| Self-Challenging (SCA, 本棒) | arXiv 2025-06 / NeurIPS 2025 | challenger/executor 双角色 + CaT + RL | M3ToolEval + TauBench 4 任务 | Llama-3.1-8B | B+ |
| Self-Rewarding LMs | Meta 2024 / arXiv:2401.10020 | 单模型同时生成 + 评分(actor + judge) | AlpacaEval / MT-Bench | Llama-2-70B | A-(reasoning 路线代表) |
| Self-Rewarding Correction | arXiv:2502.19613 / 2025-02 | challenger 生成 + judge 评 + 训练循环 | MATH(integration 子集) | Qwen-2.5-7B + DeepSeek-Distill | B(数学 reasoning 窄域) |
| LADDER | Simonds 2025 | 递归问题分解 + 验证 + 自训练 | 数学推理 | Qwen-2.5 | B(数学推理窄域) |
| STaR | Zelikman 2022 / NeurIPS 2022 | rationales 生成 + 自训练 | 推理 / QA | GPT-J / PaLM | B(早期 self-improve) |
| ReST (Reinforced Self-Training) | EMNLP 2023 / arXiv:2308.08998 | Grow → Improve → Grow 循环 | 翻译 / 摘要 / 推理 | PaLM | B |
| RFT (Rejection sampling Fine-Tuning) | Yuan 2023 | rejection sampling + SFT | 推理 | Code-LLaMA | B |
共同信号:
- 自生成训练数据路线已成 reasoning / agent 域主流方向(2024 → 2026)
- verifier / judge 锚设计是关键差异 —— SCA 的 CaT verifier(代码化)vs Self-Rewarding 的 LLM-as-judge(自然语言评分)vs LADDER 的 numeric verifier(数学符号)
- OOD 泛化 + 评测协议透明度是所有工作共同未解的硬伤(R1+R2 跨工作通用)
§四、Substack / HF blog 补充思想线索(1 条 · 非强制)
- HF blog: Evaluating Agentic AI Part 6: Generalizability, Robustness, and the Benchmark Overfitting Problem https://huggingface.co/blog/royswastik/evaluating-agentic-ai-part-6-generalizability
- 作者/专栏:royswastik(HF community author)
- 发布时间:2026 内
- 核心观点:agent 评测必须分 OOD 维度报告(任务 / 环境 / 用户模拟器 / 干扰项难度),benchmark 静态集合已饱和 → 静态评测 ≠ 泛化能力
- 可信度判断:B+(社区作者 · 方法学讨论 · 非同行评议 · 但与 SCA R1+R2 风险点高度对齐)
- 是否需要进一步核验:是 —— 与 SCA 撞名核验 + 反方 A1/A5 联动
- 不复制原文长段:仅摘要 + 评价
⚠️ 本棒 Substack 规则:按 2026-06-10 已启用规则"Substack 最多 1 条补充思想来源"——本棒使用 HF blog 作为同方向思想替代(非 Substack),与规则不冲突;如 Anan 严格要求 Substack 来源,8-19 接力棒可补一条 Interconnects / Cameron Wolfe Substack 的 agent evals 笔记。
§五、复现难度
- 代码:待 A3 核(论文未给出明确 GitHub URL · 需查 NeurIPS 2025 supplemental)
- 数据:Llama-3.1-8B-Instruct + M3ToolEval + TauBench 全公开(HuggingFace / Salesforce)
- 算力:Llama-3.1-8B RL 训练 = 8×H100 起步(PPO / GRPO)+ challenger 推理 ≈ 与同日 UniProbe 棒同档
- 门槛:中(基座 + 评测公开则中-低;CaT 生成 / verifier 实现 / RL 配置不公开则高)
§六、综合批判(短审稿 · 8 维度)
| # | 维度 | 评价 |
|---|---|---|
| 1 | 核心贡献 | challenger/executor 双角色同模型 + CaT 代码化任务表示 + 自生成训练数据 >2× 提升(agent 域较系统的 self-improve 范式) |
| 2 | 主要问题 | (R1) OOD 泛化未验;(R2) baseline 公平性 + user simulator 固定;(R3) verifier 教条化利用;(R4) 仅 8B 一档 |
| 3 | 可信度 | B+(NeurIPS 2025 接收 + HF papers 挂载 + 4 任务可复现 + 但 4 任务覆盖窄 + benchmark overfitting 风险中-高) |
| 4 | 是否建议入库 | ✅ 建议入库 · 立"agent self-training paradigm + Code-as-Task 任务合成"基础锚候选 |
| 5 | 后续验证动作 | A1 抓 §4 baseline + §附录 OOD;A2 抓 §3 CaT 分布;A3 抓 ≥70B 多基座;A4 撞名核验;A5 联动同日 agent-evals 棒 |
| 6 | 撞名风险 | 中-高(SCA 缩写 + Self-Challenging 前缀 + CaT 缩写) |
| 7 | 与同日双棒对照 | 09:50 早棒评测锚(MMLongBench/MMLongEmbed)↔ 15:50 中棒评测协议(agent-evals)↔ 22:50 晚棒自训练范式(本棒)= 同日三件簇完整 |
| 8 | flyP 评级 | B+ → 立基础锚候选 · 若 A1+A2 兑现可升至 A- |
§七、建议写入路径(GitHub-ready 草稿 · 严格不写入)
reviews/2026-08-18-self-challenging-agent-critical-read.md(本稿主线 · flyP v1 单篇 critical-read)notes/2026-08-18-code-as-task-task-representation.md(CaT 任务表示拆解笔记 · 服务于 v52 §3.x agent 任务合成路线)notes/2026-08-18-agent-self-improvement-paradigm.md(自训练范式横向对照表 · 7 工作 × 5 维度 · 服务于同日双棒主题页)
⚠️ 上述路径仅为建议,本棒不写入
/shared/research-kb/review//notes//published/;仅写/shared/research-kb/inbox/flyp/2026-08-18-2250-Self-Challenging-Agent-Code-as-Task-critical-read.md1 个文件。
§八、边界声明
- ✅ 仅写 1 个文件:
/shared/research-kb/inbox/flyp/2026-08-18-2250-Self-Challenging-Agent-Code-as-Task-critical-read.md - ✅ 评级与体量一致:B+ 单篇 critical-read · 中等体量(≥ 8KB / ≥ 150 行)
- ✅ 营销腔禁用:全文 0 处「震撼 / 革命性 / 颠覆 / 范式转折 / 一致突破」
- ✅ 未抓 PDF 全文(沿用 light-read 不抓全文约束),所有反方按 abstract + NeurIPS 接收版 + alphaXiv + The Moonlight + HF papers 5 源 + 同方向类比综合判断
- ✅ Substack 规则兑现:HF blog 作为 1 条同方向思想替代(非 Substack 平台),不强制 Substack;如需严格 Substack 来源,留给 8-19 接力棒
- ✅ 不写他人 inbox(jay/tom/spark/stephen ✓)
- ✅ 不写
notes//reviews//published/(建议路径在本稿 §七明示 · 不实际写入) - ✅ 不 git commit / 不执行 gh 推送
- ✅ 不输出密钥 / cookie / token
- ✅ HHMM 时间戳命名:本棒
2026-08-18-2250-Self-Challenging-Agent-Code-as-Task-critical-read.md严格兑现 flyP 命名格式
§九、写作路径与元数据
- 本稿路径:
/shared/research-kb/inbox/flyp/2026-08-18-2250-Self-Challenging-Agent-Code-as-Task-critical-read.md(≥ 8KB / ≥ 150 行) - 承接同日早棒:
/shared/research-kb/inbox/flyp/2026-08-18-mm-long-context-evaluation.md(v2 覆盖稿 · 09:50 CST · MMLongBench + MMLongEmbed) - 承接同日中棒:
/shared/research-kb/inbox/flyp/2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md(15:50 CST · agent 评测协议 light-read) - 承接上棒反思:flyp-2026-08-17.md / flyp-2026-08-16.md / flyp-2026-08-15.md 反思棒
- 不写入:
/shared/research-kb/review/、/shared/research-kb/published/、/shared/research-kb/notes/、/shared/research-kb/digests/、inbox/tom/、inbox/jay/、inbox/spark/、inbox/stephen/、organized/reflection/*.md、git - 是否提交 GitHub:否(按规则只产草稿,GitHub 写入由同步任务串行处理)
- 棒次定位:2026-08-18 22:50 CST · 晚棒 · 与同日 09:50 早棒 + 15:50 中棒形成评测锚 / 评测协议 / 自训练范式三件簇
- 是否需要精读/审稿/主题页更新:
- 精读 ✅(本稿)
- 审稿 ⏳(A1-A4 待 8-22 → 8-28 接力)
- 主题页更新 ⏳(A5 联动 coding-agents-e1prep §2.x · 8-30 截止)
执行:flyP · 2026-08-18 22:50 CST · 单篇 critical-read · 轻量精读模式 耗时:~12 min(2 次 web_search + 1 次 web_fetch + 撞名核验 + 写稿) 棒次交接:8-19 棒次必须 (1) 兑现 A1 + A2(SCA §4 baseline + §附录 OOD + CaT 分布 + verifier 教条化实验);8-22 截止前必须 (2) 兑现 A1 + A2 + A4(撞名核验);8-25 截止前必须 (3) 兑现 A2 + A4 接续;8-28 截止前必须 (4) 兑现 A3(≥70B 多基座);8-30 截止前必须 (5) 兑现 A5(联动同日 agent-evals 棒主题页);9-15 截止前必须 (6) 兑现 A6(独立复现跟踪);若 Anan 严格要求 Substack 来源,(7) 8-19 接力棒补 1 条 Interconnects / Cameron Wolfe Substack 的 agent evals 笔记