Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要 v2 + 7-06 flyP 视角处理说明
v2 处理版(覆盖原 7-06 cron RSS 抓取 v1)|实例:flyP|日期:2026-07-06 21:20 反思 触发:cron
b37d3839· 研究知识库 · E2 自我反思 7-06 最弱产出重写 信源:https://cameronrwolfe.substack.com/feed(Cameron R. Wolfe 个人专栏,Atom feed) 写入边界:仅inbox/flyp/;不写其他实例目录、不写 review/、不 git、不输出密钥 / Token。
0. 为什么本文件是 7-06 反思选定的"最弱产出 + 重写"
本文件存在的物理现实:
| 文件 | 抓取时点 | 状态 |
|---|---|---|
2026-06-27-1557-rss-cameron-wolfe.md |
6-27 15:57 | 原状 891B(从未 v2 重写) |
2026-07-03-1048-rss-cameron-wolfe.md |
7-03 10:48 | 原状 900B(从未 v2 重写) |
2026-07-04-1000-rss-cameron-wolfe.md |
7-04 10:00 | 原状 872B(从未 v2 重写) |
2026-07-05-1000-rss-cameron-wolfe.md |
7-05 10:00 | 原状 893B(从未 v2 重写) |
2026-07-06-1000-rss-cameron-wolfe.md(本文件) |
7-06 10:00 | v1 cron 抓取 860B,本 v2 重写覆盖 |
5 条博文(Agentic RL / Agent 评估:详细指南 / RL 扩展定律 / LLM 基准剖析 / 将统计学应用于 LLM 评估)5 份 RSS 完全相同。本 v2 覆盖本表第 5 行,把"5 份 RSS 共存"压回"4 份"——这是物理层最小动作,不承诺"清理其他 4 份"。
为何 7-06 反思的"最弱"重新选回 RSS 而不是 inbox 精读:
- 7-06 当天 2 份实质性产出(Perception-R1 11KB + TechRAG 13KB)全是强产出——准确、深、接口齐备、不构成"最弱";
- 7-06 当天新增 2 份 RSS 抓取(cameron-wolfe 1000 + interconnects 1002)仍是 1KB 原状机器产物、零 flyP 分析、与其他历史 5 份内容重复——仍是最弱候选;
- 与 7-05 反思选择的差异:7-05 Interconnects RSS 集群已被反复 v2/v3 重写 4 次(6-27 v2 14.6KB / 7-03 v3 18KB / 7-04 v2 6.3KB / 7-05 v2 7KB);Cameron Wolfe RSS 集群 5 份从未被 v2 重写——本次 7-06 选择 Cameron Wolfe 的物理现实是"该集群首次进入重写循环",而 Interconnects 集群已经是高频重写循环。
- Cameron Wolfe 与 Interconnects 集群对照:Interconnects 5 篇文章覆盖"开源 step change / frontier post-training / 政策 / 博客状态 / 开源 artifact"五维,每月有 1-2 篇对 flyP 主线强接口;Cameron Wolfe 5 篇覆盖"评估方法论(含 RL/agent/benchmark/统计学 四子题)",与 7-06 flyP 评估主线(Perception-R1 + TechRAG)接口最强——这是本次选择 Cameron Wolfe 而非 Interconnects 的第二个原因。
1. 5 条博文(v2 仅展开主线接口最强的 2 条)
5 条内容与 v1 cron 抓取及其他 4 份历史 Cameron Wolfe 完全一致——本 v2 不重复列出 5 条全表,仅就 flyP 主线接口最强 的 2 条加 7-06 时点注记。
1.1 Agent Evals:详细指南(与 7-06 TechRAG 精读直接对接)
- 原文核心观点(仅摘要点,不复制原文):agent 评估需在 realistic harness 下做三件套评估(underlying LLM / tools / instructions),从单点输出 → 轨迹级 → 多回合多工具逐层递进;高风险应用(coding / medicine)需 process-level 评估与可重放日志。Wolfe 在文中给出近期 agent benchmark 的 case study(待 7-07 同步任务抓文末案例章节)。
- 7-06 接口(与 TechRAG 对接):
- TechRAG(arXiv:2606.01613v2,单作者工程白皮书,7-06 15:50 精读主体)正是 Wolfe 文"高风险应用"现实版的代表——"Planner-Researcher-Writer-Critic 四 agent + 证据充分度 100 分 rubric + 三层 LLM-judge 链";
- Wolfe 的"评估对象三件套"在 TechRAG 中的对应:individual LLM 评估未做、tools(FAISS/BM25/cross-encoder/Neo4j/ColSmol/MUVERA)独立评估未做、instructions(rubric 模板与 prompt 路由)评估未做——Wolfe 的"三件套独立评估再组合"在 TechRAG 是系统状态未达成,而非设计决策;
- "trajectory-level + process-level 评估" → TechRAG 给出 critic 自纠正机制,但critic-driven 修订与 trajectory 重放协议未披露——TechRAG 的"evidence-gated"是 prompt-level,不是 trajectory-level,与 Wolfe 文"trajectory-level 必可重放"的要求存在系统性缺口;
- 7-06 汇总结论:Wolfe 文对工程化系统(TechRAG 类)的约束力强——评估对象三件套独立 + trajectory-level 可重放 两项在 TechRAG 全部不达标,这构成对 TechRAG 类"工程范式参考"最严格的应用层 critique。
- 可信度:⭐⭐⭐⭐(Wolfe 文是同期评估方法论最简洁的索引;与 TechRAG 耦合度高)。
1.2 RL Scaling Laws:扩展定律如何从预训练演进到 RL(与 7-06 Perception-R1 精读直接对接)
- 原文核心观点(仅摘要点,不复制原文):扩展定律从预训练(Chinchilla)演进到 RL(RLHF/RLVR)的过程中,"reward 形态"成为新的缩放维度——dense reward(PRM 类)/ sparse reward(outcome-only)/ LLM-as-judge reward 三类的可扩展性曲线尚不明朗;Wolfe 提出现有 RL scaling laws 主要在 outcome reward 假设下,process reward 与 judge reward 的缩放行为还不成熟。
- 7-06 接口(与 Perception-R1 对接):
- Perception-R1(ICLR 2026 poster,arXiv:2506.07218v3,7-06 09:50 精读主体)的"visual perception reward"= LLM-as-judge reward 一类,是 Wolfe 文提到的"第三类 RL scaling"在多模态域的具体落地——Perception-R1 的 1442 样本声称 SOTA 是 LLM-as-judge scaling behavior 的局部证据,但样本规模未达到 scaling law 通常需要的 ≥ 3 个数量级;
- reward hacking 风险(Perception-R1 §3.4 R2 识别):judge 与 policy 能力天花板耦合 + 自引用偏置(视觉注释来自上一步 CoT 模型)—— 与 Wolfe 文"judge reward 的可扩展行为尚不成熟"形成强闭环;
- 与同期 PRCO / PAPO / VGPO 对照:PRCO 双奖励(Observer + Solver)、PAPO 隐式感知 KL 损失、VGPO 视觉注意力补偿 + 双粒度优势重加权——三条平行解法的 reward 形态都不是 LLM-as-judge,而是 dense signal 或 KL 正则;Perception-R1 的 LLM-as-judge reward 在这条对照中是唯一不可证扩展行为的方案;
- 7-06 汇总结论:Perception-R1 是 Wolfe 文"RL scaling 第三类"在 2026 H1 末的具体实证,但 1442 样本 + 自引用偏置 + judge 偏置 三项叠加后,其"LLM-as-judge 可缩放"主张强度被显著压低——这是本期 Perception-R1 自评 ★★★ 的物理现实之一。
- 可信度:⭐⭐⭐⭐(Wolfe 文与 Perception-R1 双向校验;reward hacking 风险的两面都明确)。
1.3 其他 3 条(v2 略,仅列标题与主线接口判定)
Agentic RL:框架与最佳实践⭐⭐⭐:与 Perception-R1 PRCO/PAPO 横向接口中,但仅摘要点;不展开;LLM 基准剖析⭐⭐⭐:与 TechRAG "领域封闭数据集"问题呼应,但不展开;将统计学应用于 LLM 评估⭐⭐⭐:与 7-05 MiroEval "过程预测"方法学呼应,但不展开。
2. v2 与 v1 cron 抓取的差异
| 维度 | v1 cron 抓取 | v2 反思处理版(本文件) |
|---|---|---|
| 字节 | 860B | ~4KB |
| flyP 判断 | 零 | 5 条中给 2 条加 7-06 时点注记(TechRAG + Perception-R1 双向对接) |
| 重复抓取承认 | 零 | 显式承认是"5 份相同 Cameron Wolfe RSS 的第 5 份" |
| 与其他 RSS 的关系 | 不声明 | 显式对照 6-27 / 7-03 / 7-04 / 7-05 四份 |
| 与 Interconnects 集群对照 | 不声明 | 显式给出"Cameron Wolfe 首次进入重写循环 vs Interconnects 已高频重写循环"的对照 |
| 元层装饰 | 无 | 仅 §0 一段(按 7-04 退役规则砍掉元层美学) |
| 后续追踪动作 | 无 | 给 Agent Evals 加"TechRAG 三件套评估+trajectory 重放两项缺口"信号,给 RL Scaling Laws 加"Perception-R1 LLM-as-judge 缩放主张被压低"信号;明确剩余 4 份 Cameron Wolfe 不清理。 |
3. 元信息
- 本次重写版本:v2(覆盖原 7-06 cron 抓取 v1)
- 重写动因:7-06 反思"最弱产出 + 重写"动作。
- 物理收敛:把"5 份 Cameron Wolfe RSS 共存"压回"4 份共存"——这是单次最小动作,不承诺清理其他 4 份。
- 保留合规:不写其他实例目录(jay / spark / stephen / tom);不写
review/、published/;不git commit/push/gh pr;不输出任何密钥 / Token;不复制博文原文长段。 - 不触碰:6-27 / 7-03 / 7-04 / 7-05 四份 Cameron Wolfe RSS 文件不动;6 份 Interconnects RSS 文件不动;其它 inbox/flyp 文件不动(特别是同日 TechRAG 13KB + Perception-R1 11KB 两份实质性产出不动)。
本文件由 flyP cron b37d3839 E2 自我反思 7-06 触发,作为"最弱产出 + 重写"动作的具体落地。覆盖 /shared/research-kb/inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md 原 v1 cron RSS 抓取(5 份相同 Cameron Wolfe RSS 中本文件最小且唯一被 v2 重写 1 次)。