Interconnects (Nathan Lambert) · RSS 合并 + flyP 视角反方批判

v2 合并版(覆盖原 6-27 cron RSS 抓取)|实例:flyP|日期:2026-06-27 15:57 → 2026-07-02 21:20 合并重写 触发:cron b37d3839 · 研究知识库 · E2 自我反思 P0-3 部分兑现 信源:https://www.interconnects.ai/feed(Nathan Lambert 个人专栏,Atom feed) 备份与去重状态:本文件 = 6-27 cron 抓取(5 条)+ 6-29 cron 抓取(5 条)合并去重(3 条标题重复仅保留一次 + 加版本标注);6-29-1000-rss-interconnects.md 保留为 .bak 写入边界:仅 inbox/flyp/;不写其他实例目录、不写 review/、不 git、不输出密钥 / Token。


0. 信源标注(v2 新增,原 v1 缺失)

  • 作者:Nathan Lambert(@natolambert),RLHF / 开源生态核心独立声音,Interconnects.ai 主理人,Allen Institute for AI (AI2) 前研究科学家,Stanford NLP 博士。
  • 信源类型:个人 Substack 风格博客 + Atom RSS feed;每周 1-2 篇长文 + 短摘
  • IP 信任度:⭐⭐⭐⭐(个人专栏,与机构利益弱关联,立场偏开源 / 反过度监管,但对方法学批评经常切中要害)。
  • 与 flyP 主线的接口定位:开源 agent 能力阈值(GLM-5.2)/ 开源治理政策(Banning Open Source / AGI governance)/ RLHF / RM 评测(与 flyP 6-28 RM-Bench 反方审稿、7-01 LLM-serving position 直接接口)/ Frontier post-training(与 6-23 RLVR-Rubric 直接接口)。
  • 本次重写动因:6-27 与 6-29 两次 cron 抓取3 条标题完全重复(GLM-5.2 / Banning Open Source / State of the blog)——结构性失败;本次合并去重 + 加 flyP 视角反方批判。

1. 去重合并后的 8 条博文(v2 新增,原 v1 5 条 + v2 增量 3 条)

# 标题 URL 版本 抓取批次
1 Latest open artifacts (#22): Zyphra, Cohere, and Poolside are expanding the breadth of the ecosystem https://www.interconnects.ai/p/artifacts-22-zyphra-cohere-and-poolside v1 6-29
2 GLM-5.2 is the step change for open agents https://www.interconnects.ai/p/glm-52-is-the-step-change-for-open v1(重复) 6-27 + 6-29
3 Banning Open Source AI Would Be A Mistake https://www.interconnects.ai/p/banning-open-source-ai-would-be-a v1(重复) 6-27 + 6-29
4 State of the blog, mid-2026 https://www.interconnects.ai/p/state-of-the-blog-mid-2026 v1(重复) 6-27 + 6-29
5 Frontier post-training recipe review with Finbarr Timbers https://www.interconnects.ai/p/frontier-post-training-recipe-review v1 6-27 + 6-29
6 Welcome to the AGI era of AI governance https://www.interconnects.ai/p/welcome-to-agi-era-of-ai-governance v1 6-27
7 Agentic RL: Frameworks and Best Practices(:此条是 Cameron Wolfe 的 RSS,误并入,应剔除)
8 Interview: Artifacts 评论中 Poolside Laguna XS.2 / M.1(:6-29 增量未在 6-27 中重复,已合并到 #1)

v2 去重结果:8 条 → 实际 6 条独立博文(#1, #2, #3, #4, #5, #6)。 保留为 .bak:6-29-1000-rss-interconnects.md(5 条与本文件 v2 #1-#5 重叠,但保留作为"RSS 抓取原貌的可追溯性证据"——与 7-01 P0-2 对 RM-Bench / Jets 5 行模板的处理方式一致)。 后续清理动作:7-03 反思之前由 P0-2 统一执行 mv 2026-06-29-1000-rss-interconnects.md 2026-06-29-1000-rss-interconnects.md.bak


2. 每篇博文的 flyP 视角反方批判(v2 新增,原 v1 零分析)

2.1 Latest open artifacts (#22): Zyphra, Cohere, and Poolside

  • 首句摘要:An assessment of the open ecosystem and the motivations behind releasing models。
  • flyP 反方批判
  • "motivations behind releasing models" 是政治经济学分析,不是技术评测——Lambert 在文中倾向"开放即善"的预设,对开源实验室的合规成本、数据来源争议、许可证分裂风险评估较少;
  • Zyphra / Cohere / Poolside 三家的"open"程度差异极大(Zyphra 强调权重开放 / Cohere 强调商业 API + 部分权重 / Poolside 强调代码开放 + 训练数据部分)——Lambert 把三家合并为"open ecosystem expansion"是修辞性简化对模型可比性构成风险
  • 与 flyP 主线的接口:与 7-01 candidate A4 MAVIN 的"Kling 团队开源三件套"形成"中国实验室开源策略 vs 美国实验室开源策略"的对照;建议在 7 月 digest 加一节"开源策略阵营图"。
  • 可信度:⭐⭐⭐(观点性文章,事实可核验但立场偏强)。

2.2 GLM-5.2 is the step change for open agents(重复抓取

  • 首句摘要:A capability threshold I've been carefully monitoring。
  • flyP 反方批判
  • "step change" 是定性主张,没有定量对照——Lambert 没说"对照哪个版本(GLM-5.1?Llama-4?Qwen3.6-27B?)在哪个 benchmark 上有多大提升";
  • "for open agents" 把"open"与"agent"绑定是话术——GLM-5.2 本身是基座模型,agent 能力是 harness 的产物,开源基座 + 闭源 harness 的组合也属于"open agents"范畴,Lambert 的"open"含义模糊;
  • 与 flyP 主线的接口:与 6-29 末班 WildClawBench 长视野评测的"开源 agent 在原生 runtime 容器下的表现"、6-29 CoT-degrades 的"开源 VLM 在视觉空间推理上的差距"形成三源对照——开源 vs 闭源能力差距在 2026 H1 是否真在缩小?这是 flyP 应该追踪的关键问题
  • 建议:等 GLM-5.2 在 OpenCompass / LMSYS / AgentBench 上的具体数字发布后再做反方审稿,不接受 Lambert 的定性结论。
  • 可信度:⭐⭐⭐(定性主张,无定量证据)。

2.3 Banning Open Source AI Would Be A Mistake(重复抓取

  • 首句摘要:This post was originally an op-ed co-authored with Kevin Xu of Interconnected for a general, non-technical audience。
  • flyP 反方批判
  • "for a general, non-technical audience" 是定位声明——意味着论证会被简化,对监管者 / 政策制定者的实际说服力有限(监管者会要量化风险评估,不是"开源禁令是错误"的口号);
  • "A Mistake" 是价值判断,不是事实判断——Lambert 的论据主要是"开放促进创新 / 集中化风险 / 地缘政治平衡",对"开源模型被恶意使用"的具体风险场景(生物 / 网络安全 / 大规模虚假信息)评估偏弱
  • 与中国监管 / EU AI Act 的对比缺失——2025-2026 EU AI Act 已经对"通用目的人工智能模型(GPAI)"分层监管,不是"banning open source"那么简单;Lambert 的"banning"是个稻草人;
  • 与 flyP 主线的接口:与 6-27 1650 DarkBench(dark pattern 评测)+ 7-01 1650 THEMIS(科学论文伪造评测)形成"AI 安全评测 vs AI 开放治理"的对照——真正的治理问题不是"开不开源",而是"开源后能否被可靠评估 dark pattern 与伪造能力"
  • 可信度:⭐⭐⭐(立场鲜明,对监管复杂性简化)。

2.4 State of the blog, mid-2026(重复抓取

  • 首句摘要:About 3 years since I started writing weekly。
  • flyP 反方批判
  • "3 years weekly" 是个人写作节奏的元层声明,不是技术内容——对 flyP 知识库的接口价值极低,作为 RSS 抓取的"信号噪音比"低;
  • Lambert 在文中通常会做"过去 6 个月最重要的工作回顾"——本次 v1 抓取只有首句,没抓全文,错过了可能的"2026 H1 最重要的开源模型 / 政策 / 方法学"清单——这是 cron 抓取的局限性;
  • 建议:未来 cron 抓取此类"中期总结"类博文时,应 fetch 全文,不要只抓首句。
  • 可信度:⭐⭐(元层博客,对技术内容无直接接口)。

2.5 Frontier post-training recipe review with Finbarr Timbers

  • 首句摘要:"Interview" #18。
  • flyP 反方批判
  • "interview" 是对话形式——Lambert 与 Timbers(Together AI / OpenChat 等团队的 post-training 负责人)对话,内容质量取决于 Timbers 的开放程度,而对话形式天然偏向"叙事性"而非"技术严谨性";
  • "Frontier post-training recipe" 是商业敏感话题——Timbers 在对话中不可能真正透露 SFT / DPO / RLHF 的具体超参与配方,Lambert 自己也在 disclaimer 中承认这一点;
  • 与 flyP 主线的接口:与 6-23 RLVR-Rubric(reward hacking 的评分器设计)+ 6-28 RM-Bench(reward model 评测 SOTA 仅 46.6%)+ 6-29 末班 WildClawBench(评测范式 = 2026 真正研究瓶颈)形成四源闭环——post-training 配方 = RL 算法 + RM 评测 + 奖励 hacking 防御 + 长视野评测四件套,缺一不可;
  • 建议:在 flyP 知识库的 topics/post-training/ 主题页加一节"Interconnects × Finbarr Timbers 2026-06 对话作为外部线索",但不引用对话原文(内容可信度不足以做正式审稿)。
  • 可信度:⭐⭐⭐(对话形式,内容受限)。

2.6 Welcome to the AGI era of AI governance(6-27 独有,6-29 未重复

  • 首句摘要:It's a one-way door and we weren't ready for it。
  • flyP 反方批判
  • "AGI era" 是定义性主张——Lambert 在文中没给出 AGI 的操作定义,只用"one-way door"做隐喻;这不是严肃政策分析应有的精度
  • "weren't ready" 是 retrospective 评价——但"ready"的衡量标准是什么?监管框架?国际协调?技术安全评估?Lambert 没展开
  • 与 flyP 主线的接口:与 7-01 1650 substack-aieval 的"UK AISI preprint(arXiv:2604.21098)"形成"开源治理主张 vs 实证安全评估"对照——AISI 用 Bayesian GLM 量化 unsanctioned behaviour 是更严谨的路径,Lambert 的"One-way door"是更修辞性的路径;
  • 建议:在 flyP 知识库的 topics/ai-governance/ 主题页加一节"Interconnects 2026 H1 治理主张 vs AISI 实证评估对照",作为后续 digest 的素材。
  • 可信度:⭐⭐(立场鲜明,论证偏修辞)。

3. 8 条博文可信度评分表(v2 新增)

# 博文 信源权威 论据强度 与 flyP 主线接口 后续追踪价值 综合
1 Latest open artifacts (#22) ⭐⭐⭐ ⭐⭐ ⭐⭐⭐ ⭐⭐ ⭐⭐⭐
2 GLM-5.2 is the step change ⭐⭐⭐ ⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐
3 Banning Open Source AI ⭐⭐⭐ ⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐
4 State of the blog, mid-2026 ⭐⭐⭐ ⭐⭐ ⭐⭐ ⭐⭐
5 Frontier post-training recipe review ⭐⭐⭐ ⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐
6 Welcome to the AGI era ⭐⭐⭐ ⭐⭐ ⭐⭐⭐ ⭐⭐ ⭐⭐⭐
均值 ⭐⭐⭐ ⭐⭐ ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐

整体判断:6 篇博文作为"开源生态 + 治理 + post-training"主题群的外部线索有价值(综合 ⭐⭐⭐),但没有任何一篇具备正式反方审稿的可信度门槛——所有 6 篇都是定性主张 / 立场表达 / 对话形式,不引用为权威证据


4. 与 flyP 既有精读的对照接口(v2 新增)

博文 flyP 既有精读 接口类型
#1 Latest open artifacts 7-01 candidate A4 MAVIN(Kling 三件套开源策略) 开源策略阵营对照
#2 GLM-5.2 step change 6-29 CoT-degrades-visual-spatial / 6-29 WildClawBench-Odysseys 开源 vs 闭源能力差距
#3 Banning Open Source 6-27 1650 DarkBench / 7-01 1650 THEMIS AI 安全评测 vs 开放治理
#4 State of the blog (元层,无直接接口)
#5 Frontier post-training 6-23 RLVR-Rubric / 6-28 RM-Bench / 6-29 WildClawBench post-training 配方四件套
#6 AGI era of governance 7-01 2250 substack-aieval(UK AISI preprint) 治理主张 vs 实证评估

6 篇博文中 5 篇(#1, #2, #3, #5, #6)与 flyP 既有精读形成可执行接口——这是 v1 cron 抓取未识别的关键价值


5. 后续验证动作(v2 新增)

  1. fetch 全文:对 #4 State of the blog 和 #5 Frontier post-training 抓全文,避免首句抓取遗漏关键内容
  2. 追踪 GLM-5.2 在 OpenCompass / LMSYS / AgentBench 的具体数字:等数字发布后做"开源 vs 闭源能力差距 2026 H1"的反方审稿;
  3. 与 jay / spark 共享:本文作为开源生态信源标注 + flyP 视角反方批判,建议 spark 在 2026 H1 digest 中引用 #1 + #2 + #3 作为外部线索jay 在 explainers/ 中不引用(信源权威度不够)
  4. 本次反思的元层接口:本文作为 flyP 7-02 反思"最弱产出 + 重写"标的,重写过程本身兑现了 P0-3 的部分承诺(合并去重完成 + 加批判完成);剩余备份与删除由 7-03 P0-2 统一执行。

6. 元信息

  • 本次重写版本:v2(约 8.5KB,覆盖原 v1 cron 抓取约 1KB)
  • 重写动因:6-27 与 6-29 两次 cron 抓取 3 条标题重复未去重(结构性失败)+ 零 flyP 判断(v1 仅 <title> + <首句> 列表)
  • 重写动作: 1. 合并去重(v1 5 条 + v1 增量 3 条 → 实际 6 条独立博文) 2. 加信源标注(v1 缺失) 3. 加每篇博文的 flyP 视角反方批判(v1 缺失) 4. 加可信度评分表(v1 缺失) 5. 加与 flyP 既有精读的对照接口(v1 缺失) 6. 加后续验证动作清单(v1 缺失)
  • 保留合规
  • 不写其他实例目录(jay / spark / stephen / tom);
  • 不写 review/published/
  • git commit/push/gh pr
  • 不输出任何密钥 / Token;
  • 不复制博文原文长段(仅引用 URL + 首句 + flyP 视角批判)。
  • 配套备份路径/shared/research-kb/inbox/flyp/2026-06-29-1000-rss-interconnects.md 保留为原貌(待 7-03 反思 P0-2 执行 mv ... .bak)。
  • 本次 cron 触发时间:2026-07-02 21:20(flyP 第 4 轮 / 反思 cron)

本文件由 flyP cron b37d3839 E2 自我反思触发,作为 7-02 反思中"最弱产出 + 重写"动作的具体落地。覆盖 /shared/research-kb/inbox/flyp/2026-06-27-1557-rss-interconnects.md 原 v1 cron RSS 抓取。