2026 年 LLMs 年度梳理:Simon Willison 的 WeAreDevelopers 闭门 Keynote 全解读 · 干货攻略

  • 链接:https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far
  • 分类:x-tips
  • 来源:X @simonw
  • 作者:Jay
  • 更新:2026-10-01

这是什么

2026 年 9 月 27 日,AI 领域知名独立开发者 Simon Willison 在 WeAreDevelopers World Congress North America(圣何塞)发表了闭幕 Keynote,题目为「2026 in LLMs (so far)」。这是一篇按时间线串联 2026 年 AI 领域所有重大事件的超长综述,涵盖从 GPT-5.1/Claude Opus 4.5 发布、OpenClaw 崛起、MoltBook 泡沫、StrongDM "Dark Factory"、开源模型逆袭、Pope Leo XIV 警告、到 GPT-6 Astra 限量预览等几乎所有热点话题。

原文配有 YouTube 视频 和带标注的幻灯片,是 2026 年 AI 领域最完整的时间线回顾之一。


为什么值得关注

谁分享的,解决什么问题

@simonw(Simon Willison)是 Datasette、shot-scraper、llm 等知名开源工具的作者,也是 AI 领域少数兼具工程实践能力和写作深度的影响者。他早在 2024 年就发明了「prompt injection」这个词,近年来持续用实验驱动的方式评估 AI 模型能力。

这篇年度梳理的核心价值在于:

  1. 纯时间线叙事:不是事后总结,而是逐月追踪,保持了事件的原始节奏感
  2. 有观点有数据:Pelican on Bicycle 这个"愚蠢基准"贯穿全文,用一致的方法论串联所有模型对比
  3. 诚实预测复盘:他在 1 月的 Oxide and Friends 播客 里做了 2026 预测,9 月回头逐条检验

解决什么问题

对于想快速把握 2026 年 AI 领域全貌的从业者,这篇是最有条理的入口。不需要追踪数十个账号的 X 动态,一条时间线覆盖了所有关键节点。


核验过程

官方来源

交叉验证

  • OpenClaw 起源于 Moltbot → OpenClaw:Simon 原文中描述的命名演变(Warelay → CLAWDIS → CLAWDBOT → Moltbot → OpenClaw)与多方报道(Taskade Blog、Medium @kanerika、Pure AI)一致,开发者为 Peter Steinberger(奥地利开发者),2025 年 11 月首次提交。
  • MoltBook 事件:Simon 描述的"MoltBook 于周四上线,周五爆火,周一被纽约时报报道,周二因 slop 和 spam 沉寂,一个月后被 Meta 收购"与 CNBC 等媒体报道一致。
  • GPT-6 Astra 发布时间:Wikipedia 词条和 OpenAI 官方博客均标注为 2026 年 9 月 3 日限量预览,原帖时间线描述吻合。
  • StrongDM "Dark Factory":Simon 提到的 factory.strongdm.ai 和 Dan Shapiro 的 Dark Factory 博客均实际存在。
  • Pope Leo XIV:2026 年 5 月发布的 encyclical letter 提及 AI 经济影响,与 Simon 1 月预测一致。

无法核验(需标注)

以下为 Simon 个人经历/观察,第三方核验有限:

  • 「Bay Area Apple Store Mac Mini 脱销」:多方报道提及 OpenClaw 在中国的安装派对盛况,但 Bay Area 苹果店细节无独立来源
  • 「Anthropic 估值飙至约 1 万亿美元」:属市场推测,原帖无官方背书
  • 「Meta Muse 登顶 iPhone 免费榜」:Simon 提及但未附数据,保留原帖主张

正文:从 November 2025 开始的编年史

起点:November 2025——质变时刻

Simon 认为 2026 年实际上从 2025 年 11 月就开始了。两条关键发布打破了隐形门槛:

  • Claude Opus 4.5:配合 Claude Code(2025 年 2 月已发布),终于跨越了"经常出错"到"日常可用"的界线
  • GPT-5.1:配合 Codex,编程 agent 从概念走向实用

Simon 的 Pelican on Bicycle 测试揭示了一个有趣规律:两者的自行车画得都很烂,但关键不在画技,而在于这个"愚蠢基准"能稳定捕捉模型的组合推理能力。

同一月,一个不起眼的 GitHub 仓库悄悄创建,名字叫"Warelay"。

January 2026——OpenClaw 革命

年末假期后,开发者们开始大规模实验编程 agent。到 1 月底,那个仓库经历了多次改名:CLAWDIS → CLAWDBOT → Moltbot → OpenClaw。

OpenClaw 定义了一个新的软件类别——Simon 称之为"Claw"。同期的克隆产品包括 NanoClaw、IronClaw、PicoClaw 等,共同构成了一个"Claw 生态"。

OpenClaw 由奥地利开发者 Peter Steinberger 创建,支持 WhatsApp、Telegram、Slack、Discord、iMessage 等多渠道,能在用户的本地机器上运行,代表了"个人 AI Agent"(Personal AI Agent)这一品类的崛起。

MoltBook 是另一件 1 月大事:一个人类观察 AI Agent 互动的社交网络。周四上线,周五爆火,周一被纽约时报报道,周二即因 slop 和 spam 沉寂。一个月后被 Meta 收购。

Simon 本人在 1 月经历了他所谓的"AI Mania"——为了证明"世界不需要蹩脚的 Python JS 解释器",他用 AI 辅助写了一个 JavaScript 解释器(simonw/micro-javascript)和一个 WebAssembly 运行时(simonw/pwasm)。

February 2026——Tokenmaxxing 与开源逆袭

Tokenmaxxing 现象:Meta 把 AI 使用纳入绩效考核、Microsoft 要求全员用 AI、Uber 宣称 90% 工程师用 AI 流程。但数月后这些公司相继叫停——agent 成本远超预期。Simon 指出,去年很难在 AI tokens 上花超过 50 美元,因为没有足够复杂的任务;今年一天就能花掉 1000 美元。

StrongDM "Dark Factory":StrongDM 公开了两个规则:① 代码必须由 agent 撰写(不经手人类工程师);② 代码不许人类审查。这套方法被 Dan Shapiro 称为"Dark Factory"——工厂足够自动化时,你可以把灯关掉。

Gemini 3.1 Pro 发布:Google 在 2 月发布,Simon 用 Pelican on Bicycle 测试发现它终于画出了正确形状的自行车(链条、脚蹬位置都对,还有条小鱼在篮子里)。Jeff Dean 随后发推展示了 Gemini 3 Pro vs 3.1 Pro 的对比视频,涵盖各种动物骑各种交通工具。Simon 无奈表示:Google 针对这类提示做了专项训练,他这个基准已经彻底失效。

March–April 2026——开源模型逆袭、Claude Mythos 事件

OpenClaw 峰值:3 月达到热度顶峰,中国出现线下安装派对(排队数小时),非技术人群也在追赶潮流。

Claude Mythos 未发布事件:Anthropic 宣布了新模型 Claude Mythos,随即以"太危险"为由仅向安全研究人员开放。Simon 当时认为可信,因为亲眼见过 coding agent 找 bug 的能力进步。后来的 ExploitBench 数据(见下)证明这类担忧并非营销噱头。

开源模型本地逆袭:4 月 16 日,Simon 在自己的笔记本上运行 Qwen3.6-35B-A3B(21GB 文件),生成的 Pelican on Bicycle 图像质量超过 Claude Opus 4.7。这是开源本地模型的标志性时刻。

May 2026——Pope Leo XIV 与 AI 经济学

Simon 在 1 月预测"Pope 会就 AI 发表意见"。这不是胡说:新 Pope 的名号 Leo XIV 来自 Leo XIII——1891 年发布《Rerum novarum》 encyclical 谈工业革命的那位。5 月,Leo XIV 发布 AI 主题 encyclical。

June–September 2026——GPT-6 Astra 与 Agent 安全

GPT-6 Astra 于 2026 年 9 月 3 日以限量预览形式发布,官方定位为"迄今最强大、最对齐的模型",并首次在网络安全基准上达到"Critical"级别:

基准 GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
ExploitBench 100.0% 78.5% 70%
ExploitBench (June–Aug 2026) 39.0% 5.5% —
SRE-Bench 88.0% 55.9% 12.5%
SEC-Bench Pro 85.4% 79.1% —

数据来源:OpenAI 官方博客(2026年9月22日更新,新增 GPT-6 Sol/Luna)。

Meta Muse 在 9 月发布,登顶 iPhone 免费榜,代表消费级个人 Agent 正式打入大众市场。


坑与适用边界

  1. Simon 的 Pelican on Bicycle 是非正式基准,不能代替标准评测(MMLU、HumanEval 等),但它的价值在于提供了一个长期一致的个人评估方法论,跨越了 2024–2026 整整三年的模型演变。

  2. Simon 对部分事件带有个人情绪(如 OpenClaw 革命、Dark Factory),这些是他的观点而非事实陈述,指南已区分哪些是观察、哪些是推断。

  3. 部分时间线细节无官方文档核实:如"MoltBook 周四上线,周二沉寂"的精确节奏,来自 Simon 博客但无独立来源,保留原帖主张。

  4. 市场类数据(Anthropic 估值、Meta Muse 排行榜):属第三方报道/推测,非官方数据。


一句话结论

Simon Willison 的 2026 年度梳理是一部用时间线写成的 AI 领域编年史,最有价值的地方不是告诉你"哪个模型最强",而是展示了 2026 年 AI 领域如何从"编程 agent 质变"出发,经历了 OpenClaw 革命 → Tokenmaxxing 泡沫 → Dark Factory 探索 → 开源本地模型逆袭,最终在 GPT-6 Astra 达到某种阶段性终点。

视频:YouTube - WeAreDevelopers Closing Keynote
幻灯片:simonwillison.net 上有带标注的幻灯片版本(simonwillison.net/tags/annotated-talks)