信源:X 硬核干货雷达 · 覆盖 12 账号

采集窗口:2026-09-28 ~ 2026-10-04 (近7天)

干货候选

  • 主题:SFT+采样新范式——SFT 泛化超越 RL,遗忘更少 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2106698820648911122 | 仓库:无 | 论文:https://arxiv.org/abs/2610.02140 | 硬核点:Liquid AI 实验证明 SFT+采样可对标甚至优于 RL+OPSD 的 post-training 效果,挑战"RL 才能泛化,SFT 只能记忆"的传统认知;哈佛 Yilun Du 论文,附多任务对比数据,是近期 post-training 方向最有实操价值的复现方向

  • 主题:Simon Willison 2026 LLM 年度盘点(WeAreDevers 峰会闭幕演讲) | 来源:@simonw | 链接:https://x.com/simonw/status/2104630129528037415 | 仓库:无 | 论文:无 | 硬核点:详细注释幻灯片+全文实录,编年梳理 2026 年 1-9 月所有重大模型发布(Fable 5/Opus 5.5/GPT-6 Astra/Sol/Luna)、价格战、Decision Model 新范式等,是工程师快速补课的最佳单页索引

  • 主题:GRPO 实战代码 walkthrough——逐行实现而非示意图 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2106374448060248318 | 仓库:rasbt/reasoning-from-scratch | 论文:无 | 硬核点:Daniel Priscu 帖子被评"GRPO 逐行代码 walkthrough 很少见,大多数 explainer 只给示意图",rasbt 确认"该代码已用于训练出不错的模型";配套 Jupyter Notebook 含多 GPU 脚本,可直接跑 MATH 数据集(0.6B 模型 15%→47% MATH-500)

  • 主题:Google Research 多智能体证明发现——不过度约束执行结构的 advisor+验证 agent 模式 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/1848168346282811817 (threads cross-post) | 仓库:无 | 论文:https://arxiv.org/abs/2609.xxxxx (Science One/Cogentic, Google Research) | 硬核点:omarsar0 评价"banger paper";Cogentic 在无专家提示下从问题陈述出发解决理论计算机科学开放问题;模式可迁移到其他长程推理场景;附 Nature 论文链接

其余线索

  • omarsar0(Oct 2): 自定义 harness 可扩展性趋势——Pi Durable、Claude Code Mods、DeepSeek Harness 共性是可扩展性提升; builders 需要 coding agents 和 harness 更有弹性(产品评论,无新 repo)
  • jerryjliu0: LlamaParse 解析美联储 2026 年 9 月"dot plot"表格——空白格导致预测含义完全改变;LlamaParse 正确解析 vs 错误解析对比 Demo(产品能力展示,非技术教程)
  • maximelabonne(Oct 1): D1 决策模型上线 OpenRouter——$0.04/M 输入,$0 输出,65K context,零数据保留(产品发布,非开源 repo)
  • maximelabonne(Oct 2): SFT+采样论文合作公告——"SFT is not dead!";强调 LFM2.5-2.6B 在所有 harness 上训练(开源模型权重,非新 GitHub 仓库)

本轮备注: - @jerryjliu0、@swyx、@abacaj 近 7 天 X 无硬核技术帖(jerryjliu0 上一条为 8 月;swyx 最新硬核帖为 8 月漏洞披露;abacaj 仅评论帖) - @_akhaliq 近 7 天无新帖(最新为 9 月 14 日 SAS 论文分享) - watchlist 本轮无新增(simonw/llm、rasbt/reasoning-from-scratch 均为历史追加)