信源:X 硬核干货雷达 · 覆盖 12 账号

采集窗口:2026-09-13 ~ 2026-09-20 (北京时间) 账号:@omarsar0 @_akhaliq @rasbt @svpino @simonw @hwchase17 @jerryjliu0 @swyx @maximelabonne @tri_dao @cwolferesearch @abacaj


干货候选

  • 主题:SoL-Pi — NVIDIA Pi 编程 Agent 引擎 Token 效率提升 45-49% | 来源:@omarsar0 | 链接:https://arxiv.org/html/2609.20519 | 仓库:NVlabs/SoL-Pi | 论文:https://arxiv.org/abs/2609.20519 | 硬核点:NVlabs 自动化研究环路从 152 个提案中筛选出 4 个 Token 节省机制(Action Fusion / ObservationPack / Evidence-Preserving Reducer / Online Context Compact),在 EdgeBench 保留 ~94% 分数的同时削减近半 Token;附 IMO 2026 Lean 4 验证基准(3/6 通过),$20.90/题 vs Codex $22.89/题;工程可直接 pi install git:github.com/NVlabs/SoL-Pi 落地

  • 主题:Reasoning from Scratch Round 3 — RLVR 验证器从零实现 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2099231450411290900 | 仓库:rasbt/reasoning-from-scratch | 论文:无 | 硬核点:Sebastian Raschka "Build a Reasoning Model From Scratch"第 3 轮——手把手实现 Verifier 用于(a)模型评估和(b)RLVR可验证奖励训练;YouTube 同步视频 40.4K 查看,step-by-step PyTorch 代码

  • 主题:Plasma AI Radio — 多 Agent 共享上下文协调工具(类似团队 Slack) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2099880259210412282 | 仓库:无 | 论文:无 | 硬核点:当前多 Agent 工作流最大痛点——各引擎(Claude Code/Codex/开源模型)之间手动传递上下文;Radio 提供共享 Chat Room,任意能 fetch URL 的 Agent 均可加入;Plasma 将其定位为 Agent 团队基础设施,omarsar0 实测推荐

  • 主题:Harness Design for Coding Agents — 实证研究六大组件与设计原则 | 来源:@_akhaliq | 链接:https://huggingface.co/papers/2609.20... | 仓库:无 | 论文:https://huggingface.co/papers/2609.20... | 硬核点:系统梳理编码 Agent Harness 的六大核心组件(live repo context/cached prefix/tools/clipping/memory/subagent bounds),附消融实验数据;9 月 17-18 日 HF Papers 热榜

  • 主题:MOPD — 多教师同策略蒸馏:2026 后训练新范式 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2098088130259664919 | 仓库:无 | 论文:无 | 硬核点:Cameron Wolfe 系统梳理 MOPD(Multi-Teacher On-Policy Distillation)——让单一模型从多个专用 RL 教师吸收能力;已落地于 MiMo-V2-Flash/Kimi K3/DeepSeek-V4 等前沿模型;长帖含技术动机+与单教师蒸馏的对比分析

  • 主题:WHALE — LLM 权重与 Harness 联合优化 | 来源:@cwolferesearch | 链接:https://krafton.ai/blog/whale/ | 仓库:无 | 论文:https://arxiv.org/abs/2609.00196 | 硬核点:Harness 优化遇到瓶颈后,WHALE 提供联合调优权重+Harness 的简单配方;与仅调 Harness 相比 plateau 后仍有提升空间;KRAFTON blog + arxiv 双链接

  • 主题:Fine-tuning & Merging LLMs 视频课程 — DPO + MergeKit 实操 | 来源:@maximelabonne | 链接:https://www.youtube.com/watch?v=uLrOI65XbDw | 仓库:无 | 论文:无 | 硬核点:Maxime Labonne( Liquid AI Head of Post-Training)系统性讲解微调+模型合并完整流程——含 DPO 偏好优化、MergeKit SLERP/DARE/TIES 合并方法、分布式训练技巧;Sep 16-17 视频发布,AI Engineer 频道 1.1K 赞

  • 主题:JEPA-Anything — 统一视觉基础模型架构 | 来源:@_akhaliq | 链接:https://huggingface.co/papers/2609.20... | 仓库:无 | 论文:https://huggingface.co/papers/2609.20... | 硬核点:基于 Meta JEPA 思想的统一视觉基础模型,可处理任意视觉任务;Sep 17-18 HF Papers 热榜,@_akhaliq 每日策展分享


其余线索

  • @rasbt GPT-5.6 Astra vs Qwen3.8 Max 视觉基准对比(Sep 15, 23K 查看) — 像素相似度评分机制分析;评论指出"评分规则本身在测 Harness 而非模型",有参考价值但非独立干货帖
  • @maximelabonne "Remember you're not merging enough"(Sep 12) — 表态帖,含 representation collapse + loss curvature + gradient variance trade-off 讨论;偏观点但有技术营养
  • @abacaj GLM-5.3 Flash 替换 GPT-5.6 Luna 文档处理(Aug 29) — 超出窗口,但零质量下降 + 成本优势仍有参考价值
  • @cwolferesearch MOPD 相关推文(Sep 2) — 与 Sep 3 主帖同一主题,超出 7 天窗口;Notion 读书列表补充阅读
  • @omarsar0 SoL-Pi 论文策展 — 搜索结果显示 9 月 17-19 日 AI/TLDR 收录过该论文,但原始 @omarsar0 帖子未能在本次窗口内确认;待下轮核对原始 X 帖子
  • @_akhaliq LimiX-2(Sep 17-18, huggingface.co/papers/2609.17...) — 线性混合模型新版本,关注边缘/移动端高效部署;热榜论文,详情待挖

本轮综合评估:相比上周(SoL-Pi + MOPD + WHALE + RLVR Verifier),本窗口干货密度中等。@rasbt 连续两周输出稳定;@omarsar0 Plasma Radio 切入工程痛点;@_akhaliq HF Papers 策展持续;@maximelabonne 视频课程填补微调实操空白。