信源:X 硬核干货雷达 · 覆盖 12 账号

本轮窗口:2026-10-01 ~ 2026-10-08 | 扫描时间:2026-10-08 23:40 UTC


干货候选

  • 主题:Multi-Harness RL——同一模型在不同 Agent Harness 下表现差异高达 30pt,跨 4 种 Harness 训练 LFM2.5-2.6B 从 42% → 54% | 来源:@maximelabonne | 链接:https://x.com/adithya_s_k/status/2105684965891703141 | 仓库:adithya-s-k/FineEnvs | 论文:无 | 硬核点:adithya_s_k Oct 1 原帖附完整训练 recipe,工具效率 reward 可将 tool calls 减少 31%;多 harness 联合训练范式对 harness 设计有直接工程参考价值;配套 HF Space 可直接跑实验。

  • 主题:rasbt《从零构建推理模型》第 6 轮——RLVR + GRPO 原理与实现 | 来源:@rasbt | 链接:https://x.com/rasbt | 仓库:无(系列书 repo 待核实) | 论文:无 | 硬核点:Oct 3 帖子附完整实现讲解,Reinforcement Learning with Verifiable Rewards 与 Group Relative Policy Optimization 的 from-scratch PyTorch 实现,原理+代码可对照学习。

  • 主题:simonw Qwen3.8 27B 加法问题系统性基准评测——非推理模式准确率仅 23.57% | 来源:@simonw | 链接:https://simonwillison.net/2026/Oct/5 | 仓库:无 | 论文:无 | 硬核点:simonw Oct 5 实测 13 位数以内加法词问题,推理模式 vs 非推理模式对比详表,附 heatmap;是本地跑 Qwen 模型的踩坑复盘,有可复现的实验设计。


其余线索

  • @cwolferesearch Oct 1:MOPD(Multi-Teacher On-Policy Distillation)技术细节——不同 teacher 在 MOPD 中存在不兼容问题;Nemotron tech report 系列解读,harness-aware 训练工程细节。

  • @maximelabonne Oct 2:SFT 逊于 RL 的根因是 off-policy 数据,而非 SFT 目标本身;轨迹重写可使 SFT 匹配 on-policy 方法效果且遗忘更少;源自@aakaran31 论文。

  • @_akhaliq Oct 2:Adaptive Reward Routing for Joint Audio-Video Diffusion via Forward-Process RL 论文分享。

  • @_akhaliq Oct 5:EditHero 3D 长视野编辑评测基准;Scaling Trajectories via Recursive Self-Rewrite;Octrees as Explicit 3D Language——均为论文分享。

  • @swyx Oct 2:AI Security Summit 2026 推广帖,活动/社群内容,非技术干货。

本轮无干货候选:@omarsar0(Oct 窗口最近帖子为 Sep 18-19 超窗,窗口内未抓到新帖) / @jerryjliu0 / @hwchase17 / @tri_dao / @abacaj(未搜到近期技术动态) / @svpino / @cwolferesearch / @swyx(活动推广帖)