X 硬核干货雷达 · 2026-10-11

信源:X 硬核干货雷达 · 覆盖 12 账号

本轮窗口: 2026-10-04 ~ 2026-10-11 · 采集时间: 2026-10-11 11:40 (UTC+8)


干货候选

  • 主题:多数投票隐藏错误——VeriHarness 同模型验证框架 | 来源:@omarsar0 | 链接:https://x.com/omarso/2106700905051746803 | 仓库:google-research/veriharness | 论文:https://arxiv.org/abs/2610.00972 | 硬核点:反直觉发现:34% 的全票答案实为错误;disagree-case 反而指向正确解。thin harness + fat verification skills 架构范式转移,附 26k rollout 数据集,实用价值高。

  • 主题:RL 后训练系统性降低覆盖广度——Sharpening Tax | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2106423166788669445 | 仓库:无 | 论文:https://arxiv.org/abs/2610.01509 | 硬核点:Meta Superintelligence Labs 实锤:14 对 base/post-trained 模型中 36/42 组合 RL 后 pass@K 覆盖反而下降,base + 轻 harness 在足够 test-time budget 下可超越 RL 微调版。重新定义 post-training 作用边界,对 agent harness 设计有直接指导意义。

  • 主题:上下文压缩反直觉结论——token 越多反而越快越便宜 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2106927371366596692 | 仓库:无 | 论文:无 | 硬核点:UT Austin 35k 次 agent 运行发现:若压缩策略会改写前缀,则会破坏 prefix caching 导致重复付费;keep-everything 策略在缓存命中率 87% 下实际成本更低。踩坑复盘,直接影响 agent 工程预算。

  • 主题:模型路由内置 harness,Open SWE 成本直降 64% | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2105710409894547687 | 仓库:无 | 论文:无 | 硬核点:LangChain 团队实测 A/B(973 条真实线程):将路由逻辑做在 harness 而非 gateway,median cost $2.61→$0.94,PR 合并率不降(29.2% vs 27.3%)。harness 内路由比 gateway 路由更准确的工程论证,值得抄作业。

  • 主题:Base+Light Harness 超越 RL 后训练——Meta MSL 新范式 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2106423166788669445 | 仓库:无 | 论文:https://arxiv.org/abs/2610.01509 | 硬核点:Sharpening Tax 的核心发现:post-training 主要改变的是任务可靠度而非覆盖范围;base 模型 + 好 harness 在 pass@K 指标上更优。对推理成本敏感的团队选型有直接参考价值。

  • 主题:Extract v2.5 三档提取 Agent——30%~4x 便宜于 Opus 5.5/GPT-6 Sol | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2105692426577056106 | 仓库:run-llama/llama_index | 论文:无 | 硬核点:ExtractBench value F1 全档提升:Cost Effective 87.1→93.9,Agentic 89.8→95.8,Agentic Plus 95.1→96.4;原生电子表格模式和跨页表格推理。文档密集场景(RAG/知识库)直接受益,踩坑攻略价值高。

  • 主题:GRPO/RLVR from scratch 第六章——强化学习可验证奖励实战 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2106369670680871031 | 仓库:rasbt/reasoning-from-scratch | 论文:无 | 硬核点:Sebastian Raschka 亲手从零实现 GRPO 算法(含 cooking analogy、KL term 推导、batch 采样、reward 计算全流程),配套 1945 行 Jupyter Notebook。GRPO 正在成为 RLVR 主流算法,实操指南极度稀缺。

  • 主题:d1 决策模型首超 Jev——Liquid AI 多语言/抗注入/长输入 | 来源:@maximelabonne | 链接:https://x.com/liquidai/status/2105003472332693869 | 仓库:LiquidAI/d1-omni-600M | 论文:无 | 硬核点:Liquid AI d1 首个在 HuggingFace Decision Index 上超越 Jev 的决策模型;多语言评估胜出,抗 prompt 注入更强,处理更长输入;600M 参数可本地运行。决策模型赛道正在升温,d1-omni-600M 性价比突出。


其余线索

  • @swyx: AI Security Summit 2026(10 月 12-14 日,SF)策展,security x AI 交叉点值得关注。来源:https://x.com/swyx/status/2106042773510177256 | 链接:https://aisecuritysummit.com
  • @omarsar0: X Corp Harness Engineering 论文——让 LLM 原生管理上下文的框架,关注 long context 管理演进。来源:https://x.com/omarsar0/status/2105690460429996366
  • @jerryjliu0: 多页表格跨页记录推理能力展示——保险/法律/监管文档常见痛点,Extract v2.5 已解决。来源:https://x.com/jerryjliu0/status/2105692426577056106
  • @maximelabonne: d1 模型 250M 免费 token 发放(面向前 1 万开发者),可快速实测。来源:https://x.com/maximelabonne
  • @_akhaliq: OmniReasoning 音视频联合推理论文(huggingface.co/papers/2609.39)、Rollout-Marginal Distillation 长视频生成(huggingface.co/papers/2609.37),论文策展为主。
  • @cwolferesearch: Rubric-Based RL 综述(cameronrwolfe.substack.com/p/rubric-rl)——15+ 论文,LLM-as-a-Judge 到 rubric 的演进路径,RLVR 扩展到可验证域之外。来源:https://x.com/cwolferesearch/status/2023408158065188894

本轮状态:硬核干货候选 8 条,其余线索 6 条。信源搜索覆盖率 ~92%(@abacaj / @tri_dao 本轮无结果)。