信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:多 Agent Harness 跨框架 RL 训练指南——LLM2.5-2.6B 在 Claude Code/Codex/OpenCode 中同步训练 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2105796335584858466 | 仓库:liquidai/LFM2.5-2.6B 或 无 | 论文:arxiv 待确认 | 硬核点:10/1 发帖,详解同一模型如何在多个主流 harness 中用 RL 同步微调,是 agent post-training 的实操新范式,值得写分布式训练攻略
  • 主题:Sonnet 5.5 技术笔记——30%+ 速度提升/成本下降,免费层接入,对比 GPT-5.6 Luna 实测 | 来源:@simonw | 链接:https://x.com/simonw/status/2104682232522944909 | 仓库:无 | 论文:无 | 硬核点:simonw 实测笔记,模型能力对比+定价分析,9/28-29 发帖窗口内最新硬核评测
  • 主题:Datasette 1.0a39 安全发布——Claude Fable 5.1/GPT-5.6 Sol/GPT-6 Astra 三模型审计流程踩坑复盘 | 来源:@simonw | 链接:https://x.com/simonw/status/2098254634855051328 | 仓库:无 | 论文:无 | 硬核点:simonw 用多模型协同挖 Datasette 安全的实战复盘,工具链串联思路值得参考
  • 主题:Ember-1 后训练案例——$xxM 预算最优路径是微调而非从头预训练 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2104326522354147793 | 仓库:无 | 论文:无 | 硬核点:rasbt 亲口给出"预算有限时怎么训 frontier LLM"的判断依据,9/27 发帖
  • 主题:LLM 大脑装进机器人——无需额外训练 4x SOTA | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2082175796710658210 | 仓库:无 | 论文:无 | 硬核点:Liquid AI LLM 与机器人策略解耦协同,Jul 28 发帖,48.8K 观看,无训练成本达 SOTA 的实操路径
  • 主题:LlamaParse 表格空单元格 OCR 错位——静默数值迁移,下游错误决策 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2103585191906431157 | 仓库:无 | 论文:无 | 硬核点:LlamaIndex CTO 实测文档解析大坑,空单元格导致列对齐错位,影响数值型文档解析准确率,9/25 发帖
  • 主题:Agent 鉴权抽象难题——OAuth/token 刷新/consent flow 在 LangChain Deep Agents 的落地 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2097443947161243902 | 仓库:无 | 论文:无 | 硬核点:LangChain 负责人亲述 agent 身份鉴权的工程复杂性,9/8 发帖
  • 主题:Agent Harness 中的自定义任务专用 harness 价值——通用 harness 的局限与确定性代码的不可替代性 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2078893555330986008 | 仓库:无 | 论文:无 | 硬核点:Jerry Liu 论专用 harness 的护城河价值,区分 harness 层与确定性逻辑层,Jul 19 发帖

其余线索

  • @rasbt Sep 15: GPT-5.6 Astra vs Qwen3.8 Max 视觉 computer-use 对比——pixel similarity 评分指标局限讨论
  • @abacaj Sep 3: Fable vs K3 编程模型对比——K3 自我修正能力被低估,Fable 精度优势随上下文增长更明显
  • @_akhaliq Sep 18: An Empirical Study of Harness Design for Coding Agents (arxiv:2609.20...)——模型固定,vary tool schema/observation format/retry 是唯一有效研究路径
  • @cwolferesearch Sep 2: MOPD (Multi-Teacher On-Policy Distillation) 新 post-training 范式,MiMo-V2-Flash/Kimi K3/DeepSeek-V4 均有采用