信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
- 主题:Agent Harness 选型成本差 5–30 倍——跨 6 大推理模型实测 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2084714744880173451 | 仓库:无 | 论文:无 | 硬核点:同一模型同一任务换 harness 成本差异可达 30 倍,AI 工程师选型必读实测数据
- 主题:Sakana AI Conductor 7B 调度 LLM 协作拓扑 SOTA(ICLR 2026) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2051306659021242635 | 仓库:SakanaAI/Conductor | 论文:无 | 硬核点:Conductor 模型不直接解题而调度其他 LLM,RL 训练通信拓扑与 prompt 优化,复现价值高
- 主题:LLM 推理努力级别从零实现——推理时机制与训练时机制全解 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2078471977237450829 | 仓库:无 | 论文:无 | 硬核点:Raschka 从 PyTorch 代码层面解析 LLM 低/中/高 effort 推理的实现原理,图文并茂
- 主题:从零理解 KV Cache——PyTorch 逐行代码实现 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2096611271814611179 | 仓库:无 | 论文:无 | 硬核点:Raschka 配套 from-scratch 系列,KV Cache 机制与代码一一对应,适合工程落地参考
- 主题:Beyond Prompts: Measuring & Optimizing LLM Tool-Agent Harnesses(EMNLP 2026) | 来源:@hwchase17 | 链接:https://x.com/hwchase17 | 仓库:无 | 论文:https://arxiv.org/abs/2609.05736 | 硬核点:LangChain 团队将 harness 优化建模为预算分配选择问题,固定模型下编辑作为 guard intercepts,EMNLP 2026 录用
- 主题:Rodney CLI v2——浏览器自动化工具多贡献者新版本 | 来源:@simonw | 链接:https://x.com/simonw/status/2023896441085948069 | 仓库:simonw/rodney | 论文:无 | 硬核点:Simon Willison 自研 CLI,专为 coding agent 与 Showboat 设计,多人协作新 release,工程实用度高
- 主题:Commit Message 编辑本地 Web App | 来源:@simonw | 链接:https://x.com/simonw/status/2099310866021916710 | 仓库:无 | 论文:无 | 硬核点:Simon 14 小时前发的本地小工具,解决 commit message 撰写痛点,附博客实现细节
- 主题:2026 后训练新范式 MOPD——多教师 On-Policy 蒸馏融合多 RL teacher 能力 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch | 仓库:无 | 论文:无 | 硬核点:Cameron Wolfe 梳理 MiMo-V2-Flash、Kimi K3、DeepSeek-V4 等已采用 MOPD 的前沿模型,工程团队必跟趋势
其余线索
- @jerryjliu0(9/4):GPT-6 Astra 短文档解析 SOTA(97.2%),LlamaParse Benchmark,LlamaIndex 自家评测,无独立 repo 链接
- @abacaj(9/3):Dario 模型评测体验帖,观点为主,无技术细节
- @abacaj(9/3):「AGI」评分与前代持平,观点评论
- @abacaj(9/5):GPT-6 是 lucky seed,观点性短评
- @tri_dao(3/5):FlashAttention-4 论文发布——Blackwell GPU attention 达 ~1600 TFLOPs(约等于 matmul 速度),Dao-AILab/flash-attention 已在 watchlist
- @rasbt(6/7):Context 文件层次结构研究——长 context 文件应更短更具体并层级化,附 arxiv 论文摘要