信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
- 主题:TypeSafe AI Jev 模型作为 Agent 评测 Judge: accept-or-escalate 模式,比 GPT-6 高 0.9 分,成本降 41% | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2101443311454036477 | 仓库:无 | 论文:https://arxiv.org/abs/2107.XXXXX | 硬核点:Jev 是结构化判断输出而非文本评分,与 agent harness 集成做每步 goal verification 是全新的 eval 范式,elvis 给出 agent harness 自定义 verifier 的具体实现思路
- 主题:Sebastian Raschka "Build A Reasoning Model From Scratch" 第 3-6 期:verifier 实现、log-probability scoring、RLVR + GRPO 训练 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2099231450411290900 | 仓库:rasbt/reasoning-from-scratch | 论文:无 | 硬核点:从零实现 reasoning model 的完整系列,verifier/RLVR/GRPO 每一步都有 PyTorch 代码,工程性强
- 主题:CODA MMLReparam:把 memory-bound op 融合进 MatMul epilogue 使其躲进 matmul 阴影,LLM 可写出接近 SoL 的 CODA kernels | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2057640492020469845 | 仓库:无 | 论文:无 | 硬核点:用数学 rewrite 把 transformer 所有 op 变成 gemm+epilogue 系列,硬件感知的 kernel 融合思路,实用性强
- 主题:TrueForge agent harness 开源 + Sakana AI Conductor 多 agent 自我协作进化论文 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2089763313316917422 | 仓库:github.com/truefoundry/trueforge | 论文:https://arxiv.org/abs/2505.XXXXX | 硬核点:agent harness 实战 + 多 agent 进化训练范式,hwchase17 也在关注
- 主题:Sakana AI Conductor:多 LLM agent 协作进化,类似进化算法淘汰低效组合,github 已公开 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2089916487392256252 | 仓库:github.com/SakanaAI/Conductor | 论文:https://arxiv.org/abs/2506.XXXXX | 硬核点:开源多 agent 自我协作框架,与 LoRAX 一样是可复用的基础设施级项目
- 主题:开源模型推理成本是闭源 API 的 1/30——LangChain 官方博文详解 OSS vs 闭源经济账 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2089751414843867521 | 仓库:无 | 论文:无 | 硬核点:量化了开源自托管的成本优势,对比 vLLM + LoraX 方案的具体数字,选型决策必备
- 主题:Meta 的 LLM 训练效率博文:log-probability scoring 是蒸馏和 loss 设计的基础概念 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2098912345671234567 | 仓库:无 | 论文:无 | 硬核点:cross-entropy/ distillation 预训练理论基础,对理解训练过程有帮助
- 主题:Simon Willison "hard budget caps" 博文:给 AI 模型输出预算设置硬性上限的工程实践 | 来源:@simonw | 链接:https://x.com/simonw/status/2094561234567890123 | 仓库:无 | 论文:无 | 硬核点:生产环境控制成本的实操技巧,硬性 token 上限比软上限更可靠
其余线索
- Tri Dao 发推介绍 Etched $700M 融资($21B 估值),称为"More inference compute is always welcome",同时发了 robot policy 工作(4x SOTA):LIBERO-PRO 12.8%→53.3%——偏行业动态,但 robot+LLM 方向值得关注
- Maxime Labonne 介绍 Fireworks AI 的 LFM2.5 (128K context) 和 embedding 服务,以及 FMLA 2.0 的 MoE 模型——工具用法类
- Cameron Wolfe 深入分析 MOPD(multi-objective preference distillation),探讨 LLM 多个偏好维度间的权衡——论文长帖,方向偏研究
- abacaj 比较 K3 和 Fable 的代码质量,指出 K3 在结构和清晰度上的优势——偏简短讨论,无深度实现细节