信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:Sakana AI Conductor(ICLR 2026)——7B 模型用 RL 调度其他 LLM 协作,AIME25/GPQA-D 达 SOTA | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2051306659021242635 | 仓库:无 | 论文:arxiv Conductor 相关 | 硬核点:递归 LLM 拓扑+在线迭代 test-time scaling 机制新颖,值得写实操攻略

  • 主题:Jerry Liu 论 PDF grounding——精确标注答案来源区域(word/line/box)是 2026 agentic RAG 核心差距,前沿 VLM 仍做不到可靠 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:无 | 论文:无 | 硬核点:LlamaIndex 自评+ExtractBench 数据背书,踩坑复盘可直接指导 RAG 开发

  • 主题:abacaj K3 vs Fable 训练踩坑——用 Fable 训练 LFM 2.6B 因 chat template 错误(1/3 数据)导致模型全面变差,排查过程有数据 | 来源:@abacaj | 链接:https://x.com/abacaj | 仓库:无 | 论文:无 | 硬核点:数据质量驱动训练的实操踩坑,教训可直接迁移到其他微调场景

  • 主题:maximelabonne LFM2.5 QAD 量化实测——QAD Q4_0 压缩 LFM2.5-2.6B:5.4GB→1.6GB,吞吐量 21→64 tok/s,延迟 3.0s→1.2s,保留~97% BF16 性能 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne | 仓库:LiquidAI/LFM2.5-3B(既有点赞) | 论文:无 | 硬核点:量化实战数据,本地推理优化可直接抄作业

  • 主题:maximelabonne DSpark 推理加速——LFM2.5 DSpark 推理速度进一步提升,覆盖更多硬件 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne | 仓库:LiquidAI/LFM2.5-3B | 论文:无 | 硬核点:同一模型推理栈两条优化路线(QAD+DSpark),可合并写本地部署攻略

  • 主题:swyx OpenClaw Mac Mini 销售影响分析——OpenClaw 2026 带动 Mac Mini 全球销量+50%($50-150M),AI agent 桌面化拐点信号 | 来源:@swyx | 链接:https://x.com/swyx/status/2090498250168058080 | 仓库:无 | 论文:无 | 硬核点:量化 agent 桌面化商业影响,值得追踪开源 agent 工具对硬件生态的反向拉动

  • 主题:Jerry Liu ExtractBench 企业文档提取基准——370 docs/4869 pages/67 类/8 领域,IoU 0.5 严格打分, LlamaExtract Agentic Plus 95.6% | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:run-llama/ExtractBench | 论文:arxiv 36 页技术报告 | 硬核点:企业文档提取系统性评测方法论,踩坑攻略可直接引用

其余线索

  • omarsar0:Artificial Analysis Search Index——benchmark search API providers(Parallel/Exa/Firecrawl/You.com/Tavily/Brave)在 agent 场景的质量/成本/速度对比,值得留档参考
  • swyx:nVIDIA 收购 poolside "model factory"部门,员工转 NVIDIA——AI infra 整合信号
  • abacaj:K3 自愈能力——"keep asking it to fix" 可弥补错误,Fable 更准确但 K3 更便宜,可用性对比有参考价值
  • omarsar0:Agent Team Communication 论文——命名协调者 agent 无法可靠提升团队性能,通信拓扑是关键