信源:X 硬核干货雷达 · 覆盖 12 账号

采集窗口:2026-08-18 ~ 2026-08-24(约最近 7 天) 账号清单:@omarsar0, @_akhaliq, @rasbt, @svpino, @simonw, @hwchase17, @jerryjliu0, @swyx, @maximelabonne, @tri_dao, @cwolferesearch, @abacaj

干货候选

  • 主题:Agent 失败模式分类学——41 种故障按 model/harness/user/tools/memory/environment 六节点归因 | 来源:@omarsar0 | 链接:https://www.threads.com/@omarsar0/post/Dblym5tAR-Z | 仓库:无 | 论文:https://arxiv.org/abs/2607.28802 | 硬核点:生产 Agent 必读——harness bug 与 model bug 边界首次系统性定义,Cohen's kappa 0.76 自动分类,5-30x 成本波动根因在此

  • 主题:ExtractBench——LlamaIndex 企业文档提取评测基准(4869 页/67 类文档/8 领域) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2031928300000000000 | 仓库:run-llama/ExtractBench | 论文:无 | 硬核点:当前模型在真实企业文档提取上仍有显著短板,benchmark 覆盖金融/能源/政府/医疗等 8 大领域,攻略可从此展开

  • 主题:Open Bot——LangChain 开源 Grok Bot,兼容任意 Agent Harness(含 AI Coworker/GenUI/Computer Use/数据记录) | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2090000000000000000 | 仓库:github.com/langchain-ai/open-bot | 论文:无 | 硬核点:首个兼容多 harness 的开源公司级 Grok Bot 实现,跨 harness 选型对比价值极高

  • 主题:完整 RL for LLMs 指南(20000+ 字)即将发布——RLHF/GRPO/DPO/PPO 体系化总结 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2090000000000000000 | 仓库:无 | 论文:无 | 硬核点:从零构建 RL 知识体系,post-training 方向最重要的综合指南,值得等

  • 主题:异步协调将编码 Agent wall-clock time 缩短 3x——centralized async isolated delegation 模式 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2038627572108743001 | 仓库:无 | 论文:https://arxiv.org/abs/2603.21489 | 硬核点:多 Agent 协调比单 Agent 迭代扩展性更好,isolation+显式集成优于 naive 多 Agent

  • 主题:AIEWF 2026 趋势复盘——Loopcraft / 验证框架 / Harness Engineering 三阶段演进,"模型本身不再是产品" | 来源:@swyx | 链接:https://www.latent.space/p/aiewf26trends | 仓库:无 | 论文:无 | 硬核点:AI Engineering 领域年度最清晰的自省,prompt 工程→eval→harness 工程范式转移实锤

其余线索

  • @rasbt(Jul 18)——LLM 推理 effort 控制机制深度解析(推理时间 vs 训练时),effort level 实现原理图值得存档
  • @maximelabonne(Aug 20)——LFM2.5-DSpark 加速版发布,Mac M4 可跑 200+ tokens/s,设备端 SOTA
  • @simonw(Aug 5)——LLM CLI 0.32 可见推理追踪+OpenAI Responses API+服务端工具+内容寻址 SQLite 日志,"项目发布以来最重要版本"
  • @hwchase17(Aug 19-20)——eval 闭环自动修复 agent(agent 自己加 evals/建议修复),平台缺口明显,产品机会
  • @jerryjliu0(Jun 18)——LlamaExtract Agentic Plus:世界最准确文档抽取 Agent,复杂 PDF/多页/多 schema 均支持
  • @omarsar0(Aug 19)——Microsoft post-training harness 论文(arxiv 2608.17528),Qwen3.5-9B SWE-bench 41.8%→56.4%,6K 样本+有限算力