信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:Sakana AI Conductor——7B 模型 RL 学习调度多 LLM 协作拓扑,超越所有单体前沿模型 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2051306659021242635 | 仓库:SakanaAI/Conductor(07-24 已入 watchlist) | 论文:https://arxiv.org/abs/2512.04388 | 硬核点:ICLR 2026;Conductor/worker 路由是 agent 架构新方向,递归自调度揭示 test-time scaling 新轴

  • 主题:ThinkingCap 微调——Qwen3.6-27B 思考 token 减半(GSM8K 降 74%),精度反而提升 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2074195249732128870 | 仓库:bottleapai/ThinkingCap-Qwen3.6-27B | 论文:无 | 硬核点:首个公开的推理 token 效率化微调方案,Apache 2.0 开源,工程实操价值高

  • 主题:动态工作流——在 agent orchestrator 中动态生成 harness,支持 LLM council / 多 agent 路由 / 验证循环等模式 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2080323178119786642 | 仓库:无 | 论文:无 | 硬核点:首个系统性 reverse-engineering Claude Dynamic Workflows 的实操复盘,覆盖长时任务场景

  • 主题:ParseBench 文档理解评测——CVPR 2026,2k 页真实企业文档,测 VLM 表格/图表/视觉定位/语义格式/内容忠实度 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2062535626491412621 | 仓库:run-llama/ParseBench(07-21 已入 watchlist) | 论文:https://arxiv.org/abs/2512.04388(同 Conductor 论文 URL,需核实 ParseBench 专属链接) | 硬核点:文档 OCR 是 AI agent 落地的"最后瓶颈",首个为 AI 设计的文档解析评测基准

  • 主题:Retrieval Harness in LlamaParse——2026 版 RAG,混合语义+关键词检索+文件级 grep+分段读取,统一 agent 推理循环 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2071729856900215261 | 仓库:run-llama/legacy(07-22 已入 watchlist) | 论文:无 | 硬核点:把 RAG 重新定义为"agent 文件系统",混合检索+导航是大规模语料 agent 化的标准范式

  • 主题:Agentic World Models 深度博客——RL+世界建模联合训练,观测作为密集监督信号,防止过度拟合的权重平衡策略 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2079214560943198614 | 仓库:无 | 论文:https://arxiv.org/abs/2506.06266(Prime Intellect ECHO) | 硬核点:系统梳理 ECHO/PaW/Qwen-AgentWorld 三条技术路线,提炼过拟合根源与解法

  • 主题:Claude Code Debug 实战——Tri Dao 用 Claude 自主 debug FA4 死锁,6h 自主探索后发现部分修复思路,但陷入"编译器坏了"思维陷阱 | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2029569889858646344 | 仓库:无 | 论文:无 | 硬核点:最真实的 AI 辅助系统编程踩坑复盘,说明 AI debug 仍有边界,人类 review 不可替代

  • 主题:FrontierCode vs SWE-bench——Cognition 新评测基准,3000+ 条人工维护者评分 rubric,超越"通过测试"衡量"是否值得合并" | 来源:@swyx | 链接:https://x.com/swyx/status/2064081945567580323 | 仓库:无 | 论文:无 | 硬核点:SWE-bench 已被 50%+ 结果认定为不可合并的 slurry,FrontierCode 才是 2026 可维护代码评测的正确答案

其余线索

  • Simon Willison:ChatGPT Work 实为"OpenAI Claw"——移动端本地运行,安全护栏弱化,桌面端云端运行(Jul 18,Jul 19); https://x.com/simonw/status/2078522146779967595
  • swyx:2026 网站性能优化——AI 提示 5 分钟/5 美元,LCP/FCP/Speed Index 提升 38-56%(Feb 20); https://x.com/swyx/status/2024939066803061104
  • _akhaliq:Long-Horizon-Terminal-Bench——终端长程任务评测,密集奖励评分(Jul 13); https://x.com/_akhaliq/status/2076742842769158545
  • _akhaliq:Read It Back——冻结 MLLM 零样本图文生成奖励模型,MLLM-as-judge 重塑(Jul 15); https://x.com/_akhaliq/status/2077420925503353037
  • jerryjliu0:LlamaIndex RAG 演进全景——从 naive RAG 12 痛点到 document parsing 是 AGI 难题(116 页 slide deck); https://x.com/jerryjliu0/status/2058953208782074127
  • cwolferesearch:工具输出训练为何提升 agent——Cartridges 论文:将知识重构为 QA 数据集比直接训练更有效; https://x.com/cwolferesearch/status/2078272777744736723