信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:GPT-6 Astra 文档解析 SOTA 达 97.2% (短文档) / 90.6% (中文档),LlamaIndex ParseBench 评测复盘 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2096258549131165746 | 仓库:run-llama/ParseBench | 论文:无 | 硬核点:Sep 5 新鲜 benchmark 数据 + 成本分析(11c/page,是替代方案的 10x),LLM 文档提取实战评测,有复现价值

  • 主题:Jev 研究论文分类 pipeline — System One + System Two 模型组合显著提升论文打标质量,复合智能系统实战复盘 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2102066232383979749 | 仓库:无 | 论文:无 | 硬核点:Sep 21 最新,System Two (慢思考)增强 System One 分类的 production 案例,pipeline 调优实操参考

  • 主题:多 Agent 协调失控率:接收到不安全轨迹后从 0-5% 飙升至 40-95%,多 Agent 系统失控被建模为"流行病"传播 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2094806744052715668 | 仓库:无 | 论文:https://arxiv.org/abs/2608.29460 | 硬核点:Sep 8,长达三周仍值得留档;Agent 失控的量化复现,multi-agent 系统的安全必读

  • 主题:MOPD (Multi-Teacher On-Policy Distillation):多 RL 专业教师蒸馏合一学生模型的新 post-training 原语,MiMo-V2-Flash / GLM-5 / Nemotron-Cascade 2 / DeepSeek-V4 均已采用,6x 采样效率提升 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2050347345641116088 | 仓库:无 | 论文:https://arxiv.org/abs/2606.30406 | 硬核点:May 1 长帖,但系统性覆盖 MOPD 方法论全貌与近期主流模型部署案例,post-training 必读

  • 主题:Apodex 1.1 开源:自进化重型 Agent 模型族 (35B Mini,FrontierAgent),开源 Harness + Weights,对标 Professional Work 场景 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2092269176710631758 | 仓库:ApodexAI/FrontierAgent | 论文:无 | 硬核点:Aug 24 发布,开源权重+Harness 全套,自进化 Agent 的工程实现值得关注

其余线索

  • 主题:Coding Agent 产出 vs 落地可靠软件的差距显著:代码生成到交付之间有 field study 实证 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2097368121468453044 | 仓库:无 | 论文:无 | 硬核点:Sep 8,Agent 工程化落地的真实瓶颈分析
  • 主题:TRACES — 探索性 AI 评测基准,评估 AI 能否发现未知答案而非仅检索已知答案,六维能力评估 (Tools/Repair/Alternatives/Coherence/Evidence/Science) | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2092269176710631758 | 仓库:无 | 论文:无 | 硬核点:评测设计思路创新,从检索转向发现
  • 主题:AI Engineering World's Fair 2026 五大趋势总结:Agent 系统化而非单点工具 | 来源:@swyx | 链接:https://x.com/swyx/status/2095757526726025348 | 仓库:无 | 论文:无 | 硬核点:Sep 21 最新,AI Engineering 领域状态快照