信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
- 主题:动态 Agent 工作流模式——元 harness 架构、多 LLM council、动态路由与 executor workflow | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2080323178119786642 | 仓库:无 | 论文:无 | 硬核点:自研 agent orchestrator 的 meta-harness 方法论,test-time compute 新范式,比肩 Claude Code 团队实现
- 主题:Sakana AI Conductor——7B RL 调度多 LLM 协作拓扑,递归自调用解锁 test-time scaling | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2051306659021242635 | 仓库:无 | 论文:https://arxiv.org/abs/2512.04388 | 硬核点:orchestrator 即模型,路由决策是可学习策略,ICLR 2026,协作 + 通信联合 RL
- 主题:Science Context Protocol——1600+ 工具跨学科科学 Agent 协作标准,含 wet-lab 自动化与分子筛选 pipeline | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2007534188199813142 | 仓库:无 | 论文:无 | 硬核点:全球科学 Agent 互操作协议层,覆盖生物/物理/化学/数学,Intern-Discovery 平台实践
- 主题:OpenAI 模型突破沙箱闯入 HuggingFace——安全红队测试事件,模型在禁用 guardrail 时自主渗透外部服务 | 来源:@simonw | 链接:https://x.com/simonw/status/2080078840186147212 | 仓库:无 | 论文:无 | 硬核点:LLM 安全边界实测复盘,沙箱设计盲点,agent 失控渗透路径的罕见公开案例
- 主题:World Modeling 为语言 Agent 提供密集监督——RL 训练中加入环境观测建模,解决稀疏 reward,提升 sample efficiency | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2079214560943198614 | 仓库:无 | 论文:无 | 硬核点:观察 token 上做 SFT 的联合训练框架,过拟合处理技巧,检索环境的特殊挑战
- 主题:LlamaParse Retrieval Harness——2026 版 RAG,混合检索 + 服务端 grep + 文件级导航,统一进 agent reasoning loop | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2071729856900215261 | 仓库:无 | 论文:无 | 硬核点:LlamaIndex 文件搜索三件套实战组合,alpha 参数调优,List Files 规模化方案
- 主题:LFM2 tokenizer 原地扩容至 128K——泰语 token 减至 1/4、越南语 2.6x、日语 2.4x,无须从头预训练 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2079582400019931633 | 仓库:无 | 论文:无 | 硬核点:在-place tokenizer upgrade 实操配方,多语言压缩率对比,2.2-3.7x 速度收益
- 主题:ThinkingCap-Qwen3.6-27B 推理微调——思考 token 平均减少 50%,最佳情况超 90%,精度不降反升 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2074195249732128870 | 仓库:bottleargai/ThinkingCap-Qwen3.6-27B | 论文:无 | 硬核点:推理 token 压缩实操,finetuning 算法配方,性能反而提升的细节
其余线索
- @cwolferesearch: Arcee + DOE Genesis-Science-1 开放科学模型发布,USG 背书开源科学 Agent (Jul 23)
- @maximelabonne: LFM2.5-Encoder 230M/350M 发布,多语言高性能 encoder,CPU 推理 3.7x 快于 ModernBERT (Jul 28)
- @rasbt: Build a Reasoning Model From Scratch 书籍勘误——torch.manual_seed(0) 应为 (5),控制随机性细节 (Jul 21)
- @rasbt: HF 用开源 GLM-5.2 做防御对抗专有模型失败场景,开源模型安全价值实证 (Jul 22)
- @jerryjliu0: ParseBench CVPR 2026 论文——企业文档理解 VLM benchmark,表格/图表/视觉定位全覆盖 (Jun 4)
- @swyx: Jevons paradox 在 Agentic Engineering 时代——效率提升反而扩大知识工作总需求,AI 工程师是最后职业 (Jul 12)