信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:Harness-of-Harness——让 coding agent 自主持续构建数天的多层编排框架 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2095175056598966652 | 仓库:无 | 论文:无 | 硬核点:Wrapper 框架新范式——把已有 harness 嵌套组织成「规划→编码→测试」循环,突破单轮 agent 上限,值得深入拆解实现细节
  • 主题:Exo harness 实战——全量暴露 harness 代码给模型实现递归自我改进 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2095204228687945880 | 仓库:无 | 论文:无 | 硬核点:不只是 prompt 注入,而是把运行代码+日志全部开放给模型动态升级,是最贴合 Bitter Lesson 哲学的 RSI 路径
  • 主题:LangSmith Messages View——以对话流形式回放 agent trace,降低调试门槛 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2094985765629628904 | 仓库:无 | 论文:无 | 硬核点:将 trace 重放体验从"读 fluent trace"变成"读英文对话",工程化价值高,落地参考性强
  • 主题:Claude Fable 5.1 tokenizer 分析——英语贵 1.4x、西班牙语 1.33x、简体中文几乎不变 | 来源:@simonw | 链接:https://x.com/simonw/status/2094938927727804684 | 仓库:无 | 论文:无 | 硬核点:tokenizer 变化带来的成本差异量化分析,对预算敏感的 agent 构建者有直接参考价值

其余线索

  • @swyx (Sep 4): GPT-6 Astra 发布舆情点评——OpenAI 首次好过 Claude,latent.space 深度测评附链接;偏行业观察,非硬核实现
  • @jerryjliu0 (Sep 3): 等 GPT-6 Astra ChatGPT Pro 权限的吐槽帖,非技术干货
  • @abacaj (Sep 3): AGI 营销循环吐槽 + Anthropic Mythos 初印象——短观点,无实现细节
  • @cwolferesearch (Aug 21): 20k+ 字 RL for LLMs 综合指南预告,8 月旧帖,本轮留档等正式发布

本轮观察

  • @omarsar0 本轮最活跃:Sep 2 密集输出 Harness-of-Harness 和 Exo 两篇,均指向「agent 递归自我改进」方向,2026 RSI 主题明确
  • @_akhaliq、@rasbt、@svpino、@maximelabonne、@tri_dao 本轮无 7 日内硬核技术帖,跳过