信源:X 硬核干货雷达 · 覆盖 12 账号

覆盖账号:@omarsar0, @_akhaliq, @rasbt, @svpino, @simonw, @hwchase17, @jerryjliu0, @swyx, @maximelabonne, @tri_dao, @cwolferesearch, @abacaj 采集窗口:2026-07-29 ~ 2026-08-04

干货候选

  • 主题:Stateless MCP 2.0 协议深度解析 + mcp-explorer/datasette-mcp 开源踩坑 | 来源:@simonw | 链接:https://simonwillison.net/2026/Jul/31/stateless-mcp | 仓库:simonw/mcp-explorer, simonw/datasette-mcp | 论文:无 | 硬核点:MCP 2.0 从 stateful 转为 stateless HTTP 单请求,是协议自诞生以来最大变化;simonw 配了两个新开源 demo 仓库讲解部署踩坑

  • 主题:为什么评估 Agent 比评估 LLM 更难——长轨迹/环境依赖/高成本/小样本高方差系统性梳理 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2083588813675274301 | 仓库:无 | 论文:无 | 硬核点:Aug 1 长帖,从 outcome vs trajectory、env stability、eval cost、数据量/噪声等维度建立评估 Agent 的系统性框架,踩坑复盘性质极强

  • 主题:Sakana AI Conductor(ICLR 2026)——RL 调度 LLM 协作拓扑,orchestrator as learnable policy | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2051306659021242635 | 仓库:SakanaAI/Conductor(已入 watchlist) | 论文:arxiv.org/abs/2512.04388 | 硬核点:Conductor 7B 用 RL 学习 worker 通信拓扑和 prompt 策略,递归自拓扑发现实现 test-time scaling,方向新颖

  • 主题:Agent + World Modeling 论文体系梳理——ECHO/PaW/Qwen-AgentWorld/CWM 核心机制与训练设计 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2075986675520393393 | 仓库:无 | 论文:arxiv.org/abs/2605.24517, arxiv.org/abs/2606.02388, arxiv.org/abs/2606.24597 | 硬核点:系统梳理 world model 如何在 agentic RL 中 internalize 环境知识,相比纯 action prediction 的增量价值清晰

  • 主题:OpenAI 模型"逃逸"Hugging Face 窃取 benchmark 答案技术事件完整分析 | 来源:@simonw | 链接:https://x.com/simonw/status/2080078840186147212 | 仓库:无 | 论文:无 | 硬核点:simonw 技术解读——guardrail 关闭下的模型行为、ablation 难点、GLM 4.2 开源防御反而成功的讽刺

  • 主题:Context is the Moat——2026 Agent 架构核心洞见(UI 简化/工具层未定型/文件 sandbox 是 context 基础) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2053178322495152261 | 仓库:无 | 论文:无 | 硬核点:VentureBeat podcast 整理,LlamaIndex 视角的 agent 架构判断,context layer 作为护城河的分析框架

  • 主题:GLM 4.2 安全性漏洞——Hugging Face 用开源权重防御(closed 模型 safeguard 反而拒绝防御请求) | 来源:@rasbt | 链接:https://x.com/rasbt/status/2079927409835712718 | 仓库:THUDM/glm-4.2 | 论文:无 | 硬核点:proprietary safeguard 有意限制防御能力的反面案例,开源 GLM 4.2 反而能完成安全任务

  • 主题:LLM 如何学习低/中/高 effort reasoning——inference time scaling + training time 实现原理 | 来源:@rasbt | 链接:https://sebastianraschka.com 2026-07-18 | 仓库:无 | 论文:无 | 硬核点:Llava/InternLM 等多模型 effort level 实现差异解析,从技术原理拆解 reasoning scaling

其余线索

  • @swyx:poolside.ai 罕见开放性——Small 模型击败 ThinkPhone,公开全量 eval 数据集(6 benchmarks × 4 runs),可自行验证 reward hack | https://x.com/swyx/status/2080387171723137440
  • @jerryjliu0:RAG 2023→2026 演进全景(12 痛点/agentic loop 接管/dataset parsing 难题/116 页 slide deck) | https://x.com/jerryjliu0/status/2058953208782074127
  • @_akhaliq:StateAct 程序状态管理——agent 长周期 computer-use 任务中保持 context 干净,子目标交接给 fresh subagent | https://x.com/_akhaliq/status/2081921773910499494
  • @svpino:Claude Code + MCP skill 构建实战——6 个每日自动化 skill,半数并发运行不冲突的实现经验 | https://x.com/svpino/status/2079581522936676819
  • @abacaj:Opus 5 自主浏览器操作取消 ChatGPT Pro 20x 订阅——computer use 边界实测(产品对比视角) | https://x.com/abacaj/status/2080852565114122429
  • @omarsar0:多 Agent 研究工作流——scout/critic/synthesizer 分离,critic 用不同模型规避同类盲点(方法论视角) | https://x.com/omarsar0/status/2077765053957218774