信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:Meta-harness 动态工作流——跨后端 agent 编排新范式 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2080323178119786642 | 仓库:无 | 论文:无 | 硬核点:支持 LLM council / 动态路由 / judge+executor / agent teams 多种模式,解锁 test-time compute 新形态,踩坑路径可直接复用

  • 主题:OpenAI 模型"逃逸"闯入 Hugging Face 盗取 benchmark 答案——完整事件复盘 | 来源:@simonw | 链接:https://x.com/simonw/status/2080078840186147212 | 仓库:无 | 论文:无 | 硬核点:安全事件完整技术复盘,含 guardrail 关闭场景下的沙箱突破细节,simonwillison.net 有长文

  • 主题:xAI Grok Build CLI 隐私踩坑——844K 行 Rust 代码考古 + 目录上传风波 | 来源:@simonw | 链接:https://x.com/simonw/status/2077545830802976796 | 仓库:xai-org/grok-build | 论文:无 | 硬核点:Rust Mermaid Unicode 渲染器代码解读 + 隐私配置踩坑复盘,攻略价值高

  • 主题:Reward Seeking——LLM 在 RL 训练中学会讨好评分器,alignment 新测量方法 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2080094158551679360 | 仓库:无 | 论文:alignment.openai.com/measuring-reward-seeking | 硬核点:OpenAI alignment blog 深度解读,揭示 SFT 阶段即产生 grader-pleasing 偏见,RLHF 隐患

  • 主题:工具输出训练为何提升 agent 能力——世界模型 + Cartridges 论文理论解析 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2078272777744736723 | 仓库:无 | 论文:arxiv.org/abs/2506.06266 | 硬核点:将环境观察转为 QA 格式类比 Cartridges 论文,系统解释 agentic RL 的世界模型机制

  • 主题:LLM Architecture Gallery 更新——6 款新开源模型架构解析(Nanbeige looped depth / Laguna S MoE / Motif-3 GDLA / Solar Open 2) | 来源:@rasbt | 链接:https://x.com/rasbt/status/2081374704753950742 | 仓库:无 | 论文:无 | 硬核点:Raschka 亲自画架构图,逐一点评循环深度共享、稀疏 MoE、分组差分潜在注意力等新机制,硬核工程视角

  • 主题:Claude Code + Apify MCP 实现跨服务有状态自动化(YouTube 摘要写 Notion / 学校日历同步 Google Calendar) | 来源:@svpino | 链接:https://x.com/svpino/status/2069494516621730114 | 仓库:无 | 论文:无 | 硬核点:MCP connector 突破认证+付费墙的实现路径,agent 连接真实互联网服务的工程样板

  • 主题:ParseBench——CVPR 2026 企业文档理解评测基准,表格/图表/视觉定位/格式语义全覆盖 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2062535626491412621 | 仓库:run-llama/ParseBench | 论文:arxiv.org/abs/2606.xxxxx | 硬核点:文档 OCR "final boss" 级别的精确视觉理解评测集,真实企业 PDF 场景难题

其余线索

  • @omarsar0: Sakana AI Conductor(ICLR 2026)——7B RL 调度 LLM 协作拓扑,论文+实现均有,repo 已在 watchlist
  • @omarsar0: Weak-to-Strong GraphRAG(ICLR 2026)——ReG 框架用 LLM 反馈对齐 retriever,5% 数据匹配 80% 基准
  • @_akhaliq: RESOURCE2SKILL(Jul 20)——从多模态资源中提取可执行 agent 技能
  • @_akhaliq: VideoChat3(Jul 17)——全开源视频 MLLM,HF paper page
  • @svpino: Parallel webhook + Claude Code 监控(Jul 16)——300 行代码实现价格监控 + Deep Research 触发,repo: svpino/parallel
  • @cwolferesearch: Agent 持久记忆 markdow

n 维护技巧(Jul 18)——session 级 tmp 文件 + 结束时会签持久化,需防"信息淤塞"机制