信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:LLM 推理 effort 控制:训练时与推理时机制详解 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2078471977237450829 | 仓库:无 | 论文:无 | 硬核点:详细解释 LLM 如何在推理时/训练时切换低/中/高度推理 effort,附完整技术文章(magazine.sebastianraschka.com),280K 播放,Jul 18。

  • 主题:X MCP Tools 技能:3 步搭建本地 X 情报流 HTML 页面(X API + MCP + agent artifact) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2078573267015885136 | 仓库:dair-ai/dair-academy-plugins | 论文:无 | 硬核点:完整 step-by-step 实操教程:X API MCP 配置 → skill 安装 → prompt 生成 HTML feed,可定时自动化,实用度高,Jul 18。

  • 主题:Agent Teams 实战:用 LLM Council 构建多角色 AI 研究团队(@raft_hq) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2077765052434633023 | 仓库:无 | 论文:无 | 硬核点:并非简单多 agent,关键是角色与目标设定方法论,配 raft_hq 平台实战演示,Jul 18。

  • 主题:World Modeling 作为 RL agent 密集监督信号:联合训练 SFT+RL、observation filtering、过拟合处理 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2079214560943198614 | 仓库:无 | 论文:https://arxiv.org/abs/2506.06266 | 硬核点:为何工具输出可作为环境 dense supervision;joint RL/SFT 训练权重平衡;observation filtering 防止过拟合;PrimeIntellect True Agents 论文支撑,Jul 20。

  • 主题:ParseBench:最全面 VLM 文档理解评测基准(CVPR 2026),2k 页真实企业文档 + 多维评估指标 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2062535626491412621 | 仓库:无 | 论文:https://arxiv.org/abs/2604.04xxx(ArXiv link in post) | 硬核点:文档语义理解是 AGI-complete 问题;表格/图表/visual grounding/fidelity 多维评测;LlamaIndex CEO 亲自发,Jul 初(CVPR 2026 期间)。

其余线索

  • Long-Horizon-Terminal-Bench:终端密集奖励长程任务评测基准,AK(@_akhaliq)Jul 13 分享,huggingface paper page。
  • GroundWorld Simulation Models in Real-World Metropolis:ECCV 2026 论文,AK RT,huggingface.co/papers/2603.15xxx。
  • Think in Strokes, Not Pixels:ECCV 2026 论文,过程驱动图像生成,AK RT。
  • Claude Code 团队访谈(simonw @aiDotEngineer):视频 + annotated transcript 已发布,Jul 21,非技术长帖,归入观察线。