信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:GPT-6 Astra 与循环Transformer架构深度解析——cost tradeoffs、reasoning traces、近期文献 tour | 来源:@rasbt | 链接:https://x.com/rasbt/status/2097677950262939931 | 仓库:无 | 论文:无 | 硬核点:Sebastian Raschka 亲撰 mega write-up,配视频,含 looped transformer vs 标准 transformer 详细 cost 对比图与近期 2026 论文综述,附 SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 论文要点;真正可写攻略的架构分析长帖。

  • 主题:ExtractBench——企业文档提取严格评测基准(word-level box IoU 0.5 双重打分) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:run-llama/ExtractBench(2026-08-14 已有) | 论文:无 | 硬核点:LlamaIndex 提出"value 对 + citation 对才算对"严格打分法;主流 VLM 文档 grounding 实测惨淡,LlamaParse VLM-based 解法领先;做 RAG/文档 AI 产品必读的评测设计复盘。

  • 主题:小模型无需蒸馏即可构建竞争力编程 Agent——Microsoft 论文信号 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2097696747338232069 | 仓库:无 | 论文:arxiv 疑似(帖中无具体链接) | 硬核点:elvis 转发 Microsoft 新研究,证明小模型可在无 frontier 模型蒸馏的情况下构建有竞争力的 coding agent,方向值得跟进,完整论文可作攻略素材。

  • 主题:LLM 大脑上机器人——零训练即可 4× SOTA 性能 | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2082175796710658210 | 仓库:无 | 论文:无 | 硬核点:Tri Dao 转发 LLM+机器人融合工作,真机 16.7%→97.3%,Sim 12.8%→53.3%;"LLM 思考+机器人行动"分工范式验证,robotics agent 方向重要信号。

  • 主题:LFM2.5-2.6B 不适合编程——Maxime Labonne 实测数据警示 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2099526059418939778 | 仓库:无 | 论文:无 | 硬核点:18 万 views、6868 赞的爆款帖,附数据说明 Liquid AI 2.5-2.6B 在 coding 任务上存在明确短板;有具体数据才有攻略价值,是避坑型干货。

  • 主题:Continual Pretraining(CPT)做领域专业化 LLM 的最佳实践资源整理 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2086203104094257642 | 仓库:无 | 论文:Databricks CPT blog / Composer 2 arxiv:2603.24477 / Code Llama arxiv:2308.12950 等 | 硬核点:Cameron Wolfe 系统梳理 6 篇 CPT 实战资源(Databricks 最佳实践 + 多篇顶会论文),做领域模型fine-tuning 的工程师必读清单。

  • 主题:Claude Code + MCP 是史上最佳自动化平台——svpino 技能分享复盘 | 来源:@svpino | 链接:https://x.com/svpino/status/2079581522936676819 | 仓库:无(bit.ly/4w6whIu 为短链接) | 论文:无 | 硬核点:svpino 展示用 Claude Code + MCP 自动化日常工作的实战 skill,含可运行代码片段;虽然 bit.ly 短链接无法直接追溯,但 3.6 万播放量说明社区高度认可,有复现价值。

  • 主题:SWE-bench 2026.02 更新分析——基准高分 ≠ 真实 agent 能力 | 来源:@simonw | 链接:https://x.com/simonw/status/2024346931632492827 | 仓库:无 | 论文:无 | 硬核点:Simon Willison 写长文指出 SWE-bench 评测设计局限:persistent memory + tool execution + unverified code 才是真实 agent 场景;benchmark 分数与 production 效果存在根本性断层,踩坑复盘型干货。

其余线索

  • 主题:Blender + 编程 Agent 新玩法——macOS 本地 3D 渲染技能 TIL | 来源:@simonw | 链接:https://x.com/simonw/status/2096265759660142826 | 仓库:无 | 论文:无 | 硬核点:Simon 用 GPT-6 Astra 让 coding agent 调用 Blender 做 pelican 骑自行车 3D 渲染;til.simonwillison.net 有完整 TIL,含 agent 调用外部 GUI 工具的工程思路。

  • 主题:LingBot-World 2.0 Small——1.3B 单卡实时交互式世界模型 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2097730117900328968 | 仓库:无(Roboant 的开源项目,原帖未附 repo) | 论文:无 | 硬核点:1.3B 模型在单消费级 GPU 上实时生成交互式 3D 世界;世界模型小型化方向有趣,但原帖无 repo 链接,留档观察。

  • 主题:Agentic Retrieval Harness——LlamaIndex 持久化数据管道框架 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2073407100642852871 | 仓库:run-llama/legacy(2026-07-22 已有) | 论文:无 | 硬核点:Jerry 定义"现代 agentic retrieval"的标准 harness 架构;semantic/keyword/regex/file search 统一工具抽象,接入任意 agent;LLM+RAG 工程化参考。

  • 主题:FLUO 1B 小模型后训练团队实战——工具使用/指令遵循/长上下文/复杂任务恢复 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2104098635118223716 | 仓库:无 | 论文:无 | 硬核点:Liquid AI 1B 模型后训练细节分享,含工具调用、instruction following、长 context、多步复杂任务恢复的实战经验;无代码但有方法论参考价值。

  • 主题:Claude Opus 5 自主操控浏览器取消订阅——browser-use agent 能力实测 | 来源:@abacaj | 链接:https://x.com/abacaj/status/2080855420709527613 | 仓库:无 | 论文:无 | 硬核点:Anton 实测 Opus 5 用 browser-use 能力直接取消 ChatGPT Pro 订阅(20次);browser automation agent 已达到可自主完成真实金钱操作的水平,安全性值得关注。