信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
- 主题:文档提取必须做词级溯源——word-level box @ IoU 0.5 是及格线,VLMs 仅 28% 达标 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:run-llama/ExtractBench | 论文:无 | 硬核点:ExtractBench 严格计分规则(值对+引用对+IoU≥0.5 才算)揭示多数 VLM 文档提取方案自欺欺人;LlamaExtract Agentic Plus 94%+ 准确率来自 harness+专用模型 co-design,非通用 VLM;可写"企业文档提取避坑与 ExtractBench 评测指南"
- 主题:LLM 作机器人大脑——无需额外训练即 4×SOTA,实体机器人 16.7%→97.3%,LIBERO-PRO 仿真 12.8%→53.3% | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2082175796710658210 | 仓库:无 | 论文:无 | 硬核点:Tri Dao 发帖宣告 LLM+LeRobot 框架免微调四倍收益;实操门槛低(用现有机器人 policy+LLM reasoning 无需重训),可写"LLM 机器人集成从 0 到 1 踩坑指南"
- 主题: LlamaParse 大规模文档提取——10k~100k 字段、500 页文档、94%+ 准确率,Agentic Plus 全流程拆解 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089099864554831995 | 仓库:run-llama/ExtractBench | 论文:无 | 硬核点:超多字段+超长文档是生产级 RAG 最大痛点;Jerry Liu 直接给出 harness+模型集配置,FTX 债权人矩阵(75k 字段/114 页)验证,可写"LlamaParse Agentic Plus 提取 10 万字段实战"
- 主题:世界模型训练本质——用 SFT 让 LLM 预测 tool 输出,对齐 RL objective for LLM tokens,双目标混合才是正解 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2082195276765241405 | 仓库:无 | 论文:无 | 硬核点:解释为什么单加 world modeling loss 能缩短轨迹、降低成本(~$7.8 vs ~$72/task),而不仅仅是"理解 tool output";可写"Agent World Modeling 训练范式拆解——SFT+RL 双目标实操"
- 主题:LFM2.5 Encoder 系列发布——230M/350M 双规格,CPU 8k tokens 推理比 ModernBERT 快 3.7 倍,低于 30 秒 vs 超过 90 秒 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2082122012726608345 | 仓库:无 | 论文:无 | 硬核点:Liquid AI 首发 LFM 混合架构 encoder;双向 MLM+线性 attention 混合,长 context CPU 友好;可写"LFM2.5 Encoder CPU 长文本分类部署指南"
其余线索
- @abacaj: Opus 5 自主浏览器操作取消 ChatGPT Pro 订阅——browser agent 真实任务能力观察,非技术深度帖,存档观察
- @swyx: AEO/SEO agent 自动化每周跑一次——实操 tip 有参考价值但未附实现,已在 2026-08-13 x-tech-radar 覆盖
- @jerryjliu0: 路由必须放在 harness 层而非 gateway 层(Aug 14-15 帖)——架构判断,LlamaIndex 官方博客已详述;可作攻略背景参考