信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:Portable Computer——本地优先 Agent,27B 模型 82.6% 真实知识工作 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:无具体 repo 名(LlamaIndex 生态) | 论文:无 | 硬核点:on-device 27B 超越开源 harness(Pi/Hermes),post-trained PPLX 27B 达 85.4%,LlamaIndex RAG 栈工程实践复现性强
  • 主题:Claude Code + SmolVM 沙盒自动化——Fable 5 自建 GitHub Actions 执行工作流 | 来源:@simonw | 链接:https://x.com/simonw/status/2092718504516428008(smolvm 相关) | 仓库:github.com/CelestoAI/SmolVM | 论文:无 | 硬核点:AI Coding Agent 自主修复执行环境缺失(Fable 5 识别无 /dev/kvm 后主动推送 GitHub Actions),工程踩坑复盘,可作 Agent 沙盒设计参考
  • 主题:ExtractBench 严格评分——word-level box + IoU 0.5,value 和引用必须同时正确 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:github.com/run-llama/ExtractBench | 论文:无 | 硬核点:LLM 文档抽取评估协议——引用必须精确到词级边界,完美包围错误值不得分;实用 RAG eval 评分设计参考
  • 主题:TrueFoundry TrueForge 开源——vendor-neutral Agent Harness,75% 降本替换 Claude Managed Agents | 来源:@svpino | 链接:https://x.com/svpino/status/2090818844105511001 | 仓库:github.com/truefoundry/trueforge | 论文:无 | 硬核点:Agent harness 层开源替代方案,工程选型参考;omarsar0 8 月 20 日已原帖确认

其余线索

  • @jerryjliu0: Aug 17 LlamaParse Pro 升级 400K→1.2M credits,PDF 解析工程推广帖(产品非干货)
  • @simonw: Aug 17 Qwen 3.8 27B 本地跑通(LM Studio M5 Max 17GB GGUF),工具实操帖(偏观察)
  • @maximelabonne: Jul 28 LFM2.5-Encoder-230M/350M 发布(3.7x ModernBERT-base CPU 速度,CPU 8K tokens <30s),模型发布硬核但 Jul 28 已超 7 天窗口
  • @_akhaliq: Jul 31 DeepSeek-V4-Flash-0731 开源权重(MIT),模型发布硬核但 Jul 31 已超 7 天窗口
  • @rasbt: Jul 26 10 个开源权重模型架构纵览(Jan-Feb 2026),MLA/线性注意力混合趋势分析,长文硬核但 Jul 26 已超窗口
  • @cwolferesearch: Aug 1 为什么 Agent 评测比 LLM 难——环境状态验证(coding agent 说修 bug 但 test 仍失败),eval 设计核心问题,长文硬核但 Aug 1 已超 7 天窗口