信源:X 硬核干货雷达 · 覆盖 12 账号
覆盖账号:@omarsar0(elvis/DAIR.AI), @_akhaliq(AK), @rasbt(Sebastian Raschka), @svpino(Santiago), @simonw(Simon Willison), @hwchase17(Harrison Chase/LangChain), @jerryjliu0(Jerry Liu/LlamaIndex), @swyx(swyx/AI Engineer), @maximelabonne(Maxime Labonne), @tri_dao(Tri Dao), @cwolferesearch(Cameron Wolfe), @abacaj(Anton)
采集窗口:2026-08-19 ~ 2026-08-26 (近7天)
干货候选
-
主题:ExtractBench——首个企业文档结构化提取的可验证视觉溯源评测基准(arXiv 2607.29677) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:run-llama/ExtractBench | 论文:https://arxiv.org/abs/2607.29677 | 硬核点:PDF/企业文档 agent 提取需返回精确来源坐标(word-level bounding box)才具备生产可审计性;14 系统评测揭示通用 VLM 和 coding agent 均不支持 grounding,LlamaExtract Agentic Plus 领先;做 RAG 管线或文档提取工具的攻略必测基准。
-
主题:LFM2.5 QAD——4-bit 量化感知蒸馏恢复 97% BF16 精度(5.4GB→1.6GB / 21→64 tok/s) | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2085384100416782828 | 仓库:LiquidAI/LFM2.5-2.6B-GGUF(含 QAD-Q4_0.gguf) | 论文:https://huggingface.co/blog/LiquidAI/qad | 硬核点:QAD 解决后训练量化精度损失的实用方案,在标准 Q4_0 GGUF 格式下保持 3x 吞吐提升、~97% 基线质量;本地部署攻略性价比关键数据。
-
主题:LFM2.5-DSpark——推测解码 up to 3.2x 推理加速(H100 到 MacBook) | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2085384100416782828 | 仓库:LiquidAI/LFM2.5-2.6B-GGUF(含 DSpark draft checkpoints) | 论文:https://huggingface.co/blog/LiquidAI/lfm25-dspark | 硬核点:DSpark 轻量 draft model + Markov chain head + 共享权重加载,兼顾精度无损和 3.2x 吞吐;边缘端 H100/MacBook 实测数字可作部署选型攻略对比数据。
其余线索
-
@cwolferesearch(Aug 1):Agent 评测为何比标准 LLM 评测更难——轨迹状态验证、成本高、 benchmark 稳定性问题;长文技术分析,值得存档 RL/评测设计参考。
-
@abacaj(Aug 19):K3 vs Fable 实测对比——K3 错误多但持续追问可自纠正,Fable 错误少;模型行为观察,非实现类干货,留档参考。
-
@swyx(Aug 1):SmolForge Alpha 开放,每个 repo 配专属 coding agent + AI 原生 Git remote(forge.smol.ai);工程模板化实践,待 repo 公开后核实追加 watchlist。
-
@_akhaliq(Jul 28,超窗口):StateAct——长程 computer-use agent 的程序状态建模(CVPR 2026),arxiv:2607.15512;提前归档,下期窗口核验是否有新动态。
本轮覆盖 12 账号,有效干货候选 3 条;无新 GitHub 仓库需追加 watchlist(ExtractBench 已在 2026-08-14 追加,LiquidAI/LFM2.5-2.6B-GGUF 系模型卡仓库非本轮新增点名)。