信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:ExtractBench——企业文档结构化提取最全评测基准(370 docs/4869 pages/67类/8领域/14系统) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2087195936225108171 | 仓库:run-llama/ExtractBench | 论文:https://arxiv.org/abs/2607.29677 | 硬核点:LlamaIndex 放出 36 页白皮书+代码+数据集,全面评测前沿 VLM/编程 Agent/提取 API 在真实企业文档上的表现,$10-$1677 跑一次完整评测——踩坑复盘价值极高
-
主题:Artificial Analysis Search Index——搜索 API Agent 能力Benchmark(Parallel/Exa/Firecrawl/Tavily 等 13 产品) | 来源:@omarsar0 | 链接:https://x.com/omarsar0 | 仓库:无 | 论文:无 | 硬核点:同一 GPT-5.6 Luna Agent 环境,只换搜索提供商;无搜索基准 33 分,Parallel/Exa/Firecrawl 达 75/74/73;高质量搜索可使 Token 消耗降 40% 以上——选型必读
-
主题:DeepSeek-V4 论文未注明细节——mid-training 阶段混入 agentic trajectories | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch | 仓库:无 | 论文:无 | 硬核点:论文仅一句话提及但无人注意:DeepSeek-V4 在 mid-training 阶段就混入了 agentic 数据;这意味着 post-training 不是唯一注入渠道,对理解长程 Agent 训练曲线有参考价值
-
主题:Qwen 3.8 27B 默认推理设置"过度思考",附 LM Studio "Extra High" 实测画像 | 来源:@simonw | 链接:https://x.com/simonw | 仓库:无 | 论文:无 | 硬核点:Simon 实测发现默认配置下模型输出膨胀严重,需手动降推理深度才能高效运行——本地部署调参必知
其余线索
- @maximelabonne: LFM2.5-Encoder 230M/350M CPU 高效双向编码器,比 ModernBERT-base CPU 推理快 3.7 倍,多语言强(Jul 28)
- @cwolferesearch: Continual Pretraining 最佳实践资源清单(Databricks 等),LlamaIndex 官方文档提取 Agentic Plus 同期发布(Aug 11)
- @abacaj: K3 自我纠错能力被低估;Fable 用量受限期间 K3 作为备选代码模型实测对比(Aug 19)
- @swyx: OpenClaw 带动 Mac Mini 全球销量+50%(估算 $50-150M),Jensen 黄仁勋已注意到此开源 Agent 现象(Aug 20)
- @maximelabonne: 模型合并新玩法——LFM2.5-2.6B + Qwen3.6-35B-A3B 权重融合,紧凑模型达 Qwen 旗舰水平(Aug 5-6)