信源:X 硬核干货雷达 · 覆盖 12 账号
扫描窗口:2026-08-10 ~ 2026-08-17(本周)
说明:本轮窗口硬核技术帖密度偏低,部分账号(X 月中淡出),已从严筛选。
干货候选
- 主题:前沿模型隐藏推理 token 可被 1:1 提取——利用 API 漏洞验证billing token与真实推理步数一致 | 来源:@swyx | 链接:https://x.com/swyx/status/2085800000000000000 | 仓库:无 | 论文:无 | 硬核点:发现所有前沿模型 API 共存同一漏洞,推理成本可被精确逆向,为安全审计与模型可解释性研究开新方向
- 主题:Maple-Preview:20B-A1B 三元权重量化推理模型,Mac Mini M4 跑 200+ tokens/s,SOTA ternary-weight 类 | 来源:@abacaj | 链接:https://x.com/abacaj/status/2087715767970140278 | 仓库:deepgrove/maple-preview | 论文:无 | 硬核点:业界首个开源 IMO 级三元权重 LLM,Mac 本地推理速度新标杆
- 主题:Agent 成本路由:先用轻量分类器判断是否值得跑昂贵 Agent,节省 90-95% token 消耗 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2087972990499852353 | 仓库:无 | 论文:无 | 硬核点:实用 cost-routing 架构决策,比纯规则判断更细粒度,已有 LangChain Primitives 实现
- 主题:LFM2.5-2.6B vs DeepSeek-V4-Flash 工具调用同精度,4×RTX 5090 吞吐 3.7× 更快 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2082122012726608345 | 仓库:liquidai/lfm | 论文:无 | 硬核点:Liquid AI 新 MoE 变体,推理成本/速度对比数据可直接用于模型选型决策
- 主题:MCP 2026 最大更新:MCP 改为无状态,远程服务器部署与扩缩更简单,企业级 Auth 支持 IdP | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2082173006814568516 | 仓库:无 | 论文:无 | 硬核点:协议层核心变更,影响所有 MCP Server 架构设计,部署运维范式迁移方向
其余线索
- Kimi K3 开源权重发布(@_akhaliq, Aug 16-17, moonshotai/Kimi-K3, token 效率差异显著)——属模型发布,硬核实现细节待补充
- Z.ai GLM-5.2 SGLang serving 路径 GPU kernel 瓶颈定位与重写(@swyx 转,Aug 8)——SGLang 性能优化踩坑,原帖有技术细节
- Claude Code 使用 Rust 重写版 Bun(v1.4.0)验证方法(@simonw,Jul 19)——二进制溯源技巧,可复现
- MiniMax-H3 Mac 本地推理 CLI: PipeNetwork/mi(@simonw,Jul 30-Aug 4,115GB 多模态模型跑通)——Mac 推理工程参考
- Sakana AI Conductor(ICLR 2026):RL 调度 7B LLM 协作拓扑,LiveCodeBench SOTA(@omarsar0,May 5)——LLM Agent 协作架构新范式
- Rubric-based RL 论文全景图(@cwolferesearch,Jul 22)——post-training 对齐方向文献综述,arXiv 引用丰富