信源:X 硬核干货雷达 · 覆盖 12 账号
采集日期:2026-08-10 · 时段:近 3-7 天 · 评分维度:实现技巧/性能优化/踩坑复盘/新工具用法/论文长帖
干货候选
-
主题:GPT-5.6 通过 Codex 自我优化,降低 20% 服务成本 | 来源:@simonw | 链接:https://x.com/simonw/status/2082641030093127768 | 仓库:无 | 论文:无 | 硬核点:模型自优化生产部署(重写 GPU kernel + 改进 speculative decoding)首次公开披露,推理工程必读
-
主题:Antidoom — Final Token Preference Optimization 消除推理模型 doom loop(dataloader 率 22.9%→1%) | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2074495376204210388 | 仓库:Liquid4All/antidoom | 论文:无 | 硬核点:精确定位重复失败 token、仅在首 loop-starting token 做 preference 训练的新思路,minimax 对推理部署有直接价值
-
主题:ReplaySSM — SSM 状态写回绕过实现混合模型 2 倍速,解锁 SSM speculative decoding | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2066518563184365953 | 仓库:无 | 论文:无 | 硬核点:Hybrid model( Nemotron-3 / Qwen3.5) 推理延迟敏感场景核心优化技巧
-
主题:Mamba-3 发布 — SSM 与线性注意力混合最强线性模型,推理 scaling 驱动设计 | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2033948569502413245 | 仓库:state-spaces/mamba | 论文:https://arxiv.org/abs/2603.15569 | 硬核点:线性模型 SOTA 新标杆,Tri Dao 亲自发布,附完整开源代码
其余线索
- LocateAnything-3B:Parallel Box Decoding(CVPR 2026)——NVIDIA LPR 视觉定位新范式,一次并行预测整 BBox,比 Qwen3-VL 快 10 倍且精度更高 (@_akhaliq RT NVIDIA,5 月 28 日)
- LFM2.5-Encoder:230M/350M CPU 高效编码器——长上下文双向编码,CPU 8K tokens 30 秒完成,3.7 倍快于 ModernBERT-base(@maximelabonne,7 月 28 日)
- LLM tokenizer 双倍扩容攻略——LFM2.5-8B-A1B 从 65K→128K tokenizer,泰语省 4 倍 token、越南语 2.6 倍,2.2~3.7 倍推理加速(@maximelabonne,7 月 21 日)
- Antidoom 训练数据集开源:HuggingFace 上有配套 preference data,可直接复现 FTPO 训练流程(@maximelabonne,7 月 7 日)