信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:SAS——通过端到端语言建模损失优化上下文排序的注意力稀疏化新方法 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2099511334987522298 | 仓库:tencent/Simple-Attention-Sparsification | 论文:https://arxiv.org/abs/2609.13141 | 硬核点:突破 Top-K 蒸馏式稀疏注意力的梯度阻断问题,将 selector 分数注入 softmax logit 使 LM 损失端到端优化上下文排序;Triton kernel 集成实现长序列训练;MATH500/GPQA-Diamond/LongBench 全面超越 SeerAttention-R,tight budget 下增益最大。
-
主题:ChessFly——果蝇大脑复刻神经网络下棋,击败 Opus 5,开源 HF Space + 模型权重 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2100498776893108470 | 仓库:mlabonne/chessfly | 论文:无 | 硬核点:用真实果蝇连接组训练神经网络下棋(h = (1-a)h + a·relu(γ(Wx+u-μ)/σ+β)),击败 Opus 5;浏览器端 HF Space 可直接体验;单次前向传播完成整盘棋决策,架构本身有研究价值。
-
主题:Encoder 在生产 Agent 中的核心地位——分类路由比生成更可靠,小模型快速兜底、大模型处理复杂边缘 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2100437426455900324 | 仓库:无 | 论文:无 | 硬核点:encoder 模型在真实生产环境(房产 Agent)中承担"分类+路由"关键路径,小模型廉价、可预测地失败,大模型专治罕见步骤;是对"encoder 已过时"论调的生产级反驳。
其余线索
- @jerryjliu0 9月13日:"context layer 是 2026 年少数护城河之一"——Agent 抽象固化、UI 简化、英语编程趋势;偏理念,缺实现细节,留档观察。
- @abacaj 9月3日:Mythos 模型体验报告——"Dario 全胜,Fable 代码仍领先";产品评测非干货,略过。
- @maximelabonne 8月28日:各硬件配置推荐模型(8GB/16GB);超出窗口但可作选型参考。
- @cwolferesearch 5月12日:OpenAI Codex prompt 缓存策略分析——如何构造长 system prompt 最大化 cache hit rate;时间较久,窗口外。