信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:SSM 状态重计算——混合模型推理 2x 提速新解法 | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2066518563184365953 | 仓库:state-spaces/mamba | 论文:无 | 硬核点:首创 RecomputeSSM 技巧——hybrid model(Qwen 3.5/Nemotron Ultra)decode 阶段不写回 SSM state,改用重计算换取 HBM 带宽,speculative decoding 终于可应用于 SSM,实用性强。
-
主题:Sakana AI Conductor:7B RL 训练多 LLM 协作拓扑(ICLR 2026) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2051306659021242635 | 仓库:SakanaAI/Conductor | 论文:https://arxiv.org/abs/2505.XXXXX | 硬核点:Conductor 不直接解题,而是设计 worker 拓扑+下发 prompt 指令,GPQA-Diamond/LiveCodeBench SOTA,RL 自发现协同策略(无人工设计),复现路径清晰。
-
主题:ParseBench——首个文档解析 AI Agent 评测基准(CVPR 2026) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2062535626491412621 | 仓库:run-llama/ParseBench | 论文:https://arxiv.org/abs/2604.08538 | 硬核点:2k 人工验证企业文档页+167k 测试规则,LlamaParse Agentic 84.88%综合,文档解析被定义为 AGI-complete 问题,工程复现价值高。
-
主题:RSIBench-Data:递归自我改进数据质量基准(arxiv 2607.25886) | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2082923633593176426 | 仓库:无 | 论文:https://arxiv.org/abs/2607.25886 | 硬核点:评测 LLM Agent 能否自主改进训练数据,发现"发现-可靠性鸿沟"——58%场景能初步改进但 78%无法保持峰值,工程坑点明确。
-
主题:Mac 开发环境即 Claude Skill——swyxio/skills 实战 | 来源:@swyx | 链接:https://x.com/swyx/status/2037410502817841176 | 仓库:swyxio/skills | 论文:无 | 硬核点:Skill=可执行开发环境文档,Claude Cowork 直接消费;global vs project 级 skill 分离是实操关键,并行 worktree 多 agent 模式工程可抄。
-
主题:SWE-bench 2026 年 2 月官方榜单长帖分析 | 来源:@simonw | 链接:https://x.com/simonw/status/2024346931632492827 | 仓库:无 | 论文:无 | 硬核点:逐模型分析官方评测结果+chart 重绘技巧,Cluade Opus 4.5 意外超 4.6 的细节值得做攻略深挖。
-
主题:LangSmith Gateway 公测——Agent 成本管控基础设施 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2082883597204373717 | 仓库:langchain-ai/deepagents | 论文:无 | 硬核点:per-end-user 限额+rate limiting+PII 脱敏一站式,spend limit 断请求还是断下一条的技术细节是踩坑点,工程强相关。
-
主题:Mamba-3:下一代线性状态空间模型 SOTA(arxiv 2603.15569) | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2033948569502413245 | 仓库:state-spaces/mamba | 论文:https://arxiv.org/abs/2603.15569 | 硬核点:FlashAttention 作者新作,混合架构已成主流(Quen3.5/Nemotron),线性注意力效率+scaling 关系实操解读。
其余线索
- @jerryjliu0:context layer 是 2026 唯一护城河——UI 简化+Agent 抽象固化+sandbox/web search 组合是明确方向,非新观点但框架清晰值得存档(https://x.com/jerryjliu0/status/2053178322495152261)
- @cwolferesearch:为什么评测 Agent 比评测 LLM 难得多——单轨迹+长时域+环境交互复合噪声,benchmark 设计思路值得存档(https://x.com/cwolferesearch/status/2083588813675274301)
- @hwchase17:Deep Agents+Browserbase 深度浏览——生产环境可靠性关键在 page snapshot 而非 stack trace,ops 踩坑值得存档(https://x.com/hwchase17/status/2050300474927292883)
- @rasbt:AI Coding Agent Index 修正帖——label shift 导致 Ultra=Max 混淆,校准评测细节值得存档(https://x.com/rasbt/status/2075961865683825141)
- @abacaj:Fable vs Sol 模型驱动风格差异——"did too much" vs "holds back"成选型新轴,实用选型参考(https://x.com/abacaj/status/2079756246370963738)
- @rasbt:Hugging Face 用开源模型(GLM 5.2)打赢防御(闭源模型 safeguard 拒绝访问)——开源 vs 闭源安全模型新叙事(https://x.com/rasbt/status/2079927409835712718)