信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:LangChain Managed Deep Agents 正式 GA——纯 markdown/config 无代码部署生产 agent | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2085788531046424883 | 仓库:langchain-ai/deepagents | 论文:无 | 硬核点:LangChain 生态从 Python API 向纯配置文件演进,生产 agent 部署门槛从代码层降到 markdown,适合攻略实测
-
主题:FlashAttention-4——Blackwell GPU attention kernel co-design,BF16 达 1.3x cuDNN / 2.7x Triton(1613 TFLOPs),CuTe-DSL 全 Python 实现 | 来源:@akhaliq | 链接:https://arxiv.org/html/2603.05451v1 | 仓库:Dao-AILab/flash-attention | 论文:https://arxiv.org/abs/2603.05451 | 硬核点:Blackwell 非对称 scaling 硬件优化首个系统性工程文档,kernel 从 C++ 迁移到 CuTe-DSL踩坑,GPU 性能工程师必读
-
主题:Maple-Preview 三元权重量化——20B-A1B ternary-weight 模型,Mac Mini M4 跑出 200+ tokens/s SOTA | 来源:@abacaj | 链接:https://x.com/abacaj/status/2084306579499266354 | 仓库:deepgrove/maple-preview | 论文:无 | 硬核点:Mac 本地跑大模型量化新 SOTA,工程复现价值高,适合攻略实操
-
主题:LlamaParse Retrieval Harness——语义搜索+server-side grep+文件导航三合一,agent 推理循环内置四种工具 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2071729856900215261 | 仓库:run-llama/legacy | 论文:无 | 硬核点:2026 文件系统 RAG 栈核心工程参考,从 naive RAG 升级为多工具 agent 循环的实战复现路径
-
主题:Meta Muse Glimmer 30B 首评——Meta 2026 首个开源权重,Hybrid attention GQA+SWA,内存占用低,dense 30B 对标 Qwen3.6-27B | 来源:@rasbt | 链接:https://x.com/rasbt/status/2087180773497421926 | 仓库:无 | 论文:无 | 硬核点:Llama 4 之后首个 Meta 开源权重多模态推理模型,架构分析与 benchmark 实测均有攻略价值(无 repo 走 HF 模型卡)
其余线索
- omarsar0 分享 Sakana AI Conductor(ICLR 2026)——7B RL 调度 LLM 协作拓扑,SOTA on GPQA-Diamond/LiveCodeBench(repo SakanaAI/Conductor 已在 watchlist)
- _akhaliq 分享 DataFlow-Harness(arxiv:2607.16617)——可编辑 LLM 数据流水线 DAG(repo OpenDCAI/DataFlow-Harness 已在 watchlist)
- simonw LLM 0.32a0 major refactor——推理模型支持+可见追踪+Responses API 集成(repo simonw/llm 已在 watchlist)
- svpino 分享 Parallel webhook + Claude Code 监控脚本——300 行 Python 实现(repo svpino/parallel 已在 watchlist)
- maximelabonne 分享 Antidoom 训练法——消除推理模型 doom-loop,doom-loop 率 22.9%→1%(repo liquidai/antidoom 已在 watchlist)
- tri_dao FlashAttention-4 NVIDIA CUDA Tile 调优 blog——kernel 调优全流程踩坑(repo Dao-AILab/flash-attention 已在 watchlist)