信源:X 硬核干货雷达 · 覆盖 12 账号
扫描窗口:2026-07-25 ~ 2026-07-31(约一周)
说明:只做采集与初筛;硬核判断基于技术深度、实现细节、性能数据或踩坑复盘,不以账号粉丝量或公司名权重。
干货候选
-
主题:FlashAttention-4 论文发布——Blackwell 非对称 scaling 揭示 exp2/shared memory 墙,attention 达 ~1600 TFLOPs 与 matmul 同速 | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2029569889858646344 | 仓库:Dao-AILab/flash-attention | 论文:https://arxiv.org/abs/2503.xxxxx(待核实) | 硬核点:Blackwell 算力过剩时代算法层面瓶颈转移的系统性分析,ICML/NeurIPS 核内人必读;CUDA kernel 优化者可重点关注 2CTA fwd 实现细节
-
主题:RSIBench-Data——数据为中心的递归自我改进评测基准,agent 迭代 refine 训练数据(开源 Tinker harness) | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2082923633593176426 | 仓库:无 | 论文:https://arxiv.org/abs/2607.xxxxx(arXiv 链接见原帖) | 硬核点:数据驱动 RSI 的 benchmark 范式;当前 top 模型难以单调提升——对做 post-training/RL 的人有直接参考价值
-
主题:LLM-as-a-Verifier 细粒度评分公式推导——Reward = (1/CK) Σ score_logprob × score_value,粒度↑/重复验证↑/准则数↑均提升准确率 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2044555271792406577 | 仓库:无 | 论文:https://llm-as-a-verifier.notion.site | 硬核点:LLM judge 评分实践的重大认知更新(高分粒度不再有害,1-100 刻度可用),对做 agent 评测/verifier 的人直接可复现
-
主题:StateAct——程序状态先于像素(OSWorld 2.0),Claude Opus 4.8 从 20.6% 提升至 26.9%(binary),9× 成本降低(224K→100K token) | 来源:@cwolferesearch(综合转推/引用链) | 链接:https://arxiv.org/html/2607.22798v1 | 仓库:待核实(arxiv 页面) | 论文:https://arxiv.org/abs/2607.22798 | 硬核点:computer-use agent 从 screenshot-driven 向 state-grounded 的范式转变;对 UI automation / agent 开发者有直接实现参考价值
-
主题:shot-scraper CLI 踩坑——--help 文档作为 agent skill 的 trick,simonw 实测 shot-scraper 0.0.44 新版行为差异 | 来源:@simonw | 链接:https://x.com/simonw/status/xxxxxxxx(待查原帖链接) | 仓库:simonw/shot-scraper | 论文:无 | 硬核点:实用 CLI 工具新版本和 MCP 集成的踩坑记录,可用于 agent tool-calling 攻略
-
主题:VibeCoder post-training stack 深度解析——Qwen2.5-Coder-3B 模型为基础的 9 点技术实现分析 | 来源:@rasbt | 链接:https://x.com/rasbt/status/xxxxxxxx(待查原帖链接) | 仓库:无 | 论文:无 | 硬核点:post-training pipeline 实战拆解,从 preference data 到 training recipe 的完整链路,对微调实践者有参考价值
-
主题:Parse Gateway——页面级文档解析路由(智能选择解析策略),LlamaIndex 生态多语言 SDK 更新 | 来源:@jerryjliu0 | 链接:https://www.llamaindex.ai/blog/parse-gateway-smart-page-level-document-parser-routing | 仓库:run-llama/llama-parse | 论文:无 | 硬核点:生产级文档解析 pipeline 路由策略实现细节,对做 RAG/文档 agent 的人有参考价值
-
主题:Sakana AI Conductor(ICLR 2026)——RL 调度多 LLM 协作拓扑,SOTA on GPQA-Diamond/LiveCodeBench | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/xxxxxxxx | 仓库:SakanaAI/Conductor(官网附链接) | 论文:无 | 硬核点:LLM 编排的 RL 化方法,与 LangChain deepagents / OpenDCAI DataFlow-Harness 属于同一技术线(已在 watchlist)
其余线索
- @maximelabonne: LFM2.5-VL-450M 小型 VLM(edge 端 512×512 图 ~240ms),Liquid AI 出品;多语言 + 目标检测 + function calling——产品发布级别,非实现细节,留档参考
- @cwolferesearch: Olmo 3 技术报告推荐(7B/32B 完全开源权重,post-training 最详尽 artifact)——资源线索,对复现/微调有参考价值
- @swyx: Vibe coding 会议网站 launch——非技术实现帖,不收录干货候选
- @svpino: AI spend/budget 控制帖——管理/商业视角,无技术深度,不收录
- @abacaj: 本轮窗口无硬核技术内容,账号以代码实现分享为主但近期无新发布
- @_akhaliq: 本轮检索未捕获具体硬核帖子(可能是近期转赞为主),留档需下轮补扫