X 硬核干货雷达

信源:X 硬核干货雷达 · 覆盖 11 账号

干货候选

  • 主题:SWE-Bench ProMax: 多语言代码重构 benchmark(COLM 2026) | 来源:@_akhaliq | 链接:https://x.com/_akhaliq | 仓库:huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMax | 论文:https://arxiv.org/abs/2608.09802 | 硬核点:7语言170实例、平均patch改11.4文件/261行,解决原SWE-Bench单语言饱和问题;coding agent评测新标杆

  • 主题:BDH-CQ: 递归潜在推理 ICL 系统,$0.0007/task 破 ARC-AGI-1 成本效率边界 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq | 仓库:无 | 论文:https://arxiv.org/abs/2608.09888 | 硬核点:150M 推理系统 vs GPT-5.6 Luna 便宜 11 倍,latent reasoning 不外化思维链;成本/智能比新前沿

  • 主题:SCoPE: 视频 Diffusion Transformer Sightline 坐标位置编码 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq | 仓库:TencentARC/SCoPE | 论文:无 | 硬核点:视频生成 position encoding 新思路,对 diffusion video model 实践者有直接参考价值

  • 主题:Midtraining / CPT 训练领域专精 LLM 深度指南 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2086849991721546189 | 仓库:无 | 论文:无 | 硬核点:Cameron Wolfe 实践指南,数据配比是 midtraining 核心调参维度;做专精模型必读

  • 主题:DiG-bench: 70 个文本发现游戏 benchmark,测 Agent 发现能力(排除视觉 confounders) | 来源:@tri_dao | 链接:https://x.com/jcrwhittington/status/2087535497480388729 | 仓库:discos-research/dig-bench | 论文:无 | 硬核点:James Whittington 等 Princeton/MIT/KAUST 联合发布;文本域 discovery games 填补 LLM 泛化评测空白

  • 主题:Qwen 3.7 27B GGUF 本地运行经验(LM Studio,M5 Max MacBook) | 来源:@simonw | 链接:https://x.com/simonw | 仓库:无 | 论文:无 | 硬核点:simonw 实测 17GB GGUF 量化跑出最优 pelican 效果;本地跑大模型工程参考

其余线索

  • @jerryjliu0 8/21 预告 9/30 长程文档 Agent 演讲,暂无新公开技术内容,暂列入观察
  • @omarsar0 8/25 参与 MCP vs Agent 讨论,提 WebMCP;OpenAI WebMCP Challenge($35K 奖金,9/3 截止)
  • @swyx 8/20 推 Podcast:NVIDIA $6B 收购 poolside 模型工厂;观点性内容
  • @rasbt 8/15 对 Claude watermarking 实现细节的追问(待官方 FAQ 确认)