信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
- 主题:SAS:通过端到端上下文排序优化实现简易注意力稀疏化 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2099511334987522298 | 仓库:Tencent/Simple-Attention-Sparsification | 论文:https://arxiv.org/abs/2609.13141 | 硬核点:将 Top-K 硬截断梯度阻断问题转化为端到端可微 context ranking 任务,训练 selector 直接用 LM loss 优化,而非蒸馏 layer-wise 密集注意力分布——对长 agent traces 的稀疏注意力改造有直接参考价值
- 主题:Beyond Prompts: 测量与优化 LLM Tool-Agent Harnesses(EMNLP 2026)| 来源:@hwchase17 | 链接:https://arxiv.org/abs/2609.05736 | 仓库:无 | 论文:https://arxiv.org/abs/2609.05736 | 硬核点:将 harness 优化形式化为预算约束选择问题——edits 是工具边界拦截而非重写,为 agent 对齐、性能优化提供可量化框架
- 主题:GPT-6 Astra 文档解析/抽取任务基准评测 ParseBench(短文档 97.2%/中档 90.6%)| 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2096258549131165746 | 仓库:无 | 论文:无 | 硬核点:LLM 文档解析工程实测数据,Cohere Parse 均价 $1.50/1k pages 但 5 维度平均仅 50% 准确率,与 GPT-6 Astra 97.2% 形成工程级对比
- 主题:本地 commit 消息重写 Web 应用(LLM + 工具调用实现)| 来源:@simonw | 链接:https://simonwillison.net/2026/Sep/14/commit-rewriter/ | 仓库:无 | 论文:无 | 硬核点:Simon Willison 亲写完整实现细节,commit 消息批量编辑工具的 LLM 工具调用实战演示,含截图和实现思路
- 主题:WHALE — 联合优化 LLM 权重与 Harness 的简单配方(arxiv 2609.00196)| 来源:@cwolferesearch | 链接:https://krafton.ai/blog/whale/ | 仓库:无 | 论文:https://arxiv.org/abs/2609.00196 | 硬核点:Harness 优化样本效率高但会平台化,WHALE 提出权重+harness 联合优化配方,与 harness 优化形成互补
其余线索
- @swyx · AI Engineer World’s Fair 2026 五大趋势 recap(Lilian Weng Harness Engineering for Self-Improvement 论文引用,loop 主导第一天)——行业全景,非实现细节
- @jerryjliu0 · ParseBench 中 Cohere Parse 50% 准确率评测——基准数据偏产品对比,可作工程参考
- @maximelabonne · fine-tuning 2026 实践指南在社区流传——内容为 SFT/DPO/LoRA 组合建议,定位入门,非新技巧
- @svpino · Reflexio agent 自改进平台发布(9/18)——产品发布,无实现细节