信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:默认硬预算上限(hard budget caps)——AI agent 失控消费的救命设计模式复盘 | 来源:@simonw | 链接:https://simonwillison.net/2026/Oct/3/default-hard-budget-caps | 仓库:无 | 论文:无 | 硬核点:AI agent 失控消费的救命设计模式——pay-by-usage API 必须从软警告升级为硬切断,AWS/Google Cloud 已落地实践,Simon 给出具体实现路径和竞品对比攻略素材;10/3 发帖,在窗口内
-
主题:Ember-1 后训练复盘(Kimi K3 精调,40% 更简洁同等质量,40% 更快更便宜)| 来源:@rasbt | 链接:https://x.com/rasbt/status/2104326522354147793 | 仓库:无 | 论文:无 | 硬核点:rasbt 亲自评测 Fireworks AI Ember-1,给出"花$xxM 预算正确姿势是后训练而非从头预训练"的具体建议;攻略价值:后训练预算分配决策参考;9/27 发帖,距窗口6天(Sep 30-Oct 6 = 7天)
其余线索(≤8天窗口外,参考留档)
- @jerryjliu0 9/22 分享 Opus 5.5 ParseBench 表格解析 SOTA(93.9%,+7% vs Opus 5),LlamaParse Agentic Plus 可比;run-llama/ParseBench 已在 watchlist(2026-07-22);攻略可对比各模型文档解析选型
- @jerryjliu0 9/5 分享 GPT-6 Astra 短中文档解析 SOTA(97.2% / 90.6%),LlamaIndex ParseBench 实测各 Frontier 模型文档解析能力边界
- @rasbt 9/15 分享 GPT-5.6 Astra vs Qwen3.8 Max Paint UI 视觉 benchmark 对比,指出评分规则本身测量的是 harness 而非模型;评测设计方法论值得留档
- @rasbt 9/23 "开源 harness 核心价值是透明可审计,不是免费";agent 评测可验证性讨论,有观点价值
- @_akhaliq 9/18 分享 Harness Design for Coding Agents 实证研究论文(arxiv 2609.20804,UMass+Emory+UNC Charlotte,43页),系统消融规划/动作空间/上下文管理三组件
- @_akhaliq 9/14 分享 SAS 注意力稀疏化论文(arxiv 2609.13141,腾讯+港科广),端到端优化 Context Ranking 替换 Top-K 硬截断,GPQA-Diamond 同等 1K budget 下 SAS 50.41% vs SeerAttn-R# 39.84%
- @omarsar0 9/10 分享 Salesforce 共进化 harness 论文(弱模型进化 harness → 强模型蒸馏到同一 harness,性能反降 4-30pts),harness engineering hot topic
- @hwchase17 9/21 分享 Jev-as-a-judge 进入 LangSmith,可低成本全量评分 production trace;产品更新留档
本轮说明
本轮扫描(10/1-10/6)12 账号中,@simonw 10/3 硬预算上限复盘是唯一明确在3天窗口内的干货。@rasbt 9/27 Ember-1 评测距窗口6天,属宽窗口边界。多数其他候选距窗口已超14天,仅供攻略参考。本轮干货候选密度偏低,属正常波动。