信源:X 硬核干货雷达 · 覆盖 12 账号
窗口:2026-08-13 ~ 2026-08-20
干货候选
-
主题:ExtractBench——企业文档提取最全基准(370 docs/4869页/67类/8领域) | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2087195936225108171 | 仓库:run-llama/ExtractBench | 论文:https://arxiv.org/abs/2607.29677 | 硬核点:LlamaParse Agentic Plus 凭该基准登顶(95.6%),4维评测(长记录完整性/视觉定位/感知鲁棒/单页成本)填补生产文档提取无系统性评测空白;36页白皮书详述基准设计,可复现
-
主题:TrueFoundry TrueForge——MIT开源Agent Harness(75%降本,GLM-5.2替换Claude Managed Agents) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2090138030296219973 | 仓库:truefoundry/trueforge | 论文:无 | 硬核点:osarsar0早期实测——单命令本地运行,沙盒代码执行开箱即用;14项DevRev Enterprise-Bench任务匹配Claude Managed Agents精度,$2.90/run vs $11.80/run(75%降本);vendor-neutral,支持任意LLM/MCP server;攻略价值:harness层正在成为Agent差异化核心,此案例是"Own Your Harness"的最佳实战范本
-
主题:/align-me批量对齐修正——Claude Skill批处理lookahead设计决策(2-10步)降round-trip | 来源:@swyx | 链接:https://x.com/swyx/status/2088073777779515615 | 仓库:无 | 论文:无 | 硬核点:swyx自述/align-me修改版:人类I/O成本高,批量收集问题再发给Agent而非逐轮往返;类比spec decoding的lookahead思路;实测对设计类探索类任务加速效果显著;Matt Pocock的grill-me同采纳该批处理直觉;适合写Agent效率优化攻略
-
主题:AI Engineer World Fair——RL重思:SDPO用于非可验证奖励的持续学习(swyx主持) | 来源:@swyx | 链接:https://x.com/swyx/status/2088120493224362084 | 仓库:无 | 论文:无 | 硬核点:Trajectory Labs在World Fair持续学习专场分享:GRPO不够,需SDPO等新算法处理non-verifiable per-token奖励;RL时代后训练范式正在被重新设计;是Agent能力持续演进的核心基础设施话题;swyx策展,AI Engineer圈重要信号
其余线索
- @_akhaliq 8/11-13论文4连:SWE-Bench ProMax(大规模多语言代码重构基准,170实例/7语言)、MiniMax-Music3 gradio工作流、SCoPE视频DiT坐标位置编码、BDH-CQ循环潜在推理;仅论文摘要,无repo随帖附出;价值:论文选题策展,不够格写攻略但值得留档
- @cwolferesearch 8/5 DeepSeek-V4中训练agent轨迹细节:业内已知但被忽略的"将post-training数据混合进mid-training"已成标准操作;8/8 CPT持续预训练深度文章;窗口边界内容,不够候选但有复盘价值
- @maximelabonne 8/12 LFM2.5-VL-3B(设备端VLM,WebGPU浏览器运行);属产品发布而非硬核干货,留档
- @rasbt 8/11 Meta Muse Glimmer 30B开源权重(推特摘要);8/12新书Amazon开售+LLMs-from-scratch破100K stars;观点/发布类,无新硬核内容
- @hwchase17 8/15 Sequoia演讲"Own Your Intelligence";8/7 Managed Deep Agents发布;产品/演讲类,无新硬核实操内容