信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
- 主题:StateAct——把 computer-use agent 的状态从截图改为直接程序状态,OSWorld2.0 成功率+6.3分、费用降低9× | 来源:@_akhaliq | 链接:https://arxiv.org/html/2607.22798v1 | 仓库:无 | 论文:https://arxiv.org/abs/2607.22798 | 硬核点:截图=有损渲染,直接读程序状态是 long-horizon agent 的核心突破,9×成本节省有工程说服力
- 主题:LiteParse v2 全 Rust 重写——比 pymupdf/pypdf 等开源方案快 100 倍,跨 Python/Node/CLI/WASM | 来源:@jerryjliu0 | 链接:https://www.llamaindex.ai/blog/liteparse-v2-0-runs-everywhere | 仓库:run-llama/liteparse | 论文:无 | 硬核点:文档解析是 RAG 入口,全 Rust 实现+零依赖是工程化亮点
- 主题:WebGPU 浏览器内微调 LLM——llama.cpp + wllama 实现 PoC,下一步 LoRA | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2096456605076476239 | 仓库:ngxson/wllama | 论文:无 | 硬核点:隐私敏感场景的本地微调路径,浏览器即 OS 的里程碑雏形
- 主题:SAS——用 LM loss 端到端优化 context ranking,而非蒸馏 dense attention 分布,在 reasoning/long-context/agentic 任务一致超越可训练稀疏基线 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2099511334987522298 | 仓库:无 | 论文:https://arxiv.org/abs/2609.13141 | 硬核点:KV-cache 紧张下,稀疏注意力训练范式从"选 top-k"转向"可微分排序"的思路转变
- 主题:ReplaySSM——混合模型(decode 阶段)中 Mamba 状态不写回、而是缓存重建,spec decoding SSM 提速 2× | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2066518563184365953 | 仓库:无 | 论文:无 | 硬核点:hybrid SSM 成为主流的当下,状态管理细节直接决定 decode 效率
- 主题:Hermes Agent 1393 子 agent 自动化重构——$2m 工程小时节省,1m 行 Python 缩减 34.4%,compoinding engineering+自演化技能实操展示 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2095256315476000817 | 仓库:nousresearch/refactoring-hermes | 论文:无 | 硬核点:最大规模真实子 agent 编程案例,技能复合是长线工程 trick
- 主题:多子 agent 并行 >2 个后收益递减——超过 2 个并发子 agent 几乎必然因互相"查作业"导致 token 浪费,但 forked subagent 是 LangChain deepagents 已内置的 context engineering 技巧 | 来源:@omarsar0 | 链接:https://x.com/omarsar0 | 仓库:无 | 论文:无 | 硬核点:反直觉:不是越多 agent 越好,阈值分析和 fork 技巧是落地关键
其余线索
- Claude Fable 5.1 + Codex prompt 缓存策略分析:cwolferesearch 指出 system message + repo map 等稳定部分在 cache boundary 之上的分割是关键,变动部分频繁跨边界则缓存经济性消失
- GLM 5.3 Flash 替换 GPT-5.6 Luna 文档处理:零质量下降,成本低于 GPT 八折后价格,anton 实践经验
- MOPD(post-training 新范式):多 RL teacher 蒸馏合一,已在 MiMo-V2-Flash/Kimi K3/DeepSeek-V4 落地,cwolferesearch 梳理
- Claude Code + Datasette 安全审计:simonw 用 Fable 5.1 + GPT-5.6 Sol + GPT-6 Astra 三模型交叉审计,发现多类 bug 并修复