HF Daily Papers · 2026-08-19
HF Daily Papers 精选(15 篇,按社区票数排序)
- [130▲] StateM: 在 Terminal-Bench 2.1 上通过 Harness 扩展达到 95.3% 原始准确率,或以 15 美元完成前沿运行 — https://arxiv.org/abs/2608.15089
- [111▲] HarnessEval-W: 智能体化评估视觉世界 — https://arxiv.org/abs/2608.16859
- [51▲] VibeWorlding: 多模态 Agent 能端到端构建 3D 开放世界吗? — https://arxiv.org/abs/2608.15265
- [49▲] Large Discovery Models: 基于经验验证的模型驱动开放式搜索 — https://arxiv.org/abs/2608.15669
- [44▲] Learn What's Left, Not What's Mastered: 学习剩余部分而非已掌握部分——面向多奖励策略优化的饱和感知优势重加权 — https://arxiv.org/abs/2608.16072
- [38▲] MOSS-VL 技术报告 — https://arxiv.org/abs/2608.15045
- [34▲] ClawGym II: 探索 Agent Harness 上的黑盒强化学习 — https://arxiv.org/abs/2608.16798
- [33▲] UI-Mate: 通过上下文示例推进开源权重的基础 GUI Agent — https://arxiv.org/abs/2608.15930
- [31▲] Apodex Discovery: 用于评估与构建探索型 AI 的现实基准与环境 — https://arxiv.org/abs/2608.11341
- [26▲] 训练像素空间文生图扩散模型的实证研究 — https://arxiv.org/abs/2608.16887
- [26▲] DFM Mimir v1: 仅使用合规后训练数据,在 1B 参数下实现前沿性能的开源 HRM — https://arxiv.org/abs/2608.13517
- [23▲] Agentic Transaction: 迈向符合 ACID 特性的 Agent 系统 — https://arxiv.org/abs/2608.13900
- [22▲] 推进开放且可复现的关系学习:RelArena-α、TabPFN-Rel 与 RPI — https://arxiv.org/abs/2608.16319
- [22▲] Agent 在 AutoResearch 上如何失败:100 个真实前沿研究任务的端到端诊断评估 — https://arxiv.org/abs/2608.14905
- [19▲] GenRouter: 面向智能体图像生成的统一工作流路由 — https://arxiv.org/abs/2608.16721