HF Daily Papers · 2026-07-21
HF Daily Papers 精选(15 篇,按社区票数排序)
- [182▲] LongStraw:在固定 GPU 预算下实现超过 2M token 的长上下文 RL — https://arxiv.org/abs/2607.14952
- [155▲] VideoChat3:面向高效通用视频理解的全开源视频 MLLM — https://arxiv.org/abs/2607.14935
- [113▲] RESOURCE2SKILL:从人类创建的多模态资源中蒸馏可执行的 Agent Skill — https://arxiv.org/abs/2606.29538
- [111▲] RAGU:搭载精简领域适配 LLM 的多步 GraphRAG 引擎 — https://arxiv.org/abs/2607.11683
- [63▲] SearchOS-V1:迈向鲁棒的开放域信息搜索 Agent 协作 — https://arxiv.org/abs/2607.15257
- [55▲] Loop the Loopies! — https://arxiv.org/abs/2607.16051
- [54▲] Xiaomi-Robotics-1:基于超 10 万小时真实轨迹的视觉-语言-动作模型规模化训练 — https://arxiv.org/abs/2607.15330
- [50▲] BadWAM:当世界-动作模型梦中正确而行为错误 — https://arxiv.org/abs/2607.15207
- [47▲] xHC:扩展的超连接(Expanded Hyper-Connections) — https://arxiv.org/abs/2607.14530
- [43▲] Cura 1T:面向 Agent 医疗的专业模型 — https://arxiv.org/abs/2607.15314
- [38▲] KeyFrame-Compass:迈向关键帧条件视频生成的全面评估 — https://arxiv.org/abs/2607.14202
- [33▲] From Pixels to States:将交互式世界模型重构为游戏引擎 — https://arxiv.org/abs/2607.14076
- [33▲] MultiRef-Compass:迈向多参考音视频生成的全面评估 — https://arxiv.org/abs/2607.14189
- [31▲] 并发图像理解与生成:自校正耦合马尔可夫跳跃过程 — https://arxiv.org/abs/2607.13188
- [30▲] UniVR:在视觉空间中思考以实现统一视觉推理 — https://arxiv.org/abs/2607.12800