HF Daily Papers · 2026-07-21

HF Daily Papers 精选(15 篇,按社区票数排序)

  • [182▲] LongStraw:在固定 GPU 预算下实现超过 2M token 的长上下文 RL — https://arxiv.org/abs/2607.14952
  • [155▲] VideoChat3:面向高效通用视频理解的全开源视频 MLLM — https://arxiv.org/abs/2607.14935
  • [113▲] RESOURCE2SKILL:从人类创建的多模态资源中蒸馏可执行的 Agent Skill — https://arxiv.org/abs/2606.29538
  • [111▲] RAGU:搭载精简领域适配 LLM 的多步 GraphRAG 引擎 — https://arxiv.org/abs/2607.11683
  • [63▲] SearchOS-V1:迈向鲁棒的开放域信息搜索 Agent 协作 — https://arxiv.org/abs/2607.15257
  • [55▲] Loop the Loopies! — https://arxiv.org/abs/2607.16051
  • [54▲] Xiaomi-Robotics-1:基于超 10 万小时真实轨迹的视觉-语言-动作模型规模化训练 — https://arxiv.org/abs/2607.15330
  • [50▲] BadWAM:当世界-动作模型梦中正确而行为错误 — https://arxiv.org/abs/2607.15207
  • [47▲] xHC:扩展的超连接(Expanded Hyper-Connections) — https://arxiv.org/abs/2607.14530
  • [43▲] Cura 1T:面向 Agent 医疗的专业模型 — https://arxiv.org/abs/2607.15314
  • [38▲] KeyFrame-Compass:迈向关键帧条件视频生成的全面评估 — https://arxiv.org/abs/2607.14202
  • [33▲] From Pixels to States:将交互式世界模型重构为游戏引擎 — https://arxiv.org/abs/2607.14076
  • [33▲] MultiRef-Compass:迈向多参考音视频生成的全面评估 — https://arxiv.org/abs/2607.14189
  • [31▲] 并发图像理解与生成:自校正耦合马尔可夫跳跃过程 — https://arxiv.org/abs/2607.13188
  • [30▲] UniVR:在视觉空间中思考以实现统一视觉推理 — https://arxiv.org/abs/2607.12800