HF Daily Papers · 2026-07-22

HF Daily Papers 精选(15 篇,按社区票数排序)

  • [141▲] TimeLens2: 基于多模态 LLM 的通用视频时间定位 — https://arxiv.org/abs/2607.17423
  • [129▲] RESOURCE2SKILL: 从人类创建的多模态资源中蒸馏可执行的 Agent Skill — https://arxiv.org/abs/2606.29538
  • [128▲] RAGU: 基于紧凑领域适配 LLM 的多步 GraphRAG 引擎 — https://arxiv.org/abs/2607.11683
  • [73▲] EvolvingWorld: 交互式文学世界中角色扮演 Agent 与世界模型协同演化的开放模式框架 — https://arxiv.org/abs/2607.17250
  • [72▲] DeepSearch-World: 可验证环境中深度搜索 Agent 的自蒸馏 — https://arxiv.org/abs/2607.07820
  • [64▲] SWE-Pruner Pro: 编码器 LLM 已知该剪枝什么 — https://arxiv.org/abs/2607.18213
  • [46▲] HOMIE: 通过多模态智能增强实现以人-物为中心的视频个性化 — https://arxiv.org/abs/2607.18217
  • [37▲] Apple-π: 面向基于物理定律智能的视频思维基准评测 — https://arxiv.org/abs/2607.16401
  • [32▲] RynnBrain 1.1: 迈向能力更强、泛化性更高的具身基础模型 — https://arxiv.org/abs/2607.17977
  • [30▲] GigaChat Audio: 时间感知的大型音频语言模型 — https://arxiv.org/abs/2607.10387
  • [28▲] GigaAM Multilingual: 面向欠代表语言的基础模型 — https://arxiv.org/abs/2607.10371
  • [26▲] Open-AoE: 用于具身学习的开放第一人称操作数据集与工具链 — https://arxiv.org/abs/2607.14183
  • [25▲] FlowMimic: 利用像素对扭曲流场实现免掩码视觉编辑与生成,用于在线视频编辑数据生成与模态模拟 — https://arxiv.org/abs/2607.18227
  • [24▲] ReflectWorld-MM: 面向开放式视频流的以实体为中心的多模态记忆系统 — https://arxiv.org/abs/2607.09759
  • [24▲] Group Entropy-Controlled Policy Optimization: 组熵控制的策略优化 — https://arxiv.org/abs/2607.16850