HF Daily Papers · 2026-07-23

HF Daily Papers 精选(15 篇,按社区票数排序)

  • [166▲] ABot-World-0:在单台桌面 GPU 上的无限交互世界推演 — https://arxiv.org/abs/2607.19191
  • [157▲] TimeLens2:基于多模态 LLM 的通用视频时序定位 — https://arxiv.org/abs/2607.17423
  • [120▲] DataFlow-Harness:用于构建可编辑 LLM 数据管道的基于代码的 Agent 平台 — https://arxiv.org/abs/2607.16617
  • [86▲] DeepSearch-World:在可验证环境中对深度搜索 Agent 进行自蒸馏 — https://arxiv.org/abs/2607.07820
  • [83▲] EvolvingWorld:在交互式文学世界中协同演化角色扮演 Agent 与世界模型的开放模式框架 — https://arxiv.org/abs/2607.17250
  • [66▲] 文本模板 Token 是 Diffusion Transformer 中的隐式语义寄存器 — https://arxiv.org/abs/2607.19139
  • [64▲] 实时速度的生成式世界渲染器 — https://arxiv.org/abs/2607.18703
  • [61▲] Open-AoE:面向具身学习的开放第一人称操作数据集与工具链 — https://arxiv.org/abs/2607.14183
  • [56▲] Mage-Flow:用于图像生成与编辑的高效原生分辨率基础模型 — https://arxiv.org/abs/2607.19064
  • [52▲] HOMIE:通过多模态智能增强实现以人-物为中心的视频个性化 — https://arxiv.org/abs/2607.18217
  • [46▲] AlayaWorld:交互式长视野世界建模——完整技术报告 — https://arxiv.org/abs/2607.18367
  • [40▲] Apple-π:面向基于法律知识的物理智能的视频思维基准测试 — https://arxiv.org/abs/2607.16401
  • [33▲] Subliminal Clocks:Diffusion 语言模型中的潜时间建模 — https://arxiv.org/abs/2607.01774
  • [32▲] GigaChat Audio:时序感知的大型音频语言模型 — https://arxiv.org/abs/2607.10387
  • [31▲] FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成与模态模拟 — https://arxiv.org/abs/2607.18227