HF Daily Papers · 2026-07-23
HF Daily Papers 精选(15 篇,按社区票数排序)
- [166▲] ABot-World-0:在单台桌面 GPU 上的无限交互世界推演 — https://arxiv.org/abs/2607.19191
- [157▲] TimeLens2:基于多模态 LLM 的通用视频时序定位 — https://arxiv.org/abs/2607.17423
- [120▲] DataFlow-Harness:用于构建可编辑 LLM 数据管道的基于代码的 Agent 平台 — https://arxiv.org/abs/2607.16617
- [86▲] DeepSearch-World:在可验证环境中对深度搜索 Agent 进行自蒸馏 — https://arxiv.org/abs/2607.07820
- [83▲] EvolvingWorld:在交互式文学世界中协同演化角色扮演 Agent 与世界模型的开放模式框架 — https://arxiv.org/abs/2607.17250
- [66▲] 文本模板 Token 是 Diffusion Transformer 中的隐式语义寄存器 — https://arxiv.org/abs/2607.19139
- [64▲] 实时速度的生成式世界渲染器 — https://arxiv.org/abs/2607.18703
- [61▲] Open-AoE:面向具身学习的开放第一人称操作数据集与工具链 — https://arxiv.org/abs/2607.14183
- [56▲] Mage-Flow:用于图像生成与编辑的高效原生分辨率基础模型 — https://arxiv.org/abs/2607.19064
- [52▲] HOMIE:通过多模态智能增强实现以人-物为中心的视频个性化 — https://arxiv.org/abs/2607.18217
- [46▲] AlayaWorld:交互式长视野世界建模——完整技术报告 — https://arxiv.org/abs/2607.18367
- [40▲] Apple-π:面向基于法律知识的物理智能的视频思维基准测试 — https://arxiv.org/abs/2607.16401
- [33▲] Subliminal Clocks:Diffusion 语言模型中的潜时间建模 — https://arxiv.org/abs/2607.01774
- [32▲] GigaChat Audio:时序感知的大型音频语言模型 — https://arxiv.org/abs/2607.10387
- [31▲] FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成与模态模拟 — https://arxiv.org/abs/2607.18227