HF Daily Papers · 2026-06-29
HF Daily Papers 精选(15 篇,按社区票数排序)
- [105▲] 我们是否准备好迎接 Agent 原生的记忆系统? — https://arxiv.org/abs/2606.24775
- [71▲] DanceOPD:On-Policy 生成式场蒸馏 — https://arxiv.org/abs/2606.27377
- [64▲] DomainShuttle:自由形式开放域主体驱动的文本到视频生成 — https://arxiv.org/abs/2606.26058
- [50▲] 用于机器人控制的 In-Context 世界建模 — https://arxiv.org/abs/2606.26025
- [46▲] OPID:面向 Agent 强化学习的 On-Policy Skill 蒸馏 — https://arxiv.org/abs/2606.26790
- [45▲] ShutterMuse:基于 MLLM 的拍摄时摄影指导 — https://arxiv.org/abs/2606.25763
- [42▲] Qwen-Image-Agent:弥合真实场景图像生成中的上下文鸿沟 — https://arxiv.org/abs/2606.26907
- [41▲] 验证鸿沟:编码 Agent 奖励没有银弹 — https://arxiv.org/abs/2606.26300
- [38▲] ViQ:任意分辨率下与文本对齐的视觉量化表征 — https://arxiv.org/abs/2606.27313
- [34▲] MVTrack4Gen:作为 4D 视频生成几何监督的多视角点跟踪 — https://arxiv.org/abs/2606.26087
- [31▲] JetSpec:通过并行树形 Draft 突破推测解码的扩展天花板 — https://arxiv.org/abs/2606.18394
- [28▲] GUI vs. CLI:纯屏幕与 Skill 介导的计算机使用 Agent 中的执行瓶颈 — https://arxiv.org/abs/2606.24551
- [26▲] V-Zero:基于对比证据门控的无答案标签 On-Policy 蒸馏,用于细粒度视觉推理 — https://arxiv.org/abs/2606.25319
- [24▲] UnityShots:基于记忆驱动的多镜头音视频生成与边界感知门控 — https://arxiv.org/abs/2606.21661
- [23▲] 快速 LeWorldModel — https://arxiv.org/abs/2606.26217