HF Daily Papers · 2026-07-13
HF Daily Papers 精选(15 篇,按社区票数排序)
- [122▲] Vidu S1:一个实时交互式视频生成模型 — https://arxiv.org/abs/2607.03118
- [84▲] 准确、跨学科且透明的结构-性质理解,基于深度原生结构推理 — https://arxiv.org/abs/2607.07708
- [55▲] Video-Oasis:重新思考视频理解的评估方式 — https://arxiv.org/abs/2603.29616
- [51▲] 视觉-语言-动作模型中的双潜记忆用于机器人操控 — https://arxiv.org/abs/2607.07608
- [49▲] 扩展混合专家视频预训练以实现具身智能 — https://arxiv.org/abs/2607.07675
- [48▲] 为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径 — https://arxiv.org/abs/2601.16211
- [31▲] 思想拥有基因组:科学谱系推理与基于谱系的思想生成基准测试 — https://arxiv.org/abs/2607.08758
- [31▲] 具有多样化交互的无限世界 — https://arxiv.org/abs/2607.07534
- [27▲] LongE2V:基于视频扩散模型的长时程事件驱动视频重建、预测与帧插值 — https://arxiv.org/abs/2607.08770
- [27▲] UniClawBench:面向真实世界任务主动 Agent 的通用基准 — https://arxiv.org/abs/2607.08768
- [27▲] LLM-as-a-Tutor:针对不可验证 RL 的策略感知提示自适应 — https://arxiv.org/abs/2607.04412
- [17▲] DrugGen 2:一个增强药物发现的疾病感知语言模型 — https://arxiv.org/abs/2607.08404
- [17▲] 通过几何感知预训练增强上下文全景生成 — https://arxiv.org/abs/2607.08765
- [15▲] Jet-Long:基于动态双焦 RoPE 的高效长上下文扩展 — https://arxiv.org/abs/2607.07740
- [15▲] 京东 Oxygen AI Item Center(Oxygen AIIC)V1:以 LLM/VLM 为核心的工业级商品理解、管理与应用解决方案 — https://arxiv.org/abs/2606.28070