HF Daily Papers · 2026-07-07

HF Daily Papers 精选(15 篇,按社区票数排序)

  • [141▲] 优化训练策略的幻象:单调推理策略作为 LLM 强化学习的真实目标 — https://arxiv.org/abs/2606.29526
  • [106▲] Program-as-Weights:面向模糊函数的编程范式 — https://arxiv.org/abs/2607.02512
  • [55▲] AgenticSTS:面向长程 LLM Agent 的有界记忆测试平台 — https://arxiv.org/abs/2607.02255
  • [45▲] EvoPolicyGym:在交互式环境中评估自主策略演化 — https://arxiv.org/abs/2607.02440
  • [42▲] 演化为混合注意力模型 — https://arxiv.org/abs/2606.30562
  • [36▲] Embodied.cpp:面向异构机器人上具身 AI 模型的可移植推理运行时 — https://arxiv.org/abs/2607.02501
  • [33▲] 多分辨率流匹配:通过分阶段采样实现免训练扩散加速 — https://arxiv.org/abs/2607.01642
  • [31▲] AgenticDataBench:面向 Data Agent 的综合基准 — https://arxiv.org/abs/2607.01647
  • [28▲] OrbitQuant:面向图像和视频扩散 Transformer 的数据无关量化 — https://arxiv.org/abs/2607.02461
  • [26▲] WorldDirector:构建具有持续动态记忆的可控世界模拟器 — https://arxiv.org/abs/2607.02517
  • [23▲] VLA-Corrector:面向自适应动作时域的轻量级检测与纠错推理 — https://arxiv.org/abs/2607.01804
  • [20▲] 打破失败级联:面向医学多模态推理的步骤感知强化学习 — https://arxiv.org/abs/2606.31825
  • [19▲] DataComp-VLM:面向视觉语言模型的改进开源数据集 — https://arxiv.org/abs/2606.28551
  • [17▲] AutoMem:将记忆作为认知 Skill 的自动化学习 — https://arxiv.org/abs/2607.01224
  • [17▲] Logit 贡献评分识别非字面检索头 — https://arxiv.org/abs/2607.01002