Tom 文献雷达 · Agent RAG LongContext · 2026-07-07 14:30

本轮速览

  • 来源: HF Daily (arXiv metadata 富化)
  • 高价值候选: 3 条
  • CSDN: 未使用
  • Substack: 未使用

高价值候选 ⭐

1. LLM-as-a-Verifier: A General-Purpose Verification Framework

  • 链接: https://arxiv.org/abs/2607.05391
  • 标签: agent systems
  • 核心摘要: 识别 验证(Verification) 作为继预训练、后训练、测试时计算之后的第四条 scaling 轴。提出通用验证框架,无需额外训练即可对 agentic 任务提供细粒度反馈——通过计算 scoring token 逻辑的期望值而非输出离散分数,实现对候选解的期望度量。验证能力本身可独立 scaling。
  • 意义: 对 Agent 任务评测具有直接参考价值;验证-scaling 或成为 RAG/Agent 流程中结果质量控制的新方向。

2. EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

  • 链接: https://arxiv.org/abs/2607.05155
  • 标签: agent systems
  • 核心摘要: 分析约 38,000 小时真实机器人 agent 与环境交互数据(134 个真实任务),发现环境学习阶段的性能遵循 log-sigmoid scaling law(R²=0.998);跨模型代际,agent 学习速度约每 3 个月翻倍。
  • 意义: 首个在真实物理环境学习上的 scaling 实证;为 Agent 能力增长预测和计算资源规划提供量化依据。

3. SaMer: Object-Evidence Preserving Token Merging for Vision-Language Retrieval

  • 链接: https://arxiv.org/abs/2607.04605
  • 标签: rag benchmark multimodal
  • 核心摘要: 针对多向量视觉-语言检索(late interaction)的 token 压缩问题,提出 SaMer——保留原始 late-interaction 接口的前提下,将图像侧 token 压缩为 K 个代表 centroids,且训练时利用 object 标注作为合并先验,防止跨实例混淆。
  • 意义: 对多向量 RAG(如 ColBERT 架构)的存储压缩和检索效率有直接参考;late-interaction 接口保留设计值得借鉴。

其余候选

# 标题 标签 Votes 备注
4 OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers rag memory benchmark systems 19 优化器统一元框架;benchmark cookbook;memory 相关性待验证
5 EVA-Client: Unified Framework for Embodied Policies on Real Robots benchmark systems 18 机器人 policy 部署;与本 topic 关联有限
6 InternVLA-A1.5: Unifying Understanding & Latent Foresight for Manipulation multimodal 6 VLA 策略;偏机器人视觉导航
7 dOPSD: On-Policy Self-Distillation for Diffusion Language Models multimodal 6 扩散 LLM 自蒸馏;非本 topic 重点
8 GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving benchmark systems 1 分布式 LLM serving;LLM-as-a-Verifier 同期工作

去重说明

  • 本轮 OmniOpt(19票)票数最高但偏 optimizer benchmark,与上轮(07-06)候选重合度低;本次保留供参考。
  • EVA-Client / InternVLA 偏 embodied robotics,07-06 已有类似 VLA 工作(InternVLA 系列),可视为已知方向延伸。
  • 今日 3 条高价值均来自 07-05~07-06 新 arXiv,未出现在历史 radar 中。

📌 本报告由 Tom 研究知识库自动生成 · candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-07-07-agent-rag-longcontext-candidates.json