Tom 文献雷达 · Agent RAG LongContext · 2026-07-07 14:30
本轮速览
- 来源: HF Daily (arXiv metadata 富化)
- 高价值候选: 3 条
- CSDN: 未使用
- Substack: 未使用
高价值候选 ⭐
1. LLM-as-a-Verifier: A General-Purpose Verification Framework
- 链接: https://arxiv.org/abs/2607.05391
- 标签:
agentsystems - 核心摘要: 识别 验证(Verification) 作为继预训练、后训练、测试时计算之后的第四条 scaling 轴。提出通用验证框架,无需额外训练即可对 agentic 任务提供细粒度反馈——通过计算 scoring token 逻辑的期望值而非输出离散分数,实现对候选解的期望度量。验证能力本身可独立 scaling。
- 意义: 对 Agent 任务评测具有直接参考价值;验证-scaling 或成为 RAG/Agent 流程中结果质量控制的新方向。
2. EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
- 链接: https://arxiv.org/abs/2607.05155
- 标签:
agentsystems - 核心摘要: 分析约 38,000 小时真实机器人 agent 与环境交互数据(134 个真实任务),发现环境学习阶段的性能遵循 log-sigmoid scaling law(R²=0.998);跨模型代际,agent 学习速度约每 3 个月翻倍。
- 意义: 首个在真实物理环境学习上的 scaling 实证;为 Agent 能力增长预测和计算资源规划提供量化依据。
3. SaMer: Object-Evidence Preserving Token Merging for Vision-Language Retrieval
- 链接: https://arxiv.org/abs/2607.04605
- 标签:
ragbenchmarkmultimodal - 核心摘要: 针对多向量视觉-语言检索(late interaction)的 token 压缩问题,提出 SaMer——保留原始 late-interaction 接口的前提下,将图像侧 token 压缩为 K 个代表 centroids,且训练时利用 object 标注作为合并先验,防止跨实例混淆。
- 意义: 对多向量 RAG(如 ColBERT 架构)的存储压缩和检索效率有直接参考;late-interaction 接口保留设计值得借鉴。
其余候选
| # | 标题 | 标签 | Votes | 备注 |
|---|---|---|---|---|
| 4 | OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers | rag memory benchmark systems |
19 | 优化器统一元框架;benchmark cookbook;memory 相关性待验证 |
| 5 | EVA-Client: Unified Framework for Embodied Policies on Real Robots | benchmark systems |
18 | 机器人 policy 部署;与本 topic 关联有限 |
| 6 | InternVLA-A1.5: Unifying Understanding & Latent Foresight for Manipulation | multimodal |
6 | VLA 策略;偏机器人视觉导航 |
| 7 | dOPSD: On-Policy Self-Distillation for Diffusion Language Models | multimodal |
6 | 扩散 LLM 自蒸馏;非本 topic 重点 |
| 8 | GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving | benchmark systems |
1 | 分布式 LLM serving;LLM-as-a-Verifier 同期工作 |
去重说明
- 本轮 OmniOpt(19票)票数最高但偏 optimizer benchmark,与上轮(07-06)候选重合度低;本次保留供参考。
- EVA-Client / InternVLA 偏 embodied robotics,07-06 已有类似 VLA 工作(InternVLA 系列),可视为已知方向延伸。
- 今日 3 条高价值均来自 07-05~07-06 新 arXiv,未出现在历史 radar 中。
📌 本报告由 Tom 研究知识库自动生成 · candidates JSON:
/shared/research-kb/inbox/tom/_candidates/2026-07-07-agent-rag-longcontext-candidates.json