Tom 文献雷达 · Agent RAG LongContext · 2026-09-14 14:40 UTC

概览

本次采集 8 条候选,全部来自 HF Daily;arXiv 查询因 429 超限未成功。整体搜索面收窄,质量尚可,高价值条目 4 条。


高价值条目 ⭐

1. Benchmark Radar: AI Benchmark 数据库与搜索引擎

  • 来源: arXiv 2609.11115 / HF Daily
  • 标签: agent · rag · benchmark · systems
  • votes: 35
  • 摘要: Benchmark Radar 是一个每日更新的 benchmark 数据库与检索引擎,覆盖 LLM评测、agentic/tool-use 基准、coding、reasoning、safety 及领域特定评测。收录 benchmark 论文、仓库、数据集、model card 中的分数历史。
  • 亮点: 可作为 agent/RAG 系统评测选型工具;覆盖较全,适合跟踪 long-context 和 retrieval 类评测进展。

2. SAS: End-to-End 优化的 Attention 稀疏化

  • 来源: arXiv 2609.13141 / HF Daily
  • 标签: rag
  • votes: 25
  • 摘要: 现有可训练的 attention 稀疏化方法用 Top-K 截断阻断梯度,导致选择器只能依赖原始 dense attention 权重排序而非实际预测影响。SAS 通过端到端优化 context ranking 直接对齐 token 对预测的贡献,可在保持性能同时降低二次方计算成本。
  • 亮点: 与 RAG 直接相关——减少 retrieval 后长 context 的 attention 开销;方法论上有新意。

3. COBRA-Skills: Agent Skill 优化的 Contextual Bandit 框架

  • 来源: arXiv 2609.11682 / HF Daily
  • 标签: agent · benchmark
  • votes: 17
  • 摘要: 将 agent 技能优化建模为预算受限的序列优化,结合 contextual bandit 引导候选优先级 + 执行反馈驱动技能演化,在六类异构任务上验证效率。
  • 亮点: 解决 agent 技能复用代价高、数据需求量大的问题;与 memory-augmented agent 直接相关。

  • 来源: arXiv 2609.10745 / HF Daily
  • 标签: rag · benchmark · multimodal · systems
  • votes: 22
  • 摘要: 针对实体链接中稀有实体性能退化问题,引入知识图谱结构度量替代 popularity 度量,揭示15~40%的性能差距。提出训练无关的推理-检索协同方法。
  • 亮点: 对 RAG 检索质量评估有参考价值;稀有实体切片可作为 RAG 系统压力测试场景。

其他候选条目

# 标题 标签 votes
5 Breaking the Vision-Action Shortcut (LIT) multimodal 35
6 Studying Image Tokenizers as Visual Languages benchmark · multimodal 28
7 PLC-DPO: Noisy Preference Optimization multimodal 21
8 SNAP3D: Physically Grounded 3D Parts Assembly research 1

注:第5、6条偏向视觉-动作泛化和多模态 tokenizer,与 agent/rag/long-context 相关度较低但votes高,可作关注但不优先跟进。


采集元数据

  • 采集时间: 2026-09-14T06:40 UTC
  • provider: HF Daily(arXiv 429 超限,部分失败)
  • 候选文件: /shared/research-kb/inbox/tom/_candidates/2026-09-14-agent-rag-longcontext-candidates.json
  • Substack 补充: 无(本周无明确相关新帖)
  • CSDN: 未使用

Tom · 轻量雷达 · 10 min 内完成