Tom 文献雷达 · Agent RAG LongContext · 2026-09-14 14:40 UTC
概览
本次采集 8 条候选,全部来自 HF Daily;arXiv 查询因 429 超限未成功。整体搜索面收窄,质量尚可,高价值条目 4 条。
高价值条目 ⭐
1. Benchmark Radar: AI Benchmark 数据库与搜索引擎
- 来源: arXiv 2609.11115 / HF Daily
- 标签: agent · rag · benchmark · systems
- votes: 35
- 摘要: Benchmark Radar 是一个每日更新的 benchmark 数据库与检索引擎,覆盖 LLM评测、agentic/tool-use 基准、coding、reasoning、safety 及领域特定评测。收录 benchmark 论文、仓库、数据集、model card 中的分数历史。
- 亮点: 可作为 agent/RAG 系统评测选型工具;覆盖较全,适合跟踪 long-context 和 retrieval 类评测进展。
2. SAS: End-to-End 优化的 Attention 稀疏化
- 来源: arXiv 2609.13141 / HF Daily
- 标签: rag
- votes: 25
- 摘要: 现有可训练的 attention 稀疏化方法用 Top-K 截断阻断梯度,导致选择器只能依赖原始 dense attention 权重排序而非实际预测影响。SAS 通过端到端优化 context ranking 直接对齐 token 对预测的贡献,可在保持性能同时降低二次方计算成本。
- 亮点: 与 RAG 直接相关——减少 retrieval 后长 context 的 attention 开销;方法论上有新意。
3. COBRA-Skills: Agent Skill 优化的 Contextual Bandit 框架
- 来源: arXiv 2609.11682 / HF Daily
- 标签: agent · benchmark
- votes: 17
- 摘要: 将 agent 技能优化建模为预算受限的序列优化,结合 contextual bandit 引导候选优先级 + 执行反馈驱动技能演化,在六类异构任务上验证效率。
- 亮点: 解决 agent 技能复用代价高、数据需求量大的问题;与 memory-augmented agent 直接相关。
4. Think Before You Link: 跨语言实体链接的稀有性测度与推理-检索策略
- 来源: arXiv 2609.10745 / HF Daily
- 标签: rag · benchmark · multimodal · systems
- votes: 22
- 摘要: 针对实体链接中稀有实体性能退化问题,引入知识图谱结构度量替代 popularity 度量,揭示15~40%的性能差距。提出训练无关的推理-检索协同方法。
- 亮点: 对 RAG 检索质量评估有参考价值;稀有实体切片可作为 RAG 系统压力测试场景。
其他候选条目
| # | 标题 | 标签 | votes |
|---|---|---|---|
| 5 | Breaking the Vision-Action Shortcut (LIT) | multimodal | 35 |
| 6 | Studying Image Tokenizers as Visual Languages | benchmark · multimodal | 28 |
| 7 | PLC-DPO: Noisy Preference Optimization | multimodal | 21 |
| 8 | SNAP3D: Physically Grounded 3D Parts Assembly | research | 1 |
注:第5、6条偏向视觉-动作泛化和多模态 tokenizer,与 agent/rag/long-context 相关度较低但votes高,可作关注但不优先跟进。
采集元数据
- 采集时间: 2026-09-14T06:40 UTC
- provider: HF Daily(arXiv 429 超限,部分失败)
- 候选文件:
/shared/research-kb/inbox/tom/_candidates/2026-09-14-agent-rag-longcontext-candidates.json - Substack 补充: 无(本周无明确相关新帖)
- CSDN: 未使用
Tom · 轻量雷达 · 10 min 内完成