📡 Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-14 20:40
本次 arxiv 查询遭遇 429/Timeout,候选主要来自 HF Daily 富化数据,质量稍降。
🔬 本期高价值(4 条)
1. Benchmark Radar:AI 评测基准活数据库
- 来源:arXiv · HF Daily(47 票)
- 链接:https://arxiv.org/abs/2609.11115
- 摘要:Benchmark Radar 是一个可检索的 AI 评测基准活数据库,覆盖 LLM评测、agentic/tool-use benchmarks、coding、reasoning、safety 及垂直领域评估。每日自动发现新论文、仓库、数据集和 release,追踪 model card 中的基准引用和分数历史。
- 点评:⭐⭐⭐⭐⭐ · 当前最完整的 agent 评测雷达,对构建 agent 评估 pipeline 直接有用。
2. Agent Memory Is Not RAG:实践框架辨析
- 来源:Substack · Claudio Stamile(2026-01-12)
- 链接:https://open.substack.com/pub/claudiostamile/p/agent-memory-is-not-rag-a-practical
- 摘要:RAG 关注检索质量,long-context 关注序列处理能力,而 agent memory 是持久、自演化、支持长程行为的认知状态。三者虽有重叠,但设计意图和评估标准截然不同。作者提出从 forms、functions、lifecycles 三个维度规划 agent memory,而非简单叠加向量库。
- 点评:⭐⭐⭐⭐ · 实践者视角,澄清常见混淆,对 agent 系统设计有直接指导价值。
3. DSR:多样性感知技能路由
- 来源:arXiv · HF Daily(1 票,2026-09-04)
- 链接:https://arxiv.org/abs/2609.05824
- 摘要:大规模技能注册表中路由请求时,现有方法独立排名导致上下文浪费在冗余技能上。DSR(Diverse Skill Routing)使用行列式点过程(DPP)平衡相关性与非冗余性,引入 query-residual 多样性核函数惩罚技能重叠,同时保留互补技能组合。
- 点评:⭐⭐⭐⭐ · 面向 agent 技能编排的具体算法,对多技能 agent 系统有参考意义。
4. Online Learning with LLM Experts:有限反馈下的专家路由
- 来源:arXiv · HF Daily(3 票,2026-09-04)
- 链接:https://arxiv.org/abs/2609.05820
- 摘要:将用户请求自适应路由到 LLM 专家建模为 K臂老虎机问题,利用 d 维 prompt 特征在有限反馈下最小化 regret。全信息设定达到 O(dT/m),抢劫设定达到 O(dTK/m),实验验证了跨 LLMs 的高效路由策略学习。
- 点评:⭐⭐⭐ · agent 多模型路由的严谨理论框架,工程实现参考价值较高。
📋 其余候选(4 条)
| # | 标题 | 来源 | 票数 | 一句话 |
|---|---|---|---|---|
| 5 | Feyospace-v1:前沿网络模型训练数据引擎 | HF Daily | 73 | 多系统协同构建可执行环境和多轮监督,成本敏感 |
| 6 | DataFlex-RL:RLVR 数据策略评测平台 | HF Daily | 18 | 13种配置×12种子×12基准,GRPO 稳定性首次系统评测 |
| 7 | Qwen-Agent:多 Agent 框架 + RAG + Code Interpreter | Substack | - | Qwen2驱动的多agent,含 chunk-by-chunk 阅读和逐步推理 |
| 8 | Beyond Top-k Skill Retrieval(见上文 #3) | HF Daily | 1 | DSR 完整篇,含 DPP 数学推导 |
📊 本期统计
- 候选总数:8 条
- 高价值数:4 条(#1 Benchmark Radar,#2 Agent Memory,#3 DSR,#4 Expert Routing)
- Substack 使用:✅ 2 条(#2 + #7)
- CSDN 使用:❌ 未使用(无满足条件的检索结果)
- arXiv 状态:⚠️ 429/Timeout 密集,本期质量降级为 HF Daily 主导
Tom · 2026-09-14T20:40 · Agent/RAG/LongContext 每日雷达