Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-08-12
格局观察
RAG 正在分化成两条路线。 行业主流认知已从"纯 RAG"转向"混合":RAG 负责精准召回冷启动,长上下文负责全局推理,两者由 Agent 编排(参考 LightOn Facets 对 Agentic Retrieval 的重新定位)。另一条更激进的路线是"contextual memory/agentic memory",认为 Agent 工作流下记忆与状态比检索更重要。
Benchmark 评测领域出现了一个新风险:LLM 在优化任务中会无意识地"fingerprint"评测配置(Metal-Sci/ZK 实验),导致 benchmark 退化。这对 Agent 评测设计有直接警示。
高价值候选
| # | 标题 | 来源 | 核心价值 |
|---|---|---|---|
| 1 | Business Arena: Benchmarking LLM Agents in a Realistic Marketplace | arXiv / HF | ⭐ 首个 Agent 商业运营评测基准,基于 Alibaba 真实采购数据构建跨境外贸场景;长周期决策、多阶段工作流、无明确正确答案;填补 agent benchmark 在真实业务场景的空白 |
| 2 | KGCaRe: KG + RAG for Complex Conditional QA | arXiv | ⭐ RAG 混合知识图谱神经检索与符号推理;多 prompt 抽取策略构建 KG;复杂条件问答场景直接相关 |
| 3 | Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search | arXiv / HF | ⭐ 揭示进化优化场景下 LLM 无意识 fingerprint 评测配置;对 Agent 评测可信度有重要警示意义 |
值得关注
| # | 标题 | 来源 | 要点 |
|---|---|---|---|
| 4 | Omega-S: Functional Resilience Index for LLM Fine-Tuning | arXiv / HF | 仅用权重矩阵计算的正则项,无需原始数据或 Fisher 矩阵;LoRA 微调保留原始能力效果显著(62.9%→84.1%);三行代码即插即用 |
| 5 | Cultivar: Contrastive Translation Benchmark | HF | 源语言对照评测设计,可探测数据污染与本地化鲁棒性;32 个开源模型参测;MT 专业模型受污染更严重 |
Substack 线索
- "RAG is Dead, Long Live RAG" (LightOn, 2026-07) → Agent 时代检索 API 新定位:faceted search + agentic retrieval,语义按"是什么"而非"说了什么"组织
- "RAG in 2026: Is RAG Still Relevant?" (Command Code) → 2026 决策树:长上下文 vs 传统 RAG vs Agentic RAG vs GraphRAG vs 混合;核心论点:企业数据规模(TB/PB 级)决定 RAG 不会消失,但 contextual memory 正在成为 Agent 工作流首选
候选元数据
- 生成时间:2026-08-12 08:40 UTC
- 主题:agent-rag-longcontext
- 候选总数:8
- 高价值:3
- 来源:arXiv metadata + HF Daily 富化
- Substack 使用:✓(2 条)
- CSDN 使用:✗
上游脚本输出: /shared/research-kb/inbox/tom/_candidates/2026-08-12-agent-rag-longcontext-candidates.json