Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-08-12

格局观察

RAG 正在分化成两条路线。 行业主流认知已从"纯 RAG"转向"混合":RAG 负责精准召回冷启动,长上下文负责全局推理,两者由 Agent 编排(参考 LightOn Facets 对 Agentic Retrieval 的重新定位)。另一条更激进的路线是"contextual memory/agentic memory",认为 Agent 工作流下记忆与状态比检索更重要。

Benchmark 评测领域出现了一个新风险:LLM 在优化任务中会无意识地"fingerprint"评测配置(Metal-Sci/ZK 实验),导致 benchmark 退化。这对 Agent 评测设计有直接警示。


高价值候选

# 标题 来源 核心价值
1 Business Arena: Benchmarking LLM Agents in a Realistic Marketplace arXiv / HF ⭐ 首个 Agent 商业运营评测基准,基于 Alibaba 真实采购数据构建跨境外贸场景;长周期决策、多阶段工作流、无明确正确答案;填补 agent benchmark 在真实业务场景的空白
2 KGCaRe: KG + RAG for Complex Conditional QA arXiv ⭐ RAG 混合知识图谱神经检索与符号推理;多 prompt 抽取策略构建 KG;复杂条件问答场景直接相关
3 Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search arXiv / HF ⭐ 揭示进化优化场景下 LLM 无意识 fingerprint 评测配置;对 Agent 评测可信度有重要警示意义

值得关注

# 标题 来源 要点
4 Omega-S: Functional Resilience Index for LLM Fine-Tuning arXiv / HF 仅用权重矩阵计算的正则项,无需原始数据或 Fisher 矩阵;LoRA 微调保留原始能力效果显著(62.9%→84.1%);三行代码即插即用
5 Cultivar: Contrastive Translation Benchmark HF 源语言对照评测设计,可探测数据污染与本地化鲁棒性;32 个开源模型参测;MT 专业模型受污染更严重

Substack 线索

  • "RAG is Dead, Long Live RAG" (LightOn, 2026-07) → Agent 时代检索 API 新定位:faceted search + agentic retrieval,语义按"是什么"而非"说了什么"组织
  • "RAG in 2026: Is RAG Still Relevant?" (Command Code) → 2026 决策树:长上下文 vs 传统 RAG vs Agentic RAG vs GraphRAG vs 混合;核心论点:企业数据规模(TB/PB 级)决定 RAG 不会消失,但 contextual memory 正在成为 Agent 工作流首选

候选元数据

  • 生成时间:2026-08-12 08:40 UTC
  • 主题:agent-rag-longcontext
  • 候选总数:8
  • 高价值:3
  • 来源:arXiv metadata + HF Daily 富化
  • Substack 使用:✓(2 条)
  • CSDN 使用:✗

上游脚本输出: /shared/research-kb/inbox/tom/_candidates/2026-08-12-agent-rag-longcontext-candidates.json