📋 Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-02

候选概览

# 来源 标题 标签
1 arXiv ContextBias: Bias Persistence Under Context Shift in T2I benchmark
2 HF Daily EvoGenUI-Bench: Multi-Turn Generative UI Assistants benchmark
3 HF Daily SpanCalib-VLM: Calibrated Hallucination Span Detection multimodal
4 HF Daily RECAP-Forcing: Long Video via Appearance-Novelty Memory memory, multimodal
5 HF Daily MMMMM: Multilingual Multimodal Misinformation Taxonomy multimodal
6 Mem0 Blog State of AI Agent Memory 2026: Benchmark Report memory
7 Cognee AI Memory Benchmarks: Complete Guide 2026 memory
8 Databricks Long Context RAG Performance of LLMs RAG, long-context

⭐ 高价值条目(4条)

1. ContextBias:上下文迁移下的偏见稳定性评估

  • URL: https://arxiv.org/abs/2608.29847
  • 日期: 2026-08-29
  • 核心: Text-to-Image 模型在 prompt 上下文变化时,职业-视觉属性关联是否稳定。ContextBench 覆盖 92 个职业角色、1656 个语义控制 prompt,系统测试上下文扰动对角色关联的影响。
  • 价值: 对 RAG+agent 系统的"上下文敏感性"有直接类比意义——检索结果在不同上下文框架下是否稳定,是长上下文场景下未被充分研究的问题。

2. EvoGenUI-Bench:多轮生成式 UI Agent 评测

  • URL: https://arxiv.org/abs/2608.29387
  • 日期: 2026-08-28
  • 核心: 评测 LLM 作为多轮 UI 生成助手的 artifact 维护能力。150 个五轮任务,覆盖信息展示、执行交互、外部状态同步。在浏览器中执行并用截图/DOM/日志评判。Adjacent Pass Retention 测量跨轮次状态保持。
  • 价值: 首个多轮 UI agent 可执行 benchmark;跨轮 retention 测量方法(相邻轮通过率)可迁移到其他 agent 场景的上下文保持评估。

3. Mem0: AI Agent Memory 2026 Benchmark Report

  • URL: https://mem0.ai/blog/state-of-ai-agent-memory-2026
  • 日期: 近期
  • 核心: 2026 年 Agent Memory 基准全景报告,覆盖 LoCoMo、LongMemEval、BEAM(1M/10M)多个 benchmark。Mem0 新算法在 LoCoMo 达 92.5(基线约 75),LongMemEval 94.4。每次检索平均 6,956 tokens,远低于全上下文 ~26,000 tokens。
  • 价值: token 效率数据对 agent 记忆层选型有直接参考;BEAM 10M(48.6)说明超长上下文下记忆压缩仍是 open problem。

4. Databricks: Long Context RAG Performance

  • URL: https://www.databricks.com/blog/long-context-rag-performance-llms
  • 日期: 2026
  • 核心: 在不同 context length 下测量 RAG 性能。发现长 context 模型与 RAG 协同效应:更长 context 使 RAG 能包含更多相关文档。但多模型在长 context 下出现指令跟随退化、重复输出等问题。
  • 价值: 实证数据反驳"长 context 将取代 RAG"的论断,指出两者协同才是正解。

📦 技术评论

"长 context 取代 RAG" 为时过早 来源: Databricks 实验数据 + Mem0 基准报告

核心矛盾:长 context 模型(Gemini 1M / Claude 200K)本身在超长 context 下性能退化;RAG 成本约 10s,而 stuffed context 需 120s+。两者协同(更多相关文档灌入 context)才是当前最优解,而非谁取代谁。


去重说明

MNIST-PRO(arXiv 2608.31022)已在本期候选中出现,但已于 2026-09-01 雷达详述,本次保留在候选表但不作高价值展开。


Tom 文献雷达 · 2026-09-02 · agent-rag-longcontext · 8 条候选 · 4 条高价值 · 0 条 CSDN