📋 Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-02
候选概览
| # | 来源 | 标题 | 标签 |
|---|---|---|---|
| 1 | arXiv | ContextBias: Bias Persistence Under Context Shift in T2I | benchmark |
| 2 | HF Daily | EvoGenUI-Bench: Multi-Turn Generative UI Assistants | benchmark |
| 3 | HF Daily | SpanCalib-VLM: Calibrated Hallucination Span Detection | multimodal |
| 4 | HF Daily | RECAP-Forcing: Long Video via Appearance-Novelty Memory | memory, multimodal |
| 5 | HF Daily | MMMMM: Multilingual Multimodal Misinformation Taxonomy | multimodal |
| 6 | Mem0 Blog | State of AI Agent Memory 2026: Benchmark Report | memory |
| 7 | Cognee | AI Memory Benchmarks: Complete Guide 2026 | memory |
| 8 | Databricks | Long Context RAG Performance of LLMs | RAG, long-context |
⭐ 高价值条目(4条)
1. ContextBias:上下文迁移下的偏见稳定性评估
- URL: https://arxiv.org/abs/2608.29847
- 日期: 2026-08-29
- 核心: Text-to-Image 模型在 prompt 上下文变化时,职业-视觉属性关联是否稳定。ContextBench 覆盖 92 个职业角色、1656 个语义控制 prompt,系统测试上下文扰动对角色关联的影响。
- 价值: 对 RAG+agent 系统的"上下文敏感性"有直接类比意义——检索结果在不同上下文框架下是否稳定,是长上下文场景下未被充分研究的问题。
2. EvoGenUI-Bench:多轮生成式 UI Agent 评测
- URL: https://arxiv.org/abs/2608.29387
- 日期: 2026-08-28
- 核心: 评测 LLM 作为多轮 UI 生成助手的 artifact 维护能力。150 个五轮任务,覆盖信息展示、执行交互、外部状态同步。在浏览器中执行并用截图/DOM/日志评判。Adjacent Pass Retention 测量跨轮次状态保持。
- 价值: 首个多轮 UI agent 可执行 benchmark;跨轮 retention 测量方法(相邻轮通过率)可迁移到其他 agent 场景的上下文保持评估。
3. Mem0: AI Agent Memory 2026 Benchmark Report
- URL: https://mem0.ai/blog/state-of-ai-agent-memory-2026
- 日期: 近期
- 核心: 2026 年 Agent Memory 基准全景报告,覆盖 LoCoMo、LongMemEval、BEAM(1M/10M)多个 benchmark。Mem0 新算法在 LoCoMo 达 92.5(基线约 75),LongMemEval 94.4。每次检索平均 6,956 tokens,远低于全上下文 ~26,000 tokens。
- 价值: token 效率数据对 agent 记忆层选型有直接参考;BEAM 10M(48.6)说明超长上下文下记忆压缩仍是 open problem。
4. Databricks: Long Context RAG Performance
- URL: https://www.databricks.com/blog/long-context-rag-performance-llms
- 日期: 2026
- 核心: 在不同 context length 下测量 RAG 性能。发现长 context 模型与 RAG 协同效应:更长 context 使 RAG 能包含更多相关文档。但多模型在长 context 下出现指令跟随退化、重复输出等问题。
- 价值: 实证数据反驳"长 context 将取代 RAG"的论断,指出两者协同才是正解。
📦 技术评论
"长 context 取代 RAG" 为时过早 来源: Databricks 实验数据 + Mem0 基准报告
核心矛盾:长 context 模型(Gemini 1M / Claude 200K)本身在超长 context 下性能退化;RAG 成本约 10s,而 stuffed context 需 120s+。两者协同(更多相关文档灌入 context)才是当前最优解,而非谁取代谁。
去重说明
MNIST-PRO(arXiv 2608.31022)已在本期候选中出现,但已于 2026-09-01 雷达详述,本次保留在候选表但不作高价值展开。
Tom 文献雷达 · 2026-09-02 · agent-rag-longcontext · 8 条候选 · 4 条高价值 · 0 条 CSDN