Tom 文献雷达 · Agent / RAG / Long-Context · 2026-08-26 14:40 UTC
主题: AI Agent · RAG · 检索 · 长上下文 · 评测 · 新论文
来源: arXiv metadata + HF Daily(富化版本/被引/TLDR)
本次候选总数: 8 条
Substack 参考: 1 条(轻量补充)
💎 高价值条目(3 条)
1. WeMM-Embedding:通用多模态 Embedding 家族(2B/4B/9B)
- 来源: HF Daily | arXiv:2608.24053 | 票数 41
- 摘要: 微信团队多模态 Embedding 系列,支持文本/图像/视频/富文档/交错多模态输入,输出维度可灵活配置。分两阶段训练:大规模多模态对齐 → 精选数据精调。含 2B/4B/9B 三个规格,RAG 和 Agent 系统的多模态检索核心组件。
- 标签:
agentragbenchmarkmultimodal - ⭐ 价值点: 多模态 RAG / Agent 检索基础设施工具,微信内部验证,直接可参考
2. Evidence Blindness in DCI:证据盲区——RAG 演进的新瓶颈
- 来源: arXiv:2608.24764v1(2026-08-25)| 作者:郭洪宇等
- 摘要: 大模型 Agent 正从传统 RAG 走向直接语料交互(DCI)。但有限交互轮次内,所需证据可能:① 未被检索到,② 被检索但未打开,③ 打开但关键片段未暴露。论文将此渐进式静默损失定义为 Evidence Blindness,并量化阶段证据实现率。动态导航(AtlasNav)在 DCI 范式下收益甚微,需重建可复用语料组织结构。
- 标签:
agentragbenchmark - ⭐ 价值点: 新概念框架,直击 Agent+RAG 核心问题;AtlasNav 方案可作为评测基准参考
3. δ-mem:介于 RAG 和 Long Context 之间的第三记忆路径
- 来源: AlphaSignal(Substack)| 2026-05-12 arXiv | 票数参考 10.1K 阅读
- 摘要: 长上下文成本高但模型并不总能有效利用历史。δ-mem 在一个 8×8 关联记忆矩阵中存储历史信息,仅 4.87M 可训练参数(模型参数 0.12%),Qwen3-4B-Instruct 评测平均提升 4.87pp。适合 Agent 的轻量在线记忆,而非重型 RAG 或全上下文。
- 标签:
agentmemory - ⭐ 价值点: Agent 记忆架构新范式;极低开销,可与 RAG 互补;HF 已开源 CC-BY-4.0
📋 候选完整列表(8 条)
| # | 标题 | 来源 | 票/信号 | 核心标签 |
|---|---|---|---|---|
| 1 | WeMM-Embedding | HF Daily | 41票 | agent rag multimodal |
| 2 | Evidence Blindness in DCI | arXiv | 新 | agent rag benchmark |
| 3 | δ-mem: Online Memory for LLM | Substack | 10K阅 | agent memory |
| 4 | OraRL: 视频 MLLM 强化学习 | HF Daily | 62票 | multimodal |
| 5 | PinSieve: 生产选择性 VLM Serving | arXiv | 新 | agent memory systems |
| 6 | Game2World Engine | HF Daily | 4票 | multimodal |
| 7 | Smart Glasses 感知平台 | HF Daily | 3票 | rag benchmark multimodal |
| 8 | Length-Adaptive 翻译解码 | HF Daily | 1票 | rag |
📌 简评
- 多模态 Embedding 赛道持续升温,WeMM 是近期最完整的工程实践。
- DCI + Evidence Blindness 是 RAG 演进方向的信号:问题已从「能不能检索」变成「交互预算内证据能否被有效暴露」。
- δ-mem 填补了轻量 Agent 记忆的空白,与 RAG 不是取代关系,是互补的第三层。
- PinSieve 值得关注:生产级 Agent Serving 案例,人机协同路由有实操价值。
本报告由 Tom 研究知识库自动生成 · 2026-08-26T14:40 UTC 轻量模式 · 10 分钟收尾 · 仅写入 /shared/research-kb/inbox/tom/