📡 Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-10-05 20:40

本期候选(8 条)

# 类型 标题 来源 亮点
1 ⭐ CLIMB: Confidence-Guided Complementary Evidence for Multimodal RAG arXiv 2610.03421 训练-free 推理框架,用 MMR 风格目标构建互补证据池,控制答案更新是否有充分证据支撑
2 ⭐ World Embedding Benchmark arXiv 2610.03632 8000 物理仿真案例,横跨流体/固体力学/动力学/光电;支持视频-文本检索、物理属性回归、多选描述分类
3 ⭐ δ-mem: 高效在线记忆(Substack 解读) AlphaSignal / arXiv May 2026 RAG 和长上下文之外的第三条路:8×8 关联记忆状态,仅 4.87M 可调参数,Qwen3-4B 上提升 5 benchmark 均分 4.87%
4 🔍 ProWAM: Progressive World Action Model arXiv 2610.02508 联合预测动作 + 有序稀疏视觉子目标序列;解决长时序视频预测低效问题
5 🔍 Collective Bias Mitigation via Model Routing arXiv 2610.03240 细粒度模型行为学习 + 知识共享缓解偏见,tag 含 RAG
6 🔍 Multilingual GSM-Symbolic arXiv 2610.03367 30,000 题目覆盖 15 种语言,研究跨语言能力迁移的决定因素
7 📝 LVMT: Video Mask Transformer arXiv 2609.34895 GRU 时序传播模块自适应选择记忆信息,训练长视频;tag 含 memory
8 📝 Rollout-Marginal Distillation for Video Generation arXiv 2609.37925 解决自回归视频生成中误差累积问题,保留生成历史做 AR 预测

💡 高价值条目解读

⭐ CLIMB( multimodal RAG 新范式)

现有 Multimodal RAG 常用 Top-K 检索或重排,容易返回冗余段落且缺乏对"答案是否有充分证据支撑"的控制。CLIMB 是一个推理时训练-free 框架: - 用 MMR(最大边际相关)风格目标构建紧凑互补证据池 - 在检索与生成之间建立置信度门控 - 适合知识密集型视觉 VQA

适用场景:多模态文档理解、医学影像问答、工业检测。


⭐ δ-mem(Agent 记忆第三条路)

传统 Agent 记忆两条路:RAG(外部知识检索)或 Long Context(更长上下文窗口)。δ-mem 提出第三条路:

  • 核心思想:将历史信息存储在微型 8×8 关联记忆状态矩阵中
  • 仅 4.87M 可训练参数(Qwen3-4B 的 0.12%)
  • 5 benchmark 均分提升约 5%
  • 代码已开源(CC-BY-4.0)

结论:对大多数 Agent 工作负载,RAG 过度设计,长上下文浪费。δ-mem 是介于两者之间的实用选择。


⭐ World Embedding Benchmark(RAG × 物理 × 视频)

评估视频表征如何编码物理信息的基准: - 80 个物理仿真族,8,000 受控案例 - 支持三大任务:文本-视频检索 / 物理属性回归 / 视频描述多选分类 - 覆盖流体、固体力学、动力学、光电

意义:为 world models 和视频生成提供物理保真度量化标准。


🔗 Substack 线索

  • AlphaSignal:"RAG and Long Context Aren't Enough for Agent Memory. δ-mem Is a Third Option" — 附 Qwen3-4B adapter 实测指南,5 分钟可跑通
  • Claudio Stamile:"Agent Memory Is Not RAG: a Practical Map" — 三层框架(Agent memory / RAG / Context engineering)概念梳理

扫描范围:arXiv + Hugging Face Daily
Substack:✅ 使用(AlphaSignal δ-mem 解读)
CSDN:❌ 未使用
生产时间:2026-10-05 20:40 CST
锁 TTL:1500s