Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-08-17 14:40 CST

🔥 高价值条目(4 条)

1. MobileMem: 移动端全年感知记忆基准

  • 来源: arXiv:2608.13606(2026-08-11)
  • 标签: agent rag memory benchmark
  • 亮点: 首个基于真实一年移动经验数据的设备端长期记忆benchmark,涵盖异构/多模态/演化/个人化体验四位一体。对现有RAG评估体系提出根本性质疑。
  • 启示: 移动端AI助手即将成为主流形态,记忆系统评估范式需重建。
  • 来源: arXiv:2608.14210(2026-08-14)
  • 标签: rag benchmark systems
  • 亮点: 对8个法律RAG系统做精细化解构:幻觉密度 + 严重程度 + 问题类别 + 用户画像。GDPR(英)/ 国内民法(法)双数据集验证,142条法律专家问题独立测试。
  • 启示: 法律是高风险RAG场景,幻觉问题远比benchmark数字呈现的更顽固;claim级评估粒度是关键。

3. Second Thought: 推理间歇期并行思考

  • 来源: arXiv:2608.13667(2026-08-13)
  • 标签: agent systems
  • 亮点: ReAct范式中Action/Observation阶段推理空窗被浪费,作者在此窗口fork四个辅助分支并行解码,服务后续轮次,无需训练。
  • 启示: 推理与行动解耦是下一代Agent系统设计核心;测试时计算优化有新空间。

4. δ-mem: RAG 与 Long Context 之外的第三条路(Substack)

  • 来源: AlphaSignal · alphasignalai.substack.com(2026-05-15)
  • 标签: rag memory
  • 亮点: δ-mem 用 8×8 关联记忆状态(仅 64 个数值)替代 RAG 或扩展上下文;在 Qwen3-4B 上以 4.87M 可调参数(模型 0.12%)提升 5 个 benchmark 平均 4.87%。
  • 启示: 大多数 Agent 记忆场景 RAG 是过度工程,Long Context 是资源浪费,δ-mem 提示轻量在线记忆的可行路径。

📋 候选清单(共 8 条,含上述 4 条高价值)

# 标题 来源 标签 备注
1 MobileMem: Learning from a Year of Mobile Experiences arXiv:2608.13606 agent,rag,memory,benchmark ⭐ 高价值
2 How Much Do Legal RAG Systems Still Hallucinate? arXiv:2608.14210 rag,benchmark,systems ⭐ 高价值
3 Second Thought: Reasoning in Parallel as LLM Agents Act arXiv:2608.13667 agent,systems ⭐ 高价值
4 δ-mem: RAG and Long Context 之外的第三条路 AlphaSignal·substack rag,memory ⭐ 高价值·Substack
5 Latent On-Policy Self-Distillation arXiv:2608.13040 agent,multimodal Agent自主进化新路径
6 CPI-Bench: 图编辑综合评测 arXiv:2608.14546 rag,benchmark 多图编辑推理指令评测
7 PRM-as-a-Judge 1.5: 机器人过程评估工具包 arXiv:2608.14284 benchmark,multimodal 细粒度机器人评估
8 Forecast Collapse in Time-Series Foundation Models arXiv:2608.14106 benchmark 时间序列模型退化现象

本报告由 Tom 研究知识库自动生成 · 2026-08-17 14:40 CST 数据来源: arXiv · Hugging Face Daily · Substack(含 1 条)