Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-08-17 14:40 CST
🔥 高价值条目(4 条)
1. MobileMem: 移动端全年感知记忆基准
- 来源: arXiv:2608.13606(2026-08-11)
- 标签:
agentragmemorybenchmark - 亮点: 首个基于真实一年移动经验数据的设备端长期记忆benchmark,涵盖异构/多模态/演化/个人化体验四位一体。对现有RAG评估体系提出根本性质疑。
- 启示: 移动端AI助手即将成为主流形态,记忆系统评估范式需重建。
2. How Much Do Legal RAG Systems Still Hallucinate?
- 来源: arXiv:2608.14210(2026-08-14)
- 标签:
ragbenchmarksystems - 亮点: 对8个法律RAG系统做精细化解构:幻觉密度 + 严重程度 + 问题类别 + 用户画像。GDPR(英)/ 国内民法(法)双数据集验证,142条法律专家问题独立测试。
- 启示: 法律是高风险RAG场景,幻觉问题远比benchmark数字呈现的更顽固;claim级评估粒度是关键。
3. Second Thought: 推理间歇期并行思考
- 来源: arXiv:2608.13667(2026-08-13)
- 标签:
agentsystems - 亮点: ReAct范式中Action/Observation阶段推理空窗被浪费,作者在此窗口fork四个辅助分支并行解码,服务后续轮次,无需训练。
- 启示: 推理与行动解耦是下一代Agent系统设计核心;测试时计算优化有新空间。
4. δ-mem: RAG 与 Long Context 之外的第三条路(Substack)
- 来源: AlphaSignal · alphasignalai.substack.com(2026-05-15)
- 标签:
ragmemory - 亮点: δ-mem 用 8×8 关联记忆状态(仅 64 个数值)替代 RAG 或扩展上下文;在 Qwen3-4B 上以 4.87M 可调参数(模型 0.12%)提升 5 个 benchmark 平均 4.87%。
- 启示: 大多数 Agent 记忆场景 RAG 是过度工程,Long Context 是资源浪费,δ-mem 提示轻量在线记忆的可行路径。
📋 候选清单(共 8 条,含上述 4 条高价值)
| # | 标题 | 来源 | 标签 | 备注 |
|---|---|---|---|---|
| 1 | MobileMem: Learning from a Year of Mobile Experiences | arXiv:2608.13606 | agent,rag,memory,benchmark | ⭐ 高价值 |
| 2 | How Much Do Legal RAG Systems Still Hallucinate? | arXiv:2608.14210 | rag,benchmark,systems | ⭐ 高价值 |
| 3 | Second Thought: Reasoning in Parallel as LLM Agents Act | arXiv:2608.13667 | agent,systems | ⭐ 高价值 |
| 4 | δ-mem: RAG and Long Context 之外的第三条路 | AlphaSignal·substack | rag,memory | ⭐ 高价值·Substack |
| 5 | Latent On-Policy Self-Distillation | arXiv:2608.13040 | agent,multimodal | Agent自主进化新路径 |
| 6 | CPI-Bench: 图编辑综合评测 | arXiv:2608.14546 | rag,benchmark | 多图编辑推理指令评测 |
| 7 | PRM-as-a-Judge 1.5: 机器人过程评估工具包 | arXiv:2608.14284 | benchmark,multimodal | 细粒度机器人评估 |
| 8 | Forecast Collapse in Time-Series Foundation Models | arXiv:2608.14106 | benchmark | 时间序列模型退化现象 |
本报告由 Tom 研究知识库自动生成 · 2026-08-17 14:40 CST 数据来源: arXiv · Hugging Face Daily · Substack(含 1 条)