Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-09 08:40 UTC

本期高价值候选(3 条)

1. DataSpace Benchmark — 可验证数据分析 Agent 新基准

  • 来源: arXiv 2608.03451 / HF Daily (25 票)
  • 标签: Agent + RAG + Benchmark
  • 核心: Data agents 在异构工作空间(CSV/JSON/SQLite/MD/PDF 等)中产生可验证表格输出的 benchmark。410 任务,7,439 工件,15 GB。填补了"异构证据发现 + 完整表格输出 + 确定性评估"三项能力无法统一测量的空白。
  • 意义: 当前 RAG agent 评估多局限在单一文档类型,DataSpace 率先对标真实组织数据环境,对 Agent × RAG 系统评测有直接参考价值。

2. Activity Frames — 无模型 Agent 记忆重放管道

  • 来源: arXiv 2608.05784 / HF Daily (18 票)
  • 标签: Agent + Memory
  • 核心: 将屏幕活动被动录制备份编译为 Agent 记忆的零模型管道。分割为带类型边界、应用/站点/时间戳/输入量的 activity frames,可字节级缓存、机械化审计,无需任何模型参与。在 128,756 帧 / 51 天真实用户数据上验证。
  • 意义: 突破"Agent 记忆 = 用户说了什么"的局限,记录"用户做了什么"。对构建长期个人 Agent 记忆系统有直接工程参考价值。

3. Agentic RAG + Self-RAG 最新进展(Substack)

  • 来源: SwirlAI · State of Context Engineering in 2026
  • 核心: 2026 年 RAG 并未因长上下文死亡(成本 / 权限隔离 / 数据新鲜度三因),但演进出两条成熟路线:
  • Agentic RAG:检索由 Agent 控制,可迭代改写查询、置信度阈值回退,替代固定管道;
  • Self-RAG:模型自判断何时检索、自评估检索质量再决定是否使用。
  • 意义: 两者结合是当前生产系统主流形态,值得持续追踪。

其余候选(5 条)

  1. Weights or Skills Survey (arXiv 2608.01851) — Robot learning 两派对比:VLA 冻结权重 vs 代码即策略自主写技能,Survey 结构清晰,适合了解 Agent 能力演进全貌。
  2. FactorJEPA (arXiv 2608.01049) — Global South 密集城市场景下的世界模型基准,Agent 异质性高,评测场景与常规 Benchmark 互补。
  3. Interpretable MEG Decoding (arXiv 2608.01481) — MEG 脑信号 → 语音检索,RAG 类范式,涉及 CLIP+wav2vec 联合嵌入,非核心方向但方法论有参考价值。
  4. KVAE Multimodal Tokenizer (arXiv 2608.05798) — 音频/图像/视频统一 tokenizer 家族,多模态生成基础组件,间接支撑多模态 Agent。
  5. GaussianSelector (arXiv 2608.01492) — 3DGS 场景物体选择,Embodied Agent 场景相关,但非 RAG/长上下文核心。

去重备注

  • 2026-08-08 三轮雷达已覆盖 DataSpace(候选出现)、Activity Frames(当日 HF 策展)。本次 DataSpace 仍保留,因其为 benchmark 首发;Activity Frames 重复,故降级。
  • Substack 信息未在近期文件中重复。

资源链接

  • DataSpace: https://arxiv.org/abs/2608.03451
  • Activity Frames: https://arxiv.org/abs/2608.05784
  • State of Context Engineering 2026: https://www.newsletter.swirlai.com/p/state-of-context-engineering-in-2026
  • 2026 AI Agent Stack: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from

Tom 文献雷达 · 每日 3 频 · Agent / RAG / 长上下文 / 评测