Tom 文献雷达 · Agent RAG LongContext · 2026-09-07 晚场

概览

  • 采集时间:2026-09-07 20:40 (UTC+8)
  • 数据源:arXiv + HF Daily(8 条候选)
  • 本轮候选:8 条 | 高价值:4 条
  • Substack:未使用(CSDN:未使用)

高价值候选

1. Bilevel Coordinated Reflection — 多 Agent 博弈协调与语义记忆演化

  • 来源: HF Daily | votes: 59 | 2026-09-01
  • 链接: https://arxiv.org/abs/2609.02750
  • 标签: agent memory systems
  • 摘要: 将 orchestrator-worker 多 Agent 交互建模为双层博弈,在有界耦合下 worker 局部更新近似势博弈,其均衡 slack 由任务分解质量控制。reflection 被建模为语义记忆状态上的随机游走,推导了有限时间上界。这是目前对 Multi-Agent 协调机制最接近形式化的分析框架。
  • 关联度: ⭐⭐⭐ 核心 — Agent 协调机制 + 记忆建模

2. τ^τ-Bench — 真实客户端场景的 Agent 构建评测基准

  • 来源: HF Daily | votes: 2 | 2026-09-03
  • 链接: https://arxiv.org/abs/2609.04611
  • 标签: agent benchmark systems
  • 摘要: 现有 Agent 基准不测"AI 能否在真实客户交付条件下构建一个可用 Agent"。τ^τ-bench 给定:业务记录 + 客户需求 + 生产 API + 继承代码库 + 成本限制,由开发 Agent 端到端完成交付。是第一个把 Agent 构建过程本身作为 benchmark 任务的评测。
  • 关联度: ⭐⭐⭐ 核心 — Agent 基准方法论新方向

3. Substrate-Aware AI Agents — 执行上下文作为第一类输入

  • 来源: arXiv | Manu Agrawal | 2026-09-04
  • 链接: http://arxiv.org/abs/2609.05232v1
  • 标签: agent memory
  • 摘要: 提出 substrate blindness 概念:Agent 在规划时忽略内存、执行时间、运行时、算力和运营约束。通过代码生成实验测试三个前沿模型,发现模型对操作约束的敏感性差异显著,提出将执行上下文显式纳入 Agent 状态表示。
  • 关联度: ⭐⭐⭐ 核心 — Agent memory + 执行上下文建模

4. ShallowStream — 浅索引深回答:流式视频理解 Token 预算控制

  • 来源: HF Daily | votes: 2 | 2026-09-01
  • 链接: https://arxiv.org/abs/2609.02780
  • 标签: agent rag benchmark multimodal
  • 摘要: 1 小时视频 = 3600 帧,多模态 LLM 全深度预填充成本极高。ShallowStream 固定评分器、提示边界、分辨率和答题模型,系统性变化 selection、spatial compression、reinvestment 三个维度,研究 MLLM 在长视频流上的 token 分配权衡。融合 RAG 思想(按需帧检索)到视频理解。
  • 关联度: ⭐⭐ 相关 — 长上下文 Token 管理 + RAG 视频检索

一般候选(4 条)

  1. Enoki: Multi-Level Hallucination Detection (14 votes, 2026-08-31) — claim-level + span-level 幻觉检测统一框架,非本主题核心。
  2. Attention Triangle in Audio-Video Models (10 votes, 2026-09-02) — 音视频跨模态注意力泄漏分析,多模态方向。
  3. Beneath Chains-of-Thought (6 votes, 2026-09-03) — CoT 操作在 hidden representation 中的几何结构,推理可解释性。
  4. HoloWorld: Indoor-Outdoor Urban Generation (2 votes, 2026-08-28) — 3D 城市生成,非本主题核心。

实践洞察

RAG vs Long Context 2026 实测数据(Wire) - RAG 单次查询 ~$0.00008,Long Context ~$0.10,差距 1250 倍 - 延迟:RAG ~1s vs Long Context ~45s - Long Context 在相关文档埋藏在上下文中间时准确率下降 30%+ - 2026 生产主流:hybrid,宽检索收窄上下文 → 注入大上下文窗口全局推理 - 现代 coding agent 普遍采用此架构:检索 + 长上下文推理 + tool calling


去重备注

  • 本轮高价值项与早场(RoboTok/DRACO/VeriPhy/Select-Compress-Reinvest)无重复
  • τ^τ-bench 与现有 Agent 基准(GITM/WebArena 等)方向不同,评测的是"构建过程"而非"执行任务"
  • Substrate-Aware 与 DRACO(早场)同属 Agent memory 方向,但侧重点不同(执行约束 vs 信用分配)

Tom 文献雷达 · 每日 3 次轻量采集 · 高价值驱动