Tom 文献雷达 · Agent RAG LongContext · 2026-09-07 晚场
概览
- 采集时间:2026-09-07 20:40 (UTC+8)
- 数据源:arXiv + HF Daily(8 条候选)
- 本轮候选:8 条 | 高价值:4 条
- Substack:未使用(CSDN:未使用)
高价值候选
1. Bilevel Coordinated Reflection — 多 Agent 博弈协调与语义记忆演化
- 来源: HF Daily | votes: 59 | 2026-09-01
- 链接: https://arxiv.org/abs/2609.02750
- 标签:
agentmemorysystems - 摘要: 将 orchestrator-worker 多 Agent 交互建模为双层博弈,在有界耦合下 worker 局部更新近似势博弈,其均衡 slack 由任务分解质量控制。reflection 被建模为语义记忆状态上的随机游走,推导了有限时间上界。这是目前对 Multi-Agent 协调机制最接近形式化的分析框架。
- 关联度: ⭐⭐⭐ 核心 — Agent 协调机制 + 记忆建模
2. τ^τ-Bench — 真实客户端场景的 Agent 构建评测基准
- 来源: HF Daily | votes: 2 | 2026-09-03
- 链接: https://arxiv.org/abs/2609.04611
- 标签:
agentbenchmarksystems - 摘要: 现有 Agent 基准不测"AI 能否在真实客户交付条件下构建一个可用 Agent"。τ^τ-bench 给定:业务记录 + 客户需求 + 生产 API + 继承代码库 + 成本限制,由开发 Agent 端到端完成交付。是第一个把 Agent 构建过程本身作为 benchmark 任务的评测。
- 关联度: ⭐⭐⭐ 核心 — Agent 基准方法论新方向
3. Substrate-Aware AI Agents — 执行上下文作为第一类输入
- 来源: arXiv | Manu Agrawal | 2026-09-04
- 链接: http://arxiv.org/abs/2609.05232v1
- 标签:
agentmemory - 摘要: 提出 substrate blindness 概念:Agent 在规划时忽略内存、执行时间、运行时、算力和运营约束。通过代码生成实验测试三个前沿模型,发现模型对操作约束的敏感性差异显著,提出将执行上下文显式纳入 Agent 状态表示。
- 关联度: ⭐⭐⭐ 核心 — Agent memory + 执行上下文建模
4. ShallowStream — 浅索引深回答:流式视频理解 Token 预算控制
- 来源: HF Daily | votes: 2 | 2026-09-01
- 链接: https://arxiv.org/abs/2609.02780
- 标签:
agentragbenchmarkmultimodal - 摘要: 1 小时视频 = 3600 帧,多模态 LLM 全深度预填充成本极高。ShallowStream 固定评分器、提示边界、分辨率和答题模型,系统性变化 selection、spatial compression、reinvestment 三个维度,研究 MLLM 在长视频流上的 token 分配权衡。融合 RAG 思想(按需帧检索)到视频理解。
- 关联度: ⭐⭐ 相关 — 长上下文 Token 管理 + RAG 视频检索
一般候选(4 条)
- Enoki: Multi-Level Hallucination Detection (14 votes, 2026-08-31) — claim-level + span-level 幻觉检测统一框架,非本主题核心。
- Attention Triangle in Audio-Video Models (10 votes, 2026-09-02) — 音视频跨模态注意力泄漏分析,多模态方向。
- Beneath Chains-of-Thought (6 votes, 2026-09-03) — CoT 操作在 hidden representation 中的几何结构,推理可解释性。
- HoloWorld: Indoor-Outdoor Urban Generation (2 votes, 2026-08-28) — 3D 城市生成,非本主题核心。
实践洞察
RAG vs Long Context 2026 实测数据(Wire) - RAG 单次查询 ~$0.00008,Long Context ~$0.10,差距 1250 倍 - 延迟:RAG ~1s vs Long Context ~45s - Long Context 在相关文档埋藏在上下文中间时准确率下降 30%+ - 2026 生产主流:hybrid,宽检索收窄上下文 → 注入大上下文窗口全局推理 - 现代 coding agent 普遍采用此架构:检索 + 长上下文推理 + tool calling
去重备注
- 本轮高价值项与早场(RoboTok/DRACO/VeriPhy/Select-Compress-Reinvest)无重复
- τ^τ-bench 与现有 Agent 基准(GITM/WebArena 等)方向不同,评测的是"构建过程"而非"执行任务"
- Substrate-Aware 与 DRACO(早场)同属 Agent memory 方向,但侧重点不同(执行约束 vs 信用分配)
Tom 文献雷达 · 每日 3 次轻量采集 · 高价值驱动