Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-20

本期关键词

AI Agent · RAG · 长上下文 · 评测 · 具身智能 · 多智能体


🔥 高价值条目(4 条)

1. LongStraw:百万 Token RL 训练预算下的长上下文后训练

  • 来源:arXiv · 2026-07-16
  • 作者:周昌华(华东师大)、Kieran Liu、Harry Zhang 等
  • 链接:http://arxiv.org/abs/2607.14952v1
  • 核心观点:推理侧上下文窗口已突破百万 token,但 RL 后训练仍困在 256K 导致长度泛化鸿沟。LongStraw 提出架构感知执行栈,在固定 GPU 预算下将 RL post-training 扩展至百万 token 级;核心是对共享 prompt 不做 autograd,仅保留模型特定状态,配合 GRPO 优化。
  • 为什么高价值:Agent 的观察、工具输出、文档、决策历史随轨迹不断累积——这正是 LongStraw 要解决的核心场景。与 AI Agent 记忆管理的工程实践直接挂钩。

2. RxBrain:具身规划中语言与视觉想象的互补框架

  • 来源:HuggingFace Daily · 2026-07-14 · 23 票
  • 链接:https://arxiv.org/abs/2607.14187
  • 核心观点:Hy-Embodied-RxBrain 将具身计划表示为单一规划序列,语言提供抽象结构(任务分解、约束),视觉想象提供物理状态预测,两者互补而非各自为政。与传统视觉-语言模型和世界模型路线均不同。
  • 为什么高价值:具身 Agent 规划范式的新思路;语言与视觉的互补角色分工值得在 Agent 架构设计中借鉴。

3. Digital Pantheon:LLM Agent 联盟形成的模拟与审计

  • 来源:arXiv · 2026-07-16
  • 作者:Dylan Van Mulders、Matthias Bogaert、Dirk Van den Poel(根特大学)
  • 链接:http://arxiv.org/abs/2607.15095v1
  • 核心观点:政治联盟形成由政策目标和意识形态共同驱动;LLM 经 RLHF 后天然有"中立性偏差",难以维持坚定的党派行为。框架结合 SFT + DPO + RAG:DPO 强化党派立场,RAG 保证事实 grounding,SFT 提供基础能力。
  • 为什么高价值:RAG 与微调结合的实战级多智能体设计;多 Agent 协商/博弈场景下的 RLHF 局限性分析有参考价值。

4. Chat2Scenic:基于迭代 RAG 的自动驾驶场景脚本生成

  • 来源:HuggingFace Daily · 2026-07-14 · 4 票
  • 链接:https://arxiv.org/abs/2607.14387
  • 核心观点:自动驾驶仿真需要合规的场景脚本;策展式方法(retrieval-assemble)编译率高但缺乏可扩展性,纯生成方法编译率低。Chat2Scenic 提出首个迭代 RAG 框架,用 DSL 生成场景脚本,在策展率和编译成功率之间取得平衡。
  • 为什么高价值:RAG 在垂直领域(自动驾驶 DSL)的迭代增强实践;与通用 Agent 调用工具链的场景化挑战高度相关。

📋 常规候选(4 条)

  1. Rethinking Harness Evolution for Agents(HF · 2026-07-13)——质疑 Agent 评测中 harness 进化协议:同等反馈预算下简单任务级搜索基线是否更优?评测方法论层面的自省,对 benchmark 设计有参考价值。

  2. Hierarchical Denoising for Multi-Step Visual Reasoning(HF · 2026-07-15)——HDR 将视频潜码组织为树结构,实现流式多步推理的去噪;因果 AR 扩散与双向全局修订的统一框架。

  3. On Locality and Length Generalization in Visual Reasoning(HF · 2026-07-09)——研究局部顺序视觉模型 vs 全局一次性视觉模型在状态跟踪和长度泛化上的差异,生物启发路线。

  4. SUFLECA:CAD-to-image 对齐的规模化特征学习(HF · 2026-07-15)——零样本 CAD 对齐的弱监督框架,增强几何特征学习,缓解外观驱动对应关系在遮挡和 sim-to-real 下的退化。


📡 本期补充线索(1 条,非 Substack)

  • 2M Token 上下文 vs RAG 成本延迟决策框架(2026)
    https://ecorpit.com/long-context-2m-tokens-vs-rag-cost-latency-2026
    Gemini 3.5 Pro(2M context)发布后,RAG vs 长上下文的成本-延迟决策框架,token 成本表、中等窗口精度 drop 现象、策展检索策略,适合 Agent 工程落地参考。

📊 元数据

  • 检索时间:2026-07-20 08:40 UTC
  • 检索来源:arXiv metadata、HF Daily
  • Web 补充:1 次(用于非 Substack 行业分析,非策展内容)
  • CSDN:未使用(本期无满足条件的检索结果)
  • 本期候选总数:8 条
  • 高价值条数:4 条

Tom 文献雷达 · 每日 3 次 · 轻量模式