Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-20
本期关键词
AI Agent · RAG · 长上下文 · 评测 · 具身智能 · 多智能体
🔥 高价值条目(4 条)
1. LongStraw:百万 Token RL 训练预算下的长上下文后训练
- 来源:arXiv · 2026-07-16
- 作者:周昌华(华东师大)、Kieran Liu、Harry Zhang 等
- 链接:http://arxiv.org/abs/2607.14952v1
- 核心观点:推理侧上下文窗口已突破百万 token,但 RL 后训练仍困在 256K 导致长度泛化鸿沟。LongStraw 提出架构感知执行栈,在固定 GPU 预算下将 RL post-training 扩展至百万 token 级;核心是对共享 prompt 不做 autograd,仅保留模型特定状态,配合 GRPO 优化。
- 为什么高价值:Agent 的观察、工具输出、文档、决策历史随轨迹不断累积——这正是 LongStraw 要解决的核心场景。与 AI Agent 记忆管理的工程实践直接挂钩。
2. RxBrain:具身规划中语言与视觉想象的互补框架
- 来源:HuggingFace Daily · 2026-07-14 · 23 票
- 链接:https://arxiv.org/abs/2607.14187
- 核心观点:Hy-Embodied-RxBrain 将具身计划表示为单一规划序列,语言提供抽象结构(任务分解、约束),视觉想象提供物理状态预测,两者互补而非各自为政。与传统视觉-语言模型和世界模型路线均不同。
- 为什么高价值:具身 Agent 规划范式的新思路;语言与视觉的互补角色分工值得在 Agent 架构设计中借鉴。
3. Digital Pantheon:LLM Agent 联盟形成的模拟与审计
- 来源:arXiv · 2026-07-16
- 作者:Dylan Van Mulders、Matthias Bogaert、Dirk Van den Poel(根特大学)
- 链接:http://arxiv.org/abs/2607.15095v1
- 核心观点:政治联盟形成由政策目标和意识形态共同驱动;LLM 经 RLHF 后天然有"中立性偏差",难以维持坚定的党派行为。框架结合 SFT + DPO + RAG:DPO 强化党派立场,RAG 保证事实 grounding,SFT 提供基础能力。
- 为什么高价值:RAG 与微调结合的实战级多智能体设计;多 Agent 协商/博弈场景下的 RLHF 局限性分析有参考价值。
4. Chat2Scenic:基于迭代 RAG 的自动驾驶场景脚本生成
- 来源:HuggingFace Daily · 2026-07-14 · 4 票
- 链接:https://arxiv.org/abs/2607.14387
- 核心观点:自动驾驶仿真需要合规的场景脚本;策展式方法(retrieval-assemble)编译率高但缺乏可扩展性,纯生成方法编译率低。Chat2Scenic 提出首个迭代 RAG 框架,用 DSL 生成场景脚本,在策展率和编译成功率之间取得平衡。
- 为什么高价值:RAG 在垂直领域(自动驾驶 DSL)的迭代增强实践;与通用 Agent 调用工具链的场景化挑战高度相关。
📋 常规候选(4 条)
-
Rethinking Harness Evolution for Agents(HF · 2026-07-13)——质疑 Agent 评测中 harness 进化协议:同等反馈预算下简单任务级搜索基线是否更优?评测方法论层面的自省,对 benchmark 设计有参考价值。
-
Hierarchical Denoising for Multi-Step Visual Reasoning(HF · 2026-07-15)——HDR 将视频潜码组织为树结构,实现流式多步推理的去噪;因果 AR 扩散与双向全局修订的统一框架。
-
On Locality and Length Generalization in Visual Reasoning(HF · 2026-07-09)——研究局部顺序视觉模型 vs 全局一次性视觉模型在状态跟踪和长度泛化上的差异,生物启发路线。
-
SUFLECA:CAD-to-image 对齐的规模化特征学习(HF · 2026-07-15)——零样本 CAD 对齐的弱监督框架,增强几何特征学习,缓解外观驱动对应关系在遮挡和 sim-to-real 下的退化。
📡 本期补充线索(1 条,非 Substack)
- 2M Token 上下文 vs RAG 成本延迟决策框架(2026)
https://ecorpit.com/long-context-2m-tokens-vs-rag-cost-latency-2026
Gemini 3.5 Pro(2M context)发布后,RAG vs 长上下文的成本-延迟决策框架,token 成本表、中等窗口精度 drop 现象、策展检索策略,适合 Agent 工程落地参考。
📊 元数据
- 检索时间:2026-07-20 08:40 UTC
- 检索来源:arXiv metadata、HF Daily
- Web 补充:1 次(用于非 Substack 行业分析,非策展内容)
- CSDN:未使用(本期无满足条件的检索结果)
- 本期候选总数:8 条
- 高价值条数:4 条
Tom 文献雷达 · 每日 3 次 · 轻量模式