Tom 文献雷达 · AI Agent × RAG × 长上下文 × 评测

2026-07-19 20:40 (UTC+8) · 第3次/天


📡 本期高价值论文(4条)

1. RxBrain: 具身认知基础模型 — 语言+视觉联合推理与想象

  • 来源: arXiv · HF Daily · 2026-07-14 · votes 22
  • 标签: agent multimodal
  • 核心: 腾讯混元团队(Tencent Hunyuan)开源 Hy-Embodied-RxBrain-1.0,6.2B 统一多模态 MoE Transformer。突破在于:每步规划同时输出语言动作 + 目标图像(visual imagination),语言提供抽象任务分解结构,视觉想象预测中间/最终物理状态。开源 RxBrain-Bench 具身认知基准、推理代码和模型权重(HuggingFace: tencent/Hy-Embodied-RxBrain-1.0)。
  • 洞察: Agent具身规划从纯语言符号向语言-视觉双通路演进;视觉想象作为规划锚点,是具身Agent区别于纯LLM规划的关键。

2. HDR: Hierarchical Denoising for Multi-Step Visual Reasoning

  • 来源: HF Daily · 2026-07-15 · votes 3
  • 标签: multimodal systems
  • 核心: 视频模型做多步推理的两难:流式AR扩散高效但推理弱,双向扩散能全局修正但逐帧去噪成本高。HDR用树状层级latent统一两者,支持流式低延迟+全局逻辑一致性。面向复杂推理任务。
  • 洞察: 对Agent视觉观测链路(多帧/视频输入)的处理架构有参考价值,但主战场是视频生成而非Agent。

3. On Locality and Length Generalization in Visual Reasoning

  • 来源: HF Daily · 2026-07-09 · votes 2
  • 标签: multimodal systems
  • 核心: 人类视觉是局部序列化foveated瞥视,而非全局单次计算。研究从视觉状态追踪和长度泛化视角,探讨局部序列化视觉模型是否比全局模型有根本计算优势。初步结论:局部模型在长度外推任务上有优势,且更生物合理。
  • 洞察: 对长视频理解、长轨迹Agent观测建模有启发;局部采样可能是突破长上下文窗口限制的另类思路。

4. LongStraw: Long-Context RL Beyond 2M Tokens under Fixed GPU Budget

  • 来源: arXiv · 2026-07-16(补充收录,前次简报已发)
  • 标签: agent long-context benchmark systems
  • 核心: RL post-training受困于256K,但Agent长轨迹(observation、tool output、历史决策)需要百万token级上下文。LongStraw用GRPO共享prompt免autograd、固定GPU预算下执行百万token RL训练栈。
  • 洞察: 补发原因:这是目前最完整的"推理上下文百万token vs 训练上下文256K"gap的系统性解决方案,Agent长程记忆训练方向必读。

📋 候选论文(全部8条)

# 标题 来源 日期 标签 亮点
1 RxBrain (Hy-Embodied) HF Daily 07-14 agent/multimodal 具身认知语言+视觉双通路规划
2 HDR HF Daily 07-15 multimodal/systems 层级去噪多步视觉推理
3 Locality & Length Generalization HF Daily 07-09 multimodal/systems 局部序列化视觉vs全局计算优势
4 LongStraw arXiv 07-16 agent/long-context/systems 百万token RL训练栈
5 SUFLECA HF Daily 07-15 systems CAD-图像9D姿态零样本对齐
6 Chat2Scenic arXiv 07-14 agent/rag/benchmark/systems 迭代RAG生成自动驾驶DSL
7 Digital Pantheon arXiv 07-16 agent/rag/benchmark DPO+RAG多智能体联盟博弈
8 Rethinking Harness Evolution arXiv 07-13 agent/benchmark/systems Agent评测协议批判

🧭 行业风向标(轻量补充)

Substack 线索(非深度检索,仅本期候选关联补充): - 本轮8条候选中,Agent+RAG相关共5条(RxBrain、Chat2Scenic、Digital Pantheon、LongStraw、Rethinking Harness),仍是主流研究方向;多模态具身和视觉推理新增4条,反映近期HF策展热点偏移至视觉-语言联合范式。 - 0816前次Substack报告(LLM Context 2026路由指南)核心结论不变:RAG与Long Context非竞争,路由层决定最优路径。


📁 产出信息

  • candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-07-19-agent-rag-longcontext-candidates.json
  • 高价值: 4/8 条
  • Substack 引用: 无新增深度检索,继承0816结论
  • CSDN 使用: 无
  • 执行耗时: ~6 min