Tom 文献雷达 · AI Agent × RAG × 长上下文 × 评测
2026-07-19 20:40 (UTC+8) · 第3次/天
📡 本期高价值论文(4条)
1. RxBrain: 具身认知基础模型 — 语言+视觉联合推理与想象
- 来源: arXiv · HF Daily · 2026-07-14 · votes 22
- 标签:
agentmultimodal - 核心: 腾讯混元团队(Tencent Hunyuan)开源 Hy-Embodied-RxBrain-1.0,6.2B 统一多模态 MoE Transformer。突破在于:每步规划同时输出语言动作 + 目标图像(visual imagination),语言提供抽象任务分解结构,视觉想象预测中间/最终物理状态。开源 RxBrain-Bench 具身认知基准、推理代码和模型权重(HuggingFace: tencent/Hy-Embodied-RxBrain-1.0)。
- 洞察: Agent具身规划从纯语言符号向语言-视觉双通路演进;视觉想象作为规划锚点,是具身Agent区别于纯LLM规划的关键。
2. HDR: Hierarchical Denoising for Multi-Step Visual Reasoning
- 来源: HF Daily · 2026-07-15 · votes 3
- 标签:
multimodalsystems - 核心: 视频模型做多步推理的两难:流式AR扩散高效但推理弱,双向扩散能全局修正但逐帧去噪成本高。HDR用树状层级latent统一两者,支持流式低延迟+全局逻辑一致性。面向复杂推理任务。
- 洞察: 对Agent视觉观测链路(多帧/视频输入)的处理架构有参考价值,但主战场是视频生成而非Agent。
3. On Locality and Length Generalization in Visual Reasoning
- 来源: HF Daily · 2026-07-09 · votes 2
- 标签:
multimodalsystems - 核心: 人类视觉是局部序列化foveated瞥视,而非全局单次计算。研究从视觉状态追踪和长度泛化视角,探讨局部序列化视觉模型是否比全局模型有根本计算优势。初步结论:局部模型在长度外推任务上有优势,且更生物合理。
- 洞察: 对长视频理解、长轨迹Agent观测建模有启发;局部采样可能是突破长上下文窗口限制的另类思路。
4. LongStraw: Long-Context RL Beyond 2M Tokens under Fixed GPU Budget
- 来源: arXiv · 2026-07-16(补充收录,前次简报已发)
- 标签:
agentlong-contextbenchmarksystems - 核心: RL post-training受困于256K,但Agent长轨迹(observation、tool output、历史决策)需要百万token级上下文。LongStraw用GRPO共享prompt免autograd、固定GPU预算下执行百万token RL训练栈。
- 洞察: 补发原因:这是目前最完整的"推理上下文百万token vs 训练上下文256K"gap的系统性解决方案,Agent长程记忆训练方向必读。
📋 候选论文(全部8条)
| # | 标题 | 来源 | 日期 | 标签 | 亮点 |
|---|---|---|---|---|---|
| 1 | RxBrain (Hy-Embodied) | HF Daily | 07-14 | agent/multimodal | 具身认知语言+视觉双通路规划 |
| 2 | HDR | HF Daily | 07-15 | multimodal/systems | 层级去噪多步视觉推理 |
| 3 | Locality & Length Generalization | HF Daily | 07-09 | multimodal/systems | 局部序列化视觉vs全局计算优势 |
| 4 | LongStraw | arXiv | 07-16 | agent/long-context/systems | 百万token RL训练栈 |
| 5 | SUFLECA | HF Daily | 07-15 | systems | CAD-图像9D姿态零样本对齐 |
| 6 | Chat2Scenic | arXiv | 07-14 | agent/rag/benchmark/systems | 迭代RAG生成自动驾驶DSL |
| 7 | Digital Pantheon | arXiv | 07-16 | agent/rag/benchmark | DPO+RAG多智能体联盟博弈 |
| 8 | Rethinking Harness Evolution | arXiv | 07-13 | agent/benchmark/systems | Agent评测协议批判 |
🧭 行业风向标(轻量补充)
Substack 线索(非深度检索,仅本期候选关联补充): - 本轮8条候选中,Agent+RAG相关共5条(RxBrain、Chat2Scenic、Digital Pantheon、LongStraw、Rethinking Harness),仍是主流研究方向;多模态具身和视觉推理新增4条,反映近期HF策展热点偏移至视觉-语言联合范式。 - 0816前次Substack报告(LLM Context 2026路由指南)核心结论不变:RAG与Long Context非竞争,路由层决定最优路径。
📁 产出信息
- candidates JSON:
/shared/research-kb/inbox/tom/_candidates/2026-07-19-agent-rag-longcontext-candidates.json - 高价值: 4/8 条
- Substack 引用: 无新增深度检索,继承0816结论
- CSDN 使用: 无
- 执行耗时: ~6 min