Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-10-06

本期概况

  • 检索来源:arXiv metadata + HF Daily
  • 候选总数:8 条
  • 高价值:4 条
  • Substack:用了 1 条(综合分析,未用 CSDN)
  • 生成时间:2026-10-06 08:40 (CST)

🔴 高价值

1. The Extender: Log-Structured Transformer

  • 来源: arXiv 2026-09-25
  • 链接: https://arxiv.org/abs/2609.32759
  • 核心: 标准 Transformer 每层通过残差 h 传递信息;Extender 新增拼接通道 x,每层输出一个微小 extension ε appended to x。KV 投影只看 x,残差路径和 KV 路径解耦。2Ld_model → 显著降低持久注意力内存占用
  • 标签: memory / efficiency / long-context
  • 判断: 长上下文工程层面直接相关——内存效率是 10M Token 落地的核心瓶颈之一,Log-Structured 设计思路值得关注

2. Self-Supervised Scaling of Terminal Environments for Scientific Domains

  • 来源: HF Daily 2026-10-01
  • 链接: https://arxiv.org/abs/2610.02710
  • 核心: 软件 in-the-loop 重构,自动从现有工作流获取参考输出和验证目标,无需人工标注。终端 Agent 扩展到科学领域的关键瓶颈是环境和验证器构建,该工作用程序执行自动解决
  • 标签: agent / systems / environment
  • 判断: Agent 落地科学领域的范式级进展——绕过人工标注直接复用现有软件工作流做自监督

3. World Embedding Benchmark

  • 来源: arXiv 2026-10-02
  • 链接: http://arxiv.org/abs/2610.03632v1
  • 核心: 评估视频表征对物理信息的编码能力,8000 仿真案例覆盖流体力学/固体力学/动力学/光电,支撑 text-video retrieval / physical-property regression / multiple-choice 三个任务
  • 标签: rag / benchmark / multimodal
  • 判断: RAG 领域对多模态物理世界知识库的新 Benchmark;物理标注丰富,可作为 world-model + RAG 融合方向的数据基础

4. 4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes

  • 来源: HF Daily 2026-10-01
  • 链接: https://arxiv.org/abs/2610.03715
  • 核心: Agent 从视频重建动态场景为可执行图形程序,需实现物理模拟(形变/流体/断裂)来复现复杂行为;benchmark 包含真实视频和合成场景
  • 标签: agent / benchmark / multimodal
  • 判断: Agent 评测的新方向——超越文本代码生成,考察视觉→结构化表征→物理仿真→可执行程序的全链路

🟡 一般候选

5. JEPA-TTT: Persistent Test-Time Training of Latent World Models

  • 来源: arXiv 2026-09-29
  • 核心: 测试时自适应,累积 self-supervised 更新,视觉编码器冻结保表征,dense replay 支撑规划无需在线奖励
  • 标签: agent

6. WM-VLM: Probing Internal World Models for Interleaved Visual-Textual Reasoning

  • 来源: arXiv 2026-09-27
  • 核心: VLM + lightweight world model 分支生成中间视觉状态,两阶段训练让模型学会用视觉状态而非纯语言做空间推理
  • 标签: multimodal / reasoning

7. EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras

  • 来源: HF Daily 2026-10-01
  • 核心: 仅需单台立体相机,active visual fixation 层次化策略(低层 gaze servoing + 上层任务规划)
  • 标签: multimodal / robotics

8. Tail-Influence Sampling for CVaR Policy Evaluation

  • 来源: HF Daily 2026-09-28
  • 核心: 稀有 failure 场景下策略评估的采样效率优化,推导 tail-influence 聚合每条件分量不确定性
  • 标签: benchmark / evaluation

📡 行业动态(Substack 综合)

RAG vs Long Context 2026 共识框架(综合 atlan.com / digitalapplied.com): - 10M Token 时代:RAG 用于 latency-critical 和频繁更新的语料;Long-context 用于单文档内全量覆盖推理 - 前端延迟 <2s:RAG 或 warm cache 长上下文;2-10s:冷长上下文 + 缓存;>10s:批处理场景才适合冷长上下文 - 500K effective reasoning quality 即使窗口声称 1M,实际推理质量仍需优化 - MCP(Model Context Protocol)成为 enterprise 数据图谱接入标准 - 实际企业 AI 栈:RAG + MCP + 长上下文三者协同,非替代关系


Tom 文献雷达 · 每工作日 3 次 · 高频雷达模式 candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-10-06-agent-rag-longcontext-candidates.json