Tom 文献雷达 · AI Agent × RAG × 长上下文 · 2026-08-31

状态

  • status: completed
  • 主题:AI Agent、RAG、检索、长上下文、评测与新论文
  • 候选总数:8 条
  • 高价值条数:3 条
  • Substack 条目:1 条(轻度使用)

🔴 高价值候选

1. CrabOS: Human-AI 任务交接的操作系统抽象

  • 来源:arXiv 2026-08-28(Qi Yang, Yun Ma)
  • 标签:agent · memory · systems
  • 核心:现有 agent 系统让人类和 AI 在独立工作环境中切换,交接需要开发者构建接口或用户手动复制状态。CrabOS 提出共享工作状态抽象,任务在人与 AI 之间自然流转,无需额外桥接。
  • 观点:这是 human-in-the-loop agent 走向生产部署的关键基础设施问题。不同于"让 AI 更强",它解决的是"人机协作断层"。方向明确,值得追踪。
  • 链接:http://arxiv.org/abs/2608.28165v1

2. StepGuard: Agent 动作级别的安全护栏

  • 来源:HF Daily(arXiv 2026-08-24)
  • 标签:agent · benchmark · multimodal
  • 核心:现有 guardrails 评估已完成轨迹,但 agent 执行单个工具调用前的检查(pre-execution)研究不足。StepGuard 训练可同时做轨迹审计和执行前检查的护栏模型,并提出 StepGen 自动数据引擎生成安全/危险轨迹对。
  • 观点:Agent 安全从"事后审计"向"事中拦截"升级是行业趋势,该工作数据构造方法(相同上下文不同动作)值得参考。
  • 链接:https://arxiv.org/abs/2608.24777

3. Ring Forcing: 长视频生成的精确长期记忆

  • 来源:HF Daily(arXiv 2026-08-26)
  • 标签:long-context · memory · multimodal · systems
  • 核心:视频生成模型的两大长期记忆瓶颈:object permanence(对象重识别)和 memory capacity(超长上下文处理)。Ring Forcing 在自回归视频扩散框架中同时解决两者——强迫模型在环路闭合时精确重建对象外观。
  • 观点:虽然是视频生成方向,但 object permanence 和 long-context memory 的解耦分析框架对通用 LLM 长程记忆设计有参考价值。
  • 链接:https://arxiv.org/abs/2608.26794

🟡 其他候选

4. LayerRecall: 视频 DiT 的状态条件化记忆路由

  • arXiv 2026-08-28 · memory · multimodal · 8 votes
  • 发现视频 DiT 各层对当前/近期/远距上下文偏好不同,提出按层选择性地使用不同范围记忆的路由机制。

5. J-Zero: Challenger-Solver-Judge 三方协同进化

  • HF Daily 2026-08-26 · multimodal · 23 votes
  • 通用领域(不可验证任务)的自进化框架,Judge 参与协同适应,补足了现有自进化研究偏可验证域的短板。

6. EASEL: 灵巧视觉工具使用的 Benchmark

  • HF Daily 2026-08-25 · agent · benchmark · multimodal
  • 评测模型从视觉证据推断工具参数并精确执行的能力,现有 benchmark 缺乏这种"视觉→执行参数→结果精度"的闭环评测。

7. StarHarness: 企业场景的 Agent Harness 自动化演进

  • HF Daily 2026-08-24 · agent · benchmark · 2 votes
  • 不改模型权重,通过演进 harness(prompt/工具接口/子 agent 结构等)提升 ITBench SRE、EnterpriseOps-Gym 等企业 benchmark 性能。

8. Revisiting Local Context: 流式 3D 重建的局部记忆设计

  • HF Daily 2026-08-26 · memory · multimodal · systems · 16 votes
  • ABot-Recon:将预测目标设计为与序列长度无关的量,从而在有限内存下实现稳定的长程 3D 重建,局部状态设计思路值得关注。

📬 Substack 线索

Context Engineering 指南(Substack,Joud Awad)

  • 核心观点:Prompt engineering = 告诉模型说什么;Context engineering = 模型开口前看到什么。两者维度不同,混淆导致系统 demo 强、上线弱。
  • 长期对话是 context window 的定时炸弹:压缩(compression)是解法,类比 OS 内存管理。
  • Agentic RAG 流程:用户查询触发跨长期记忆(情景/语义/程序)的检索,这是 agentic RAG 层在主动决定"什么值得拉入"。
  • 链接:https://joudawad.substack.com/p/context-engineering-guide-ai-agents

去重备注

本轮候选与近 7 日已有的高价值条目(J-Zero 23票已出现、StepGuard、Ring Forcing 系新出)无重复。


Generated by Tom · 2026-08-31T14:40 CST · candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-08-31-agent-rag-longcontext-candidates.json