Tom 文献雷达 · Agent RAG LongContext · 2026-09-26 20:40

本期概览

候选来源:HF Daily(arXiv 406 限流,部分查询降级)| 补强:Substack web search


🔥 高价值(3 条)

1. Coding Agents for Generalized TAMP Problems

  • 来源: arXiv 2609.30233 | HF 8票
  • 内容: 任务与运动规划(TAMP)问题中,离散决策与几何/运动约束高度耦合。现有方法需要大量 TAMP 特化工程。本文探究编码 Agent 能否通过合成跨实例泛化的程序来自动化这一过程。
  • 关联标签: agent coding generalization
  • 点评: Agent 从"执行指令"走向"合成规划程序",是 Agentic Coding 的前沿方向。

2. RLCDAlignBench: Jev 模型检测十类对齐失败

  • 来源: arXiv 2609.29429 | HF 2票
  • 内容: 用 RLCD(强化学习校准决策)训练的 Jev,在单次调用中回答多个问题并给出校准概率。benchmark 测试了谄媚越狱、欺骗、提示注入、幻觉等十类对齐失败检测。
  • 关联标签: benchmark alignment agent-safety
  • 点评: Agent 安全评测从"固定标签分类器"走向"多问题校准概率",思路值得关注。

3. LongMemEval: 长程对话记忆评估

  • 来源: Substack(codingwithroby / 2026 AI Agent Stack)
  • 内容: 提到 LoCoMo 相关研究《Evaluating Very-Long-Term Conversational Memory of LLM Agents》,以及 Mem0、Letta、Zep 等 Agent 记忆供应商的 benchmark 对比。
  • 关联标签: memory long-context benchmark
  • 点评: 知识与记忆已拆分为两个独立问题——知识是外部可检索数据,记忆是 Agent 自身状态。RAG 失败瓶颈往往不在向量库本身,而在检索质量(chunk 选择、排序、上下文充分性)。

📚 候选列表(8 条)

# 标题 来源 票/分 标签
1 Coding Agents for Generalized TAMP arXiv 2609.30233 8 agent
2 RGBD20K: 大规模 RGB-D 语义分割 benchmark arXiv 2609.29028 7 rag, benchmark
3 Superposition Linearity Hypothesis arXiv 2609.29845 61 research
4 Parts-of-Speech as Emergent SAE Categories arXiv 2609.29362 10 research
5 RLCDAlignBench: 对齐失败零样本检测 arXiv 2609.29429 2 benchmark
6 AV-GRPO: 音视频生成解耦强化学习 arXiv 2609.29816 3 multimodal
7 Just Ask Jev: RLCD 校准决策 arXiv 2609.29429 2 alignment
8 DeltaWAM: 双臂操作 Delta 世界动作模型 arXiv 2609.28811 2 multimodal

📌 Substack 线索(1 条)

Cameron R. Wolfe — "Agent Evaluation: A Detailed Guide" - 引用 Anthropic 2026《Demystifying evals for AI agents》、OpenAI《Evaluation Best Practices》(2026) - 核心:上下文腐烂(context rot)是长程 Agent 的普遍问题;必须主动压缩和精炼上下文内容,不能靠无限 context window 解决。 - 相关:Anthropic《Effective harnesses for long-running agents》(2025)

Ben Lorica — "RAG Reimagined: 5 Breakthroughs" - 来自 Gradient Flow,关注 RAG 架构级突破,适合后续深度追踪。


备注

  • arXiv API 本轮遭遇 406 限流,多个查询失败;候选纯依赖 HF Daily 富化数据。
  • 整体执行时间约 6 分钟,未触发超时保护。