Tom 文献雷达 · Agent RAG LongContext · 2026-09-26 20:40
本期概览
候选来源:HF Daily(arXiv 406 限流,部分查询降级)| 补强:Substack web search
🔥 高价值(3 条)
1. Coding Agents for Generalized TAMP Problems
- 来源: arXiv 2609.30233 | HF 8票
- 内容: 任务与运动规划(TAMP)问题中,离散决策与几何/运动约束高度耦合。现有方法需要大量 TAMP 特化工程。本文探究编码 Agent 能否通过合成跨实例泛化的程序来自动化这一过程。
- 关联标签:
agentcodinggeneralization - 点评: Agent 从"执行指令"走向"合成规划程序",是 Agentic Coding 的前沿方向。
2. RLCDAlignBench: Jev 模型检测十类对齐失败
- 来源: arXiv 2609.29429 | HF 2票
- 内容: 用 RLCD(强化学习校准决策)训练的 Jev,在单次调用中回答多个问题并给出校准概率。benchmark 测试了谄媚越狱、欺骗、提示注入、幻觉等十类对齐失败检测。
- 关联标签:
benchmarkalignmentagent-safety - 点评: Agent 安全评测从"固定标签分类器"走向"多问题校准概率",思路值得关注。
3. LongMemEval: 长程对话记忆评估
- 来源: Substack(codingwithroby / 2026 AI Agent Stack)
- 内容: 提到 LoCoMo 相关研究《Evaluating Very-Long-Term Conversational Memory of LLM Agents》,以及 Mem0、Letta、Zep 等 Agent 记忆供应商的 benchmark 对比。
- 关联标签:
memorylong-contextbenchmark - 点评: 知识与记忆已拆分为两个独立问题——知识是外部可检索数据,记忆是 Agent 自身状态。RAG 失败瓶颈往往不在向量库本身,而在检索质量(chunk 选择、排序、上下文充分性)。
📚 候选列表(8 条)
| # | 标题 | 来源 | 票/分 | 标签 |
|---|---|---|---|---|
| 1 | Coding Agents for Generalized TAMP | arXiv 2609.30233 | 8 | agent |
| 2 | RGBD20K: 大规模 RGB-D 语义分割 benchmark | arXiv 2609.29028 | 7 | rag, benchmark |
| 3 | Superposition Linearity Hypothesis | arXiv 2609.29845 | 61 | research |
| 4 | Parts-of-Speech as Emergent SAE Categories | arXiv 2609.29362 | 10 | research |
| 5 | RLCDAlignBench: 对齐失败零样本检测 | arXiv 2609.29429 | 2 | benchmark |
| 6 | AV-GRPO: 音视频生成解耦强化学习 | arXiv 2609.29816 | 3 | multimodal |
| 7 | Just Ask Jev: RLCD 校准决策 | arXiv 2609.29429 | 2 | alignment |
| 8 | DeltaWAM: 双臂操作 Delta 世界动作模型 | arXiv 2609.28811 | 2 | multimodal |
📌 Substack 线索(1 条)
Cameron R. Wolfe — "Agent Evaluation: A Detailed Guide" - 引用 Anthropic 2026《Demystifying evals for AI agents》、OpenAI《Evaluation Best Practices》(2026) - 核心:上下文腐烂(context rot)是长程 Agent 的普遍问题;必须主动压缩和精炼上下文内容,不能靠无限 context window 解决。 - 相关:Anthropic《Effective harnesses for long-running agents》(2025)
Ben Lorica — "RAG Reimagined: 5 Breakthroughs" - 来自 Gradient Flow,关注 RAG 架构级突破,适合后续深度追踪。
备注
- arXiv API 本轮遭遇 406 限流,多个查询失败;候选纯依赖 HF Daily 富化数据。
- 整体执行时间约 6 分钟,未触发超时保护。