Tom 文献雷达 · Agent + RAG + Long Context · 2026-09-23
候选摘要(8 条)
| # | 来源 | 标题 | 标签 |
|---|---|---|---|
| 1 | HF Daily | ACLArena: Agent Continue Learning in Multi-stage Post-training | agent, benchmark |
| 2 | HF Daily | SkillSpec: Intent-Masked Specification Reasoning for Agent Skill Correctness | agent, systems |
| 3 | HF Daily | The Functionalizer: Lossless Functional Decomposition for Subword Tokenization | rag |
| 4 | HF Daily | Towards Full Pipeline FP8 Reinforcement Learning for LLMs | agent, systems |
| 5 | HF Daily | A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal | benchmark |
| 6 | HF Daily | Realtime-Venus: Full-Duplex Audio-Visual Interaction System | multimodal, systems |
| 7 | HF Daily | UltraTex: 2K Multi-View Diffusion for 3D Texturing | memory, systems |
| 8 | HF Daily | TAPe+ML: Compact Structured Representation for Multi-Task Computer Vision | multimodal, systems |
⭐ 高价值条目(3 条)
1. ACLArena — Agent 持续学习评测新框架
- 链接: https://arxiv.org/abs/2609.23989
- 核心: 提出 ACLArena 框架,系统研究 Agent 持续学习(ACL)中遗忘与泛化的权衡,建立分段训练 pipeline,从模型级和 token 级两个视角解释机制。
- 价值: ACL 是工业 Agent 部署的核心难题,此前缺乏统一评测方案。此工作填补了 agent-training 阶段持续学习 benchmark 的空白,对构建可持续演进的通用 agent 系统有直接参考价值。
- Votes: 8
2. SkillSpec — Agent Skill 正确性的形式化验证框架
- 链接: https://arxiv.org/abs/2609.06052
- 核心: 用 Hoare-style 框架将 skill 正确性形式化为规格推理,检测意图冲突(intent conflicts)等常规代码测试无法发现的语义错误,聚焦任务边界和泛化性。
- 价值: 随着 agent 系统依赖可复用 skill 抽象,如何验证其正确性成为工程瓶颈。SkillSpec 提供了语义层面的验证思路,适合用于 agent 系统的质量保障流程设计。
- Votes: 4
3. RAG vs Long Context — 2026 融合趋势分析
- 来源: commandcode.ai · 非正式综述(Substack 参考源)
- 核心论点: 两者不是对立关系,工业级 agent 系统正在走向「RAG 检索 + 大上下文窗口推理」的混合架构;检索质量(chunking / ranking)仍是决定 RAG 效果的关键瓶颈,而非向量数据库本身。
- 价值: 为当前 RAG 实践者提供了清晰的架构选型参考:不必在 RAG 和长上下文之间二选一,应将检索视为 eval 问题而非基础设施问题。
简评
本日候选以 HF Daily 为主,arXiv API 出现批量 406 错误导致传统检索渠道受限。亮点在于 ACL 持续学习评测和SkillSpec 形式化验证两条脉络,均指向 agent 工程化的核心缺口:如何在多阶段训练中保持能力,如何确保 skill 抽象的正确性。RAG 与长上下文的混合架构讨论进一步印证了这一方向——未来系统需要更好的编排层(orchestration),而非单纯扩大 context window。
本次检索: HF Daily (8条) · Substack补充1条 · CSDN 未使用
原始 JSON:/shared/research-kb/inbox/tom/_candidates/2026-09-23-agent-rag-longcontext-candidates.json