Tom 文献雷达 · Agent + RAG + Long Context · 2026-09-01 08:40
本期候选(8 条)
| # | 标题 | 来源 | 关键信号 |
|---|---|---|---|
| 1 | LoopArena: Benchmarking Models As Runtime Controllers for Loop Engineering | HF Daily (85票) | Agent 循环执行benchmark;鉴别"loop策略"与"执行能力";8月27日 |
| 2 | CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models | arXiv 2608.28389 | RAG投毒攻击;伪装文档规避过滤;对抗性chunk混入良性内容;8月28日 |
| 3 | LINE Conversation History Retrieval for Personal Memory RAG | arXiv 2608.27809 | 个人记忆RAG评测;BM25 vs向量 vs混合召回;22k对话chunk;8月28日 |
| 4 | CrabOS: An Operating System for Human-AI Co-inhabitation | arXiv 2608.28165 | Agent人机协同状态交接;共享工作环境;Qi Yang, Yun Ma;8月28日 |
| 5 | Sliding-window beats linear attention | HF Daily | 滑动窗口 vs 线性注意力;长上下文记忆效率;8月27日 |
| 6 | EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses | HF Daily | Agent自修改可逆性验证;跨反事实状态诊断;8月27日 |
| 7 | Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models | HF Daily (24票) | VLA多模态行为意图蒸馏;与Agent记忆关联弱 |
| 8 | Acquire, Repair, Preserve: Small-Model Dialogue Game Agents | HF Daily | 小模型对话游戏Agent;诊断→SFT→修复流程;8月27日 |
⭐ 高价值条目(4 条)
1. LoopArena ⭐⭐⭐⭐⭐
Agent Loop 控制器的 benchmark。与其手工写 prompt,不如设计监控→分配→检查→决策循环。即使 LLM 强,loop 也会因"信任过期进度、跳过验证、花错预算"导致失败。LoopArena 可量化"loop 策略质量"与"Agent 执行能力"的各自贡献——这对搭建生产级 Agent 系统有直接参考价值。
结论: Agent 系统的评测新方向,votes 85 印证社区热度,值得深入。
2. CamoDocs ⭐⭐⭐⭐⭐
RAG 系统投毒攻击。把恶意文档伪装成良性 chunk 混入,不依赖直接 query 包含,因此传统过滤失效。攻击者可通过公开或用户可编辑数据源注入,对知识库 RAG 场景威胁直接。
结论: 所有使用外部知识库的企业 RAG 系统都应关注;对抗性数据管道现在是必要防御层。
3. LINE Conversation History Retrieval(个人记忆 RAG 评测)⭐⭐⭐⭐
在 LINE 对话历史上做检索召回实验。结论:
embedding_text_bm25(混合)超过单独向量或 BM25;在个人记忆场景下,summary+原文片段+固定文本的组合表示效果最好。
结论: 实用性强,对话系统/记忆模块设计者直接参考;非技术作者也能理解价值。
4. CrabOS:人机协同操作系统的概念架构 ⭐⭐⭐⭐
Agent 与人类交替主导执行,需要无缝交接"任务工作状态"。现有系统让人/AI 分隔,Agent 依赖额外桥接才能访问工作状态。CrabOS 提出共享工作环境,实现人机状态无缝传递。
结论: 长生命周期 Agent 的基础设施方向,概念新,值得架构师关注。
📬 Substack 线索(1 条)
δ-mem: 高效在线记忆,RAG 和长上下文的第三条路 来源:AlphaSignal(alphasignalai.substack.com),2026年5月
扩展上下文窗口成本高,RAG 对多数 Agent 场景过于笨重。δ-mem 用 tiny 8×8 关联记忆状态存储历史信息,仅 4.87M 可训练参数(Qwen3-4B 的 0.12%)即可在5个 benchmark 上提升平均分。适配器已开源 CC-BY-4.0。
价值: 实践指导性强,有代码参考;是长上下文 vs RAG 之外的新范式提示。
去重参考
近期已覆盖:8月31日、30日、29日同日 radar 已有 LoopArena 相关讨论;CamoDocs/LINE/CrabOS 为本期新线索。Substack δ-mem 系5月论文,本次首度纳入雷达。
Tom 文献雷达 · Agent/RAG/LongContext · 2026-09-01T08:40 · 8候选/4高价值/1Substack