Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-08-06 20:40
候选概览(8 条,含去重)
| # | 来源 | 标题 | 票/信号 |
|---|---|---|---|
| 1 | HF Daily | ABSeeker: 搜索 Agent 答案回溯信用分配 | 49 |
| 2 | HF Daily | GDPevo: 企业真实业务任务 Agent 自进化评测 | 19 |
| 3 | HF Daily | FocusMem: 潜在 GUI 记忆的内容/读取/信任分解 | 8 |
| 4 | HF Daily | PIMiner: Agent 自动提示注入红队 | 5 |
| 5 | HF Daily | AVE-Compass: 音视频协同编辑评测(含复检更新: 14票) | 14 |
| 6 | HF Daily | Consistency-Driven Co-Evolution 跨模态图表代码 | 4 |
| 7 | HF Daily | DRIFT: Flow-Matching VLA 对抗补丁攻击 | 1 |
| 8 | arXiv | Teaching Nemotron Greek: RAG 非拉丁语系适应(已见,14:40) | — |
🔴 高价值条目(3 条)
1. ABSeeker: 搜索 Agent 的答案回溯信用分配
来源: HF Daily · 2026-08-04 · tags: agent, multimodal
链接: https://arxiv.org/abs/2608.05102
票: 49(本日最高)
摘要: 长时域搜索 Agent 需执行多步搜索→检索→验证→整合,现有 SFT/RL 对所有步骤一视同仁,无法区分有效动作和冗余/错误动作。ABSeeker 提出 ABC(Answer-Backtracked Credit Assignment):将稀疏的轨迹级回报转化为稠密的步骤级监督信号,针对性奖励正确搜索决策。直接解决 Agent 多步推理中的信用分配难题,工程可复现性强。
2. GDPevo: 基于真实企业工作流的 Agent 自进化评测基准
来源: HF Daily · 2026-08-03 · tags: agent, rag, benchmark
链接: https://arxiv.org/abs/2608.03764
票: 19
摘要: Agent 自进化(从历史经验更新持久状态并复用于新任务)是重要方向,但现有评测基准覆盖经济价值场景不足、训练/测试任务设计难以归因到训练经验、易受数据污染影响。GDPevo 提出 rule hybridization 机制,在 GDP 相关企业工作流上构建 evolution-native 评测,填补了 Agent 自进化专项评测的空白,对 RAG + 长期记忆方向有直接参考价值。
3. FocusMem: 潜在 GUI 记忆的内容 / 读取 / 信任三维分解
来源: HF Daily · 2026-08-04 · tags: agent, memory, multimodal
链接: https://arxiv.org/abs/2608.04530
票: 8
摘要: GUI Agent 需同时记住历史任务经验和当前交互中的未完成进度。现有潜在记忆方法将每条轨迹映射为单一固定块、以 next-action 监督为主,导致压缩丢细节、固定块服务不同决策阶段、不相关检索轨迹误导 Agent 三类问题。FocusMem 将内容、读取、信任三层职责分离,对多模态 Agent 记忆架构设计有重要参考价值(尤其 GUI / 浏览器 Agent 场景)。
📌 快速判断
- Agent 多步推理信用分配: ABSeeker(ABC 框架,高票,工程可复现)
- Agent 自进化评测: GDPevo(企业工作流,rule hybridization)
- 多模态 Agent 记忆: FocusMem(内容/读取/信任分离)
- RAG vs 长上下文: 成本数据更新——RAG 单次查询约 $0.00008,long-context 约 $0.10(1250×差距),延迟 1s vs 45s;mid-2026 主流共识:混合架构最优,检索收窄上下文后再用长窗口推理
📦 Substack / 非arXiv 补充
| 来源 | 标题 | 关键信号 |
|---|---|---|
| Wire Blog | RAG vs Long Context: 2026 数据实测 | RAG 1250× 更便宜;长上下文中间信息丢失 30%+ 准确率;混合方案是生产级最优解 |
| Atlan/EITT | Context Engineering 企业指南 2026 | GraphRAG 在多跳推理有效但依赖图质量;生产 RAG = 多 Agent 共享治理上下文 |
Tom 文献雷达 · 每日 3 次 · 轻量模式 · 2026-08-06T20:40 CST