Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-10
本次轮次:第 13 次 · 轻量版 · 候选 8 条来自 candidates JSON | 高价值:3 条 | Substack:0 | CSDN:0 candidates JSON:
/shared/research-kb/inbox/tom/_candidates/2026-07-10-agent-rag-longcontext-candidates.json(8/8 命中,providers: arxiv + HF)
🔴 高价值(3 条)
1. UniClawBench:能力驱动的主动 Agent 通用基准(arXiv:2607.08768v1)⭐
核心:现有 Agent 基准混在一起了不同能力维度,难定位失败根因。UniClawBench 首次提出 capability-driven 任务分类 + 真实世界多轮评估,填补主动 Agent(能主动操作工具、规划执行)评估空白。
工程价值:① 评估维度拆解比"总分"更有排障价值;② 多轮 + 真实工具集比单轮沙盒更接近工业场景;③ 对比 OSWorld 等现有基准的核心差异在于"主动性"建模。
引用信号:2026-07-09 发布,votes=8
📎 http://arxiv.org/abs/2607.08768v1
2. Token-Flow Firewall:持久化 AI Agent 的语义运行时审计(arXiv:2607.08395v1)⭐
核心:持久 Agent 的不安全内容可通过"记忆更新 / 工具参数 / 文件读取 / 组件通信"等 token 流传播,攻击面远大于单轮对话。Token-Flow Firewall 把"语义审计"建模为 token 级别的"流量防火墙"。
工程价值:① 记忆注入攻击是生产 Agent 的高危漏洞——这篇给出系统性防御框架;② 标注了 token 流传播路径,可做定向安全测试;③ 对长期记忆架构(向量库 / 知识图谱)有直接参考价值。
引用信号:2026-07-09 发布
📎 http://arxiv.org/abs/2607.08395v1
3. Context Access Divide:交互层面的 Agentic Inequality 新维度(arXiv:2607.08495v1)⭐
核心:现有"availability / quality / quantity"三维不等框架,缺少交互层面的细粒度维度。两个用户即便 Agent 访问能力相当,能否"自主检索上下文"(Dynamic Context Retrieval)vs "手动提供上下文"会带来质的体验差。论文把这个交互粒度的差距定义为 Context Access Divide。
工程价值:① RAG 即民主化工具——DCR(动态上下文检索)能力是 Agent 效用的核心分水岭;② 对 Agent 产品设计有评测框架意义——不能只看"能不能用",还要看"上下文获取自动化程度";③ 与 UniClawBench 的 capability-driven 视角互补。
引用信号:2026-07-09 发布
📎 http://arxiv.org/abs/2607.08495v1
🟡 一般候选(5 条)
4. PolyUQuest:异构图结构感知 Web RAG(arXiv:2607.08269v1) HTML 页面内 DOM 层级 + 页面间超链接拓扑 + 跨页面实体关系统一建模为异构图;双层路由器分发查询到三种检索模式;答案可溯源。→ Web RAG 结构化检索新路线,votes=4。 📎 http://arxiv.org/abs/2607.08269v1
5. Conversational RAG for Historical Archives(arXiv:2607.08459v1) 历史档案数字图书馆的会话式 RAG;支持专家知识和档案记录的动态融合;超越单条记录的提取式问答,趋向整体文档集的理解。 📎 http://arxiv.org/abs/2607.08459v1
6. CineMobile:端侧图像转电影级运动生成(HF,2026-07-03) 蒸馏 + 剪枝压缩 DiT 模型,实现移动端 bullet time / dolly zoom / 慢动作生成。与 RAG 相关性弱,仅作为多模态生成侧参考。 📎 https://arxiv.org/abs/2607.03803
7. Video-Oasis:视频理解基准审计工具(HF,2026-07-01,votes=35) 55% 现有视频理解基准存在可修复缺陷;可持续诊断套件而非新基准。→ 多模态 benchmark 元评测视角,高票但与 Agent/RAG 直接相关性低。 📎 https://arxiv.org/abs/2603.29616
8. Object-Driven Shortcuts in Zero-Shot Action Recognition(HF,2026-07-01,votes=33) 模型通过物体类别预测动作而非时序证据;稀疏组合监督导致 shortcut 学习。对 RAG/Agent 暂无直接价值,视频动作识别参考。 📎 https://arxiv.org/abs/2601.16211
📌 Tom 简评(本次轻量版)
本日 arXiv 新发密集,3 篇同日(7-9)论文均与 Agent 评测/安全/上下文架构高度相关,信号较强。
- Agent 评测正在从"沙盒单轮"走向"真实世界多轮 + 能力维度拆解"(UniClawBench)
- 持久 Agent 安全是 2026 H2 新兴方向,Token-Flow Firewall 填补了"token 流级"审计框架空白
- Agentic Inequality研究开始出现细粒度维度(Context Access Divide vs 原有三维),RAG 普及度是关键分水岭
Tom 文献雷达 · 2026-07-10 14:40 · agent-rag-longcontext