Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-16 08:40 UTC
本期高价值条目(4条)
1. CiteGuard-RAG: Validation-Centered RAG 系统
来源: arXiv (2026-09-14) | 标签: rag benchmark systems
核心: 混合语义-词汇检索 + 引用约束生成 + 句子级验证 + 单次重生成。运行时判断答案是否应被接受/拒绝/重生成,再交付。400题评估,覆盖引用有效性和适当拒答。
为何高价值: RAG 领域长期缺少数句级别引用验证的端到端方案;CiteGuard 填补了这一空白,且验证模块可独立复用。
2. Agentic Visual RAG:稀疏证据导航
来源: arXiv (2026-09-14) | 标签: agent rag benchmark
核心: 解决视觉文档中答案相关证据稀疏且分散的问题;提出显式上下文选择与整合机制,而非依赖原始探索轨迹或压缩记忆。减少答案对分散视觉证据的脆弱性。
为何高价值: 视觉 RAG 是多模态 Agent 落地的关键瓶颈;本文直接面对稀疏性挑战,方法可迁移到文档智能、图表问答等场景。
3. Root-Cause Attribution Is a Search Problem: 长程 Agent 失败根因搜索
来源: arXiv (2026-09-10) | 标签: agent
核心: 大规模 Agent 执行日志中人工审查不现实;LLM 自动归因精度低,因为根因信息稀疏、分散且与可见失败断开连接。本文将 RCA 建模为持续搜索问题,而非一次性生成。
为何高价值: 随着 Agent 生产部署增多,故障诊断成为刚需;搜索框架思路比端到端生成更符合工程实际。
4. δ-mem:RAG 与 Long Context 之外的第三记忆路径
来源: AlphaSignal Substack · 2026-05 | 标签: agent memory
核心: 延伸上下文代价高但模型并不一定真正用好历史;δ-mem 用 tiny 8×8 关联记忆状态存储过去信息,在 Qwen3-4B-Instruct 上仅 4.87M 可训练参数(模型 0.12%)将 5 个 benchmark 均分从 46.79% 提至 51.66%。
为何高价值: 为 Agent 记忆提供了一个轻量、高效、即插即用的新范式;与 RAG 和 Long Context 形成三足鼎立,对工业落地极具参考价值。
候选条目(4条)
-
Orthrus 投机解码精度验证 | HF Daily · 2026-09-13 | systems
BF16 下精确轨迹匹配仅 45%/43%(作者 checkpoint 及独立复现);对推理系统方向有参考价值。 -
E2A-Bench:金融图表证据-行动可靠性评测 | HF Daily · 2026-09-12 | rag · benchmark · multimodal
969 query,HS300 成分股,评估证据-推理-置信度-行动一致性;金融 RAG 场景的细粒度评测基准。 -
Thought without Systematicity:推理模型规则归纳评测 | HF Daily · 2026-09-11 | benchmark · systems
认知科学规则归纳任务变体测试推理模型系统性,发现当前模型在结构等价变体上表现不一致。 -
Dynin-Robotics:全模态统一扩散 VLA 模型 | HF Daily · 2026-09-10 | multimodal
视觉目标+动力学联合预测驱动机器人策略,轨迹模型统一动作生成与选择;多模态 Agent 基础模型方向。
去重说明
- 本期 arXiv 新鲜度高(9/10-9/14),与 9/14、9/15 雷达无重叠
- CiteGuard-RAG 和 Agentic Visual RAG 为 9/14 新发表,本期首次覆盖
- δ-mem 为 Substack 回顾性策展,与纯 arXiv 候选互补
Tom · 2026-09-16T08:40 UTC · agent-rag-longcontext · 8 candidates · 高价值 4 条 · Substack 1 条 · 无 CSDN