Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-07-28 20:40 UTC

概览

  • 主题:Agent + RAG + 长上下文 + 检索评测
  • 来源:HuggingFace Daily(arXiv 本轮因 429/超时未富化)
  • Substack:沿用 14:40 已发线索(见末节),本轮不重复展开
  • 去重:已对照 0840 和 1440 场次,避开已发布条目

★ 高价值条目(3 条)

1. Physics of Multi-Turn Long-Horizon Planning:从预训练到 Agentic 蒸馏的统一框架

  • 来源: arXiv 2607.24720 / HF Daily(2026-07-26)
  • 核心: 在可控多轮环境中系统研究规划能力在预训练阶段如何获得(数据格式/分布/质量),以及单/多教师蒸馏路径。显式世界模型 + CoT 状态转移建模
  • 为何高价值: 规划能力是 Agent 核心,但现有模型训练数据不可控、来源不透明。本文提供可重复的实验框架;多教师蒸馏对生产 Agent 训练有直接参考价值
  • 标签: agent systems
  • 链接: https://arxiv.org/abs/2607.24720

2. Reasoning Denoiser:去噪长推理轨迹以检测 LRMs 幻觉

  • 来源: arXiv 2607.22098 / HF Daily(2026-07-23)
  • 核心: LRMs 长推理轨迹中两类噪声(无关步骤 + 重复步骤)显著损害幻觉检测准确率;现有置信度评分和朴素 embedding 过滤均无法有效分离噪声;提出专用去噪器
  • 为何高价值: 幻觉检测是 Agent 部署质量保障的核心能力;长推理链中噪声识别能力直接影响 RAG 系统的自我修正可靠性
  • 标签: benchmark agent
  • 链接: https://arxiv.org/abs/2607.22098

3. Codifying the Judge:通过程序蒸馏实现可扩展评测

  • 来源: arXiv 2607.22561 / HF Daily(2026-05-28)
  • 核心: LLM-as-a-judge 成本高、延迟大、决策不透明;将判断逻辑蒸馏为程序化评判程序(PAJAMA 系统),消除 per-sample API 调用成本
  • 为何高价值: 评测成本是 Agent 迭代效率的瓶颈;透明、可编辑的程序化评判可降低 RAG/Agent 系统评测门槛,适合内部知识库团队自建
  • 标签: benchmark systems
  • 链接: https://arxiv.org/abs/2607.22561

📋 候选条目(5 条)

# 标题 关键点 标签
4 Sol-Attn:视频生成中动态稀疏注意力加速 无需训练的 KV 块稀疏注意力; Diffusion Transformer 推理瓶颈优化 multimodal systems
5 Evidence Attribution 无坐标版 视觉文档理解中坐标接口的局限性;CiteVQA 双语验证集 benchmark multimodal
6 Chamaileon:跨靶点多状态蛋白binder设计 统一多靶点多状态binder设计;与本轮主题交弱 research
7 IndicTalk:18种印度语言大规模对话语料 130万+ 混合代码对话;非本主题直接相关 research
8 Characterizing Warp Divergence Pascal→Blackwell GPU warp分歧跨代研究;硬件层,非Agent相关 benchmark

🔍 Substack 线索(沿用 14:40,已发布不重复)

Designing Agentic Memory in 2026 — The Nuanced Perspective 五大认知记忆类型分类 + 记忆投毒攻击(>90% Agent 易感);核心结论:存储/检索/更新/丢弃均属架构决策 https://thenuancedperspective.substack.com/p/designing-agentic-memory-in-2026


本期小结

维度 数值
候选总数 8
高价值 3
HF Daily 来源 8 篇(arXiv 本轮未富化)
Substack 沿用 14:40(1 条)
CSDN 未使用

Tom 文献雷达 · 轻量模式 · 2026-07-28 20:40 UTC