Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-03 14:40 UTC

概览

  • 主题:agent-rag-longcontext
  • 来源:arXiv + Hugging Face Daily(2026-07-27 ~ 07-31)
  • 候选总数:8 条
  • 高价值:3 条
  • Substack:✅ 已使用(1 条);CSDN:未使用

⭐ 高价值条目

1. HyPE: Hypothetical Prompt Embeddings(arXiv,2026-07-31)

  • 方向:RAG 查询-文档风格对齐
  • 核心:HyDE 在 query 时生成假设文档,引入额外推理开销;HyPE 将假设文档生成前移到索引构建阶段,用 query embedding 空间的对齐替代查询时生成。直接对齐 query 与文档语义分布,减少检索噪声。
  • 意义:RAG 的 query-doc 风格 gap 是长期痛点,HyPE 在索引时预计算对齐,有望成为新标配
  • 标签:#rag #retrieval #embedding
  • 链接:http://arxiv.org/abs/2607.29402v1

2. ExtractBench: Schema-Guided Enterprise Document Extraction Benchmark(HF Daily,2026-07-30,13票)

  • 方向:Agent 评测 + 企业文档提取
  • 核心:首个同时评测值准确率、记录完整率、溯源(grounding)和成本的 benchmark;370 企业文档、8 领域、67 种文档类型;可扩展 schema 支持自定义抽取目标。
  • 意义:企业 RAG/Agent 场景的真实评测基准,填补了"有 schema 约束的 agent 提取"无统一评测的空白
  • 标签:#agent #benchmark #rag #enterprise
  • 链接:https://arxiv.org/abs/2607.29677

3. CrossRAG: Retrieval-Augmented Time Series Forecasting with RAG(arXiv,2026-07-31)

  • 方向:RAG + 时序预测
  • 核心:时序 Foundation Model 依赖静态参数知识,缺乏动态外部历史模式;CrossRAG 在推理时检索相似历史模式,解决异构时序数据的量级差异和历史相似性≠未来一致性错配问题。
  • 意义:RAG 扩展到时序推理的新范式,检索不再只服务文本
  • 标签:#rag #time-series #foundation-model
  • 链接:http://arxiv.org/abs/2607.29459v1

📋 其他候选

# 标题 来源 关键点
4 QQWorld: Quantile-Quantile Matching for World Model(HF,07-29,22票) EP 损失的尾样本梯度消失问题;QQWorld 用分位数对齐替代;Agent 规划能力相关
5 Enhancing Rubric-based RL via Self-Distillation(HF,07-20,13票) RL 在未探索准则上无优化信号;自蒸馏缓解 train-inference mismatch
6 Evaluation-Verification Reward for Multi-Reference Image Editing(HF,07-30,11票) 多参考图像编辑的 MLLM 幻觉问题;评测-验证双阶段 reward
7 Scaling Properties of Text Conditioning in Visual Generation(HF,07-30,20票) diffusion loss 与提示结构化程度线性相关;白盒/黑盒双度量(GPG/ED)
8 Meshy T2: Native Mesh Generation with Flow Matching(HF,07-27,23票) 流匹配替代序列化自回归;单 token 每顶点连续隐变量

💡 本周趋势小结

RAG 从文本向多模态/时序扩散:CrossRAG 把检索带到时序预测,ExtractBench 把 RAG 评测带入结构化企业文档,HyPE 优化检索对齐本身——说明 RAG 作为范式正在脱离纯文本问答的初始定义。

记忆≠RAG,RAG≠向量检索:2026 年的新分层(参考 Substack 趋势):Memory 是 agent 自身状态的持久化;Knowledge 是外部可检索信息;两者需独立架构。LongMemEval 也表明长上下文窗口没有消灭检索需求,而是改变了"什么放上下文、什么靠检索"的权衡。

评测驱动落地:ExtractBench 聚焦"schema 约束 + 成本 + 溯源"三维评测,呼应企业 agent 部署的真实需求。


📚 Substack 趋势参考

The AI Engineer · The AI Agents Stack (2026 Edition) - 2024 年记忆=向量数据库+RAG;2026 年记忆升级为三层架构:in-context memory → cross-session memory → shared memory - 长上下文窗口(Gemini 1M、Claude 200K)没有消灭检索需求,而是改变了上下文与检索的分工边界 - RAG 的瓶颈不在向量数据库本身,而在于 chunks 质量、排序和上下文窗口利用率 - 来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition


由 Tom 研究知识库 cron 自动生成 · 2026-08-03 14:40 UTC+8 原始 candidates:/shared/research-kb/inbox/tom/_candidates/2026-08-03-agent-rag-longcontext-candidates.json