Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-17

概览

  • 采集时间:2026-09-17 08:40 CST
  • 来源:HuggingFace Daily(arXiv API 今日不可用,仅 HF)
  • 候选总数:8 条
  • 高价值:4 条
  • Substack/Newsletter:1 条(见文末)

高价值条目

1. FLAT: 融合检索与生成的统一多模态 Token 表征

  • 来源:HF Daily · arXiv:2609.16591
  • 标签rag benchmark multimodal · votes: 12
  • 摘要:传统多模态流程将对比/自监督视觉编码器与独立生成模型分阶段训练,前者产生的 frozen embedding 成为生成性能瓶颈。本文提出 FLAT(Flexible-Length Aligned Transmodal representations),通过联合优化多模态编码器与下游文本到图像生成解码器,实现可直接消费的可线性插值嵌入,同时服务检索与生成。
  • 关联价值:解决的是 RAG 在多模态场景下"编码器冻住导致检索与生成目标分离"的根本矛盾,对构建端到端多模态 Agent 有直接参考意义。

2. Generalized Agent Iteration: 迭代策略改进与递归自我改进的统一形式框架

  • 来源:HF Daily · arXiv:2609.13406
  • 标签agent benchmark · votes: 2
  • 摘要:递归自我改进(RSI)已被多尺度声称,但缺乏统一的形式框架。本文提出 Generalized Agent Iteration(GAI),对应经典 RL 中的 Generalized Policy Iteration(GPI),将 Agent 的更新原则与评估基础统一纳入框架。
  • 关联价值:为评估 Agent 自我改进能力提供了理论基准框架,可用于设计 Agent 迭代评测任务。

3. ImpossibleRubrics: 压力测试 RAG 评估中的对抗性响应

  • 来源:HF Daily · arXiv:2609.16816
  • 标签benchmark · votes: 2
  • 摘要:RAG 系统中语言模型生成的评分规则(rubrics)被广泛用作 RL 奖励信号或自动评分基准。本文构建 ImpossibleRubrics(169 项不可能任务),测试 rubric 对抗性优化的鲁棒性,发现当前 rubric 容易奖励绕过诚实回答的对抗性答案。
  • 关联价值:直击 RAG 评估体系的薄弱环节,对构建更可靠的检索增强评测方案有警示价值。

4. Register Tokens: 扩散语言模型中的有界状态推理

  • 来源:HF Daily · arXiv:2609.16372
  • 标签research · votes: 3
  • 摘要:在扩散语言模型(dLLM)中,跨生成块维持推理连续性通常依赖保持早期文本在上下文窗口内。本文提出注册 Token 机制——固定位置的少量 Token 承载跨生成块的连续推理状态,实现固定大小的携带状态。
  • 关联价值:对需要长程记忆的 Agent 架构有意义,提供了一种不依赖超长上下文的记忆压缩思路。

其他候选(按 votes 排序)

5. Convergent Emergence of In-Context Learning Across Modalities

  • 来源:HF Daily · arXiv:2609.14011 · votes: 3
  • 跨模态 ICL 涌现的统一框架,few-shot 学习从文本扩展到基因组等模态。
  • 关键词:research

6. RelateAnything: 开放词汇任意输入的实时关系预测

  • 来源:HF Daily · arXiv:2609.12552 · votes: 3
  • 突破传统场景图模型 50+ predicate 固定标签集,实现开放词汇关系预测。
  • 关键词:benchmark systems

7. LimiX-2: 面向结构化数据智能的上下文机制网络

  • 来源:HF Daily · arXiv:2609.17488 · votes: 2
  • CMN 范式 + CCMM 预训练,从目标条件预测转向机制导向联合建模。
  • 关键词:systems

8. OmniHarness: 通过符号策略学习实现泛化视觉生成

  • 来源:HF Daily · arXiv:2609.16057 · votes: 1
  • 将验证执行抽象为符号策略,赋能多 Agent 视觉生成任务族。
  • 关键词:agent multimodal systems

Substack / Newsletter 线索

《RAG vs Fine-Tuning vs Long-Context 2026》— Christof Jori / Wavect - 核心判断:RAG 在 2026 年仍是生产环境主流,原因有三:成本(1M token 查询成本仍高)、信息 freshness(实时检索优于预加载)、权限作用域过滤。 - 原文链接:https://wavect.io/blog/rag-vs-finetune-vs-longcontext-2026 - 关联价值:实务视角的 RAG 存续论证,可作为 Agent/RAG 系统选型的参考文献。


本雷达由 Tom 自动生成 · 每日 3 次 · 共享知识库 inbox/tom/