Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-05 20:40

概览

  • 候选总数:8 条
  • 高价值:4 条
  • 来源:arXiv + HuggingFace Daily(8 条)
  • Substack:使用(CSDN:未使用)
  • 注:本日第三次运行,HF Daily 今日条目与 14:40 完全相同,vote 动态已更新

🔥 高价值条目

1. DRACO: 动态 rubric 分配用于长程 Agent 训练

  • 来源:HF Daily · 2026-09-02 · 23 票
  • 链接:https://arxiv.org/abs/2609.04094
  • 摘要:RLVR 在长程 Agent 任务无程序化 checker 时效果差。DRACO 动态生成评分 rubric,训练中跟踪策略能力演进,对完整轨迹评分后重新分配优势信号。
  • 标签agent
  • 意义:outcome-blind 场景下突破信用分配难题。

2. RoboTok: 互联网规模机器人演示检索引擎

  • 来源:HF Daily · 2026-09-01 · 40 票(今日大幅上升)
  • 链接:https://arxiv.org/abs/2609.03199
  • 摘要:给定人类操作视频,从网络视频检索相关演示用于机器人灵巧操控策略训练,学习 3D 手部轨迹潜在空间表示,跨视角对齐。
  • 标签rag benchmark multimodal
  • 意义:RAG 思想引入机器人学习,互联网规模数据是核心壁垒。

3. Select, Compress, Reinvest: 长视频 MLLM Token 分配控制研究

  • 来源:HF Daily · 2026-09-02 · 15 票
  • 链接:https://arxiv.org/abs/2609.03820
  • 摘要:1 小时视频每秒一帧 = 3600 张图,系统只保留固定 slice。研究解耦帧选择、空间压缩和"省 token 重新投入"三个决策,在 6 种选择规则、3 benchmark、2 模型上系统评测。
  • 标签benchmark multimodal systems
  • 意义:视频 Token 分配首个控制变量基准,长期被忽视的工程问题。

4. VeriPhy: Agentic 物理推理与世界模型评测

  • 来源:HF Daily · 2026-09-01 · 12 票
  • 链接:https://arxiv.org/abs/2609.03153
  • 摘要:视频生成 fluency ≠ 物理可靠性。VeriPhy 用纯文本 Planner 编译为类型化物理义务和静态验证执行计划,观察门控调用冻结专家(分割、跟踪、计数、11 种物理测量等)。
  • 标签agent benchmark multimodal systems
  • 意义:首个可审计物理验证框架,为世界模型提供可解释评测标准。

📌 一般条目

5. Last Translation Benchmark

  • 来源:HF Daily · 2026-09-02 · 24 票
  • 链接:https://arxiv.org/abs/2609.04173
  • 机器翻译标准 benchmark 趋饱和,引入新 benchmark 追踪客观进展。
  • 标签benchmark

6. QCell: 细胞查询重组用于重叠实例分割

  • 来源:HF Daily · 2026-08-28 · 13 票
  • 链接:https://arxiv.org/abs/2608.29253
  • 标签research

7. Locked at the Entrance: RLVR 缩小解空间的位置分析

  • 来源:HF Daily · 2026-08-28 · 8 票
  • 链接:https://arxiv.org/abs/2608.29188
  • 标签systems

8. A Common Measure of Communication for Speech BCIs

  • 来源:HF Daily · 2026-09-01 · 9 票
  • 链接:https://arxiv.org/abs/2609.02887
  • 标签systems

💡 趋势洞察(来源:Web/Tavily)

RAG 架构 2026 最新共识: - 混合检索成为默认,纯稠密检索已成 smell;重排器收敛至 Cohere Rerank 3.5、Voyage Rerank-2、BGE Reranker v2 - 长上下文 vs RAG 成本博弈:1M token 窗口让部分 RAG 场景可选,但成本和延迟数学仍偏向检索 - Agentic RAG 成为复杂问题标配:模型自主决定何时检索、检索什么、迭代修正 - 评测框架:TruLens 和 DeepEval 主领 AI Agent + RAG 评测;TruLens 新增 Agent GPA(目标/计划/行动三维度);持续线上评测替代一次性离线评估 - Advanced RAG 类型:Long-document memory(MiA-RAG、HGMem、MegaRAG)、Adaptive/Agentic RAG(Agentic RAG、A-RAG、HiFi-RAG)、Graph RAG、Multimodal RAG


生成时间:2026-09-05 20:40 (Asia/Shanghai) · Tom 文献雷达