Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-08-06

候选概览(8 条)

# 来源 标题 投票
1 HF Daily AVE-Compass: 音视频编辑评测基准 9
2 HF Daily Ego2Robot: 仿生数据合成规模化机械手策略 8
3 HF Daily WorldCycle: 长时视频世界模型自验证 RL 3
4 arXiv K-EXAONE 2.0 (256K 上下文, MoE 750B) 2
5 HF Daily BridgeVLA++: 3D 操控的记忆增强 VLA 框架 2
6 arXiv Teaching Nemotron Greek: RAG 专项适应 + HERA 基准
7 HF Daily Distill Where You Fail: GRPO + OPD 混合优化 1
8 arXiv MultiPathFormer: 无线多径传播基础模型

🔴 高价值条目(4 条)

1. Teaching Nemotron Greek: RAG 专项适应 + HERA 新基准

来源: arXiv · 2026-08-05 · tags: rag, benchmark
链接: http://arxiv.org/abs/2608.05138v1
摘要: 现代希腊语在主流检索模型和基准中缺席,LG AI Research 团队对 Nemotron 检索栈做端到端适配:语料挖掘 → 合成监督 → 检索模型训练 → 重排器 → 阅读器微调,并发布 HERA 基准。关键发现:BM25 在专业希腊语语料上不输多个现成多语稠密检索模型。对 RAG 适应非拉丁语系场景有直接工程参考价值。


2. δ-mem: 高效在线记忆 — RAG 和长上下文的第三条路

来源: AlphaSignal (Substack) · 2026-05-15
链接: https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough
摘要: Mind Lab (NTU, Fudan, SJTU, CUHK, HKUST-GZ) 提出的 δ-mem,用 8×8 关联记忆状态(仅 4.87M 可训练参数,Qwen3-4B 的 0.12%)存储历史信息。Qwen3-4B 在五项基准上平均分从 46.79% 提升至 51.66%。论文 2026-05-12 登录 arXiv。核心观点:大多数 agent 工作负载中 RAG 过重、长上下文浪费,δ-mem 提供了轻量记忆的第三条路。


3. The AI Agents Stack (2026 Edition)

来源: The AI Engineer (Substack) · 近期
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
摘要: 2024 年记忆 = "选个向量库做 RAG";2026 年记忆是第一等架构原语,分为三层:短期上下文、长期向量记忆、外部知识。Gemini 1M+ token 上下文窗口并未消灭记忆需求,而是改变了取舍:什么塞进上下文 vs. 什么按需检索。Agent 基础设施(Letta, Zep, Mem0)在跨实例共享记忆和跨模型提供商切换时发挥作用。检索 = 评测问题 > 基础设施问题。


4. BridgeVLA++: 记忆增强的 3D 操控 VLA 框架

来源: HF Daily · 2026-08-04 · tags: rag, memory, multimodal
链接: https://arxiv.org/abs/2608.05042
摘要: 基于 BridgeVLA 改进,解决 3D VLA 的三大痛点:数据饥渴、分布漂移泛化弱、无显式记忆。引入显式记忆机制存储历史观察,对数据稀缺、开放世界、记忆依赖场景有针对性提升。


📌 快速判断

  • RAG 评测 + 非拉丁语系适配: 条目 1(希腊语 HERA 基准 + RAG 全链路实践)
  • Agent 记忆新范式: 条目 2(δ-mem 轻量记忆)、条目 3(2026 Agent Stack 三层记忆架构)
  • 多模态 / 具身智能: 条目 4(BridgeVLA++ 含显式记忆)
  • 多模态评测: 条目 1(AVE-Compass 音视频协同编辑基准,votes=9)

Tom 文献雷达 · 每日 3 次 · 轻量模式 · 2026-08-06T14:40 CST