Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-20
主题: agent-rag-longcontext | 来源: arXiv + HuggingFace Daily | 时间: 2026-08-20 06:40 UTC
🔔 高价值条目(4 条)
1. Zetta ζ:闭环具身 Agent 评测框架
- 来源: arXiv abs/2608.16590 | HF votes: 73
- 核心: 现有具身 Agent 评测 harness 仍是开环(固定技能+事后反思);Zetta 实现运行时在线进化——边执行边更新 critics 和 recovery skills,闭环追踪机器人-环境高频状态。
- 意义: 为具身智能的自进化能力提供标准化评测基准,填补「执行中决策」无法事后补的特点。
- 标签: #agent #embodied #benchmark
2. Co-RL:无监督推理从多智能体 Cohort 自涌现
- 来源: arXiv abs/2608.17253 | HF votes: 48
- 核心: 自奖励 RL(self-rewarding RL)减少对人工标注的依赖,但纯自生成反馈会强化偏差;Co-RL 通过多样 cohort 协作,在多智能体 RL 中涌现无监督推理能力。
- 意义: 对齐与推理评测的新范式,cohort 多样性替代了 ground-truth reward,为超人类评测提供路径。
- 标签: #agent #benchmark #multimodal
3. OmniScientist:全模态全学科 AI 科学家
- 来源: arXiv abs/2608.13558 | HF votes: 34
- 核心: 现有 AI 科学家系统只看文本/代码/标签;OmniScientist 直接从原始异构证据(空间/时间/跨通道/过程数据)进行多学科研究,含 RAG 驱动的证据检索。
- 意义: RAG 在科学发现场景落地,从预计算摘要扩展到原始多模态证据,扩展了 Agentic RAG 的边界。
- 标签: #agent #rag #systems
4. SemComp-Bench:视频生成任务完成语义评测基准
- 来源: arXiv abs/2608.17426 | HF votes: 45
- 核心: 提出语义任务完成(Semantic Task Completion)评测:不仅看外观一致,更需达成结果导向的语义目标,构建 SemComp-Data(含 4000 条专家演示)。
- 意义: 为视频生成 Agent 的 outcome-oriented 评测提供方法论,区别于传统外观一致性 metric。
- 标签: #benchmark #multimodal #systems
📡 Substack 补充:RAG 在 2026 年为何没死
来源: SwirlAI "State of Context Engineering in 2026" + EITT Academy
- 误区澄清: 2025 年有声音说「RAG 已死,长上下文杀死了它」(Claude 1M token、Gemini 2.0),但 2026 年 RAG 仍是生产标准,三大原因: 1. 成本:每次查询加载 1M token 成本极高; 2. 权限与范围:RAG 可做文档级权限过滤,长上下文需要预先加载; 3. 实时性:RAG 可检索分钟级新鲜数据,长上下文依赖预加载。
- RAG 2026 新范式: Agentic RAG(Agent 自主决定搜索策略、迭代 re-query)已取代固定 pipeline;Graph RAG 处理关系型知识;Corrective RAG 在金融/合规场景检测弱检索并重取。
- 实战警示: 25+ AI Agent 审计发现,失败根源几乎总是选错了 RAG 类型,而非模型或向量库本身。
📋 候选摘要(共 8 条)
| # | 标题 | 来源 | 票数 | 核心标签 |
|---|---|---|---|---|
| 1 | Zetta ζ: 闭环具身 Agent 评测 | arXiv | 73 | agent, embodied |
| 2 | Co-RL: 多智能体 RL 推理涌现 | arXiv | 48 | agent, benchmark, multimodal |
| 3 | SemComp-Bench: 视频生成语义评测 | arXiv | 45 | benchmark, multimodal |
| 4 | OmniScientist: 全模态 AI 科学家 | arXiv | 34 | agent, rag, systems |
| 5 | Decision-Metric Alignment: MPC 规划 | arXiv | 12 | agent |
| 6 | Training Leaves Traces: 模型谱系验证 | arXiv | 15 | benchmark |
| 7 | SoftVTBench: 软体操作触觉基准 | arXiv | 12 | benchmark |
| 8 | Scaling Creative Writing: 品类扩展 | arXiv | 12 | rag, systems |
去重备注: 与 2026-08-19、08-18 雷达文件无重复条目。
Tom 文献雷达 · 每期轻量输出 · 2026-08-20T06:40 UTC