Agent · RAG · Long-Context 雷达 · 2026-10-02
本期高价值候选(4 条)
1. RAGScope:RAG 幻觉分诊协议 [RAG · Benchmark]
- 链接:http://arxiv.org/abs/2609.39075v1
- 作者:Zeming Liu, Qibai Chen, Jingtao Zhang, Hang Lyu
- 核心:RAG 系统需要低成本路由策略——低风险直接放行、不确定人工审核、昂贵强验证器留给高风险尾部。RAGScope 提出"泄漏受控"本地证据门控协议,在 RAGTruth 三个任务上 AUROC 达 0.798,AP 0.660。
- 亮点:端到端运行时 + 来源偏移压力测试;消费级硬件可跑;适合把 RAG hallucination 检测集成进生产流水线的团队。
- 标签:rag / benchmark / systems
2. MILO:Agent Harness 自动发现框架 [Agent · Memory · Systems]
- 链接:https://arxiv.org/abs/2609.38349
- 来源:HF Daily · 2026-09-28 · 15 votes
- 核心:当前 agentic 系统由 AI 模型 + 控制执行/环境交互的 harness 组成,但 harness 设计空间庞大且随模型变化需重新搜索。MILO(Meta-evolutionary Island Orchestration)通过层级 lineage memory + 协同进化策略同时优化 harness 和发现策略本身,避免陷入固定 exploit 策略。
- 亮点:harness design 自动化;适配新模型无需人工重设计;为 memory 在 agent 系统中的结构化利用提供了新范式。
- 标签:agent / memory / systems
3. DAGent:Evaluate-then-Grow 的深度研究 Agent 规划 [Agent · Benchmark]
- 链接:https://arxiv.org/abs/2609.39154
- 来源:HF Daily · 2026-09-29 · 3 votes
- 核心:深度研究任务中 DAG-based 多 Agent 系统适合并行执行和依赖隔离,但现有方案在执行前就固定计划,只在失败后才修图。DAGent 提出 Evaluate-then-Grow:边评估边扩展 DAG 节点,在证据最薄弱时避免过度承诺,计算浪费在后期大幅修订上。
- 亮点:为 deep research agent 的"过早规划"问题提供了差异化解法;benchmark 信号值得关注。
- 标签:agent / benchmark / systems
4. Training LLM Judges from Language Feedback [Benchmark · Agent]
- 链接:https://arxiv.org/abs/2609.38792
- 来源:HF Daily · 2026-09-29 · 5 votes
- 核心:主观任务中 judge 模型调用哪些标准、如何加权决定 verdict,但 outcome-supervised RL(如 GRPO)对所有 token 给同一标量reward,忽略了 criterion-choice token 的独立 credit。论文提出 Position-Selective Self-Distillation,从自然语言反馈中学习评判标准本身,而非仅学习最终结论。
- 亮点:对需要 agent 自我反思/评判能力的研究者有直接参考价值;也影响 LLM-as-Judge 评测范式。
- 标签:benchmark
其他候选(4 条)
| # | 标题 | 核心 | 来源 |
|---|---|---|---|
| 5 | BIABench:生物图像分析 Agent 真实任务评测 | 16 个来自已发表研究的重建任务;Agent 需处理 2D/3D/时间序列超大规模图像;benchmark 对生物/科学 AI 有直接价值 | arXiv · HF Daily · 4 votes |
| 6 | Tacit-TTS:非自回归零样本语音克隆 | 从 IndexTTS2 蒸馏;移除转录本依赖;延迟大幅降低 | HF Daily · 8 votes · systems |
| 7 | PixelUMM:像素空间统一图文视频理解与生成 | 无 encoder 架构;在像素空间统一理解/生成;多模态推理 | HF Daily · 5 votes · multimodal |
| 8 | Aligning One-Step 生成模型 via RWTD | Reward-Weighted Transport Distillation;仅需样本 + reward 标量;无隐式生成器似然需求 | HF Daily · 2 votes · benchmark |
轻量观察笔记
RAG + Long-Context 配比趋势(来自本期):RAGScope 的路由分诊思路反映了一个现实——长上下文越强,RAG 的"必要性"争论越多,但两者并非替代关系: - RAG:超大规模语料、低延迟、频繁更新的知识库 - Long-Context:单文档深度推理、跨文档上下文内综合 - 实际工程组合:RAG 负责 scale,long-context 负责 reasoning depth
Agent Memory 新动向:MILO 的 lineage memory 思路值得关注——不只是记录历史,而是把 memory 作为搜索策略的进化信号。传统 RAG 只做检索,MILO 在 agent harness 层面做 memory-driven 演化,这可能是未来 memory 系统的主流形态之一。
候选溯源
- 数据生成:2026-10-02 08:40 UTC
- 候选数:8 条(arXiv × 1,HF Daily × 7)
- arXiv one query timeout(MILO memory 相关),HF 补足,未影响总量
- Substack 搜索:本次未命中真实 Substack 内容(搜索结果为通用博客)
- CSDN:未使用
Tom · Agent · RAG · Long-Context Radar · 2026-10-02