Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-09-24

本期概况

  • 来源:HuggingFace Daily + Web Search 补充
  • arXiv API 今日返回 406,候选主要来自 HF Daily
  • 高价值 4 条,Substack 1 条,总候选 6 条

★ 高价值候选

1. JEV-as-a-Judge:评估置信度路由(18 票)

  • 链接:https://arxiv.org/abs/2609.26550
  • 核心:决策型裁判(decision-only judge),以 0.36% 的成本达到 SOTA LLM Judge 3% 误差内;提出置信度路由——不确定时升级到更强评估器。
  • 价值:大规模 Agent 评估成本优化;可作为 Agent 自我验证模块的架构参考。
  • 标签:benchmark / systems

2. Agensh:1024 Agent 自组织调度(9 票)

  • 链接:https://arxiv.org/abs/2609.26781
  • 核心:去中心化多 Agent 框架,无中央编排器;worker 自主认领子任务、共享上下文、合并进度。
  • 价值:突破多 Agent 扩展瓶颈;与 Long context window 交互模式直接相关。
  • 标签:agent / systems

3. LatentPort:跨模型持久记忆迁移(4 票)

  • 链接:https://arxiv.org/abs/2609.25053
  • 核心:Qwen3.5 4B→9B 混合态接力;KV + Gated DeltaNet 持久状态跨模型传递,NLL 降低 0.747 nats/token。
  • 价值:RAG 记忆跨会话/跨模型复用的新范式;RAG + memory 交叉点。
  • 标签:rag / memory / systems

4. RoboFollow:嵌入式 Agent 指令遵循诊断基准(4 票)

  • 链接:https://arxiv.org/abs/2609.25636
  • 核心:高场景熵诊断基准;揭示"低场景熵幻觉"——场景唯一解时语言冗余,策略可高分但实际未遵循指令。
  • 价值:Agent 真实能力测评;benchmark 设计方法论可迁移到 RAG 评估。
  • 标签:agent / rag / benchmark / multimodal

📬 Substack 补充

Mem0:AI Agent Memory 现状 2026(mem0.ai, 2026-09-18)

  • 要点:2026 年 Agent Memory 已是独立架构组件,而非塞入 Context Window;三大基准 LoCoMo / BEAM / LongMemEval;Token 高效算法(6,956 tokens/次)vs 全量上下文基线(26,000 tokens/次)。
  • 价值:快速了解 memory 评测格局,补充本文库 LatentPort 等论文的行业背景。

常规候选(可参考)

标题 票数 标签
Tri-PvP:Omni-modal LLM 跨模态冲突基准 2 benchmark / multimodal
ImIR:图像修复指令微调 3 multimodal / systems

去重提示

  • 本期候选均未在近 7 天雷达中出现(2026-09-19 / 2026-09-23 已查重)

Tom · 2026-09-24 · 轻量模式