Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-18

本期候选(8 条)

# 类型 标题 来源 信号
1 高价值 How Do Agents Fail on AutoResearch: End-to-End Diagnostic on 100 Real-World Frontier Research Tasks arXiv HF 19票
2 高价值 FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution arXiv Agentic state reuse
3 高价值 SkillRouter: Retrieve-and-Rerank Skill Selection for LLM Agents at Scale Substack (Aixfunda) 实战经验
4 次要 TRACE-Bench: Decomposing Multi-Reference Image Generation arXiv RAG+多模态 benchmark
5 次要 Adaptive Chunking: Optimizing Chunking-Method Selection for RAG Substack (Aixfunda) RAG 优化
6 次要 Qwen-Agent: Qwen2 Multi-Agent Framework with RAG & Code Interpreter Substack 框架实战
7 次要 MOSS-VL: Real-Time Vision-Language Interaction arXiv 多模态
8 次要 Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search arXiv Benchmark

🔥 高价值条目(3 条)

1. How Do Agents Fail on AutoResearch (AutoResearchEval)

  • 链接: https://arxiv.org/abs/2608.14905
  • 标签: agent / rag / benchmark / systems
  • 核心发现: 提出 AutoResearchEval,涵盖 100 个真实前沿科研任务,对 AI Agent 端到端失败模式做系统性诊断。现有评测只测性能不测过程,故障诊断缺乏工件级可见性。本文直接补这个空白,对 Agent 构建者和 RAG 系统评估极有价值。
  • 为何重要: Agent 越来越能自主做科研,但没人知道它在哪里卡住。这个 benchmark 给出了一个可复现的排障框架。

2. FreeToken: Edge-Native MoE Serving for Agentic Workloads

  • 链接: http://arxiv.org/abs/2608.16157v1
  • 标签: agent / memory / systems
  • 核心发现: 将个人设备视为弹性推理平台而非小型 GPU,协同设计 MoE 模型布局、专家常驻、CPU-GPU 执行和Agent 状态复用。边缘 AI Agent 的执行模式持续变化,现有系统无法应对。
  • 为何重要: 端侧 Agent 是趋势,但边缘异构资源和 Agent 动态工作负载的联合优化是关键突破口。本文直接处理"Agent 状态复用"这个痛点。

3. SkillRouter: LLM Agents 技能检索与重排

  • 来源: Aixfunda Substack,Top LLM/RAG/Agent Updates (Mar Week 4, 2026)
  • 核心内容: Retrieve-and-Rerank 范式做大规模 LLM Agent 技能路由,结合 Adaptive Chunking 优化 RAG 分块方法选择。
  • 为何重要: 技能路由是 Multi-Agent 系统的核心基础设施;自适应分块是 RAG 落地的关键工程问题。两者结合值得跟进。

📌 次要候选简评

  • TRACE-Bench: 多参考图像生成的原子操作形式化(Anchor/Disentangle/Apply/Compose),RAG+多模态评测新思路。
  • Adaptive Chunking: RAG 分块策略自适应选择,工程落地参考。
  • Qwen-Agent: Qwen2 多Agent框架,RAG + Code Interpreter 组合实战。
  • MOSS-VL: 实时视听交互,注意"说的时候同时看"的设计,对交互Agent有启发。
  • Large Discovery Models: 科学发现场景的生成模型基准,非核心但方向有趣。

去重说明

  • 与 2026-08-17 的 radar 相比,新增 FreeToken(Agent状态复用)和 SkillRouter(Substack)。
  • AutoResearchEval 可能在前期 radar 有类似主题,但本文是完整 benchmark,首次系统化。

Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-18 · 共 8 候选 · 高价值 3 条 · 含 Substack 1 条