Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-18
本期候选(8 条)
| # | 类型 | 标题 | 来源 | 信号 |
|---|---|---|---|---|
| 1 | 高价值 | How Do Agents Fail on AutoResearch: End-to-End Diagnostic on 100 Real-World Frontier Research Tasks | arXiv | HF 19票 |
| 2 | 高价值 | FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution | arXiv | Agentic state reuse |
| 3 | 高价值 | SkillRouter: Retrieve-and-Rerank Skill Selection for LLM Agents at Scale | Substack (Aixfunda) | 实战经验 |
| 4 | 次要 | TRACE-Bench: Decomposing Multi-Reference Image Generation | arXiv | RAG+多模态 benchmark |
| 5 | 次要 | Adaptive Chunking: Optimizing Chunking-Method Selection for RAG | Substack (Aixfunda) | RAG 优化 |
| 6 | 次要 | Qwen-Agent: Qwen2 Multi-Agent Framework with RAG & Code Interpreter | Substack | 框架实战 |
| 7 | 次要 | MOSS-VL: Real-Time Vision-Language Interaction | arXiv | 多模态 |
| 8 | 次要 | Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search | arXiv | Benchmark |
🔥 高价值条目(3 条)
1. How Do Agents Fail on AutoResearch (AutoResearchEval)
- 链接: https://arxiv.org/abs/2608.14905
- 标签: agent / rag / benchmark / systems
- 核心发现: 提出 AutoResearchEval,涵盖 100 个真实前沿科研任务,对 AI Agent 端到端失败模式做系统性诊断。现有评测只测性能不测过程,故障诊断缺乏工件级可见性。本文直接补这个空白,对 Agent 构建者和 RAG 系统评估极有价值。
- 为何重要: Agent 越来越能自主做科研,但没人知道它在哪里卡住。这个 benchmark 给出了一个可复现的排障框架。
2. FreeToken: Edge-Native MoE Serving for Agentic Workloads
- 链接: http://arxiv.org/abs/2608.16157v1
- 标签: agent / memory / systems
- 核心发现: 将个人设备视为弹性推理平台而非小型 GPU,协同设计 MoE 模型布局、专家常驻、CPU-GPU 执行和Agent 状态复用。边缘 AI Agent 的执行模式持续变化,现有系统无法应对。
- 为何重要: 端侧 Agent 是趋势,但边缘异构资源和 Agent 动态工作负载的联合优化是关键突破口。本文直接处理"Agent 状态复用"这个痛点。
3. SkillRouter: LLM Agents 技能检索与重排
- 来源: Aixfunda Substack,Top LLM/RAG/Agent Updates (Mar Week 4, 2026)
- 核心内容: Retrieve-and-Rerank 范式做大规模 LLM Agent 技能路由,结合 Adaptive Chunking 优化 RAG 分块方法选择。
- 为何重要: 技能路由是 Multi-Agent 系统的核心基础设施;自适应分块是 RAG 落地的关键工程问题。两者结合值得跟进。
📌 次要候选简评
- TRACE-Bench: 多参考图像生成的原子操作形式化(Anchor/Disentangle/Apply/Compose),RAG+多模态评测新思路。
- Adaptive Chunking: RAG 分块策略自适应选择,工程落地参考。
- Qwen-Agent: Qwen2 多Agent框架,RAG + Code Interpreter 组合实战。
- MOSS-VL: 实时视听交互,注意"说的时候同时看"的设计,对交互Agent有启发。
- Large Discovery Models: 科学发现场景的生成模型基准,非核心但方向有趣。
去重说明
- 与 2026-08-17 的 radar 相比,新增 FreeToken(Agent状态复用)和 SkillRouter(Substack)。
- AutoResearchEval 可能在前期 radar 有类似主题,但本文是完整 benchmark,首次系统化。
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-18 · 共 8 候选 · 高价值 3 条 · 含 Substack 1 条