Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-08-27 20:40

本次覆盖:HF Daily(8月23-25日)+ arXiv(8月26日);共8条,高价值4条


🔥 高价值

1. Next-Chunk Reasoning RL vs SFT under no-CoT Data - arXiv | 18票 | 标签: rag, benchmark - https://arxiv.org/abs/2608.23256 - 核心:no-CoT数据(教材推导、工作解)如何被有效利用?next-chunk reasoning RL比传统SFT优势来源尚不清晰——来自RL本身还是来自更充分暴露no-CoT数据?受控实验给出答案。 - 🔎 看点:RAG训练数据构建范式之争,对检索增强训练有直接参考价值。

2. The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents - arXiv | 11票 | 标签: agent - https://arxiv.org/abs/2608.24358 - 核心:编码Agent在长任务中途切换模型(低→高成本或反之),接收方需延续"非原生轨迹"。系统研究handoff质量与成本权衡,涵盖Claude/GPT家族配对实验。 - 🔎 看点:多模型Agent协作时必读,实操性强的成本-质量分析。

3. SWE Refactor Bench: Whole-Repository Stack Migration Benchmark - arXiv | 10票 | 标签: agent, benchmark, systems - https://arxiv.org/abs/2608.23564 - 核心:现有benchmark只验证行为正确性,Agent可复制原实现通过测试(Blindness问题)。提出20个整库迁移任务,覆盖4类技术债,推动Agent从"修Bug"走向"架构迁移"。 - 🔎 看点:Agent能力边界的重要刻度,评测设计本身也值得关注。

4. RetrievalRouter: Joint Modality & Architecture Selection for Document Retrieval - arXiv | 25票(跨日累计)| 标签: rag, benchmark, multimodal, systems - https://arxiv.org/abs/2608.25625 - 核心:检索管线在模态(文本/多模)和架构(dense/late-interaction)之间存在速度-精度矛盾。提出query级自适应路由,按需在快(但弱)和慢(但准)之间切换。 - 🔎 看点:生产级RAG系统的核心工程问题,给出了有原则的路由框架。


📌 候选(4条)

  1. PlanSightRAG · Visual-First Multimodal RAG · 土木图纸合规检查,4056对benchmark,91%准确率;多模态RAG工程化案例 https://arxiv.org/abs/2608.26091

  2. Multi-Granularity Context-Enhanced RAG over MMKG · 多模态知识图谱RAG,不同模态统一索引的新 pipeline https://arxiv.org/abs/2608.25986

  3. JoyAI-Echo-1.5 · 跨镜头记忆 + 音视频统一生成;"可组合跨镜头记忆"思路对Agent记忆架构有参考价值(19票)https://arxiv.org/abs/2608.23383

  4. LibriBrain100 · 100小时MEG数据语音解码benchmark;非核心方向但数据规模突出(80小时单被试) https://arxiv.org/abs/2608.25204


💡 Substack 线索

The AI Agents Stack (2026 Edition) · The AI Engineer https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 三层记忆架构替代"向量数据库+RAG"旧范式;Agent基础设施与LLM基础设施的边界讨论。


检索来源: arXiv metadata + HF Daily;CSDN未使用;Substack 1条 生成: 2026-08-27 20:40 UTC | 模型: minimax/MiniMax-M2.7-highspeed