rag · E1 预消化简报(2026-09-25)
R101 E1 轮 · 窗口覆盖:2026-09-24 08:50 ~ 2026-09-25 08:50 CST 数据来源:Jay 9-25 CSDN/Substack 推理引擎/RAG/Agentic AI 高价值条目 + paper_cards Sep 25 新批次(1476-1506)+ work-queue Sep 25 + 活文档 rag.md R100 基线 诚实度声明:本轮增量密度「中」——RAG 主分类新入库 0 件;新批次(1476-1506)共 11 张新卡,无 RAG 主分类;Jay 9-25 补充了 RAG 四代演进框架(R96 Naive→Advanced→Agentic 三代到 R101 四代细化)+ SGLang H100 benchmark + Ken Huang KV Cache 系列工程深度;Agensh (2609.26781) work-queue Top 条目提供 RAG/Agent 编排邻接。无硬凑字数。
0. 概述与基线对齐
R100 状态确认:R100 锚入 2 件(RAG/memory 邻接 LatentPort 2609.25053 + RAG 评测方法论邻接 RoboFollow 2609.25636)+ 1 件 RAG 评测基准 fresh 来源(RAGSearch 2604.09666)+ RAG 2026 四新范式 CSDN 双源锚入(Jay 9-24)+ RAG 工程化 CSDN 锚入;work-queue 9-24 Top 条目 Agensh 2609.26781 标注为 RAG 邻接待跟进。
本轮(R101)新发现:RAG 主分类新 paper_card 入库 0 件——Sep 25 批次(1476-1506)共 11 张新卡,无一以 rag 为主分类;Jay 9-25 最关键增量是 RAG 四代演进框架(Naive RAG → Simple RAG → Complex RAG → Agentic RAG)——对 R96 Naive→Advanced→Agentic 三代架构做了工程化细化,与 R100 Jay 9-24 的"四新范式"(Graph-RAG/Agentic RAG/Memory-Augmented AI/Retrieval-free Reasoning)形成互补;SGLang vs vLLM H100 benchmark 揭示了推理引擎选择对 RAG 实时性的直接影响;Ken Huang KV Cache 物理系列提供了 RAG 长上下文处理的底层工程参照;Agensh (2609.26781) 无中心编排器 1,024 agents 为 RAG 多跳编排提供系统架构参照。
1. 增量条目(5 件)
增量 ① Jay 9-25 RAG 四代演进框架 · Naive RAG → Agentic RAG 工程化细化(核心新增)⭐⭐⭐
- 来源:Jay 9-25 0850
/inbox/jay/2026-09-25T0820-jay-csdn-substack-inference-rag-highvalue-sep25.md(CSDN 条目 3)+ https://blog.csdn.net/weixin_47547625/article/details/161535116 - 要点:2026 年 RAG 从"检索-生成"线性管道走向"理解-规划-检索-推理-生成"智能循环;四代演进:① Naive RAG(原始向量检索 + 生成);② Simple RAG(基础分块 + 混合检索);③ Complex RAG(多跳推理 + 初步规划);④ Agentic RAG(检索本身成为 Agent 行动,支持自主决策下一步检索策略 + 迭代式修正)。Graph RAG + Agentic RAG 组合正让知识库从"高级 Ctrl+F"变为真正的"知识助手"。
- 与活文档现有脉络的关系:与 rag.md R96 Naive→Advanced→Agentic RAG 三代架构(§2.14 RAG 53 范式)形成工程化细化版本——R96 三代 vs R101 四代(R101 将"Advanced"拆解为 Simple RAG + Complex RAG 两阶段);与 R100 Jay 9-24 RAG 2026 四新范式(Graph-RAG/Agentic RAG/Memory-Augmented AI/Retrieval-free Reasoning)形成互补——Jay 9-24 提供横向范式分类,Jay 9-25 提供纵向演进阶段;与 R100 RAGSearch 2604.09666(dense RAG vs GraphRAG agentic search 对照)形成评测-演进双轨印证。
- 建议归入节:§2.14 RAG 53 范式(Naive→Simple→Complex→Agentic 四代演进框架)+ 趋势 306 补充
- 可信度:★★★(CSDN 系统性综述,有演进逻辑和实测数据支撑;四代 vs 三代的颗粒度差异建议标注"待原文核验")
- ⚠️ 需读全文:① Naive/Simple/Complex 三代的分界具体标准;② Complex RAG 的"多跳推理"具体实现机制;③ Graph RAG 在四代中的定位——是独立轨还是 Agentic RAG 的组件
增量 ② SGLang vs vLLM H100 Benchmark · RAG 运行时推理引擎选型(邻接)⭐⭐
- 来源:Jay 9-25 0850 条目 1 + https://blog.csdn.net/qq_27504375/article/details/163024278(CSDN,2026-08-31)+ work-queue Sep 25 Top 条目参照
- 要点:H100 实测 benchmark,prefix-heavy traffic,Llama 3.1 8B:SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s,差距约 29%(来自 RadixAttention 前缀复用);独立 prompt 场景两者差距缩小至 1-4%。结论:SGLang 适合共享 system prompt + 短用户轮次的多轮/Agentic 场景;vLLM 适合完全独立请求。RAG 检索-生成管道中,多轮对话和 Agentic 检索场景直接受益于 SGLang 的前缀缓存优势。
- 与活文档现有脉络的关系:与 rag.md §2.6 运行时与基础设施(143 件)邻接——推理引擎选择直接影响 RAG 端到端延迟;SGLang RadixAttention 前缀复用对 RAG 多轮对话场景(历史上下文重复利用)有直接工程价值;work-queue Sep 25 Top 条目(Agensh)无直接关联但均属于 Agent 系统范畴。
- 建议归入节:§2.6 运行时与基础设施(推理引擎 benchmark,RAG 场景选型参考)
- 可信度:★★★(H100 实测数据,含具体测试条件 Llama 3.1 8B/3.3 70B FP8)
- ⚠️ 需读全文:① 16,200 vs 12,500 tok/s 的具体测试配置(batch size/concurrency);② 在更大模型(70B)上的差距是否保持;③ RAG 生产中 SGLang 的稳定性数据
增量 ③ Ken Huang KV Cache 物理与工程系列 · RAG 长上下文底层参照(邻接)⭐⭐
- 来源:Jay 9-25 0850 Substack 研究线索(Ken Huang,DistributedApps.ai,2026-09-04 起)+ https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 要点:Ken Huang 发布 10 篇 LLM inference 物理与工程系列,部分核心议题:① KV Cache Accumulation Dilemma——长思考链 trace 占用 GPU HBM 数百秒,主动 batch size 下降,内存碎片化;② Global Radix Tree & Prefix Caching(vLLM/SGLang)——动态共享前缀检测、基于哈希 token 树、跨会话 system prompt 共享;③ Zhipu AI KVShare & Layer Pruning——跨层 KV cache 复用、稀疏层缓存、H2O/Scissorhands/StreamingLLM 动态 token 驱逐策略;④ Low-Precision KV Cache Kernels——FP8(E4M3)和 INT4 量化 KV cache 布局,子通道缩放因子,Triton 去量化 kernel。对 RAG 系统长上下文处理的底层工程有直接参照价值。
- 与活文档现有脉络的关系:与 rag.md §2.6 运行时(143 件)+ R99 DeepSeek-V4.1-Flash KV cache 压缩(§2.6 续立)邻接——Ken Huang 系列提供了 2026 年 KV Cache 工程优化的系统性全景;FP8/INT4 量化 KV cache 与 R99 DeepSeek-V4.1-Flash NLL 指标形成量化压缩-质量双轨;与 R100 LatentPort(persistent state handoff)形成 KV 层级的工程化参照(LatentPort 是 persistent state 跨模型迁移,KVShare 是跨请求/跨层复用)。
- 建议归入节:§2.6 运行时与基础设施(KV Cache 物理与工程全景,Long Context RAG 底层参照)
- 可信度:★★★(Substack 工程深度系列,有具体议题框架;具体数字待读全文)
- ⚠️ 需读全文:① KV Cache Accumulation Dilemma 的具体量化(数百秒 HBM 占用对应的 batch size/throughput 损失);② KVShare 跨层复用的具体效率数字;③ FP8/INT4 KV cache 量化对 RAG 生成质量的影响
增量 ④ Agensh · 2609.26781 · 无中心编排器 1,024 Agents(work-queue Top · RAG/Agent 编排邻接)⭐⭐
- 来源:work-queue Sep 25(Top 0.5 高价值)+ paper_card 1486(主分类 agent,形态 method,副分类 evaluation)+ https://arxiv.org/abs/2609.26781
- 要点:"Agensh: Scaling Organizational Intelligence to 1,024 Agents"——多智能体系统可通过并发执行降低复杂任务延迟,但现有 multi-agent harness 的可扩展性受限于中心编排器分配任务与协调 worker 的能力。Agensh 提出无需中心编排器的可扩展自组织 multi-agent harness:并发 worker 运行多智能体协作循环,持续收集上下文、自主认领并自分配子任务、执行动作并共享完成。可扩展至 1,024 个并发 agents。
- 与活文档现有脉络的关系:与 rag.md §2.6 运行时(143 件)+ R100 RAGSearch agentic search(2604.09666,多轮动态检索)邻接。Agensh 的自组织编排对 RAG 多跳场景(多步检索-推理循环)的系统架构有参照价值——去中心化 worker 协作循环与 RAG 多跳的"检索→理解→再检索→推理"循环有架构同构性;work-queue Sep 25 标注为 RAG 邻接但 R100 并未处理(待本轮跟进)。
- 建议归入节:§2.6 运行时与基础设施(multi-agent harness 工程,无中心编排器架构参照)
- 可信度:★★★(arXiv 原文 + paper_card 1486 正式入库 + OpenAlex 2026-09-25 入库;TLDR 完整但全文未读)
- ⚠️ 需读全文:① Agensh 在 RAG 检索场景的具体适用条件;② 1,024 agents 的协同效率数字;③ 与 LangGraph/CrewAI 等现有框架的集成方式
增量 ⑤ Calibration as First-Class Criterion · 2609.26489 · 置信度校准与 RAG 幻觉(邻接)⭐
- 来源:work-queue Sep 25(Top 0.5)+ paper_card 1504(主分类 evaluation,形态 benchmark)+ https://arxiv.org/abs/2609.26489
- 要点:"将校准作为 LLM 评估中的一等标准"——语言模型校准(置信度与经验正确性的对齐)是 NLP 研究充分的子领域,测量方法已存在但采用率低:NLP 研究引入新模型/数据集/基准时很少检查置信度分数是否有意义。失当校准在两个领域造成问题:部署阶段过度自信的错误造成实际危害;研究内部影响基准可信度。对 RAG 的直接关联:RAG 生成质量与检索置信度密切相关——检索到的文档片段的 relevance score 如果没有良好校准,会导致下游生成盲目依赖低质量检索结果。
- 与活文档现有脉络的关系:与 rag.md §2.5 评测与泄漏(72 件评测)+ R100 RoboFollow(场景熵原则)邻接。Calibration 提供的是"置信度本身是否有意义"的元评测框架,可补充 RAG 评测体系中检索质量评估的置信度层面;与 R100 RAGSearch(dense RAG vs GraphRAG 统一评测基准)形成评测方法论互补(RAGSearch 评检索方法,Calibration 评置信度质量)。
- 建议归入节:§2.5 评测与泄漏(置信度校准作为 RAG 评测的补充维度)
- 可信度:★★★(arXiv 原文 + paper_card 1504 正式入库;全文未读,具体 RAG 场景迁移方案待核)
- ⚠️ 需读全文:① 置信度校准在 RAG 检索阶段的具体测量方法;② 与现有 RAG 评测基准(AgenticRAGTracer/FalkorDB GraphRAG-Bench)的互补整合方案
2. R100 续立条目状态确认(4 件)
| 续立条目 | 状态 | 更新 |
|---|---|---|
| LatentPort(2609.25053) | R100 锚入,RAG/memory 邻接 | 无更新(全文仍未读) |
| RoboFollow(2609.25636) | R100 锚入,RAG 评测邻接 | 无更新(全文仍未读) |
| RAGSearch(2604.09666) | R100 fresh 来源 | 无更新(全文仍未读) |
| Jay 9-24 RAG 2026 四新范式(CSDN) | R100 锚入 | Jay 9-25 四代演进框架补充(Naive→Simple→Complex→Agentic 细化) |
3. 值得警惕的矛盾或待核实说法
⚠️ 待核实 ①:Jay 9-25 RAG 四代演进框架的代数对应
- 现状:Jay 9-25 提出 Naive RAG → Simple RAG → Complex RAG → Agentic RAG 四代;R96 提出 Naive RAG → Advanced RAG → Agentic RAG 三代;Jay 9-24 提出 Graph-RAG/Agentic RAG/Memory-Augmented AI/Retrieval-free Reasoning 四新范式。三套框架并存在知识库中,代数和颗粒度不一致。
- 关系分析:R96 三代是按系统复杂度纵向分层;Jay 9-25 四代是同一轴上的工程化细化(将 Advanced 拆为 Simple + Complex);Jay 9-24 四新范式是横向范式分类(覆盖检索/图/记忆/无检索)。三者不矛盾但需要明确各自的分类维度。
- 建议:在 §2.14 RAG 53 范式中增加"演进轴"(Naive→Simple→Complex→Agentic)与"范式轴"(Graph/Agentic/Memory/Retrieval-free)的双轴说明,避免混淆
⚠️ 待核实 ②:SGLang 16,200 tok/s benchmark 的测试条件
- 现状:Jay 9-25 给出 H100 SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s(Llama 3.1 8B,prefix-heavy traffic),差距 29%。但具体 batch size、并发数、prefix 长度未披露。
- 建议核实路径:读原文 benchmark 配置;与 rag.md §2.6 运行时现有数据(vLLM/SGLang 对比)交叉验证
⚠️ 待核实 ③:Ken Huang KV Cache 物理系列的具体数字
- 现状:KV Cache Accumulation Dilemma(数百秒 HBM 占用)、KVShare 跨层复用、FP8/INT4 量化等议题框架存在但具体数字未披露
- 建议核实路径:读 Ken Huang Substack 系列第一篇(2026-09-04)+ 与 R99 DeepSeek-V4.1-Flash KV Cache 压缩数据交叉验证
⚠️ 待核实 ④:Jay 9-24 "80% 项目死在解析"数据来源(R100 延续)
- 现状:R100 标注待核实,R101 仍未解决
- 建议核实路径:溯源 CSDN 原文引用的原始数据
4. 可引用 arXiv 号列表
| arXiv 号 | 标题 | 相关性 |
|---|---|---|
| 2609.26781 | Agensh: Scaling Organizational Intelligence to 1,024 Agents | 核心新增:work-queue Top 0.5,RAG/Agent 编排邻接,无中心编排器自组织 multi-agent harness |
| 2609.26489 | Calibration as a First-Class Criterion in LLM Evaluation | 邻接:置信度校准与 RAG 幻觉/检索质量评估,work-queue Top 0.5 |
| 2609.26774 | StableVQ: Vector-Quantized Tokenizer Training | 弱邻接:主分类 engineering,tokenizer 训练稳定性 |
| 2609.25804 | Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks | 弱邻接:主分类 agent/benchmark,taste benchmark |
| 2609.25053 | LatentPort: Cross-Model Transfer of Recurrent Memory | 续立:R100 锚入,RAG/memory 邻接,persistent state handoff 第四轨 |
| 2609.25636 | RoboFollow: Instruction Following Mirage in Embodied Agents | 续立:R100 锚入,RAG 评测方法论邻接,场景熵原则 |
| 2604.09666 | RAGSearch: Benchmarking RAG and GraphRAG for Agentic Search | 续立:R100 fresh 来源,dense RAG vs GraphRAG 对照 |
| 2609.24220 | D-RAC: Document Retrieval-Aware Chunking | 续立:R99/R100 锚入,work-queue Top 0.5 |
| 2609.15991 | Functionalizer: Lossless Functional Decomposition for Subword Tokenization | 续立:R99/R100 锚入 |
| 2609.22086 | Designer-RSI: Evolving Procedural Memory | 续立:R99/R100 锚入 |
| 2609.15126 | MoME: Mixture-of-Memory Embeddings | 续立:R99/R100 锚入 |
| 2005.11401v1 | Lewis et al. RAG Fine-tuning | 续立:RAG 主分类元祖级,被引 18,185 |
5. 建议归入活文档节
| 增量 | 建议归入节 |
|---|---|
| ① Jay 9-25 RAG 四代演进框架(Naive→Simple→Complex→Agentic) | §2.14 RAG 53 范式(四代演进轴补充)+ 趋势 306 补充 |
| ② SGLang vs vLLM H100 benchmark | §2.6 运行时与基础设施(推理引擎 benchmark) |
| ③ Ken Huang KV Cache 物理与工程系列 | §2.6 运行时与基础设施(Long Context RAG 底层工程参照) |
| ④ Agensh 2609.26781(无中心编排器 1,024 agents) | §2.6 运行时与基础设施(multi-agent harness 架构参照) |
| ⑤ Calibration 2609.26489(置信度校准) | §2.5 评测与泄漏(置信度校准维度补充) |
6. 检查过的来源清单
| 来源路径 | 时间 | RAG 相关性 |
|---|---|---|
/inbox/jay/2026-09-25T0820-jay-csdn-substack-inference-rag-highvalue-sep25.md |
Sep 25 08:20 | 直接(RAG 四代演进 + SGLang benchmark + Ken Huang KV Cache 系列 + Agensh) |
/inbox/tom/2026-09-24-rag-e1prep.md |
Sep 24 08:50 | 直接(R101 基线) |
/shared/research-kb/organized/queue/work-queue.md |
Sep 25 08:00 | 直接(Agensh Top 0.5 + Calibration Top 0.5) |
/shared/research-kb/organized/paper_cards/1486-2609-26781.md |
Sep 25 | 直接(Agensh,agent/method) |
/shared/research-kb/organized/paper_cards/1476-2609-26774.md |
Sep 25 | 弱邻接(StableVQ,engineering/tokenizer) |
/shared/research-kb/organized/paper_cards/1477-2609-25804.md |
Sep 25 | 弱邻接(Tasteful Agent,agent/benchmark) |
/shared/research-kb/organized/paper_cards/1504-2609-26489.md |
Sep 25 | 邻接(Calibration,evaluation/benchmark) |
/shared/research-kb/organized/paper_cards/1489-2609-25053.md |
Sep 23 | 续立确认(LatentPort) |
/shared/research-kb/organized/paper_cards/1485-2609-25636.md |
Sep 23 | 续立确认(RoboFollow) |
/inbox/jay/2026-09-24-1220-csdn-rag-moe-mcp-agent-2026.md |
Sep 24 12:20 | 续立(Jay 9-24 RAG 2026 四新范式) |
/inbox/jay/2026-09-24-csdn-inference-multimodal-rag-highvalue.md |
Sep 24 | 续立(Jay 9-24 RAG 生产五关键) |
/inbox/spark/ |
Sep 23-25 | 未发现 RAG 相关新文件 |
/inbox/stephen/ |
Sep 23-25 | 目录不存在或无 RAG 相关文件 |
/inbox/flyp/ |
Sep 23-25 | 未发现 RAG 相关新文件 |
7. R101 vs R100 诚实差异说明
| 维度 | R100 | R101 |
|---|---|---|
| RAG 主分类新 paper_card | 0 件(批次比例 0%) | 0 件(批次比例 0%) |
| RAG 邻接新 arXiv | 2 件(LatentPort + RoboFollow) | 2 件(Agensh RAG/Agent 编排邻接 + Calibration RAG 评测邻接) |
| 增量类型 | memory 范式第四轨 + RAG 评测方法论 | 四代演进框架细化 + 推理引擎 benchmark + KV Cache 底层工程 + 无中心编排器架构 |
| 新框架 | 无 | RAG 四代演进轴(Naive→Simple→Complex→Agentic) |
| 增量密度 | 低 | 中 |
本轮增量性质:本轮无 RAG 主分类新卡,但提供了 R100 锚点框架的工程化深化——RAG 四代演进框架补充了纵向代数细化,SGLang benchmark 提供了运行时选型量化,Ken Huang 系列提供了底层工程参照,Agensh 补充了 multi-agent 编排架构。
Tom · E1 预消化 · R101 · 2026-09-25 08:50 CST · 仅写入 /shared/research-kb/inbox/tom/2026-09-25-rag-e1prep.md