研究知识库草稿 · Jay · 2026-09-06 下午补遗
实例: Jay
时间: 2026-09-06 15:05 CST
任务: 增量补遗 · 本日第四轮简报(14:50 后新发现)
写入路径: /shared/research-kb/inbox/jay/2026-09-06-1505-jay-afternoon-supplement.md
增量发现说明
本轮(15:05)与上一轮(14:50)间隔约 15 分钟,发现了若干下午时段新增内容: - vLLM 官方博客新文(41 分钟深度解剖 + Prefill-Decode disaggregation) - AAAI 2026 RAG 新范式:Agentic keyword search 挑战 vector database 默认地位 - "Internet for KV Cache" 论文(arXiv:2608.01526)概念框架 - vLLM RDT Sharded Weight Transfer 工业级 RL 同步方案
一、DATABASE(数据库 & 向量检索)
🔬 高价值 1:AAAI 2026 — Keyword Search 替代 Vector RAG 新证据 ⭐⭐⭐⭐⭐
来源: AAAI 2026(Subramanian et al.)
URL(引用来源): buzzgrewal.medium.com · "AI Agents Don't Need Vector Search Anymore"
原文论文: "Keyword search is all you need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use"
可信度: ⭐⭐⭐⭐⭐ 高(AAAI 2026 同行评审,Claude 3 Sonnet 同条件对比)
核心发现:
- 在 6 个数据集上,使用 Claude 3 Sonnet(200K context,temperature 0.001)同条件测试
- Agentic keyword search(通过 ReAct agent 调用 pdfmetadata/rga 等工具)达到 RAG faithfulness 的 94.5%
- Zero vector store,直接挑战 2024-2025 年"向量数据库是 RAG 默认基础设施"的共识
- Amazon Science 同期论文:Search-R1(RL 训练检索策略)比 RAG 高 24% relative
- Anthropic 内部多 Agent 研究系统:比单 Claude Opus 4 高 90.2% internal evals
评价: 这是 2026 年 RAG 范式转移的关键证据。向量搜索没有被淘汰,而是被降级到"明确需要语义泛化、超大规模稳定语料库"场景。工程启示:不要默认上向量数据库,先评估 workload 类型。 后续行动: 查找原文 PDF;标记 AAAI 2026 Agentic Search track
📚 中价值:向量数据库基准测试系统性批判(arXiv:2507.00379)
来源: arXiv · "Towards Robustness: A Critique of Current Vector Database Assessments" 可信度: ⭐⭐⭐ 中(系统性批判方法论,有实验支撑) 核心问题: - 厂商基准(VectorDBBench 等)存在架构偏向性,自评偏高 - 连续数据流入场是生产级 RAG 的真实挑战:Milvus 团队承认"benchmarks test after data ingestion completes, but production data never stops flowing" - 2026 年集成平台(PostgreSQL+pgvector / Actian VectorAI DB)比"vector-only"竖井更有竞争力
评价: 对选型有参考价值,但结论偏行业趋势,非具体性能数据。适合纳入架构选型 checklist。 后续行动: 与 11:05 简报中 pgvector vs 托管向量服务条目合并
二、BACKEND(推理系统 & LLM 基础设施)
🔬 高价值 1:vLLM 官方博客 — "Inside vLLM: Anatomy of a High-Throughput LLM Inference System" ⭐⭐⭐⭐⭐
来源: vLLM Blog · 2026-08/09 URL: https://blog.vllm.ai/blog 类型: 41 分钟深度技术长文 · 系统解剖 可信度: ⭐⭐⭐⭐⭐ 极高(vLLM 官方工程团队撰写,覆盖所有核心组件) 覆盖内容: - PagedAttention 原理(block-level 内存管理,减少 fragmentation) - Continuous Batching(iteration-level 调度,maximize GPU utilization) - Prefix Caching(共同前缀复用的工程实现) - Speculative Decoding(EAGLE / Medusa / n-gram 各路径对比) - Multi-GPU Serving(Tensor Parallelism + Pipeline Parallelism) - Scheduling(请求队列 + 优先级 + 抢占策略) - Benchmarking 方法论
评价: 这是目前最完整的 vLLM 内部原理中文可读材料。41 分钟适合精读,建议纳入本实例 inference engine 知识页核心参考文献。 后续行动: 精读第三、四节(Scheduling + Benchmarking);等官方发布 PDF 或 markdown 版本
🔬 高价值 2:vLLM — "Next-Level Inference: Prefill-Decode Disaggregation on AMD MI300X" ⭐⭐⭐⭐
来源: vLLM Blog · 2026 URL: https://blog.vllm.ai/blog 可信度: ⭐⭐⭐⭐ 高(vLLM 官方,含实测数据) 核心内容: - 单节点 8-GPU MI300X 上做 prefill/decode disaggregation - 使用 AMD MORI-IO 实现 KV cache 高效传输(跨 Prefill/Decode 实例) - 收益:ITL(Inter-Token Latency)更稳定,goodput 提升 - 适用场景:长 prompt + 短生成的工作负载(如 agent system prompts)
评价: 之前普遍认为 disaggregation 只能多节点实现。本文证明单节点 AMD 生态也可以,值得评估。 后续行动: 对比 NVIDIA 生态的 prefill/decode disaggregation 方案(TensorRT-LLM / DistBelief );等 H100 复现数据
📝 工程数据:vLLM RDT — Sharded Weight Transfer for Online RL ⭐⭐⭐⭐
来源: vLLM Blog · 2026-08-22 URL: https://vllm.ai/blog/2026-08-22-rdt-weight-transfer 可信度: ⭐⭐⭐⭐ 高(官方工程博客,含 benchmark 数据) 核心数据: - Kimi K2 model in BF16,48 节点 × 8×H100(32 节点 trainer + 16 节点 inference) - 使用 Ray Direct Transport(RDT)实现 GPU-GPU 直传,7.53 秒完成全量权重同步 - RDT:Ray actor method 返回 GPU tensor 而不经过 CPU 拷贝;支持 NCCL/GLOO/NIXL pluggable backend - 实现位于 vLLM,SkyRL 端到端示例已开源
评价: Online RL(verl / SkyRL / Slime / NeMoRL)场景的核心工程突破。48 节点 7.53 秒意味着 RL 训练循环的 weight sync 不再是瓶颈。 后续行动: 检查 SkyRL GitHub 仓库 RDT 集成状态;对比 DeepSpeed-MII 或 Megatron-LM 的 weight transfer 方案
📚 新概念:Internet for the KV Cache(arXiv:2608.01526)⭐⭐⭐
来源: arXiv · 2026 URL: https://arxiv.org/html/2608.01526v1 可信度: ⭐⭐⭐ 中高(概念框架预印本,工程可行性待验证) 核心命题: - KV Cache 已不仅是 serving 优化技术,而成为存储、通信、调度的基础原语 - LMCache(2025)、TensorRT(NVIDIA 2026)、llm-d(2026)、NVIDIA Dynamo(2026)均在做 KV Cache 跨引擎/跨查询复用 - KV Cache = compact + persistent + steerable contextual knowledge representation
评价: 概念先行,工程落地不完整。但方向正确:2026 年 KV Cache 正在从"缓存优化"演进为"一级基础设施"。适合纳入趋势观察,不适合立即工程落地。 后续行动: 跟踪 LMCache 项目进展;与 CacheBridge(arXiv:2609.00891,交叉模型 KV transfer)对照
三、CLOUD-NATIVE(K8s & 分布式系统)
📝 候选:vLLM on AMD MI300X 完整部署路径
来源: vLLM Blog + AMD ROCm 生态 可信度: ⭐⭐⭐ 中(生态文档,benchmark 来自官方) 增量信息: - AMD MI325X / MI300X 上 vLLM 已知问题:AITER_ENABLE_VSKIP=0 需显式设置(DeepSeek 模型稳定运行必需) - vLLM 0.14.1 在 MI325X 上验证通过
评价: 与本日 11:05 简报中 openFuyao(昇腾)形成 GPU 多元化视角,AMD ROCm 生态值得持续跟踪。 后续行动: 记录 AMD ROCm + vLLM 部署 checklist
四、CSDN(本日无新增高价值条目)
说明: 本轮检索未发现新的 CSDN 高价值文章。已有条目(昇腾推理加速、Triton C++ Backend)维持原优先级。
五、REPRODUCTION(可复现工程路径)
| 条目 | 环境要求 | 复现难度 | 优先级 |
|---|---|---|---|
| vLLM Inside 精读 | 任意 GPU | 低(文档阅读) | P1 |
| vLLM Prefill-Decode Disagg | AMD MI300X × 8 | 中(需硬件) | P2 |
| RDT Sharded Weight Transfer | 48×H100 + Ray | 高(需集群) | P3 |
| AAAI 2026 Agentic keyword search | Claude API | 低(论文复现) | P1 |
六、分类标签汇总
| 条目 | 标签 |
|---|---|
| AAAI 2026 keyword search vs RAG | rag agentic-search vector-db aaai-2026 benchmark |
| Vector DB benchmark critique | vector-db benchmark methodology |
| Inside vLLM 深度解剖 | vllm inference-engine pagedattention continuous-batching speculative-decoding |
| vLLM Prefill-Decode Disagg | vllm prefill-decode amd-mi300x inference-engine |
| vLLM RDT Sharded Weight Transfer | vllm rl weight-sync ray distributed |
| Internet for KV Cache | kv-cache infrastructure llm trends |
七、本轮建议写入路径
本次草稿: /shared/research-kb/inbox/jay/2026-09-06-1505-jay-afternoon-supplement.md
建议后续知识页(由同步任务处理 GitHub 写入):
1. docs/inference-engines-2026-benchmark.md — 整合 vLLM Inside + Prefill-Decode Disagg + RDT(更新)
2. docs/rag-architecture-2026.md — 整合 AAAI 2026 agentic keyword search + Mem0/Atlan memory 条目(本日已有素材)
精读优先级: 1. AAAI 2026 "Keyword Search is All You Need"(P1,等 PDF) 2. Inside vLLM 深度解剖(P1,41 分钟精读) 3. Prefill-Decode Disaggregation on AMD(P2,等 H100 数据) 4. Internet for KV Cache(P3,概念参考)
八、与本日已覆盖内容的去重说明
| 已有条目(14:50 前) | 本轮新补充 | 关系 |
|---|---|---|
| SGLang vs vLLM benchmark(AIMultiple/LeetLLM) | Inside vLLM 深度解剖 | 互补:benchmark 数据 → 系统原理 |
| CacheBridge(交叉模型 KV transfer) | Internet for KV Cache | 互补:具体方案 → 概念框架 |
| Agentic RAG(arXiv:2603.07379) | AAAI 2026 keyword search | 直接关联:RAG 范式转移新证据 |
| Triton C++ Backend(CSDN) | vLLM RDT Sharded Weight Transfer | 互补:推理引擎 → 训练推理同步 |
起草:Jay · 2026-09-06 15:05 CST · 不含 GitHub 写入操作