Jay · 五分类简报 · 2026-09-11 11:05 (UTC+8)

本简报覆盖:LLM 推理优化 / RAG 系统 / AI Agent / 多模态 / 向量数据库
检索范围:arXiv (cs.AI/cs.CL/cs.MA/cs.AR) · Web 搜索 · 技术博客 · Substack
本轮共发现候选条目 30+,精选高价值条目如下


1. Database / Vector DB

🔷 Vector DB 2026 生产选型指南(8DB 对比)

来源: Digital Applied · 2026-04-28
URL: https://www.digitalapplied.com/blog/vector-databases-for-ai-agents-pinecone-qdrant-2026

核心内容: - 2026 年向量数据库格局已高度收敛,生产环境 8 大选手中: - 托管型头部:Pinecone(~10–15ms延迟)、Vertex Vector(GCP) - 开源主力:Qdrant(Rust 栈,开源最快 ~12ms)、Weaviate(混合搜索+GraphQL)、Milvus(大规模) - 轻量/原型:Chroma(开发者体验最优)、pgvector(Postgres 集成,~25–40ms) - 超大规模:Vespa(混合搜索) - 延迟排名(OSS 自托管):Qdrant ≈12ms > Weaviate ≈16ms > Milvus ≈18ms > pgvector ≈25–40ms - 生产 RAG 主流收敛路径:Qdrant(自托管)或 Pinecone(托管),pgvector 随 pgvectorscale 升级后份额上升

评价: 实用的 2026 中期选型快照,重点在延迟与规模权衡,非学术深度但对工程决策有参考价值。


🔷 向量数据库全面对比(2026-04 · aiml.qa)

来源: aiml.qa · Aizhan Azhybaeva · 2026-04-22
URL: https://aiml.qa/vector-database-comparison-2026

核心内容(与上条互补): - UAE CBUAE AI Guidance + PDPL 合规视角下的选型框架 - pgvector + pgvectorscale 扩展路径明确(适合已有 Postgres 基础设施的团队) - 超大规模多模态场景推荐 Milvus 或 Vespa - 各库量化评分:托管生态 / 开源灵活性 / 合规支持 / 延迟

评价: 补充了合规与多云部署视角,与上条合并可构成较完整的选型决策树。


📌 Database 类标签: vector-db production-decision qdrant pgvector pinecone milvus
建议写入路径: database/vector-db-2026-landscape.md
精读建议: 选型参考,非深度学术,可作工程 checklist 引用


2. Backend / Inference Engineering

🔷 vLLM · Ray Direct Transport 大规模分片权重传输(2026-08-22)

来源: vLLM 官方博客
URL: https://vllm.ai/blog/2024-09-05-perf-update(2026-08-22 更新)

核心内容: - vLLM 原生实现基于 Ray Direct Transport(RDT)的大规模分片权重传输引擎 - 在 48×8×H100 节点集群上,Kimi K2 模型(BF16)权重传输仅需 7.53 秒 - 这是 vLLM 在 2026 年中后期显著加强的分布式推理通信路径,对 MoE 大模型意义重大

评价: 高价值生产工程细节,对分布式推理训练/服务一致性有直接参考意义。


🔷 IsoExec · 消除 Trainer-Inference 数值不匹配的统一执行框架(2026-08-21)

来源: vLLM 博客 · SkyRL
URL: 同上

核心内容: - 提出 Trainer 侧(Megatron)与 Inference 侧(vLLM)数值执行不匹配问题 - IsoExec 统一两个 runtime 的数值执行路径,降低平均误差 - 对 RL 训练后部署场景有直接价值(SkyRL 生态)

评价: 学术与工程结合紧密,RL + LLM 服务化趋势中的关键问题。


🔷 InferenceBench · LLM 推理优化的开放基准(arXiv:2607.20468 · 2026)

来源: arXiv · cs.AI
URL: https://arxiv.org/abs/2607.20468

核心内容: - 提出专为 AI Agent 场景设计的 LLM 推理优化 benchmark - 评估目标:开放性问题下的推理时优化效果(非固定 benchmark) - 覆盖多步推理、长上下文、多模态场景

评价: 基准设计思路值得关注,是 2026 年 MLsys 方向较新的 benchmark 贡献。


🔷 LLM Serving 需要数学优化与算法基础,而非启发式(arXiv:2605.01280 · 2026)

来源: arXiv · 2026
URL: https://arxiv.org/html/2605.01280v1

核心内容: - 核心论点:当前 LLM serving 系统过度依赖启发式调度,缺乏理论保障 - 提出 barrier-synchronized, sticky-assignment 数据并行解码的在线优化框架 - 给出最坏情况下不平衡度削减的严格理论保证:Ω(√(B log G)) 尺度 - Chen et al. 2026 的整数规划公式与证明

评价: ⭐ 高价值理论文章,对理解分布式 LLM 调度底层问题有重要意义,建议精读。


🔷 AMD Instinct GPU 架构感知 LLM 推理优化(arXiv:2603.10031 · 2026)

来源: arXiv · cs.AR
URL: https://arxiv.org/abs/2603.10031

核心内容: - 40 页技术报告,30 张表格,覆盖 AMD Instinct 系列 GPU 上的 LLM 推理基准 - 对 NV H100 与 AMD MI300X 的量化对比 - 跨架构推理优化路径(RoCM 栈 + ROCm 版本差异)

评价: 非 NVIDIA 生态推理部署的稀缺工程参考,对 AMD GPU 用户有直接价值。


📌 Backend 类标签: llm-inference vllm scheduling distributed-systems kv-cache amd-gpu
建议写入路径: backend/inference-systems-sep2026.md
精读建议: ⭐ arXiv:2605.01280(理论调度)、vLLM RDT(生产工程)


3. Cloud-Native / MLOps

🔷 KubeCon NA 2026 · AI Inference Track 追踪

来源: 技术社区汇总 · 2026-08-30
URL: 任务日志已覆盖(见 /shared/research-kb/inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md

核心要点(任务日志摘要): - KubeCon NA 2026 AI Inference 专题覆盖:K8s 调度 × GPU 分配 × inference serving 集成 - SIG-MLSys 工作组推进 K8s 原生推理 API 标准化 - 主要关注:Pod 级别 GPU 调度、KVCache ephemeral storage、模型镜像预热策略

评价: KubeCon NA 2026(通常 11 月)的内容预热,实际动态需等 11 月会后汇总。


📌 Cloud-Native 类标签: kubernetes kubecon gpu-scheduling kvcache sig-mlsys
建议写入路径: cloud-native/kubecon-na-2026-preview.md(待 11 月会后更新)
精读建议: 低优先级,可作后续追踪占位


4. CSDN 高价值

今日 CSDN 候选条目已由 Jay 09:12 工程过滤器覆盖(见 2026-09-11_engineering.md
本次简报补充近期高质量 CSDN 条目(非重复):

🔷 vLLM OOM 排障与 Runbook(CSDN · 精选)

来源: Jay 晨间工程过滤器(2026-09-11 09:12)
URL: 2026-09-11_engineering.md → 原链接已收录

评价: 近期 OOM 根因分析模板,直接可用于生产 Runbook 编写。


📌 CSDN 类标签: vllm oom-troubleshooting production-runbook
建议写入路径: csdn/production-troubleshooting-vllm-oom.md
精读建议: 选读,可整合入团队 SRE Runbook 库


5. Reproduction / Research

🔷 RAG for AIGC 综述(Springer · Data Science and Engineering · 2026-01)

来源: Springer · Zhao, Zhang, Yu et al. · 2026-01-02 发表,2026-03 正式出版
URL: https://link.springer.com/article/10.1007/s41019-025-00335-5

核心内容: - 系统综述 RAG 在 AIGC 场景中的应用(2020–2026) - 按 retriever 如何增强 generator 分类 - 关键洞察:噪声检索结果有时反而能提升生成质量(反直觉但有实验支撑) - LongLive-RAG:将长视频生成建模为 RAG 问题,解决滑动窗口注意力中的 identity drift

可信度: ⭐⭐⭐ 学术期刊同行评审,引用价值高


🔷 Mario · 多模态图推理(arXiv:2603.05181 · CVPR 2026)

来源: arXiv · cs.CV
URL: https://arxiv.org/abs/2603.05181

核心内容: - CVPR 2026 接收论文 - 将图结构引入多模态 LLM,提升结构化视觉推理能力 - 应用于图表理解、文档理解等场景

可信度: ⭐⭐⭐ CVPR 2026 接收


🔷 Reasoning-Driven Multimodal LLM for Domain Generalization(arXiv:2602.23777 · ICLR 2026)

来源: arXiv · cs.AI
URL: https://arxiv.org/abs/2602.23777

核心内容: - ICLR 2026 Poster - 研究多模态 LLM 在分布外(OOD)泛化能力 - 提出推理驱动方法增强跨域鲁棒性

可信度: ⭐⭐⭐ ICLR 2026 接收


🔷 From Language Models to World-Acting Systems(arXiv:2609.04894 · 2026-09)

来源: arXiv · Zhu, Cai · 2026-09-07 提交
URL: https://arxiv.org/abs/2609.04894

核心内容: - 29 页综述,文献截止 2026-08-31 - 系统梳理 AI Agent 从数字环境到物理环境的行动能力进展 - 覆盖:MCP、Agent2Agent 互操作进展,多 Agent 组织架构,evidence-aligned 评估方法

可信度: ⭐⭐⭐ 新提交,值得追踪


🔷 Agentic RAG · 2026 Systematization of Knowledge(SoK)

来源: Turing Post · 2026
URL: https://www.turingpost.com/p/ragtypes

核心内容: - Agentic RAG 定义:将检索建模为多步决策过程而非单次 retrieve-then-generate 管道 - 20 种 Advanced RAG 类型总结(2026) - A-RAG:层级检索接口的多步扩展方案 - 2026 RAG 趋势:从向量相似搜索走向长文档记忆、自适应检索、多模态 grounding

评价: 实用的技术分类框架,非原创研究但有调研价值


🔷 Substack · All You Need to Know About RAG in 2026(Aishwarya Srinivasan)

来源: Aishwarya Srinivasan Substack · 2026
URL: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-rag-in

核心内容(付费内容摘要): - 2026 Vanilla RAG 失效原因分析 - 高级 Chunking 策略(Fixed-size → Semantic → Agentic splitters) - Hybrid Search + Reciprocal Rank Fusion(向量 × BM25 融合) - Cross-Encoder Reranking 的关键作用 - Query Transformation(multi-query、step-back、HyDE)

可信度: ⭐⭐ 中高,可作为 RAG 工程 checklist


📌 Reproduction 类标签: rag survey agentic-rag multimodal agent arxiv-fresh
建议写入路径: reproduction/rag-agent-aiagent-research-sep2026.md
精读建议: ⭐⭐⭐ arXiv:2609.04894(Agent综述)、Springer RAG Survey(期刊综述)


汇总

分类 高价值条目数 最高价值 建议动作
Database 2 8-DB 对比报告(工程选型) 纳入选型决策树
Backend 5 arXiv:2605.01280(调度理论) ⭐ 精读
Cloud-Native 1 KubeCon NA 2026 Preview 追踪占位
CSDN 1 vLLM OOM Runbook Runbook 整合
Reproduction 6 arXiv:2609.04894 / Springer RAG Survey ⭐ 精读

本简报由 Jay 实例生成 · 2026-09-11 11:05 UTC+8
草稿目录:/shared/research-kb/inbox/jay/
请勿直接写入 review/ 或 published/,GitHub 合并由单独同步任务处理