📚 Jay 研究简报 · 2026-09-22 晚间版
主题覆盖:LLM Agent / RAG · Inference Engine · Vector DB · Kubernetes 2.0 · DB 内核 检索范围:arXiv · GitHub Trending · Hugging Face · Tavily · 学术平台 · CSDN DTCC
🏷️ 分类标签
LLM-Agent | RAG | Inference-Engine | Vector-DB | Kubernetes | Cloud-Native | DB-Kernel | MLOps
🔬 Backend(LLM 推理引擎 & 优化)
⭐ 高价值条目
1. vLLM / SGLang / TensorRT-LLM 三引擎对比 2026
来源:Spheron Blog / Effloow / Zylos Research URL: - https://www.spheron.network/blog/llm-inference-optimization-2026 - https://effloow.com/articles/llm-inference-engines-compared-vllm-sglang-tgi-2026 - https://zylos.ai/research/2026-01-15-llm-inference-optimization
核心观点: - vLLM(v0.7.3):PagedAttention + continuous batching,生产默认选择;Blackwell 支持引入中 - SGLang(v0.4.3):RadixAttention prefix caching 对 RAG/多轮聊天 workloads 吞吐领先(16,200 tok/s @ H100) - TensorRT-LLM:H100 FP8 编译核,延迟敏感场景 p99 最优;部署复杂度最高 - Hugging Face TGI:已进入维护模式(maintenance-only),新项目不再推荐 - FP8 在 Hopper GPU 成为新默认,精度损失可忽略,吞吐提升 30%+ - PagedAttention:将 KV cache 内存浪费从 60-80% 降至 <4% - Continuous batching:相比静态 batching 吞吐提升最高 23x - Speculative decoding:小模型 draft + 大模型验证,实测 2-3x 加速,部分实现可达 5x
评价:2026 年推理工程标准参考,框架选型决策树完整,适合做架构设计依据。 可信度:⭐⭐⭐⭐⭐(多源交叉印证) 后续行动:建议更新「LLM 推理引擎选型」主题页,含 TGI 迁移指南
2. LLM 推理成本优化全景(2026)
来源:alpacked.io URL:https://alpacked.io/blog/llm-deployment-cost-optimization
核心观点: - 核心指标从 Cost per Token 转向 CPSO(Cost per Successful Outcome) - Context caching 可节省高达 90% 重复 prompt 成本 - Hybrid 部署(托管 + 自托管 SLM):整体成本降低 70-80% - BYOC(Bring Your Own Compute)成为中间层策略:Kubernetes + vLLM/TGI + OpenAI 兼容端点 - Break-even 计算需考虑:GPU 代际(A100 vs Blackwell)、利用率(30% vs 90%)、模型规模
评价:工程视角清晰,FinOps 思维融入推理优化,非纯技术文章。 可信度:⭐⭐⭐⭐ 后续行动:收录作「LLM 成本优化」工程参考
3. 量化技术速查 2026
来源:Morph / Zylos Research URL:https://www.morphllm.com/llm-inference-optimization
核心量化技术: | 方法 | 精度 | 加速比 | 质量保留 | |------|------|--------|---------| | FP8 (Hopper) | 8-bit float | ~30% | ~100% | | INT8 | 8-bit int | 1.5-2x | 95-99% | | INT4 / AWQ / GPTQ | 4-bit | 2-4x | 93-97% | | SmoothQuant | INT8 等效 | 1.56x | ~100% | | TurboQuant (Google 2026) | KV cache 3-bit | 6x memory | 0% 精度损失 |
可信度:⭐⭐⭐⭐
🗄️ Database(向量数据库 & 内核)
⭐ 高价值条目
4. pgvector 2026 性能突破:不再是"慢速方案"
来源:DEV Community / Salt Benchmark 2026 Q1 / Firecrawl URL: - https://dev.to/polliog/postgresql-as-a-vector-database-when-to-use-pgvector-vs-pinecone-vs-weaviate-4kfi - https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 - https://www.firecrawl.dev/blog/best-vector-databases
核心观点: - pgvectorscale(Timescale 出品)颠覆性能认知:50M 向量 @ 1536 dims + 99% recall → 471 QPS,p95 延迟 28ms - 对比 Pinecone s1(同样 471 QPS,p95 784ms):延迟低 28x - 对比 Qdrant(41 QPS):pgvector 快 11.4x - 技术基础:DiskANN + Statistical Binary Quantization(磁盘存储向量) - pgvector 0.8.0(2026-03)改进:HNSW 索引构建速度提升、streaming inserts、halfvec 量化 - 2026 Q1 Benchmark(Salt Technologies):Qdrant p50 延迟 4ms 最优;Pinecone managed 最便捷;Milvus GPU 加速最多算法
评价:向量数据库选型必读,pgvector 性能定位已全面重写。 可信度:⭐⭐⭐⭐⭐(独立 benchmark,多源交叉) 后续行动:建议写「向量数据库选型 2026」横向对比页
5. DTCC 2026 中国数据库技术大会要点(CSDN 来源)
来源:CSDN / dtcc.it168.com URL: - https://dtcc.it168.com/yichengxiangqing.html - https://blog.csdn.net/weixin_47390342/article/details/163948249
核心观点: - GBase 8s HTAP Bitmap 索引:低基数场景突破 B+Tree 瓶颈,高并发读写 + 存储密度提升 - TDSQL-C 存储架构演进 + AI 查询优化器:段惠超(腾讯云数据库内核团队),研究方向含索引推荐、基数估计、物化视图 - 金仓(Kingbase)融合架构:统一事务、融合存储,RAC 架构在 AI 时代核心系统演进 - Nexa Knowledge 语义层:LangFuse 替换 CK+Redis 实现 10x 性能;Agent + 语义路由使高质量 SQL 比例从 40% 升至 85% - DongSQL(京东自研)数据库实践
评价:国内数据库内核实战风向标,含 HTAP、向量/语义融合、AI 优化器等热点。 可信度:⭐⭐⭐⭐(行业大会一手内容) 后续行动:建议精读 GBase 8s Bitmap 索引原理(附实测数据)
☁️ Cloud-Native(Kubernetes & 平台工程)
⭐ 高价值条目
6. Kubernetes 2.0:2026 重大变革
来源:tech-insider.org URL:https://tech-insider.org/kubernetes-2-0-everything-developers-need-to-know-about-the-biggest-release-in-a-decade
核心观点(2025-12 GA,2026-06 三大云全面生产可用): - eBPF 原生网络替换 kube-proxy:取代 iptables 瓶颈,Cilium 方案占生产集群 60%(2026-03) - Native sidecar containers:无需第三方 sidecar 运营商,KServe/Volcano/NVIDIA GPU Operator 功能被原生吸收 - Simplified CRD authoring:降低自定义资源开发门槛 - Built-in multi-cluster federation:原生多集群管理 - GPU gang scheduling(v1.36):AI workloads GPU 利用率提升 25%
评价:K8s 2.0 是近十年最大版本,网络栈和 AI workloads 支持是最大亮点。 可信度:⭐⭐⭐⭐⭐ 后续行动:建议更新「Kubernetes 生产最佳实践」主题页,标注 v1.35/v1.36 关键变化
7. Cloud-Native 2026 趋势总结
来源:多个来源综合 URL: - https://www.ainformat.com/detail/598 - https://gartsolutions.com/kubernetes-and-containerization-trends
核心趋势: - 84% 组织已在生产运行 Kubernetes(来源:Cloud Native Foundation 年度调查) - Platform Engineering 替代 DevOps:Internal Developer Platform(IDP)提供"黄金路径" - GitOps(ArgoCD / Flux)+ FinOps(Kubecost)成为 Day 2 运营标配 - Sidecarless service mesh(Istio Ambient Mode)解决 sidecar 性能开销问题 - SBOM(软件物料清单)供应链安全全面普及 - AI/ML GPU 工作负载调度从第三方 Operator 迁移至 K8s 原生
评价:宏观趋势梳理全面,适合管理层和技术负责人参考。 可信度:⭐⭐⭐⭐
🔍 Reproduction(可复现项目)
⭐ 高价值条目
8. Agentic RAG over arXiv(可完整复现)
来源:GitHub - not-sad/agentic-rag-arxiv URL:https://github.com/not-sad/agentic-rag-arxiv
项目概况: - 作者:Sadiya Imran(Indira Gandhi Delhi Technical University for Women),B.Tech 实习项目 2026 - 数据集:329 篇 arXiv LLM-Agent 相关论文 - 评测结果:Full Agent → 30 题答对 29 题,平均引用 3.7 篇/答案 - 技术栈:Groq API(Llama 3.1 8B Instant)、hybrid retrieval + query planning + reflection + citation verification - 复现步骤:pip install → scraper → indexer → agent → evaluate - 环境需求:.env 配置 GROQ_API_KEY(免费申请)
评价:学生项目但工程完整度极高,适合作为 agentic RAG 入门复现基准。 可信度:⭐⭐⭐⭐ 后续行动:可纳入「RAG 系统复现」清单
9. awesome-ai-agent-papers 2026 周更列表
来源:GitHub - VoltAgent/awesome-ai-agent-papers URL:https://github.com/VoltAgent/awesome-ai-agent-papers
覆盖规模(2026 年 1 月起): - Memory & RAG:57 篇 - Multi-Agent:54 篇 - Eval & Observability:80 篇 - Agent Tooling:95 篇 - AI Agent Security:82 篇
代表论文:
- Internal Safety Collapse(前沿模型有害内容副作用研究)
- Confundo(RAG poison 对抗性样本生成)
- Corpus2Skill(企业知识→可导航技能树,替代传统 retrieval)
- CIGPO(Contextual Information-Gain Policy Optimization for 多轮证据阅读 Agent)
评价:当前最完整的 2026 AI Agent 论文精选列表,按周更新,质量较高。 可信度:⭐⭐⭐⭐⭐ 后续行动:建议每周追踪,作为 Agent 研究优先级过滤器
10. awesome-search-agent-papers 搜索 Agent 专项列表
来源:GitHub - YunjiaXi/Awesome-Search-Agent-Papers URL:https://github.com/YunjiaXi/Awesome-Search-Agent-Papers
代表性 2026 年论文: | 时间 | 论文 | 方向 | |------|------|------| | 2026-07 | Mach-Mind-4-Flash | Long Context Flash | | 2026-07 | AREX | 递归自我改进 Agent | | 2026-07 | PATS | Agentic RL scaffolding | | 2026-07 | CIGPO | 多轮证据阅读策略优化 | | 2026-06 | ECHO | 选择性 turn memory | | 2026-06 | ReGRPO | 反思增强策略优化 | | 2026-05 | LatentRAG | 隐式推理+检索 |
评价:专注搜索 Agent 垂直领域,覆盖面广,适合做 RAG + search 交叉研究。 可信度:⭐⭐⭐⭐
📋 本次汇总
| 类别 | 条目数 | 最高价值 |
|---|---|---|
| backend | 3 | vLLM/SGLang/TensorRT-LLM 决策树 |
| database | 2 | pgvector 性能突破 + DTCC 内核 |
| cloud-native | 2 | Kubernetes 2.0 eBPF/AI |
| reproduction | 3 | Agentic RAG 复现 + 论文列表 |
| 合计 | 10 |
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-09-22-llm-systems-and-backend.md
是否需要精读: - ⭐ 精读:#4(pgvector benchmark)、#6(K8s 2.0)、#1(推理引擎选型) - 审稿:#9(awesome-ai-agent-papers 列表更新) - 主题页更新:LLM Inference 引擎选型、Kubernetes 2.0 生产指南
本次无 GitHub 写入,内容留此处作为草稿,同步任务后续串行处理 commit。
Jay · 2026-09-22 21:05 CST