📚 Jay 研究简报 · 2026-07-18

检索时间:2026-07-18 21:05 (Asia/Shanghai) 覆盖范围:database · backend · cloud-native · csdn · reproduction 本次搜索源:Tavily (arXiv / Substack / GitHub / 技术博客)


🗄️ Database

⭐ 高价值

1. PostgreSQL-V:解耦式高速向量搜索 [CIDR 2026]

  • 来源cs.purdue.edu PDF · 普渡大学
  • 核心观点:pgvector 继承 PostgreSQL 页面结构导致性能瓶颈;PostgreSQL-V 提出架构解耦设计,将向量索引与 PostgreSQL 核心引擎分离,兼顾崩溃一致性与高吞吐。关键机制:利用 LSM-based 框架 + 轻量级索引一致性保证。
  • 评价:⭐⭐⭐⭐ 有 CIDR 2026 学术背书的工程系统论文,方向是 2026 向量数据库领域值得关注的技术路线之一。
  • 标签database vector-search postgresql CIDR2026 research
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-18-postgresql-vector.md

2. pgvector vs Pinecone vs 专用向量库 2026 全面对比

  • 来源BuildSpace Blog / BirJob
  • 核心观点(综合):
  • 2026 年 pgvector 基准神话破除:在 1M 向量 / 1536 dim 下,pgvector p50 ≈ 18ms,但 RAG 管道中向量搜索几乎从不是瓶颈(embedding 调用 + LLM 生成主导延迟)。
  • pgvector 最大优势:SQL 联合查询 + 元数据过滤可在一个语句内表达,竞品需应用层 JOIN。
  • Snowflake $250M 收购 Crunchy Data、Databricks $1B 收购 Neon,印证"向量是数据类型而非数据库类别"论断。
  • 50M 向量以下 pgvector 是默认选择;超大规模选 Qdrant / Milvus。
  • 评价:⭐⭐⭐⭐⭐ 生产决策级对比,附量化数据和实际迁移案例,适合入库作为 RAG 向量选型参考。
  • 标签database vector-search pgvector benchmark production

3. Vector DB Benchmark 2026(10 库 19 字段)

  • 来源Salt Technologies AI · Q1 2026 CC BY 4.0
  • 关键数据(1M 向量 / 1536 dim): | DB | p50 | p99 | |---|---|---| | Qdrant | 4ms | 25ms | | Redis | 5ms | 20ms | | Milvus | 6ms | 35ms | | Pinecone | 8ms | 45ms | | pgvector | 18ms | 90ms |
  • 评价:⭐⭐⭐⭐ 可下载 CSV/JSON,基准方法论透明,适合引用。
  • 标签database benchmark vector-search

⚙️ Backend

⭐ 高价值

1. LLM Inference Engine 2026 完整对比(vLLM / SGLang / TGI / TensorRT-LLM / llama.cpp)

框架 最佳场景 吞吐 上手难度
vLLM 生产 Serving 120-160 req/s 小时级
SGLang Agent / RAG 多轮 最高达 vLLM 3.1x 小时级
TensorRT-LLM 极致 NVIDIA 性能 最高 1-2 周
llama.cpp Edge / 本地 视硬件 分钟级
Ollama 开发 / 原型 中等 分钟级
  • 关键洞察
  • SGLang 的 RadixAttention 在多轮对话和 Agent 工作流中复用 KV cache,实现 2-3x 吞吐提升。
  • vLLM PagedAttention + continuous batching 仍是行业标准,相比静态 batching 提升最高 23x。
  • H100 定价已正常化($3-4/hr),成为默认训练/推理 GPU。
  • 评价:⭐⭐⭐⭐⭐ 框架选型必读,代码示例 + benchmark 数据均有。
  • 标签backend LLM-inference vLLM SGLang performance

2. SGLang 深度解析:RadixAttention 原理

  • 来源Inference.net · 2026-01-26
  • 核心观点:SGLang = 前端(结构化生成 DSL)+ 后端(RadixAttention)。RadixAttention 自动在 KV cache 中识别并复用重复 prompt 片段,对多轮对话和 RAG 管道提升显著。
  • 评价:⭐⭐⭐⭐ 原理讲解清晰,有代码示例,适合作为 SGLang 入门材料。
  • 标签backend SGLang KV-cache LLM-inference

3. LLM 推理优化栈(2026)

  • 来源Medium · 系统设计手册
  • 核心总结:vLLM 优化内存布局(where),SGLang 优化时序调度(when),两者结合可实现数量级的成本削减。
  • 评价:⭐⭐⭐ 总结性文章,适合快速了解优化全貌。
  • 标签backend LLM-inference optimization

☁️ Cloud-Native

⭐ 高价值

1. CNCF 云原生开发状态报告 Q1 2026

  • 来源CNCF PDF
  • 核心数据:Kubernetes 社区达 2000 万开发者,云原生生态成为 AI 工作负载底座。
  • AI 开发者云原生成熟路径:实验/训练阶段 → 数据管道(事件驱动、流式)→ 可观测性工具。
  • 洞察:observability 与 chaos engineering 呈负相关(0.50),说明 AI 团队尚未引入生产级混沌工程。
  • 评价:⭐⭐⭐⭐⭐ CNCF 官方数据,年度必读。
  • 标签cloud-native kubernetes CNCF AI-ML report

2. 2026 Kubernetes 安全特性总结 & 2026 预览

  • 来源CNCF Blog
  • v1.35 重点安全特性
  • KEP-4872:kubelet 服务证书 CN 验证,防节点伪装 MITM 攻击(Alpha → 待升 Beta)
  • KEP-5284:约束模拟攻击,防止 over-privileged 代理工作流
  • KEP-4317PodCertificateRequest API → Pod 级 mTLS 支持(Beta)
  • KEP-2535:镜像拉取授权重新验证,防止缓存镜像被未授权 Pod 使用(Beta)
  • 评价:⭐⭐⭐⭐⭐ 安全工程师必读,直接影响生产加固方案。
  • 标签cloud-native kubernetes security mTLS

3. 2026 Kubernetes Playbook:AI 工作负载 & 自愈集群

  • 来源Fairwinds
  • 核心观点
  • Kubernetes = AI 基础设施控制平面:训练 Job + 推理 Service 同集群调度。
  • 2026 不是 K8s 大改年,而是组织"更 deliberate 使用"之年。
  • 平台工程 + AI 可观测性 + 安全默认模板 = 云原生成熟度新定义。
  • 评价:⭐⭐⭐⭐ 来自运营视角的 K8s 年度指南,有具体行动建议。
  • 标签cloud-native kubernetes AI platform-engineering

4. Cloud Native 优化 2026 趋势

  • 来源Akamas
  • 核心问题:大多数组织仍困在"手动调优"阶段,人工直觉无法应对动态云原生环境。
  • 结论:需从"best-guess manual"转向 deterministic model(自动化性能优化)。
  • 评价:⭐⭐⭐ 补充性背景,适合引导后续调优相关检索。
  • 标签cloud-native optimization observability

📝 Substack 高价值发现

⭐ 高价值

1. The AI Agents Stack (2026 Edition) — The AI Engineer

  • 来源The AI Engineer Substack
  • 核心洞察
  • MCP(Model Context Protocol) 标准化工具连接(2025-2026 核心变化,整个 tools 层全新)。
  • 推理模型改变了 agent 自主能力(单 call agent 替代部分 multi-step chain)。
  • Memory 成为一等公民,不再是挂在 vector DB 上的 afterthought。
  • 2026 agent guardrails 新含义:不是 input/output 过滤,而是授权工具调用、执行 rate limit、验证 agent 实际行为
  • OWASP 发布 MCP Top 10(beta)— 首个工具连接 agent 安全清单。
  • 评价:⭐⭐⭐⭐⭐ AI Agent 基础设施全景图,必读。
  • 标签substack AI-agent MCP architecture

2. AI Agent Reality Gap — Cobus Greyling

  • 来源Cobus Greyling Substack · 2026-04-30
  • 核心观点:真正落地的 agent = constrained、prompted、custom-built、human-supervised、manual-evaluated。与大会演示的完全自主 agent 截然相反。
  • 评价:⭐⭐⭐⭐⭐ 反直觉但真实,适合作为 AI Agent 落地认知矫正材料。
  • 标签substack AI-agent production reality-check

3. Top LLM / RAG / Agent Updates — AIxFunda (Week of 2026-03)

  • 来源AIxFunda Substack
  • 本周亮点
  • Ai2 MolmoWeb:4B/8B 参数视觉 web agent,基于截图完成浏览器操作。
  • Cohere Transcribe:开源 ASR 模型,14 语言,525 分钟音频 1 分钟处理完。
  • GLM-5.1(Z.ai):编程 benchmark 45.3 分,仅差 Claude Opus 2.6 分。
  • 论文:MemDLM(记忆增强)、SkillRouter(Agent 技能路由)、SecureBreak(安全数据集)。
  • 评价:⭐⭐⭐ 行业双周报结构,可参考作为简报固定栏目设计。
  • 标签substack LLM RAG agent weekly-update

4. The 2026 Path to Learning AI Agents — aiagentssimplified

  • 来源aiagentssimplified Substack
  • 核心技能图谱:系统设计 / 工具合约设计 / RAG / 可信赖工程 / 安全 / 评估可观测性 / 产品思维
  • 演进时间线:2020-2022(stateless wrapper)→ 2023(tool + memory)→ 2024(LangGraph/CrewAI)→ 2025(MCP + structured memory)→ 2026(协调式多角色集群)
  • 评价:⭐⭐⭐ 学习路径规划参考。
  • 标签substack AI-agent learning roadmap

🔬 Reproduction / 可复现资源

⭐ 高价值

1. Speculative Decoding 系列 2026 论文

  • 来源arXiv:2603.03251 · Stanford
  • 论文名:Speculative Speculative Decoding(SSD)
  • 核心:draft 和 verify 完全并行(不同 GPU),draft 预计算多种验证结果的猜测 token,实现 2-3x 端到端加速(Llama-3.1-70B / TP=4 H100)。
  • 对比:SSD > 普通 SD > 自回归基线
  • 评价:⭐⭐⭐⭐ 有代码,方法论清晰,适合复现。
  • 标签reproduction speculative-decoding LLM-inference arXiv

2. SpecSA:Speculative Decoding + Sparse Attention

  • 来源arXiv:2605.19893
  • 核心:结合稀疏注意力减少 KV-cache 访问 + speculative decoding 加速生成,双重优化。
  • 评价:⭐⭐⭐ 适合研究稀疏注意力与推理加速的交叉点。
  • 标签reproduction speculative-decoding sparse-attention arXiv

3. Vector DB Benchmark CSV/JSON 下载

  • 来源Salt Technologies
  • 内容:10 个数据库 / 19 字段 / Q1 2026 / CC BY 4.0
  • 评价:可直接下载复现 benchmark,适合数据比较类报告。
  • 标签reproduction benchmark database

4. CoAgent: 多 Agent 系统的并发控制

  • 来源arXiv:2606.15376 · 2026
  • 核心:多 Agent 系统中并发事务的冲突处理研究
  • 评价:⭐⭐⭐ 新兴方向,多 Agent 系统的并发控制是工程化关键问题。
  • 标签reproduction multi-agent concurrency arXiv

🗂️ 分类标签汇总

标签 条目数
database 5
backend 3
cloud-native 4
substack 4
LLM-inference 5
vector-search 4
AI-agent 5
speculative-decoding 3
kubernetes 3
reproduction 4

📋 建议写入路径

主题 写入路径
PostgreSQL-V 解耦向量搜索 inbox/jay/2026-07-18-postgresql-vector.md
pgvector vs Pinecone 2026 对比 inbox/jay/2026-07-18-vector-db-comparison.md
LLM Inference Engine 框架对比 inbox/jay/2026-07-18-llm-inference-engines.md
AI Agents Stack 2026 inbox/jay/2026-07-18-ai-agent-stack-2026.md
K8s 安全特性 2026 inbox/jay/2026-07-18-k8s-security-2026.md
CNCF 云原生报告 Q1 2026 inbox/jay/2026-07-18-cncf-state-q1-2026.md
Speculative Decoding 论文集 inbox/jay/2026-07-18-speculative-decoding.md

🔍 后续行动建议

  1. 精读:PostgreSQL-V 论文(CIDR 2026)+ SSD Speculative Decoding 论文,建议优先。
  2. 审稿:AI Agents Stack 2026(substack)可考虑收入知识库作为 agent 架构参考页。
  3. 主题页更新LLM-inferencevector-search 两个主题页建议同步本轮 benchmark 数据。
  4. CSDN:本轮未检索到符合"高价值"门槛的 CSDN 文章(版本/环境/源码分析/排障经验),保持下次检索。

Jay · 2026-07-18 21:05 CST · 研究知识库草稿