📚 Jay 研究简报 · 2026-07-18
检索时间:2026-07-18 21:05 (Asia/Shanghai) 覆盖范围:database · backend · cloud-native · csdn · reproduction 本次搜索源:Tavily (arXiv / Substack / GitHub / 技术博客)
🗄️ Database
⭐ 高价值
1. PostgreSQL-V:解耦式高速向量搜索 [CIDR 2026]
- 来源:cs.purdue.edu PDF · 普渡大学
- 核心观点:pgvector 继承 PostgreSQL 页面结构导致性能瓶颈;PostgreSQL-V 提出架构解耦设计,将向量索引与 PostgreSQL 核心引擎分离,兼顾崩溃一致性与高吞吐。关键机制:利用 LSM-based 框架 + 轻量级索引一致性保证。
- 评价:⭐⭐⭐⭐ 有 CIDR 2026 学术背书的工程系统论文,方向是 2026 向量数据库领域值得关注的技术路线之一。
- 标签:
databasevector-searchpostgresqlCIDR2026research - 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-18-postgresql-vector.md
2. pgvector vs Pinecone vs 专用向量库 2026 全面对比
- 来源:BuildSpace Blog / BirJob
- 核心观点(综合):
- 2026 年 pgvector 基准神话破除:在 1M 向量 / 1536 dim 下,pgvector p50 ≈ 18ms,但 RAG 管道中向量搜索几乎从不是瓶颈(embedding 调用 + LLM 生成主导延迟)。
- pgvector 最大优势:SQL 联合查询 + 元数据过滤可在一个语句内表达,竞品需应用层 JOIN。
- Snowflake $250M 收购 Crunchy Data、Databricks $1B 收购 Neon,印证"向量是数据类型而非数据库类别"论断。
- 50M 向量以下 pgvector 是默认选择;超大规模选 Qdrant / Milvus。
- 评价:⭐⭐⭐⭐⭐ 生产决策级对比,附量化数据和实际迁移案例,适合入库作为 RAG 向量选型参考。
- 标签:
databasevector-searchpgvectorbenchmarkproduction
3. Vector DB Benchmark 2026(10 库 19 字段)
- 来源:Salt Technologies AI · Q1 2026 CC BY 4.0
- 关键数据(1M 向量 / 1536 dim): | DB | p50 | p99 | |---|---|---| | Qdrant | 4ms | 25ms | | Redis | 5ms | 20ms | | Milvus | 6ms | 35ms | | Pinecone | 8ms | 45ms | | pgvector | 18ms | 90ms |
- 评价:⭐⭐⭐⭐ 可下载 CSV/JSON,基准方法论透明,适合引用。
- 标签:
databasebenchmarkvector-search
⚙️ Backend
⭐ 高价值
1. LLM Inference Engine 2026 完整对比(vLLM / SGLang / TGI / TensorRT-LLM / llama.cpp)
- 来源:Zylos Research · DeployBase · Sesamedisk
- 核心框架对比:
| 框架 | 最佳场景 | 吞吐 | 上手难度 |
|---|---|---|---|
| vLLM | 生产 Serving | 120-160 req/s | 小时级 |
| SGLang | Agent / RAG 多轮 | 最高达 vLLM 3.1x | 小时级 |
| TensorRT-LLM | 极致 NVIDIA 性能 | 最高 | 1-2 周 |
| llama.cpp | Edge / 本地 | 视硬件 | 分钟级 |
| Ollama | 开发 / 原型 | 中等 | 分钟级 |
- 关键洞察:
- SGLang 的 RadixAttention 在多轮对话和 Agent 工作流中复用 KV cache,实现 2-3x 吞吐提升。
- vLLM PagedAttention + continuous batching 仍是行业标准,相比静态 batching 提升最高 23x。
- H100 定价已正常化($3-4/hr),成为默认训练/推理 GPU。
- 评价:⭐⭐⭐⭐⭐ 框架选型必读,代码示例 + benchmark 数据均有。
- 标签:
backendLLM-inferencevLLMSGLangperformance
2. SGLang 深度解析:RadixAttention 原理
- 来源:Inference.net · 2026-01-26
- 核心观点:SGLang = 前端(结构化生成 DSL)+ 后端(RadixAttention)。RadixAttention 自动在 KV cache 中识别并复用重复 prompt 片段,对多轮对话和 RAG 管道提升显著。
- 评价:⭐⭐⭐⭐ 原理讲解清晰,有代码示例,适合作为 SGLang 入门材料。
- 标签:
backendSGLangKV-cacheLLM-inference
3. LLM 推理优化栈(2026)
- 来源:Medium · 系统设计手册
- 核心总结:vLLM 优化内存布局(where),SGLang 优化时序调度(when),两者结合可实现数量级的成本削减。
- 评价:⭐⭐⭐ 总结性文章,适合快速了解优化全貌。
- 标签:
backendLLM-inferenceoptimization
☁️ Cloud-Native
⭐ 高价值
1. CNCF 云原生开发状态报告 Q1 2026
- 来源:CNCF PDF
- 核心数据:Kubernetes 社区达 2000 万开发者,云原生生态成为 AI 工作负载底座。
- AI 开发者云原生成熟路径:实验/训练阶段 → 数据管道(事件驱动、流式)→ 可观测性工具。
- 洞察:observability 与 chaos engineering 呈负相关(0.50),说明 AI 团队尚未引入生产级混沌工程。
- 评价:⭐⭐⭐⭐⭐ CNCF 官方数据,年度必读。
- 标签:
cloud-nativekubernetesCNCFAI-MLreport
2. 2026 Kubernetes 安全特性总结 & 2026 预览
- 来源:CNCF Blog
- v1.35 重点安全特性:
KEP-4872:kubelet 服务证书 CN 验证,防节点伪装 MITM 攻击(Alpha → 待升 Beta)KEP-5284:约束模拟攻击,防止 over-privileged 代理工作流KEP-4317:PodCertificateRequest API → Pod 级 mTLS 支持(Beta)KEP-2535:镜像拉取授权重新验证,防止缓存镜像被未授权 Pod 使用(Beta)- 评价:⭐⭐⭐⭐⭐ 安全工程师必读,直接影响生产加固方案。
- 标签:
cloud-nativekubernetessecuritymTLS
3. 2026 Kubernetes Playbook:AI 工作负载 & 自愈集群
- 来源:Fairwinds
- 核心观点:
- Kubernetes = AI 基础设施控制平面:训练 Job + 推理 Service 同集群调度。
- 2026 不是 K8s 大改年,而是组织"更 deliberate 使用"之年。
- 平台工程 + AI 可观测性 + 安全默认模板 = 云原生成熟度新定义。
- 评价:⭐⭐⭐⭐ 来自运营视角的 K8s 年度指南,有具体行动建议。
- 标签:
cloud-nativekubernetesAIplatform-engineering
4. Cloud Native 优化 2026 趋势
- 来源:Akamas
- 核心问题:大多数组织仍困在"手动调优"阶段,人工直觉无法应对动态云原生环境。
- 结论:需从"best-guess manual"转向 deterministic model(自动化性能优化)。
- 评价:⭐⭐⭐ 补充性背景,适合引导后续调优相关检索。
- 标签:
cloud-nativeoptimizationobservability
📝 Substack 高价值发现
⭐ 高价值
1. The AI Agents Stack (2026 Edition) — The AI Engineer
- 来源:The AI Engineer Substack
- 核心洞察:
- MCP(Model Context Protocol) 标准化工具连接(2025-2026 核心变化,整个 tools 层全新)。
- 推理模型改变了 agent 自主能力(单 call agent 替代部分 multi-step chain)。
- Memory 成为一等公民,不再是挂在 vector DB 上的 afterthought。
- 2026 agent guardrails 新含义:不是 input/output 过滤,而是授权工具调用、执行 rate limit、验证 agent 实际行为。
- OWASP 发布 MCP Top 10(beta)— 首个工具连接 agent 安全清单。
- 评价:⭐⭐⭐⭐⭐ AI Agent 基础设施全景图,必读。
- 标签:
substackAI-agentMCParchitecture
2. AI Agent Reality Gap — Cobus Greyling
- 来源:Cobus Greyling Substack · 2026-04-30
- 核心观点:真正落地的 agent = constrained、prompted、custom-built、human-supervised、manual-evaluated。与大会演示的完全自主 agent 截然相反。
- 评价:⭐⭐⭐⭐⭐ 反直觉但真实,适合作为 AI Agent 落地认知矫正材料。
- 标签:
substackAI-agentproductionreality-check
3. Top LLM / RAG / Agent Updates — AIxFunda (Week of 2026-03)
- 来源:AIxFunda Substack
- 本周亮点:
- Ai2 MolmoWeb:4B/8B 参数视觉 web agent,基于截图完成浏览器操作。
- Cohere Transcribe:开源 ASR 模型,14 语言,525 分钟音频 1 分钟处理完。
- GLM-5.1(Z.ai):编程 benchmark 45.3 分,仅差 Claude Opus 2.6 分。
- 论文:MemDLM(记忆增强)、SkillRouter(Agent 技能路由)、SecureBreak(安全数据集)。
- 评价:⭐⭐⭐ 行业双周报结构,可参考作为简报固定栏目设计。
- 标签:
substackLLMRAGagentweekly-update
4. The 2026 Path to Learning AI Agents — aiagentssimplified
- 来源:aiagentssimplified Substack
- 核心技能图谱:系统设计 / 工具合约设计 / RAG / 可信赖工程 / 安全 / 评估可观测性 / 产品思维
- 演进时间线:2020-2022(stateless wrapper)→ 2023(tool + memory)→ 2024(LangGraph/CrewAI)→ 2025(MCP + structured memory)→ 2026(协调式多角色集群)
- 评价:⭐⭐⭐ 学习路径规划参考。
- 标签:
substackAI-agentlearningroadmap
🔬 Reproduction / 可复现资源
⭐ 高价值
1. Speculative Decoding 系列 2026 论文
- 来源:arXiv:2603.03251 · Stanford
- 论文名:Speculative Speculative Decoding(SSD)
- 核心:draft 和 verify 完全并行(不同 GPU),draft 预计算多种验证结果的猜测 token,实现 2-3x 端到端加速(Llama-3.1-70B / TP=4 H100)。
- 对比:SSD > 普通 SD > 自回归基线
- 评价:⭐⭐⭐⭐ 有代码,方法论清晰,适合复现。
- 标签:
reproductionspeculative-decodingLLM-inferencearXiv
2. SpecSA:Speculative Decoding + Sparse Attention
- 来源:arXiv:2605.19893
- 核心:结合稀疏注意力减少 KV-cache 访问 + speculative decoding 加速生成,双重优化。
- 评价:⭐⭐⭐ 适合研究稀疏注意力与推理加速的交叉点。
- 标签:
reproductionspeculative-decodingsparse-attentionarXiv
3. Vector DB Benchmark CSV/JSON 下载
- 来源:Salt Technologies
- 内容:10 个数据库 / 19 字段 / Q1 2026 / CC BY 4.0
- 评价:可直接下载复现 benchmark,适合数据比较类报告。
- 标签:
reproductionbenchmarkdatabase
4. CoAgent: 多 Agent 系统的并发控制
- 来源:arXiv:2606.15376 · 2026
- 核心:多 Agent 系统中并发事务的冲突处理研究
- 评价:⭐⭐⭐ 新兴方向,多 Agent 系统的并发控制是工程化关键问题。
- 标签:
reproductionmulti-agentconcurrencyarXiv
🗂️ 分类标签汇总
| 标签 | 条目数 |
|---|---|
database |
5 |
backend |
3 |
cloud-native |
4 |
substack |
4 |
LLM-inference |
5 |
vector-search |
4 |
AI-agent |
5 |
speculative-decoding |
3 |
kubernetes |
3 |
reproduction |
4 |
📋 建议写入路径
| 主题 | 写入路径 |
|---|---|
| PostgreSQL-V 解耦向量搜索 | inbox/jay/2026-07-18-postgresql-vector.md |
| pgvector vs Pinecone 2026 对比 | inbox/jay/2026-07-18-vector-db-comparison.md |
| LLM Inference Engine 框架对比 | inbox/jay/2026-07-18-llm-inference-engines.md |
| AI Agents Stack 2026 | inbox/jay/2026-07-18-ai-agent-stack-2026.md |
| K8s 安全特性 2026 | inbox/jay/2026-07-18-k8s-security-2026.md |
| CNCF 云原生报告 Q1 2026 | inbox/jay/2026-07-18-cncf-state-q1-2026.md |
| Speculative Decoding 论文集 | inbox/jay/2026-07-18-speculative-decoding.md |
🔍 后续行动建议
- 精读:PostgreSQL-V 论文(CIDR 2026)+ SSD Speculative Decoding 论文,建议优先。
- 审稿:AI Agents Stack 2026(substack)可考虑收入知识库作为 agent 架构参考页。
- 主题页更新:
LLM-inference和vector-search两个主题页建议同步本轮 benchmark 数据。 - CSDN:本轮未检索到符合"高价值"门槛的 CSDN 文章(版本/环境/源码分析/排障经验),保持下次检索。
Jay · 2026-07-18 21:05 CST · 研究知识库草稿