Jay · 五类简报 · 2026-09-23 晚间版
实例:Jay | 生成时间:2026-09-23 21:05 CST | 检索范围:arXiv / GitHub / Hugging Face / Substack / CSDN / 技术博客
📌 database · 向量数据库 & 存储系统
高价值条目
1. Vector DB Benchmark 2026 综合横评(Salt Technologies)
- 来源:https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026
- 发布时间:2026-02-15(Q1 2026 版本)
- 核心数据:
- Qdrant:p50 ~4ms,p95 ~8ms at 1M vectors,实测 850 QPS;1M-vector benchmark 下 p50 ~2.1ms,p99 ~6.3ms
- Pinecone:sub-20ms p95 latency at 5M+ vectors
- pgvector:成熟度大幅提升,2M vectors 内无需特殊调优
- Weaviate:BM25+向量混合检索,text-image CLIP 原生支持,多模态 RAG 最适合
- Milvus:分布式规模领先,44k+ GitHub stars
- 评价:⭐⭐⭐⭐ 工程选型必读。结论:大多数生产 RAG 收敛于 Qdrant 或 Pinecone;已有 Postgres 团队优先 pgvector;多模态场景选 Weaviate;超大规模选 Milvus。
- 可信度:高(第三方实测,有 CSV/JSON 方法论文档)
2. Qdrant vs Pinecone vs Weaviate 深度对比(Alphacorp / Kalvium Labs)
- 来源:https://alphacorp.ai/blog/best-vector-databases-for-rag-2026-top-7-picks | https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate
- 核心洞察:
- 50M vectors + 90% recall 场景:Qdrant p50 4.74ms,p99 5.79ms(极窄尾延迟)
- Pinecone 成本是 Supabase Postgres 同规模实例的 3-8x
- Weaviate 的 BM25+vector hybrid 在 keyword+semantic 混合检索上架构最一致
- 评价:⭐⭐⭐⭐ 2026 向量数据库选型决策树,可直接用于架构设计文档
- 可信度:高(生产部署经验团队)
📌 backend · 推理引擎 & 系统架构
高价值条目
1. RoofLang:AI 驱动的 LLM 推理系统架构 DSL(arXiv 2609.12551)
- 来源:https://arxiv.org/html/2609.12551v1
- 发布时间:2026-09-21
- 作者:Ziyue Yang(上海星云智理AI研究院)、Yuting Jiang、Lei Qu、Peng Cheng(Microsoft Research)
- 核心观点:
- 现有 AI 优化均为 profiling-based,困于现有软件栈,无法发现根本性更好的架构
- RoofLang:工作负载+硬件联合图表示 + 语义保持图变换 + roofline-based 离散事件模拟器
- 重大发现:DeepSeek V4 系列 decode throughput 峰值比同类模型高 3.5–39.5×,主因是紧凑 KV-cache 设计(支撑更大 batch,降低内存流量)
- 持续优化 AI Agent 在 NVIDIA B300 上为 DeepSeek V4 Pro 发现新架构,throughput + interactivity 提升 6.23–50.1%
- 评价:⭐⭐⭐⭐⭐ 系统论文,近期最值得关注。AI for Systems 方向的里程碑工作,KV-cache 设计是超越参数量级的性能杠杆
- 可信度:高(Microsoft Research 合作,完整 DSL + 模拟器开源)
- 后续行动:建议核验 GitHub repo(arXiv 未给出),关注 RoofLang 开源动态
2. A Survey of LLM Inference Systems(arXiv 2506.21901,cs.DB)
- 来源:https://arxiv.org/abs/2506.21901
- 发布时间:2025-06(已收录,补充阅读)
- 分类:数据库(cs.DB)| 25 页
- 核心覆盖:算子算法 → 模型优化执行(kernel设计/batching/scheduling)→ 内存管理(paged memory/eviction/offloading/quantization/cache persistence)→ 单副本/多副本/ disaggregated / serverless 推理系统
- 核心洞察:所有技术本质上依赖 load prediction、adaptive mechanisms、cost reduction 来克服自回归生成挑战
- 评价:⭐⭐⭐⭐ 工程人员复习与知识体系梳理必读
- 可信度:高(arXiv cs.DB 分类,结构化survey)
3. LMCache:跨引擎 KV-cache 共享方案
- 来源:https://arxiv.org/html/2510.09665v1
- 核心功能:从 vLLM / SGLang 提取 KV-cache,支持跨引擎、跨查询共享
- vLLM/SGLang 原生 GPU-to-CPU KV 传输,但缺少跨节点优化和分层存储支持
- LMCache 填补这一空白
- 评价:⭐⭐⭐⭐ 多租户/跨引擎场景值得关注
- 可信度:高(开源,有 benchmark)
4. P2Skill:隐私保护技能蒸馏(arXiv 2608.14094)
- 来源:https://arxiv.org/html/2608.14094v1
- 核心机制:Cloud-local LLM inference partitioning(端侧小模型处理隐私敏感子任务,云端大模型处理复杂推理)
- 评价:⭐⭐⭐ 隐私敏感 Agent 场景参考
- 可信度:中
5. vLLM/SGLang 混合模型 KV Cache 深度解析(CSDN,2026-09-08)
- 来源:https://blog.csdn.net/kaka0722ww/article/details/156153663
- 发布时间:2026-09-08(最新推荐)
- 核心内容:PagedAttention 原理、连续批处理、显存管理四要素(模型权重/KV Cache/激活值/临时缓冲)、部署 checklist
- 评价:⭐⭐⭐ 实践导向,vLLM/SGLang 选型参考
- 可信度:中(实操文章,有代码对照)
📌 cloud-native · K8s & 云原生基础设施
候选条目
1. KubeCon NA 2026 AI Inference Track(持续跟踪)
- 背景:2026 下半年重要云原生+AI 融合会议
- 建议关注:vLLM/SGLang 在 K8s 上的 Operator 进展、PD disaggregation 生产实践
2. kubernetes-sigs/lws(LeaderWorkerSet)更新
- 来源:GitHub(https://github.com/kubernetes-sigs/lws)
- Stars:811
- 用途:多 Pod 复制组部署 API,支持 LLM 推理分布式工作负载
- 评价:⭐⭐⭐ K8s 上部署 LLM 分布式推理的 SIG Apps 标准方案
📌 csdn · CSDN 高价值技术文
高价值条目
1. 2026 RAG 全景文:万字长文吃透全栈落地(腾讯云开发者社区)
- 来源:https://cloud.tencent.com/developer/article/2654878
- 发布时间:2026 年(持续更新)
- 核心内容(~12000字,含代码):
- Embedding 模型选型(BGE-M3/bge-large-zh/m3e/m3e-large/Jina v3)
- 向量数据库对比(Milvus/Qdrant/Pinecone/Weaviate/pgvector 决策矩阵)
- Agentic RAG:思考-行动-观察循环自主决定检索策略
- GraphRAG 关系型多跳推理
- 分层智能分块(Parent-Child/RAPTOR/语义边界)
- 混合检索(BM25+dense)+ Cross-Encoder 重排,Token 节省 40%
- HyDE/查询扩展/意图分类
- Multi-Modal RAG(Vision-Guided Chunking + CLIP)
- 实时增量 RAG(分钟级知识同步)
- 评价:⭐⭐⭐⭐ 2026 RAG 全栈实战指南,内容密度高,有代码有架构图
- 可信度:高(腾讯云社区,技术深度足够)
2. Agentic RAG:范式迁移文(CSDN,2026-09-14)
- 来源:https://blog.csdn.net/qcx23/article/details/160820786
- 核心:Agentic RAG 将大模型从被动生成器转变为主动推理智能体,多跳推理准确率 34%→78%
- 评价:⭐⭐⭐ 配合上面的万字文补充阅读
3. 大模型推理框架选型指南(vLLM/SGLang/TensorRT-LLM,CSDN)
- 来源:https://blog.csdn.net/xx_nm98/article/details/158851692
- 发布时间:2026-03(2026-07 更新)
- 核心数据:
- PyTorch:450ms / 45 tok/s / 80GB
- vLLM:123ms / 78 tok/s / 75GB
- SGLang:340ms / 65 tok/s / 72GB
- TensorRT-LLM:98ms / 95 tok/s / 48GB
- 评价:⭐⭐⭐ 吞吐量 vs 显存 vs 延迟权衡矩阵,实践参考
📌 reproduction · 可复现性 & 工程验证
高价值条目
1. Jev-Mem:System-One-Controlled Agentic Memory(arXiv 2609.23986)
- 来源:https://arxiv.org/html/2609.23986v1
- 发布时间:2026-09-21
- 核心机制:
- System One(快思考)控制 memory 生命周期,证据合成和最终答案生成由 System Two(慢思考)完成
- 引用 SimpleMem(语义压缩+异步聚合+查询自适应检索)和 LightMem(轻量在线处理与昂贵内存整合分离)
- 路由方式:temporal routing / causal routing / candidate relevance
- 评价:⭐⭐⭐⭐ Agent 记忆架构核心方向,建议跟进 SimpleMem 和 LightMem 开源代码
- 可信度:高(arXiv 2026-09-21 最新)
2. Skill Retrieval Augmentation for Agentic AI(arXiv 2604.24594)
- 来源:https://arxiv.org/html/2604.24594v1
- 核心:Skill 作为模块化能力包(自然语言指令/调用条件/工具使用/可执行代码/辅助资源),OpenClaw skills 框架被明确引用
- 评价:⭐⭐⭐⭐ 与 OpenClaw 生态直接相关,建议精读原文第 4 节和第 5 节
- 可信度:高(引用 OpenClaw Steinberger and Contributors 2026)
3. Agentic Data Environments(arXiv 2607.07397)
- 来源:https://arxiv.org/html/2607.07397v1
- 核心发现:
- AIM(Structured Representations):比 GAM 快 4.18×,准确率高 13.54%
- 比 Octen(mem0 竞品)高 15.82%
- 长对话中,AIM 用 ~10% 上下文长度达到与全对话相同准确率
- 知识图谱固定模式(KG-fixed)跨模型升级可移植性最好(Qwen 升级后准确率几乎不变)
- 评价:⭐⭐⭐⭐⭐ Agent 记忆架构选型关键数据支撑;RAG 在模型升级后准确率下降 50%+,是严重问题
- 可信度:高(系统性对照实验,有量化数据)
4. Securing Agentic AI: From Per-Action Checks to Trajectory Assurance(arXiv 2608.01558)
- 来源:https://arxiv.org/html/2608.01558v1
- 覆盖:OWASP Agentic Security 15 类威胁 / CSA MAESTRO 7 层框架 / Microsoft 失败模式分类
- 关键洞察:
- A2A 协议(Agent-to-Agent):信任建立和身份认证留给实现方,安全性表达为可选建议
- MCP 协议(Model Client Protocol):优于 A2A 的安全设计
- 评价:⭐⭐⭐⭐ Agent 安全全景图,工程落地参考
- 可信度:高(系统性综述)
5. Hugging Face Blog · Your Agent Aced the Task. Will It Do It Again?(2026-09-15)
- 来源:https://huggingface.co/blog
- 核心:Agent 评测鲁棒性,任务成功≠可重复成功
- 评价:⭐⭐⭐⭐ Agent 评测工程化必读
- 可信度:高(HF 官方博客)
🗂️ 分类标签汇总
| 类别 | 条目数 | 高价值 |
|---|---|---|
| database | 2 | 4 |
| backend | 5 | 5 |
| cloud-native | 2 | 1 |
| csdn | 3 | 3 |
| reproduction | 5 | 5 |
💡 建议写入路径
主草稿:/shared/research-kb/inbox/jay/2026-09-23T2105-jay-five-category-evening-briefing.md(本文件)
主题深度页更新建议: 1. Agent 记忆架构专题页:更新 Jev-Mem + Agentic Data Environments(AIM vs GAM/Octen 数据) 2. LLM 推理系统架构专题页:补充 RoofLang 核心发现(DeepSeek V4 的 KV-cache 杠杆效应) 3. 向量数据库选型页:更新 Qdrant/Pinecone/Weaviate 2026 benchmark 数据
🔍 精读 / 审稿 / 主题页更新建议
| 优先级 | 动作 | 对象 | 理由 |
|---|---|---|---|
| P0 | 精读 | RoofLang arXiv 2609.12551 | DeepSeek V4 的 KV-cache 设计洞察,AI for Systems 里程碑 |
| P0 | 精读 | Agentic Data Environments arXiv 2607.07397 | AIM vs RAG 量化数据,模型升级可移植性关键发现 |
| P1 | 审稿 | HF Blog: Agent Evaluation Robustness | Agent 评测必读 |
| P1 | 审稿 | Skill Retrieval Augmentation arXiv 2604.24594 | OpenClaw skills 被引用,建议对齐 |
| P2 | 更新主题页 | 向量数据库选型 | Qdrant 2026 benchmark 更新 |
| P2 | 更新主题页 | Agent 安全 | OWASP 15 类威胁 + A2A vs MCP 对比 |
本简报由 Jay 实例自动生成,仅供研究参考。不复制原文,不含 API Key 或私密信息。