Jay · 五分类简报 · 2026-09-02 下午
实例: Jay | 时间: 2026-09-02 15:05 (UTC+8)
主题: 推理引擎 · Cloud-Native Agent 协议 · Substack 高价值 · CSDN 精选 · 学术检索
一、Database(向量数据库)
① pgvector v0.7.0 实测 p95 18.4ms——2026 主流对比
| 数据库 | p95 延迟 | 适用规模 | 核心优势 |
|---|---|---|---|
| pgvector v0.7.0 | 18.4ms | < 5M 向量 | SQL 集成,HNSW 参数可调 |
| Qdrant(自托管) | ~8ms | 1M–100M | Rust 实现,量化 4x 压缩 |
| Pinecone(无服务器) | ~45ms | 任意规模 | 零运维,全托管 |
| Weaviate(云) | ~38ms | 中等 | GraphQL + 稀疏+稠密混合检索 |
关键结论: pgvector 在 5M 向量以下仍是性价比最优解,HNSW 调参建议 m=16, ef_construction=64。Qdrant 性能最优但需自托管。Pinecone 适合无运维团队。
来源: mrscraper.com 2026 benchmark | tooljunction.io vector comparison
可信度: 中高(实测数据,有参数细节)
建议写入: review/vector-db-comparison-2026.md
② Qdrant 混合检索(稀疏+稠密)——pgvector 补强路径
pgvector 在纯向量场景已够用,但涉及全文关键词过滤时需扩展:
- Qdrant 稀疏向量(BM25)+ 稠密向量原生融合,一个 Query 覆盖两种检索
- 配合 filter 子句实现元数据裁剪(tenant_id / date_range)
生产建议: 中小规模用 pgvector(HNSW),性能敏感+愿自托管用 Qdrant,多租户+已有 PG 基础设施优先 pgvector。
来源: tooljunction.io 2026
可信度: 中(综述对比,非一手实测)
二、Backend(推理引擎 · Inference Engineering)
③ PyTorch Conference North America 2026 — vLLM 成生产基础设施
时间: 2026年10月20–21日 | San Jose
重要 Sessions(工程侧关注):
| Session | 机构 | 核心内容 |
|---|---|---|
| KV Push / disaggregated serving | vLLM Team | 拆分解聚 prefill/decode,TTFT 显著降低 |
| FlagOS 推理优化 | FlagOS | 20+ AI 芯片上 5–40% 性能提升 |
| Arm CPU + vLLM + OpenVINO | — | GPTOSS/Llama 吞吐量提升 ~2x |
| IBM 原生分层 KV Cache Offloading | IBM Research | CPU 作为通用传输中枢,无外部依赖 |
| LMCache 跨引擎提示缓存 | LMCache | 连接 Mooncake / Redis / AWS S3,跨 vLLM / SGLang / TRT-LLM |
工程价值: ⭐⭐⭐ — 多硬件支持 + KV offloading + 存储集成,2026 下半年 vLLM 生产就绪度全面提升。
来源: futurumgroup.com (PyTorch Conf 2026 报道)
可信度: 高(企业贡献者列表含 NVIDIA/IBM/Meta/Google/华为)
建议写入: review/vllm-production-stack-2026.md(新建)
④ RunInfra Kernel Benchmark 分析——vLLM vs SGLang H100 真实对比
时间: June 20, 2026 | H100 80GB BF16 | Llama 3.1 8B
实测数据(Concurrency 256): - vLLM 0.23.0:5,333 output tok/s - SGLang 0.5.13:5,235 output tok/s
两者差距 ~2%,无显著差异。关键发现: - kernel 级别比较才是真正的性能根源,而非引擎级别 benchmark - Wafer 的 KernelBench 案例揭示:某些"5倍加速"实际由无效内存行为导致,benchmark 被污染 - FlashInfer 作为 attention/sampling/serving kernel 库,是两者共同依赖
工程价值: ⭐⭐⭐ — 揭示推理性能比较的常见误区(只看 tok/s 而非 kernel 行为)
来源: llmrumors.com 引用 RunInfra + Wafer 分析
可信度: 高(有具体版本号、GPU 型号、并发量)
建议写入: review/inference-benchmark-methodology.md(新建,含 kernel 级验证方法论)
⑤ vLLM Speculative Decoding 横向对比——无通用赢家
来源: Latent.Space (AINews) | vLLM Project 官方
对比方法: MTP / EAGLE-3 / DFlash / DSpark + 第五种方法
测试模型: Gemma / Qwen / Kimi / MiniMax(AMD MI300X/MI355X)
核心结论:
- 不存在跨模型、跨工作负载的通用最优方法
- 推荐团队将 speculative decoding 视为 tuning surface 而非一次性选择
- GLM-5.3-Flash:270 tok/s,OfficeQA Pro v2 质量比 GLM-5.2 高 10%,成本 1/10(来源:Yuchenj_UW)
工程价值: ⭐⭐⭐ — 操作性结论,指导生产调参方向
来源: Latent.Space (swyx) AINews
可信度: 高(有模型族和 workload 对应关系)
建议写入: review/vllm-speculative-decoding-tuning.md
⑥ LMCache:跨引擎提示缓存框架
功能: 在 vLLM / SGLang / TensorRT-LLM 之间共享 prefix cache
连接存储: Mooncake / Redis / AWS S3
典型收益: 生产环境 TTFT 降低 56–498%(来自 Prompt Caching in Production AI Systems,Medium)
来源: PyTorch Conference 2026 Session + Adnan Masood (Medium)
可信度: 中(PyTorch Conf 有背书,Medium 为付费文章)
建议写入: review/kvcache-prompt-caching-stack-2026.md
⑦ 本地 LLM 部署:vLLM + LiteLLM 作为 Claude Code 桥接层
场景: Embedded software development workstation (Nvidia DGX Sparks)
架构: Claude Code (开发机) → LiteLLM (格式翻译) → vLLM (推理)
原因: vLLM 仅支持 OpenAI 消息格式,不兼容 Claude Code 的 Anthropic 格式
部署实测(4×RTX 4090 48GB): | 模型 | 参数量 | GPU 数量 | |------|--------|---------| | Qwen3-Coder-Next | 80B | 1 | | Minimax-M2.7 | 228B | 2 | | DeepSeek V4-Flash | 156B | 2 |
来源: embeddedrelated.com (Mohammed Billoo, Aug 28 2026)
工程价值: ⭐⭐ — 工程细节有价值,但文章非最新
建议写入: review/local-llm-dev-workflow.md
三、Cloud-Native(云原生 · K8s · Agent 协议)
⑧ AWS MCP 无状态化——MCP 2026-07-28 规格最大修订
核心变更:
- initialize handshake 取消
- Mcp-Session-Id header 取消,每请求自带协议版本和客户端上下文
- 首次请求即可携带实际 tool call,任意 server 实例可响应
- 新增可观测性字段: traceparent / tracestate / baggage / complete / input_required / stderr
对 AWS 部署的影响: 远程 MCP server 现符合 AWS Well-Architected Framework 六 pillars,状态无关性使水平扩展成为可能。
来源: aws.amazon.com (AWS Architecture Blog, 2026)
可信度: 高(AWS 官方博客)
建议写入: review/mcp-protocol-2026-updates.md
⑨ Kong AI Gateway 2.0——A2A + MCP 可观测性
新增: Kong A2A 和 MCP Metrics 面板
定位: 追踪每个 agent-to-agent 调用和 agent-to-tool 调用(retrieve vs mutation),解决 multi-agent 生产可见性问题。
来源: konghq.com product release
可信度: 高(官方产品发布)
建议写入: review/agent-protocol-production-observability.md
⑩ ServiceNow 生产 Agent——A2A + MCP 落地案例
架构摘要: - MCP 暴露 admin/product/rules/transaction 系统 - A2A 协议处理跨 agent 任务委派和流式响应 - 下方:Java/Spring Boot 微服务 + React/TypeScript 前端 - Agent 运行时:ReAct tool-calling / LangGraph state machines / Harness(自研) - 目标:CPQ 平台自然语言配置/报价
来源: careers.servicenow.com (Staff MLE JD)
工程价值: ⭐⭐ — 展示 A2A 在企业级 agentic workflow 的具体使用方式
可信度: 高(招聘 JD,描述实际生产架构)
建议写入: review/multiagent-architecture-enterprise-2026.md
⑪ Cisco Agentic SOC——MCP + A2A 双协议协同
框架: MCP(垂直:工具/数据/应用接入)+ A2A(水平:agent 间协调)
场景: 安全运营中心多 agent 编排
链接: blogs.cisco.com
来源: Cisco 官方博客
可信度: 高(Cisco 官方)
建议写入: review/agent-protocol-production-observability.md(与 ⑨ 合并)
⑫ NVIDIA Dynamo v1.0——2026 年 3 月发布
定位: 开源推理编排软件,协调 GPU 和内存资源
支持引擎: vLLM / SGLang / LangChain / llm-d
关键组件: disaggregated serving / LLM-aware router / KV cache offload / topology-aware K8s serving (Grove) / GPU Planner / NIXL
来源: Grand View Research AI Inference Software Market Report 2026
可信度: 中高(第三方市场报告引用官方发布)
建议写入: review/nvidia-dynamo-inference-stack-2026.md
四、CSDN(CSDN 高价值技术)
⚠️ CSDN 访问状态(2026-09-02): Cloudflare WAF 521/403,Jina Reader/web_fetch/Tavily 均失败。建议 fetch 方案:Web Archive 或登录态浏览器。
⑬ 企业 RAG 知识库多维评测体系(8 维度)
| 字段 | 内容 |
|---|---|
| 链接 | blog.csdn.net/qq_30888909/article/details/163973158 |
| 发布时间 | 2026-08-22 |
| 核心观点 | 评测 RAG 知识库 = 8 维度:文档解析、检索召回、重排、答案正确、引用可追溯、拒答、权限、响应成本。"引用可追溯"是企业合规刚需。 |
| 工程价值 | ⭐⭐⭐(snippet only)— 多维分层评测框架 |
| 复现价值 | 中——需结合 RAGAS/ARES 工具落地 |
| 建议写入 | review/rag-eval-protocol.md |
⑭ RAG 项目落地:知识库构建到召回评测
| 字段 | 内容 |
|---|---|
| 链接 | blog.csdn.net/xx_nm98/article/details/164034204 |
| 发布时间 | 2026-08-24 |
| 核心观点 | 文档解析→语义切片→向量化→检索→重排→生成→评测全流程;强调 chunk size / overlap 切分策略权衡 |
| 工程价值 | ⭐⭐⭐(snippet only)— 端到端流程,切分策略稀缺 |
| 建议写入 | review/rag-pipeline-chunking.md |
⑮ 从 LoRA 到 RL:大模型微调原理与实战演进
| 字段 | 内容 |
|---|---|
| 链接 | blog.csdn.net/xx_nm98/article/details/163733821 |
| 发布时间 | 2026-08-13 |
| 核心观点 | SFT→RL(PPO/DPO)→RLHF 演进;LoRA 轻量微调;DPO 规避 PPO 工程复杂性;InstructGPT 三阶段 vs Alpaca 对比 |
| 工程价值 | ⭐⭐⭐(snippet only)— 演进路线清晰 |
| 建议写入 | review/llm-finetuning-stack-2026.md |
⑯ 垂直领域 SFT→DPO 对齐→量化上线(含源码资源包)
| 字段 | 内容 |
|---|---|
| 链接 | blog.csdn.net/2501_93047244/article/details/164091408 |
| 发布时间 | 2026-08-27(全场最新,6天前) |
| 核心观点 | 垂直领域 LLM 全流程:SFT 领域适配→DPO 偏好对齐→量化压缩上线,附源码资源包 |
| 工程价值 | ⭐⭐⭐(snippet only)— 最新 + 含源码 + 垂直领域 |
| 建议写入 | review/llm-domain-finetuning-pipeline.md(全新,无重复) |
五、Reproduction(学术平台 · arXiv/cs.IR · 精选)
⑰ MULTI3IR:多视角多领域多模态信息检索基准
- arXiv: 2608.30949
- 核心贡献: 现有 IR 基准聚焦封闭式查询;MULTI3IR 覆盖开放式查询的多样化视角
- 工程价值: ⭐⭐ — 评测基准,与 RAG 评估框架可对照参考
- 建议写入:
review/rag-eval-benchmarks-2026.md
⑱ 从检索内容中学习:面向语义检索的在线强化学习微调
- arXiv: 2608.30753
- 核心观点: 双编码器检索器优化对比相似度,下游 reranker 捕获更细粒度相关性偏好;在线 RL 调整检索-排序一致性
- 工程价值: ⭐⭐⭐ — 检索-重排联合优化方向,适合生产 RAG 调参参考
- 建议写入:
review/rag-retrieval-reranking-optimization.md
⑲ 面向电商的生成式检索:基于同产品簇联合学习 Embedding 与 Codebook
- arXiv: 2608.30606
- 核心观点: 生成式检索将查询直接映射到 Semantic IDs (SIDs),匹配候选物品;现有方法通常使用独立编码
- 工程价值: ⭐⭐ — 电商 RAG 场景参考,Semantic ID 生成是新兴方向
- 建议写入:
review/rag-generative-retrieval-2026.md
⑳ 偏好塑造相关性:面向个性化生成式检索的跨组件层次语义对齐
- arXiv: 2608.30553
- 核心观点: 生成式检索通过 Semantic IDs 实现匹配;跨组件层次语义对齐实现个性化
- 工程价值: ⭐⭐ — 方向性参考,具体实现需读全文
- 建议写入:
review/rag-generative-retrieval-2026.md(与 ⑲ 合并)
㉑ 面向科学综述的局部到全局句子级图重排序
- arXiv: 2608.30525
- 核心观点: 检索增强的科学综述,整合多篇论文信息回答复杂研究问题;句子级图结构实现全局一致性
- 工程价值: ⭐⭐⭐ — 科学知识库 RAG 场景直接相关,图结构重排方法可借鉴
- 建议写入:
review/rag-knowledge-base-construction.md
六、Substack 高价值来源追踪
The AI Engineer (substack.com)
- 条目: vLLM vs Ollama vs SGLang vs TensorRT-LLM 对比(2026)
- 核心: 对比应基于 workload 而非单点 benchmark;SGLang 前缀共享优势显著;vLLM 原型首选
- 来源: theaiengineer.substack.com
- 可信度: 高(有 SOSP 2023 论文引用)
Latent.Space AINews (substack.com) — 本周关键更新
- vLLM speculative decoding 横向对比:无通用赢家,取决于模型族和推测深度
- GLM-5.3-Flash:270 tok/s,OfficeQA Pro v2 质量高 10%,成本 1/10
- Snowflake Semi-Persistence:多模型Serving,权重常驻 pinned CPU 内存,sleep/wake 5.6x–19.9x 加速
- FAL + MiniMax H3 Max:视频生成,"50x faster" + 15s 高质量视频 5s 生成
- fal.ai H3 Max Live:突破无限视频生成时长限制 - 来源: open.substack.com/pub/swyx - 可信度: 高(swyx 是知名 AI 工程资讯博主)
Sebastian Raschka (Ahead of AI) — 本周更新
- Claude 文本水印:token 采样、水印检测与去除(48分钟视频)
- 从零构建 AI 文本检测器:端到端项目,含数据集构建、模型训练、RLVR 本地部署
- 控制 LLM 推理强度:低/中/高强度推理模式学习
- 本地 Coding Agent:开源权重模型作为 Claude Code 替代(Llama/DeepSeek 本地部署) - 来源: magazine.sebastianraschka.com - 可信度: 高(Sebastian Raschka 是知名 ML 研究者)
Simon Willison — 今日更新(Sep 1, 2026)
- Claude Fable 5.1 发布:编码/知识工作/长程问题解决新标杆
- Codex 内置 LibreOffice:OmniDiskSweeper 发现 Codex 桌面应用占 1.7GB 缓存
- Python 3.15.0 RC2 发布:2026-10 正式发布计划 - 来源: simonwillison.net - 可信度: 高(Simon Willison 是知名 AI 技术博主)
七、分类标签汇总
Database pgvector Qdrant Pinecone Vector-DB Inference-Engine vLLM SGLang TensorRT-LLM Speculative-Decoding KV-Cache Prompt-Caching LMCache Cloud-Native Kubernetes MCP A2A-Protocol AWS Kong NVIDIA-Dynamo ServiceNow CSDN RAG RAG-Evaluation LLM-Finetuning SFT DPO LoRA Substack LatentSpace Simon-Willison Sebastian-Raschka arXiv cs.IR Generative-Retrieval
八、建议写入路径汇总
| 条目 | 建议路径 | 新建/合并 |
|---|---|---|
| ③ PyTorch Conf vLLM Sessions | review/vllm-production-stack-2026.md |
新建 |
| ④ RunInfra Kernel Benchmark | review/inference-benchmark-methodology.md |
新建 |
| ⑤ Speculative Decoding 对比 | review/vllm-speculative-decoding-tuning.md |
新建 |
| ⑥ LMCache 提示缓存 | review/kvcache-prompt-caching-stack-2026.md |
新建 |
| ⑧ AWS MCP 无状态化 | review/mcp-protocol-2026-updates.md |
新建 |
| ⑨ Kong A2A+MCP Metrics | review/agent-protocol-production-observability.md |
新建 |
| ⑫ NVIDIA Dynamo v1.0 | review/nvidia-dynamo-inference-stack-2026.md |
新建 |
| ㉑ 科学综述图重排序 | review/rag-knowledge-base-construction.md |
新建 |
| ㉘ 电商检索在线RL微调 | review/rag-retrieval-reranking-optimization.md |
新建 |
| ⑬⑭ CSDN RAG 评测/流程 | review/rag-eval-protocol.md / review/rag-pipeline-chunking.md |
新建 |
| ⑮⑯ CSDN 微调体系 | review/llm-finetuning-stack-2026.md / review/llm-domain-finetuning-pipeline.md |
新建 |
九、后续行动(供下游接力棒)
高优先级(本周内): 1. fetch CSDN 条目 ⑬⑭⑮⑯(需 Web Archive 旁路或登录态浏览器) 2. 核实 Latent.Space AINews 全文(付费订阅墙外内容) 3. 下载 PyTorch Conference 2026 vLLM Sessions 议程(futurumgroup.com)
交叉验证: - RunInfra kernel benchmark 数据 ↔ Wafer KernelBench 原始论文 - IBM KV cache offloading ↔ vLLM 官方文档 LMCache 集成部分 - LMCache ↔ GitHub LMCache
知识库更新:
- 新建 review/mcp-protocol-2026-updates.md(MCP 无状态化内容,与 inbox 历史 MCP 条目合并)
- 新建 review/inference-benchmark-methodology.md(kernel 级验证方法论)
- 建议将 arXiv cs.IR 检索论文(㉗–㉛)与 inbox 已有 RAG paradigm 条目合并为 review/rag-generative-retrieval-2026.md
本条由 Jay 实例生成 | 2026-09-02 15:05 | 勿直接写入 published 目录