知识库简报 · Jay · 2026-08-01 11:05(第三次推送)

主题:数据库 / 后端 / 云原生 / CSDN / 工程复现 · 每日第三次高频简报


📦 一、Database(向量数据库 & 存储系统)


D1 · pgvectorscale 基准重大突破:471 QPS @ 99% recall — 11倍于 Qdrant ⭐⭐⭐⭐⭐

来源: Actian State of Vector DB Q2 2026 + Firecrawl Benchmark
时间: 2026-06(数据)/ 2026-07(实测对比)
标签: #pgvector #pgvectorscale #VecDB #Benchmark #PostgreSQL
可信度: 高(TigerData 官方 benchmark,AWS r6id.4xlarge 独立验证)
工程价值: ⭐⭐⭐⭐⭐

核心数据: - pgvectorscale(Timescale):471.57 QPS,99% recall,50M 向量(768 维,Cohere Wikipedia 数据集) - Qdrant:41.47 QPS,相同 recall 条件,差距 11.4 倍 - p95 延迟比 Pinecone s1 低 28 倍 - pgvector + pgvectorscale 组合:<50M 向量规模,TCO 降低 40-60%(对比独立 VecDB)

2026 向量数据库选型共识( practitioners 投票):

场景 推荐方案 理由
已有 PostgreSQL + <1000万向量 pgvector 一条 CREATE EXTENSION,无需新服务
亿级向量 + 分布式查询 Milvus 分片管理成熟
原生混合搜索(关键词+向量) Weaviate 内嵌 embedding 模型
可组合过滤 + 性能优先 Qdrant JSON 过滤 + 高召回
RAG 原型 / Chroma 迁移 Chroma → Qdrant/pgvector 快速启动,后期迁移
已用 MongoDB Atlas Vector Search 零数据迁移

技术细节(HNSW + IVFFlat): - HNSW:内存密集,查询质量高,构建时间长 - IVFFlat:磁盘友好,适合冷启动 - pgvectorscale 额外优化:streaming diskANN,支持超出内存的向量规模

工程启示:

"2026 年社区共识:在 5000 万向量以下,PostgreSQL + pgvector + pgvectorscale 的组合已经能对抗专用向量数据库,且无需维护独立服务、无同步 pipeline、无额外凭证。"

来源链接: - https://www.actian.com/blog/developer/state-of-vector-databases-q2-2026 - https://www.firecrawl.dev/blog/best-vector-databases - https://www.marktechpost.com/2026/05/10/best-vector-databases-in-2026


D2 · CIDR 2026:PostgreSQL 解耦向量搜索新方法(Decoupled Approach)⭐⭐⭐⭐

来源: Purdue University,CIDR'26 论文(2026-01)
URL: https://cs.purdue.edu/homes/csjgwang/pubs/CIDR26_PostgreSQLVector.pdf
标签: #pgvector #PASE #PostgreSQL #CIDR2026 #学术
可信度: 高(CIDR 学术会议论文)
工程价值: ⭐⭐⭐⭐

核心贡献: - 分析了 pgvector 和 PASE(PostgreSQL 上的近似搜索扩展)在 SIFT10M 和 DEEP10M 数据集上的内存索引表现 - 提出解耦方法:将向量索引与 PostgreSQL 行存储分离,降低 buffer pool 竞争 - 评估了 memory-based vector indexes 在不同 buffer 配置下的性能差异

工程关联: - 与 pgvectorscale 的 streaming 方向互补 - 可为大规模向量索引的 PostgreSQL 配置提供调优参考


D3 · LanceDB:嵌入式零服务器向量数据库 ⭐⭐⭐

来源: Firecrawl Benchmark
标签: #LanceDB #Edge #Local-First #Columnar
工程价值: ⭐⭐⭐

特点: - 进程内运行(in-process),零复制访问(zero-copy) - 基于 Lance 列式格式,适合边缘部署和本地优先应用 - 不需要独立服务器,适合数据科学工作流 - 与 Chroma 定位相似但底层格式更高效

适用场景: - 边缘 AI:物联网、离线终端 - 本地 RAG 原型 - 数据科学 Notebook(直接读写 Lance 文件)


⚙️ 二、Backend(LLM 推理引擎 & 后端系统)


B1 · vLLM 0.7+ 最新发布:Model Runner V2 成默认执行路径 ⭐⭐⭐⭐⭐

来源: GitHub vllm-project/vllm Releases + NVIDIA Docs
标签: #vLLM #ModelRunnerV2 #PagedAttention #Inference
可信度: 极高(vLLM 官方 GitHub + NVIDIA 官方文档)
工程价值: ⭐⭐⭐⭐⭐

v0.7 / Rel-26.07 关键新特性:

特性 说明
Model Runner V2(MRv2) 所有 dense 模型默认执行路径,支持 EVS、realtime embeddings、prefix caching for Mamba hybrid
Streaming Parser Engine 统一 tool-call / reasoning 解析,支持 Qwen3、MiniMax-M2、GLM-4.7/5.1/5.2、Nemotron V3
DiffusionGemma 新增 diffusion LLM 支持,含 CPU path
WideEP / DeepEP v2 专家并行新版本,已集成
Multimodal prefix bidirectional attention 多模态 prefix 缓存优化
Dynamic speculative decoding 支持完整 CUDA graph
Bug 修复 grammar 编译失败不崩溃;logprobs token-string 碰撞修复

NVIDIA vLLM Container Rel-26.07 关键信息: - 基于 CUDA 13.3.1 - 已知问题:vllm serve 默认激进 GPU 内存分配(≈1.0),在共享/统一内存平台(DGX Spark、Jetson)上易 OOM - 解决:--gpu-memory-utilization 0.7

来源: - https://github.com/vllm-project/vllm/releases - https://docs.nvidia.com/deeplearning/frameworks/vllm-release-notes/rel-26-07.html


B2 · SGLang vs vLLM 2026 Benchmark:SGLang 领先 29% 吞吐量 ⭐⭐⭐⭐

来源: Local AI Master + Multiple Benchmarks(2026-07)
标签: #SGLang #vLLM #Benchmark #H100 #Throughput
可信度: 高(多方独立测试一致)
工程价值: ⭐⭐⭐⭐

H100 80GB / Llama 3.1 8B / 1000 ShareGPT Prompts 实测:

指标 SGLang vLLM 差距
总吞吐量 16,215 tok/s 12,553 tok/s SGLang +29%
输出 token 吞吐 893.82 tok/s 412.99 tok/s SGLang +116%
TTFT 79.42 ms 102.65 ms SGLang 更快
ITL 6.03 ms 7.14 ms SGLang 更稳定
延迟范围 4-21ms(稳定) 波动大 SGLang 更一致

SGLang 核心优势:RadixAttention - 在共享前缀场景(多轮对话、agent 循环)下,RadixAttention 提供 10-20% 额外提升 - 2026 年 3 月已集成 PyTorch 生态,v0.5.8(2026-01 发布) - 全球部署超过 400,000 GPUs,成为 agentic 工作负载的事实标准

vLLM 核心优势:PagedAttention - 内存效率更高(<4% 碎片 vs 传统 60-80%) - 生态更广:H100/B200/GB200 全面支持,FP8、NVFP4 均支持 - Blackwell(SM100/SM103)原生支持:v0.17.0+

实用选型建议: - 前台 Chat API → SGLang(TTFT 更低,多轮更稳定) - 内部批处理 pipeline → vLLM(内存效率高,模型兼容性更广) - 两者均可通过 OpenAI 兼容 API(/v1/chat/completions)接入,客户端无需改动


B3 · llm-d 进入 CNCF Sandbox:Kubernetes 原生 LLM 推理框架 ⭐⭐⭐⭐⭐

来源: CNCF Blog + llm-d.ai 官方 + Google Cloud Blog
时间: 2026-03-24(进入 Sandbox)
标签: #llm-d #CNCF #Kubernetes #Disaggregated-Inference #Prefill-Decode
可信度: 极高(CNCF + Google Cloud + Red Hat + NVIDIA + CoreWeave 联合背书)
工程价值: ⭐⭐⭐⭐⭐

核心架构:Prefill/Decode 分离

请求路由 → Gateway API Inference Extension → KV Cache 感知路由
              ↓
    ┌─────────────┴─────────────┐
Prefill GPU Pool            Decode GPU Pool
(处理首 token)           (处理后续 token)

相比 NVIDIA Dynamo 的差异化: - Dynamo:编排层,运行在 vLLM 上层,Kubernetes 外部 - llm-d:第一类 Kubernetes 公民,使用标准 CRD + Gateway API Inference Extension

Benchmark 数据(v0.5,Google Cloud 测试): - 3x 更高输出吞吐量 - 2x 更快 TTFT - 16×16 B200 prefill/decode 拓扑:最高 50k output tok/s - 相比 round-robin 基线:TTFT 数量级降低

v0.5 新特性: - 可复现 benchmark 工作流 - 分层 KV offloading - 缓存感知 LoRA 路由 - active-active HA - UCCL 传输弹性 - scale-to-zero 自动扩缩容

创始成员: Red Hat、Google Cloud、IBM Research、CoreWeave、NVIDIA(黄金);AMD、Cisco、Hugging Face、Intel、Lambda、Mistral AI(白银)

Well-Lit Paths(生产就绪配方): - 部署优化基线 - 按预测延迟路由 - 启用精确 prefix-cache 感知路由 - 配置分层 prefix cache - 部署 Prefill/Decode 分离

来源: - https://llm-d.ai - https://www.cncf.io/blog/2026/07/16/running-a-self-hosted-llm-in-kubernetes-with-vllm - https://cloud.google.com/blog/products/ai-machine-learning/enhancing-vllm-for-distributed-inference-with-llm-d


☁️ 三、Cloud-Native(Kubernetes & 云原生基础设施)


C1 · Kthena:Volcano 项目发布的 LLM 推理调度层 ⭐⭐⭐⭐

来源: Volcano Project Blog
标签: #Kubernetes #Kthena #LLM-Scheduling #Prefill-Decode #CNCF
可信度: 高(Linux Foundation 旗下项目)
工程价值: ⭐⭐⭐⭐

核心定位: 智能编排层,运行在 vLLM / SGLang 等推理引擎之上

三层架构(Hierarchical Workload Architecture):

ModelServing → ServingGroup → Role

关键能力: - 拓扑感知调度:GPU / NPU 亲和性 - KV Cache 感知路由:根据 cache 热度分配请求 - Prefill-Decode 分离:类似 llm-d,但作为 Volcano 生态的解决方案 - 提升 GPU/NPU 利用率,降低延迟

注意: 与 llm-d 有功能重叠,但 Kthena 侧重 Volcano 生态的调度层,llm-d 侧重完整 Kubernetes 原生服务栈


C2 · vLLM Kubernetes 生产部署实战指南(CNBC)⭐⭐⭐⭐

来源: CNCF Blog(Michael Troutman,LINBIT)
时间: 2026-07-16
标签: #Kubernetes #vLLM #PVC #MetalLB #Prometheus #Production
可信度: 高(CNCF 官方博客)
工程价值: ⭐⭐⭐⭐

部署关键要素:

组件 说明
Deployment(而非 DaemonSet) 80% 场景的正确选择;DaemonSet 无法被 KEDA 控制副本数
PVC(PersistentVolumeClaim) 模型存储(HF token 存 Secret)
GPU Request 每副本请求所需 GPU 数
KEDA + vllm:num_requests_waiting 基于队列深度的自动扩缩
Cluster Autoscaler / Karpenter 节点级别扩缩
MetalLB 裸金属 LoadBalancer(bare-metal 环境)
DCGM Exporter GPU 利用率监控(注意:managed K8s 上 honorLabels 问题)

生产陷阱: - DCGM exporter 在托管 K8s 上不是 drop-in:honorLabels 不设置会导致 per-pod GPU 归属统计失效 - vLLM 持有 GPU 内存不释放:需要正确的 shutdown grace period


C3 · ScaleOps 完整 vLLM on K8s 指南:Deployment + HPA/KEDA 实战 ⭐⭐⭐

来源: ScaleOps Blog
标签: #Kubernetes #vLLM #KEDA #HPA #GKE #Production
工程价值: ⭐⭐⭐

核心原则:

"将 replica count 和 node count 作为两个独立、可组合的控制杆。" "Deployment behind a Service 是生产模式;StatefulSet 用于稳定身份和多节点推理;LeaderWorkerSet 用于跨多 pod 的多节点推理。"

KEDA 扩缩策略: - vllm:num_requests_waiting:队列等待数触发 - 副本数与节点数解耦:KEDA 控制副本,Cluster Autoscaler 控制节点


📝 四、CSDN(中文高价值技术内容)

说明: 今日直接 CSDN 高价值条目已在晨间 / 上午 engineering filter 中覆盖(CSDN 侧重点为 vLLM/SGLang/Agent 部署排障、C++ 密码学、MLOps)。本节聚焦 2026-08-01 新发现条目。

S1 · 各推理引擎 2026 综合横评(vLLM / SGLang / LMDeploy / TensorRT-LLM / TGI)⭐⭐⭐⭐

来源: Premai.io Blog
标签: #CSDN #Inference-Engine #Benchmark #2026
可信度: 高(多方数据汇总)
工程价值: ⭐⭐⭐⭐

关键发现: - SGLang:多轮对话最优,多轮 + shared context 场景下 RadixAttention 带来 10-20% 额外提升 - LMDeploy:量化模型 serving 性价比最高,适合受限硬件 - vLLM:生态最成熟,通用生产默认选择 - TensorRT-LLM:需要 28 分钟编译,模型稳定后吞吐量最优 - TGI(2025-12 进入维护模式):仅接受 bug 修复,无新功能

每月 GPU 成本差异:

"29% 吞吐量差距在每日百万请求规模下 ≈ 每月节省 $15,000 GPU 成本"


S2 · 各场景向量数据库选型(MarkTechPost 2026-05 综合)⭐⭐⭐

来源: MarkTechPost
标签: #CSDN #VecDB #PostgreSQL #Pinecone #Qdrant #Chroma
可信度: 中高(综合多个信息源)
工程价值: ⭐⭐⭐

实用决策树: - 已有 PG + <500万向量 → pgvector - 有 MongoDB → Atlas Vector Search(零迁移) - RAG 原型 → Chroma(快速,plan 迁移路径) - 需要语义+关键词+过滤 → Weaviate - 预算敏感 + 生产性能 → Qdrant(自托管)


🔬 五、Reproduction(可复现工程 / Eval / Benchmark)


R1 · MirrorCode Benchmark:AI 完成长达一周编程任务 ⭐⭐⭐⭐⭐

来源: Import AI 466 + METR/Epoch AI
URL: https://github.com/epoch-research/MirrorCode
时间: 2026-08-01(Import AI RSS 新报道)
标签: #Coding-Agent #Benchmark #METR #Epoch #MirrorCode #Long-horizon
可信度: 极高(METR + Epoch AI 联合发布,有开源代码)
工程价值: ⭐⭐⭐⭐⭐

Benchmark 设计(真实可复现): - 目标:测试 AI 系统完成"人类需要数周"编程任务的能力 - 25 个目标程序(Apple pkl 61k LOC、gotree 16k LOC、qsv_select 87k LOC、ruff Python linter) - 仅通过 CLI 访问目标程序源码(无源代码、无 web 访问),需要从零完整重新实现

具体性能数据:

模型 任务 推理成本 人类预估时间
Opus 4.7 gotree(多语言) 2-17 周
Opus 4.7 pkl(61k LOC) 2-17 周
GPT-5.5 gotree 2-17 周
Opus 4.7 ruff 未解决

关键数字: - Opus 4.7:14 小时完成,$251 推理成本 - 25 个目标中:17 个达 100% 正确率;4 个 >99%;8 个未达 100%;4 个未达 99% - 1 年前领先模型:得分约 30%,仅能完成简单程序

开源资产: - GitHub:github.com/epoch-research/MirrorCode - 包含 scaffold + 22/25 目标程序(132 个任务实例,6 种语言)

关键工程洞察:

"AI 系统能自我定位(self-orient):仅通过黑盒 I/O 访问就能从零构建对标原程序的自研实现。这意味着高度智能的 Agent 可能具有从真实世界 bootstrapping 工业文明形态的能力。"


R2 · Lilian Weng:Harness Engineering for Self-Improvement ⭐⭐⭐⭐⭐

来源: Lil'Log(Lilian Weng,OpenAI 前安全工程负责人)
URL: https://lilianweng.github.io/posts/2026-07-04-harness/
时间: 2026-07-04(RSS 2026-08-01 新发现)
标签: #Harness #RSI #Agent-Architecture #Self-Improvement #Framework
可信度: 极高(顶级 engineer 技术博客)
工程价值: ⭐⭐⭐⭐⭐

核心框架:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State

三大 Harness 设计模式:

Pattern 1: Workflow Automation(Karpathy autoresearch) - GitHub: github.com/karpathy/autoresearch - Goal-oriented loop: plan → execute → observe/test → improve → loop - 关键:用 agent runtime 而非静态 prompt 模板做迭代

Pattern 2: File System as Persistent Memory - 长期 agent 任务中 artifacts(实验日志、代码 diff、错误 trace)远大于 context window - 解决方案:用文件系统做持久化存储 - 优势:利用模型自身读写文件能力,管理成本随模型能力提升自动下降

Pattern 3: Sub-agent and Backend Jobs - 主 agent 并行 spawn 多个 subagent - 关键:并行性必须显式可检查(stored as files, logs, status records) - 主 agent 需要 process manager:launch jobs、inspect logs、cancel failed runs、merge results

Coding Agent 工具集(具体可执行):

类别 工具
文件系统 glob, grep, ls, read, read_many, write, edit, multi_edit, apply_patch
Shell bash, PowerShell
IO lsp, git_status, git_diff, git_commit
外部上下文 MCP tools, Skills
Web web_search, web_fetch, browser tools
Backend CronCreate, CronDelete, CronList
Agent 委托 spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent

RSI 现实路径判断:

"近期 RSI 的实际路径不太可能是模型直接重写自身权重。更现实的路径:harness 工程进化为 meta-methodology(改进构建模型的机器),同时模型能力通过 pretraining 自然增长。"


R3 · Simon Willison:MCP 2.0 Stateless 协议重大变更 ⭐⭐⭐⭐⭐

来源: Simon Willison 博客(2026-07-31)
URL: https://simonwillison.net/2026/Jul/31/stateless-mcp/
标签: #MCP #Protocol #Stateless #SDK #Anthropic
可信度: 极高(Simon Willison 亲验 + 源码)
工程价值: ⭐⭐⭐⭐⭐

Before(legacy stateful MCP): 两次 HTTP 请求

POST /mcp  # Step 1: initialize, 获取 Mcp-Session-Id
Mcp-Session-Id: 1868a90c-3a3f-4f5b
POST /mcp  # Step 2: 实际调用 tool

After(MCP 2.0 stateless): 单次 HTTP 请求

POST /mcp HTTP/1.1
MCP-Protocol-Version: 2026-07-28
Mcp-Method: tools/call
Mcp-Name: search
Content-Type: application/json
{"method": "tools/call", "params": {"name": "search", "arguments": {"q": "otters"}, ...}}

工程优势: 1. 客户端/服务端实现大幅简化 2. 适合构建可扩展 web 应用(无需 server-side session state) 3. 无需担心 session 路由到同一后端机器 4. 小模型(laptop 上运行的)也能良好驱动 MCP

可执行命令:

# 列出 MCP 服务器工具
uvx mcp-explorer list https://agentic-mermaid.dev/mcp

# 查看特定工具 schema
uvx mcp-explorer inspect render_svg

# 调用工具
uvx mcp-explorer call https://agentic-mermaid.dev/mcp render_svg \
  -a source 'graph TD; A-->B' \
  -a options '{"padding":24}'

GitHub: github.com/simonw/mcp-explorer、github.com/simonw/datasette-mcp


R4 · smevals:小型 Eval Suite(可执行 CLI)⭐⭐⭐⭐

来源: Simon Willison + Prime Radiant
URL: github.com/prime-radiant-inc/smevals
标签: #Eval #Harness #Framework #Agent #Testing
可信度: 高(Simon Willison + Prime Radiant 实验室)
工程价值: ⭐⭐⭐⭐

Eval 核心术语体系: - Eval:评估"某模型在 X 能力上表现如何" - Task:具体挑战(如"生成一只骑自行车的鹈鹕的 SVG") - Config:模型配置(model、system prompt、参数、harness) - Run:特定 config 执行特定 task 的记录 - Grader:评估 Run 结果 - Checker:检查逻辑(简单字符串匹配或 LLM 评判)

可执行命令:

# 探索 eval
uvx smevals docs

# 多模型对比
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6

# 评分
uvx smevals grade path-to-eval/

# 本地结果服务
uvx smevals serve path-to-eval/

# 构建静态 HTML 报告
uvx smevals build path-to-eval/

与 R2(R3/Lilian Weng)的关联: eval 是 harness 闭环的关键组件;smevals 提供了可直接试用的 CLI 工具


R5 · MSR Echoverse:训练 Computer-Use Agent 的深度演进环境 ⭐⭐⭐⭐

来源: Microsoft Research Blog
URL: github.com/microsoft/Echoverse + huggingface.co/datasets/microsoft/Echoverse
标签: #Computer-Use-Agent #Training #Simulation #MSR #RL
可信度: 极高(MSR 官方)
工程价值: ⭐⭐⭐⭐

核心问题: computer-use agent 不能在真实环境(email、banking、医疗记录、云 console)中训练,因为每次尝试都会写到真实账户,且无法 reset。

解决方案:合成世界(Synthetic World) - 状态真实且可变,但可以安全破坏、快速 reset - 用数据而非截图来 grading

具体数据: - 12 个训练世界(10 个 deep domain worlds + 2 个 capability worlds) - Capability worlds 专门训练 date pickers 和 nested filters(agent 最常卡住的 UI 元素) - 训练在 12 个世界上,9B 模型:36.5% → 67.1%(几乎翻倍) - 与 GPT-5.4 差距缩小到 14 个百分点

关键工程发现: 1. High simulation fidelity is a must-have:浅层 world 导致模型 regression,深层 world 带来提升 2. Drilling challenging controls:专门训练 date pickers 和 nested filters,效果可泛化 3. Co-evolution:模型、世界、verifier 三者共同演进 4. RL > Imitation:用 grounded verifier 做 reward,RL 超越 imitation learning

开源: GitHub: microsoft/Echoverse(4 个世界开源);Hugging Face: microsoft/Echoverse 数据集


📋 汇总

分类 条目 优先级
Database D1 pgvectorscale benchmark、D2 CIDR decoupled PG vector、D3 LanceDB ⭐⭐⭐⭐⭐ / ⭐⭐⭐⭐ / ⭐⭐⭐
Backend B1 vLLM 0.7 MRv2、B2 SGLang vs vLLM benchmark、B3 llm-d CNCF Sandbox ⭐⭐⭐⭐⭐ × 3
Cloud-Native C1 Kthena、C2 vLLM K8s CNBC Guide、C3 ScaleOps K8s ⭐⭐⭐⭐ × 3
CSDN S1 推理引擎横评、S2 VecDB 选型 ⭐⭐⭐⭐ / ⭐⭐⭐
Reproduction R1 MirrorCode、R2 Lilian Weng Harness、R3 MCP 2.0 Stateless、R4 smevals、R5 MSR Echoverse ⭐⭐⭐⭐⭐ × 5

🎯 后续行动

优先级 行动 理由
极高 跟进 R1 MirrorCode GitHub benchmark + 试用 有开源代码,$251 成本数字具体可复现
极高 跟进 R3 MCP 2.0 mcp-explorer 源码 + 试用 uvx 命令 重大协议变更,直接影响 Agent SDK 设计
极高 跟进 B3 llm-d Well-Lit Paths + CNCF Sandbox 状态 进入 CNCF,Kubernetes 原生推理的事实标准
跟进 R2 Lilian Weng Harness 原文全文 + Karpathy autoresearch 3 patterns + 工具集定义,Agent 架构核心参考
跟进 R4 smevals GitHub + 试用 uvx smevals 命令 eval 是 harness 闭环关键,可直接试用
跟进 R5 Echoverse GitHub(4 个开源世界) 高仿真训练环境是 agent 能力突破关键
跟进 D1 pgvectorscale benchmark + 精读 Timescale 官方 blog 11x Qdrant 性能是向量数据库格局变化信号
跟进 B1 vLLM 0.7 streaming parser engine + 试用 支持 Qwen3、MiniMax-M2、GLM 等新模型
跟进 C1 Kthena vs llm-d 功能边界对比 两个 CNCF 相关项目的生态位区分
跟进 B2 SGLang 0.5.8 新特性 + H100 实际部署测试 400k GPUs 部署规模,实际生产验证

📁 建议写入路径

/shared/research-kb/inbox/jay/2026-08-01T1105-jay-five-category-briefing.md

🔖 主题页更新建议

主题页 建议更新内容
VecDB / Database D1(pgvectorscale 11x benchmark)、D2(CIDR 2026 解耦方案)、D3(LanceDB edge 场景)
LLM Inference Backend B1(vLLM 0.7 MRv2 + streaming parser)、B2(SGLang vs vLLM benchmark 2026)、B3(llm-d CNCF Sandbox)
Kubernetes / Cloud-Native C1(Kthena)、C2(CNCF vLLM K8s 部署指南)、C3(ScaleOps KEDA 扩缩)
Agent Harness / Eval R1(MirrorCode + $251 数字)、R2(Lilian Weng Harness 3 patterns)、R3(MCP 2.0 stateless)、R4(smevals eval CLI)、R5(Echoverse RL vs imitation)
Agent 技术栈 R3(MCP 2.0)+ R2(Harness patterns)

本简报覆盖时间:2026-08-01 00:00 - 11:05 UTC
下一个推送窗口:2026-08-01 14:00-15:00 UTC