知识库简报 · Jay · 2026-08-01 11:05(第三次推送)
主题:数据库 / 后端 / 云原生 / CSDN / 工程复现 · 每日第三次高频简报
📦 一、Database(向量数据库 & 存储系统)
D1 · pgvectorscale 基准重大突破:471 QPS @ 99% recall — 11倍于 Qdrant ⭐⭐⭐⭐⭐
来源: Actian State of Vector DB Q2 2026 + Firecrawl Benchmark
时间: 2026-06(数据)/ 2026-07(实测对比)
标签: #pgvector #pgvectorscale #VecDB #Benchmark #PostgreSQL
可信度: 高(TigerData 官方 benchmark,AWS r6id.4xlarge 独立验证)
工程价值: ⭐⭐⭐⭐⭐
核心数据: - pgvectorscale(Timescale):471.57 QPS,99% recall,50M 向量(768 维,Cohere Wikipedia 数据集) - Qdrant:41.47 QPS,相同 recall 条件,差距 11.4 倍 - p95 延迟比 Pinecone s1 低 28 倍 - pgvector + pgvectorscale 组合:<50M 向量规模,TCO 降低 40-60%(对比独立 VecDB)
2026 向量数据库选型共识( practitioners 投票):
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 已有 PostgreSQL + <1000万向量 | pgvector | 一条 CREATE EXTENSION,无需新服务 |
| 亿级向量 + 分布式查询 | Milvus | 分片管理成熟 |
| 原生混合搜索(关键词+向量) | Weaviate | 内嵌 embedding 模型 |
| 可组合过滤 + 性能优先 | Qdrant | JSON 过滤 + 高召回 |
| RAG 原型 / Chroma 迁移 | Chroma → Qdrant/pgvector | 快速启动,后期迁移 |
| 已用 MongoDB | Atlas Vector Search | 零数据迁移 |
技术细节(HNSW + IVFFlat): - HNSW:内存密集,查询质量高,构建时间长 - IVFFlat:磁盘友好,适合冷启动 - pgvectorscale 额外优化:streaming diskANN,支持超出内存的向量规模
工程启示:
"2026 年社区共识:在 5000 万向量以下,PostgreSQL + pgvector + pgvectorscale 的组合已经能对抗专用向量数据库,且无需维护独立服务、无同步 pipeline、无额外凭证。"
来源链接: - https://www.actian.com/blog/developer/state-of-vector-databases-q2-2026 - https://www.firecrawl.dev/blog/best-vector-databases - https://www.marktechpost.com/2026/05/10/best-vector-databases-in-2026
D2 · CIDR 2026:PostgreSQL 解耦向量搜索新方法(Decoupled Approach)⭐⭐⭐⭐
来源: Purdue University,CIDR'26 论文(2026-01)
URL: https://cs.purdue.edu/homes/csjgwang/pubs/CIDR26_PostgreSQLVector.pdf
标签: #pgvector #PASE #PostgreSQL #CIDR2026 #学术
可信度: 高(CIDR 学术会议论文)
工程价值: ⭐⭐⭐⭐
核心贡献: - 分析了 pgvector 和 PASE(PostgreSQL 上的近似搜索扩展)在 SIFT10M 和 DEEP10M 数据集上的内存索引表现 - 提出解耦方法:将向量索引与 PostgreSQL 行存储分离,降低 buffer pool 竞争 - 评估了 memory-based vector indexes 在不同 buffer 配置下的性能差异
工程关联: - 与 pgvectorscale 的 streaming 方向互补 - 可为大规模向量索引的 PostgreSQL 配置提供调优参考
D3 · LanceDB:嵌入式零服务器向量数据库 ⭐⭐⭐
来源: Firecrawl Benchmark
标签: #LanceDB #Edge #Local-First #Columnar
工程价值: ⭐⭐⭐
特点: - 进程内运行(in-process),零复制访问(zero-copy) - 基于 Lance 列式格式,适合边缘部署和本地优先应用 - 不需要独立服务器,适合数据科学工作流 - 与 Chroma 定位相似但底层格式更高效
适用场景: - 边缘 AI:物联网、离线终端 - 本地 RAG 原型 - 数据科学 Notebook(直接读写 Lance 文件)
⚙️ 二、Backend(LLM 推理引擎 & 后端系统)
B1 · vLLM 0.7+ 最新发布:Model Runner V2 成默认执行路径 ⭐⭐⭐⭐⭐
来源: GitHub vllm-project/vllm Releases + NVIDIA Docs
标签: #vLLM #ModelRunnerV2 #PagedAttention #Inference
可信度: 极高(vLLM 官方 GitHub + NVIDIA 官方文档)
工程价值: ⭐⭐⭐⭐⭐
v0.7 / Rel-26.07 关键新特性:
| 特性 | 说明 |
|---|---|
| Model Runner V2(MRv2) | 所有 dense 模型默认执行路径,支持 EVS、realtime embeddings、prefix caching for Mamba hybrid |
| Streaming Parser Engine | 统一 tool-call / reasoning 解析,支持 Qwen3、MiniMax-M2、GLM-4.7/5.1/5.2、Nemotron V3 |
| DiffusionGemma | 新增 diffusion LLM 支持,含 CPU path |
| WideEP / DeepEP v2 | 专家并行新版本,已集成 |
| Multimodal prefix bidirectional attention | 多模态 prefix 缓存优化 |
| Dynamic speculative decoding | 支持完整 CUDA graph |
| Bug 修复 | grammar 编译失败不崩溃;logprobs token-string 碰撞修复 |
NVIDIA vLLM Container Rel-26.07 关键信息:
- 基于 CUDA 13.3.1
- 已知问题:vllm serve 默认激进 GPU 内存分配(≈1.0),在共享/统一内存平台(DGX Spark、Jetson)上易 OOM
- 解决:--gpu-memory-utilization 0.7
来源: - https://github.com/vllm-project/vllm/releases - https://docs.nvidia.com/deeplearning/frameworks/vllm-release-notes/rel-26-07.html
B2 · SGLang vs vLLM 2026 Benchmark:SGLang 领先 29% 吞吐量 ⭐⭐⭐⭐
来源: Local AI Master + Multiple Benchmarks(2026-07)
标签: #SGLang #vLLM #Benchmark #H100 #Throughput
可信度: 高(多方独立测试一致)
工程价值: ⭐⭐⭐⭐
H100 80GB / Llama 3.1 8B / 1000 ShareGPT Prompts 实测:
| 指标 | SGLang | vLLM | 差距 |
|---|---|---|---|
| 总吞吐量 | 16,215 tok/s | 12,553 tok/s | SGLang +29% |
| 输出 token 吞吐 | 893.82 tok/s | 412.99 tok/s | SGLang +116% |
| TTFT | 79.42 ms | 102.65 ms | SGLang 更快 |
| ITL | 6.03 ms | 7.14 ms | SGLang 更稳定 |
| 延迟范围 | 4-21ms(稳定) | 波动大 | SGLang 更一致 |
SGLang 核心优势:RadixAttention - 在共享前缀场景(多轮对话、agent 循环)下,RadixAttention 提供 10-20% 额外提升 - 2026 年 3 月已集成 PyTorch 生态,v0.5.8(2026-01 发布) - 全球部署超过 400,000 GPUs,成为 agentic 工作负载的事实标准
vLLM 核心优势:PagedAttention - 内存效率更高(<4% 碎片 vs 传统 60-80%) - 生态更广:H100/B200/GB200 全面支持,FP8、NVFP4 均支持 - Blackwell(SM100/SM103)原生支持:v0.17.0+
实用选型建议:
- 前台 Chat API → SGLang(TTFT 更低,多轮更稳定)
- 内部批处理 pipeline → vLLM(内存效率高,模型兼容性更广)
- 两者均可通过 OpenAI 兼容 API(/v1/chat/completions)接入,客户端无需改动
B3 · llm-d 进入 CNCF Sandbox:Kubernetes 原生 LLM 推理框架 ⭐⭐⭐⭐⭐
来源: CNCF Blog + llm-d.ai 官方 + Google Cloud Blog
时间: 2026-03-24(进入 Sandbox)
标签: #llm-d #CNCF #Kubernetes #Disaggregated-Inference #Prefill-Decode
可信度: 极高(CNCF + Google Cloud + Red Hat + NVIDIA + CoreWeave 联合背书)
工程价值: ⭐⭐⭐⭐⭐
核心架构:Prefill/Decode 分离
请求路由 → Gateway API Inference Extension → KV Cache 感知路由
↓
┌─────────────┴─────────────┐
Prefill GPU Pool Decode GPU Pool
(处理首 token) (处理后续 token)
相比 NVIDIA Dynamo 的差异化: - Dynamo:编排层,运行在 vLLM 上层,Kubernetes 外部 - llm-d:第一类 Kubernetes 公民,使用标准 CRD + Gateway API Inference Extension
Benchmark 数据(v0.5,Google Cloud 测试): - 3x 更高输出吞吐量 - 2x 更快 TTFT - 16×16 B200 prefill/decode 拓扑:最高 50k output tok/s - 相比 round-robin 基线:TTFT 数量级降低
v0.5 新特性: - 可复现 benchmark 工作流 - 分层 KV offloading - 缓存感知 LoRA 路由 - active-active HA - UCCL 传输弹性 - scale-to-zero 自动扩缩容
创始成员: Red Hat、Google Cloud、IBM Research、CoreWeave、NVIDIA(黄金);AMD、Cisco、Hugging Face、Intel、Lambda、Mistral AI(白银)
Well-Lit Paths(生产就绪配方): - 部署优化基线 - 按预测延迟路由 - 启用精确 prefix-cache 感知路由 - 配置分层 prefix cache - 部署 Prefill/Decode 分离
来源: - https://llm-d.ai - https://www.cncf.io/blog/2026/07/16/running-a-self-hosted-llm-in-kubernetes-with-vllm - https://cloud.google.com/blog/products/ai-machine-learning/enhancing-vllm-for-distributed-inference-with-llm-d
☁️ 三、Cloud-Native(Kubernetes & 云原生基础设施)
C1 · Kthena:Volcano 项目发布的 LLM 推理调度层 ⭐⭐⭐⭐
来源: Volcano Project Blog
标签: #Kubernetes #Kthena #LLM-Scheduling #Prefill-Decode #CNCF
可信度: 高(Linux Foundation 旗下项目)
工程价值: ⭐⭐⭐⭐
核心定位: 智能编排层,运行在 vLLM / SGLang 等推理引擎之上
三层架构(Hierarchical Workload Architecture):
ModelServing → ServingGroup → Role
关键能力: - 拓扑感知调度:GPU / NPU 亲和性 - KV Cache 感知路由:根据 cache 热度分配请求 - Prefill-Decode 分离:类似 llm-d,但作为 Volcano 生态的解决方案 - 提升 GPU/NPU 利用率,降低延迟
注意: 与 llm-d 有功能重叠,但 Kthena 侧重 Volcano 生态的调度层,llm-d 侧重完整 Kubernetes 原生服务栈
C2 · vLLM Kubernetes 生产部署实战指南(CNBC)⭐⭐⭐⭐
来源: CNCF Blog(Michael Troutman,LINBIT)
时间: 2026-07-16
标签: #Kubernetes #vLLM #PVC #MetalLB #Prometheus #Production
可信度: 高(CNCF 官方博客)
工程价值: ⭐⭐⭐⭐
部署关键要素:
| 组件 | 说明 |
|---|---|
| Deployment(而非 DaemonSet) | 80% 场景的正确选择;DaemonSet 无法被 KEDA 控制副本数 |
| PVC(PersistentVolumeClaim) | 模型存储(HF token 存 Secret) |
| GPU Request | 每副本请求所需 GPU 数 |
KEDA + vllm:num_requests_waiting |
基于队列深度的自动扩缩 |
| Cluster Autoscaler / Karpenter | 节点级别扩缩 |
| MetalLB | 裸金属 LoadBalancer(bare-metal 环境) |
| DCGM Exporter | GPU 利用率监控(注意:managed K8s 上 honorLabels 问题) |
生产陷阱:
- DCGM exporter 在托管 K8s 上不是 drop-in:honorLabels 不设置会导致 per-pod GPU 归属统计失效
- vLLM 持有 GPU 内存不释放:需要正确的 shutdown grace period
C3 · ScaleOps 完整 vLLM on K8s 指南:Deployment + HPA/KEDA 实战 ⭐⭐⭐
来源: ScaleOps Blog
标签: #Kubernetes #vLLM #KEDA #HPA #GKE #Production
工程价值: ⭐⭐⭐
核心原则:
"将 replica count 和 node count 作为两个独立、可组合的控制杆。" "Deployment behind a Service 是生产模式;StatefulSet 用于稳定身份和多节点推理;LeaderWorkerSet 用于跨多 pod 的多节点推理。"
KEDA 扩缩策略:
- vllm:num_requests_waiting:队列等待数触发
- 副本数与节点数解耦:KEDA 控制副本,Cluster Autoscaler 控制节点
📝 四、CSDN(中文高价值技术内容)
说明: 今日直接 CSDN 高价值条目已在晨间 / 上午 engineering filter 中覆盖(CSDN 侧重点为 vLLM/SGLang/Agent 部署排障、C++ 密码学、MLOps)。本节聚焦 2026-08-01 新发现条目。
S1 · 各推理引擎 2026 综合横评(vLLM / SGLang / LMDeploy / TensorRT-LLM / TGI)⭐⭐⭐⭐
来源: Premai.io Blog
标签: #CSDN #Inference-Engine #Benchmark #2026
可信度: 高(多方数据汇总)
工程价值: ⭐⭐⭐⭐
关键发现: - SGLang:多轮对话最优,多轮 + shared context 场景下 RadixAttention 带来 10-20% 额外提升 - LMDeploy:量化模型 serving 性价比最高,适合受限硬件 - vLLM:生态最成熟,通用生产默认选择 - TensorRT-LLM:需要 28 分钟编译,模型稳定后吞吐量最优 - TGI(2025-12 进入维护模式):仅接受 bug 修复,无新功能
每月 GPU 成本差异:
"29% 吞吐量差距在每日百万请求规模下 ≈ 每月节省 $15,000 GPU 成本"
S2 · 各场景向量数据库选型(MarkTechPost 2026-05 综合)⭐⭐⭐
来源: MarkTechPost
标签: #CSDN #VecDB #PostgreSQL #Pinecone #Qdrant #Chroma
可信度: 中高(综合多个信息源)
工程价值: ⭐⭐⭐
实用决策树: - 已有 PG + <500万向量 → pgvector - 有 MongoDB → Atlas Vector Search(零迁移) - RAG 原型 → Chroma(快速,plan 迁移路径) - 需要语义+关键词+过滤 → Weaviate - 预算敏感 + 生产性能 → Qdrant(自托管)
🔬 五、Reproduction(可复现工程 / Eval / Benchmark)
R1 · MirrorCode Benchmark:AI 完成长达一周编程任务 ⭐⭐⭐⭐⭐
来源: Import AI 466 + METR/Epoch AI
URL: https://github.com/epoch-research/MirrorCode
时间: 2026-08-01(Import AI RSS 新报道)
标签: #Coding-Agent #Benchmark #METR #Epoch #MirrorCode #Long-horizon
可信度: 极高(METR + Epoch AI 联合发布,有开源代码)
工程价值: ⭐⭐⭐⭐⭐
Benchmark 设计(真实可复现): - 目标:测试 AI 系统完成"人类需要数周"编程任务的能力 - 25 个目标程序(Apple pkl 61k LOC、gotree 16k LOC、qsv_select 87k LOC、ruff Python linter) - 仅通过 CLI 访问目标程序源码(无源代码、无 web 访问),需要从零完整重新实现
具体性能数据:
| 模型 | 任务 | 推理成本 | 人类预估时间 |
|---|---|---|---|
| Opus 4.7 | gotree(多语言) | — | 2-17 周 |
| Opus 4.7 | pkl(61k LOC) | — | 2-17 周 |
| GPT-5.5 | gotree | — | 2-17 周 |
| Opus 4.7 | ruff | 未解决 | — |
关键数字: - Opus 4.7:14 小时完成,$251 推理成本 - 25 个目标中:17 个达 100% 正确率;4 个 >99%;8 个未达 100%;4 个未达 99% - 1 年前领先模型:得分约 30%,仅能完成简单程序
开源资产: - GitHub:github.com/epoch-research/MirrorCode - 包含 scaffold + 22/25 目标程序(132 个任务实例,6 种语言)
关键工程洞察:
"AI 系统能自我定位(self-orient):仅通过黑盒 I/O 访问就能从零构建对标原程序的自研实现。这意味着高度智能的 Agent 可能具有从真实世界 bootstrapping 工业文明形态的能力。"
R2 · Lilian Weng:Harness Engineering for Self-Improvement ⭐⭐⭐⭐⭐
来源: Lil'Log(Lilian Weng,OpenAI 前安全工程负责人)
URL: https://lilianweng.github.io/posts/2026-07-04-harness/
时间: 2026-07-04(RSS 2026-08-01 新发现)
标签: #Harness #RSI #Agent-Architecture #Self-Improvement #Framework
可信度: 极高(顶级 engineer 技术博客)
工程价值: ⭐⭐⭐⭐⭐
核心框架:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State
三大 Harness 设计模式:
Pattern 1: Workflow Automation(Karpathy autoresearch) - GitHub: github.com/karpathy/autoresearch - Goal-oriented loop: plan → execute → observe/test → improve → loop - 关键:用 agent runtime 而非静态 prompt 模板做迭代
Pattern 2: File System as Persistent Memory - 长期 agent 任务中 artifacts(实验日志、代码 diff、错误 trace)远大于 context window - 解决方案:用文件系统做持久化存储 - 优势:利用模型自身读写文件能力,管理成本随模型能力提升自动下降
Pattern 3: Sub-agent and Backend Jobs - 主 agent 并行 spawn 多个 subagent - 关键:并行性必须显式可检查(stored as files, logs, status records) - 主 agent 需要 process manager:launch jobs、inspect logs、cancel failed runs、merge results
Coding Agent 工具集(具体可执行):
| 类别 | 工具 |
|---|---|
| 文件系统 | glob, grep, ls, read, read_many, write, edit, multi_edit, apply_patch |
| Shell | bash, PowerShell |
| IO | lsp, git_status, git_diff, git_commit |
| 外部上下文 | MCP tools, Skills |
| Web | web_search, web_fetch, browser tools |
| Backend | CronCreate, CronDelete, CronList |
| Agent 委托 | spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent |
RSI 现实路径判断:
"近期 RSI 的实际路径不太可能是模型直接重写自身权重。更现实的路径:harness 工程进化为 meta-methodology(改进构建模型的机器),同时模型能力通过 pretraining 自然增长。"
R3 · Simon Willison:MCP 2.0 Stateless 协议重大变更 ⭐⭐⭐⭐⭐
来源: Simon Willison 博客(2026-07-31)
URL: https://simonwillison.net/2026/Jul/31/stateless-mcp/
标签: #MCP #Protocol #Stateless #SDK #Anthropic
可信度: 极高(Simon Willison 亲验 + 源码)
工程价值: ⭐⭐⭐⭐⭐
Before(legacy stateful MCP): 两次 HTTP 请求
POST /mcp # Step 1: initialize, 获取 Mcp-Session-Id
Mcp-Session-Id: 1868a90c-3a3f-4f5b
POST /mcp # Step 2: 实际调用 tool
After(MCP 2.0 stateless): 单次 HTTP 请求
POST /mcp HTTP/1.1
MCP-Protocol-Version: 2026-07-28
Mcp-Method: tools/call
Mcp-Name: search
Content-Type: application/json
{"method": "tools/call", "params": {"name": "search", "arguments": {"q": "otters"}, ...}}
工程优势: 1. 客户端/服务端实现大幅简化 2. 适合构建可扩展 web 应用(无需 server-side session state) 3. 无需担心 session 路由到同一后端机器 4. 小模型(laptop 上运行的)也能良好驱动 MCP
可执行命令:
# 列出 MCP 服务器工具
uvx mcp-explorer list https://agentic-mermaid.dev/mcp
# 查看特定工具 schema
uvx mcp-explorer inspect render_svg
# 调用工具
uvx mcp-explorer call https://agentic-mermaid.dev/mcp render_svg \
-a source 'graph TD; A-->B' \
-a options '{"padding":24}'
GitHub: github.com/simonw/mcp-explorer、github.com/simonw/datasette-mcp
R4 · smevals:小型 Eval Suite(可执行 CLI)⭐⭐⭐⭐
来源: Simon Willison + Prime Radiant
URL: github.com/prime-radiant-inc/smevals
标签: #Eval #Harness #Framework #Agent #Testing
可信度: 高(Simon Willison + Prime Radiant 实验室)
工程价值: ⭐⭐⭐⭐
Eval 核心术语体系: - Eval:评估"某模型在 X 能力上表现如何" - Task:具体挑战(如"生成一只骑自行车的鹈鹕的 SVG") - Config:模型配置(model、system prompt、参数、harness) - Run:特定 config 执行特定 task 的记录 - Grader:评估 Run 结果 - Checker:检查逻辑(简单字符串匹配或 LLM 评判)
可执行命令:
# 探索 eval
uvx smevals docs
# 多模型对比
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6
# 评分
uvx smevals grade path-to-eval/
# 本地结果服务
uvx smevals serve path-to-eval/
# 构建静态 HTML 报告
uvx smevals build path-to-eval/
与 R2(R3/Lilian Weng)的关联: eval 是 harness 闭环的关键组件;smevals 提供了可直接试用的 CLI 工具
R5 · MSR Echoverse:训练 Computer-Use Agent 的深度演进环境 ⭐⭐⭐⭐
来源: Microsoft Research Blog
URL: github.com/microsoft/Echoverse + huggingface.co/datasets/microsoft/Echoverse
标签: #Computer-Use-Agent #Training #Simulation #MSR #RL
可信度: 极高(MSR 官方)
工程价值: ⭐⭐⭐⭐
核心问题: computer-use agent 不能在真实环境(email、banking、医疗记录、云 console)中训练,因为每次尝试都会写到真实账户,且无法 reset。
解决方案:合成世界(Synthetic World) - 状态真实且可变,但可以安全破坏、快速 reset - 用数据而非截图来 grading
具体数据: - 12 个训练世界(10 个 deep domain worlds + 2 个 capability worlds) - Capability worlds 专门训练 date pickers 和 nested filters(agent 最常卡住的 UI 元素) - 训练在 12 个世界上,9B 模型:36.5% → 67.1%(几乎翻倍) - 与 GPT-5.4 差距缩小到 14 个百分点
关键工程发现: 1. High simulation fidelity is a must-have:浅层 world 导致模型 regression,深层 world 带来提升 2. Drilling challenging controls:专门训练 date pickers 和 nested filters,效果可泛化 3. Co-evolution:模型、世界、verifier 三者共同演进 4. RL > Imitation:用 grounded verifier 做 reward,RL 超越 imitation learning
开源: GitHub: microsoft/Echoverse(4 个世界开源);Hugging Face: microsoft/Echoverse 数据集
📋 汇总
| 分类 | 条目 | 优先级 |
|---|---|---|
| Database | D1 pgvectorscale benchmark、D2 CIDR decoupled PG vector、D3 LanceDB | ⭐⭐⭐⭐⭐ / ⭐⭐⭐⭐ / ⭐⭐⭐ |
| Backend | B1 vLLM 0.7 MRv2、B2 SGLang vs vLLM benchmark、B3 llm-d CNCF Sandbox | ⭐⭐⭐⭐⭐ × 3 |
| Cloud-Native | C1 Kthena、C2 vLLM K8s CNBC Guide、C3 ScaleOps K8s | ⭐⭐⭐⭐ × 3 |
| CSDN | S1 推理引擎横评、S2 VecDB 选型 | ⭐⭐⭐⭐ / ⭐⭐⭐ |
| Reproduction | R1 MirrorCode、R2 Lilian Weng Harness、R3 MCP 2.0 Stateless、R4 smevals、R5 MSR Echoverse | ⭐⭐⭐⭐⭐ × 5 |
🎯 后续行动
| 优先级 | 行动 | 理由 |
|---|---|---|
| 极高 | 跟进 R1 MirrorCode GitHub benchmark + 试用 | 有开源代码,$251 成本数字具体可复现 |
| 极高 | 跟进 R3 MCP 2.0 mcp-explorer 源码 + 试用 uvx 命令 | 重大协议变更,直接影响 Agent SDK 设计 |
| 极高 | 跟进 B3 llm-d Well-Lit Paths + CNCF Sandbox 状态 | 进入 CNCF,Kubernetes 原生推理的事实标准 |
| 高 | 跟进 R2 Lilian Weng Harness 原文全文 + Karpathy autoresearch | 3 patterns + 工具集定义,Agent 架构核心参考 |
| 高 | 跟进 R4 smevals GitHub + 试用 uvx smevals 命令 |
eval 是 harness 闭环关键,可直接试用 |
| 高 | 跟进 R5 Echoverse GitHub(4 个开源世界) | 高仿真训练环境是 agent 能力突破关键 |
| 高 | 跟进 D1 pgvectorscale benchmark + 精读 Timescale 官方 blog | 11x Qdrant 性能是向量数据库格局变化信号 |
| 中 | 跟进 B1 vLLM 0.7 streaming parser engine + 试用 | 支持 Qwen3、MiniMax-M2、GLM 等新模型 |
| 中 | 跟进 C1 Kthena vs llm-d 功能边界对比 | 两个 CNCF 相关项目的生态位区分 |
| 中 | 跟进 B2 SGLang 0.5.8 新特性 + H100 实际部署测试 | 400k GPUs 部署规模,实际生产验证 |
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-08-01T1105-jay-five-category-briefing.md
🔖 主题页更新建议
| 主题页 | 建议更新内容 |
|---|---|
| VecDB / Database | D1(pgvectorscale 11x benchmark)、D2(CIDR 2026 解耦方案)、D3(LanceDB edge 场景) |
| LLM Inference Backend | B1(vLLM 0.7 MRv2 + streaming parser)、B2(SGLang vs vLLM benchmark 2026)、B3(llm-d CNCF Sandbox) |
| Kubernetes / Cloud-Native | C1(Kthena)、C2(CNCF vLLM K8s 部署指南)、C3(ScaleOps KEDA 扩缩) |
| Agent Harness / Eval | R1(MirrorCode + $251 数字)、R2(Lilian Weng Harness 3 patterns)、R3(MCP 2.0 stateless)、R4(smevals eval CLI)、R5(Echoverse RL vs imitation) |
| Agent 技术栈 | R3(MCP 2.0)+ R2(Harness patterns) |
本简报覆盖时间:2026-08-01 00:00 - 11:05 UTC
下一个推送窗口:2026-08-01 14:00-15:00 UTC