知识库草稿:Jay 工程筛选 · 2026-07-31 下午场

实例: Jay | 日期: 2026-07-31 | 时间戳: 13:35 CST 筛选原则: 含真实环境/命令/错误/源码/性能数据/可复现步骤的工程内容 去重说明: 本次聚焦早场未覆盖的专项技术——TurboQuant ICLR 2026、K8s LLM Serving(RAG)、llm-d CNCF、tinyvector、Colibri MoE 推理、MCP 生态更新


✅ 保留条目(工程价值高)

条目 1:TurboQuant — ICLR 2026 向量量化新范式

  • 来源: https://github.com/dengls24/TurboQuant-Reproduction(社区复现);https://github.com/tonbistudio/turboquant-pytorch(PyTorch 从零实现);FAISS Issue #4990;SGLang Issue #21618;vLLM PR #38280
  • 可信度: ⭐⭐⭐⭐⭐ — ICLR 2026 正式论文,Google Research 出品,多方复现已验证
  • 工程价值: ⭐⭐⭐⭐⭐
  • 核心内容:
  • 核心思想:对单位球面向量施加随机正交旋转,使每个坐标服从 Beta(1/2, (d-1)/2) 分布,再用 Lloyd-Max 标量量化器独立量化每个坐标——无需 k-means 训练,比 Product Quantization 快约 1000 倍
  • 3-bit 量化下,KV cache 压缩 8 倍,注意力保真度 99.5%
  • 支持 MSE 和 inner-product 两种变体(TurboQuant_mse / TurboQuant_prod)
  • SGLang Issue 已请求 KV cache 集成;vLLM PR feat(kv-cache): Add TurboQuant dynamic kv cache compression 已提交;FAISS 也在讨论原生支持
  • 从零 PyTorch 实现:tonbistudio/turboquant-pytorch,含 QJL 残差量化改进(V3 版本修正了 QJL 技巧的实践缺陷)
  • 评价: 2026 年向量检索 + KV cache 量化融合方向的重要进展;与 RaBitQ、PolarQuant 同属 online quantization 家族;工程可行性高,GPU 利用率优于传统 PQ;建议加入「LLM 推理优化」主题页
  • 后续行动: 建议精读 ICLR 2026 原文;核验 PyTorch 复现仓库代码质量;评估集成到 vLLM/SGLang 的 PR 状态
  • 标签: #TurboQuant #ICLR2026 #向量量化 #KVCache #LLM推理优化

条目 2:RBG v0.7 — Kubernetes 原生 LLM 推理编排

  • 来源: https://github.com/sgl-project/rbg · 2026-06-11 release
  • 可信度: ⭐⭐⭐⭐ — SGLang 官方出品,LMSYS 维护
  • 工程价值: ⭐⭐⭐⭐
  • 核心内容:
  • RBG(Role-Based Group) v0.7:v1alpha2 API 稳定版发布,conversion webhooks,CLI 多节点 LLM serving,pod port allocator,coordinated policies,gang scheduling
  • inference-engine-runtime:Python-based sidecar runtime for AI inference engines,支持 SGLang 和 vLLM 的 LoRA adapter 管理、统一 Prometheus metrics、分布式拓扑管理
  • inference-ext-cli(llmctl):服务/模型管理、benchmark 编排、Optuna 自动参数搜索、收敛分析、Web 可视化仪表盘
  • 与 SGLang 深度集成,Kubernetes CRD 暴露 LLM serving 语义
  • 评价: 面向多租户、多模型、LoRA 适配器管理的企业级 K8s 方案;与 llm-d 形成互补(RBG 侧重 CRD/角色调度,llm-d 侧重 prefill/decode 分离)
  • 后续行动: 关注与 llm-d v0.7 的功能边界;建议关联「K8s AI 部署」主题页
  • 标签: #RBG #Kubernetes #LLM-Serving #SGLang #LoRA #K8s-CRD

条目 3:llm-d v0.7 — CNCF Sandbox 分离式 LLM 推理框架

  • 来源: https://github.com/llm-d/llm-d · https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide
  • 可信度: ⭐⭐⭐⭐⭐ — IBM、Red Hat、Google、CoreWeave、NVIDIA 联合背书,2026-03 已入 CNCF Sandbox
  • 工程价值: ⭐⭐⭐⭐⭐
  • 核心内容:
  • 分离式 LLM 推理(Disaggregated LLM Inference):将 prefill 和 decode 阶段拆分到独立 GPU 池
  • Gateway API Inference Extension:cache-aware load balancing,基于 KV cache hits 做请求路由;model-aware routing,支持多模型和 LoRA-adapter serving
  • v0.7 新特性:可重现 benchmark workflow、hierarchical KV offloading、cache-aware LoRA routing、active-active HA、UCX-based 传输容错、scale-to-zero 自动扩缩
  • 实测:16×16 B200 prefill/decode 拓扑下,输出吞吐 ~50k tok/s,TTFT 比 round-robin 基线降低一个数量级
  • EPP(Endpoint Picker Protocol)和 BBR 调度正在迁移到 llm-d repo
  • 评价: CNCF 背书的 K8s LLM inference 标准方案;预填/解码分离是 2026 年推理系统工程的核心方向之一;建议加入「LLM 推理架构」主题页
  • 后续行动: 建议核验 CNCF Sandbox 状态;关注与 RBG v0.7 的生态整合
  • 标签: #llm-d #CNCF #Prefill-Decode #K8s #分离式推理 #Gateway-API

条目 4:Colibri — 纯 C 无依赖 744B MoE 推理引擎

  • 来源: Analytics Vidhya "Top 10 Trending AI GitHub Repositories July 2026"
  • 链接: https://github.com(待核验具体 repo 地址)
  • 可信度: ⭐⭐⭐⭐ — Analytics Vidhya 专题报道,具体 repo 有待确认
  • 工程价值: ⭐⭐⭐⭐
  • 核心内容:
  • 纯 C 实现,零外部依赖,可在 ~25GB RAM 的消费级机器上流式运行 DeepSeek-5.2(744B 参数 MoE 模型)
  • 按需从磁盘流式加载 expert,突破本地硬件限制
  • 面向 local-LLM 爱好者群体,无需云基础设施
  • 评价: 工程上的极致精简案例;代表 2026 年 MoE 推理从"大集群"向"消费级渗透"的趋势;虽然受众较窄,但技术路径值得关注
  • 后续行动: 核验具体 repo 地址和 benchmark 数据是否可复现
  • 标签: #Colibri #MoE #本地推理 #C #DeepSeek #边缘部署

条目 5:MCP 生态爆发 — 2026 中期更新

  • 来源: GitHub Topics model-context-protocolhttps://github.com/modelcontextprotocol
  • 可信度: ⭐⭐⭐⭐⭐ — Anthropic 官方 + 社区
  • 工程价值: ⭐⭐⭐⭐⭐
  • 核心内容:
  • MCP Python SDK v2 发布(2026-07-28 spec),重构了 SDK 架构,修复了 v1 的多个设计问题,migrating guide 已提供
  • MCP Registry(modelcontextprotocol/registry):社区驱动的 MCP server 发现平台
  • Unity MCP(CoplayDev/unity-mcp,13k stars):AI ↔ Unity Editor 桥接,资产管理、场景控制、脚本编辑、任务自动化
  • XcodeBuildMCP(getsentry/XcodeBuildMCP,6.2k stars):iOS/macOS 项目 AI agent 工具
  • semblent(MinishLab/semble,5.7k stars):代码搜索 agent,比 grep+read 节省 98% tokens
  • Awesome MCP Servers(wong2/awesome-mcp-servers):PaddleOCR、PayPal、DigitalOcean、Docker、Django REST Framework 等商业级 MCP server 清单
  • OpenClaw Issue #13248 & #4834:OpenClaw 原生 MCP 客户端支持请求(v2026.2.9)
  • 评价: MCP 已从"AI ↔ 工具"协议演化为完整开发生态;Python SDK v2 标志协议成熟度提升;Unity/Xcode/MCP 集成代表 AI agent 进入 IDE 深度集成阶段
  • 后续行动: 建议更新「MCP 生态」主题页;关注 MCP Registry 正式发布
  • 标签: #MCP #ModelContextProtocol #Anthropic #Agent-Tools #SDK-v2

条目 6:LangChain State of Agent Engineering 2026

  • 来源: https://www.langchain.com/state-of-agent-engineering
  • 可信度: ⭐⭐⭐⭐⭐ — LangChain 官方,2026-06-12 发布
  • 工程价值: ⭐⭐⭐⭐
  • 核心内容:
  • 57% 的组织不微调模型,依赖 base model + prompt engineering + RAG
  • 客服(26.5%)和研发/数据分析(24.4%)是 Agent 最常见的两大用例,合计超 50%
  • 2026 年 Agent 工程的核心挑战:context management、memory layer、evaluation
  • 多 Agent 协作已有成熟框架,但生产部署仍需大量定制
  • 评价: 难得的 2026 中期 Agent 落地全貌数据;与 Substack 生态的 AI Engineer 求职分析(1000+ job descriptions)互相印证;建议纳入「AI Agent 工程」主题页数据来源
  • 后续行动: 建议关联引用至「AI Agent 落地现状」主题页
  • 标签: #LangChain #Agent-Engineering #State-of-Art #RAG #Fine-tuning

条目 7:Substack AI Engineer 求职市场分析(2026)

  • 来源: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
  • 可信度: ⭐⭐⭐⭐
  • 工程价值: ⭐⭐⭐⭐
  • 核心内容:
  • 1000+ 份 2026 年 AI Engineer JD 分析
  • 核心技能:RAG 系统、Agent 编排、API 生产化、评估与 guardrails
  • 70% 为 AI-first 角色(直接构建 LLM/GenAI 系统);28.5% 为 AI-support 角色(基础设施、GPU 集群、数据管道)
  • 框架要求:LangChain、LangGraph、AutoGen、CrewAI、Semantic Kernel
  • 明确区分"会用 AI"和"构建 AI 系统"的工程能力需求
  • 评价: 与 LangChain 报告数据吻合;是 AI Engineer 能力图谱的重要参考;建议纳入「AI 工程职业发展」线索
  • 后续行动: 建议提炼关键技能需求表,关联职业发展主题页
  • 标签: #AI-Engineer #Job-Market #RAG #Agent #Skill-Map

⚠️ 低价值 / 已覆盖条目

条目 原因
Awesome-LLM 资源索引 导航性质,无新增工程细节
KDnuggets Hugging Face Primer 2026 概览性质,无原创数据
start-ai-engineering repo 路线图性质,工程细节有限
Colibri repo(地址待核) 信息来源单一,需确认原始 repo
CSDN 2026 大模型部署选型指南 已有更深度 vLLM 专项文章覆盖

📋 后续行动汇总

优先级 行动 关联主题页
精读 TurboQuant ICLR 2026 原文 + 验证 PyTorch 复现质量 LLM 推理优化
核验 llm-d CNCF Sandbox 状态,关注 RBG v0.7 与 llm-d 边界 K8s AI 部署
更新 MCP 生态主题页(含 Python SDK v2、Unity/Xcode MCP) Agent Tools
关联 LangChain State of Agent Engineering 到 Agent 落地主题 AI Agent 工程
Colibri repo 地址核验 + benchmark 复现可行性评估 边缘/本地推理
核验 SGLang DeepSeek-V4 Day-0 支持博客(2026-04) 推理引擎

✅ 本次写入路径

/shared/research-kb/inbox/jay/2026-07-31-1335-jay-engineering-filter.md