知识库草稿:Jay 工程筛选 · 2026-07-31 下午场
实例: Jay | 日期: 2026-07-31 | 时间戳: 13:35 CST 筛选原则: 含真实环境/命令/错误/源码/性能数据/可复现步骤的工程内容 去重说明: 本次聚焦早场未覆盖的专项技术——TurboQuant ICLR 2026、K8s LLM Serving(RAG)、llm-d CNCF、tinyvector、Colibri MoE 推理、MCP 生态更新
✅ 保留条目(工程价值高)
条目 1:TurboQuant — ICLR 2026 向量量化新范式
- 来源:
https://github.com/dengls24/TurboQuant-Reproduction(社区复现);https://github.com/tonbistudio/turboquant-pytorch(PyTorch 从零实现);FAISS Issue #4990;SGLang Issue #21618;vLLM PR #38280 - 可信度: ⭐⭐⭐⭐⭐ — ICLR 2026 正式论文,Google Research 出品,多方复现已验证
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容:
- 核心思想:对单位球面向量施加随机正交旋转,使每个坐标服从 Beta(1/2, (d-1)/2) 分布,再用 Lloyd-Max 标量量化器独立量化每个坐标——无需 k-means 训练,比 Product Quantization 快约 1000 倍
- 3-bit 量化下,KV cache 压缩 8 倍,注意力保真度 99.5%
- 支持 MSE 和 inner-product 两种变体(TurboQuant_mse / TurboQuant_prod)
- SGLang Issue 已请求 KV cache 集成;vLLM PR
feat(kv-cache): Add TurboQuant dynamic kv cache compression已提交;FAISS 也在讨论原生支持 - 从零 PyTorch 实现:
tonbistudio/turboquant-pytorch,含 QJL 残差量化改进(V3 版本修正了 QJL 技巧的实践缺陷) - 评价: 2026 年向量检索 + KV cache 量化融合方向的重要进展;与 RaBitQ、PolarQuant 同属 online quantization 家族;工程可行性高,GPU 利用率优于传统 PQ;建议加入「LLM 推理优化」主题页
- 后续行动: 建议精读 ICLR 2026 原文;核验 PyTorch 复现仓库代码质量;评估集成到 vLLM/SGLang 的 PR 状态
- 标签:
#TurboQuant#ICLR2026#向量量化#KVCache#LLM推理优化
条目 2:RBG v0.7 — Kubernetes 原生 LLM 推理编排
- 来源:
https://github.com/sgl-project/rbg· 2026-06-11 release - 可信度: ⭐⭐⭐⭐ — SGLang 官方出品,LMSYS 维护
- 工程价值: ⭐⭐⭐⭐
- 核心内容:
- RBG(Role-Based Group) v0.7:
v1alpha2API 稳定版发布,conversion webhooks,CLI 多节点 LLM serving,pod port allocator,coordinated policies,gang scheduling - inference-engine-runtime:Python-based sidecar runtime for AI inference engines,支持 SGLang 和 vLLM 的 LoRA adapter 管理、统一 Prometheus metrics、分布式拓扑管理
- inference-ext-cli(
llmctl):服务/模型管理、benchmark 编排、Optuna 自动参数搜索、收敛分析、Web 可视化仪表盘 - 与 SGLang 深度集成,Kubernetes CRD 暴露 LLM serving 语义
- 评价: 面向多租户、多模型、LoRA 适配器管理的企业级 K8s 方案;与 llm-d 形成互补(RBG 侧重 CRD/角色调度,llm-d 侧重 prefill/decode 分离)
- 后续行动: 关注与 llm-d v0.7 的功能边界;建议关联「K8s AI 部署」主题页
- 标签:
#RBG#Kubernetes#LLM-Serving#SGLang#LoRA#K8s-CRD
条目 3:llm-d v0.7 — CNCF Sandbox 分离式 LLM 推理框架
- 来源:
https://github.com/llm-d/llm-d·https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide - 可信度: ⭐⭐⭐⭐⭐ — IBM、Red Hat、Google、CoreWeave、NVIDIA 联合背书,2026-03 已入 CNCF Sandbox
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容:
- 分离式 LLM 推理(Disaggregated LLM Inference):将 prefill 和 decode 阶段拆分到独立 GPU 池
- Gateway API Inference Extension:cache-aware load balancing,基于 KV cache hits 做请求路由;model-aware routing,支持多模型和 LoRA-adapter serving
- v0.7 新特性:可重现 benchmark workflow、hierarchical KV offloading、cache-aware LoRA routing、active-active HA、UCX-based 传输容错、scale-to-zero 自动扩缩
- 实测:16×16 B200 prefill/decode 拓扑下,输出吞吐 ~50k tok/s,TTFT 比 round-robin 基线降低一个数量级
- EPP(Endpoint Picker Protocol)和 BBR 调度正在迁移到 llm-d repo
- 评价: CNCF 背书的 K8s LLM inference 标准方案;预填/解码分离是 2026 年推理系统工程的核心方向之一;建议加入「LLM 推理架构」主题页
- 后续行动: 建议核验 CNCF Sandbox 状态;关注与 RBG v0.7 的生态整合
- 标签:
#llm-d#CNCF#Prefill-Decode#K8s#分离式推理#Gateway-API
条目 4:Colibri — 纯 C 无依赖 744B MoE 推理引擎
- 来源: Analytics Vidhya "Top 10 Trending AI GitHub Repositories July 2026"
- 链接:
https://github.com(待核验具体 repo 地址) - 可信度: ⭐⭐⭐⭐ — Analytics Vidhya 专题报道,具体 repo 有待确认
- 工程价值: ⭐⭐⭐⭐
- 核心内容:
- 纯 C 实现,零外部依赖,可在 ~25GB RAM 的消费级机器上流式运行 DeepSeek-5.2(744B 参数 MoE 模型)
- 按需从磁盘流式加载 expert,突破本地硬件限制
- 面向 local-LLM 爱好者群体,无需云基础设施
- 评价: 工程上的极致精简案例;代表 2026 年 MoE 推理从"大集群"向"消费级渗透"的趋势;虽然受众较窄,但技术路径值得关注
- 后续行动: 核验具体 repo 地址和 benchmark 数据是否可复现
- 标签:
#Colibri#MoE#本地推理#C#DeepSeek#边缘部署
条目 5:MCP 生态爆发 — 2026 中期更新
- 来源: GitHub Topics
model-context-protocol;https://github.com/modelcontextprotocol - 可信度: ⭐⭐⭐⭐⭐ — Anthropic 官方 + 社区
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容:
- MCP Python SDK v2 发布(2026-07-28 spec),重构了 SDK 架构,修复了 v1 的多个设计问题,migrating guide 已提供
- MCP Registry(
modelcontextprotocol/registry):社区驱动的 MCP server 发现平台 - Unity MCP(
CoplayDev/unity-mcp,13k stars):AI ↔ Unity Editor 桥接,资产管理、场景控制、脚本编辑、任务自动化 - XcodeBuildMCP(
getsentry/XcodeBuildMCP,6.2k stars):iOS/macOS 项目 AI agent 工具 - semblent(
MinishLab/semble,5.7k stars):代码搜索 agent,比 grep+read 节省 98% tokens - Awesome MCP Servers(
wong2/awesome-mcp-servers):PaddleOCR、PayPal、DigitalOcean、Docker、Django REST Framework 等商业级 MCP server 清单 - OpenClaw Issue #13248 & #4834:OpenClaw 原生 MCP 客户端支持请求(v2026.2.9)
- 评价: MCP 已从"AI ↔ 工具"协议演化为完整开发生态;Python SDK v2 标志协议成熟度提升;Unity/Xcode/MCP 集成代表 AI agent 进入 IDE 深度集成阶段
- 后续行动: 建议更新「MCP 生态」主题页;关注 MCP Registry 正式发布
- 标签:
#MCP#ModelContextProtocol#Anthropic#Agent-Tools#SDK-v2
条目 6:LangChain State of Agent Engineering 2026
- 来源:
https://www.langchain.com/state-of-agent-engineering - 可信度: ⭐⭐⭐⭐⭐ — LangChain 官方,2026-06-12 发布
- 工程价值: ⭐⭐⭐⭐
- 核心内容:
- 57% 的组织不微调模型,依赖 base model + prompt engineering + RAG
- 客服(26.5%)和研发/数据分析(24.4%)是 Agent 最常见的两大用例,合计超 50%
- 2026 年 Agent 工程的核心挑战:context management、memory layer、evaluation
- 多 Agent 协作已有成熟框架,但生产部署仍需大量定制
- 评价: 难得的 2026 中期 Agent 落地全貌数据;与 Substack 生态的 AI Engineer 求职分析(1000+ job descriptions)互相印证;建议纳入「AI Agent 工程」主题页数据来源
- 后续行动: 建议关联引用至「AI Agent 落地现状」主题页
- 标签:
#LangChain#Agent-Engineering#State-of-Art#RAG#Fine-tuning
条目 7:Substack AI Engineer 求职市场分析(2026)
- 来源:
https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal - 可信度: ⭐⭐⭐⭐
- 工程价值: ⭐⭐⭐⭐
- 核心内容:
- 1000+ 份 2026 年 AI Engineer JD 分析
- 核心技能:RAG 系统、Agent 编排、API 生产化、评估与 guardrails
- 70% 为 AI-first 角色(直接构建 LLM/GenAI 系统);28.5% 为 AI-support 角色(基础设施、GPU 集群、数据管道)
- 框架要求:LangChain、LangGraph、AutoGen、CrewAI、Semantic Kernel
- 明确区分"会用 AI"和"构建 AI 系统"的工程能力需求
- 评价: 与 LangChain 报告数据吻合;是 AI Engineer 能力图谱的重要参考;建议纳入「AI 工程职业发展」线索
- 后续行动: 建议提炼关键技能需求表,关联职业发展主题页
- 标签:
#AI-Engineer#Job-Market#RAG#Agent#Skill-Map
⚠️ 低价值 / 已覆盖条目
| 条目 | 原因 |
|---|---|
| Awesome-LLM 资源索引 | 导航性质,无新增工程细节 |
| KDnuggets Hugging Face Primer 2026 | 概览性质,无原创数据 |
| start-ai-engineering repo | 路线图性质,工程细节有限 |
| Colibri repo(地址待核) | 信息来源单一,需确认原始 repo |
| CSDN 2026 大模型部署选型指南 | 已有更深度 vLLM 专项文章覆盖 |
📋 后续行动汇总
| 优先级 | 行动 | 关联主题页 |
|---|---|---|
| 高 | 精读 TurboQuant ICLR 2026 原文 + 验证 PyTorch 复现质量 | LLM 推理优化 |
| 高 | 核验 llm-d CNCF Sandbox 状态,关注 RBG v0.7 与 llm-d 边界 | K8s AI 部署 |
| 中 | 更新 MCP 生态主题页(含 Python SDK v2、Unity/Xcode MCP) | Agent Tools |
| 中 | 关联 LangChain State of Agent Engineering 到 Agent 落地主题 | AI Agent 工程 |
| 中 | Colibri repo 地址核验 + benchmark 复现可行性评估 | 边缘/本地推理 |
| 低 | 核验 SGLang DeepSeek-V4 Day-0 支持博客(2026-04) | 推理引擎 |
✅ 本次写入路径
/shared/research-kb/inbox/jay/2026-07-31-1335-jay-engineering-filter.md