研究草稿 · Jay · 2026-09-16 12:20
主题
CSDN 高价值检索 · 推理引擎部署(Qwen3.6/Kimi K2系列)+ Agent 协议栈现状(2026年9月)
检索范围
- CSDN (blog.csdn.net): vLLM、SGLang、KTransformers、Qwen3.6-35B-A3B、Kimi K2.6/2.7-Code 部署
- CSDN: MCP、A2A、AG-UI 协议对比与选型
- CSDN: KV Cache 量化、推理优化
- 去重依据:今日 08:20 及 09:37 草稿(已覆盖 MC-Search、TechRAG、LMCache、DualPath)
高价值条目
1. Qwen3.6-35B-A3B 三框架部署对比指南 ⭐⭐⭐⭐⭐
来源: CSDN 原创 | 2026-05-30 发布 | 594 阅读 链接: https://blog.csdn.net/gitblog_00922/article/details/151445362
核心内容摘要: 文章对阿里云 Qwen3.6-35B-A3B(350亿参数,支持 262,144 原生上下文,可扩展至 1,010,000 token)给出 vLLM / SGLang / KTransformers 三框架完整部署对比,含实际命令与性能数据。
工程价值亮点:
| 框架 | 推荐版本 | 核心参数 | 适用场景 |
|---|---|---|---|
| vLLM | ≥0.19.0 | --tensor-parallel-size 8 --max-model-len 262144 | 高吞吐量生产环境 |
| SGLang | ≥0.5.10 | --mem-fraction-static 0.8 --reasoning-parser qwen3 | 实时推理、思维链 |
| KTransformers | - | CPU-GPU 异构 | 资源受限环境 |
- Speculative Decoding 配置:
--speculative-algo NEXTN --speculative-num-steps 3 - 工具调用:
--tool-call-parser qwen3_coder --enable-auto-tool-choice - 超长上下文突破:vLLM 用
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1,SGLang 用SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 - 保留思维轨迹:
preserve_thinking选项可在多轮对话中保留中间推理步骤
可信度: 高 — 含具体命令、版本号、性能对比表,可直接复现 复现价值: 高 — pip/uv 安装命令完整,TP 配置有明确示例
建议分类: inference-engineering / vllm / sglang / production
建议操作: 精选命令片段写入知识库 "LLM 推理部署命令参考" 页
2. Kimi K2.6 / K2.7-Code 部署双指南 ⭐⭐⭐⭐
来源: CSDN 原创 | 2026-05-26 / 2026-06-13 发布 K2.6: https://blog.csdn.net/gitblog_00947/article/details/157413911 K2.7-Code: https://blog.csdn.net/gitblog_00062/article/details/157923917
核心内容摘要:
K2.6(原生多模态智能体模型):
- vLLM nightly 安装:--extra-index-url https://wheels.vllm.ai/nightly;生产推荐 0.19.1 稳定版
- SGLang ≥0.5.10 稳定版直接支持,无需 nightly
- KTransformers 异构配置(8×L20 + 2×Intel 6454S):640.12 tokens/s Prefill / 24.51 tokens/s Decode(48路并发)
- LoRA SFT:USE_KT=1 llamafactory-cli train examples/train_lora/kimik2_lora_sft_kt.yaml
K2.7-Code(代码专项): - 部署方案与 K2.6 架构相同,命令可复用 - 推理引擎持续更新,建议关注各引擎主页最新指南
可信度: 高 — 含具体配置参数、硬件规格、benchmark 数据 复现价值: 高 — LoRA SFT + 推理分离配置在中文资料中较少见
建议分类: inference-engineering / vllm / sglang / multimodal / moonshot
建议操作: KTransformers 异构推理配置值得单独建立 benchmark 条目
3. MCP × A2A × AG-UI 协议栈现状(2026年9月) ⭐⭐⭐⭐
来源: CSDN 原创 | 2026-07-20 / 2026-08-20 发布 主文: https://blog.csdn.net/2401_85300269/article/details/163045477 协议栈: https://blog.csdn.net/weixin_74809706/article/details/163614053
核心内容摘要:
2026年7月关键里程碑: - MCP 正式版发布(2026-07-28) - A2A 1.0 GA 发布(2026年7月),获 Microsoft、Salesforce、Snowflake、ServiceNow 等联盟背书 - AG-UI(Agent UI)作为第三层协议补全人机交互
三层协议定位: | 层次 | 协议 | 解决的问题 | 核心机制 | |---|---|---|---| | 工具连接层 | MCP | Agent ↔ 工具/数据 | JSON-RPC 2.0,Host-Client-Server 架构 | | Agent 协作层 | A2A | Agent ↔ Agent | Agent Card + Task 状态机 + SSE | | 前端交互层 | AG-UI | Agent ↔ 用户界面 | SSE 事件流推送 |
关键动态: - 截至 2026年7月,MCP Registry 收录 23,000+ MCP Server(相比 2025年11月的近 2000 个大幅增长) - Google A2A 与 Anthropic MCP 已明确为互补关系,非竞争 - "MCP 接工具 + A2A 做编排 + AG-UI 做展示" 成为企业级系统组合范式 - MCP Sampling with Tools(2025-11-25 版本)模糊了工具与 Agent 边界,暗示未来 MCP+A2A 可能进一步融合
最小可运行示例(FastMCP 2.x):
from mcp.server.fastmcp import FastMCP
mcp = FastMCP("my-server")
@mcp.tool()
def query_order(order_id: str) -> str:
return f"订单 {order_id} 状态:已发货"
选型建议(按场景): - 单 Agent + 工具调用 → MCP - 多 Agent 协作委派 → A2A - 前端实时事件展示 → AG-UI - 企业级系统 → 三者组合,MCP×A2A 联动最优
可信度: 高 — 协议版本、发布时间、生态数据具体 后续行动: 建议对照 MCP official SDK (mcp≥1.0) 和 A2A SDK 验证协议字段最新变化
建议分类: agentic-systems / mcp / a2a / protocol / architecture
建议操作: 建立 "Agent 协议栈选型决策树" 页面
4. KV Cache 量化:长上下文显存瓶颈(ICLR 2026 论文引用)⭐⭐⭐
来源: CSDN | https://blog.csdn.net/qq_30089667/article/details/160157714 引用论文: Google Research, ICLR 2026
核心内容摘要: - 标题:"KV Cache: 长上下文推理的'内存黑洞'" — 向量量化算法,针对 KV Cache 极端压缩 - KV Cache 大小与序列长度呈平方关系增长(O(N²)) - 32K 上下文时 KV Cache 显存占用可超过模型权重本身 - 量化方案:将 KV Cache 从 FP16/BF16 压缩至 INT8/INT4,压缩比 2-4×
工程意义: - vLLM 0.7+ 内置 BlockManager V1/V2,支持 KV Cache 量化 - Prefix Caching 在多轮对话和 Coding Agent 场景中天然有效 - LMCache(见今日 09:37 草稿)提供跨节点 KV Cache 传输能力
可信度: 中高 — 引用 ICLR 2026 论文,需核验 arXiv 原文 建议: 与 LMCache / DualPath 草稿内容交叉引用
建议分类: inference-engineering / kv-cache / quantization
5. vLLM + SGLang 源码调试指南(Cursor/VSCode)⭐⭐⭐
来源: CSDN 原创 | 2025-05-20 | vLLM 0.8.5 / SGLang 0.4.6 链接: https://blog.csdn.net/tttppp000/article/details/148092004
核心内容摘要:
- vLLM 源码调试:.vscode/launch.json 配置 VLLM_USE_MODELSCOPE=1 + CUDA_VISIBLE_DEVICES
- SGLang 调试模式:server/client 分离,server 先启动,client 送请求
- 参考 sglang/examples/runtime/openai_batch_chat.py 注释
工程价值: 中等(版本较旧,0.8.5/0.4.6 非当前最新版),但调试模式设计有参考价值
建议分类: inference-engineering / vllm / debugging
过滤说明
以下条目因缺乏版本/命令/复现步骤,已过滤: - "2026年RAG架构演进"(泛泛而谈,无版本/代码) - "从RAG到Agent"(企业视角,无工程细节) - "RAG技术全解"(2026新版RAG技术,但偏综述) - 多数 RAG 基础教程(无源码/命令/排障经验)
建议写入路径
/shared/research-kb/inbox/jay/2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md(本文)
分类标签
inference-engineering / vllm / sglang / kimi-k2 / qwen / mcp / a2a / kv-cache / quantization / agentic-systems / production
后续行动
- [ ] 核验 Qwen3.6-35B-A3B 文章中 vLLM ≥0.19.0 是否为当前最新稳定版
- [ ] 对比 MCP 1.0 正式版字段变更(相对 2025-11-25 版本)
- [ ] A2A 1.0 GA Agent Card 规范与文中示例是否一致
- [ ] ICLR 2026 KV Cache "内存黑洞" 论文标题/编号待核验