研究知识库草稿 · Jay · 2026-10-05
主题
推理引擎格局更新 + Agent Loop 工程 + Qwen3.8/DeepSeek 推理工程
一、推理引擎格局(2026年10月)
核心对比:vLLM vs SGLang
| 维度 | vLLM | SGLang |
|---|---|---|
| 核心技术 | PagedAttention + Continuous Batching | RadixAttention(前缀缓存) |
| 吞吐量(Prefix-heavy) | ~12,500 tok/s | ~16,200 tok/s (+29%) |
| 吞吐量(Unique prompts) | 基准 | 接近持平(±5%) |
| 延迟(TTFT) | 150ms | 80ms(实测) |
| 生态 | 更广(llm-d、RHEL AI基于此) | 增长快(Grok 部署达数十万 GPU) |
| 适用场景 | 单轮交互、首次部署生产 | 多轮 Agent、长 System Prompt |
结论(来源综合): - 前缀复用场景 → SGLang(RadixAttention 跨请求缓存共享前缀) - 独立请求为主 → vLLM(稳定性 + 生态优势) - LMDeploy:量化模型在受限硬件上最快(TurboMind 优化) - TensorRT-LLM:编译后延迟最低,但部署复杂度最高
来源: - SGLang vs vLLM: Which Inference Engine Should You Use (2026) - vLLM vs SGLang vs LMDeploy: Fastest LLM Inference Engine in 2026? - vLLM vs TensorRT-LLM vs SGLang: Which Inference Engine to Deploy
新进入者:DeepSeek 4 Flash 本地推理引擎
antirez/ds4( Salvatore Sanfilippo,Redis 作者)出现在 GitHub Trending,定位: - DeepSeek 4 Flash & PRO 的本地推理引擎 - 支持 Apple Metal、CUDA、ROCm - 亮点:利用 DeepSeek V4.1 Flash 的 Engram lookup table 可从 SSD 直接流式读取特性
来源: - GitHub Trending 2026-10-05 - DeepSeek 4 Flash local inference engine for Metal | Hacker News - What It Costs To Run DeepSeek V4.1 Flash Locally (YouTube)
二、DeepSeek V4.1 Flash 推理工程
关键参数(截至 2026-10-05)
| 项目 | 规格 |
|---|---|
| 总参数量 | 763B(MoE,8B 激活/ prompt,16B 激活/ generation) |
| Engram Lookup Table | 196B 参数,存于磁盘,非全量驻留内存 |
| 发布日期 | 2026-09-10(V4.1 Flash 取代 V4 Flash) |
| 许可 | MIT(Hugging Face) |
| 本地运行 | 需要 ~8GB VRAM + SSD 流式读取(Engram 特性) |
架构创新(arXiv:2606.19348v1)
- Manifold-Constrained Hyper-Connections (mHC):增强残差连接稳定性
- Hybrid Attention Architecture:压缩记忆长上下文效率
- Multi-Token Prediction (MTP):每步多 token 预测
- Fused MoE Kernel:计算/通信/内存访问完全重叠
来源: - DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence (arXiv) - DeepSeek V4: Release Date, Specs, and How to Access It (2026) | Yotta Labs - Inference engineering for DeepSeek V4 Pro 0813 | Baseten
三、Qwen3.8 系列推理工程
家族概览(2026年10月)
| 模型 | 参数量 | 类型 | 关键特性 |
|---|---|---|---|
| Qwen3.8-Max | 2.4T(MoE,95B 激活) | 旗舰编程模型 | 编程 benchmark 接近 Claude Opus 5;16天自主代码 265 commits |
| Qwen3.8-Flash-Next | 180B(MoE) | 高效推理 | DGX Spark 上可达 64 tok/s(NVFP4) |
| Qwen3.8-27B | 27B(Dense) | 本地可运行 | 单卡/家用级别可用 |
| Qwen3.8-Flash | 8B/16B 激活 | 超轻量 | 移动/边缘 |
量化支持
- MXFP4:AMD Instinct MI355X 原生支持,KV cache 4-bit 无精度损失
- NVFP4:NVIDIA DGX Spark 官方量化格式
- GGUF:各路社区量化广泛存在(Hugging Face)
AMD MI355X Day-0 支持
ROCm 博客提供 SGLang + MXFP4 在 AMD MI355X 上的完整部署命令:
docker pull rocm/sgl-dev:v0.5.8.post1-rocm720-mi30x-20260215
# TP8 single node MXFP4 推荐配置
来源: - Day 0 Support for Qwen 3 8 on AMD Instinct GPUs - UltraQuant on AMD Instinct: More Efficient Agentic Serving for Qwen3.8-MXFP4 - Day 0 Support for Qwen3.8-2.4T-A95B on vLLM | vLLM Blog - Qwen3.8-Max: A New Bar for Coding and Cowork
四、Loop Engineering:2026 新兴工程学科
什么是 Loop Engineering
"设计 Agent 运行所在循环——两次 tool call 之间做什么、何时自检、何时判定完成——而非手写每条 prompt。人类从操作者变成系统设计者。核心技能是写 verifier 判断输出是否足够好。"
对比 Prompt Engineering: - Prompt Engineering:人类写每条 prompt - Loop Engineering:人类定义"好"和"完成",模型自己生成和执行 prompt
核心架构
while not done:
discover() # 决定下一步做什么
plan() # 制定执行计划
execute() # 调用工具/生成
verify() # 验证输出(verifier 是瓶颈)
四类 Memory 在生产环境
- Episodic Memory:对话片段存储
- Semantic Memory:结构化知识(向量 DB)
- Procedural Memory:Agent 学到的技能/模式
- Working Memory:当前任务上下文
关键洞察
- Verifier 是瓶颈:不是模型能力,而是判断"好"的系统
- Persistent Memory 降成本 60-90%:不重发对话历史
- CLAUDE.md 实践:每次错误纠正写入项目知识文件,跨 session 累积
- 生产数据:89% 团队有 observability,但只有 52% 有 evals(LangChain Agent Engineering Survey)
来源: - Loop Engineering Guide (2026) | AI Builder Club - The Art of Loop Engineering | LangChain - What Is Loop Engineering? | IBM - The AI Agents Stack: LLM to Production (2026) | The AI Engineer
五、Agentic RAG 与持久化 Memory
为什么 2026 年 RAG 仍是生产标准
尽管 1M+ token context 模型(Claude Sonnet 4.6、Gemini 2.0)已出现,RAG 仍然必要: 1. 成本:1M token/query 费用极高 2. 精度:精确检索 > 大海捞针式 context 3. ** freshness**:实时数据无法全部存入 context
Agentic RAG 的循环架构
query → routing → retrieval → memory store → synthesis → response
↑ ↓
←←←←← context query ←←←←←←←←←
Mem0 等持久化 Memory 方案
- 减少 60-90% token 成本(对话历史不重发)
- 持久化跨 session 偏好
- 需解决:context 污染、retrieval 质量
来源: - AI Agents 2026 — Guide from LLM to Multi-Agent Systems | EITT - Loop Engineering for AI Agents: Memory-First Design | Mem0 - Agentic loops explained: From ReAct to loop engineering (2026 guide)
六、GitHub Trending 高价值项目(今日本地)
| 项目 | Stars | 类型 | 亮点 |
|---|---|---|---|
| antirez/ds4 | New | 本地推理引擎 | DeepSeek 4 Flash PRO,Metal/CUDA/ROCm |
| DeepSeek-V3 | 高 | 开源模型 | benchmark 媲美 GPT-4 |
| vLLM | ~88K | 推理引擎 | 生产级吞吐量 |
| SGLang | 高 | 推理框架 | RadixAttention 前缀缓存 |
| ComfyUI | ~106K | 视觉工作流 | 节点式生成 pipeline |
| Ollama | ~177K | 本地模型运行 | 一命令跑模型 |
| Open WebUI | ~147K | ChatGPT 风格 UI | Ollama 前端 |
七、分类标签
#推理引擎 #vLLM #SGLang #DeepSeek-V4.1-Flash #Qwen3.8
#Loop-Engineering #Agent-Memory #Agentic-RAG #HuggingFace
#AMD-ROCm #MXFP4 #NVFP4 #MoE #本地推理 #Harness-Engineering
八、建议写入路径
/shared/research-kb/inbox/jay/2026-10-05-inference-agents-loop-engineering.md
九、后续行动建议
- 精读:Loop Engineering Guide(AI Builder Club)+ The AI Engineers Substack Stack 2026
- 审稿:DeepSeek V4.1 Flash 的 Engram SSD streaming 特性是否被充分理解
- 主题页更新:「推理引擎对比」页需更新 2026-10 月数据
- 核验:antirez/ds4 GitHub 实际 star 数和 commit 记录(Trending 截取可能不准)