研究知识库草稿 · Jay · 2026-10-05

主题

推理引擎格局更新 + Agent Loop 工程 + Qwen3.8/DeepSeek 推理工程


一、推理引擎格局(2026年10月)

核心对比:vLLM vs SGLang

维度 vLLM SGLang
核心技术 PagedAttention + Continuous Batching RadixAttention(前缀缓存)
吞吐量(Prefix-heavy) ~12,500 tok/s ~16,200 tok/s (+29%)
吞吐量(Unique prompts) 基准 接近持平(±5%)
延迟(TTFT) 150ms 80ms(实测)
生态 更广(llm-d、RHEL AI基于此) 增长快(Grok 部署达数十万 GPU)
适用场景 单轮交互、首次部署生产 多轮 Agent、长 System Prompt

结论(来源综合): - 前缀复用场景 → SGLang(RadixAttention 跨请求缓存共享前缀) - 独立请求为主 → vLLM(稳定性 + 生态优势) - LMDeploy:量化模型在受限硬件上最快(TurboMind 优化) - TensorRT-LLM:编译后延迟最低,但部署复杂度最高

来源: - SGLang vs vLLM: Which Inference Engine Should You Use (2026) - vLLM vs SGLang vs LMDeploy: Fastest LLM Inference Engine in 2026? - vLLM vs TensorRT-LLM vs SGLang: Which Inference Engine to Deploy


新进入者:DeepSeek 4 Flash 本地推理引擎

antirez/ds4( Salvatore Sanfilippo,Redis 作者)出现在 GitHub Trending,定位: - DeepSeek 4 Flash & PRO 的本地推理引擎 - 支持 Apple Metal、CUDA、ROCm - 亮点:利用 DeepSeek V4.1 Flash 的 Engram lookup table 可从 SSD 直接流式读取特性

来源: - GitHub Trending 2026-10-05 - DeepSeek 4 Flash local inference engine for Metal | Hacker News - What It Costs To Run DeepSeek V4.1 Flash Locally (YouTube)


二、DeepSeek V4.1 Flash 推理工程

关键参数(截至 2026-10-05)

项目 规格
总参数量 763B(MoE,8B 激活/ prompt,16B 激活/ generation)
Engram Lookup Table 196B 参数,存于磁盘,非全量驻留内存
发布日期 2026-09-10(V4.1 Flash 取代 V4 Flash)
许可 MIT(Hugging Face)
本地运行 需要 ~8GB VRAM + SSD 流式读取(Engram 特性)

架构创新(arXiv:2606.19348v1)

  1. Manifold-Constrained Hyper-Connections (mHC):增强残差连接稳定性
  2. Hybrid Attention Architecture:压缩记忆长上下文效率
  3. Multi-Token Prediction (MTP):每步多 token 预测
  4. Fused MoE Kernel:计算/通信/内存访问完全重叠

来源: - DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence (arXiv) - DeepSeek V4: Release Date, Specs, and How to Access It (2026) | Yotta Labs - Inference engineering for DeepSeek V4 Pro 0813 | Baseten


三、Qwen3.8 系列推理工程

家族概览(2026年10月)

模型 参数量 类型 关键特性
Qwen3.8-Max 2.4T(MoE,95B 激活) 旗舰编程模型 编程 benchmark 接近 Claude Opus 5;16天自主代码 265 commits
Qwen3.8-Flash-Next 180B(MoE) 高效推理 DGX Spark 上可达 64 tok/s(NVFP4)
Qwen3.8-27B 27B(Dense) 本地可运行 单卡/家用级别可用
Qwen3.8-Flash 8B/16B 激活 超轻量 移动/边缘

量化支持

  • MXFP4:AMD Instinct MI355X 原生支持,KV cache 4-bit 无精度损失
  • NVFP4:NVIDIA DGX Spark 官方量化格式
  • GGUF:各路社区量化广泛存在(Hugging Face)

AMD MI355X Day-0 支持

ROCm 博客提供 SGLang + MXFP4 在 AMD MI355X 上的完整部署命令:

docker pull rocm/sgl-dev:v0.5.8.post1-rocm720-mi30x-20260215
# TP8 single node MXFP4 推荐配置

来源: - Day 0 Support for Qwen 3 8 on AMD Instinct GPUs - UltraQuant on AMD Instinct: More Efficient Agentic Serving for Qwen3.8-MXFP4 - Day 0 Support for Qwen3.8-2.4T-A95B on vLLM | vLLM Blog - Qwen3.8-Max: A New Bar for Coding and Cowork


四、Loop Engineering:2026 新兴工程学科

什么是 Loop Engineering

"设计 Agent 运行所在循环——两次 tool call 之间做什么、何时自检、何时判定完成——而非手写每条 prompt。人类从操作者变成系统设计者。核心技能是写 verifier 判断输出是否足够好。"

对比 Prompt Engineering: - Prompt Engineering:人类写每条 prompt - Loop Engineering:人类定义"好"和"完成",模型自己生成和执行 prompt

核心架构

while not done:
    discover()    # 决定下一步做什么
    plan()        # 制定执行计划
    execute()     # 调用工具/生成
    verify()      # 验证输出(verifier 是瓶颈)

四类 Memory 在生产环境

  1. Episodic Memory:对话片段存储
  2. Semantic Memory:结构化知识(向量 DB)
  3. Procedural Memory:Agent 学到的技能/模式
  4. Working Memory:当前任务上下文

关键洞察

  • Verifier 是瓶颈:不是模型能力,而是判断"好"的系统
  • Persistent Memory 降成本 60-90%:不重发对话历史
  • CLAUDE.md 实践:每次错误纠正写入项目知识文件,跨 session 累积
  • 生产数据:89% 团队有 observability,但只有 52% 有 evals(LangChain Agent Engineering Survey)

来源: - Loop Engineering Guide (2026) | AI Builder Club - The Art of Loop Engineering | LangChain - What Is Loop Engineering? | IBM - The AI Agents Stack: LLM to Production (2026) | The AI Engineer


五、Agentic RAG 与持久化 Memory

为什么 2026 年 RAG 仍是生产标准

尽管 1M+ token context 模型(Claude Sonnet 4.6、Gemini 2.0)已出现,RAG 仍然必要: 1. 成本:1M token/query 费用极高 2. 精度:精确检索 > 大海捞针式 context 3. ** freshness**:实时数据无法全部存入 context

Agentic RAG 的循环架构

query → routing → retrieval → memory store → synthesis → response
                     ↑                              ↓
                     ←←←←← context query ←←←←←←←←←

Mem0 等持久化 Memory 方案

  • 减少 60-90% token 成本(对话历史不重发)
  • 持久化跨 session 偏好
  • 需解决:context 污染、retrieval 质量

来源: - AI Agents 2026 — Guide from LLM to Multi-Agent Systems | EITT - Loop Engineering for AI Agents: Memory-First Design | Mem0 - Agentic loops explained: From ReAct to loop engineering (2026 guide)


项目 Stars 类型 亮点
antirez/ds4 New 本地推理引擎 DeepSeek 4 Flash PRO,Metal/CUDA/ROCm
DeepSeek-V3 高 开源模型 benchmark 媲美 GPT-4
vLLM ~88K 推理引擎 生产级吞吐量
SGLang 高 推理框架 RadixAttention 前缀缓存
ComfyUI ~106K 视觉工作流 节点式生成 pipeline
Ollama ~177K 本地模型运行 一命令跑模型
Open WebUI ~147K ChatGPT 风格 UI Ollama 前端

七、分类标签

#推理引擎 #vLLM #SGLang #DeepSeek-V4.1-Flash #Qwen3.8
#Loop-Engineering #Agent-Memory #Agentic-RAG #HuggingFace
#AMD-ROCm #MXFP4 #NVFP4 #MoE #本地推理 #Harness-Engineering

八、建议写入路径

/shared/research-kb/inbox/jay/2026-10-05-inference-agents-loop-engineering.md


九、后续行动建议

  1. 精读:Loop Engineering Guide(AI Builder Club)+ The AI Engineers Substack Stack 2026
  2. 审稿:DeepSeek V4.1 Flash 的 Engram SSD streaming 特性是否被充分理解
  3. 主题页更新:「推理引擎对比」页需更新 2026-10 月数据
  4. 核验:antirez/ds4 GitHub 实际 star 数和 commit 记录(Trending 截取可能不准)