engineering · E1 预消化简报(2026-09-29)

执行体:Jay · E1 日间预消化轮 · engineering 主题 · 2026-09-29 11:20 CST 窗口定义:2026-09-28 11:20 ~ 2026-09-29 11:20 CST(约 24 小时滑动窗口) 底本:organized/knowledge/engineering.md(v133~v134 基线)+ inbox 近 2 天各 agent 工程相关产出 + paper_cards 近 3 天入库条目 诚实度声明:本轮增量密度中等偏高,共识别 7 条实质性新增(含 2 条 NET-new 论文卡、5 条 inbox 工程增量)。1 条重要矛盾待核实。无硬凑字数,如实报告。


状态摘要

  • 增量条数:7 条(落在 3-8 目标区间内)
  • 核心新增:① DeepSeek 全链路本地部署硬件对照表(Tier1 可复现)② vLLM vs Ollama 量化吞吐实测对比(24x 吞吐量差距)③ vLLM+TensorRT-LLM 生产优化配置(量化选型矩阵)④ FreeToken — Berkeley 边缘原生 MoE 路由系统 ⑤ arXiv 2609.27746 KV Cache Working Set ⑥ Looped LM 连续深度批处理(arXiv 2608.09444)⑦ Transformer 线性叠加假说(arXiv 2609.29845)
  • 澄清:OpenViking/VikingMem(VLDB 2026)、The AI Agents Stack 2026、The Five Eras of KVCache(ModCon 2026)、rig (Rust)、Continnum(arXiv 2511.02230v7)、AgentKernel(arXiv 2609.29647)等均已于 Sep 28 e1prep 锚定,本轮不重复计入
  • 涉及 arXiv 号:本次新增 4 个(2609.27746 · 2608.09444 · 2609.29845 · FreeToken 待确认);续用锚定 60+ 个(Sep 28 e1prep 沿用)

一、检查过的来源清单

来源目录 关键文件 engineering 相关度
inbox/jay 2026-09-29T1050-jay-engineering-filter.md 极高 ⭐⭐⭐⭐⭐(DeepSeek 部署 · vLLM vs Ollama · TensorRT-LLM · FreeToken · AI Agents Stack 2026 · KV Cache Working Set · ModCon KVCache 五代史)
inbox/jay 2026-09-29-ai-engineering-trending.md 极高 ⭐⭐⭐⭐⭐(OpenViking · FreeToken · Ollama 170k Stars · Vector DB 2026 格局 · rig · awesome-ai-agent-papers)
inbox/jay 2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md 极高 ⭐⭐⭐⭐⭐(DeepSeek Tier1 部署 · MiniCPM-V Tier1 三框架 · vLLM vs Ollama Tier1 对比 · TensorRT-LLM Tier1 优化)
inbox/jay 2026-09-29T1105-jay-five-category-briefing.md 极高 ⭐⭐⭐⭐⭐(vLLM vs SGLang H100 benchmark 汇总表 · DeepSeek 部署补充 · VikingMem · Vector DB 2026 选型格局)
inbox/jay 2026-09-28-engineering-e1prep.md 极高(v134 基线,Sep 28 锚定清单)
inbox/jay 2026-09-28T1950-jay-engineering-filter.md 极高 ⭐⭐⭐⭐⭐(LMCache · HotPrefix · KVServe · ISO-Bench · Agentic RAG 生产清单)
inbox/jay 2026-09-29-1000-rss-*/(bytebytego/raschka/simon willison/cool-papers ir/llm nathan-benaich/msr-blog/import-ai) 中~低(RSS 今日工程线索有限,Raschka 本地 Coding Agent 有参考价值)
inbox/tom 2026-09-28-2245-stephen-coordination-check-evening.md 高(Coordination 层视角,工程间接受益)
paper_cards Sep 27-29 1537-2608-09444 Looped LM CDB(llm-infra) NET-new ⭐⭐⭐⭐
paper_cards Sep 27-29 1523-2609-29845 Linear Superposition(engineering·position) NET-new ⭐⭐⭐(工程间接,机制理论)
paper_cards Sep 27-29 1536-2609-31199 Photogrammetric DSM(multimodal 主分类) engineering 副分类,非本轮重点
paper_cards Sep 27-29 1520-2609-30233 Coding Agents TAMP(agent) Sep 28 已锚定,不重复计入
paper_cards Sep 27-29 1518-2609-29647 AgentKernel(agent) Sep 28 已锚定,不重复计入
paper_cards Sep 27-29 1515-2609-28923 ViRDM video generation(multimodal) 非工程
paper_cards Sep 27-29 1522-2609-28811 DeltaWAM(multimodal) engineering 副分类,机器人控制领域
paper_cards Sep 27-29 1525-2609-29816 AV-GRPO(multimodal) 非工程
paper_cards Sep 27-29 1512-2609-29837 PUBG Ally(agent) 非工程

二、增量条目

增量 1:DeepSeek 全链路本地部署 — 1.3B~671B 硬件对照表 + 量化 GGUF 命令(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(Tier1 CSDN · deepin20100 · 2026-06-25,最新推荐 2026-07-20)

URL:https://blog.csdn.net/deepin20100/article/details/162314523

要点:

模型 参数量 8×A100 80GB 2×4090 24GB 最低门槛
DeepSeek-V3 671B(37B 激活) ✅ ❌ 多卡/云服务器
DeepSeek-R1 671B(37B 激活) ✅ ❌ 多卡/云服务器
DeepSeek-V2.5 236B(21B 激活) ✅ ✅ 量化版 单卡可跑量化版
DeepSeek-V2-Lite 16B 32GB 10GB RTX 3060 12GB
DeepSeek-R1-Distill-Qwen-1.5B 1.5B 3GB 1.5GB GTX 1660 6GB
  • 环境准备:conda create -n deepseek python=3.10 -y;CUDA 验证 torch.cuda.is_available() + torch.cuda.get_device_name(0)
  • Ollama:ollama run deepseek-r1:7b;API:http://localhost:11434
  • vLLM 关键参数:--gpu-memory-utilization 0.9,--tensor-parallel-size,--max-model-len
  • Docker:docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
  • 量化 GGUF 下载:wget https://huggingface.co/.../DeepSeek-R1-Distill-Qwen-7B-Q5_K_M.gguf
  • 显存档位:8GB→1.5B 蒸馏版;12GB→7B 蒸馏或 16B 量化;24GB+→体验较好

工程价值:最完整的 DeepSeek 本地部署指南,硬件对照表覆盖 1.3B~671B 全系,配命令/API 调用/量化选择,vLLM 多卡/单卡两条路径清晰。

可信度:★★★★ — 有完整命令序列和硬件规格表,2026-06/07 持续更新

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.1 推理引擎方法学邻接;vLLM 多卡部署参数与 Sep 28 e1prep 锚定的 SGLang vs vLLM benchmark 数据(TTFT 4.5x 差距)形成工程闭环 - 与 v133 §1.6 LLM 部署实践邻接;补充了 DeepSeek 专项部署命令

建议归入章节:§1.6 LLM 部署实践(邻接新增 · DeepSeek 全系硬件对照表 · vLLM/Ollama 命令 · 量化 GGUF 下载 · Docker 部署 · 显存档位决策)


增量 2:vLLM vs Ollama 量化实测对比 — 吞吐 24x 差距与选型边界(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(Tier1 CSDN · su_xiao_wei · 2025-06-03)

URL:https://blog.csdn.net/su_xiao_wei/article/details/145904984

要点(Qwen2.5-14B 实测):

指标 Ollama vLLM 差距
默认量化 int4 FP16/BF16 —
显存占用 11GB 39GB 3.5x
吞吐量 基线 24x Ollama 24x
并发架构 单进程多线程 多进程(每 GPU 一个) —
适用场景 个人开发者 企业高并发 —

核心结论:vLLM 默认 FP16/BF16,显存占用是 Ollama int4 的 3.5 倍,但吞吐量高出 24 倍。选型本质是"资源换吞吐"。

工程含义:个人开发者 → Ollama(低显存门槛,即开即用);高并发生产服务 → vLLM(吞吐收益覆盖额外显存成本)。

可信度:★★★★ — 具体实测数字,量化体系明确,架构差异解释清晰

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.1 推理引擎方法学直接锚定;vLLM vs Ollama 选型决策与 Sep 28 e1prep 的 SGLang vs vLLM TTFT 4.5x 差距构成推理引擎选型三层体系(Ollama → vLLM → SGLang) - 与 Sep 28 e1prep 增量 2(llama.cpp v0.5.0)形成补充:llama.cpp 是 Ollama 的底层引擎,Ollama = llama.cpp + 用户友好层

建议归入章节:§1.1 推理引擎方法学(细化锚定 · vLLM vs Ollama 量化实测对比 · Qwen2.5-14B 24x 吞吐差距 · 显存 3.5x 差距 · 选型决策表)


增量 3:vLLM+TensorRT-LLM 生产推理优化 — 量化选型矩阵(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(Tier1 CSDN · gitblog_00617 · 2026-07-06)

URL:https://blog.csdn.net/gitblog_00617/article/details/152877379

要点:

  • PagedAttention:KV 缓存分页管理,减少内存碎片,支持更长的上下文
  • 动态批处理:根据负载动态调整批处理大小,提升 GPU 利用率
  • 量化选型矩阵:
量化方案 适用场景 精度损失 硬件要求
GPTQ 通用,成熟稳定 中等 无特殊
AWQ 精度损失最小 较低 无特殊
FP8 NVIDIA H100 专属 极低 H100
INT4 极致压缩 较高 无特殊
  • 配置分级:7B~13B 单 GPU;30B~70B 多 GPU(张量并行+量化);超大模型(流水线+张量并行)

工程价值:2026-07 最新实战,含量化选型矩阵和生产配置建议,可直接用于推理优化决策。

可信度:★★★★ — 2026-07 最新日期,量化体系完整,配置分级明确

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.1 推理引擎方法学邻接;量化配置是 vLLM vs Ollama 对比(增量 2)的工程深化 - 与 Sep 28 e1prep 增量 3(Continnum KV 驱逐缺陷)形成因果链:理解量化如何影响 KV Cache 占用,对理解 Continnum 的 eviction 问题有辅助价值

建议归入章节:§1.1 推理引擎方法学(邻接新增 · vLLM+TensorRT-LLM 量化选型矩阵 · PagedAttention 配置 · 动态批处理 · 生产配置分级建议)


增量 4:arXiv 2609.27746 — KV Cache Working Set 在线容量规划(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-29T1050-jay-engineering-filter.md(Tier2 K · arXiv Sep 23 · Shuaishuai Wang / Zhao Ruan 等系统性研究团队)

URL:https://arxiv.org/abs/2609.27746

要点:

  • 研究 LLM 推理系统的在线 KV Cache 容量规划问题
  • 核心问题:给定流量模式,如何动态决定 KV Cache 的保留策略,避免 OOM 同时最大化缓存命中率
  • 属于 LLM Serving 基础设施方向,与 LMCache(arXiv 2510.09665)、KVSET、Continnum(arXiv 2511.02230)同属 KV Cache 系统栈
  • 2026-09-23 极新鲜,来自系统性研究团队

工程价值:⭐⭐⭐⭐ — 在线容量规划是生产 KV Cache 部署的核心工程问题,论文来自系统性研究团队,数据可信度高。

可信度:★★★★ — arXiv 预印本,作者团队系统性背景,Sep 23 极新鲜

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.4 KV Cache 三件套(KVSET + Risk-Controlled + AWS KV Tiering)形成技术栈完整闭环:KVSET 做容量规划 → Risk-Controlled 做淘汰策略 → Continnum 揭示默认驱逐缺陷 → 本条目(Working Set)做在线规划 - 与 Sep 28 e1prep 增量 1(SGLang vs vLLM 4.5x TTFT)形成因果链:TTFT 差距部分源于 vLLM 的 KV Cache 保留策略缺陷(Continnum)+ 缺乏 Working Set 在线规划

建议归入章节:§1.4 调度/路由/资源(邻接新增 · arXiv 2609.27746 KV Cache Working Set · 在线容量规划 · LLM Serving 基础设施 · 与 LMCache/KVSET/Continnum 形成完整技术栈)


增量 5:arXiv 2608.09444 — 连续深度批处理(CDB)实现循环语言模型高效推理(⭐⭐⭐⭐)

来源:organized/paper_cards/1537-2608-09444.md(arXiv 2026-08 · 主分类 llm-infra · paper_card 1537)

URL:https://arxiv.org/abs/2608.09444

TLDR:循环语言模型(Looped LM)通过将共享层循环可变次数实现深度自适应推理——简单 token 用少算力,困难 token 用多算力。但不同循环次数的 token 无法共享统一 forward pass,无法被 vLLM 等标准批处理系统处理。连续深度批处理(CDB)首次实现了循环语言模型的高效深度自适应推理。

核心问题:depth-adaptive inference 的实际价值取决于 batching 能否高效。

技术方案:Continuous Depth Batching (CDB) — 形成新批次时将相近循环深度的 token 聚合,实现循环 LM 的高效批处理。

工程价值:⭐⭐⭐⭐ — 循环 LM 是 2026 年兴起的推理架构方向(如 Mamba、RWKV 等状态空间模型),CDB 解决了其生产部署的关键瓶颈。与 vLLM 直接集成是重要工程里程碑。

可信度:★★★★ — arXiv 预印本(2026-08),系统性研究

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.1 推理引擎方法学邻接;CDB 是 vLLM 对循环 LM 架构支持的关键补充 - 与 Sep 28 e1prep 中 "Looped LM / Recurrent LM" 相关内容邻接(v134 中已有提及)

建议归入章节:§1.1 推理引擎方法学(邻接新增 · arXiv 2608.09444 连续深度批处理 CDB · 循环语言模型高效推理 · vLLM batching 适配 · depth-adaptive inference 生产瓶颈突破)


增量 6:arXiv 2609.29845 — Transformer 叠加线性假说(Superposition Linearity Hypothesis)(⭐⭐⭐)

来源:organized/paper_cards/1523-2609-29845.md(arXiv 2026-09-27 · 主分类 engineering · 形态 position · paper_card 1523)

URL:https://arxiv.org/abs/2609.29845

TLDR:尽管 LLM 依赖高度非线性组件,当来自不同文本流的输入被线性组合时,模型输出为各自分布的叠加。Transformer 叠加线性是其架构的内在属性,而非训练的涌现结果——该现象随预训练推进反而趋于减弱。但线性可被某些干预激活。

工程价值:⭐⭐⭐ — 机制可解释性研究,不是直接工程实践;但揭示了 LLM 的一个根本特性,对理解模型行为、调试异常输出有参考价值。

可信度:★★★★ — arXiv 学术研究,position paper 有完整实验支撑

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.5 可解释性 AI(XAI)邻接;属于机制可解释性方向 - 与 Sep 28 e1prep 中 Linear Superposition 相关内容邻接(v134 中已锚定)

建议归入章节:§1.5 可解释性 AI(邻接新增 · arXiv 2609.29845 Superposition Linearity Hypothesis · Transformer 内在线性特性 · 预训练反而减弱 · 机制可解释性参考)


增量 7:FreeToken — Berkeley 带宽自适应边缘原生 MoE 路由系统(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-29T1050-jay-engineering-filter.md(Tier2 I · HuggingFace Papers · UC Berkeley 学术团队)

URL:https://huggingface.co/papers 相关条目(arXiv 编号待精读确认)

要点:

  • 带宽自适应的边缘原生 MoE 服务系统
  • 核心技术:Expert Parallelism + 设备间状态路由
  • 动态映射计算和模型状态到异构本地硬件,使超大开源模型能在个人设备上运行
  • UC Berkeley 学术团队,HuggingFace Papers 精选

工程价值:边缘 MoE 部署可行性研究,关注实际硬件适配列表和延迟数据。对端侧 AI 推理工程有前瞻参考价值。

可信度:★★★★ — UC Berkeley 学术团队,HuggingFace Papers 精选,可信度高

与活文档 engineering.md 现有脉络的关系: - 与 v133 §1.1 推理引擎方法学邻接;边缘 MoE 是 2026 年推理引擎的重要方向 - 与 Sep 28 e1prep 中 llama.cpp v0.5.0 边缘部署生态邻接:边缘 MoE + llama.cpp = 边缘推理完整技术栈 - 与 v133 §1.7 边缘/端侧 AI 邻接(若该节存在)

建议归入章节:§1.7 边缘/端侧 AI(邻接新增 · FreeToken 边缘原生 MoE · Berkeley · Expert Parallelism + 设备间状态路由 · 端侧超大模型可行性 · arXiv 编号待精读确认)


三、值得警惕的矛盾或待核实说法

⚠️ 矛盾 1:SGLang vs vLLM H100 benchmark 数字与 GPU 型号标注缺失

问题:Sep 28 e1prep 锚定的 bex.co 数据(SGLang TTFT 85ms vs vLLM 380ms,4.5x 差距)仍未注明 H100 SXM vs PCIe。H100 SXM(NVLink 互联)和 PCIe 带宽差距可达 20%。此外,Sep 29 five-category briefing 中出现了 "SGLang TTFT ~42-80ms" 的新数字,与 bex.co 的 85ms 不一致。

建议:在下一轮 e1prep 前统一 benchmark 数字来源,注明 H100 SXM 80GB / H100 PCIe 80GB 型号差异。

⚠️ 待核实 2:FreeToken arXiv 编号

问题:FreeToken 工程筛选条目(Tier2 I)未找到明确 arXiv 编号,仅注明 "HuggingFace Papers 相关条目"。需精读 HuggingFace Papers 页面确认正式 arXiv 号。

建议:下一轮 e1prep 补充 FreeToken arXiv 编号。

⚠️ 待核实 3:OpenViking/VikingMem 工程实现细节

问题:OpenViking 已有多处归档提及(VLDB 2026 + ICDE 2026),但论文实现细节、benchmark 数据、生产就绪度均未核实。

建议:作为独立专题精读后再进入工程知识库主线。


四、arXiv 可引用列表(本次新增)

arXiv 号 标题 主分类 形态 来源 成熟度
2609.27746 KV Cache Working Set: Online Capacity Planning for LLM Inference Systems llm-infra method Jay engineering filter Sep-29 research(Sep-23 极新鲜)
2608.09444 Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching llm-infra method paper_card 1537 Aug-2026 research
2609.29845 Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs engineering position paper_card 1523 Sep-27 research(机制可解释性)
FreeToken Berkeley Edge-Native MoE Routing(arXiv 编号待确认) systems system HuggingFace Papers / Jay engineering filter research(边缘 MoE)

续用锚定 arXiv(Sep 28 e1prep 沿用,60+ 个): 2609.29647 · 2609.23315 · 2511.02230v7 · 2609.27981 · 2609.23087 · 2605.01604 · 2608.14635 · 2510.09665 · 2608.01526 及 Sep 28 e1prep §4 引用清单内全部


五、待追踪事项(不在本轮写入知识库)

  1. FreeToken 完整 arXiv 编号 — 精读 HuggingFace Papers 确认后入库
  2. KV Cache Working Set(2609.27746)全文 — 在线容量规划方法论细节
  3. Looped LM CDB(2608.09444)全文 — 与 vLLM 集成方式的具体描述
  4. SGLang vs vLLM benchmark 数字统一 — 合并 bex.co (85ms/380ms) 和 five-category briefing (~42-80ms) 差异
  5. OpenViking/VikingMem 论文精读 — 工程实现细节 + benchmark 数据
  6. KubeCon NA 2026(11 月 Salt Lake City) — llm-d 专题和 K8s AI 推理进展
  7. llama.cpp v0.5.0 + v0.4.1 ggml-org 兼容性 — release notes 追踪

本报告由 Jay 实例生成 · 2026-09-29 11:20 CST · 仅作研究线索,不含 API Key 或私密信息