engineering · E1 预消化简报(2026-09-28)

执行体:Jay · E1 日间预消化轮 · engineering 主题 · 2026-09-28 11:20 CST 窗口定义:2026-09-27 11:20 ~ 2026-09-28 11:20 CST(约 24 小时滑动窗口) 底本:organized/knowledge/engineering.md v132(2026-09-27 09:15 CST)+ inbox 近 2 天各 agent 工程相关产出 诚实度声明:本轮增量密度中等,共识别 5 条实质性新增(含 1 条 paper_card NET-new 邻接入库、4 条 inbox 工程新发现),1 条重要矛盾待核实。无硬凑字数,如实报告。


状态摘要

  • 增量条数:5 条(落在 3-8 目标区间内)
  • 核心新增:① SGLang vs vLLM 生产基准(Agent 平台多轮 4.5x TTFT 差距)② llama.cpp v0.5.0 稳定版发布 ③ Continnum(KV cache 端到端驱逐缺陷)④ AgentKernel(arXiv:2609.29647)Agent OS 新分类 ⑤ Graph Memory benchmark(arXiv:2609.23315)
  • 澄清:arXiv:2609.30233 Coding Agents TAMP 已于 v132 §1.8 锚定,本轮不重复计入
  • 涉及 arXiv 号:本次新增 3 个(2609.29647 · 2609.23315 · 2511.02230);续用锚定 60+ 个(v132 沿用)

一、检查过的来源清单

来源目录 关键文件 engineering 相关度
inbox/jay 2026-09-28T1150-jay-engineering-filter-production-benchmarks.md 极高 ⭐⭐⭐⭐⭐(SGLang vs vLLM 生产基准 + llama.cpp v0.5.0 + Continnum + KVSET + AutoRAG)
inbox/jay 2026-09-28T0935-jay-ai-engineering-inference-vecdb-mcp-trending.md 极高 ⭐⭐⭐⭐⭐(推理引擎格局 + MCP 2026 + VecDB 选型 + 数据库栈)
inbox/jay 2026-09-28-llm-inference-db-cloudnative.md 极高 ⭐⭐⭐⭐⭐(arXiv 工程论文 9 篇精读候选 + 数据库栈 + CSDN 推理工程文章)
inbox/jay 2026-09-28-csdn-rag-agent-research.md 高 ⭐⭐⭐⭐(RAG 26 篇演进时间线 + GraphRAG 生产 + LazyGraphRAG 成本 + BM25 逆袭)
inbox/jay 2026-09-28-1000-rss-*/(bytebytego/raschka/simon willison) 中(RSS 工程线索,部分非工程)
inbox/jay 2026-09-27-engineering-e1prep.md 极高(v133 基线)
inbox/jay 2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md 极高(推理引擎三强对比 + inferenceengineering.tech 决策树)
inbox/jay 2026-09-27-1450-jay-engineering-filtering-code-agent-rag-frameworks-sep27.md 高(代码搜索 grep vs RAG + Agentic 框架生产对比 + Corpus2Skill)
inbox/jay 2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md 高(CSDN 推理工程 + 投机解码 + vLLM vs SGLang 架构对比)
inbox/tom 2026-09-28-rag-e1prep.md 邻接(RAG 主轴,engineering 间接)
inbox/tom 2026-09-28-agent-rag-longcontext-radar.md 邻接(Linear Superposition + TAMP + Jev + Substack AI Agents Stack)
inbox/tom 2026-09-28_agents-lite.md 高(Agent 记忆三层架构 + 多 Agent 协作 + Mem0/Letta/Zep)
inbox/tom 2026-09-28-0900-hf-daily-2026-09-28.md 中(HF Daily 15 篇,新 paper_card 入库线索)
inbox/spark 2026-09-28-1001-rss-gradient-flow.md 低(数据栈视角,engineering 间接)
inbox/flyp 2026-09-28-0950-flyP-critical-read-VisualDecathlon-ResidualAdapters.md 低(multimodal 主轴,非工程)
paper_cards Sep 27-28 1523-2609-29845 Linear Superposition(engineering·position) 已在 v133 锚定(昨日简报增量 1),不重复计入
paper_cards Sep 27-28 1514-2609-29421 Rufus-Air(engineering·method) 已在 v133 锚定(昨日简报增量 2),不重复计入
paper_cards Sep 27-28 1520-2609-30233 Coding Agents TAMP(agent 主分类) 已在 v132 §1.8 锚定,不重复计入
paper_cards Sep 27-28 1518-2609-29647 AgentKernel(agent 主分类) NET-new 高 ⭐⭐⭐⭐
paper_cards Sep 27-28 1519-2609-29362 SAE PoS(multimodal 主分类) 非工程
paper_cards Sep 27-28 1521-2609-29429 Jev对齐失败检测(risk 主分类) 非工程
paper_cards Sep 27-28 1524-2609-29028 RGBD20K(multimodal 主分类) 非工程

二、增量条目

增量 1:SGLang vs vLLM 生产基准 — Agent 平台多轮场景 4.5x TTFT 差距(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md(Jay 本日 11:50 批次)· 原始来源:bex.co 技术博客(引用 PremAI 2026 基准)

URL:https://bex.co/blog/2026-09/24/sglang-vs-vllm-tenant-model-server

要点(与 v133 锚定 PremAI 数据的工程细化):

指标 SGLang vLLM 差距
TTFT 中位数(多轮 Agent) 85ms 380ms 4.5x
KV Cache 命中率(多轮 Agent) 78.6% 41.2% —
输出吞吐(token/s,多轮) 5,430 3,120 1.74x
KV Cache 命中率(多轮聊天) 75–90% 10–20% —
KV Cache 命中率(代码分析) 60–80% 5–15% —
前缀密集负载吞吐(Llama 3.1 8B) 16,200 tok/s 12,500 tok/s +29%

核心结论(原文一句话):"The more your requests share prefixes, the wider SGLang's lead; the more unique each prompt is, the closer the race."

工程含义:SGLang 的 RadixAttention 在多轮 Agent 场景(工具调用 + 对话历史)中显著优于 vLLM,原因在于 KV Cache 可在工具执行暂停期间保留。vLLM 默认在请求结束时驱逐 KV Cache,导致多轮 Agent 的 KV 复用率极低(41.2% vs 78.6%)。

⚠️ 数据可靠性警示:基准数据未注明 H100 SXM vs PCIe 型号,H100 SXM 与 PCIe 带宽差距可达 20%,所有基于这些数字的 TCO 计算需注明 GPU 型号。

生产建议:Agent 平台(工具调用、多轮对话)优先 SGLang;高独立请求率的工作负载选 vLLM。

可信度:★★★★ — 引用 PremAI 2026 基准,注明 H100 SXM 80GB / RunPod 环境,但 GPU 型号标注缺失需实测交叉验证

与活文档 engineering.md 现有脉络的关系: - v133 §1.1 已锚定 PremAI H100 实测(SGLang/LMDeploy 16,200 vs vLLM 12,500 tok/s);本条是同一来源体系的工程细化,新增多轮 Agent 场景数据 - 与 v132 §1.4 KV Cache 三件套(KVSET + Risk-Controlled + AWS KV Tiering)形成因果链:vLLM 默认驱逐 KV Cache 正是 Continnum 论文(增量 3)揭示的核心缺陷

建议归入章节:§1.1 推理引擎方法学(细化锚定 · bex.co 多轮 Agent 生产基准 · SGLang vs vLLM TTFT 4.5x · KV Cache 命中率 78.6% vs 41.2% · ⚠️ GPU 型号标注缺失需实测)


增量 2:llama.cpp v0.5.0 稳定版发布 + Ollama v0.34.4-rc1 升级警告(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md(Jay 本日 11:50 批次)· 原始来源:AI Infrastructure Digest 2026-09-25(agents-radar 自动化追踪)

URL:https://github.com/duanyytop/agents-radar/issues/3478

版本状态对比(截至 2026-09-25):

引擎 版本 状态 生产建议
llama.cpp v0.5.0 ✅ 新稳定版 优先使用,推荐升级
Ollama v0.34.4-rc1 🔴 RC(含 breaking changes) 升级前需等正式版
vLLM RC 进程中 🟡 开发版 无 24h 内 release
SGLang RC 进程中 🟡 高不稳定性 Issue 93 / PR 151
LiteLLM Dev build 🟡 开发版 PR 149 open

GGUF 量化构建命令(Tech-Insider.org,可复现):

# llama.cpp CUDA 构建
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
pip install -r requirements.txt
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)

# Apple Silicon(Metal 默认启用)
# cmake -B build
# cmake --build build --config Release -j$(sysctl -n hw.ncpu)

回归测试建议:每次新版本发布,重新量化并对同一基准模型跑 llama-bench,对比结果以捕获特定架构破坏性变更。ggml-org 于 2026 年 9 月发布 v0.4.1,建议拉取 latest tag。

工程影响:llama.cpp v0.5.0 稳定版发布意味着本地/边缘推理推荐从旧版本迁移;Ollama v0.34.4-rc1 含 breaking changes,需等正式版再升级生产。

可信度:★★★★ — 来自 agents-radar 自动化追踪系统,可信度高

与活文档 engineering.md 现有脉络的关系: - 与 v132 §1.1 推理引擎方法学邻接,v0.5.0 补充了版本状态快照 - 与 v132 §1.10 数据/Vector DB(sqlite-vec + VectorChord 嵌入式向量)邻接:llama.cpp 是嵌入式/轻量级推理的核心引擎,v0.5.0 稳定性提升对 sqlite-vec 生态有间接正向影响

建议归入章节:§1.1 推理引擎方法学(邻接新增 · llama.cpp v0.5.0 稳定版 + Ollama RC 警告 · 版本状态快照 · GGUF cmake 构建命令 · 回归测试建议)


增量 3:Continnum — End-of-Turn KV Cache 驱逐导致多轮 Agent 缓存失效(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md(Jay 本日 11:50 批次)· 原始来源:arXiv:2511.02230v7(2026 年 9 月 8 日修订)

URL:https://arxiv.org/html/2511.02230v7

核心问题:vLLM 等引擎在 LLM 调用结束后若新请求等待即驱逐 KV Cache;Agent 工作流中间穿插工具调用(时长差异大),导致缓存无法跨 turn 复用。

关键图:End-of-turn KV Cache Eviction 时序图(Job 1 LLM → Tool → LLM 序列中,Job 1 KV 在工具期间被错误驱逐)

相关工作引用: - AlignedServe (Bai et al., 2026):探索前缀感知 batching - HyMCache (2026):针对 CXL 混合内存的 KV cache 框架

工程价值:高 — 为 SGLang vs vLLM 生产基准中的缓存命中率差异(78.6% vs 41.2%)提供理论解释,对理解 Agent 平台选型有直接帮助。

可信度:★★★★ — 学术论文,引用 USENIX OSDI 26 等顶级会议,2026 年 9 月修订说明仍活跃更新

与活文档 engineering.md 现有脉络的关系: - 与 v132 §1.4 KV Cache 三件套(KVSET + Risk-Controlled + AWS KV Tiering)形成技术栈完整闭环:KVSET 做容量规划 → Risk-Controlled 做淘汰策略 → Continnum 揭示默认驱逐缺陷 - 与增量 1(SGLang vs vLLM TTFT 4.5x 差距)形成因果解释:vLLM 默认驱逐 KV Cache = Continnum 揭示的端到端缺陷 = 多轮 Agent 性能差的根本原因 - 与 v132 §1.1 推理引擎方法学邻接

建议归入章节:§1.4 调度/路由/资源(邻接新增 · arXiv:2511.02230v7 Continnum · End-of-Turn KV Cache 驱逐缺陷 · 多轮 Agent 缓存失效机制 · 为 SGLang vs vLLM 4.5x TTFT 差距提供理论解释)


增量 4:AgentKernel — The Trust-Native Agentic Operating System(⭐⭐⭐⭐)

来源:organized/paper_cards/1518-2609-29647.md(OpenAlex 2026-09-27 入库 · 主分类 agent · paper_card 1518)· Tom 9-28 radar 标注

URL:https://arxiv.org/abs/2609.29647

TLDR:AgentKernel 将 Agent 抽象为"操作系统"——提供系统级原语(进程/线程/文件描述符/系统调用等价物),使 Agent 可以在统一框架内管理自身状态、外部工具、多 Agent 通信。

核心概念: - Trust-Native:信任成为系统设计的第一等公民,而非事后外挂 - Agent 作为"进程":每个 Agent 有独立执行上下文、生命周期管理 - 工具作为"系统调用":统一接口访问文件系统、网络、数据库等 - 多 Agent 协作通过"进程间通信"(IPC)原语实现

工程意义:这是继 MCP(工具标准化)+ LangGraph(工作流编排)之后,Agent 系统抽象层面的新分类——把 Agent OS 作为新的系统软件层来设计。

可信度:★★★ — arXiv 预印本(主分类 agent,非 engineering),工程价值需读全文评估

与活文档 engineering.md 现有脉络的关系: - 与 v132 §1.8 Agentic Engineering 邻接,属于 Agent 基础设施的新形态 - 与 v132 §1.3 协议层/MCP/互操作形成互补:MCP 标准化工具访问,AgentKernel 标准化 Agent 间协作 - 与 v132 §3.2 争议 160(关键词搜索 + Agentic 工具 = 向量 RAG 等效性能)邻接:Agent OS 层的抽象可能是下一阶段 Agent 系统的主流方向

建议归入章节:§1.8 Agentic Engineering(邻接新增 · arXiv:2609.29647 AgentKernel · Trust-Native Agentic OS · Agent 作为进程/工具作为系统调用 · 新分类待全文核实)


增量 5:Graph Memory for LLM Agents — Neo4j/Memgraph/DuckPGQ 性能对比(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28-llm-inference-db-cloudnative.md(Jay 知识库草稿 · 2026-09-28)· 原始来源:arXiv:2609.23315

URL:https://arxiv.org/html/2609.23315

核心发现: - 在 LLM Agent 记忆场景下对比主流图数据库引擎(Neo4j/Memgraph/DuckPGQ 等)的查询、写入、更新性能差异 - ingest throughput 各引擎差距达 3 个数量级——这是选型的决定性数据 - Appendix A 含完整对比数据表,适合知识图谱+Agent 系统选型

工程价值:⭐⭐⭐⭐ — 量化数据直接可用于生产图数据库选型决策,3 个数量级的性能差距意味着某些引擎在 Agent 记忆场景下根本不可用

可信度:★★★★ — arXiv 学术论文,有完整实验数据,Appendix A 数据表可直接引用

与活文档 engineering.md 现有脉络的关系: - 与 v132 §1.8 Agentic Engineering 邻接:图数据库是 Agent 记忆层的重要基础设施(对应 tom 9-28 agents-lite 中的 Mem0/Letta/Zep 产品矩阵) - 与 v132 §1.9 数据库工程实践(sqlite-vec + VectorChord)形成"图数据库 vs 关系型向量数据库"的互补选型 - 与 v132 §3.1 共识 138(Agent 状态/记忆工程化五源汇聚)形成技术层支撑:五源汇聚(LongHorizon-Harness / MemoryAthena / EAL-Bench / Mem0 / Zero-Mem)均依赖图数据库做记忆存储

建议归入章节:§1.9 数据库工程实践(邻接新增 · arXiv:2609.23315 Graph Memory for LLM Agents · Neo4j/Memgraph/DuckPGQ 3 数量级性能差距 · Agent 记忆图数据库选型数据 · Appendix A 完整对比表待精读)


三、值得警惕的矛盾或待核实说法

⚠️ 矛盾 1:SGLang vs vLLM TTFT 4.5x 差距与 GPU 型号标注缺失

问题:bex.co 博客的 SGLang TTFT 85ms vs vLLM 380ms(4.5x 差距)未注明 H100 SXM vs PCIe。H100 SXM(NVLink 互联)和 PCIe 带宽差距可达 20%,同一引擎不同配置实测数字会漂移。

潜在影响:基于这些数字的 Agent 平台选型建议(TCO 计算、"月省 $15K GPU"说法)可能存在偏差。

建议:所有基于 H100 吞吐量的决策需注明 SXM/PCIe 型号,待与 Jarvislabs/PremAI 数据交叉验证后更新知识库。

⚠️ 待核实 2:AgentKernel(arXiv:2609.29647)工程成熟度

问题:AgentKernel TLDR 描述"Trust-Native Agentic OS"是新概念形态,论文尚未有社区引用数据(OpenAlex 被引 0),具体实现细节、可复现性、生产就绪程度均未知。

建议:需读全文确认是否有开源代码、benchmark 数据、实际系统演示,再作为工程设计依据。

⚠️ 待核实 3:llama.cpp v0.5.0 稳定版与 GGUF 工具链兼容性

问题:Tech-Insider.org 指南引用 ggml-org v0.4.1,而 llama.cpp 已发布 v0.5.0。v0.5.0 是否破坏 ggml-org 工具链兼容性尚无公开文档。

建议:关注 llama.cpp GitHub release notes 中关于 ggml-org 兼容性的说明。


四、arXiv 可引用列表(本次新增)

arXiv 号 标题 主分类 形态 来源 成熟度
2609.29647 AgentKernel: The Trust-Native Agentic Operating System agent method paper_card 1518 Sep-27 research(工程成熟度待核实)
2609.23315 Graph Memory for LLM Agents: At What Cost? database benchmark Jay inbox Sep-28 知识库草稿 research(含完整数据表)
2511.02230v7 Continnum: End-of-Turn KV Cache Eviction in LLM Serving systems method Jay inbox Sep-28 11:50 批次 research(OSDI 26 引用)

续用锚定 arXiv(v132/v133 沿用,约 60+ 个): 2609.29845 · 2609.29421 · 2609.30233 · 2609.27746 · 2609.27981 · 2609.23087 · 2605.01604 · 2608.14635 及 v132 §4 引用清单内全部


五、待追踪事项(不在本轮写入知识库)

  1. llama.cpp v0.5.0 完整 release notes — 确认 ggml-org 兼容性变更
  2. AgentKernel 全文 — 确认开源代码 + benchmark 数据 + 生产就绪度
  3. KubeCon NA 2026(11 月 Salt Lake City) — llm-d 专题和 K8s AI 推理进展
  4. SGLang vs vLLM RTX 4090/L40S 消费级基准(ComputingForGeeks)— 缺具体 tok/s 数值,需全文读取
  5. Graph Memory Appendix A 完整数据表 — Neo4j/Memgraph/DuckPGQ 三数量级差距的具体数字

本报告由 Jay 实例生成 · 2026-09-28 11:20 CST · 仅作研究线索,不含 API Key 或私密信息