engineering · 知识库活文档
- 更新:2026-10-09:补入数据库/云原生、KV网络层、静默失败与Eval闭环;保留v141共识与争议基线。
0. 范围与定调
本文是 engineering 主题的活文档。范围覆盖推理引擎与分布式服务、KV Cache 与网络、数据库/后端/云原生、RAG 与 Agent runtime、Harness/Loop/Eval、可观测性、安全与供应链、端侧与具身系统。当前工作队列没有待建卡,Top 15 是 CADFather、XRD 自学习科学 Agent、UniSkill 三项高价值待深读材料;它们暂不强行并入本轮工程主线。
2026-10-09 的新鲜信号集中在“系统接缝”:数据库采用 MVCC/WAL/冷热分层解决写放大与恢复;Prefill/Decode 通过 MORI-IO、NIXL、Mooncake 把网络变成一等公民;Agent 生产失败更多来自 schema drift、错误上下文和静默叙事,而非模型参数本身。工程成熟度因此从单点 benchmark 转向跨层可验证性:请求是否可解释、状态是否可恢复、工具是否可授权、网络是否可观测、成本是否可封顶。
1. 现状全景
1.1 推理引擎与分布式服务
vLLM、SGLang、TensorRT-LLM 仍是三条主线,但比较单位已从“谁的 tokens/s 最高”变成工作负载形状、批处理策略、KV 管理、并行模式、网络与故障恢复的组合。Prefill 是计算密集,Decode 是带宽/访存密集;将二者部署在同一资源池容易产生 head-of-line blocking。Chunked Prefill 以较小改动缓解混合负载,disaggregation 则让 prefill 与 decode 独立扩缩容。代价是 TTFT 中显式加入 KV 传输,RDMA、NIXL、路由和拥塞控制成为服务正确性的一部分。
vLLM MORI-IO 提供 Read 与 Write 两种 KV 传输模式:VLLM_MORIIO_CONNECTOR_READ_MODE=1 让 decode 主动拉取已完成的 KV,适合延迟可预测的长 prompt/短输出;Write 模式允许 prefill 按层推送 KV,decode 可在 prefill 完成前开始生成,TTFT 更有利但状态与拥塞管理复杂。llm-d/NIXL 将传输后端纳入比较:UCCL、UCX、Mooncake 分别对应 NVIDIA 原生、通用高性能通信和生产化 KV transfer。Mooncake 已进入 PyTorch 生态,并与 SGLang EPD、FlexKV 等场景结合。工程结论不是“选最快后端”,而是为不同请求形状测 TTFT、TPOT、KV transfer、失败恢复和拥塞尾部。
v141 的 SEIS(arXiv:2610.04646)将配置搜索自动化,报告在 H100 单请求负载下比人工配置吞吐高 2.81–3.10×;ServeTwin(arXiv:2610.02732)用分布式模拟器验证容量规划,报告 InferenceX 稳态误差约 3.6%、动态 LMBenchmark 低于 10%。这些数字必须保留“基准条件”限定,不能直接外推多租户、长上下文或故障态。
1.2 KV Cache、网络与内存
KV Cache 已从局部优化对象变成系统资源:复用、分层存储、压缩、淘汰、跨节点传输和路由相互耦合。Behavior-Preserving KV Cache Compression(arXiv:2610.06479)把目标从注意力代理信号推进到“移除 token 是否改变输出分布”,但免训练方法的生产精度仍待验证。EdgeAgent(arXiv:2610.03394)代表 Apple Silicon UMA 多 Agent 的原地冻结与硬件偏移映射;VLA Workload(arXiv:2610.05062)和 ThermE(arXiv:2610.00267)把端侧实时性与热约束拉回系统设计。JIL Attack(arXiv:2610.03430)进一步提醒:长度预测调度器可被对抗性后缀操纵,粗粒度长度分组只是待生产验证的缓解方向。
PagedAttention 的 block table 可类比虚拟页、页表和物理页框;beam 分叉时通过 reference count 与 copy-on-write 保持共享 block 的语义。网络层的关键不是 RDMA 名称,而是端到端预算:KV 字节量、网络拥塞、重传、跨 NUMA/节点边界、取消请求与故障恢复必须进入 SLO。
1.3 数据库、后端与云原生
2026-10-09 的新鲜数据库材料把工程主线补全为“引擎—协议—平台”三层。Swan(VLDB Endowment 2026,DOI 10.14778/3819518.3819528)针对 LSM-Tree KV store 提出混合 MVCC;RCC(arXiv:2607.19697)用 redo log 同时承担恢复与并发控制,在 transaction-local area 存放 speculative versions,缩短 write-write 冲突事务生命周期。Write-Behind Logging 讨论 NVM 可字节寻址后日志优先 WAL 的边界。它们的共同启示是:事务可见性、日志顺序、恢复和版本链不是独立功能,必须联合设计。
PostgreSQL-V(CIDR 2026)将向量索引与 heap 解耦,强调独立刷新与故障恢复;材料报告 10M SIFT、100K 未刷 memtable、1000 次崩溃恢复实验,239ms 恢复中 110ms 用于扫描状态页与重建 bitmap。该数字需要保留实验条件,不能直接视为所有 PostgreSQL 部署的 SLA。GenDB(arXiv:2603.02081)代表 LLM 合成查询计划;Living Databases(arXiv:2605.00676)把 schema 视为可持续演化的活对象;Toward Multi-Database Query Reasoning for Text2Cypher(arXiv:2605.10373)扩展 Text2SQL 到异构数据库推理。它们更接近研究方向,尚不能替代传统数据库内核。
后端与云原生实践的共同形态是“故障分层”:调度、容器、网络、存储、身份和应用分别取证。Komodor 指南给出 symptom→layer→evidence→fix;DevOpsBoys 使用 get/describe/logs/exec/debug 逐步定位;Field Guide 强调内部 curl 成功而外部失败时优先查 Ingress/DNS/LB。生产预防包括资源限制、readiness/liveness、禁止 :latest、PDB、Prometheus/Grafana、RBAC 验证和 kubectl debug。这些是 SOP,不是“自动修复”按钮。
云原生数据库材料展示了两种相反方向:天翼云的分层表空间、冷热 StorageClass 与无锁/顺序锁优化,声称核心表查询 1200ms→200ms、SSD 占用减少 80%;TDSQL-C 通过存算分离、SPDK/RDMA 与只传 redo log,主张 IO 减少 60% 以上。数字来自厂商/二手材料,不能与独立 benchmark 等量齐观,但它们明确指向冷热分层、日志最小化和计算无状态化。
1.4 RAG、Harness、Loop 与 Agent runtime
RAG 已从“向量库 + prompt”演化为可观测数据管道:召回、重排、上下文选择、证据标签、生成、引用和评测必须闭环。Memory 的 Working/Episodic/Semantic/Procedural 分层,MCP 的工具/资源连接层,以及 Agent Guardrails(授权工具、速率限制、操作验证)共同构成 Agent stack。Loop Engineering 的稳定闭环是 discover→plan→execute→verify;Verifier 是瓶颈,persistent memory 能减少重复上下文,但会增加陈旧状态与污染风险。
UndoBench(arXiv:2610.05622)把任务能力与故障恢复能力解耦,使用 8 个企业领域、36 个基础工作流、36 个故障场景、反事实配对和 effect-history oracle。这是对“成功一次”的重要修正:生产系统不仅要证明能做,还要证明出错后能安全恢复。
静默失败材料 arXiv:2606.14589 的五类机制值得固化:tool-call 数据损坏、fail-plausible chained fabrication、routing chaos、context poisoning、semantic schema drift。材料中 4,286 个单元测试、827 个治理检查仍只能阻止已知事故的重复,对新型事故预防率为 0%;最佳检测器之一是人类阅读产品输出。工程含义是:测试不是“全绿”的同义词,必须覆盖接缝、未知 schema、错误来源和跨请求记忆。
FutureAGI 的 4-D trajectory score(plan efficiency、factual grounding、error recovery、task completion)可以转成 gate:每个 agent node 维护代表性 golden cases;路由、工具调用、证据引用和恢复分别评估;关键指标回归超过 5% 时阻断发布。observability 回答“发生了什么”,eval 回答“做得对不对”;v141 的 89% observability/52% eval 差距应继续作为结构性缺口,而不是营销数字。
1.5 安全、协议与治理
MCP 2026-07-28 的 Stateless、Task、多轮请求与企业授权继续推动无状态工具执行和多供应商互操作。MCP Gateway 正成为发现、授权、策略、审计和流量治理的控制面。Agentic-ZTA(arXiv:2610.05782)把 NIST SP 800-207 的零信任控制循环映射到多 Agent 与 RAG 策略管道;Hard Budget Caps 则从经济层切断失控循环。二者与 JIL Attack 的调度层风险、OWASP Agents Top 10 的投毒/过度授权/向量弱点构成互补防线。
生产原则是零信任数据、最小权限、JIT token、HITL、micro-VM/Wasm 沙箱、工具输出敌对处理、schema 验证、来源可信度标签和全链路审计。MCP 不是安全边界;它只是工具连接与发现协议,授权边界仍由 Gateway、身份系统、数据层和执行沙箱承担。
2. 关键工作脉络
2.1 从模型服务到网络与服务控制面
脉络为:单引擎吞吐→PagedAttention/KV 管理→多 GPU 并行→PD disaggregation→RDMA/NIXL transfer→KV-aware routing→容量模拟与自动调优。每一层都引入新的失败模式:传输延迟、缓存不一致、路由错误、重试放大、租户越权和配置漂移。SEIS、RoofLang、Characterizing Parallelism 与 ServeTwin 共同说明,系统优化必须和测量模型一起演进。
2.2 从数据库版本到活数据库与 Agent 数据平面
传统 B-Tree 读优化、LSM 写优化、MVCC/WAL 和分片仍然决定基础性能;新问题是如何让 schema、数据治理、检索和 Agent 工具共享可验证语义。Living Databases 的 sandbox/what-if 与 Text2Cypher 体现方向,但 LLM 合成计划仍需权限、代价模型、确定性重放与人工 gate。
2.3 从 Harness 组件到可恢复 Agent 运行时
Harness 负责上下文、工具、权限、状态与运行约束;Loop 负责循环;Eval 负责判断;Memory 负责跨请求经验;Gateway 负责跨供应商执行。四者若不共享 trace ID 和 schema,生产就会出现“每层都能跑、整体会静默失败”。推荐统一事件模型:request、model_call、tool_call、memory_read/write、policy_decision、cost_event、verification、compensation。
2.4 从性能报告到生产证据
试金石应同时包含吞吐、TTFT/TPOT、KV 命中率与传输、恢复时间、成本/请求、错误分类、人工接管率和安全拦截率。任何单一 tok/s 或 recall 排名都不足以支撑选型。
3. 共识与争议
3.1 共识
- 推理工程已是独立系统学科,工作负载形状和资源约束比模型品牌更能解释性能。
- KV Cache 是跨层资源;PD 分离后网络与路由必须和 GPU 一起设计。
- 数据库、消息、缓存和 Agent 工具都需要 schema 治理;兼容不能靠约定俗成。
- Agent 生产化需要 evals、observability、权限、预算、恢复和人工升级共同存在。
- MCP/Gateway 正在把工具互操作与治理控制面产品化,但协议本身不提供安全保证。
- 数据库与 Agent 系统的下一阶段是语义化、可演进和可回放,而非单纯扩容。
3.2 争议
- SEIS 的 2.81–3.10× 自动调优增益能否跨模型、硬件、并发和多租户复现。
- MORI-IO Write 模式降低 TTFT 的收益,是否会被 KV 传输、拥塞与取消复杂度抵消。
- Behavior-Preserving KV Cache 的免训练精度和成本是否能进入默认生产路径。
- 粗粒度长度分组能否真正缓解 JIL Attack,还是会把风险转移到其他队列。
- LLM 生成查询计划能否在可解释、确定性和权限边界内替代成熟优化器。
- Eval gap 的调查数字能否转化为跨组织可比较的基准;不同任务域的 verifier 如何校准。
- Agentic-ZTA 和硬预算能否在不牺牲可用性的情况下阻断长程失控。
- 厂商数据库案例的收益是内核创新、硬件/部署差异,还是选择性测量。
4. 开放问题与趋势
4.1 开放问题
- MORI-IO/NIXL/Mooncake 在真实跨节点拥塞、故障和取消场景的尾部表现。
- KV Cache 行为保持、压缩、分层和跨模型复用的统一评测。
- PD 分离下的租户公平性、优先级安全和资源回收。
- PostgreSQL-V 与 pgvector/Qdrant/Milvus 的恢复、隔离、更新和成本对比。
- Agent tool schema 漂移的自动检测、版本协商与回滚。
- 静默失败的在线发现:异常检测、因果追踪和人类审核如何组合。
- Verifier 的校准、奖励 hacking、对抗性输入和跨域泛化。
- 端侧 VLA 30Hz 目标与当前 0.4–8.5Hz 有效频率之间的硬件/软件边界。
- MCP 多供应商 Gateway 的身份、凭证撤销、策略一致性和审计互操作。
4.2 2026 H2—2027 H1 趋势
- 推理控制面与数据面进一步分离:自动配置、路由、容量和故障恢复成为平台能力。
- KV Cache 从 GPU 内部优化对象变成跨层存储与网络协议对象。
- PD disaggregation 扩展到多模态 EPD、边缘和具身控制。
- 数据库内核从静态 schema 走向版本化、活数据库和 Agent 可调用的数据平面。
- RAG 从召回 benchmark 走向证据、来源、恢复与成本的全链路 eval。
- Agent runtime 的核心竞争力转向权限、状态、验证、补偿和可观测性,而非单一 prompt。
- MCP Gateway、A2A/ACP/UCP 等协议形成连接、发现、授权、执行的分工生态。
- 端侧系统将热管理、KV、实时频率和安全边界联合优化。
5. 试金石、标准与基准
- PD/KV 网络:vLLM MORI-IO Read/Write;llm-d/NIXL UCCL/UCX/Mooncake;Mooncake + SGLang EPD + AWS EFA。
- 自动化系统优化:SEIS arXiv:2610.04646;ServeTwin arXiv:2610.02732;RoofLang arXiv:2609.12551。
- Agent 恢复/评估:UndoBench arXiv:2610.05622;静默失败 arXiv:2606.14589;4-D trajectory score;89% observability vs 52% eval。
- 数据库:Swan DOI 10.14778/3819518.3819528;RCC arXiv:2607.19697;Write-Behind Logging;PostgreSQL-V CIDR 2026;GenDB arXiv:2603.02081;Living Databases arXiv:2605.00676;Text2Cypher arXiv:2605.10373;pgvector 0.8.6。
- 云原生:Kubernetes v1.37 67 enhancements;Pod certificates for mTLS;imagePullCredentialsVerificationPolicy;K8s 排障 signal→layer→evidence→fix。
- 安全:MCP 2026-07-28 Stateless;Agentic-ZTA arXiv:2610.05782;Hard Budget Caps;OWASP Agents Top 10;JIL Attack arXiv:2610.03430;V141 既有 CVE/DOI 清单全部保留。
6. 引用与来源
本轮 fresh sources:
/shared/research-kb/inbox/jay/2026-10-09T0910-jay-database-backend-cloudnative-engineering.md/shared/research-kb/inbox/jay/2026-10-08T2105-jay-substack-arxiv-k8s-pgvector-mcp-oct08-evening.md/shared/research-kb/inbox/jay/2026-10-08T1950-jay-engineering-filter-pd-disaggregation-mooncake-moriiio.md/shared/research-kb/inbox/jay/2026-10-08T1505-jay-engineering-filter-silent-failures-observability.md/shared/research-kb/inbox/jay/2026-10-09-0930-academic-weekly.md/shared/research-kb/inbox/tom/2026-10-09-0900-hf-daily-2026-10-09.md/shared/research-kb/inbox/tom/2026-10-09-agent-rag-longcontext-radar.md/shared/research-kb/organized/promo/surveys/2026-10-04-engineering.md- web search:
latest AI engineering infrastructure inference agents October 9 2026,检索结果包括 Cisco AI network report、InfoQ AI Engineering、Metavert agent ecosystem;只作为趋势背景,未将未经核验的搜索摘要当作硬证据。
外部链接:https://vllm.ai/blog/2026-04-07-moriio-kv-connector ,https://llm-d.ai/blog/networking-for-distributed-inference-llm-d ,https://github.com/kvcache-ai/Mooncake ,https://developers.redhat.com/articles/2026/06/24/optimizing-distributed-ai-inference-advanced-deployment-patterns ,https://github.com/pgvector/pgvector ,https://cs.purdue.edu/homes/csjgwang/pubs/CIDR26_PostgreSQLVector.pdf ,https://arxiv.org/html/2603.02081v1 ,https://arxiv.org/html/2605.00676v1 ,https://arxiv.org/html/2605.10373v1 ,https://arxiv.org/html/2606.14589v1 。
7. 结论
Engineering 的前沿不是把模型调用成功一次,而是把跨层系统变得可测、可解释、可恢复、可授权和可替换。短期最可靠的投资顺序是:先统一 trace/schema/eval,再做 KV 网络与 PD 分离;先建立最小权限和预算,再增加 Agent autonomy;先用独立 workload benchmark 验证数据库和推理引擎,再采用厂商案例数字。共识是系统工程正在成为 AI 生产力的主战场;争议集中在自动优化、行为保持、Verifier 和安全控制能否在真实负载中兑现。
本次变更
2026-10-09
- 补入数据库/后端/云原生、PostgreSQL-V/GenDB/Living Databases、pgvector 0.8.6 与 K8s v1.37 运维线索。
- 将 MORI-IO、llm-d/NIXL、Mooncake、SGLang EPD、AWS EFA 纳入分布式推理网络主线。
- 将 arXiv:2606.14589 五类静默失败、4-D trajectory score 和 observability/eval gap 纳入 Agent runtime 共识与争议。
- 保留 v141 的 JIL Attack、Agentic-ZTA、Rogue Agent、EdgeAgent/VLA/ThermE、Loop Engineering、SEIS、ServeTwin、UndoBench、既有 CVE/DOI/arXiv/URL 引用基线。
2026-10-08
- v141 主线延续:生产调度安全、端侧具身三角、Loop Engineering 与 AI-for-Systems 闭环。
2026-10-04
- MCP Gateway、Heterfold/Jev/JevSpawn/Φ-Bench 与多供应商推理 TCO 基线延续。