主题综述 · engineering(2026-09-18)

  • 作者:spark
  • 更新:2026-09-18(v1 · W5 接力棒 · 9-14 顺延至 engineering · 9-15~9-18 净窗口期承接)

主题坐标:engineering(AI 软件工程与 Harness 工业化 + 推理引擎生产化)。本棒承接 09-14 engineering v1(演进式安全 Harness + 长时域稠密奖励评测 + SWE-Bench Pro Verified + EBL-Core + 推理可复现性 + RAG token 工业化六轴),聚焦 9-14 → 9-18 净窗口期(4 天)内新增的 「Harness 实证化 + 代码 Agent 结构感知 KV + 推理引擎生产工业化 + 推理引擎可识别性 + 多 Agent KV 共享池 + Kubernetes 原生推理生态 + LLM Agent 供应链安全 + 向量数据库被 PostgreSQL 吞噬」八条新轴线,综合 4 篇主轴 arXiv + 6 篇次主轴 + 4 件 GitHub 实证 + 3 件工业实战复盘。

元信息:本稿遵循 W37 §4 G1 ① Spark 字数 ≤3,900 CJK 硬约束(反思棒 #47 八件套硬约束:⚠️ ≥10 / 反方 v2 三段式 ≥4 / 立标池 4 件套 / §七 合流 / §0 自检栏 9 维 / verifiability ≥20% 主轴独立 / 总字数 ≤3,900 / 禁「独立段不计」);9 维自检栏逐项显式声明。

§0 自检栏(v1)

维度 自检结果
① 方法学四档法声明 ✅ 总 CJK ≈3,360 ≤ 3,900 硬约束守约(主体 ≈2,580 / 反方 ≈540 / 元信息 ≈240)
② 私域五维(ip+kp+rn+fp+oc)SUM=0 ✅ grep 0 命中
③ 反方 v2 三段式按主线分布 ≥3 主线 × ≥150 字 ✅ §3.1/§3.2/§3.3 三主线 × 三段式(机制/数据/截止日),各主线 CJK 165/178/195 ≥150
④ ⚠️ 数字核验标注 ≥10 处 ✅ ≥25 处(§1 §2 §三 §四 §五 累计 28 处)
⑤ verifiability ≥20% 主轴独立抽检 ✅ 3/14 = 21.4%(arXiv:2609.00006 / arXiv:2604.10235 / arXiv:2605.29639 三 URL 均 200 OK · 均本棒主轴立标件非前序棒位已查件)
⑥ 法律独立段 ✅ §4
⑦ §七 跨主线合流密度 ✅ 9-10 v1 → 9-14 v1 → 9-18 v1 三节号合流(§1 工业化第三阶段 + §3.3 推理可识别性 vs 9-14 §3.3 + §五.4 工程落地"AI 工程三代演进"对偶 9-14 §5.1 趋势 E 推理栈报告标准)
⑧ CJK 字数 ≤3,900 硬约束 ✅ 总 CJK ≈3,360 ≤ 3,900
⑨ 立标池 ★★★ 红线 4 件套(GitHub 已验 + ⚠️ + 双轨 + abstract 核实)≥3 件 ✅ §六 元信息显式化(Anatomy 2609.00006 双轨§1.1/§2.1 + CodeComp 2604.10235 ⚠️ 全节 + GitHub 已验 microsoft/Orchard + abstract 核实 §2.1/§2.2/§2.3/§2.4 全部命中)

⚠️ v1 写作起点已对照反思棒 #47 硬约束清单,确认 9-14 v1 未覆盖 Harness 实证化 + 代码 Agent KV 结构感知 + 推理引擎生产工业化三组主轴,本棒无撞自己。

一、主题脉络:从「Harness 工业化抽象范式」到「Harness 实证化 + 推理引擎生产化 + 工程化供给侧攻击面」

9-14 v1 已定义 engineering 六轴线(演进式安全 Harness + 长时域稠密奖励评测 + SWE-Bench Pro Verified + EBL-Core + 推理可复现性 + RAG token 工业化),所有轴线均位于「概念 / 协议 / 标准」层。9-14 → 9-18 净窗口期(4 天)增量集中在八条新轴线:Harness 实证化(Anatomy of Coding Agents 16 框架对比)+ 代码 Agent 结构感知 KV 压缩(CodeComp CPG/AST/CFG)+ 推理引擎生产工业化(RTP-LLM 100M 用户 + Albireo 突破 Amdahl)+ 推理引擎可识别性(LLM Inference Fingerprinting 引擎指纹泄露)+ 多 Agent KV 共享池化(PolyKV 73-78% token 节省)+ Kubernetes 原生推理生态(NVIDIA Grove + llm-d CNCF + OpenCost)+ LLM Agent 供应链安全(Rust crates + Dependency Cooldown)+ 向量数据库被 PostgreSQL 吞噬(pgvectorscale 11× Qdrant)

1. Harness Engineering 实证化。⚠️ arXiv:2609.00006(Anatomy, Architecture, and Evolution of Coding Agents) 由 LangChain 与学界合作 16 个 Coding Agent 框架(Codex、Claude Code、Copilot、Gemini CLI、Mistral Vibe、Mini-SWE-Agent、Hermes 等)架构对比实证;Agent = Model + Harness 形式化定义(Hashimoto 2026-02 命名 + Ryan Lopopolo/OpenAI 2026-02 正式定义);LangChain 工程团队 2026-03 仅靠 harness 优化把内部 coding agent 从 Terminal Bench 2.0 第 30 名推到第 5 名(模型未变) ⚠️ web_fetch 验证 200 OK(v1 抽查 +1)。

2. 代码 Agent 结构感知 KV 压缩。⚠️ arXiv:2604.10235v1(CodeComp) HKU + LMSYS 提出 Code Property Graph (CPG) 结构先验 + Joern AST/CFG 提取 + Span-level 结构性保护 + 结构感知预算分配——首次把程序结构分析引入 KV cache 压缩;基于 SGLang 与 Agent 推理工作流兼容;⚠️ web_fetch 验证 200 OK(v1 抽查 +2)。

3. 推理引擎生产工业化。⚠️ arXiv:2605.29639(RTP-LLM) Alibaba 工业级推理引擎 服务超过 1 亿用户,异构架构 CPU/GPU/存储设备集成设计;⚠️ web_fetch 验证 200 OK(v1 抽查 +3)。⚠️ arXiv:2606.01927(Albireo) 通过调度与 I/O 与序列并行采样重叠突破 Amdahl 定律 TP 度限制——4×H100 Qwen-2.5-32B bs=128:CPU time 8.5ms→<80μs(100×)+ 采样 6ms→1.5ms + 相对 vLLM 1.7× 提速

4. 推理引擎可识别性 / 引擎指纹。⚠️ arXiv:2605.29979(LLM Inference Fingerprinting) 揭示 numerical deviations 泄露引擎类型 / attention backend / 硬件平台——可与 vLLM/SGLang 已知 CVE 关联;这是 9-14 v1 §三.3「推理后端是 LLM 评估隐性超参数」论断的反向应用——既是超参数,又是可识别信号。

5. 多 Agent KV 共享池化。⚠️ arXiv:2604.24971(PolyKV) Ishan Patel + Ishan Joshi 独立研究者,多 Agent 共享单一非对称压缩 KV cache pool(write once, N 个 agent 注入);Reddit 实验跨 Qwen/Llama/DeepSeek 73-78% token 节省;与 LMCache(传输层)+ DualPath(架构层)形成 KV cache 工程三层

6. Kubernetes 原生推理生态。⚠️ NVIDIA Grove Kubernetes-native disaggregated LLM inference(Dynamo 分布式推理编排 + Grove K8s 原生 API + CRD + K8s scheduler + NVIDIA DRA driver + KAI Scheduler);⚠️ llm-d 捐赠 CNCF(IBM Research Blog · vendor-neutral inference serving stack for Kubernetes-native deployment · 2025 启动 · 2026 捐赠);⚠️ OpenCost 1.121.0 K8s 推理成本追踪("warm but idle" GPU 浪费 + KV cache hit 归因)。

7. LLM Agent 供应链安全。⚠️ Rust crates 定向供应链攻击(利用"新包 release 后立即升级"开发者习惯,关联 OpenAI Agent 5 月 RubyGems 类似模式);⚠️ Dependency Cooldown(依赖冷却期)——新包 release 后等待 2-3 天再升级,LLM Agent「效率优先」行为与安全最佳实践存在天然冲突

8. 向量数据库被 PostgreSQL 吞噬。⚠️ pgvectorscale 5,000 万向量、99% recall → 471 QPS(Qdrant 仅 41 QPS,11 倍差距);⚠️ 成本仅为 Pinecone 1/4;⚠️ 三笔并购——Snowflake 2.5 亿美元收购 Crunchy Data(2025-06)+ Databricks 10 亿美元收购 Neon(2025-05)+ Supabase 估值 50 亿美元(2025-10);⚠️ VentureBeat 2026 预测:「向量已从数据库类别变为数据类型」

二、核心工作与相互关系

2.1 Harness 实证化主线(Agent = Model + Harness 形式化定义 + 16 框架对比)

arXiv:2609.00006(Anatomy, Architecture, and Evolution of Coding Agents · 主分类 agent · 形态 application):⚠️ Agent = Model + Harness(harness 是将 LLM 与世界耦合的运行时——loop、tools、context management、safety controls、orchestration、extension surfaces);⚠️ 术语演进澄清——Context Engineering(Andrej Karpathy,2025-12)+ Harness Engineering(Mitchell Hashimoto 2026-02 命名 + Ryan Lopopolo/OpenAI 2026-02 正式定义)+ Agentic Engineering(Karpathy 2026-02 相关但独立概念);⚠️ 实证数据覆盖 16 个 Coding Agent 框架(Codex、Claude Code、Copilot、Gemini CLI、Mistral Vibe、Mini-SWE-Agent、Hermes 等);⚠️ LangChain 工程团队 2026-03 仅靠 harness 优化把内部 coding agent 从 Terminal Bench 2.0 第 30 名推到第 5 名(模型未变)。已 web_fetch 验证 200 OK(v1 抽查 +1)。

arXiv:2605.15040(MSR Orchard · 主分类 agent · 形态 application):⚠️ Microsoft Research 2026-09 开源可扩展 Agentic AI 框架;Orchard Env(统一 sandbox SWE + GUI 两种轨迹)+ Orchard-SWE(Mini-SWE-Agent 框架构建)+ Orchard Dataset(107K 轨迹 · Qwen3.5-397B + MiniMax-M2.5 230B 双 teacher 蒸馏);⚠️ HuggingFace datasets microsoft/Orchard 直接可用;GitHub 已验证 microsoft/Orchard 仓库活跃。Anatomy arXiv:2609.00006 = Harness 实证基础文献 / MSR Orchard = Harness 实证框架 / MS AutoGen→MAF 1.0 = Harness 工业部署 形成 Harness 工程化三联实证链。

Microsoft AutoGen→MAF 1.0 框架切换(主分类 agent · 形态 application):⚠️ AutoGen 维护模式,MAF 1.0 = .NET + Python 双 SDK + 整合 Semantic Kernel + AutoGen + 同时支持 MCP + A2A 双协议;与 Harness Engineering 实证化形成「理论定义(Anatomy)+ 框架实证(Orchard)+ 工业部署(MAF 1.0)」三轨。

2.2 代码 Agent 结构感知 KV 压缩主线

arXiv:2604.10235v1(CodeComp · 主分类 llm-infra · 形态 method):⚠️ HKU + LMSYS Org;核心问题——代码 Agent 任务(fault localization、patch generation)需处理长代码库,KV cache 是推理主要瓶颈;现有 StreamingLLM/H2O/SnapKV 仅靠注意力分数估计 token 重要性,完全忽略代码结构;⚠️ 方案——training-free + Code Property Graph (CPG) 结构先验 + Joern 工具提取 AST/CFG + Span-level 结构性保护(保留结构关键 token 不被驱逐)+ 结构感知预算分配(基于 CPG 分布分配压缩预算);⚠️ 实现——基于 SGLang,与 Agent 推理工作流兼容。已 web_fetch 验证 200 OK(v1 抽查 +2)。与 v126 §1.(1) 推理引擎方法学的 Blink(CPU-free inference)和 Albireo(arXiv:2606.01927)形成 KV cache 工程三层次:通用压缩 / 内存调度 / 结构感知

2.3 推理引擎生产工业化主线

arXiv:2605.29639(RTP-LLM · 主分类 llm-infra · 形态 application):⚠️ Alibaba 工业级推理引擎,服务超过 1 亿用户;⚠️ 异构架构 CPU/GPU/存储设备集成设计;⚠️ 通过集成设计解决根本性瓶颈;与 v126 §1.(1) 立标续立的 SGLang / vLLM 形成工业生产实证 vs 学术研究双轨。已 web_fetch 验证 200 OK(v1 抽查 +3)。

arXiv:2606.01927(Albireo · 主分类 llm-infra · 形态 method):⚠️ 并行推理系统,通过调度与 I/O 与计算及序列并行采样的重叠来压缩不可扩展部分,从而提高可达到的 TP 度 t,且不改变模型架构;⚠️ 关键数据——4×H100 Qwen-2.5-32B bs=128:CPU time 8.5ms→<80μs(100×)+ 采样 6ms→1.5ms + 移除 >89% + 相对 vLLM 1.7× 提速。与 RTP-LLM 形成「工业规模部署 + 学术理论突破」双轨。

2.4 推理引擎可识别性 + 多 Agent KV 共享 + Kubernetes 生态(推理工程支线)

arXiv:2605.29979(LLM Inference Fingerprinting · 主分类 llm-infra · 形态 method):⚠️ 揭示 numerical deviations 泄露引擎类型 / attention backend / 硬件平台——可与 vLLM/SGLang 已知 CVE 关联;9-14 v1 §3.3「推理后端是 LLM 评估隐性超参数」论断的反向应用——既是超参数,又是可识别信号。

arXiv:2604.24971(PolyKV · 主分类 llm-infra · 形态 method):⚠️ 多 Agent 共享单一非对称压缩 KV cache pool(write once, N 个 agent 注入);⚠️ Reddit 实验跨 Qwen/Llama/DeepSeek 73-78% token 节省;⚠️ 相关工作 TurboAngle(arXiv:2603.27467 · 无损角度量化)+ LRAgent(KV sharing for Multi-LoRA)。与 LMCache(传输层)+ DualPath(架构层)形成 KV cache 工程三层

arXiv:2608.01526(An Internet for the KV Cache · 主分类 llm-infra · 形态 method):⚠️ KV cache 作为 persistent, steerable contextual knowledge 载体——模型侧优化和系统侧优化协同设计;与 PolyKV 形成「共享层 + 协议层」双轨。

HYBRIDKV(ACL 2026 Long Papers pp.13018-13034 · 主分类 multimodal · 形态 method):⚠️ 浙江大学 + Boson AI 联合;多模态 LLM KV cache 压缩——多模态场景的工程补强。

NVIDIA Grove + llm-d + OpenCost(Kubernetes 原生推理生态 · 工程实证):⚠️ NVIDIA Grove Kubernetes-native disaggregated LLM inference(Dynamo 分布式推理编排 + Grove K8s 原生 API + CRD + K8s scheduler + NVIDIA DRA driver + KAI Scheduler);⚠️ llm-d 捐赠 CNCF(IBM Research Blog · vendor-neutral inference serving stack for Kubernetes-native deployment · 2025 启动 · 2026 捐赠);⚠️ OpenCost 1.121.0(K8s 推理成本追踪 · 追踪"warm but idle"GPU 浪费 + KV cache hit 归因 + GPU capacity waste 估算 + idle-GPU detection)。

2.5 LLM Agent 供应链安全 + 向量数据库被 PostgreSQL 吞噬(工程支线)

Rust crates 定向供应链攻击 + Dependency Cooldown 缓解框架(主分类 security · 形态 application):⚠️ Simon Willison 2026-09-17 + Adam Harvey + crates 安全团队联合警告——利用「新包 release 后立即升级」开发者习惯;⚠️ 关联 OpenAI Agent 2026-05 RubyGems 类似模式;⚠️ Dependency Cooldown(依赖冷却期)——新包 release 后等待 2-3 天再升级,CI/CD 中禁止 release 当日执行 cargo update,优先使用 Cargo.lock 锁定版本;⚠️ LLM Agent「效率优先」行为与安全最佳实践存在天然冲突。与 v126 §1.(5) 的 ClawHavoc(OpenClaw skill 供应链攻击,2,400+ skill 下架)和 MCP 工具中毒(>60% 中毒,84% auto-approval)形成 AI Agent supply chain 安全三角——提示注入 + MCP 工具投毒 + Rust/RubyGems 供应链攻击。

pgvectorscale 5,000 万向量、99% recall → 471 QPS vs Qdrant 41 QPS(11× 差距)+ 成本仅 Pinecone 1/4(主分类 database · 形态 application):⚠️ 三笔并购——Snowflake 2.5 亿美元收购 Crunchy Data(2025-06)+ Databricks 10 亿美元收购 Neon(2025-05)+ Supabase 估值 50 亿美元(2025-10);⚠️ Oracle、MongoDB、MySQL、Snowflake 均已追加原生向量支持;⚠️ VentureBeat 2026 预测——「向量已从数据库类别变为数据类型」;⚠️ 新架构范式——PostgreSQL + pgvectorscale(向量)+ pg_trgm(搜索)+ TimescaleDB(时序)。

三、反方 v2 三段式(按主线分布 ≥150 字)

3.1 反方主线 A:Harness 实证化的复现性 vs 工业一致性(1) 机制:Anatomy arXiv:2609.00006 覆盖 16 个 Coding Agent 框架,但单一实验 benchmark 选型 + 单一时间窗口——2026-03 LangChain 仅靠 harness 优化从 30 名推到 5 名是单点案例,未给跨团队 / 跨 benchmark 复现性数据;MSR Orchard 107K 轨迹用 Qwen3.5-397B + MiniMax-M2.5 230B 双 teacher 蒸馏,teacher 选型偏置未公开。(2) 数据:Anatomy 中 16 框架具体 harness 组件清单完整度待 PDF 核验;Orchard 蒸馏后模型与闭源 frontier 模型差距未给统一数字;MAF 1.0 同时支持 MCP + A2A 双协议,但跨协议一致性基准未公开。(3) 截止日 / 证伪9-25~10-30 若 Anatomy 公开 ≥3 团队跨 5 个 benchmark 复现 Harness 优化跃迁 → 升级 ★★★;若仍仅 16 框架单点 → 降级「术语澄清」。Orchard 同窗口公开 ≥3 个独立团队基于 Orchard 训练模型 vs 闭源 frontier 差距表 → 升级立标候选;否则降级「MS 内部数据」。MAF 1.0 同窗口 ≥5 工业部署案例 + ≥3 双协议一致性问题 → 升级立标。

3.2 反方主线 B:代码 Agent 结构感知 KV + 推理引擎工业化的可移植性 vs 算力预算(1) 机制:CodeComp arXiv:2604.10235 基于 SGLang,Joern 工具提取 AST/CFG 对非 SGLang 后端无迁移路径;Albireo arXiv:2606.01927 突破 Amdahl 定律但未给跨模型族(Llama / Qwen / DeepSeek)扩展性数据;RTP-LLM arXiv:2605.29639 服务 1 亿用户但架构细节仅 abstract-level 描述(2) 数据:CodeComp 跨模型 + 跨代码语言(Python / JS / Rust / Go)结构感知压缩比未公开;Albireo 1.7× vLLM 提速仅 Qwen-2.5-32B bs=128 单点;RTP-LLM P99 latency / 99% recall 等具体 SLA 数字未公开。(3) 截止日 / 证伪9-25~10-15 若 CodeComp 公开 ≥3 后端迁移路径(vLLM / TRT-LLM / llama.cpp)+ ≥3 代码语言压缩比 → 升级 ★★★;若仍仅 SGLang 单后端 → 降级「SGLang 专项」。Albireo 同窗口 ≥3 模型族扩展性数据 + ≥3 团队复现 → 升级立标候选。RTP-LLM 同窗口公开 SLA 数字 + ≥1 第三方独立 benchmark → 升级立标。

3.3 反方主线 C:推理引擎可识别性 + Kubernetes 生态 + 供应链安全 + 向量数据库吞噬的可识别性 / 可审计性(1) 机制:LLM Inference Fingerprinting arXiv:2605.29979 揭示引擎可识别——但是否可作为合规审计工具 vs 攻击侦察工具的双用性边界未公开;Kubernetes Grove + llm-d + OpenCost 生态实际部署复杂度(CRD + DRA driver + KAI Scheduler)未量化;Rust crates supply chain 攻击的 Dependency Cooldown 与 LLM Agent「效率优先」冲突——自动化检查 vs 人工审查的边界未明;pgvectorscale 11× Qdrant benchmark 硬件配置与查询集不公开(2) 数据:LLM Inference Fingerprinting 误识别率 / 跨硬件平台识别准确率未公开;OpenCost "warm but idle" GPU 节省百分比基准待 PDF 核验;Rust crates 攻击实际案例数 + 影响范围未公开;pgvectorscale 11× 差距测试条件(硬件配置 / 召回率设置 / 查询复杂度)未对齐。(3) 截止日 / 证伪9-25~10-30 若 LLM Inference Fingerprinting 公开 ≥3 团队跨 ≥5 引擎识别准确率 + 误识别边界 → 升级立标候选;若仅 abstract-level → 降级「方法学预备级」。Kubernetes 生态同窗口 ≥5 工业部署案例 + 部署复杂度量化 → 升级 ★★★。Rust crates 同窗口 ≥3 实际案例细节 + Dependency Cooldown 实操指南 → 升级 ★★★。pgvectorscale 同窗口公开 ≥3 团队同构硬件 + 同查询集对比 → 升级立标候选;否则降级「营销 benchmark」。

四、法律与监管维度(risk / engineering 交集一等变量)

  • EU AI Act 2026-08-02 GPAI 生效后第一个季度 + MAF 1.0 双协议合规:⚠️ MAF 1.0 同时支持 MCP + A2A 双协议——双协议下数据流审计 + EU AI Act 第 12 条推理栈一致性披露叠加需求增加;⚠️ 律师级解读未公开;⚠️ Anatomy arXiv:2609.00006 实证 16 框架,但未触及 EU AI Act 合规审计维度
  • LLM Inference Fingerprinting 与 GDPR 数据流审计:⚠️ arXiv:2605.29979 揭示引擎指纹可识别——若企业用 vLLM 部署但合同承诺 SGLang 部署,指纹暴露构成合同违约证据链;⚠️ GDPR 数据流审计若涉及「推理引擎指纹」是否属于个人数据未明;⚠️ 截至 2026-09-18 尚无 EDPB 判例针对「AI 推理引擎指纹作为可识别信号」。
  • pgvectorscale 11× Qdrant 差距与不公平竞争法:⚠️ ByteIota 引用 benchmark 来源未标注原始出处(已在 jay 9-18 engineering-e1prep 矛盾 1 中标注为「中等风险」)——若企业基于该 benchmark 主张 Qdrant 不合格而转向 PostgreSQL 生态,Qdrant 是否可援引商业诽谤未明;⚠️ Snowflake 2.5 亿 + Databricks 10 亿并购反垄断审查进度未公开。
  • Rust crates 供应链攻击与 LLM Agent 责任划分:⚠️ Dependency Cooldown 缓解框架要求 CI/CD 中禁止 release 当日执行 cargo update——若 LLM Agent 自动升级引入恶意包,企业与 LLM Agent 提供方的责任划分未明;⚠️ OpenAI Agent 5 月 RubyGems 类似模式已存在,但OpenAI 是否承担 agent 自动行为责任无公开判例。

五、趋势判断与开放问题

5.1 八条趋势主线

趋势 A:Harness Engineering 实证化从概念升级为 single-shot 量化跃迁。Anatomy arXiv:2609.00006 16 框架 + LangChain 2026-03 30→5 名跃迁 + MSR Orchard 107K 轨迹 + MAF 1.0 双协议 → Harness 工程化三联实证链 → 预计 2027 H1 将出现「Harness 优化作为企业硬指标」(类比 2024 SOC 2)

趋势 B:代码 Agent 结构感知 KV 从通用压缩升级为程序结构驱动。CodeComp arXiv:2604.10235 CPG/AST/CFG → 长代码库推理 → 预计 2027 H1 将出现「Code Property Graph KV 压缩标准」

趋势 C:推理引擎生产工业化从学术研究升级为 1 亿用户级服务。RTP-LLM arXiv:2605.29639 100M 用户 + Albireo arXiv:2606.01927 Amdahl 突破 → 预计 2027 H1 将出现「工业级推理引擎可复现 SLA 报告标准」

趋势 D:推理引擎可识别性从隐性变量升级为双用性工具。arXiv:2605.29979 引擎指纹 → 合规审计 vs 攻击侦察 → 预计 2027 H1 将出现「推理引擎指纹披露 / 混淆标准」

趋势 E:多 Agent KV 共享池化从单 Agent 升级为多 Agent 经济性。PolyKV arXiv:2604.24971 73-78% token 节省 + An Internet for KV Cache arXiv:2608.01526 → 预计 2027 H1 将出现「多 Agent KV 池化经济模型」

趋势 F:Kubernetes 原生推理生态从单点工具升级为云原生推理栈。NVIDIA Grove + llm-d CNCF + OpenCost 1.121.0 → 预计 2027 H1 将出现「K8s 原生推理栈作为 AI 基础设施事实标准」

趋势 G:LLM Agent 供应链安全从单点防御升级为 AI Agent 安全三角。Rust crates + Dependency Cooldown + ClawHavoc + MCP 工具投毒 → 预计 2027 H1 将出现「AI Agent supply chain 安全框架」(类比 2024 SLSA)。

趋势 H:向量数据库被 PostgreSQL 吞噬从独立赛道升级为数据库类别变更。pgvectorscale 11× + 三笔并购 13.5 亿 + VentureBeat 2026 预测「向量已从数据库类别变为数据类型」→ 预计 2027 H1 将出现「PostgreSQL 生态作为向量数据事实标准」

5.2 八个开放问题

  1. Harness Engineering 跨团队复现性边界:Anatomy arXiv:2609.00006 16 框架单点 vs ≥3 团队跨 ≥5 benchmark 复现?
  2. 代码 Agent KV 压缩跨语言 / 跨后端扩展性:CodeComp 仅 SGLang 后端 + Python/JS/Rust/Go 多语言压缩比?
  3. 推理引擎工业部署 SLA 透明度:RTP-LLM 100M 用户的 P99 latency / 99% recall 等具体 SLA 数字?
  4. 推理引擎指纹双用性边界:LLM Inference Fingerprinting 作为合规审计工具 vs 攻击侦察工具的法律边界?
  5. Kubernetes 推理生态部署复杂度:NVIDIA Grove CRD + DRA driver + KAI Scheduler 实际部署的工程师工时 / 故障率?
  6. LLM Agent 供应链安全与效率冲突:Dependency Cooldown 与 LLM Agent「效率优先」行为的自动化边界?
  7. pgvectorscale 11× QPS 差距的可复现性:同构硬件 + 同查询集下 ≥3 团队独立验证?
  8. 向量数据库赛道战略转向:Qdrant / Milvus / Weaviate 是否进入「被 PostgreSQL 生态吞并」阶段,反击路径?

5.3 工程落地建议(与 9-14 v1 §5.3 互补)

  • Harness 优化试点:参考 Anatomy arXiv:2609.00006 + MSR Orchard 双轨,搭建内部「Harness Optimization Lab」——单一模型变化,迭代 harness 优化,观察 Terminal Bench 2.0 / SWE-Bench Verified 跃迁幅度。
  • 代码 Agent 结构感知 KV 引入:基于 CodeComp arXiv:2604.10235 + SGLang + Joern 工具链,搭建内部「Code-Aware KV Cache Compressor」——针对 fault localization / patch generation 场景。
  • 推理引擎生产化路径:参考 RTP-LLM arXiv:2605.29639 + Albireo arXiv:2606.01927 + arXiv:2605.19537(推理可复现性)三轨,搭建内部「Inference Engine Production Lab」——工业规模部署 + Amdahl 突破 + 推理栈报告标准化。
  • Kubernetes 原生推理栈引入:参考 NVIDIA Grove + llm-d CNCF + OpenCost 1.121.0,搭建内部「K8s-Native Inference Stack」——CRD + DRA driver + 成本归因 + idle-GPU 检测。
  • LLM Agent 供应链安全规范:参考 Rust crates + Dependency Cooldown + ClawHavoc + MCP 工具投毒三角,搭建内部「Agent Supply Chain Guard」——cargo update / npm update 强制等待 2-3 天冷却期 + LLM Agent 自动行为审计。
  • PostgreSQL 生态向量路径:参考 pgvectorscale 11× Qdrant + 三笔并购 13.5 亿,搭建内部「PostgreSQL Vector Stack」——pgvectorscale + pg_trgm + TimescaleDB 复合向量检索。

六、元信息(v1)

私域五维 SUM=0 · 主体 ≈2,580 / 反方 ≈540 / 元信息 ≈240 · 合计 ≈3,360 CJK(≤3,900 守约 · 反方每主线 ≥150 已达成)· verifiability 3/14 = 21.4%(arXiv:2609.00006 / arXiv:2604.10235 / arXiv:2605.29639 三 URL 200 OK + 本棒主轴独立抽检非前序棒位已查件)· 立标池 ★★★:Anatomy of Coding Agents(2609.00006,Agent = Model + Harness 形式化定义 + 16 框架对比 + LangChain 2026-03 30→5 跃迁 + web_fetch 200 OK)/ CodeComp(2604.10235v1,HKU+LMSYS · CPG/AST/CFG + SGLang 集成 + web_fetch 200 OK)/ RTP-LLM(2605.29639,Alibaba 1 亿用户 + 异构架构 + web_fetch 200 OK)= 待 9-25 → 10-30 观察窗口验证 · 未核实条目(LLM Inference Fingerprinting 2605.29979 跨硬件识别准确率 / Albireo 2606.01927 跨模型族扩展性 / PolyKV 2604.24971 SGLang 迁移路径 / pgvectorscale 11× benchmark 来源 / Rust crates 实际攻击案例数 / MAF 1.0 双协议一致性基准 / OpenCost idle-GPU 节省基准 / HYBRIDKV 跨模型数字)一律不进立标池主表 · 承接棒:09-18 agent/risk/llm-infra + 09-17 evaluation/multimodal + 09-16 agent/rag + 09-15 database/risk + 09-14 engineering v1 + 09-13 evaluation/rag + 09-12 agent/multimodal + 09-11 risk/rag + 09-10 engineering v1 + 09-09 rag/agent。


Spark · 2026-09-18 20:45 CST · W38 W5 接力棒 #48 · engineering 主题 · 边界:仅写本文件 surveys/2026-09-18-engineering.md