工程实践二次筛选 · Jay · 2026-07-20 10:50 (Asia/Shanghai)

本次主题: 推理系统核心机制 · Harness 工程 · 向量数据库架构 · Agent 安全漏洞 检索范围: CSDN · GitHub · Lilian Weng (Substack) · ByteByteGo · Arjun Jaggi Blog · Substack RSS


一、推理框架核心机制(CSDN 高价值 — 二次筛选通过)

🔥 KEEP — 条目1:Efficient LLM Inference 五大优化方向系统梳理

  • 来源: blog.csdn.net/weixin_44369324/article/details/162635526
  • 时间: 2025-2026

保留理由: ✅ 真实工程内容。 - PagedAttention(vLLM): 显存利用率 3-5 倍提升,类 OS 分页管理 KV cache - RadixAttention(SGLang): 前缀复用,结构化 prompt,吞吐量超 vLLM 5 倍 - KV Cache Disaggregation: DistServe/Splitwise/Mooncake,prefill/decode 分离 - Speculative Decoding: Medusa/EAGLE-3/TensorRT-LLM,串行 decode → draft-and-verify - 量化路线: FP8 全面普及(H100/H200/B200),KIVI 2-bit,QServe W4A8KV4,TensorRT-LLM NVFP4 KV cache - 涉及版本:vLLM 0.6+、SGLang 0.3+、TensorRT-LLM FP8、FlashAttention-3 - 复现可行性: 高。版本号精确,框架名称具体,技术路径清晰


🔥 KEEP — 条目2:推理框架横评(vLLM / TGI / TensorRT-LLM / SGLang)

  • 来源: blog.csdn.net/weixin_37647148/article/details/161914538
  • 时间: 2026年6月

保留理由: ✅ 工程定位明确,版本数据具体。 - vLLM:生态最完整,PagedAttention + Continuous Batching 成熟 - SGLang:RadixAttention 多轮对话复用,2026 增长曲线超 vLLM - TensorRT-LLM:FP8 吞吐量达 H100 峰值,延迟最低 - LMDeploy(国产):TurboMind + 4-bit 量化,RTX 4090 单卡 1.8 倍加速,60% 显存降低 - SGLang 0.4.3(2025年2月)支持 DeepSeek-R1/V3 Multi-token 预测 - 复现可行性: 高。版本号、硬件平台、加速比均有标注


🔥 KEEP — 条目3:LMDeploy vs vLLM vs SGLang 性能差异(实测数据)

  • 来源: blog.csdn.net/qq_40999403/article/details/151405198
  • 时间: 2025年9月(持续更新)

保留理由: ✅ 含真实命令级参数和 benchmark 数据。 - 实测数据: - vLLM 并发 40 达峰值 924 tokens/s - SGLang 50 并发时达 1014 tokens/s - 参数调优: - cache_max_entry_count=0.5 比默认 0.3 提升 23% 吞吐量 - 长文本场景 block_size 建议 64→128,减少内存碎片 - 复现可行性: 高。并发数、tokens/s 数值、配置参数均明确


🔥 KEEP — 条目4:Prefill/Decode 分离架构(DistServe/Splitwise/Mooncake)

  • 来源: blog.csdn.net/w776341482/article/details/162718932
  • 核心: DistServe 明确提出 prefill/decode 分离到不同 GPU 池;Splitwise/Mooncake/TensorRT-LLM/vLLM 均支持 disaggregated serving
  • 保留理由: ✅ 架构选型具体,跨框架对比有工程参考价值

🔥 KEEP — 条目5:Qwen3 部署实战(vLLM/SGLang 完整代码)

  • 来源: blog.csdn.net/m0_55303420/article/details/147688863
  • 真实数据:
  • vLLM 并发 40:924.52 tokens/s(峰值);50 并发:917.30 tokens/s
  • SGLang 在 1-50 并发范围性能持续上升,50 并发:1014.74 tokens/s
  • 含完整 Python 部署代码和 HuggingFace 模型下载命令
  • 保留理由: ✅ 实测 benchmark 数据 + 可复现命令

🔥 KEEP — 条目11:GPTQ/AWQ/GGUF 量化综述(2026 更新)

  • 来源: blog.csdn.net/lijinze2/article/details/162545512
  • 保留理由: ✅ 后训练量化三大主流方案对比 + 2026 新趋势(FP8 普及、KV cache 量化)

二、Harness 工程系统性深度分析(Lilian Weng — 二次筛选通过)

🔥 KEEP — Lilian Weng「Harness Engineering for Self-Improvement」

  • 链接: https://lilianweng.github.io/posts/2026-07-04-harness/
  • 发布时间: 2026-07-04
  • 标签: harness agent self-improvement context-engineering scaffolding

保留理由: ✅ 工程内容极其丰富,有代码、有框架、有量化数据。

核心工程 Pattern(均有源码级细节):

  1. Pattern 1: Workflow Automation(Karpathy autoresearch) - goal-oriented loop:plan → execute → observe/test → improve → loop - 引用 Karpathy autoresearch GitHub repo:https://github.com/karpathy/autoresearch - Codex agent loop 有具体图示(OpenAI 官方博文)

  2. Pattern 2: File System as Persistent Memory - 长程 agent 系统持久化状态的核心模式 - 实验日志、代码 diff、错误堆栈、历史轨迹均以文件存储

  3. Pattern 3: Sub-agent and Backend Jobs - 并行化必须显式可检查(explicit and inspectable) - parent agent 需要 process manager:launch jobs、inspect logs、cancel failed runs、merge results

Case Study — Coding Agent Harness 工具集(有完整工具列表):

File system: glob, grep, ls, read, read_many, write, edit, multi_edit, apply_patch
Shell execution: bash, PowerShell
IO: lsp, git_status, git_diff, git_commit
External context: MCP tools, Skills
Web search: web_search, web_fetch, browser tools
Backend processes: CronCreate, CronDelete, CronList
Agent delegation: spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent

ACE(Agentic Context Engineering)与 MCE(Meta Context Engineering): - ACE:⟨identifier, description⟩ structured bullets,防止 context collapse 和 brevity bias - MCE 双层优化:skill 作为 context function,inner/outer loop 分离 - Inner: c_s^* = argmax_c J_train(c_s; s) - Outer: s^* = argmax_s J_val(c_s^*) - Meta-Harness:harness 代码本身成为优化目标,Pareto frontier

复现可行性: 高。有 GitHub repo(Karpathy autoresearch),有具体方程和优化目标,有工具集列表


三、Microsoft 企业级 Agent 部署(ByteByteGo — 二次筛选通过)

🔥 KEEP — ByteByteGo「How Microsoft Ships AI Agents at Enterprise Scale」

  • 链接: https://blog.bytebytego.com/p/how-microsoft-ships-ai-agents-at
  • 信源: ByteByteGo · interview with Marco Casalaina(Microsoft Core AI VP)
  • 时间: 2026-07-14 ~ 07-20 期间发布

保留理由: ✅ 有真实生产数据、工程细节和架构图。

真实生产数据: - Microsoft Foundry:80,000+ 企业构建 AI 应用 - Microsoft 365 Copilot:20,000,000+ 用户 - 一线 agent 月活增长:6x(同比 YTD) - 支持 11,000+ 模型(OpenAI/Anthropic/xAI/DeepSeek/Microsoft MAI)

五层 Harness 架构(Production): 1. Inference Layer(模型抽象层,harness 独立于具体模型) 2. Agent Runtime(编排 loop、工具调用、对话状态) 3. Context Retrieval(上下文检索) 4. Identity Layer(身份控制 + audit trail) 5. Guardrails + Evaluators(护栏 + 评估)

关键工程洞察: - "Prototype 不出问题的地方,生产才出问题":数据过时、工具调用失败、edge cases、model update 行为漂移、identity 控制缺失 - Harness re-tuning 周期: 每个新模型发布需要重新调优 harness 并重新运行 evals(案例:Claude Opus 4.8 发布后 GitHub Copilot CLI 团队) - Agent runtime 原则: 不是所有步骤都过 LLM;数据库查询和专用提取模型比 LLM 更快、更便宜、更可靠

复现可行性: 中高。架构层级清晰,但具体配置参数未披露


四、向量数据库架构深度解析(Arjun Jaggi — 二次筛选通过)

🔥 KEEP — Arjun Jaggi「Vector Database Architecture: What It Is, What It Isn't, and When SQL Wins」

  • 链接: https://arjunvaggi.com/blog/vector-database-architecture
  • 发布时间: 2026-07-06
  • 标签: vector-db architecture pgvector HNSW SQL ANN

保留理由: ✅ 有算法级细节(HNSW 机制)、量化运营数据(ef 参数、内存规划)、选型决策树。

核心工程数据: - HNSW 搜索复杂度: O(log n)(vs O(n) 暴力搜索);百万向量 vs 暴力搜索:60,000x 加速 - ef 参数(exploration factor): 越高 recall 越高但速度越慢, tradeoff 由应用决定 - HNSW 索引构建: 百万向量需要小时级;全部索引常驻 RAM 以保证访问速度 - 内存计算: 100万 × 1536维 × float32 ≈ 6GB(仅原始向量)+ HNSW 图结构额外开销 - pgvector 2026 数据: 0.8.0 版本带来 5.7 倍查询性能提升;AWS 基准:1千万向量 filtered query 120ms → 70ms - 65% 生产 RAG 部署使用混合架构(向量搜索 + SQL 元数据过滤)

何时 SQL 胜出(pgvector): - 精确查找(B-tree O(log n)) - 事务性工作负载(ACID) - 多 predicate 精确过滤 - 成本敏感场景

何时专用向量数据库必要: - 亿级向量规模 - 亚毫秒查询延迟 - 原生多租户/实时更新

复现可行性: 高。算法机制、参数设置、成本计算框架均有明确数值


五、AI Agent 安全漏洞深度分析(arXiv/GitHub — 二次筛选通过)

🔥 KEEP — awesome-ai-agent-attacks:四个关键 CVE(2026-07-10 披露)

  • 链接: https://github.com/webpro255/awesome-ai-agent-attacks
  • 更新时间: 2026-07-13
  • 信源: Orca Security 2026 State of AI Security Report

真实漏洞数据: | CVE | 项目 | 漏洞类型 | 利用难度 | |-----|------|----------|----------| | CVE-2026-61447 | PraisonAI CodeAgent | LLM 生成 Python 无 AST 验证/sandbox 直接执行 RCE | 低 | | CVE-2026-54769 | Langroid | TableChatAgent VectorStore full_eval=True 沙箱逃逸 | 中 | | CVE-2026-57572 | Crawl4AI | Docker API 无认证 RCE | 低 | | CVE-2026-59726 | Ruflo | 未认证 MCP bridge,terminal_execute 授予 shell 权限 | 低(严重) |

统计背景数据(Orca Security): - 99.9% AI 相关漏洞告警有补丁但未修补 - 81.2% 公司运行含已知漏洞 AI 包 - 74.1% 含至少一个 CVE 关键漏洞 - 64% 运行向量数据库(RAG 用户平均 3.78 个向量库) - ~30% 以不安全方式存储 AI API 密钥

保留理由: ✅ 真实 CVE 数据,漏洞类型、利用难度、影响项目均明确。需对照 NVD 核验


六、RAG 量化综述(CSDN — 二次筛选通过)

🔥 KEEP — LLM 量化完整知识树(2026版)

  • 来源: blog.csdn.net/zhangfeng1133/article/details/161356265
  • 保留理由: ✅ PTQ/QAT/FP8/硬件支持/工具链体系完整,适合学习路径规划

🔥 KEEP — 边缘设备 LLM 量化实战

  • 来源: blog.csdn.net/weixin_43801219/article/details/160889991
  • 真实数据: 12 种量化策略组合,Llama-3-8B 压缩至 500MB 内存限制下运行;TensorRT-LLM 配置秘籍
  • 保留理由: ✅ 边缘部署前沿实践,量化策略数量和压缩目标明确

七、丢弃条目及理由

条目 来源 丢弃理由
Andrew Ng Agentic AI 课程精华 CSDN (Datawhale) ❌ 学习笔记性质,工程实践数据不足
AI Research Agents 与科研自动化 CSDN ❌ 研究视角,非工程实践内容
Agent 核心范式 4 阶演进 CSDN ❌ 时间线梳理,无工程量化数据
运维工程师转型 MLOps CSDN ❌ 职业转型视角,工程实践参考价值低
AI狂热削弱决策能力 Simon Willison ❌ 行业评论,无工程数据
Claude Fable 5 永久化 Simon Willison ❌ 产品发布公告,非工程内容
Cool Papers (cs.CL RSS) papers.cool ❌ 学术论文为主,工程实践相关性低
Import AI 462-464 Jack Clark ❌ 行业评论 newsletter,无具体工程数据
FDE 完整指南 2026 AiOps School ❌ 行业分析框架,无一手技术数据
The New Stack AI 工程技能集 ODSC ❌ 市场数据,非工程实践内容
RAG 最新进展 2024-2025 CSDN ⚠️ 综述性强,arXiv 引用多但工程细节少

汇总

分类 通过筛选数 高价值
推理框架核心机制 5 5
Harness 工程 1 1
Microsoft 企业级部署 1 1
向量数据库架构 1 1
AI Agent 安全漏洞 1 1
RAG 量化 2 2
合计 11 11

分类标签: inference-engine vLLM SGLang TensorRT-LLM LMDeploy Harness agent self-improvement context-engineering vector-db pgvector HNSW CVE RCE quantization AWQ GPTQ GGUF production reproducibility

建议写入路径: /shared/research-kb/inbox/jay/2026-07-20-1050-engineering-filter-round1-jul2026-inference-harness-vecdb.md


精读建议(按优先级)

  1. Lilian Weng Harness Engineering for Self-Improvement — Coding Agent 工具集完整列表(spawn_agent 等)、MCE 双层优化方程、Meta-Harness Pareto frontier,均有 GitHub repo 可复现
  2. LMDeploy vs vLLM vs SGLang benchmarkcache_max_entry_count=0.5 提升 23%、924 vs 1014 tokens/s 数据,可直接用于推理性能调优参考
  3. Qwen3 部署实战 — 完整 Python 代码 + HuggingFace 下载命令 + benchmark,可直接复现
  4. Arjun Jaggi Vector DB 架构 — HNSW ef 参数调优、内存计算(6GB/百万向量)、pgvector 0.8.0 5.7x 性能提升

主题页更新建议

  • 推理系统 2026 主题页:整合条目 1-5 + 条目 11
  • Agent Harness 工程 主题页:纳入 Lilian Weng 框架 + awesome-harness-engineering 列表
  • 向量数据库选型 主题页:纳入 Arjun Jaggi 决策树 + pgvector 0.8.0 数据