工程实践二次筛选 · Jay · 2026-07-20 10:50 (Asia/Shanghai)
本次主题: 推理系统核心机制 · Harness 工程 · 向量数据库架构 · Agent 安全漏洞 检索范围: CSDN · GitHub · Lilian Weng (Substack) · ByteByteGo · Arjun Jaggi Blog · Substack RSS
一、推理框架核心机制(CSDN 高价值 — 二次筛选通过)
🔥 KEEP — 条目1:Efficient LLM Inference 五大优化方向系统梳理
- 来源:
blog.csdn.net/weixin_44369324/article/details/162635526 - 时间: 2025-2026
保留理由: ✅ 真实工程内容。 - PagedAttention(vLLM): 显存利用率 3-5 倍提升,类 OS 分页管理 KV cache - RadixAttention(SGLang): 前缀复用,结构化 prompt,吞吐量超 vLLM 5 倍 - KV Cache Disaggregation: DistServe/Splitwise/Mooncake,prefill/decode 分离 - Speculative Decoding: Medusa/EAGLE-3/TensorRT-LLM,串行 decode → draft-and-verify - 量化路线: FP8 全面普及(H100/H200/B200),KIVI 2-bit,QServe W4A8KV4,TensorRT-LLM NVFP4 KV cache - 涉及版本:vLLM 0.6+、SGLang 0.3+、TensorRT-LLM FP8、FlashAttention-3 - 复现可行性: 高。版本号精确,框架名称具体,技术路径清晰
🔥 KEEP — 条目2:推理框架横评(vLLM / TGI / TensorRT-LLM / SGLang)
- 来源:
blog.csdn.net/weixin_37647148/article/details/161914538 - 时间: 2026年6月
保留理由: ✅ 工程定位明确,版本数据具体。 - vLLM:生态最完整,PagedAttention + Continuous Batching 成熟 - SGLang:RadixAttention 多轮对话复用,2026 增长曲线超 vLLM - TensorRT-LLM:FP8 吞吐量达 H100 峰值,延迟最低 - LMDeploy(国产):TurboMind + 4-bit 量化,RTX 4090 单卡 1.8 倍加速,60% 显存降低 - SGLang 0.4.3(2025年2月)支持 DeepSeek-R1/V3 Multi-token 预测 - 复现可行性: 高。版本号、硬件平台、加速比均有标注
🔥 KEEP — 条目3:LMDeploy vs vLLM vs SGLang 性能差异(实测数据)
- 来源:
blog.csdn.net/qq_40999403/article/details/151405198 - 时间: 2025年9月(持续更新)
保留理由: ✅ 含真实命令级参数和 benchmark 数据。
- 实测数据:
- vLLM 并发 40 达峰值 924 tokens/s
- SGLang 50 并发时达 1014 tokens/s
- 参数调优:
- cache_max_entry_count=0.5 比默认 0.3 提升 23% 吞吐量
- 长文本场景 block_size 建议 64→128,减少内存碎片
- 复现可行性: 高。并发数、tokens/s 数值、配置参数均明确
🔥 KEEP — 条目4:Prefill/Decode 分离架构(DistServe/Splitwise/Mooncake)
- 来源:
blog.csdn.net/w776341482/article/details/162718932 - 核心: DistServe 明确提出 prefill/decode 分离到不同 GPU 池;Splitwise/Mooncake/TensorRT-LLM/vLLM 均支持 disaggregated serving
- 保留理由: ✅ 架构选型具体,跨框架对比有工程参考价值
🔥 KEEP — 条目5:Qwen3 部署实战(vLLM/SGLang 完整代码)
- 来源:
blog.csdn.net/m0_55303420/article/details/147688863 - 真实数据:
- vLLM 并发 40:924.52 tokens/s(峰值);50 并发:917.30 tokens/s
- SGLang 在 1-50 并发范围性能持续上升,50 并发:1014.74 tokens/s
- 含完整 Python 部署代码和 HuggingFace 模型下载命令
- 保留理由: ✅ 实测 benchmark 数据 + 可复现命令
🔥 KEEP — 条目11:GPTQ/AWQ/GGUF 量化综述(2026 更新)
- 来源:
blog.csdn.net/lijinze2/article/details/162545512 - 保留理由: ✅ 后训练量化三大主流方案对比 + 2026 新趋势(FP8 普及、KV cache 量化)
二、Harness 工程系统性深度分析(Lilian Weng — 二次筛选通过)
🔥 KEEP — Lilian Weng「Harness Engineering for Self-Improvement」
- 链接: https://lilianweng.github.io/posts/2026-07-04-harness/
- 发布时间: 2026-07-04
- 标签:
harnessagentself-improvementcontext-engineeringscaffolding
保留理由: ✅ 工程内容极其丰富,有代码、有框架、有量化数据。
核心工程 Pattern(均有源码级细节):
-
Pattern 1: Workflow Automation(Karpathy autoresearch) - goal-oriented loop:plan → execute → observe/test → improve → loop - 引用 Karpathy autoresearch GitHub repo:
https://github.com/karpathy/autoresearch- Codex agent loop 有具体图示(OpenAI 官方博文) -
Pattern 2: File System as Persistent Memory - 长程 agent 系统持久化状态的核心模式 - 实验日志、代码 diff、错误堆栈、历史轨迹均以文件存储
-
Pattern 3: Sub-agent and Backend Jobs - 并行化必须显式可检查(explicit and inspectable) - parent agent 需要 process manager:launch jobs、inspect logs、cancel failed runs、merge results
Case Study — Coding Agent Harness 工具集(有完整工具列表):
File system: glob, grep, ls, read, read_many, write, edit, multi_edit, apply_patch
Shell execution: bash, PowerShell
IO: lsp, git_status, git_diff, git_commit
External context: MCP tools, Skills
Web search: web_search, web_fetch, browser tools
Backend processes: CronCreate, CronDelete, CronList
Agent delegation: spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent
ACE(Agentic Context Engineering)与 MCE(Meta Context Engineering):
- ACE:⟨identifier, description⟩ structured bullets,防止 context collapse 和 brevity bias
- MCE 双层优化:skill 作为 context function,inner/outer loop 分离
- Inner: c_s^* = argmax_c J_train(c_s; s)
- Outer: s^* = argmax_s J_val(c_s^*)
- Meta-Harness:harness 代码本身成为优化目标,Pareto frontier
复现可行性: 高。有 GitHub repo(Karpathy autoresearch),有具体方程和优化目标,有工具集列表
三、Microsoft 企业级 Agent 部署(ByteByteGo — 二次筛选通过)
🔥 KEEP — ByteByteGo「How Microsoft Ships AI Agents at Enterprise Scale」
- 链接: https://blog.bytebytego.com/p/how-microsoft-ships-ai-agents-at
- 信源: ByteByteGo · interview with Marco Casalaina(Microsoft Core AI VP)
- 时间: 2026-07-14 ~ 07-20 期间发布
保留理由: ✅ 有真实生产数据、工程细节和架构图。
真实生产数据: - Microsoft Foundry:80,000+ 企业构建 AI 应用 - Microsoft 365 Copilot:20,000,000+ 用户 - 一线 agent 月活增长:6x(同比 YTD) - 支持 11,000+ 模型(OpenAI/Anthropic/xAI/DeepSeek/Microsoft MAI)
五层 Harness 架构(Production): 1. Inference Layer(模型抽象层,harness 独立于具体模型) 2. Agent Runtime(编排 loop、工具调用、对话状态) 3. Context Retrieval(上下文检索) 4. Identity Layer(身份控制 + audit trail) 5. Guardrails + Evaluators(护栏 + 评估)
关键工程洞察: - "Prototype 不出问题的地方,生产才出问题":数据过时、工具调用失败、edge cases、model update 行为漂移、identity 控制缺失 - Harness re-tuning 周期: 每个新模型发布需要重新调优 harness 并重新运行 evals(案例:Claude Opus 4.8 发布后 GitHub Copilot CLI 团队) - Agent runtime 原则: 不是所有步骤都过 LLM;数据库查询和专用提取模型比 LLM 更快、更便宜、更可靠
复现可行性: 中高。架构层级清晰,但具体配置参数未披露
四、向量数据库架构深度解析(Arjun Jaggi — 二次筛选通过)
🔥 KEEP — Arjun Jaggi「Vector Database Architecture: What It Is, What It Isn't, and When SQL Wins」
- 链接: https://arjunvaggi.com/blog/vector-database-architecture
- 发布时间: 2026-07-06
- 标签:
vector-dbarchitecturepgvectorHNSWSQLANN
保留理由: ✅ 有算法级细节(HNSW 机制)、量化运营数据(ef 参数、内存规划)、选型决策树。
核心工程数据: - HNSW 搜索复杂度: O(log n)(vs O(n) 暴力搜索);百万向量 vs 暴力搜索:60,000x 加速 - ef 参数(exploration factor): 越高 recall 越高但速度越慢, tradeoff 由应用决定 - HNSW 索引构建: 百万向量需要小时级;全部索引常驻 RAM 以保证访问速度 - 内存计算: 100万 × 1536维 × float32 ≈ 6GB(仅原始向量)+ HNSW 图结构额外开销 - pgvector 2026 数据: 0.8.0 版本带来 5.7 倍查询性能提升;AWS 基准:1千万向量 filtered query 120ms → 70ms - 65% 生产 RAG 部署使用混合架构(向量搜索 + SQL 元数据过滤)
何时 SQL 胜出(pgvector): - 精确查找(B-tree O(log n)) - 事务性工作负载(ACID) - 多 predicate 精确过滤 - 成本敏感场景
何时专用向量数据库必要: - 亿级向量规模 - 亚毫秒查询延迟 - 原生多租户/实时更新
复现可行性: 高。算法机制、参数设置、成本计算框架均有明确数值
五、AI Agent 安全漏洞深度分析(arXiv/GitHub — 二次筛选通过)
🔥 KEEP — awesome-ai-agent-attacks:四个关键 CVE(2026-07-10 披露)
- 链接: https://github.com/webpro255/awesome-ai-agent-attacks
- 更新时间: 2026-07-13
- 信源: Orca Security 2026 State of AI Security Report
真实漏洞数据: | CVE | 项目 | 漏洞类型 | 利用难度 | |-----|------|----------|----------| | CVE-2026-61447 | PraisonAI CodeAgent | LLM 生成 Python 无 AST 验证/sandbox 直接执行 RCE | 低 | | CVE-2026-54769 | Langroid | TableChatAgent VectorStore full_eval=True 沙箱逃逸 | 中 | | CVE-2026-57572 | Crawl4AI | Docker API 无认证 RCE | 低 | | CVE-2026-59726 | Ruflo | 未认证 MCP bridge,terminal_execute 授予 shell 权限 | 低(严重) |
统计背景数据(Orca Security): - 99.9% AI 相关漏洞告警有补丁但未修补 - 81.2% 公司运行含已知漏洞 AI 包 - 74.1% 含至少一个 CVE 关键漏洞 - 64% 运行向量数据库(RAG 用户平均 3.78 个向量库) - ~30% 以不安全方式存储 AI API 密钥
保留理由: ✅ 真实 CVE 数据,漏洞类型、利用难度、影响项目均明确。需对照 NVD 核验
六、RAG 量化综述(CSDN — 二次筛选通过)
🔥 KEEP — LLM 量化完整知识树(2026版)
- 来源:
blog.csdn.net/zhangfeng1133/article/details/161356265 - 保留理由: ✅ PTQ/QAT/FP8/硬件支持/工具链体系完整,适合学习路径规划
🔥 KEEP — 边缘设备 LLM 量化实战
- 来源:
blog.csdn.net/weixin_43801219/article/details/160889991 - 真实数据: 12 种量化策略组合,Llama-3-8B 压缩至 500MB 内存限制下运行;TensorRT-LLM 配置秘籍
- 保留理由: ✅ 边缘部署前沿实践,量化策略数量和压缩目标明确
七、丢弃条目及理由
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| Andrew Ng Agentic AI 课程精华 | CSDN (Datawhale) | ❌ 学习笔记性质,工程实践数据不足 |
| AI Research Agents 与科研自动化 | CSDN | ❌ 研究视角,非工程实践内容 |
| Agent 核心范式 4 阶演进 | CSDN | ❌ 时间线梳理,无工程量化数据 |
| 运维工程师转型 MLOps | CSDN | ❌ 职业转型视角,工程实践参考价值低 |
| AI狂热削弱决策能力 | Simon Willison | ❌ 行业评论,无工程数据 |
| Claude Fable 5 永久化 | Simon Willison | ❌ 产品发布公告,非工程内容 |
| Cool Papers (cs.CL RSS) | papers.cool | ❌ 学术论文为主,工程实践相关性低 |
| Import AI 462-464 | Jack Clark | ❌ 行业评论 newsletter,无具体工程数据 |
| FDE 完整指南 2026 | AiOps School | ❌ 行业分析框架,无一手技术数据 |
| The New Stack AI 工程技能集 | ODSC | ❌ 市场数据,非工程实践内容 |
| RAG 最新进展 2024-2025 | CSDN | ⚠️ 综述性强,arXiv 引用多但工程细节少 |
汇总
| 分类 | 通过筛选数 | 高价值 |
|---|---|---|
| 推理框架核心机制 | 5 | 5 |
| Harness 工程 | 1 | 1 |
| Microsoft 企业级部署 | 1 | 1 |
| 向量数据库架构 | 1 | 1 |
| AI Agent 安全漏洞 | 1 | 1 |
| RAG 量化 | 2 | 2 |
| 合计 | 11 | 11 |
分类标签: inference-engine vLLM SGLang TensorRT-LLM LMDeploy Harness agent self-improvement context-engineering vector-db pgvector HNSW CVE RCE quantization AWQ GPTQ GGUF production reproducibility
建议写入路径: /shared/research-kb/inbox/jay/2026-07-20-1050-engineering-filter-round1-jul2026-inference-harness-vecdb.md
精读建议(按优先级)
- Lilian Weng Harness Engineering for Self-Improvement — Coding Agent 工具集完整列表(spawn_agent 等)、MCE 双层优化方程、Meta-Harness Pareto frontier,均有 GitHub repo 可复现
- LMDeploy vs vLLM vs SGLang benchmark —
cache_max_entry_count=0.5提升 23%、924 vs 1014 tokens/s 数据,可直接用于推理性能调优参考 - Qwen3 部署实战 — 完整 Python 代码 + HuggingFace 下载命令 + benchmark,可直接复现
- Arjun Jaggi Vector DB 架构 — HNSW ef 参数调优、内存计算(6GB/百万向量)、pgvector 0.8.0 5.7x 性能提升
主题页更新建议
- 推理系统 2026 主题页:整合条目 1-5 + 条目 11
- Agent Harness 工程 主题页:纳入 Lilian Weng 框架 + awesome-harness-engineering 列表
- 向量数据库选型 主题页:纳入 Arjun Jaggi 决策树 + pgvector 0.8.0 数据