Jay 工程实践筛选 · 2026-07-29 下午版
筛选结论
本次保留 A级 4 条,B级 3 条,C级 4 条。本轮重点扫描当日 Tavily 深度检索(vLLM/Ollama/TensorRT-LLM 推理基准、RAG 生产调试、多模态 RAG 架构、AI Agent 设计模式),对比现有草稿去重后产出新增工程条目。
✅ 保留条目(A级)
A1|vLLM vs Ollama vs TensorRT-LLM 推理基准对比(July 2026)
来源:https://www.sitepoint.com/ollama-vs-vllm-performance-benchmark-2026
https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark
可信度:⭐⭐⭐⭐(SitePoint + Lyceum Tech,有具体命令和 benchmark 数据)
核心工程数据:
Ollama vs vLLM(并发对比): - 单流场景:Ollama Q4_K_M 量化版 Llama 3.1 8B ≈ 62 tok/s;vLLM FP16 ≈ 71 tok/s;vLLM AWQ ≈ 68 tok/s。差距约 13%,部分源于量化差异而非架构差距 - 50 并发用户:vLLM 吞吐量约为 Ollama 的 6 倍,vLLM p99 < 3s vs Ollama p99 = 24.7s - Ollama 优势:单用户、资源受限环境、llama.cpp 量化内核优化 - vLLM 优势:5+ 并发用户、高吞吐生产 API、PagedAttention + continuous batching - 工程结论:Ollama 适合开发/边缘;vLLM 适合高并发生产部署
vLLM vs TensorRT-LLM(H100 FP8 生产基准): - TensorRT-LLM 峰值 > 10,000 output tokens/s(H100 FP8) - TensorRT-LLM Time-To-First-Token(TTFT)sub-100ms - 生产部署吞吐量提升:PyTorch 原生实现对比 TensorRT-LLM 提升约 4 倍 - vLLM 优势:更多量化格式(GPTQ/AWQ/SqueezeLLM/bitsandbytes),无需重编译推理栈 - TensorRT-LLM 劣势:复杂部署配置,厂商绑定 - 工程结论:H100+ 高吞吐推理优先 TensorRT-LLM;需要快速迭代/多量化方案优先 vLLM
PagedAttention 内存机制(vLLM 2026): - KV cache 按 512-2048 token 块动态分配,模拟 OS 虚拟内存 - 消除内存碎片,VRAM 利用率达 95% - 配合 continuous batching(请求即时入批而非等待整批完成)
标签:推理工程 vLLM TensorRT-LLM Ollama PagedAttention 量化 并发基准
A2|RAG 生产调试:7 个失败点 + 融合基准数据(Zartis + Galileo 2026)
来源:https://www.zartis.com/rag-in-production-what-nobody-tells-you-until-youre-debugging-it
https://galileo.ai/blog/best-rag-debugging-tools
可信度:⭐⭐⭐⭐(Zartis 有真实生产数据,Galileo 是 RAG 评测平台)
核心工程内容:
生产 RAG 7 大失败点(Barnett et al. 2024 IEEE/ACM CAIN): 1. 检索到错误文档(40% 场景下 RAG 召回错误文档) 2. Chunk 大小/重叠配置不当 3. 向量检索 vs 关键词检索权衡 4. 权限过滤缺失(生产必选项,不是可选项) 5. RAG 添加 41% 延迟,无人预算 6. Reranking 预算固定后,RAG Fusion 收益消失 7. 幻觉内容在好上下文下仍出现
RAG Fusion 融合陷阱(March 2026 行业部署研究): - RAG Fusion(多查询生成 + 互惠排名融合)提高原始召回率 - 但生产环境中固定 retrieval depth + reranking 预算下,收益在 reranking + truncation 后大部分消失 - Fusion 在 benchmark 表现好,但在真实生产不优于单查询基线 - 工程警示:生产部署前测试,不要在 benchmark 上选择融合策略
RAG 延迟实测数据: - RAG pipeline 额外增加 41% 延迟(需计入 SLA 预算) - TTFT p90 应控制在 < 2s,否则 autoscaling 触发
RAG 调试工具链: - Braintrust(企业 AI eval,RAG trace 存储于 Brainstore) - Galileo(RAG 评测优先, Luna guardrails) - Arize(企业 ML 监控 + LLM 支持) - LangSmith(LangChain 追踪) - Langfuse(开源可自托管,prompt 管理) - Maxim AI(端到端 simulation + eval + 生产监控)
权限过滤是生产必选项: - 架构层面,而非后期补救 - "不要后期添加,后期就是从不"
标签:RAG 生产调试 失败模式 RAG Fusion 延迟基准 评测工具链
A3|Addy Osmani AI-Augmented 软件工程工作流 2026(Medium)
来源:https://medium.com/@addyosmani/my-llm-coding-workflow-going-into-2026-52fe1681325e
可信度:⭐⭐⭐⭐(Google 工程师,Addy Osmani 是 Web 性能领域知名作者)
核心工程内容:
AI-augmented vs AI-automated: - Osmani 明确拒绝"AI 自动化软件工程",坚持"AI 辅助工程 + 人类负责制" - 核心:AI 写代码,自动化工具 catch issues,AI 修复,repeat - 质量保证环:AI 生成 → 自动化测试捕获 → AI 修复(人类监督方向)
Specs before code: - 先写规格文档,再让 AI 生成代码 - 避免无测试/无自动化检查时让 AI 直接生成(subtle bugs 会渗透)
实践工作流组件: - 自动化测试(至少覆盖关键路径) - Lint + 类型检查(pylint/tsc/eslint) - CI gate 必须通过才能合并 - Prompt 版本控制(与代码同仓库) - Token 消耗监控(成本控制)
工程价值:不是技术突破,但是 Google 工程师的一手实践记录,可作为团队 AI 编码规范参考。
标签:AI辅助工程 开发流程 质量门禁 Prompt管理
A4|BigDataBoutique 多模态 RAG 2026 工程指南(三大架构对比)
来源:https://bigdataboutique.com/blog/multimodal-rag-retrieval-over-images-pdfs-and-text
可信度:⭐⭐⭐⭐(BigDataBoutique 是数据工程咨询公司,技术内容具体)
核心工程内容:
2026 三大多模态 RAG 架构:
| 架构 | 代表技术 | 适用场景 | Token 成本(1024×1024) |
|---|---|---|---|
| Caption-and-Index(最简) | BLIP + 文本嵌入 | 简单图文分离文档 | 低 |
| Unified Vision Embeddings | Cohere Embed 4 / voyage-multimodal-3 | 统一语义空间 | 中 |
| Page-as-Image + Late Interaction | ColPali / ColQwen2.5 / ColNomic | 复杂 PDF/表格/图表 | 高但最精准 |
Page-as-Image 架构 token 成本实测: - Claude 4:~1,600 tokens/图像 - Gemini:~1,300 tokens/图像 - GPT-4o:~765 tokens/图像 - 传入 5 页图像:额外 4K-8K+ tokens(不含 system prompt)
文本 RAG 的硬上限: - 图 heavy 语料库中,文本 RAG 有无法通过 chunk 策略修复的信号丢失 - 图表/表格/布局信息永远无法从 OCR 文本中完全恢复
多模态 RAG 核心挑战: - Cross-modal alignment errors(跨模态对齐错误) - 计算成本(vision LLM 调用成本高) - 数据质量依赖 - 缺乏标准化评估指标
标签:多模态RAG ColPali 视觉嵌入 PDF解析 架构选型 成本估算
✅ 保留条目(B级)
B1|The 7 AI Agent 设计模式 2026(Towards AI Substack)
来源:https://pub.towardsai.net/the-7-design-patterns-every-ai-agent-developer-should-know-in-2026-c77f28b51565
可信度:⭐⭐⭐⭐(Towards AI 是知名 AI 媒体,本文引用 LangChain 2026 State 报告数据)
核心工程数据: - Plan-and-Execute:将思考分为 planner(生成完整多步 plan)和 executor(顺序执行)两个阶段,减少推理漂移,支持独立步骤并行 - Tool Use:32% 的 AI 从业者认为输出质量是 Agent 生产部署的头号阻碍(LangChain 2026) - Memory Management:多数开发者过早跳过(需分层:short-term context + long-term vector store) - Multi-Agent Collaboration:Supervisor + Specialist agents 协作模式 - Interoperability:不同框架的 Agent 调用不同 API,schema 各异——这是生产中最大可靠性风险
关键引用数据(LangChain State of AI Agent Engineering Report 2026): - 32% practitioners:output quality 是头号部署障碍 - 20%:latency 是显著挑战 - Plan-and-Execute 直接解决输出质量问题
标签:Agent设计模式 Plan-and-Execute Multi-Agent LangChain2026报告
B2|Production RAG 2026 架构模式(Agile Infoways)
来源:https://www.agileinfoways.com/blog/building-production-ready-rag-systems-2026
可信度:⭐⭐⭐(Agile Infoways 是印度 IT 咨询公司,文章偏架构概述)
有价值内容: - 多模态 RAG 从研究进入生产(图像/图表/表格/技术文档检索) - Native graph + vector 混合数据库(Neo4j + vector / ApertureDB)成为高度关联知识默认选项 - Eval-first development 替代 prompt-first development(先设评估再写 prompt) - Long-context(1M+ token)减少但不能消除 RAG——超过几百页的语料库 RAG 仍更便宜/更快/更可控 - 生产 RAG 检查清单(原文列出 4 项必须项,跳过任意一项即非生产就绪): 1. 混合检索(向量 + 关键词) 2. 重排层 3. 完整可观测性 4. 99.9% SLA
标签:RAG架构 多模态RAG Eval-first GraphRAG 生产检查清单
B3|LangChain Java/Python AI 生产对比(Substack)
来源:https://substack.com/home/post/p-186623936
可信度:⭐⭐⭐(Java 生态深度文章,有量化数据)
有价值工程数据: - Semantic Caching 在 Java 编排层实现 60-80% LLM 运营成本降低(具体数字) - GraphRAG + hybrid search 多跳推理准确率 85-95%(相比纯向量搜索) - Spring AI 和 LangChain4j(Java)已到达 production-ready 状态(late 2025 milestone) - Jlama:100% Java Large/Small LLM 实现,CPU 优先 + GraalVM native 编译(无 GPU 环境可用) - LangChain4j 支持 20+ LLM providers 和 30+ embedding stores
标签:Java AI SpringAI LangChain4j SemanticCaching GraphRAG 成本优化
❌ 丢弃条目(C级)
C1|Enterprise LLM Deployment 2026 指南(SitePoint)⭐⭐
丢弃原因:Overview 性质,无新数据,内容已被 vLLM 官方博客和 AppScale Guide 覆盖。
C2|Complete Guide to Production LLM Systems 2026(AppScale Blog)⭐⭐
丢弃原因:47 分钟阅读量但内容是综合概述,引用来自网络搜索 snippet,无原创工程数据。
C3|Building LLMs in Production 2026(Future AGI)⭐⭐
丢弃原因:HIPAA/Finance 行业概述为主,框架性内容而非工程数据。
C4|AI Engineer Roadmap 2026(dataskew.io)⭐⭐
丢弃原因:路线图文章,非一手工程内容;与 Substack 版 AI Engineer Roadmap 内容重复。
后续行动建议
| 优先级 | 行动 | 对应条目 |
|---|---|---|
| P1 | 整理 vLLM vs Ollama vs TensorRT-LLM 推理选型决策树 | A1 |
| P1 | 追踪 ColPali/ColQwen2.5 多模态 RAG 在生产中的实际 token 成本数据 | A4 |
| P2 | 对照 Barnett et al. RAG 7 failure points,补充 vLLM Blog / SGLang 官方文档 | A2 |
| P2 | 收集 LangChain 2026 State of AI Agent Engineering Report 原文 | B1 |
| P3 | 评估 Semantic Caching Java 实现(Spring AI)对现有架构的借鉴价值 | B3 |
分类标签汇总
推理工程 vLLM TensorRT-LLM Ollama PagedAttention RAG 多模态RAG ColPali Agent设计模式 RAG Fusion 延迟基准 成本优化 量化 并发基准 评测工具链 AI辅助工程
建议写入路径
/shared/research-kb/inbox/jay/2026-07-29-1455-jay-engineering-filter.md
是否需要精读
A1 和 A2 建议精读(有具体数字/代码/命令);B1/B3 可作参考;A4 建议扫读架构部分。
元信息
- 本次检索工具:Tavily Search(多 query 并行)
- 本次检索时间:2026-07-29 14:50 UTC
- 本次覆盖来源:SitePoint, Lyceum Technology, Zartis, Galileo AI, Medium (Addy Osmani), Towards AI Substack, BigDataBoutique, Agile Infoways, Substack
- 与现有草稿重叠:vLLM 2026 版已在 2026-07-28/29 多个草稿中提及,本次提炼了新数字(6x 并发对比、P99 延迟对比表)