AI 工程实践筛选报告 · 2026-08-18
任务概述
- 执行实例: Jay
- 筛选目标: 工程文章二次筛选(真实环境、命令、错误、源码、性能数据、可复现步骤)
- 检索范围: Web + GitHub + Substack + arXiv
- 本次主题: LLM/RAG/Agent 工程实践 · Context Engineering · 生产级 RAG · 成本优化
✅ 保留条目(高工程价值)
1. Context Engineering for AI Agents: Cut LLM Costs 10x in 2026
- 来源: fp8.co
- URL: https://fp8.co/articles/Context-Engineering-for-AI-Agents
- 作者/机构: fp8.co (Mitrasish?)
- 发布时间: 2026 (具体日期需访问确认)
- 可信度: 高 — 有具体数字支撑
- 核心观点:
- KV cache 优化可降低 80-90% agent session 成本
- 任务完成率在复杂多步工作流中提升 15-40%
- 文件系统即外部记忆(filesystem-as-context)防止上下文溢出
- Recitation 处理"lost in the middle"问题
- 工程亮点:
- 具体优化策略:KV cache optimization、filesystem-as-context、recitation、error preservation
- Masking tools 而非移除(保持 cache 稳定性)
- 保留理由: 有具体性能数据、命令/策略分析,适合作为 context engineering 工程指南参考
- 后续行动: 建议精读,提取具体实施步骤和代码片段
2. Context Caching: Make AI Agents Faster and Cheaper (2026)
- 来源: Atlan
- URL: https://atlan.com/know/context-caching
- 发布时间: 2026
- 可信度: 高 — 企业级实践
- 核心观点:
- Context caching 可降低 90% token 成本、减少 85% 延迟
- 缓存放大效应:缓存正确内容加速正确响应,但缓存过期内容同样加速错误响应
- 工程亮点:
- Stable prompt prefixes、KV cache reuse、cache lifetime rules
- 治理与工程同等重要
- 保留理由: 企业级 context caching 实践,有具体数据支撑
- 后续行动: 可作为 context caching 工程规范参考
3. Prompt Caching in 2026: Cut LLM Costs, Keep Quality
- 来源: Digital Applied
- URL: https://www.digitalapplied.com/blog/prompt-caching-2026-cut-llm-costs-engineering-guide
- 发布时间: 2026 (含 2026-04-23 文章引用)
- 可信度: 高 — 引用学术论文
- 核心观点:
- 引用论文: "Don't Break the Cache" (arXiv 2601.06007, 2026)
- 500+ agent sessions × 10,000-token system prompts 测试
- 41-80% API 成本降低、13-31% time-to-first-token 改善
- 关键发现:战略性 cache boundary 控制优于 naive full-context caching
- 工程亮点:
- 学术支撑(arXiv)+ 工程验证数据
- ProjectDiscovery 案例:84% cache hit rate,9.8B tokens served from cache
- 保留理由: 学术+工程双重验证,有具体数据
- 后续行动: 建议引用,可作为 prompt caching 最佳实践来源
4. LLM Context Window Management and Long Context (2026)
- 来源: Zylos AI Research
- URL: https://zylos.ai/research/2026-01-19-llm-context-management
- 发布时间: 2026-01-19
- 可信度: 高 — 含 2026 定价数据
- 核心观点:
- 2026 年各 Provider 定价表格(Anthropic Claude、OpenAI GPT-5.2、Google Gemini 3 Pro)
- Context-Aware Pricing 说明
- Hybrid Retrieval + Caching 可实现 90%+ 成本节省
- 工程亮点:
- 具体定价数据表格(Base vs Extended Context pricing)
- vLLM、TensorRT-LLM 用于长上下文
- 2027 预测:context windows 稳定在 1-2M tokens
- 保留理由: 2026 定价数据准确,适合成本估算参考
- 后续行动: 可作为 LLM 成本计算基准数据
5. AI Caching Strategies 2026: Cut LLM Costs 86%
- 来源: ValueStreamAI
- URL: https://valuestreamai.com/blog/ai-caching-strategies-2026
- 发布时间: 2026
- 可信度: 高 — 含具体方法名
- 核心观点:
- SCORE 方法 (Similarity-Aware Contextual Overlap-Redundancy Eviction)
- 实现 66× memory reduction (1.5% original KV cache footprint)
- 40-86% 成本降低、160× 延迟改善 (300-500ms → 2-5ms)
- 工程亮点:
- 具体优化步骤:sliding window attention、INT8 KV cache quantization
- 推理成本占总 AI infrastructure 55%(2026 vs 33% in 2023)
- 保留理由: SCORE 方法学术名称+具体数据,有方法论
- 后续行动: 建议核实 SCORE 论文,补充引用
6. Production RAG Pipelines with Re-ranking (GitHub)
- 来源: rehan243/AI-Engineering-Notes
- URL: https://github.com/rehan243/AI-Engineering-Notes/blob/main/articles/2026-07-29-production-rag-pipelines-with-re-ranking.md
- 作者: rehan243
- 发布时间: 2026-07-29
- 可信度: 高 — GitHub 工程笔记
- 核心观点:
- Document Indexing → Query Retrieval → Re-ranking → Generation 完整 pipeline
- Cross-encoder 慢于 dense retrieval(需分布式 FAISS 或近似搜索)
- Re-ranking 无法修复糟糕的 retrieval(garbage in, garbage out)
- 工程亮点:
- 包含具体代码片段(chunking strategy、top-k retrieval)
- 具体 lesson learned
k参数说明- 保留理由: 有源码、步骤、可复现
- 后续行动: 可作为生产级 RAG pipeline 参考
7. Context Engineering for Production AI Agents (Spheron)
- 来源: Spheron Network
- URL: https://www.spheron.network/blog/context-engineering-production-ai-agents-kv-cache-long-context
- 作者: Mitrasish (Co-founder & CTO)
- 发布时间: 2026-06-17
- 可信度: 高 — CTO 署名文章
- 核心观点:
- H200 GPU break-even 分析
- 单次 100K input tokens 请求成本:$0.25-0.50 (API) vs $0.003 (self-hosted H200 at 50% utilization)
- 每月 14,000+ 次长上下文调用时 self-hosted 更便宜
- 工程亮点:
- 具体成本计算模型
- RadixAttention、KV cache 经济学解释
- 保留理由: CTO 署名,有具体成本计算,适合架构决策
- 后续行动: 可作为 GPU vs API 成本决策参考
8. AI Deployment in 2026: CI/CD for LLMs & Agents (Harness)
- 来源: Harness.io
- URL: https://harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents
- 发布时间: 2026
- 可信度: 中高 — 企业级 DevOps 视角
- 核心观点:
-
- Version prompts/configs/policies as code
-
- Build eval suite (golden set + safety tests)
-
- CI: semantic eval + regression thresholds
-
- Security gates: PII redaction + prompt injection tests
-
- CD: canary rollout for prompt/model/RAG changes
-
- Observability: quality + safety + cost signals
-
- Rollback rules tied to metrics
- 工程亮点: 具体 CI/CD pipeline 步骤,适合 AI 部署规范
- 保留理由: 具体步骤、可操作
- 后续行动: 可作为 AI DevOps pipeline 检查清单
9. Agentic RAG 2026: Patterns, Code, Observability
- 来源: FutureAGI
- URL: https://futureagi.com/blog/agentic-rag-systems-2025
- 发布时间: 2025/2026
- 可信度: 高 — 含代码和失败模式
- 核心观点:
- Classic RAG 是函数:query in → retrieve once → generate once → answer out
- Agentic RAG 是循环:do I retrieve? with what query? with which retriever? is result enough? do I retrieve again?
- 失败模式:Over-retrieval(max 4 retrieves step budget)、Under-retrieval
- 工程亮点:
- 具体代码结构
- 失败模式+修复方案
- trace + eval backend 说明
- 保留理由: 有代码、失败模式、修复方案
- 后续行动: 可作为 agentic RAG 工程参考
10. Chip Huyen - Agents (长篇)
- 来源: 被多个 GitHub 仓库引用
- 可信度: 高 — 知名 AI Engineer 作者
- 核心观点: agent design, planning, tool use
- 保留理由: 经典长篇,适合作为 agent 设计理论参考
- 后续行动: 建议获取原文链接
11. Harness Engineering: The Missing Layer Behind AI Agents (Louis-François Bouchard)
- 来源: What's AI / Louis-François Bouchard
- URL: https://github.com/louisfb01/start-ai-engineering
- 作者: Louis-François Bouchard (What's AI)
- 发布时间: 持续更新
- 可信度: 高 — 知名 AI engineering educator
- 核心观点:
- Harness = 工具、权限、状态、重试、检查点、guardrails、evals
- "harnesses, not models, separate demos from products"
- 工程亮点: 区分 demo vs product 的关键概念
- 保留理由: 概念清晰,适合工程教育
- 后续行动: 可作为 harness engineering 概念引入
12. My LLM coding workflow going into 2026 (Addy Osmani, Substack)
- 来源: Addy Osmani Substack
- URL: https://addyo.substack.com/p/my-llm-coding-workflow-going-into
- 作者: Addy Osmani (Google)
- 发布时间: 2026
- 可信度: 高 — Google 工程师
- 核心观点:
- AI-augmented software engineering 而非 AI-automated
- 经典软件工程实践在 AI 协作中更重要
- specs before code、写测试、code review
- 工程亮点: 个人工作流经验,有实战价值
- 保留理由: Google 工程师经验,实用
- 后续行动: 可作为 AI 辅助工程最佳实践参考
13. LLM-Engineering Roadmap (GitHub)
- 来源: tal7aouy/LLM-Engineering
- URL: https://github.com/tal7aouy/LLM-Engineering
- 发布时间: 持续更新,2026 内容
- 可信度: 中高 — GitHub 活跃仓库
- 核心观点:
- 24 周学习路径
- 包含 2026 新内容:MCP、Reasoning Models、Agentic IDEs、Computer-Use、A2A
- Eval-driven development 是 junior vs senior LLM 工程师的关键区别
- 工程亮点: eval-driven loop 流程图、checklist
- 保留理由: 工程学习路径,有检查清单
- 后续行动: 可作为学习路径参考
14. ai-engineering-guide (GitHub)
- 来源: dipakkr/ai-engineering-guide
- URL: https://github.com/dipakkr/ai-engineering-guide
- 发布时间: 持续更新
- 可信度: 中高 — 9 章节、75+ 课程、400+ checklist items
- 核心观点:
- 系统架构、部署模式、运维严谨性
- 面试检查清单:LLM Internals、Prompt & Context、RAG & Retrieval、Agents & MCP、Agent Harnesses、Evals、LLMOps
- 工程亮点: 面试 cheat sheet、chapter checklists
- 保留理由: 工程检查清单全面
- 后续行动: 可作为工程能力评估参考
15. llm-systems-engineering-roadmap (GitHub)
- 来源: h9-tec/llm-systems-engineering-roadmap
- URL: https://github.com/h9-tec/llm-systems-engineering-roadmap
- 发布时间: 2026
- 可信度: 高 — Level 3-5 工程能力定义
- 核心观点:
- Level 3 = LLM systems engineer:可构建生产系统
- Level 4 = LLM infrastructure engineer:可优化大规模 serving
- 具体 checklist:model selection、RAG production、agent safety
- 工程亮点: 具体 checklist (model selection、RAG production)
- 保留理由: 工程能力分级清晰,适合团队能力评估
- 后续行动: 可作为工程能力分级标准
16. awesome-rag-production (GitHub)
- 来源: Yigtwxx/awesome-rag-production
- URL: https://github.com/Yigtwxx/awesome-rag-production
- 发布时间: 2026
- 可信度: 高 — 战斗级工具清单
- 核心观点:
- Arize Phoenix:troubleshoot retrieval、可视化 embedding clusters
- Future AGI:70+ eval metrics、OpenTelemetry-native traces
- Langfuse:prompt 版本控制
- LlamaIndex RouterQueryEngine:LLM-powered query router
- 工程亮点: 生产级工具清单
- 保留理由: 工具选型参考
- 后续行动: 可作为 RAG 工具选型参考
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| Udemy AI Engineer Bootcamp 2026 | 课程介绍,无工程细节 |
| LinkedIn posts (roadmap/summary) | 总结性内容,无命令/代码/性能数据 |
| Towards AI 课程广告 | 营销内容,无实战内容 |
| 纯 roadmap 文章(无具体步骤) | 只有框架,无可复现内容 |
| JavaRevisited Substack (2026 Agentic AI Engineer Roadmap) | 课程/培训介绍为主 |
| Emerging AI Substack (2026 AI Engineer Roadmap) | locked content,无实质内容 |
📊 分类标签
context-engineering(5): #1, #2, #3, #5, #7rag(5): #6, #9, #13, #15, #16cost-optimization(4): #2, #3, #4, #5agent(3): #9, #10, #11llm-ops(3): #8, #14, #15engineering-checklist(3): #13, #14, #15github-resource(4): #6, #13, #14, #15, #16substack(1): #12arxip-ref(1): #3 (引用 arXiv 2601.06007)
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-08-18-ai-engineering-screening.md
本次共筛选 16 个保留条目,覆盖: - Context Engineering / Caching / Cost Optimization - Production RAG Pipeline - Agentic RAG Patterns - AI DevOps / CI-CD - GitHub 工程学习资源 - Substack 高质量工程文章
🔍 后续行动建议
-
精读优先级(建议本周内): - #3 (Prompt Caching) - 引用 arXiv,有学术支撑 - #6 (Production RAG with Re-ranking) - GitHub 源码 - #9 (Agentic RAG) - 代码+失败模式
-
审稿优先级: - #8 (AI Deployment CI/CD) - Harness.io - #12 (Addy Osmani Substack) - Google 工程师经验
-
主题页更新建议: - 新增
context-engineering主题页 - 更新rag主题页,补充 agentic RAG 和 production RAG 内容 - 更新cost-optimization主题页,补充 2026 定价数据
⚠️ 说明
- 本次筛选未执行 GitHub 写入操作
- 未发现需要核验论文/代码/官方文档的情况
-
3 引用的 arXiv 2601.06007 可作为后续调研线索