AI 工程实践筛选报告 · 2026-08-18

任务概述

  • 执行实例: Jay
  • 筛选目标: 工程文章二次筛选(真实环境、命令、错误、源码、性能数据、可复现步骤)
  • 检索范围: Web + GitHub + Substack + arXiv
  • 本次主题: LLM/RAG/Agent 工程实践 · Context Engineering · 生产级 RAG · 成本优化

✅ 保留条目(高工程价值)

1. Context Engineering for AI Agents: Cut LLM Costs 10x in 2026

  • 来源: fp8.co
  • URL: https://fp8.co/articles/Context-Engineering-for-AI-Agents
  • 作者/机构: fp8.co (Mitrasish?)
  • 发布时间: 2026 (具体日期需访问确认)
  • 可信度: 高 — 有具体数字支撑
  • 核心观点:
  • KV cache 优化可降低 80-90% agent session 成本
  • 任务完成率在复杂多步工作流中提升 15-40%
  • 文件系统即外部记忆(filesystem-as-context)防止上下文溢出
  • Recitation 处理"lost in the middle"问题
  • 工程亮点:
  • 具体优化策略:KV cache optimization、filesystem-as-context、recitation、error preservation
  • Masking tools 而非移除(保持 cache 稳定性)
  • 保留理由: 有具体性能数据、命令/策略分析,适合作为 context engineering 工程指南参考
  • 后续行动: 建议精读,提取具体实施步骤和代码片段

2. Context Caching: Make AI Agents Faster and Cheaper (2026)

  • 来源: Atlan
  • URL: https://atlan.com/know/context-caching
  • 发布时间: 2026
  • 可信度: 高 — 企业级实践
  • 核心观点:
  • Context caching 可降低 90% token 成本、减少 85% 延迟
  • 缓存放大效应:缓存正确内容加速正确响应,但缓存过期内容同样加速错误响应
  • 工程亮点:
  • Stable prompt prefixes、KV cache reuse、cache lifetime rules
  • 治理与工程同等重要
  • 保留理由: 企业级 context caching 实践,有具体数据支撑
  • 后续行动: 可作为 context caching 工程规范参考

3. Prompt Caching in 2026: Cut LLM Costs, Keep Quality

  • 来源: Digital Applied
  • URL: https://www.digitalapplied.com/blog/prompt-caching-2026-cut-llm-costs-engineering-guide
  • 发布时间: 2026 (含 2026-04-23 文章引用)
  • 可信度: 高 — 引用学术论文
  • 核心观点:
  • 引用论文: "Don't Break the Cache" (arXiv 2601.06007, 2026)
  • 500+ agent sessions × 10,000-token system prompts 测试
  • 41-80% API 成本降低、13-31% time-to-first-token 改善
  • 关键发现:战略性 cache boundary 控制优于 naive full-context caching
  • 工程亮点:
  • 学术支撑(arXiv)+ 工程验证数据
  • ProjectDiscovery 案例:84% cache hit rate,9.8B tokens served from cache
  • 保留理由: 学术+工程双重验证,有具体数据
  • 后续行动: 建议引用,可作为 prompt caching 最佳实践来源

4. LLM Context Window Management and Long Context (2026)

  • 来源: Zylos AI Research
  • URL: https://zylos.ai/research/2026-01-19-llm-context-management
  • 发布时间: 2026-01-19
  • 可信度: 高 — 含 2026 定价数据
  • 核心观点:
  • 2026 年各 Provider 定价表格(Anthropic Claude、OpenAI GPT-5.2、Google Gemini 3 Pro)
  • Context-Aware Pricing 说明
  • Hybrid Retrieval + Caching 可实现 90%+ 成本节省
  • 工程亮点:
  • 具体定价数据表格(Base vs Extended Context pricing)
  • vLLM、TensorRT-LLM 用于长上下文
  • 2027 预测:context windows 稳定在 1-2M tokens
  • 保留理由: 2026 定价数据准确,适合成本估算参考
  • 后续行动: 可作为 LLM 成本计算基准数据

5. AI Caching Strategies 2026: Cut LLM Costs 86%

  • 来源: ValueStreamAI
  • URL: https://valuestreamai.com/blog/ai-caching-strategies-2026
  • 发布时间: 2026
  • 可信度: 高 — 含具体方法名
  • 核心观点:
  • SCORE 方法 (Similarity-Aware Contextual Overlap-Redundancy Eviction)
  • 实现 66× memory reduction (1.5% original KV cache footprint)
  • 40-86% 成本降低、160× 延迟改善 (300-500ms → 2-5ms)
  • 工程亮点:
  • 具体优化步骤:sliding window attention、INT8 KV cache quantization
  • 推理成本占总 AI infrastructure 55%(2026 vs 33% in 2023)
  • 保留理由: SCORE 方法学术名称+具体数据,有方法论
  • 后续行动: 建议核实 SCORE 论文,补充引用

6. Production RAG Pipelines with Re-ranking (GitHub)

  • 来源: rehan243/AI-Engineering-Notes
  • URL: https://github.com/rehan243/AI-Engineering-Notes/blob/main/articles/2026-07-29-production-rag-pipelines-with-re-ranking.md
  • 作者: rehan243
  • 发布时间: 2026-07-29
  • 可信度: 高 — GitHub 工程笔记
  • 核心观点:
  • Document Indexing → Query Retrieval → Re-ranking → Generation 完整 pipeline
  • Cross-encoder 慢于 dense retrieval(需分布式 FAISS 或近似搜索)
  • Re-ranking 无法修复糟糕的 retrieval(garbage in, garbage out)
  • 工程亮点:
  • 包含具体代码片段(chunking strategy、top-k retrieval)
  • 具体 lesson learned
  • k 参数说明
  • 保留理由: 有源码、步骤、可复现
  • 后续行动: 可作为生产级 RAG pipeline 参考

7. Context Engineering for Production AI Agents (Spheron)

  • 来源: Spheron Network
  • URL: https://www.spheron.network/blog/context-engineering-production-ai-agents-kv-cache-long-context
  • 作者: Mitrasish (Co-founder & CTO)
  • 发布时间: 2026-06-17
  • 可信度: 高 — CTO 署名文章
  • 核心观点:
  • H200 GPU break-even 分析
  • 单次 100K input tokens 请求成本:$0.25-0.50 (API) vs $0.003 (self-hosted H200 at 50% utilization)
  • 每月 14,000+ 次长上下文调用时 self-hosted 更便宜
  • 工程亮点:
  • 具体成本计算模型
  • RadixAttention、KV cache 经济学解释
  • 保留理由: CTO 署名,有具体成本计算,适合架构决策
  • 后续行动: 可作为 GPU vs API 成本决策参考

8. AI Deployment in 2026: CI/CD for LLMs & Agents (Harness)

  • 来源: Harness.io
  • URL: https://harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents
  • 发布时间: 2026
  • 可信度: 中高 — 企业级 DevOps 视角
  • 核心观点:
    1. Version prompts/configs/policies as code
    1. Build eval suite (golden set + safety tests)
    1. CI: semantic eval + regression thresholds
    1. Security gates: PII redaction + prompt injection tests
    1. CD: canary rollout for prompt/model/RAG changes
    1. Observability: quality + safety + cost signals
    1. Rollback rules tied to metrics
  • 工程亮点: 具体 CI/CD pipeline 步骤,适合 AI 部署规范
  • 保留理由: 具体步骤、可操作
  • 后续行动: 可作为 AI DevOps pipeline 检查清单

9. Agentic RAG 2026: Patterns, Code, Observability

  • 来源: FutureAGI
  • URL: https://futureagi.com/blog/agentic-rag-systems-2025
  • 发布时间: 2025/2026
  • 可信度: 高 — 含代码和失败模式
  • 核心观点:
  • Classic RAG 是函数:query in → retrieve once → generate once → answer out
  • Agentic RAG 是循环:do I retrieve? with what query? with which retriever? is result enough? do I retrieve again?
  • 失败模式:Over-retrieval(max 4 retrieves step budget)、Under-retrieval
  • 工程亮点:
  • 具体代码结构
  • 失败模式+修复方案
  • trace + eval backend 说明
  • 保留理由: 有代码、失败模式、修复方案
  • 后续行动: 可作为 agentic RAG 工程参考

10. Chip Huyen - Agents (长篇)

  • 来源: 被多个 GitHub 仓库引用
  • 可信度: 高 — 知名 AI Engineer 作者
  • 核心观点: agent design, planning, tool use
  • 保留理由: 经典长篇,适合作为 agent 设计理论参考
  • 后续行动: 建议获取原文链接

11. Harness Engineering: The Missing Layer Behind AI Agents (Louis-François Bouchard)

  • 来源: What's AI / Louis-François Bouchard
  • URL: https://github.com/louisfb01/start-ai-engineering
  • 作者: Louis-François Bouchard (What's AI)
  • 发布时间: 持续更新
  • 可信度: 高 — 知名 AI engineering educator
  • 核心观点:
  • Harness = 工具、权限、状态、重试、检查点、guardrails、evals
  • "harnesses, not models, separate demos from products"
  • 工程亮点: 区分 demo vs product 的关键概念
  • 保留理由: 概念清晰,适合工程教育
  • 后续行动: 可作为 harness engineering 概念引入

12. My LLM coding workflow going into 2026 (Addy Osmani, Substack)

  • 来源: Addy Osmani Substack
  • URL: https://addyo.substack.com/p/my-llm-coding-workflow-going-into
  • 作者: Addy Osmani (Google)
  • 发布时间: 2026
  • 可信度: 高 — Google 工程师
  • 核心观点:
  • AI-augmented software engineering 而非 AI-automated
  • 经典软件工程实践在 AI 协作中更重要
  • specs before code、写测试、code review
  • 工程亮点: 个人工作流经验,有实战价值
  • 保留理由: Google 工程师经验,实用
  • 后续行动: 可作为 AI 辅助工程最佳实践参考

13. LLM-Engineering Roadmap (GitHub)

  • 来源: tal7aouy/LLM-Engineering
  • URL: https://github.com/tal7aouy/LLM-Engineering
  • 发布时间: 持续更新,2026 内容
  • 可信度: 中高 — GitHub 活跃仓库
  • 核心观点:
  • 24 周学习路径
  • 包含 2026 新内容:MCP、Reasoning Models、Agentic IDEs、Computer-Use、A2A
  • Eval-driven development 是 junior vs senior LLM 工程师的关键区别
  • 工程亮点: eval-driven loop 流程图、checklist
  • 保留理由: 工程学习路径,有检查清单
  • 后续行动: 可作为学习路径参考

14. ai-engineering-guide (GitHub)

  • 来源: dipakkr/ai-engineering-guide
  • URL: https://github.com/dipakkr/ai-engineering-guide
  • 发布时间: 持续更新
  • 可信度: 中高 — 9 章节、75+ 课程、400+ checklist items
  • 核心观点:
  • 系统架构、部署模式、运维严谨性
  • 面试检查清单:LLM Internals、Prompt & Context、RAG & Retrieval、Agents & MCP、Agent Harnesses、Evals、LLMOps
  • 工程亮点: 面试 cheat sheet、chapter checklists
  • 保留理由: 工程检查清单全面
  • 后续行动: 可作为工程能力评估参考

15. llm-systems-engineering-roadmap (GitHub)

  • 来源: h9-tec/llm-systems-engineering-roadmap
  • URL: https://github.com/h9-tec/llm-systems-engineering-roadmap
  • 发布时间: 2026
  • 可信度: 高 — Level 3-5 工程能力定义
  • 核心观点:
  • Level 3 = LLM systems engineer:可构建生产系统
  • Level 4 = LLM infrastructure engineer:可优化大规模 serving
  • 具体 checklist:model selection、RAG production、agent safety
  • 工程亮点: 具体 checklist (model selection、RAG production)
  • 保留理由: 工程能力分级清晰,适合团队能力评估
  • 后续行动: 可作为工程能力分级标准

16. awesome-rag-production (GitHub)

  • 来源: Yigtwxx/awesome-rag-production
  • URL: https://github.com/Yigtwxx/awesome-rag-production
  • 发布时间: 2026
  • 可信度: 高 — 战斗级工具清单
  • 核心观点:
  • Arize Phoenix:troubleshoot retrieval、可视化 embedding clusters
  • Future AGI:70+ eval metrics、OpenTelemetry-native traces
  • Langfuse:prompt 版本控制
  • LlamaIndex RouterQueryEngine:LLM-powered query router
  • 工程亮点: 生产级工具清单
  • 保留理由: 工具选型参考
  • 后续行动: 可作为 RAG 工具选型参考

❌ 丢弃条目

条目 丢弃理由
Udemy AI Engineer Bootcamp 2026 课程介绍,无工程细节
LinkedIn posts (roadmap/summary) 总结性内容,无命令/代码/性能数据
Towards AI 课程广告 营销内容,无实战内容
纯 roadmap 文章(无具体步骤) 只有框架,无可复现内容
JavaRevisited Substack (2026 Agentic AI Engineer Roadmap) 课程/培训介绍为主
Emerging AI Substack (2026 AI Engineer Roadmap) locked content,无实质内容

📊 分类标签

  • context-engineering (5): #1, #2, #3, #5, #7
  • rag (5): #6, #9, #13, #15, #16
  • cost-optimization (4): #2, #3, #4, #5
  • agent (3): #9, #10, #11
  • llm-ops (3): #8, #14, #15
  • engineering-checklist (3): #13, #14, #15
  • github-resource (4): #6, #13, #14, #15, #16
  • substack (1): #12
  • arxip-ref (1): #3 (引用 arXiv 2601.06007)

📁 建议写入路径

/shared/research-kb/inbox/jay/2026-08-18-ai-engineering-screening.md

本次共筛选 16 个保留条目,覆盖: - Context Engineering / Caching / Cost Optimization - Production RAG Pipeline - Agentic RAG Patterns - AI DevOps / CI-CD - GitHub 工程学习资源 - Substack 高质量工程文章


🔍 后续行动建议

  1. 精读优先级(建议本周内): - #3 (Prompt Caching) - 引用 arXiv,有学术支撑 - #6 (Production RAG with Re-ranking) - GitHub 源码 - #9 (Agentic RAG) - 代码+失败模式

  2. 审稿优先级: - #8 (AI Deployment CI/CD) - Harness.io - #12 (Addy Osmani Substack) - Google 工程师经验

  3. 主题页更新建议: - 新增 context-engineering 主题页 - 更新 rag 主题页,补充 agentic RAG 和 production RAG 内容 - 更新 cost-optimization 主题页,补充 2026 定价数据


⚠️ 说明

  • 本次筛选未执行 GitHub 写入操作
  • 未发现需要核验论文/代码/官方文档的情况
  • 3 引用的 arXiv 2601.06007 可作为后续调研线索