Jay 工程实践筛选 · 2026-08-03

筛选概览

  • 主题: AI 工程实践(LLM 生产部署 / Agent 框架 / RAG / 推理优化)
  • 检索范围: Tavily 搜索 · arXiv · Substack · Langfuse Blog · DevEntia · VectorLabs · Lilian Weng Blog
  • 候选总数: ~30 条
  • 高价值保留: 7 条
  • 丢弃: 23 条(营销文/列表/课程推广/离题)

✅ 高价值条目(保留)

1. Loop Engineering:AI 工程的下一个范式转变

字段 内容
来源 Substack · aishwaryasrinivasan(AI Engineer)
URL https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-loop-engineering
发布时间 2026-07(推测,Trending 2026)
核心观点 继 Prompt Engineering → Context Engineering 之后,第三层是 Loop Engineering:设计 AI 系统如何反复 plan→act→observe→evaluate→repair,直到目标达成或停止条件触发。Boris Cherny(Claude Code 创作者)和 Peter Steinberger 首先命名并推广该概念。Loop 是 AI 工程的真正单元,而非单次 Prompt。
工程价值 - 提出 MINT Framework(Make Complexity Pay Rent)
- 区分 Minutes/Hours/Days 三个循环粒度
- Agent 开发生命周期从 Scoped Intent 到生产反馈
- 评估是 Loop 的核心
可信度 高 · Boris Cherny 为 Claude Code 核心作者,概念有工业实践支撑
后续行动 建议精读原文,对照 LangGraph / Claude Agent SDK 的 Loop 实现模式
标签 agent loop-engineering production framework

2. RAG 生产实现指南(含失败模式表)

字段 内容
来源 DevEntia Tech Blog(CTO Abdul Majid)
URL https://deventiatech.com/blogs/rag-implementation-guide-business-2026
发布时间 2026-07-28
核心观点 RAG 系统的 6 种失败模式中,5 种是检索问题而非模型问题。最大准确率提升是 混合搜索 + Re-ranking。权限必须在检索层过滤,而非在 Prompt 中依赖模型保密。
工程价值 - 失败模式对照表(症状/根因/修复方案)
- Retrieve 20-50 → Re-rank 到 3-8 的工程实践
- 权限过滤必须在数据库层执行(不可信赖模型拒绝)
- 构建时间估算:4-6 周(内部)/ 8-14 周(外部)
- 数据质量是时间线最大变量
可信度 高 · CTO 署名,工程经验来自真实客户项目
后续行动 可直接作为 RAG 系统设计 Checkpoint;建议审稿后纳入工程实践 Wiki
标签 RAG production failure-modes security retrieval

3. Prompt Engineering 无法保障可靠性:2026 行为研究证据

字段 内容
来源 VectorLabs(引用 Du et al.、Chen et al. arXiv 2026)
URL https://vector-labs.ai/insights/why-prompt-engineering-is-not-a-reliability-strategy-what-llm-behavioral-research-tells-engineering-leaders
发布时间 2026-07-23
核心观点 Prompt Engineering 无法解决输入框架导致的系统性输出偏移。大模型在参数规模增大后(MoE 35B),上下文遵循行为反而下降。架构可靠性必须在模型上下文窗口外部实现:输出验证、Schema 约束、行为监控、兜底逻辑。
工程价值 - 引用 2026 年 arXiv 实证研究(非推测)
- 提出架构可靠性的具体层次(Output Verification / Behavioral Monitoring)
- 对工程团队的投资优先级有直接指导意义
可信度 高 · 有具体论文引用(Du et al.、Chen et al.);建议核验 arXiv 原文
后续行动 建议追踪 Du et al. / Chen et al. arXiv 2026 原文;可作为生产 AI 可靠性架构决策参考
标签 reliability prompt-engineering research production behavior

4. 2026 AI Agent 框架工程横评

字段 内容
来源 Agent Mag(2026-05-02) + Langfuse Blog(2026-07-13)
URL https://agentmag.dev/articles/2026-ai-agent-framework-showdown-engineering-insights-for-builders
https://langfuse.com/blog/2025-03-19-ai-agent-comparison
核心观点 2026 年框架格局:Claude Agent SDK(有状态沙箱工作流)/Strands Agents(轻量模型驱动)/LangGraph(显式编排)/OpenAI Agents SDK(专用 Handoff 机制)。AutoGen 已合并入 Microsoft Agent Framework,不再独立活跃。
工程价值 - 四框架设计哲学对比(状态管理/容错/评估覆盖/成本可见性)
- Langfuse 覆盖 15 个框架:LangGraph/LangChain/ADK/Pydantic AI/CrewAI/Strands/Mastra/Vercal AI SDK/Semantic Kernel/Agno/Smolagents
- A2A 跨框架互操作正在成熟(Microsoft 领先)
可信度 高 · 工业视角,附 GitHub 链接和生产失败模式分析
后续行动 可作为框架选型决策 Memo;建议关注 A2A 协议成熟度
标签 agent-framework engineering comparison production

5. ZipServ: LLM 推理的硬件感知无损压缩(ASPLOS '26)

字段 内容
来源 arXiv + HKUST 团队(Weile Luo, Qiang Wang, Wei Wang, Xiaowen Chu 等)
URL 论文收录于 ASPLOS '26;arXiv 链接需通过 HKUST 主页追踪
核心观点 针对 LLM 推理的硬件感知无损压缩,降低内存占用同时保持推理效率。
工程价值 ASPLOS '26 同行评审论文,含实验数据;同类工作 ELoRA(KV Cache 管理,HPCA '26)、SpInfer(GPU 低级稀疏性,TOCS 2026)
可信度 高 · 顶会论文
后续行动 建议检索完整 arXiv 编号;补充到推理优化论文清单
标签 inference compression ASPLOS paper

6. Harness Engineering for Self-Improving LLM Agents(Lilian Weng)

字段 内容
来源 Lilian Weng Blog(lilianweng.github.io)
URL https://lilianweng.github.io/posts/2026-07-04-harness
发布时间 2026-07-04
核心观点 自改进 LLM Agent 的 Harness(测试/评估 harness)工程全景:
- KernelBench(LLM 能否写出高效 GPU Kernels)
- DGM(Darwin Gödel Machine):可编辑 harness 进化
- Hyperagents:Meta-Agent 控制 Task Agent 创建
- Hebbar et al. SIA:Self-Improving AI with Harness & Weight Updates
工程价值 覆盖 10+ 篇 2025-2026 arXiv 论文的调研总结;自改进 Agent 领域的概念地图
可信度 高 · Lilian Weng 为 OpenAI 安全专家,博客有工业界广泛引用
后续行动 建议追踪 KernelBench、DGM、Hyperagents 论文;适合纳入 Agent 架构研究页
标签 agent self-improvement harness research arXiv

7. Stateless MCP 分析(Simon Willison)

字段 内容
来源 Simon Willison Substack
URL https://simonw.substack.com/p/stateless-mcp-has-recaptured-my-interest
发布时间 2026-07-27
核心观点 MCP(Model Context Protocol)的无状态设计重新获得关注。核心工程观点:LLM 供应商应提供严格的 API Key 费用上限控制(dollar cap),当达到阈值时自动停止服务。
工程价值 Simon Willison 是 Datasette 作者,技术洞察实用;包含 llm CLI 工具、DeepSeek-V4-Flash-0731 模型实测(304B 参数,$0.14/M input pricing);推理努力级别(reasoning effort)对输出质量影响的数据
可信度 高 · 可复现的 CLI 命令和模型评测
后续行动 可引用作为 MCP 工程安全性建议;DeepSeek-V4-Flash-0731 性价比数据可纳入模型选型参考
标签 MCP security API-keys production model-selection

❌ 丢弃条目(不纳入)

序号 条目 丢弃理由
1 LLM Testing Frameworks / DeepEval LLM-as-Judge 工具介绍为主,缺乏新工程数据;DeepEval 官方博客已有更完整内容
2 Linux Foundation LLM Engineering Course(YouTube) 课程推广,内容为通用知识点梳理,无独特工程洞察
3 Finance LLM Guide(GetAleph) 离题,金融领域为主
4 LuMay / Wezom AI Services 榜单 营销服务列表,无工程细节
5 LinkedIn 转载(AMD Advancing AI / Ojas Varshney) 二手信息,链接失效风险
6 Internative RAG vs Fine-tuning Guide 通用决策框架,无新数据
7 AI Engineering Course(Citadel Cloud) 课程营销,非一手工程经验
8 Techment RAG Enterprise Guide 营销导向,无具体命令或性能数据
9 Sara AI Monthly July 2026 月度摘要,信息密度低
10 Packt Data Engineering Workflows Workshop 课程推广
11 AI SOC / Qevlar / Purple AI / Exaforce 分析 安全垂直领域,非通用工程
12 Uvik Agentic AI Frameworks 2026 通用综述,无具体数据
13 Yellow Systems RAG Lessons 标题党风格,工程细节稀薄
14 Winder.ai How to Build AI Agent 有价值观点但内容较短,缺乏深度
15 LLM Security Ultimate Guide 2026(A10 Networks) 营销内容为主
16 Datavlab Human LLM Evaluation 有方法论价值但内容以方法论为主,非新数据
17 AI Forward Deployed Engineer Role(营销子) 课程/工作角色介绍,技术子内容在 aishwaryasrinivasan 处已覆盖
18 TheNextGenTechInsider LinkedIn 二手摘要

分类标签(本次)

agent, loop-engineering, RAG, inference, compression,
prompt-engineering, reliability, agent-framework,
MCP, security, harness, self-improvement, production,
retrieval, failure-modes, arXiv, ASPLOS, HPCA

建议写入路径

/shared/research-kb/inbox/jay/2026-08-03-engineering-weekly.md

后续行动建议

  1. Loop Engineering — 建议在知识库建立 loop-engineering 专题页,追踪 Boris Cherny / Peter Steinberger 后续内容
  2. RAG 失败模式表 — 建议作为生产 RAG Checkpoint 模板的基础;可与 Langfuse RAG 评估工具联动
  3. Prompt Reliability 研究 — 需核验 Du et al. / Chen et al. arXiv 编号,补录论文原文链接
  4. ZipServ / ELoRA / SpInfer — 推理优化方向建议建立专项论文追踪,arXiv 编号待补全
  5. A2A 协议成熟度 — 建议 8-9 月追踪 Microsoft/Google A2A 互操作进展

Jay · 2026-08-03 · 工程实践筛选第 3 轮