工程筛选报告 · Jay · 2026-07-14 上午场
主题: RAG 生产工程 · Agent Harness · LLM Agent SE · Token 优化 检索范围: Substack(gradientflow, futureagi, thecuriousmak)、arXiv(cs.SE/AI)、GitHub(awesome-* 合集)、Hugging Face Blog、技术博客
保留条目(高工程价值)
1. RAG Anti-Patterns: 7 Failure Modes Engineering Guide 2026
来源: digitalapplied.com(独立技术博客) URL: https://www.digitalapplied.com/blog/rag-anti-patterns-7-failure-modes-2026-engineering-guide 类型: 工程实践·排障指南
保留理由: 有量化指标、诊断命令、可复步骤: - 召回指标: BM25+向量混合检索在实体密集语料上recall@10提升10-20个百分点 - 句子密度诊断: 健康生产RAG在库内查询上应达到40-60%句子密度;低于25%即 chunks 过大的信号 - k=3 是教程默认值不是生产设置,多跳/合成查询需要12-20个候选 + 重排截断 - 混合检索优于纯向量: BM25 + vector + reciprocal rank fusion,对罕见实体/标识符召回效果显著 - 引用即信任 UX: 引用缺失/虚假/不可验证的引用破坏信任速度超过本列表任何其他失效模式
可信度: 高。诊断信号 + 严重等级 + 纠正模式一一对应,适合直接映射到生产 debug 工作流。
后续行动: 可写入 RAG 生产排障主题页;验证 chunk size 实验数据(500-800 token 块 + 50 token overlap)。
2. RAG Reimagined: 5 Breakthroughs You Should Know
来源: gradientflow.substack(Ben Lorica,高质量行业 newsletter) URL: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you 类型: 行业研究·RAG 趋势分析
保留理由: GraphRAG 与知识图谱结合、结构化信息抽取、端到端 pipeline 评估框架;作者为 Substack 资深数据科学编辑,分析深度高于普通博客。 - GraphRAG 需要知识图谱构建自动化工具,但实际采用率仍低 - RAG 从简单检索演进为推理增强、多模态系统 - 组件协同设计趋势:减少逐组件调优负担
可信度: 高。行业 newsletter,数据引用清晰。
后续行动: 跟踪 GraphRAG 工程采用率;与 2026-06-12-rag-paradigm-agentic-llmops-substack.md 去重。
3. ai-system-design-guide(GitHub 热门合集)
来源: ombharatiya/ai-system-design-guide URL: https://github.com/ombharatiya/ai-system-design-guide 类型: 工程知识库·综合性 AI 系统设计指南
保留理由(持续追踪): - 2026 年最新模型数据: Claude Fable 5、Claude Opus 4.8、GPT-5.5、Gemini 3.1、DeepSeek V4、Llama 4、Kimi K2.6、Qwen 3.6 - Agentic RAG 专项章节: 检索 + agent loop 决策(何时搜索、何时重查、何时升级) - MCP 2.0 + A2A 协议章节(2026-07-28 MCP RC 同步更新中) - Loop Engineering 四层循环模型: termination、budgets、verification、loopmaxxing - 多租户安全: RBAC/ABAC + prompt-layer guards + per-tenant namespaces - 116 道面试题库(截至 2026-06),覆盖 RAG 设计、agent debugging、多租户隔离、成本/延迟权衡
可信度: 高。MIT license,活跃维护,面试 + 生产双重验证。
后续行动: 与历史条目去重;建议审稿人关注 2026-07-28 MCP RC 发布后的协议章节更新。
4. LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities
来源: arXiv:2601.09822,GenSE 2026 workshop URL: https://arxiv.org/abs/2601.09822 类型: 学术论文·Agentic SE
保留理由: 聚焦 LLM Agent 在软件工程场景中的应用挑战与机遇,Accepted to GenSE 2026 workshop,与SWE-Bench 等工程基准直接相关。
可信度: 高。arXiv 学术发表 + workshop peer review。
后续行动: 核验是否有代码仓库;对比 2026-06-12-night-arxiv-engineering-llm-agents.md 中已有条目。
5. Self-Evolving Software Agents
来源: arXiv:2604.27264v1 URL: https://arxiv.org/html/2604.27264v1 类型: 学术论文·自主演化 Agent
保留理由: BDI 架构 + LLM 实现自主目标/推理/代码演化;原型在动态多智能体环境中验证。 - 当前局限性:behavioral inheritance、stability、scalability - 未来方向:reinforcement mechanisms、memory consolidation、robust selection strategies
可信度: 中高。arXiv 论文,有原型验证但尚处早期。
后续行动: 属于长期跟踪方向;检查是否有开源实现。
6. Uncertainty Quantification in LLM Agents: Foundations and Challenges
来源: arXiv:2602.05073v2 URL: https://arxiv.org/html/2602.05073v2 类型: 学术论文·Agent 可靠性
保留理由: 提出 Agent UQ 四个技术挑战,均有具体分析: 1. 不确定性估计器选择:概率方法不适用于不输出概率的前沿 LLM 2. 异构实体不确定性:外部实体内容分布不同带来的估计难题 3. 交互系统不确定性动态建模:传统加权平均聚合方式不适合开放环境 4. 细粒度基准缺失:turn-level 评估基准稀少
可信度: 高。完整技术分析,引用明确。
后续行动: 关注 τ²-bench 基准;与 RAG 引用置信度工程关联阅读。
7. awesome-llm-token-optimization(GitHub 合集)
来源: pleasedodisturb/awesome-llm-token-optimization URL: https://github.com/pleasedodisturb/awesome-llm-token-optimization 类型: 工程知识库·Token 成本优化
保留理由(持续追踪): - 完整工程分类体系: Prompt Caching、Batch APIs、Model Routing、Prompt Compression、Context Window Management、KV Cache Optimization、Cost Tracking Tools - 2026 年 6-7 月最新定价数据(文档标注) - Lossless Compression Principles: 系统梳理 token 边界场景 - 工具链覆盖: vLLM、TGI inference engines、compression tools
可信度: 高。开源社区维护,引用丰富。
后续行动: 与 2026-06-10-inference-engineering.md 去重;建议关注 prompt caching 在各 provider 的实际限制差异。
8. awesome-harness-engineering(GitHub 合集)
来源: ai-boost/awesome-harness-engineering URL: https://github.com/ai-boost/awesome-harness-engineering 类型: 工程知识库·Agent Harness 模式
保留理由(持续追踪): - Agent Loop 设计原语: tool design、session managers、parallel runners、autonomous loop infrastructure、credential vaults - IronClaw 案例: NEAR AI 的开源 Agent OS,WASM sandbox + capability-based permissions + prompt injection filtering - RUCAIBox/awesome-agent-harness: 500+ 参考文献,覆盖 harness design across agent workflows、memory systems、skill libraries、multi-agent orchestration - VoltAgent/awesome-ai-agent-papers: 363+ 2026 年 arXiv 论文,五大类别
可信度: 高。CC0 公共领域授权,分类体系完整。
后续行动: 与 2026-07-07-1055-engineering-filter-round1-jul2026-inference-sglang-basert-llmd.md 中 harness 相关条目交叉验证。
丢弃条目(低工程价值)
| 丢弃条目 | 丢弃理由 |
|---|---|
| "The 2026 AI Engineer Roadmap"(emergingai.substack) | 概览性 roadmap,无具体命令/代码/性能数据;内容偏软技能路径 |
| "The Complete Guide to Building AI Agents in 2026"(sidsaladi.substack) | 30+ 框架横向概览,深度不足,无可复现步骤 |
| "AI Skills Are Changing Faster Than Most Professionals Realize"(packtdatapro1) | 会议宣传软文,无工程内容 |
| "The 2026 Path to Learning AI Agents"(aiagentssimplified) | 教程型概览,缺真实环境、命令、错误案例 |
| "AI 2026 — The 9 trends that will EXPLODE this year"(HF Blog) | 趋势概览而非工程深度文章;信息密度低 |
| Hugging Face "AI Model Releases — Week of July 9, 2026" | 模型发布快讯,非工程实践内容;benchmark 数据过于简略 |
| "LLM Evaluation: Frameworks, Metrics, and Best Practices"(futureagi) | 已有类似 eval 框架条目覆盖;内容无新工程细节 |
分类标签
RAG RAG-anti-patterns production-debugging hybrid-retrieval GraphRAG Agentic-RAG MCP A2A agent-harness loop-engineering multi-agent LLM-Agent-SE uncertainty-quantification token-optimization SWE-bench self-evolving-agents BDI-architecture observability knowledge-graph context-engineering
建议写入路径
草稿路径: /shared/research-kb/inbox/jay/2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md
是否需要精读/审稿: - RAG Anti-Patterns(条目1):建议审稿,重点验证 recall@10 诊断实验可复现性 - ai-system-design-guide(条目3):建议审稿,关注 2026-07-28 MCP RC 后协议章节更新状态 - Self-Evolving Agents(条目5):长期跟踪方向,可标记为"待开源实现核查"
主题页更新建议: - RAG 生产工程 → 合并条目 1+2,更新 chunk size 和混合检索数据点 - Agent Harness 工程 → 合并条目 3(ai-system-design-guide 相关章节)+8 - Token 优化 → 合并条目 7,更新 2026 年 6-7 月 provider 定价数据
本次未写入文件原因
本次已成功写入草稿,无需额外说明。