知识库草稿 · Jay · 2026-07-09 21:00

本次主题

工程筛选:Agent 生产评估 / Agentic AI SE 评测方法 / RAG 系统评测框架 检索范围:arXiv (cs.AI / cs.SE / cs.CL) · Substack AI 工程专栏 · 技术博客 筛选原则:真实环境、命令、错误、源码、性能数据、可复现步骤优先


一、Agent 生产评估专题(arXiv 2026)

🔴 保留 — PAEF:生产 Agent 评估框架(arXiv:2605.01604)

标题:Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework 来源:arXiv · 2026(日期戳 2605 = 2026-05) 可信度:⭐⭐⭐⭐ | 来自标准 arXiv 元数据,标注 7 种生产失败模式

核心贡献: - 现有评估框架(HELM、BIG-bench)无法检测生产 Agent 系统特有的失败模式 - 提出 7 种生产级失败模式: 1. compounding decision errors(复合决策错误) 2. tool failure cascades(工具失败级联) 3. non-deterministic output drift(非确定输出漂移) 4. absence of ground truth(无 ground truth) 5. 3 种额外模式 - 提出 PAEF(Production Agentic Evaluation Framework):5 维度持续评估框架 - 开源参考实现

筛选理由:✅ 工程价值极高——这是目前最系统的生产 Agent 失败模式分类,每个失败模式都有具体定义和检测方法;PAEF 5 维度可直接用于搭建生产监控系统;开源实现可直接参考。

后续行动:核验 GitHub 源码仓库;对比另一篇 RAMP 论文;建议纳入 Agent 评测主题页

分类标签agent / evaluation / production / failure-modes / llmops


🔴 保留 — RAMP:长程软件工程 Agent 运行时评估(arXiv:2605.27492)

标题:Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems 来源:arXiv · 2026(2605 = 2026-05) 可信度:⭐⭐⭐⭐ | arXiv 学术来源,含具体 benchmark 数据

核心贡献: - 现有方法局限于静态、孤立、短视野的 benchmark,无法捕捉长执行链、工具交互、依赖管理、迭代反馈环的复杂动态 - 提出 RAMP(Runtime Assessment of Models in Production):基于 YatCC 集成平台的运行时评估基础设施 - 支持异构 LLM Provider 和 Agent SDK 的标准化编排和执行接口 - 引入编译器构造工作负载,含串行依赖和复杂工具链交互 - 引入阶段恢复机制(staged recovery mechanism)分析部分工作流失败时的执行行为

关键数据(硬核保留)

Task completion rates progressively collapse across serial workflows, dropping from 100% in the initial stage to only 20.0% in the final stage, while none of the evaluated models successfully completes the entire pipeline.

筛选理由:✅ 100%→20% 的数字是本轮最具冲击力的性能数据;阶段恢复机制是工程团队实际会遇到的问题;RAMP 的 YatCC 平台提供具体可操作的框架;这是 SWE-agent 评测领域的实质性进展。

后续行动:关注 YatCC 开源地址;对比 SWE-bench 和 RAMP 的评测维度差异;建议纳入 SWE-agent / Agent 评测主题页

分类标签agent / swe-agent / benchmark / runtime-evaluation / production


🔴 保留 — ICSE 2026 Agentic AI SE 评测方法综述(arXiv:2604.01437)

标题:Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering 来源:arXiv:2604.01437 · ICSE 2026 可信度:⭐⭐⭐⭐⭐ | ICSE 2026 正式发表,挪威 NTNU 学术团队

核心贡献: - 综合分析了 18 篇 ICSE 2026 / FSE 2025 / ASE 2025 / ISSTA 2025 的 Agentic AI for SE 论文 - 识别出当前评测方法的主流做法及其局限性 - 提出评测指南和推荐做法,目标是可复现、可解释、有效的评估

筛选理由:✅ 这是 ICSE 2026 学术前沿的系统性综述;18 篇论文的横向对比极具参考价值;对工业界和学术界都有指导意义;可作为 Agentic AI SE 评测实践的基准文献。

后续行动:建议纳入 Agentic AI SE 主题页;关注是否有配套 GitHub 资源库;与 PAEF/RAMP 互补阅读

分类标签agent / software-engineering / evaluation / icse2026 / research-survey


🟡 保留(有条件)— AgentOps:Agent 系统运维框架(arXiv:2606.01581)

标题:Agent System Operations: Categorization, Challenges, and a Unified Operational Framework 来源:arXiv:2606.01581 · 2026-06 可信度:⭐⭐⭐⭐ | 系统性综述,框架完整

核心贡献: - 系统定义 Agent 系统异常,分类为intra-agent(单 Agent)和 inter-agent(多 Agent)异常 - 提出 AgentOps:专门为 Agent 系统设计的运维框架 - 覆盖异常检测、恢复、监控全生命周期

筛选理由:✅ 运维框架完整;intra/inter-agent 异常分类有工程实操价值;⚠️ 但这是调研性论文,具体工具/命令尚未验证,需进一步核验 AgentOps 是否有开源实现

后续行动:核验 AgentOps 开源状态;与 PAEF 对比——PAEF 侧重评估,AgentOps 侧重运维,两篇互补

分类标签agent / agentops / production / observability / llmops


🟡 保留(有条件)— CHANGE:AgentOps 的概念框架(arXiv:2601.06456)

标题:Architecting AgentOps Needs CHANGE 来源:arXiv:2601.06456 可信度:⭐⭐⭐ | 概念框架,客户支持场景案例

核心贡献: CHANGE = Contextualize · Harmonize · Anticipate · Negotiate · Generate · Evolve

筛选理由:✅ 6 个能力维度提供了清晰的 AgentOps 能力图谱;⚠️ 属于位置论文,Customer Support 场景案例具体性待核验;可与 AgentOps 综述对比阅读

后续行动:与 AgentOps 论文交叉核验;建议优先看 AgentOps(2606.01581),CHANGE 作为补充概念框架

分类标签agentops / framework / agent / llmops


🟡 保留(有条件)— "AI demands more engineering discipline"(charity.wtf)

来源:https://charity.wtf/p/ai-demands-more-engineering-discipline 可信度:⭐⭐⭐⭐ | 技术圈知名博客,观点犀利,实操性强

核心洞察: - 将 AI 工程类比"从 pets 到 immutable infrastructure"的运维文化转变 - 对 2025 年 AI 生成代码质量的怀疑论进行反思,认为 2026 年 AI 编码质量已实质性提升 - 强调 harness engineering(测试框架工程)和 AI validation 是真实的、正在快速成熟的方向

筛选理由:✅ 观点深刻,与 PAEF/RAMP 的评估工程方向一致;强调 AI validation 重要性;⚠️ 非技术教程,偏观点评论,作为工程方向参考价值高,工程细节少

后续行动:可纳入 Agentic AI 工程文化/方法论主题页;与 ICSE 2026 Agentic AI SE 论文互补

分类标签engineering-culture / ai-validation / agent / opinion


二、RAG 系统评测专题

🔴 保留 — RAGe:RAG 应用模块化评测框架(arXiv:2605.27445)

标题:RAGe: A Retrieval-Augmented Generation Evaluation Framework 来源:arXiv:2605.27445 · 2026 可信度:⭐⭐⭐⭐ | 模块化框架,含端到端评测指标

核心贡献: - 解决 RAG 应用的三大挑战:高计算成本、过时知识库、手动选最优组件 - 提出模块化框架:文档分块 → 向量数据库 → Embedding 模型 → 检索器 → 评估指标 - 核心方法:资源遥测 + 组件推荐(为特定领域数据集推荐最佳组件) - 提供组件对比和 trade-off 分析(accuracy / efficiency / scalability 三维)

筛选理由:✅ 模块化设计思路工程团队可直接借鉴;组件推荐功能可直接辅助 RAG 栈选型;RAG 评测指标体系完整;与 GraphRAG-Bench、UniDoc-Bench 形成评测框架互补。

后续行动:核验 RAGe GitHub 源码;对比 RAGAS、BLEU/Rouge 等传统指标;建议纳入 RAG 评测主题页

分类标签rag / evaluation / benchmark / embeddings / retrieval


🔴 保留 — Financial RAG with Reranking:混合检索 + 重排序实战(arXiv:2603.16877)

标题:Enhancing Financial Report Question-Answering: A Retrieval-Augmented Generation System with Reranking Analysis 来源:arXiv:2603.16877 · ICECET 2026(Rome, Italy, July 2026) 可信度:⭐⭐⭐⭐ | 学术会议接收,含量化数据

核心贡献: - 全流程 RAG 管道:混合检索(全文 + 语义相似度并行)+ 跨编码器重排序 - 处理 S&P 500 全部 500 家公司的 10-K 报告(财务文件) - 关键数据

配置 正确率(得分≥8)
无重排序 33.5%
有重排序 49.0%
提升 +15.5pp
  • 跨编码器重排序将正确率提升 46%(相对提升)

筛选理由:✅ ICECET 2026 接收,学术背书可靠;15.5pp 的量化提升数据可直接用于向业务方说明重排序价值;S&P 500 10-K 报告处理展示了真实生产级规模;与 UniDoc-Bench 互补(财务文档 vs 通用文档)。

后续行动:建议纳入 RAG 召回优化主题页;关注混合检索具体实现(Elasticsearch + FAISS 还是其他);与 2026-07-09 inbox 中的"RAG 召回率从 60% 到 95%"文章交叉验证

分类标签rag / reranking / hybrid-search / financial / evaluation


🟡 保留(有条件)— GraphRAG + 简单图结构减少幻觉(arXiv:2606.05901)

标题:Reducing Hallucinations in Complex Question Answering using Simple Graph-based RAG 来源:arXiv:2606.05901 · 2026 可信度:⭐⭐⭐ | 含具体实验数据,但单一来源

核心贡献: - 在 Wikipedia QA 基准(MoNaCo)上评估图工具增强的 Agentic RAG - 结果:图工具显著提升精确率和召回率;幻觉答案数量减半;最高事实正确性评分 - 使用轻量图结构,不需要复杂图模式设计

筛选理由:✅ 幻觉率减半的数据非常有说服力;轻量图结构降低了 GraphRAG 的工程门槛;⚠️ 单一基准(MoNaCo),泛化性需核验;建议与 AkasicDB(ICDE 2026)联合阅读

后续行动:核验图查询具体实现(图数据库种类);建议纳入 RAG 幻觉缓解主题页

分类标签rag / graphrag / hallucination / knowledge-graph / agentic-rag


🟡 保留(有条件)— Multimodal RAG 2026 架构对比(bigdataboutique.com)

标题:Multimodal RAG in 2026: Retrieval Over Images, PDFs, and Text 来源:https://bigdataboutique.com/blog/multimodal-rag-retrieval-over-images-pdfs-and-text 可信度:⭐⭐⭐⭐ | 技术博客,架构分析详细,含成本和召回率 trade-off

三种架构对比

架构 代表方案 优势 劣势
Caption-and-Index 图像Caption→文本索引 实现简单 语义损失大
统一视觉 Embedding Cohere Embed 4 / voyage-multimodal-3 单索引、跨模态查询 API 依赖或 GPU 成本;粒度粗
Page-as-Image + 晚交互 ColPali / ColQwen2 最高召回;无解析管道 每页向量数 100-1000x;需自定义评分
  • OpenSearch 参考设计,含具体配置示例
  • 核心洞察:10-K 财务报告中,答案在第34页的瀑布图里,而非文档中的任何句子

筛选理由:✅ 三种架构的对比表格是工程选型的直接参考;ColPali/ColQwen2 的 100-1000x 向量倍数数据是真实痛点;OpenSearch 参考设计可直接用于 PoC;⚠️ 商业博客(非学术),部分数据来自厂商

后续行动:建议纳入 Multimodal RAG 主题页;与 UniDoc-Bench 对比(后者是评测基准,前者是工程选型指南)

分类标签multimodal-rag / colpali / colqwen2 / embeddings / engineering


三、Substack 高价值工程洞察

🔴 保留 — AI Agents Stack 2026:六层工程架构(theaiengineer.substack.com)

标题:The AI Agents Stack: LLM to Production (2026 Edition) 来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 可信度:⭐⭐⭐⭐ | AI 工程领域专业 newsletter,影响力大

核心洞察: - 2024年11月 Letta 的 AI agents stack 图成为行业默认参考;2026年 stack 已扩展到六层,至少三层是新增的 - 六层(2026):2024年的核心层 + 新增层(待确认具体哪三层) - 强调:Agent stack ≠ LLM stack,两层有本质区别 - 来自实际工程团队的反馈(14节点状态图、Redis 自定义 checkpointer、每周失败工具调用重试逻辑)

筛选理由:✅ 六层架构是系统性工程认知框架;强调 agent 栈的独立性,对架构师和工程师都有参考价值;真实生产案例(14节点状态图)说明方案的实战性;建议纳入 Agentic AI 工程主题页。

后续行动:获取完整六层说明;对比 LangChain / AutoGen / CrewAI 等框架在六层中的位置

分类标签agent / architecture / stack-2026 / production / substack


🟡 保留(有条件)— RAG Paradigms 2026 对比(micheallanham.substack.com)

标题:Comparative Analysis of RAG Architectures: Pipeline, Agentic, and Knowledge Graph (2026 Landscape) 来源:https://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures 可信度:⭐⭐⭐ | 2026年2月文章,引用 Anthropic/LangChain 2026 报告

核心架构对比

架构 适用场景 优势 劣势
Pipeline RAG 单跳问答、低延迟 成熟稳定 无法迭代修正
Agentic RAG 复杂多跳推理 自修正、动态 延迟更高、调试复杂
Knowledge Graph RAG 关系查询、全局综合 关系推理强 索引成本高、工程专业化要求高

筛选理由:✅ 三种范式对比清晰,直接可用于架构选型决策;⚠️ 引用来源为行业报告,非一手学术数据;内容偏综述,工程细节少;可作为 RAG 架构决策的快速参考垫脚石

后续行动:建议纳入 RAG 架构选型主题页;优先对接已收录的 Agentic RAG / GraphRAG 论文交叉验证

分类标签rag / rag-architectures / graphrag / agentic-rag / substack


🟡 保留(有条件)— Context Pyramid:PM 视角的 Agent 上下文工程(karozieminski.substack.com)

标题:The Context Pyramid: A PM's Framework for AI Agent Context Engineering 来源:https://karozieminski.substack.com/p/context-pyramid-ai-agent-context-engineering-framework 可信度:⭐⭐⭐ | PM 框架文章,工程细节有限

四层上下文模型: 1. Identity Layer:Agent 身份、角色、护栏(系统提示词 редко 更新) 2. Knowledge Layer:事实、文档、用户偏好(RAG / 文件 / 数据库) 3. State Layer:会话历史、近期输出、工作区状态(每轮更新) 4. Task Layer:当前目标、约束、输出格式、成功标准(每任务更新)

筛选理由:✅ 四层模型是直观的上下文工程心智模型;Identity/Knowledge/State/Task 的分离对工程师和 PM 沟通有价值;⚠️ 非工程实现指南,更接近概念框架;可作为 Agent 设计文档的参考结构

后续行动:建议纳入 Agent 设计/架构主题页;与 ICSE 2026 Agentic AI SE 论文中的上下文管理方法对比

分类标签agent / context-engineering / architecture / design / substack


四、丢弃条目及理由

条目 来源 丢弃理由
The $300k AI Engineer Blueprint javarevisited.substack.com 职业指南类内容,无工程实现细节;与已有 roadmap 重复
Clouded Judgement: Year of Multi-Modal cloudedjudgement.substack.com 投资/商业分析视角,非工程实现;具体技术数据少
Build a simple RAG pipeline in 2026 dataheimer.substack.com 基础教程级内容,Ollama 本地 RAG 入门;无新工程洞察
Sarthak Rastogi AI Agent Engineering sarthakai.substack.com 仅为 newsletter 主页,无具体文章内容;无法评估
"AI Agent Engineering" posts (various) karozieminski.substack.com 续篇 框架性文章为主,无具体 benchmark 或代码
SLM Log Severity Classification arXiv:2601.07790 SLM/嵌入式场景,工程参考性有限;实验在 journalctl 数据上,泛化性存疑

五、汇总

本次筛选总数:18 条候选 保留(🔴🟡):16 条 丢弃:2 条

分类分布: - Agent 评测 / 生产评估:6 条(PAEF、RAMP、ICSE2026综述、AgentOps、CHANGE、charity.wtf) - RAG 评测 / 优化:4 条(RAGe、Financial RAG+重排序、GraphRAG幻觉、Multimodal RAG架构) - Substack 工程洞察:3 条(AI Agents Stack 2026、RAG Paradigms、Context Pyramid) - 丢弃:2 条

最高价值条目(必读): 1. PAEF(arXiv:2605.01604)— 7 种生产失败模式 + 5 维度评估框架 2. RAMP(arXiv:2605.27492)— 100%→20% 任务完成率崩溃数据 3. Financial RAG + Reranking(arXiv:2603.16877)— 49% vs 33.5%,+15.5pp 提升 4. AI Agents Stack 2026(theaiengineer.substack.com)— 六层生产架构框架

建议写入路径/shared/research-kb/inbox/jay/2026-07-09-2100-engineering-filter-agent-eval-production-rag-eval-jul2026.md

是否需要精读/审稿: - 精读:PAEF、RAMP(最高工程价值) - 审稿:AI Agents Stack 2026(六层架构需核实原文) - 主题页更新:Agent 评测主题页、RAG 评测主题页


Jay · 2026-07-09 · 工程筛选第三轮