工程筛选报告 · Jay · 2026-06-30 上午档
筛选主题
生产 LLM Agent 实测研究 / Agent 评测 / Agent 安全 / 上下文工程
检索范围
- arXiv (cs.SE, cs.AI, cs.CY, cs.LG) — 2026 年 6 月近期
- ICML 2026 Oral 论文
- ASE 2026 安全论文
- LangChain State of Agent Engineering 2026 调查报告
- DEV.to / MLflow / LiveKit 工程博客
高价值条目筛选
1. [Measuring Agents in Production] — ✅ 保留(极高工程价值)
来源: https://arxiv.org/abs/2512.04123
arXiv ID: 2512.04123v4
发布时间: 2026-06-04(最终版)
会议: ICML 2026 Oral Presentation
作者: Melissa Z. Pan et al. (UC Berkeley, Stanford, IBM Research 等)
可信度: ⭐⭐⭐⭐⭐(学术顶级会议,20 个深度访谈 + 306 份问卷,覆盖 86 个生产系统)
核心观点摘要: - 对 86 个生产或试点 Agent 系统进行了实证研究,服务每日数百到数百万用户 - 20 个深度访谈:主要科技公司 AI 实验室 → Agent 创业公司 - 核心发现 RQ1:生产率提升是 Agent 采纳的核心驱动力 - 核心发现 RQ2/3:尽管 Agent 概念火热,实际部署失败或表现不及预期的情况极为普遍 - 研究设计:2025 年 4-11 月,26 个领域,调查 306 名实践者
工程价值判断: - ✅ 真实生产数据(不是模拟/实验室数据) - ✅ 系统规模分布(每日用户量级) - ✅ 失败模式实证 - ✅ 跨行业(金融、医疗、教育) - ✅ 公开代码/数据(arXiv 页面注明有伴随资源)
保留理由: ICML 2026 Oral,实证生产 Agent 规模研究,稀缺的真实生产数据。对理解 Agent 落地现状和失败模式有直接参考价值。
标签: Agent 评测、生产部署、实证研究、ICML 2026
建议写入路径: /shared/research-kb/inbox/jay/2026-06-30-measuring-agents-production-icml2026.md
2. [Context Engineering: From Prompts to Corporate Multi-Agent Architecture] — ✅ 保留(高工程价值)
来源: https://arxiv.org/pdf/2603.09619
arXiv ID: 2603.09619
作者: V.V. Vishnyakova
发布时间: 2026
可信度: ⭐⭐⭐⭐(学术论文,作者有三年企业 LLM/Multi-Agent 实践)
核心观点摘要: - 提出 Context Engineering 概念:将上下文边界作为一等架构决策 - 企业调查数据:Deloitte 2026(n=3,235,24 国):75% 组织计划两年内部署 Agentic AI,但仅 34% 报告 AI 深度转型 - KPMG 季度追踪(n=130,美国 C-suite):Agent 部署从 Q1 11% 飙升至 Q3 42%,Q4 回落到 26%——从试点转向生产级系统的信号 - 多 Agent 编排的可控性问题:谁看到什么?状态如何转移?如何防止被入侵 Agent 发送恶意指令? - Prompt Engineering 无法回答这些问题,因为 Agent 本质是系统层面的信息环境架构 - 论文涉及 MCP (Model Context Protocol)、A2A (Agent-to-Agent Protocol)、OpenClaw 等协议对比
工程价值判断: - ✅ 企业级 Multi-Agent 架构框架 - ✅ 真实调研数据(KPMG、Deloitte) - ✅ 协议对比(MCP vs A2A) - ✅ 可控性工程原则
保留理由: "Context Engineering" 作为新概念框架对企业 Agent 架构有指导意义,KPMG 部署回落数据直接反映 2025 下半年行业从试点转向生产的真实挑战。
标签: Multi-Agent 架构、上下文工程、MCP、A2A、企业 Agent
建议写入路径: /shared/research-kb/inbox/jay/2026-06-30-context-engineering-multiagent-architecture.md
3. [How Your Credentials Are Leaked by LLM Agent Skills: An Empirical Study] — ✅ 保留(高工程价值)
来源: LinkedIn post + ASE 2026 接受论文
会议: ASE 2026 (IEEE/ACM International Conference on Automated Software Engineering)
作者: Yi Liu et al.
可信度: ⭐⭐⭐⭐⭐(ASE 2026 接收论文,首个大规模 Agent Skill 凭证泄漏实证研究)
核心观点摘要: - 研究问题:在 SkillsMP(最大开源 Skill 市场)上,LLM Agent Skill 如何泄漏凭证? - 数据规模:从 170,226 个 Skill 中抽取 17,022 个,进行静态密钥提取、动态沙箱测试、声明意图 vs 运行时行为核对 - 发现:520 个受影响 Skill,含 1,708 个安全问题,归类为 10 种泄漏模式 - 论文标题明确:将凭证泄漏定性为 "Skill" 层面的系统性安全漏洞 - MCP 安全被描述为"执行边界问题"
工程价值判断: - ✅ 大规模实证研究(17,022 个 Skill) - ✅ 10 类泄漏模式 taxonomy - ✅ 安全工程直接相关 - ✅ 与当前 Agent 部署热潮直接相关
保留理由: 首个大规模 Agent Skill 凭证泄漏实证研究,520 个受影响 Skill、10 类泄漏模式,对生产 Agent 安全实践有直接警示价值。ASE 2026 学术背书。
标签: Agent 安全、凭证泄漏、ASE 2026、MCP 安全、Skill 安全
建议写入路径: /shared/research-kb/inbox/jay/2026-06-30-llm-agent-credential-leakage-ase2026.md
4. [State of Agent Engineering 2026 — LangChain] — ⚠️ 参考保留(中等工程价值)
来源: https://www.langchain.com/state-of-agent-engineering
发布时间: 2026(年度调查)
可信度: ⭐⭐⭐⭐(LangChain 官方调查,样本量大)
核心数据点: - 69.6% 受访组织已有 Agent 在生产环境运行,30.4% 正在开发有明确部署计划 - 可观测性:89% 组织已实施某种形式的 Agent 可观测性;62% 有详细 tracing 可检查每个 Agent 步骤和工具调用 - 已在生产中的组织:94% 有某种可观测性,71.5% 有完整 tracing - 主要用例:客户服务(26.5%)、研究与数据分析(24.4%)——两者合计超 50% - 量级差异:万人以上规模组织 67% 有生产 Agent;百人以下 50%
工程价值判断: - ✅ 大样本调查数据(行业部署率) - ✅ 可观测性采用率数据 - ✅ 生产工程实践基准 - ⚠️ 来源为 LangChain 商业推广,内容偏总结性,细节有限
保留理由: 行业基准数据,适合作为工程实践报告的数据支撑。生产 Agent 部署率和可观测性采用率是关键指标。
标签: Agent 工程、调研数据、可观测性、部署率
建议写入路径: /shared/research-kb/inbox/jay/2026-06-30-state-agent-engineering-2026-langchain.md
5. [When Errors Become Narratives: Silent Failures in Production LLM Runtime] — ✅ 已有记录(2026-06-27),补充最新元数据
来源: https://arxiv.org/html/2606.14589v1
已有记录: 2026-06-27-1450-production-agent-harness-silent-failures.md
补充元数据: - 研究系统:openclaw-model-bridge(OpenClaw 的 LLM Bridge 中间件) - 系统规模(2026-06-11 快照):~40 个注册定时任务 / 8 个 LLM Provider / 4,286 个单元测试 / 827 个声明式治理检查 - 22 个已发布的 incident postmortems - 8 周窗口内发现 22 个事件,fail-plausible 模式出现至少 28 次 - 五类 failure taxonomy:A 环境/平台 quirks;B 设计假设不匹配;C 错误吞噬与稀释;D 级联幻觉与编造;E 操作遗漏与取证盲点
更新理由: 补充系统规模数据(4,286 unit tests、8 providers 等),强化该论文在生产 Agent 工程中的参考价值定位。
6. [Why AI Agents Fail in Production] — ⚠️ 丢弃(DEV.to 博客,无新数据)
来源: https://dev.to/hadil/why-ai-agents-fail-in-production-and-how-engineering-teams-are-fixing-it-in-2026-job
作者: Hadil Ben Abdallah
可信度: ⭐⭐⭐(个人技术博客,有工程经验但非实证研究)
丢弃理由: - 缺少真实环境、命令、错误日志、源码或性能数据 - 主要内容是对已知的 Agent 失败模式(silent tool failures、schema changes、LLM hallucinations)的叙述性总结 - 提供了 9 点检查清单但未提供具体实现或数据 - 无原创实证数据,主要是对行业经验的复述
对比: 同类话题已有 arXiv:2606.14589(完整 failure taxonomy + 22 个 postmortems)和 ICML 2026 的实证研究,该文章无额外独特贡献。
7. [Building Production-Ready AI Agents in 2026 — MLflow] — ⚠️ 丢弃(产品营销,非独立工程内容)
来源: https://mlflow.org/articles/building-production-ready-ai-agents-in-2026
可信度: ⭐⭐⭐(MLflow 官方博客,内容围绕 MLflow 平台功能)
丢弃理由: - 主要是 MLflow 平台功能介绍,非独立工程研究 - 生产 Agent 最佳实践(如"deterministic code for critical operations")属于已知共识,无新数据支撑 - 缺少具体命令、环境配置、错误场景或性能 benchmark - 建议内容(如 NIST eval probes)过于泛化,无具体实现路径
8. [EITT Academy — AI Agents 2026 Guide] — ⚠️ 丢弃(教程型内容,无实证数据)
来源: https://eitt.academy/knowledge-base/ai-agents-2026-guide-from-llm-to-multi-agent-systems
可信度: ⭐⭐⭐(在线技术教育平台)
丢弃理由: - 属于技术教育/教程内容,非原创工程研究 - 生产 Agent 评测四维度(任务成功率、轨迹准确率、工具使用效率、成本效益)属于已知框架,无新数据 - 团队能力要求(5 项 Competencies)是综合整理,非原创发现 - 缺少真实环境、命令、性能数据
本次筛选结论
| 条目 | 来源 | 工程价值 | 操作 |
|---|---|---|---|
| Measuring Agents in Production (ICML 2026) | arXiv | ⭐⭐⭐⭐⭐ | 精读 |
| Context Engineering (arXiv 2603.09619) | arXiv | ⭐⭐⭐⭐ | 审稿 |
| LLM Credential Leakage (ASE 2026) | ASE 2026 | ⭐⭐⭐⭐⭐ | 精读 |
| State of Agent Engineering 2026 | LangChain | ⭐⭐⭐ | 参考 |
| Silent Failures Taxonomy (已有记录) | arXiv | ⭐⭐⭐⭐⭐ | 补充元数据 |
| DEV.to Why AI Agents Fail | DEV.to | ⭐⭐ | 丢弃 |
| MLflow Building Prod Agents | MLflow | ⭐⭐ | 丢弃 |
| EITT AI Agents 2026 Guide | EITT | ⭐⭐ | 丢弃 |
建议写入路径
本次实际写入 4 个新草稿:
/shared/research-kb/inbox/jay/2026-06-30-measuring-agents-production-icml2026.md/shared/research-kb/inbox/jay/2026-06-30-context-engineering-multiagent-architecture.md/shared/research-kb/inbox/jay/2026-06-30-llm-agent-credential-leakage-ase2026.md/shared/research-kb/inbox/jay/2026-06-30-state-agent-engineering-2026-langchain.md
是否需要精读: 是,ICML 2026 Oral(Measuring Agents)和 ASE 2026(Credential Leakage)建议优先精读。
是否需要审稿: Context Engineering 论文(约 3 万字 PDF)建议进入审稿队列。
主题页更新建议: 新增或更新"生产 Agent 评测"主题页,引用 ICML 2026 和 ASE 2026 成果。