Jay 工程筛选 · 2026-07-27 下午场
实例:Jay | 检索范围:arXiv / GitHub / Substack / Medium 工程博客 | 角色:二次筛选(真实性/命令/源码/性能/可复现性) 覆盖时段:2026-07-27 下午 | 去重参考:上午场 draft(1100)
✅ 保留条目(新发现)
条目 A:arXiv 2605.08717 — PROBE:面向 SWE Agent 的 Failure-Anchored 恢复框架
来源:arXiv | ID: 2605.08717v1 类型:Agent 调试 / 可靠性工程 原文核心工程内容: - 提出 PROBE 框架:记录跨异构 agent 栈的 recovery-relevant 信号,通过共享遥测 schema 实例化 - 跨栈验证:LiteLLM-based SWE-agent、LangChain-based ReAct+MCP(AIOpsLab)、标准 LangGraph — recovery pipeline 不变 - 核心设计原则:不编码特定框架的恢复逻辑,而是记录框架无关的 recovery 信号 - 对比 Related Work:AgentRx(跨域 taxonomy 定位关键失败步骤)、LLMRCA(metrics/logs/traces 多级诊断)、CodeTracer(重建 trace tree 定位失败阶段) - 解决实际问题:SWE agent 在真实代码库任务(bug repair、issue resolution)中失败率极高的生产痛点
保留理由: - ✅ 框架无关设计:核心贡献是跨栈统一的 recovery schema,不是另一个具体框架 - ✅ 跨栈验证:LiteLLM / LangChain+MCP / AIOpsLab 三个不同栈验证,实用性强 - ✅ 有系统性相关工作对比,定位清晰 - ⚠️ 需读取原文确认 shared telemetry schema 的具体字段定义和实例化方式
可信度:高(arXiv 同行评审,正式发表级别)
后续行动:精读 schema 定义部分;与 awesome-harness-engineering 中的 TraceCoder / AgentStepper 横向比较
分类标签:Agent可靠性 SWE调试 框架无关 遥测 LangChain MCP 恢复工程
条目 B:arXiv 2602.10133 — AgentTrace:Agent 系统可观测性结构化日志框架
来源:arXiv | ID: 2602.10133 | AAAI 2026 Workshop LaMAS 类型:可观测性 / 结构化日志 原文核心内容: - 为 Agent 系统设计的结构化日志框架,标准化日志语义 - 目标:解决 Agent 执行轨迹碎片化、难以跨步关联的问题 - Workshop:AAAI 2026 LaMAS(Language Models and Agent-based Systems)
保留理由: - ✅ 结构化日志设计有工程直接价值 - ✅ AAAI 2026 Workshop 认证,有一定同行评审背书 - ⚠️ 需读取论文确认 schema 字段和实际代码示例
可信度:中(Workshop 论文,需核验代码可用性)
后续行动:检索 GitHub 是否有对应开源实现;与 Zylos/AgentSight 文章中的 OTel 方案对比
分类标签:Agent可观测性 结构化日志 AAAI2026 遥测 调试
条目 C:SemOpt — LLM-Driven 代码优化(cProfile/line_profiler 热点分析)
来源:arXiv 2510.16384v2 类型:性能工程 / 代码优化 原文核心工程数据: - Python 项目热点定位:cProfile + line_profiler(>0.1% 执行时间阈值) - C/C++ 项目热点定位:perf + gcov - 实验项目:click、flask、jinja2、requests、scrapy - 优化 pipeline:profiling → hotspot 识别 → LLM 生成优化 → 合并验证
保留理由: - ✅ 有真实 profiling 工具和具体阈值(>0.1%) - ✅ 有完整工具链(perf/gcov/cProfile/line_profiler) - ✅ Python 主流项目(flask/requests)做验证,有复现基础 - ⚠️ 需读取原文确认优化效果数据
可信度:中(arXiv,有具体工具和阈值,方法论可验证)
后续行动:提取 profiling 阈值和优化结果;可作为"LLM+性能工程"教学案例
分类标签:性能工程 LLM优化 cProfile perf 代码优化 Python
条目 D:stas00/ml-engineering — GPU Mode 2026 讲座 + 调试技能
来源:GitHub stas00/ml-engineering | https://github.com/stas00/ml-engineering 类型:ML 工程知识库 / GPU 调试 原文核心工程内容: - 配套 SKILL.md:可让 AI agent 学习训练和运营大规模 ML 模型 - 配套技能:The Art of Debugging、Stas' Python Cookbook - 2026-01-10 GPU Mode 社区讲座:accelerator 性能现实、network 和 storage 如何影响 ensemble 性能 - 讲座背景:Mark Saroufim 组织,提供实际支持
保留理由: - ✅ SKILL.md 可直接注入 agent:让 AI 学习 GPU 调试的具身知识 - ✅ 有配套调试书,专注"如何让 ML 系统在 GPU 上正确运行" - ✅ 2026 年 1 月最新讲座内容,涵盖 accelerator 性能现实
可信度:高(活跃维护的知名 ML 工程知识库)
后续行动:读取 SKILL.md 内容;提取 GPU 调试模式和 Stas' Python Cookbook 核心 recipe
分类标签:ML工程 GPU调试 分布式训练 知识库 Agent技能 Performance
条目 E:GitHub awesome-harness-engineering — LLM 测试/harness 工程
来源:GitHub ai-boost/awesome-harness-engineering | https://github.com/ai-boost/awesome-harness-engineering 类型:测试工程 / Agent 调试 原文核心工程数据: - TraceCoder(ICSE 2026):多 Agent 协同调试 loop - Instrumentation Agent 注入诊断探针 - Analysis Agent 因果 trace 诊断(含 HLLM:从历史失败中提取经验) - Repair Agent 带回滚的验证修复 - Pass@1 相对提升 34.43% - OpenObserve:统一可观测性平台,关联 Agent 决策与系统级事件(网络延迟、GPU 内存压力) - Braintrust:评估优先,Stripe/Notion/Dropbox/Perplexity 生产使用 - Brainstore:全量 trace 搜索,无需 sampling - AgentStepper(Feb 2026):交互式 agent 执行轨迹 debugger - 组织 raw logs 为结构化对话 - NASA TLX 认知负荷评分:5.4→2.4
保留理由: - ✅ 有具体数字:TraceCoder Pass@1 +34.43%;AgentStepper 认知负荷 5.4→2.4 - ✅ ICSE 2026 + Feb 2026 双时间戳,较新 - ✅ Braintrust 有真实生产用户(Stripe 等) - ✅ AgentStepper 解决了"multi-turn agent 调试认知过载"这个真实痛点
可信度:高(ICSE 顶会 + 知名生产用户背书)
后续行动:读取 AgentStepper 实现;提取 TraceCoder HLLM 机制;与 PROBE 对比 recovery 方案差异
分类标签:Agent调试 测试工程 ICSE2026 TraceCoder AgentStepper Braintrust Harness
条目 F:Substack theaiengineer — AI Agents Stack 2026 Edition
来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 类型:Agent 工程架构 / 生产洞察 原文核心工程洞察: - Guardrails 演进:2024 年是 input/output 过滤;2026 年是 tool-call 授权、rate limit 执行、action 验证。"guardrails before action" 模式出现——在 tool 执行层而非输出层授权 - OWASP MCP Top 10(beta):首个 tool-connected agent 安全 checklist - Eval 缺口:LangChain 调查显示 89% 已实现 observability,仅 52% 有 evals,37pt 差距是生产质量死亡区 - 三-tier eval 收敛:PR 快速检查 → LLM judge 夜间回归套件 → 生产监控漂移告警 - 新 benchmark:Context-Bench(memory)、Recovery-Bench(错误恢复)、Terminal-Bench(coding agents)
保留理由: - ✅ 37pt eval 缺口是真实数据,有出处(LangChain State of Agent Engineering survey) - ✅ "guardrails before action" 是经过生产教训总结出的具体模式 - ✅ OWASP MCP Top 10 是首个针对 MCP 协议的安全 checklist,有工程必须性 - ⚠️ Substack 需注册,内容片段化;核心数据需从摘要提取
可信度:中高(theaiengineer 是知名 AI 工程 newsletter,有具体引用来源)
后续行动:获取 OWASP MCP Top 10 完整 checklist;核验 89%/52% 数据来源
分类标签:Agent架构 Guardrails MCP安全 Eval工程 OWASP 生产质量
条目 G:Substack theaiengineer — Why AI Agents Fail in Production(Paolo Perrone)
来源:https://theaiengineer.substack.com/p/why-ai-agents-keep-failing-in-production 类型:Agent 生产故障 / 工程原则 原文核心工程洞察: - 权限最小化原则:Treat agents like junior engineers on their first week。从最小权限开始,按需扩展。读权限全开,写权限加 reviewer。不可删除权限强制加保险 - 不可逆操作必须人工审批:Amazon 跨 agent 部署的核心教训——10 步 workflow 中一步错误可能导致删库 - 可观测行为:每步 tool call 都要 log,每个决策点都要 trace - LangChain May 2025 事故 post-mortem:5 项具体修复项(proactive 证书监控、自动化过期告警、升级协议、post-mortem 分发清单、状态页迁移 SLA) - Deterministic Policy Gate:无 LLM 调用、无推理、无轮询;sub-100ms,fraction of a penny;写入 Merkle-tree 认证账本
保留理由: - ✅ 工程原则具体可操作:权限最小化、不可逆操作审批、可观测行为 - ✅ LangChain 事故 post-mortem 是真实生产事件,有具体 5 项修复清单 - ✅ Deterministic Policy Gate 提供具体架构模式(sub-100ms,Merkle-tree) - ✅ Amazon 文档化教训,来源可靠
可信度:高(真实生产事故 post-mortem,知名工程 newsletter)
后续行动:提取 5 项 LangChain post-mortem 清单作为生产检查项;对比 Paolo 的 Policy Gate 与 PROBE 的 recovery 机制
分类标签:Agent安全 权限设计 生产故障 Policy-Gate Post-mortem Amazon
条目 H:Medium — SGLang vs vLLM Benchmark(含真实命令)
来源:https://medium.com/@saidines12/sglang-vs-vllm-part-1-benchmark-performance-3231a41033ca
类型:推理工程 / Benchmark 复现
原文核心命令与数据:
- SGLang 启动:python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
- SGLang benchmark:python3 -m sglang.bench_serving --backend sglang --num-prompt 10 --host 127.0.0.1
- SGLang DeepSeek 支持:--enable-dp-attention flag
- vLLM 启动(含 profiler):VLLM_TORCH_PROFILER_DIR=./vllm_profile python -m vllm.entrypoints.openai.api_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
- vLLM benchmark:python benchmarks/benchmark_serving.py --backend vllm --model deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --dataset-name sharegpt --dataset-path sharegpt.json --profile --num-prompts 10
- 安装命令:pip install sgl-kernel --force-reinstall --no-deps + pip install "sglang[all]" --find-links
- 硬件:2x NVIDIA L40 GPU
保留理由:
- ✅ 有完整可复现命令(启动 + benchmark + profiling)
- ✅ --enable-dp-attention flag 是 SGLang 对 DeepSeek 系列的具体支持说明
- ✅ VLLM profiler 环境变量是生产级调试技巧
- ⚠️ 使用 vLLM 0.7.1(V1 架构默认从 0.8.0 开始),需注意版本差异
可信度:中(个人实测,有命令但版本略旧)
后续行动:更新命令适配 vLLM v0.8+ V1 架构;对比上午场 benchmark 数据
分类标签:推理工程 SGLang vLLM Benchmark Profiling 可复现命令
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| AIAMastery Substack — Production AI Engineering 课程推广 | 商业课程软文,无具体工程数据或可复现步骤 |
| DEV Community — Why AI Agents Fail in Production | 概念总结为主,无新数据,与 theaiengineer Substack 内容重叠 |
| LinkedIn — Anatomy of AI Agent 2026 | LinkedIn 帖子,深度不足,无具体命令或数字 |
| Hugobowne Substack — 750+ Real-World Deployments | Oct 2025,时间偏旧;与今日下午内容重叠度高 |
| Addy Osmani Substack — LLM Coding Workflow | 个人工作流,非系统性工程分析 |
| FutureAGI — Multi-agent Failure Modes | Substack 免费预览片段化;需付费获取全文 |
交叉参考(避免与其他实例重复)
| 已有实例覆盖 | 本场不重复产出 |
|---|---|
| Tom 的 agent-e1prep(agent 深度 prep) | 聚焦 H2 调试/测试/Harness 工程 |
| Stephen 的 coordination check(多智能体协调) | 本场以单/多 Agent 可靠性为主 |
| Spark 的 agent-rag-radar | 聚焦推理工程和 benchmark 命令 |
| Flyp 的 rss Cameron Wolfe | 不重复神经架构/模型训练 |
| 上午场 Jay engineering filter | 本场新产出 8 个条目,重点在 H2 调试/可观测性 |
建议写入路径
文件路径:/shared/research-kb/inbox/jay/2026-07-27-1450-jay-engineering-filter.md
主题标签:Agent可靠性 推理工程 Benchmark 可观测性 调试工程 Harness
本场新增核心洞察: 1. PROBE(arXiv 2605.08717)—— 框架无关的 SWE Agent 恢复 schema,跨 LiteLLM/LangChain/MCP 三栈验证 2. awesome-harness-engineering—— TraceCoder ICSE2026 + AgentStepper Feb2026,含 Pass@1 +34.43% 等具体数字 3. AgentEval 缺口(89% vs 52%)是生产质量死亡区—— LangChain 官方调查数据 4. Substack theaiengineer — "guardrails before action" + LangChain May2025 post-mortem 5项清单 5. SGLang vs vLLM benchmark 命令全集(含 profiler 环境变量和 --enable-dp-attention) 6. stas00/ml-engineering — SKILL.md 可注入 agent 的 GPU 调试知识
是否需要精读: - ⭐⭐⭐ PROBE schema 定义(条目 A) - ⭐⭐⭐ awesome-harness-engineering TraceCoder HLLM 机制(条目 E) - ⭐⭐ AgentStepper 实现(条目 E) - ⭐⭐ stas00 SKILL.md 内容(条目 D) - ⭐⭐ SemOpt profiling pipeline(条目 C)