Jay 工程实践筛选报告 · 2026-09-25

检索范围: arXiv、GitHub、Hugging Face、NVIDIA Blog、Substack、技术博客 主题: LLM Agent 工程实践 / 多智能体系统 / 故障归因 / RAG 工程


一、高价值候选条目(优先保留)

🔴 保留 — MAS-FIRE (arXiv 2602.19843)

标题: MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems 来源: arXiv · 2026-02-23 链接: https://arxiv.org/abs/2602.19843

工程价值判断: - ✅ 15类故障分类体系(Agent内认知错误 + Agent间协调失败) - ✅ 3种非侵入式故障注入机制:prompt modification、response rewriting、message routing manipulation - ✅ 在3个代表性MAS架构上完成系统性评估 - ✅ 对标 Chaos Engineering / Jepsen 的方法论,工程实践意义强 - ✅ Christopher Meiklejohn 已有深度解读(christophermeiklejohn.com)

保留理由: 多智能体系统可靠性工程的系统性方法论,故障分类细致,注入机制可复现,是该方向目前最完整的 fault injection 框架。

标签: #multi-agent #fault-injection #reliability #engineering 建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-mas-fire-multi-agent-reliability.md


🔴 保留 — FALAT (arXiv 2606.00765)

标题: FALAT: Tracing Failures in LLM Agent Trajectories 来源: arXiv · 2026-05-30 链接: https://arxiv.org/abs/2606.00765

工程价值判断: - ✅ 将故障归因建模为 dependency-guided search 问题(非独立步级分类) - ✅ 解决 failure attribution 不能被视为独立步级分类的问题 - ✅ 针对轨迹中的故障传播建模,有源码/方法论可查

保留理由: 故障归因领域的重要理论进展,将问题从独立分类推进到依赖引导搜索,工程意义明确。

标签: #agent-debugging #trajectory-analysis #failure-attribution #arxiv2026 建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-falat-trajectory-failure-attribution.md


🔴 保留 — Awesome-LLM-Agent-Trajectory-Analysis (TSE 2026)

标题: A Survey for LLM Agent Trajectory Analysis: From Failure Attribution to Enhancement 来源: IEEE Transactions on Software Engineering (TSE 2026) · GitHub 同步仓库 链接: https://github.com/IcyFeather233/Awesome-LLM-Agent-Trajectory-Analysis

工程价值判断: - ✅ TSE 2026 顶会论文,学术影响力高 - ✅ 含配套 Hugging Face 数据集(HuggingFace)和 GitHub 实现 - ✅ 覆盖 5 个维度:failure taxonomy / attribution / enhancement / debugging tools / benchmarks - ✅ 收录 AgentProcessBench(8,509个标注步级轨迹)、CodeTraceBench(4,316个代码智能体轨迹)等 Benchmark - ✅ 持续更新,包含 ACL 2026 / ESEC/FSE 2026 / AAAI 2026 等顶会最新文献

保留理由: 多智能体系统故障分析与工程可靠性方向的知识图谱级汇总,含 benchmark 资源,工程研究必读。

标签: #trajectory-analysis #survey #TSE2026 #agent-debugging #benchmark 建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-llm-agent-trajectory-survey-tse2026.md


🟡 保留(有条件)— Anthropic "Build Agents That Run for Hours" Workshop

标题: Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson 来源: YouTube · AI Engineer 频道 · 2026-05-18 链接: https://www.youtube.com/watch?v=mR-WAvEPRwE

工程价值判断: - ✅ 涵盖自评估陷阱(self-evaluation is a trap) - ✅ 对抗性评估器(adversarial evaluator agents)优于自评 - ✅ context compaction 不能解决 coherence drift,但 structured handoffs 可以 - ✅ 将工作分解为可测试的 sprint contracts - ✅ 用 LLM 可应用的 rubric 评估主观输出 - ✅ 将 traces 作为主要调试环 - ⚠️ 视频形式,需要额外提取文字版

保留理由: Anthropic 一线工程师亲授,主题针对长期运行 agent 的工程挑战,具体到错误模式和架构决策。

标签: #anthropic #agent-engineering #long-running-agents #workshop 建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-anthropic-long-running-agents-workshop.md


🟡 保留(有条件)— llm-trading-agent 工程案例

标题: Multi-Agent LLM Trading Agent — Architecture & Engineering Case Study 来源: GitHub · olkuznetsov/llm-trading-agent 链接: https://github.com/olkuznetsov/llm-trading-agent

工程价值判断: - ✅ 自改进控制循环(optimizer agent 调参驱动其他 agent) - ✅ 防范 reward-hacking 的具体策略:stop-condition 作为数据而非硬约束 - ✅ 4个专业化 LLM brain 通过结构化状态(config file + trade journal)通信 - ✅ 闭环学习机制,每个 brain 有独立 system prompt + output schema + validation - ✅ 工程反思:最高杠杆工作是数据层和可靠性层,而非模型选择 - ⚠️ 交易代码未公开,仅作工程参考

保留理由: 少有的多智能体自改进闭环实战工程记录,对理解 agent 自我优化与约束边界有高参考价值。

标签: #multi-agent #self-improving #engineering-case-study #architecture 建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-llm-trading-agent-architecture.md


二、丢弃条目(说明原因)

❌ 丢弃 — AI-Engineering-Notes (rehan243/smqd19 GitHub)

丢弃理由: 两篇均为泛泛的 LangChain 框架介绍,代码片段为零散 API 调用示例,无真实环境配置、无性能数据、无错误案例、无可复现步骤。属于"XX 框架入门级概述"。


❌ 丢弃 — NVIDIA Blog: Multi-Modal RAG Blueprint

丢弃理由: 主要是 NVIDIA NeMo Retriever 产品介绍,技术细节偏少,非开源/不可复现。工程价值不足。


❌ 丢弃 — Meilisearch / Techment / Articsledge RAG 文章

丢弃理由: 均为 2025 年旧文或营销性质内容,无命令/源码/性能数据,科普性质明显。


❌ 丢弃 — System Design Newsletter (substack) AI Engineering 21概念

丢弃理由: 内容摘要来自 X/Twitter post,Substack 本身只是索引链接,无原创技术内容。不符合 CSDN 同等筛选标准。


❌ 丢弃 — kanerika.com / mewelch.substack.com 等

丢弃理由: 咨询公司营销文或管理层订阅通讯,无工程实现细节,不满足筛选条件。


三、Substack 线索记录

专栏名 主题 链接 价值评估
Almost Timely (Christopher Patti) AI 应用/自动化工作流 almosttimely.substack.com ⚠️ 营销向,工程深度一般
Kevin R. Haylett 物理/数学/AI 安全 kevinhaylett.substack.com 学术向,非工程实践
System Design Newsletter (Neo Kim) AI 工程系统设计 newsletter.systemdesign.one ✅ 工程深度较好,需进一步核验

Substack 专项结论: 本轮 Substack 来源整体工程价值偏低,推荐持续关注 systemdesign.one,其 A2A Protocol、AI Agent Infrastructure 等条目与本知识库主题高度相关。


四、汇总

本次保留条目:5 条 1. MAS-FIRE (arXiv 2602.19843) — 多智能体故障注入 2. FALAT (arXiv 2606.00765) — 轨迹故障归因搜索 3. Awesome-LLM-Agent-Trajectory-Analysis (TSE 2026) — 知识图谱级综述 4. Anthropic Long-Running Agents Workshop — 工程实践工作坊 5. llm-trading-agent — 自改进多智能体工程案例

本次丢弃条目:7+ 条(主要因无真实工程内容/可复现步骤)

分类标签汇总: #multi-agent #fault-injection #reliability #trajectory-analysis #agent-debugging #benchmark #long-running-agents #self-improving


Jay · 2026-09-25 · 工程筛选第二轮 · 本次无需 Substack 深度精读