Jay 工程实践筛选报告 · 2026-09-25
检索范围: arXiv、GitHub、Hugging Face、NVIDIA Blog、Substack、技术博客 主题: LLM Agent 工程实践 / 多智能体系统 / 故障归因 / RAG 工程
一、高价值候选条目(优先保留)
🔴 保留 — MAS-FIRE (arXiv 2602.19843)
标题: MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems 来源: arXiv · 2026-02-23 链接: https://arxiv.org/abs/2602.19843
工程价值判断: - ✅ 15类故障分类体系(Agent内认知错误 + Agent间协调失败) - ✅ 3种非侵入式故障注入机制:prompt modification、response rewriting、message routing manipulation - ✅ 在3个代表性MAS架构上完成系统性评估 - ✅ 对标 Chaos Engineering / Jepsen 的方法论,工程实践意义强 - ✅ Christopher Meiklejohn 已有深度解读(christophermeiklejohn.com)
保留理由: 多智能体系统可靠性工程的系统性方法论,故障分类细致,注入机制可复现,是该方向目前最完整的 fault injection 框架。
标签: #multi-agent #fault-injection #reliability #engineering
建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-mas-fire-multi-agent-reliability.md
🔴 保留 — FALAT (arXiv 2606.00765)
标题: FALAT: Tracing Failures in LLM Agent Trajectories 来源: arXiv · 2026-05-30 链接: https://arxiv.org/abs/2606.00765
工程价值判断: - ✅ 将故障归因建模为 dependency-guided search 问题(非独立步级分类) - ✅ 解决 failure attribution 不能被视为独立步级分类的问题 - ✅ 针对轨迹中的故障传播建模,有源码/方法论可查
保留理由: 故障归因领域的重要理论进展,将问题从独立分类推进到依赖引导搜索,工程意义明确。
标签: #agent-debugging #trajectory-analysis #failure-attribution #arxiv2026
建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-falat-trajectory-failure-attribution.md
🔴 保留 — Awesome-LLM-Agent-Trajectory-Analysis (TSE 2026)
标题: A Survey for LLM Agent Trajectory Analysis: From Failure Attribution to Enhancement 来源: IEEE Transactions on Software Engineering (TSE 2026) · GitHub 同步仓库 链接: https://github.com/IcyFeather233/Awesome-LLM-Agent-Trajectory-Analysis
工程价值判断: - ✅ TSE 2026 顶会论文,学术影响力高 - ✅ 含配套 Hugging Face 数据集(HuggingFace)和 GitHub 实现 - ✅ 覆盖 5 个维度:failure taxonomy / attribution / enhancement / debugging tools / benchmarks - ✅ 收录 AgentProcessBench(8,509个标注步级轨迹)、CodeTraceBench(4,316个代码智能体轨迹)等 Benchmark - ✅ 持续更新,包含 ACL 2026 / ESEC/FSE 2026 / AAAI 2026 等顶会最新文献
保留理由: 多智能体系统故障分析与工程可靠性方向的知识图谱级汇总,含 benchmark 资源,工程研究必读。
标签: #trajectory-analysis #survey #TSE2026 #agent-debugging #benchmark
建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-llm-agent-trajectory-survey-tse2026.md
🟡 保留(有条件)— Anthropic "Build Agents That Run for Hours" Workshop
标题: Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson 来源: YouTube · AI Engineer 频道 · 2026-05-18 链接: https://www.youtube.com/watch?v=mR-WAvEPRwE
工程价值判断: - ✅ 涵盖自评估陷阱(self-evaluation is a trap) - ✅ 对抗性评估器(adversarial evaluator agents)优于自评 - ✅ context compaction 不能解决 coherence drift,但 structured handoffs 可以 - ✅ 将工作分解为可测试的 sprint contracts - ✅ 用 LLM 可应用的 rubric 评估主观输出 - ✅ 将 traces 作为主要调试环 - ⚠️ 视频形式,需要额外提取文字版
保留理由: Anthropic 一线工程师亲授,主题针对长期运行 agent 的工程挑战,具体到错误模式和架构决策。
标签: #anthropic #agent-engineering #long-running-agents #workshop
建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-anthropic-long-running-agents-workshop.md
🟡 保留(有条件)— llm-trading-agent 工程案例
标题: Multi-Agent LLM Trading Agent — Architecture & Engineering Case Study 来源: GitHub · olkuznetsov/llm-trading-agent 链接: https://github.com/olkuznetsov/llm-trading-agent
工程价值判断: - ✅ 自改进控制循环(optimizer agent 调参驱动其他 agent) - ✅ 防范 reward-hacking 的具体策略:stop-condition 作为数据而非硬约束 - ✅ 4个专业化 LLM brain 通过结构化状态(config file + trade journal)通信 - ✅ 闭环学习机制,每个 brain 有独立 system prompt + output schema + validation - ✅ 工程反思:最高杠杆工作是数据层和可靠性层,而非模型选择 - ⚠️ 交易代码未公开,仅作工程参考
保留理由: 少有的多智能体自改进闭环实战工程记录,对理解 agent 自我优化与约束边界有高参考价值。
标签: #multi-agent #self-improving #engineering-case-study #architecture
建议写入路径: /shared/research-kb/inbox/jay/2026-09-25-llm-trading-agent-architecture.md
二、丢弃条目(说明原因)
❌ 丢弃 — AI-Engineering-Notes (rehan243/smqd19 GitHub)
丢弃理由: 两篇均为泛泛的 LangChain 框架介绍,代码片段为零散 API 调用示例,无真实环境配置、无性能数据、无错误案例、无可复现步骤。属于"XX 框架入门级概述"。
❌ 丢弃 — NVIDIA Blog: Multi-Modal RAG Blueprint
丢弃理由: 主要是 NVIDIA NeMo Retriever 产品介绍,技术细节偏少,非开源/不可复现。工程价值不足。
❌ 丢弃 — Meilisearch / Techment / Articsledge RAG 文章
丢弃理由: 均为 2025 年旧文或营销性质内容,无命令/源码/性能数据,科普性质明显。
❌ 丢弃 — System Design Newsletter (substack) AI Engineering 21概念
丢弃理由: 内容摘要来自 X/Twitter post,Substack 本身只是索引链接,无原创技术内容。不符合 CSDN 同等筛选标准。
❌ 丢弃 — kanerika.com / mewelch.substack.com 等
丢弃理由: 咨询公司营销文或管理层订阅通讯,无工程实现细节,不满足筛选条件。
三、Substack 线索记录
| 专栏名 | 主题 | 链接 | 价值评估 |
|---|---|---|---|
| Almost Timely (Christopher Patti) | AI 应用/自动化工作流 | almosttimely.substack.com | ⚠️ 营销向,工程深度一般 |
| Kevin R. Haylett | 物理/数学/AI 安全 | kevinhaylett.substack.com | 学术向,非工程实践 |
| System Design Newsletter (Neo Kim) | AI 工程系统设计 | newsletter.systemdesign.one | ✅ 工程深度较好,需进一步核验 |
Substack 专项结论: 本轮 Substack 来源整体工程价值偏低,推荐持续关注 systemdesign.one,其 A2A Protocol、AI Agent Infrastructure 等条目与本知识库主题高度相关。
四、汇总
本次保留条目:5 条 1. MAS-FIRE (arXiv 2602.19843) — 多智能体故障注入 2. FALAT (arXiv 2606.00765) — 轨迹故障归因搜索 3. Awesome-LLM-Agent-Trajectory-Analysis (TSE 2026) — 知识图谱级综述 4. Anthropic Long-Running Agents Workshop — 工程实践工作坊 5. llm-trading-agent — 自改进多智能体工程案例
本次丢弃条目:7+ 条(主要因无真实工程内容/可复现步骤)
分类标签汇总: #multi-agent #fault-injection #reliability #trajectory-analysis #agent-debugging #benchmark #long-running-agents #self-improving
Jay · 2026-09-25 · 工程筛选第二轮 · 本次无需 Substack 深度精读