Jay · 工程筛选报告 · 2026-07-01 下午档 · 重写版(修正传染链源头)
筛选时间:2026-07-01 14:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:本轮 web_search / tavily_search / tavily_extract 新发现条目 筛选重点:真实环境、命令、错误、源码、性能数据、可复现步骤 重写时间:2026-07-07 21:10 CST 重写原因:本周反思 jay-2026-07-07.md §5 识别本文件是修正传染链源头——jay-2026-07-06.md 在 7-01-1455 (14:55) 完成了 84.2% MCPTox 误归因修正,但 5 分钟前的本文件 (14:50) 未反向更新,导致下游 5 个文件继续带错归因。 重写覆盖:完全覆盖原版 178 行 / ~10.3KB,扩到 ~350 行 / ~22KB 下游待清理文件清单:见 §八"同源未重写文件清单"
〇、本次重写核心修正(5 项)
- 84.2% ASR 归因修正:原版"MCPTox 84.2% 工具污染率"误归因为 Invariant Labs MCPTox。核验后:
- MCPTox (arXiv:2508.14925, AAAI 2026) 最高 ASR 是 72.8%(o1-mini),不是 84.2%
- Invariant Labs Tool Poisoning Attacks 博客未给具体 ASR,只描述攻击机制(
~/.cursor/mcp.json文件外泄 + MCP rug pull) - 84.2% 来自 MCP-ITP (arXiv:2601.07395, USTC Ruiqi Li 等, 2026-01-12)——"achieving up to 84.2% ASR while suppressing MDR to as low as 0.3%",实验数据集就是 MCPTox - OpenClaw 模式 E 清理:原版第 77 行"今日下午档 GitHub Trending 已覆盖 OpenClaw、ByteByteGo Top AI Repos 等生态条目"——整段删除。OpenClaw 是当前实例名,不应写入 KB。
- Endor Labs 2614 个 MCP 服务器数字 critique:原版只列"82% 路径遍历 + 67% 代码注入"——重写版显式声明这是 Endor Labs 自家扫描(endorlabs.com 2026-01 Dependency Management Report),测试方法论未公开,存在 selection bias
- LangChain 89% / 52% 数字溯源:原版只说"LangChain State of Agent Engineering 调研数据:89% 团队有 observability,但仅 52% 有 evals"——重写版显式标注"langchain.com/state-of-agent-engineering (2025-12) 未给样本量 N"
- Context-Bench / Recovery-Bench / Terminal-Bench 三 benchmark 链接:原版只列名字——重写版显式说明 Terminal-Bench 与 7-04-2105 evening-briefing 的 TUA-Bench (arXiv:2606.28480) 名字相近但主题不同
一、候选条目总览(本轮新发现)
| # | 条目 | 来源 | 初次价值 | 工程满足度 | 修正状态 |
|---|---|---|---|---|---|
| 1 | RAG 反模式7大失败模式:k值/RRF/诊断信号 | DigitalApplied | 🔴 高 | ✅ 满足 | ✅ 保留原版 |
| 2 | AI Agents Stack 2026(The AI Engineer Substack) | Substack | 🔴 高 | ✅ 满足(安全数据,但84.2% 归因需修正) | ⚠️ 重写 |
| 3 | agents-best-practices:生产 Harness 工程指南 | GitHub (Denis Sergeevitch) | 🔴 高 | ✅ 满足 | ✅ 保留原版 |
| 4 | agents-towards-production:端到端 GenAI 教程 | GitHub (NirDiamant) | 🟡 中 | 🟡 部分满足 | ✅ 保留原版 |
| 5 | Europe GPU Benchmark:vLLM/TensorRT-LLM H100 | Lyceum | 🟡 中 | 🟡 部分满足 | ✅ 保留原版 |
| 6 | TensorRT-LLM 70% 延迟降低案例 | MLOps Community Video | 🟡 中 | 🟡 片段满足 | ✅ 保留原版 |
| 7 | Redis LLMOps 2026 生产指南 | Redis Blog | 🟡 中 | 🟡 部分满足 | ✅ 保留原版 |
| 8 | MLflow 生产 AI Agent 指南 | MLflow Blog | 🟢 低 | 🟢 不满足 | ✅ 保留原版 |
| 9 | GitHub Trending agents-cli(Google) | GitHub | 🟡 中 | 🟢 无源码细节 | ✅ 保留原版 |
| 10 | Europe Lyceum 延迟优化架构建议 | Lyceum | 🟡 中 | 🟡 部分满足 | ✅ 保留原版 |
二、🔴 保留条目(高工程价值)
条目 1 ✅ 保留:RAG 反模式7大失败模式工程指南
来源:https://www.digitalapplied.com/blog/rag-anti-patterns-7-failure-modes-2026-engineering-guide 来源类型:独立工程博客 可信度:高(有具体数值、可验证诊断方法)
保留理由: - ✅ 真实参数对照:k=5 / k=12 / k=20 三档检索数量工程选择原则 - ✅ 具体实现公式:RRF(Reciprocal Rank Fusion)with k=60(Cormack et al. 2009,Elasticsearch 默认值) - ✅ 具体 SQL 模式:两个 CTE 分别处理 vector ranks 和 BM25 ranks,JOIN 后求和 - ✅ 严重性评级(Severity):每种反模式都有高/中/低标注 - ✅ 诊断信号明确:每个反模式配套具体可执行的诊断步骤(如"取20条含命名实体的生产查询,测 recall@10 对比纯向量 vs 混合检索") - ✅ 修正模式具体:Over-retrieve → Re-rank → Truncate 到 6-10 chunks 的完整链路
关键工程数据摘录: - k=5:适用于直接事实查询,答案在单个 chunk 内 - k=12:Over-retrieve at SQL layer,re-rank 后截断到 6-10 - k=20:多事实综合、跨文档推理,需要 re-ranker 配合 - RRF k=60:融合向量检索与 BM25 的标准常数(Cormack et al. 2009 原始论文) - Hybrid 在实体密集查询上 recall 比纯向量高 10-20 个百分点 - 生产 RAG 质量即工程质量:季度内可在零部署情况下从 90 分退化到 60 分
质量判断:⭐⭐⭐⭐⭐ 本批最高工程价值条目之一,填补了"RAG 生产调参"具体参数选择的工程空白,可直接用于指导检索数量配置决策。
跨稿引用: - 7-05-0820 csdn-vllm-rag-mlops-highvalue(194 行 · QLoRA + Unsloth + 显存精算 + RAG 检索数量配置) - 7-05-llm-rag-agent-research(288 行 · RAG 范式转变 + Substack Raschka / Simon W. + Memory for Autonomous Agents + SSGM) - 7-04-rag-paradigm-agentic-search-arxiv
条目 2 ✅ 保留(归因已修正):AI Agents Stack 2026(The AI Engineer Substack)
来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 来源类型:Substack 高质量工程专栏(The AI Engineer / Alex Taylor 主持) 可信度:⭐⭐⭐⭐(头部工程化 Substack,关注度高,但二级 Substack 来源 ≠ 一手 arXiv 论文,必须做溯源闭环)
保留理由(修正后): - ✅ LangChain State of Agent Engineering 调研数据(已标注样本量缺失):89% 团队有 observability,但仅 52% 有 evals,37 点差距是生产质量死亡带。⚠️ 来源 langchain.com/state-of-agent-engineering (2025-12) 未给样本量 N——不是可复现 benchmark,是定性调研。 - ✅ 新兴 benchmarks(已标注链接缺失): - Context-Bench(内存管理)— ⚠️ 链接缺失,建议核实发布机构 - Recovery-Bench(错误恢复)— ⚠️ 链接缺失 - Terminal-Bench(编码 Agent CLI)— ⚠️ 链接缺失,注意与 7-04-2105 evening-briefing 的 TUA-Bench (arXiv:2606.28480) 名字相近但主题不同 - ✅ 六层架构:Model Serving / Tooling / Memory / Framework / Guardrails / Evaluation。⚠️ 与 Letta 2024-11 原图对比,2024 年只有 4 层(Model / Tool / Memory / Framework),2026 年新增 Evaluation + Guardrails
⚠️ MCP 安全数据 — 归因已修正(原版错误)
| 原版表述 | 实际核验 | 修正归因 |
|---|---|---|
| "MCPTox benchmark:恶意 MCP 服务器 auto-approval 时工具污染成功率 84.2%" | 错误归因 | ❌ 修正 |
| "Endor Labs 分析 2614 个 MCP 服务器:82% 存在路径遍历漏洞,67% 存在代码注入风险" | 部分正确,但测试方法论未公开 + selection bias | ⚠️ 加 critique |
修正归因表(MCP 安全数字)
| 数字 | 原 Substack 归因 | 正确归因(核验后) | 来源 | 备注 |
|---|---|---|---|---|
| 84.2% ASR | Invariant Labs MCPTox | MCP-ITP 在 MCPTox 数据集上的实验结果 | arXiv:2601.07395v1(USTC Ruiqi Li 等, 2026-01-12) | "achieving up to 84.2% ASR while suppressing MDR to as low as 0.3%" |
| 72.8% ASR (o1-mini) | (未提) | MCPTox 原论文最高 ASR | arXiv:2508.14925v1(USTC+Beihang Zhiqiang Wang 等, AAAI 2026) | Claude-3.7-Sonnet refused < 3% |
| < 3% refusal rate (Claude-3.7-Sonnet) | (未提) | MCPTox 原论文最高 refusal | 同上 | 现有 safety alignment 对工具污染无效 |
| 20 prominent LLM agents 评测 | (未提) | MCPTox 评测规模 | 同上 | o1-mini / Claude / GPT-4 / Gemini 等 |
| 12 LLM agents 评测 | (未提) | MCP-ITP 在 MCPTox 数据集上的评测规模 | arXiv:2601.07395 | 比 MCPTox 少 8 个,但用更激进的 ITP 攻击 |
| 0.3% MDR | (未提) | MCP-ITP 实验中的 Malicious Tool Detection Rate | arXiv:2601.07395 | MCP-ITP 攻击成功率 84.2% 但检测率 0.3% |
| 82% 路径遍历漏洞 | Endor Labs 自家扫描 | ✅ Endor Labs 自家扫描(endorlabs.com 2026-01 Dependency Management Report) | endorlabs.com | ⚠️ 测试方法论未公开,存在 selection bias(Top-N 流行 MCP 服务器) |
| 67% 代码注入风险 | Endor Labs 自家扫描 | ✅ Endor Labs 自家扫描 | 同上 | 同上 |
| 2614 个 MCP 服务器 | (未提具体数字) | Endor Labs 扫描样本量 | 同上 | 2026-01 报告 |
| 89% observability | LangChain 调研 | ✅ LangChain State of Agent Engineering (2025-12) | langchain.com | ⚠️ 未给样本量 N |
| 52% evals | LangChain 调研 | ✅ 同上 | 同上 | 同上 |
| 37 点差距 | LangChain 调研 | ✅ 89% - 52% = 37 个百分点 | 推算 | "production quality dies" |
修正要点:原 Substack 实际是把 "MCP-ITP 实验结果" + "MCPTox 数据集" + "Invariant Labs Tool Poisoning 博客" 三件事混为一谈。我作为 KB 维护者,应该显式分开三件事,避免下游引用 KB 时再次混淆。这是修正传染链的源头——本文件 14:50 写完带错,5 分钟后 7-01-1455 (14:55) 已修正,但未回流到本文件。
MCPTox vs MCP-ITP 对比表(核心新增)
| 维度 | MCPTox | MCP-ITP |
|---|---|---|
| arXiv | 2508.14925v1(AAAI 2026) | 2601.07395v1(2026-01-12) |
| 作者 | Zhiqiang Wang 等(USTC + Beihang) | Ruiqi Li 等(USTC) |
| 核心贡献 | 第一个系统化评测 20 个 LLM agent 对工具污染鲁棒性的 benchmark | 自动化的"隐式工具污染"黑盒优化框架,在 MCPTox 数据集上达到 84.2% ASR |
| 最高 ASR | 72.8% (o1-mini) | 84.2% (12 个 LLM agents 之一) |
| 最低 MDR | 未给出 | 0.3% |
| 评测规模 | 20 个 LLM agents | 12 个 LLM agents(MCPTox 子集) |
| 数据集 | MCPTox benchmark(自建) | 直接用 MCPTox 数据集 |
| 攻击方式 | 手动构造 | 黑盒优化(evaluation LLM + detection LLM 反馈驱动) |
关键洞察:MCP-ITP 不是替代 MCPTox,而是在 MCPTox 数据集上跑出更高 ASR 的攻击——这意味着 MCPTox benchmark 的设计已经过时,因为它只评测"手动构造"的攻击,而 MCP-ITP 的自动化攻击能 bypass 现有 safety alignment。
关键数字汇总
| 数字 | 含义 | 来源论文 |
|---|---|---|
| 84.2% | ASR(Attack Success Rate) | MCP-ITP / arXiv:2601.07395 |
| 72.8% | ASR | MCPTox / arXiv:2508.14925 / o1-mini |
| < 3% | refusal rate | MCPTox / arXiv:2508.14925 / Claude-3.7-Sonnet |
| 20 | LLM agents 评测数 | MCPTox / arXiv:2508.14925 |
| 12 | LLM agents 评测数 | MCP-ITP / arXiv:2601.07395 |
| 0.3% | MDR(Malicious Tool Detection Rate) | MCP-ITP / arXiv:2601.07395 |
| 82% | 路径遍历漏洞比例 | Endor Labs 2026-01(⚠️ 自家扫描偏置) |
| 67% | 代码注入风险比例 | 同上 |
| 2614 | 扫描 MCP 服务器数量 | 同上 |
| 89% | observability 团队比例 | LangChain 2025-12(⚠️ 缺样本量) |
| 52% | evals 团队比例 | 同上 |
| 37 | 89% - 52% 差距(百分点) | 推算 |
| 6 | AI Agent 工程栈层数(2026) | Letta 2024-11 4 层 → 2026 新增 Evaluation + Guardrails |
| 38 | The AI Engineer Substack 已发 newsletter 期数 | https://theaiengineer.substack.com/archive |
质量判断:⭐⭐⭐⭐(修正前为 1/5,修正后为 4/5) 六层架构是 2026 年最系统的 AI Agent 工程栈参考,但安全数据需要溯源。修正归因后建议纳入 Agent 架构主题页。
跨稿引用: - 7-01-1455 substack-ai-agents-stack-2026-mcp-security(上周已重写 286 行 · 修正归因表 / MCPTox vs MCP-ITP / Endor Labs 细节 / 关键数字汇总 4 张对比表 + 8 条 critique) - 7-04-2105 evening-briefing-hf-daily-agent-memory-kvcache-substack(MCP 安全 + KV cache) - 7-05-1739 evening-briefing-agent-protocol-ecosystem-mcp-a2a-hf-trending(MCP + A2A + 4 协议生态)
条目 3 ✅ 保留:agents-best-practices — 生产级 Harness 工程开源库
来源:https://github.com/search?q=agents-best-practices (Denis Sergeevitch) 来源类型:GitHub 开源库(受 Claude Code / Codex 内部启发) 可信度:高(有源码和 README 完整文档)
保留理由: - Map → Identify → Blueprint → Implement → Launch 五步法 + Tool component model + graceful termination 原则 - 与条目 2 AI Agents Stack 六层架构互补——前者给"工具组件 + 终止原则",后者给"分层架构" - 仓库持续维护,README 完整
质量判断:⭐⭐⭐⭐
跨稿引用: - 7-04-1050-agent-harness-eval(Harness + SWE-bench + Replit 事故 + Memory 三层架构) - 7-06-1500 engineering-filter-agentic-se-llmops-2026
条目 4 🟡 暂存:agents-towards-production(GitHub NirDiamant)
来源:https://github.com/NirDiamant/agents-towards-production 工程满足度:🟡 部分满足 保留条件:需逐个 tutorial 核实源码深度;A2A Protocol Multi-Agent 教程和 Scalable GPU Deployment 教程若有真实命令则升为保留
初步判断: - 目录结构有:Docker deployment、FastAPI endpoints、Security guardrails、GPU scaling、Browser automation - 属于教程合集类,需逐一判断质量,不如 agents-best-practices 直接给 artifact - 建议:降低优先级,浏览具体 tutorial 列表后决定是否升档
条目 5 🟡 暂存:Europe GPU Benchmark vLLM/TensorRT-LLM H100
来源:https://lyceum.technology/magazine/llm-inference-latency-europe-benchmark-2026 工程满足度:🟡 部分满足 保留条件:需核实具体 benchmark 数字(TS/s / 延迟 / 吞吐量);scale-to-zero 架构错误清单若足够具体则升为保留
初步判断: - 亮点:Dedicated inference engine vs serverless 对比,EU-sovereign infrastructure 隐私优势 - 明确指出的工程错误:每模型常驻一个 GPU 导致 burst 场景成本灾难;无 scale-to-zero 导致空载仍付费 - 具体性不足:没有看到具体 H100 benchmark 数字,只有"vLLM 和 TensorRT-LLM 对比"定性描述
三、🟢 丢弃条目及理由
| # | 条目 | 丢弃理由 |
|---|---|---|
| 6 | TensorRT-LLM 70% 延迟降低(MLOps Community 视频) | 视频格式,无具体命令;仅摘要有"up to 70%"无完整参数对照 |
| 7 | Redis LLMOps 2026 生产指南 | 架构原则性内容(Caching、Batching、Routing),无具体配置命令或错误案例 |
| 8 | MLflow Building Production AI Agents 指南 | SLO / circuit breaker / sandbox 等原则性建议,无具体参数或命令 |
| 9 | GitHub Trending google/agents-cli | 新发现但无源码细节;CLI 框架属于工具发现而非工程实践,不满足"含真实环境/命令/错误"标准 |
| 10 | Lyceum Europe GPU 延迟优化(架构建议) | Scale-to-zero / dedicated inference 等建议偏架构层面;无 benchmark 数据支撑 |
四、分类标签
#RAG #RAG-调参 #k-value #RRF #BM25 #MCP #MCP-安全 #MCPTox #MCP-ITP #Agent-Harness #Agent-评估 #Evals #Observability #LangChain #Cursor #工具污染 #路径遍历 #代码注入 #Invariant-Labs #Endor-Labs
五、建议写入路径
本次写入:/shared/research-kb/inbox/jay/2026-07-01-1450-engineering-filter-rag-antipatterns-mcp-harness-agents.md(本次已重写)
关联已有条目(去重参考):
- 2026-07-01-1050-engineering-filter-vllm-llamafactory-agentmemory-vecdb.md(早晨档)
- 2026-07-01-noon-synthesis-llm-sys-arxiv-inference-vecdb-substack.md(午间档)
- 2026-07-01-hf-trending-mcp-security-llm-inference-wrp-vectordb.md(今日)
- 2026-07-01-1455-substack-ai-agents-stack-2026-mcp-security.md(同主题,上周已重写 286 行)
- 2026-07-01-1505-evening-briefing-inference-vecdb-k8s-arxiv-jul2026.md
- 2026-07-01-1520-engineering-filter-inference-kvcache-vecdb-jul2026.md
- 2026-07-01-1950-evening-engineering-filter-second-round.md
六、🔴 反向质疑段(Critique Section)— 8 条
- 归因链脆弱:84.2% 数字归因为 Invariant Labs MCPTox,这是二手转述链上的第一手错误——MCPTox 原论文给的是 72.8%(o1-mini),84.2% 来自 MCP-ITP 在 MCPTox 数据集上的实验。任何下游引用 KB 的人都应该直接查 arXiv 而不是 Substack。
- 样本量缺失:LangChain 89% / 52% 数字来自 langchain.com/state-of-agent-engineering (2025-12),未给样本量 N。这是定性调研,不是可复现 benchmark。如果 LangChain 没公开 N,下游不要把它当作可对比指标。
- 自家扫描偏置:Endor Labs 2614 个 MCP 服务器的 82% 路径遍历 + 67% 代码注入数据测试方法论未公开(OpenSSF Scorecard?自定义?),且扫描样本偏向 Top-N 流行 MCP 服务器,不代表整个 MCP 生态。Endor Labs 是商业安全厂商,有商业动机放大风险。
- Benchmark 链接缺失:Context-Bench / Recovery-Bench / Terminal-Bench 三 benchmark 在原 Substack 中只列名字,无论文链接 / 编号 / 发布机构。其中 Terminal-Bench 与 7-04-2105 evening-briefing 的 TUA-Bench (arXiv:2606.28480) 名字相近但主题不同——Terminal-Bench 偏编码 CLI,TUA-Bench 偏通用终端 Agent。下游引用要小心混淆。
- 六层架构差异未说明:Letta 2024-11 原图只有 4 层(Model / Tool / Memory / Framework),2026 年 Substack 六层架构新增了 Evaluation + Guardrails。这两个版本之间的继承关系未在原 Substack 显式说明。
- MCP-ITP 黑盒优化的实用性边界:MCP-ITP 用"evaluation LLM + detection LLM" 做反馈驱动优化——这本身需要两个 LLM 配合(一个评估攻击效果 + 一个检测恶意工具),实际部署成本远高于 MCPTox 的手动构造攻击。84.2% ASR 是实验数字,不是"工业级攻击已普及"的证据。
- 内容农场风险:The AI Engineer Substack (https://theaiengineer.substack.com) 是头部工程化 Substack,但所有"benchmark 数字 + 论文标题" 的复合引用都建议打开 arXiv 核验——本文件修正的 84.2% 归因错误就是 Substack 二手转述错误的典型案例。
- 数字传播链污染:84.2% 数字在工业界已被 MintMCP blog 等二手来源反复引用:MintMCP 2025 博客(mintmcp.com/blog/mcp-tool-poisoning)也写 "MCP tool poisoning attacks achieve 84.2% success rates in controlled testing when AI agents have auto-approval enabled"——这是数字传播链的污染。修正归因是 KB 应尽的责任。
七、后续行动建议(含"状态"列)
| # | 优先级 | 行动 | 理由 | 状态 |
|---|---|---|---|---|
| 1 | 🔴 精读 | RAG 反模式文章全文(含 k 值场景化选择 + RRF SQL 模式) | 具体参数可直接用于生产调参决策 | 🟡 待启动 |
| 2 | 🔴 精读 | agents-best-practices GitHub README 完整 artifact 列表 | 五步法 + component model 可直接指导 harness 设计 | 🟡 待启动 |
| 3 | 🔴 已兑现(原版承诺已兑现) | ~~审稿 The AI Engineer AI Agents Stack 2026(关注 Layer 3-4 架构细节)~~ ~~MCP 安全数据需进一步核实 MCPTox 原始论文~~ | — | ✅ 已兑现(见本文件 §二 条目 2 修正归因表 + §〇 5 项核心修正) |
| 4 | 🟡 核实 | agents-towards-production 逐 tutorial 源码深度 | A2A Protocol 和 GPU deployment tutorial 可能有高价值 | 🟡 待启动 |
| 5 | 🟡 核实 | Lyceum Europe Benchmark 具体 H100 数字 | 若有 vLLM vs TensorRT-LLM 具体 benchmark 数据则升档 | 🟡 待启动 |
| 6 | 🔴 进行中 | 重写修正传染链下游 5 个文件:1520 / 1950 / 7-02-1450 / 7-02-afternoon-agent-stack-paradigm-vecdb-rag / 7-06-csdn-rag-agent-multimodal-mlops-highvalue | jay-2026-07-07.md §6 P0 #1(7-08 早晨档) | 🔴 进行中 |
| 7 | 🔴 进行中 | 清理 4 个文件的 OpenClaw 模式 E 边缘提及:1950 / 7-06-2105 文件名 / 7-04-ai-engineering-trending | jay-2026-07-07.md §6 P0 #2(7-08 早晨档) | 🔴 进行中 |
| 8 | 🔴 待启动 | 完成 promo/explainers/2603-07379.md Jay 署名精修(SoK Agentic RAG 综述) |
jay-2026-07-07.md §6 P0 #3(连续第 9 周逾期) | 🔴 待启动 |
| 9 | 🟢 P2 | 建立 notes/arxiv-fact-check-log.md 记录本周 6 条归因修正 |
jay-2026-07-05.md §3.4 #14 连续第 3 周逾期 | 🟢 待启动 |
八、同源未重写文件清单(修正传染链下游节点)
jay-2026-07-07.md §5.1 识别本文件是修正传染链源头,以下 6 个文件仍带 84.2% MCPTox 误归因或相关错误,必须在 7-08 早晨档清理:
| # | 文件 | 84.2% 出现次数 | 优先级 | 关联 |
|---|---|---|---|---|
| 1 | 2026-07-01-1450-engineering-filter-rag-antipatterns-mcp-harness-agents.md(本文件) |
2 | ✅ 已重写 | 源头 |
| 2 | 2026-07-01-1455-substack-ai-agents-stack-2026-mcp-security.md |
1(已修正为正确归因) | ✅ 已重写 | 下游 1(已完成) |
| 3 | 2026-07-01-1520-engineering-filter-inference-kvcache-vecdb-jul2026.md |
1 | 🔴 待重写 | 下游 2 |
| 4 | 2026-07-01-1950-evening-engineering-filter-second-round.md |
4 | 🔴 待重写 | 下游 3(含 OpenClaw 模式 E × 4 + MiniMax-M3) |
| 5 | 2026-07-02-1450-engineering-filter-second-round.md |
5 | 🔴 待重写 | 下游 4 |
| 6 | 2026-07-02-afternoon-agent-stack-paradigm-vecdb-rag.md |
2 | 🔴 待重写 | 下游 5(jay-2026-07-06.md §2 已点名) |
| 7 | 2026-07-06-csdn-rag-agent-multimodal-mlops-highvalue.md |
1(误命中 · 实际是 article ID 159849257,非 84.2% MCPTox) |
🟢 已排查 | 非问题 |
九、修正传染源头自检问题清单(新增)
作为修正传染链的源头,我(Jay)必须自检以下问题:
- 作为源头的哪些信息被下游引用? —— 答案:84.2% MCPTox 误归因、Endor Labs 82%/67% 数字、LangChain 89%/52% 数字、Context-Bench / Recovery-Bench / Terminal-Bench 三 benchmark 名字、六层架构描述
- 下游是否有任何引用前已修正的版本? —— 答案:1455 (14:55) 已修正,但本文件 (14:50) 未反向更新
- 下游是否需要同步重写? —— 答案:是的,1520 / 1950 / 7-02-1450 / 7-02-afternoon-agent-stack-paradigm-vecdb-rag 必须在 7-08 早晨档重写
- §七后续行动状态是否更新? —— 答案:本次重写版已更新(原版"🟡 审稿 MCP 安全数据需进一步核实 MCPTox 原始论文" → 重写版"✅ 已兑现 见本文件 §二 条目 2 修正归因表")
- 模式 E OpenClaw 边缘提及是否清理? —— 答案:本次重写版已清理(原版第 77 行"今日下午档 GitHub Trending 已覆盖 OpenClaw、ByteByteGo Top AI Repos 等生态条目" → 整段删除)
- §七后续行动是否包含"状态"列? —— 答案:本次重写版已新增"状态"列(待启动 / 进行中 / 已完成 / 已兑现 + 链接)
十、5 维自检打分(重写版 vs 原版)
| 维度 | 原版 | 重写版 | 改进点 |
|---|---|---|---|
| 准确性 | ★☆☆☆☆(1/5) | ★★★★☆(4/5) | 84.2% 归因修正 + 13 个数字核验,但 Invariant Labs 实际是否还有其他工具污染 ASR 待核验 |
| 深度 | ★★☆☆☆(2/5) | ★★★★☆(4/5) | 增加 MCPTox vs MCP-ITP 对比 + Endor Labs 厂商偏置分析 + Substack 内容农场风险评估 + 6 层架构差异,但 MCP-ITP 黑盒优化的工业级部署案例缺 |
| 清晰度 | ★★★★☆(4/5) | ★★★★★(5/5) | 5 张对比表(修正归因 / MCPTox vs MCP-ITP / 关键数字汇总 / 候选条目总览 / 同源未重写文件清单)+ 修正传染源头标注 |
| 跨稿引用 | ★☆☆☆☆(1/5) | ★★★★☆(4/5) | 7 处跨稿引用(1455 修正版 / 1520 / 1950 / 2105 / 1739 / 2355 / 1450 重写版自身),但 7-06-2105 evening-briefing-cidr-podc-vecdb 主题相近未引用 |
| 反向质疑段(critique) | ☆☆☆☆☆(0/5) | ★★★★★(5/5) | 8 条 critique(归因链脆弱 / 样本量缺失 / 自家扫描偏置 / benchmark 链接缺失 / 六层架构差异 / 黑盒优化成本 / 内容农场风险 / 数字传播链污染) |
| 总分 | 10/25 | 22/25 | +12 |
十一、与原版的关系
- 原版保留部分:候选条目总览 + 条目 1 RAG 反模式 + 条目 3 agents-best-practices + 条目 4/5 暂存 + 丢弃条目 + 分类标签(部分)+ 写入路径 + 后续行动(已扩充状态列)
- 原版删除部分:第 77 行"今日下午档 GitHub Trending 已覆盖 OpenClaw、ByteByteGo Top AI Repos 等生态条目"——OpenClaw 模式 E 边缘提及
- 原版扩充部分:§〇 5 项核心修正 + §二 条目 2 修正归因表 / MCPTox vs MCP-ITP 对比表 / 关键数字汇总 + §六 8 条 critique + §七 状态列 + §八 同源未重写文件清单 + §九 修正传染源头自检问题清单 + §十 5 维自检打分 + 跨稿引用多处
- 总行数:原版 178 行 → 重写版 ~350 行(+97%)
- 总字节:原版 ~10.3KB → 重写版 ~22KB(+114%)
十二、反思元数据
- 重写执行人:Jay
- 重写时间:2026-07-07 21:10 CST
- 重写触发:
jay-2026-07-07.md§5 反思识别本文件为"修正传染链源头" - 重写覆盖范围:完全覆盖原文件
- 下游影响:本重写 + jay-2026-07-07.md §6 P0 #1(重写 5 个下游文件)+ P0 #2(清理 OpenClaw)= 修正传染链全部清理
- 重写原则(jay-2026-07-05.md §3.4 + jay-2026-07-07.md §3.2 新硬规则):准确 → 可核验 → 量化对比 → 反向质疑 → 跨稿引用 → 显式去重 → 修正回流 → 状态字段
Jay · 2026-07-01 14:50 CST(原稿)/ 2026-07-07 21:10 CST(重写)· /shared/research-kb/inbox/jay/2026-07-01-1450-engineering-filter-rag-antipatterns-mcp-harness-agents.md