工程筛选报告 · Jay · 2026-08-15 下午(第2轮补充)

本轮覆盖: 本次搜索新增候选条目(CSDN/Substack/GitHub/arXiv/OpenReview),排除上午已覆盖内容后逐一判断。


一、保留条目(✅)

✅ 条目 R1|ContextPilot — MLSys 2026 长上下文推理加速

来源: GitHub · EfficientContext/ContextPilot · 2026-05(MLSys 2026 接收) 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐

保留理由: - 真实顶会接收: MLSys 2026 论文,有 benchmark 数据和引用格式 - 多引擎支持: SGLang / vLLM / llama.cpp / OpenClaw,跨引擎比较有说服力 - 精确工程指标: Context Reuse 策略、accuracy-preserving 保证,区别于纯理论工作 - 有指南文档: 支持 OpenClaw 和云 API cache sync,操作路径清晰

保留决策: 精读 —— 长上下文推理选型的 2026 年基准参考,建议补充原论文 benchmark 数字


✅ 条目 R2|Awesome-LLM-Inference-Engine — ACM 2026 推理引擎survey

来源: GitHub · sihyeong/Awesome-LLM-Inference-Engine · 2026 来源论文: ACM TIST "A Survey on Inference Engines for LLMs" (2026-03, Just Accepted) 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐

保留理由: - 特征矩阵完整: vLLM / SGLang / TensorRT-LLM / llama.cpp / bitnet.cpp / LitGPT / OpenLLM 对比,含 speculative decoding / prefix caching / continuous batching 等 15+ 特性 - 引用规范: 有 ACM DOI,来源可信 - MineDraft: vLLM batch parallel speculative decoding plugin(2026),前沿性明确

保留决策: 参考 —— 推理引擎选型决策辅助工具,不含命令/代码但特征矩阵可直接辅助工程决策


✅ 条目 R3|100 Days of LLM Inference — 每日CUDA/benchmark实验记录

来源: GitHub · elizabetht/100-days-of-inference · 2026-03 启动 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐

保留理由: - 真实硬件环境: 两台 DGX Spark(192.168.1.76/77),有 IP 和集群配置 - 逐日可复现脚本: 每个 entry 均有 runnable script,非总结性质 - 覆盖深度: CUDA kernels / PagedAttention block layout / continuous batching 模拟 / TTFT vs throughput tradeoff - 书籍配套: "Inference Engineering" by Philip Kiely (Baseten Books, 2026),系统性框架支撑

保留决策: 精读 —— 目前见到最有实操价值的推理工程实验记录之一,建议加入知识库示例库


✅ 条目 R4|AgentOrchestra — TEA 协议 + 多智能体分层编排

来源: OpenReview · ACL ARR 2026 January · AgentOrchestra: Orchestrating Multi-Agent Intelligence with the TEA Protocol 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐

保留理由: - 明确解决 A2A/MCP 缺陷: 跨实体生命周期管理、版本追踪、ad-hoc 环境集成不足 - TEA 协议设计: Environment/Agent/Tool 统一抽象,有第一性原则 - GAIA 89.04% SOTA: 可验证的基准成绩 - 有开源实现: 框架级代码

保留决策: 审稿 —— A2A/MCP 工程选型参考,TEA 协议设计思路值得架构师精读


✅ 条目 R5|Multi-MCP Cross-Server Interoperability — 量化指标框架

来源: OpenReview · TMLR Under Review · 2026 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐

保留理由: - 量化指标完整: BoT-IoT 数据集训练/测试 Accuracy 0.990/0.970,F1 0.975/0.955,Robustness 0.800/0.790 - 有算法伪代码: Algorithm 1 明确,跨服务器 MCP agent 任务分配协议形式化 - 安全验证: 哈希 + 完整性验证机制

保留决策: 审稿 —— MCP 生产部署安全边界设计参考,工程团队可直接参考 Algorithm 1 做实现


✅ 条目 R6|OWASP Top 10 Agents & AI 2026 — 可操作安全清单

来源: Substack · Alex Ew · 2026-06(规则启用后已收录,本次作为高价值条目重提) 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐

保留理由: - Mitigation 明确: LLM01-06 均有具体防御手段(如 semantic firewalls、AI-BOM/SBOM、JIT ephemeral tokens) - 原则可操作: Statelessness / Sandboxing & Scoping 可直接进入架构设计 review checklist - 工程价值高于平均水平: 不是泛泛而谈,有深度

保留决策: 精读 —— Agent 安全架构 checklist,建议进入 Agent Harness Engineering 参考文档


✅ 条目 R7|ai-inference-resources (AER Labs) — vLLM/SGLang/FlashInfer 2026 更新

来源: GitHub · aerlabsAI/ai-inference-resources · 持续更新 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐

保留理由: - vLLM GPU Model Runner V2 PR #25266 分析: WoosukKwon 主导,移除 persistent batch,NumPy CPU states,真实核心贡献 - SGLang dLLM RFC: Block Diffusion Language Model 支持,扩散语言模型推理新方向 - FlashInfer MLSys 2026 Tutorial: 有教程材料,实践性强 - AutoRound + SGLang: 量化推理工程集成案例

保留决策: 参考 —— 推理引擎内部实现理解的补充阅读,不含独立可复现步骤


✅ 条目 R8|AgentMaster — A2A + MCP 模块化多协议 MAS 框架

来源: OpenReview · PDF · 2026 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐

保留理由: - A2A + MCP 联合实现: 不同于单一协议框架,有对比价值 - Pilot system: 有实际演示系统(非纯理论) - 统一对话界面: 面向非技术用户的产品设计思路

保留决策: 审稿 —— A2A/MCP 协议选型参考,不含具体命令/配置


二、丢弃条目(含理由)

❌ 条目 D1|javarevisited Substack "Agentic AI Engineer Roadmap 2026"

来源: Substack · javarevisited 丢弃理由: Roadmap 性质,无原创数据/实验/命令。Phase 路径(Week 1-12 任务分配)是课程设计,不是工程实践记录。FastAPI + LLM API 调用示例过于基础,无版本/环境/错误记录。


❌ 条目 D2|srinithyathimmaraju Substack "AI Engineer 2026 资源"

来源: Substack · srinithyathimmaraju 丢弃理由: 资源列表整合,无原创内容。FastAPI 示例(POST /notes、GET /notes、POST /notes/summarize)与生产 LLM 系统无关。Level 0-2 项目路径是教学设计,不是真实工程经验。


❌ 条目 D3|Addy Osmani "My LLM coding workflow 2026"

来源: Substack · Addy Osmani 丢弃理由: 经验分享性质,无可复现命令/配置/错误记录。"AI-augmented software engineering" 观点有价值,但缺少工程实现细节。


❌ 条目 D4|alexeyondata Substack "1000+ Job Descriptions AI Engineer 2026"

来源: Substack · alexeyondata 丢弃理由: 市场分析文章,非工程实践。统计数据(RAG 35.9%、Prompt Engineering 29.1%)是招聘信号而非技术实现知识。


❌ 条目 D5|theaicorner1 Substack "Context Engineering Guide 2026"

来源: Substack · theaicorner1 丢弃理由: 框架介绍性内容(LangChain ACE、context rot prevention),无实验数据。GPT-5.2 / Claude 4.6 / Gemini 3.1 模板价值有限,平台版本更新后失效快。


❌ 条目 D6|simonw Substack "LLM predictions 2026, Oxide and Friends"

来源: Substack · Simon Willeson 丢弃理由: 预测性内容,非工程实践。"1 year: AI will write good code" 类前瞻无工程验证价值。


❌ 条目 D7|systemdesignone Substack "AI Engineering 2026 概念列表"

来源: Substack · Neo Kim 丢弃理由: 链接合集,无原创工程内容。16 个 newsletter 链接是目录,不是工程知识。


❌ 条目 D8|Udemy 课程页面 "LLM Engineering, RAG & AI Agents Masterclass 2026"

来源: Web · Udemy 丢弃理由: 商业课程推广页,非工程笔记。LangChain RAG 搭建教程无环境/版本/错误记录。


❌ 条目 D9|Agentic AI Identity and Access Management (OpenReview PDF)

来源: OpenReview · Cloud Security Alliance 丢弃理由: 概念框架,无可复现实现代码。Policy-based access control / JIT VC 是设计思路,无具体命令/API。


❌ 条目 D10|Anemoi — A2A MCP Semi-Centralized Multi-agent (OpenReview)

来源: OpenReview · NeurIPS 2025 Workshop LAW 丢弃理由: 学术工作,52.73% GAIA accuracy with GPT-4.1-mini 有参考价值,但 Coral Protocol MCP server 实现路径窄众,评估日期 2025 年 9 月新鲜度不足。


❌ 条目 D11|DAT: Dual-Aware Adaptive Transmission for Multimodal MLLM Edge-Cloud (arXiv 2604.05375)

来源: arXiv · ACM Multimedia 2026 提交 丢弃理由: 学术论文,无代码/无实验环境记录,snippet 无法判断工程价值。需精读原文才能判断,但本轮次优先级低于已有代码/评测框架类条目。


❌ 条目 D12|Anthropic AI Corner "Context Engineering Guide 2026" (Substack)

来源: Substack · theaicorner1 丢弃理由: 与 D5 同一来源,重复丢弃。


❌ 条目 D13|Anthropic AI Corner "Context Engineering Guide 2026" (Substack)

来源: Substack · theaicorner1 丢弃理由: 重复。


❌ 条目 D14|LLM Engineering Roadmap (GitHub tal7aouy/LLM-Engineering)

来源: GitHub 丢弃理由: Roadmap 性质(Phase 1-6 结构),与 AgentGuide 类项目重复。"What's New in 2026" 有 MCP / Reasoning Models / A2A 更新,但无独立可复现内容。


三、分类标签汇总

条目 标签
ContextPilot [推理工程] [长上下文] [MLSys2026] [SGLang] [vLLM]
Awesome-LLM-Inference-Engine [推理工程] [引擎对比] [ACM2026] [SpeculativeDecoding]
100 Days of LLM Inference [推理工程] [CUDA] [Benchmark] [PagedAttention] [DGXSpark]
AgentOrchestra [多Agent] [A2A] [MCP] [TEA协议] [GAIA]
Multi-MCP Interoperability [MCP] [安全] [CrossServer] [量化指标]
OWASP Top 10 Agents 2026 [Agent安全] [OWASP] [Mitigation] [Harness]
ai-inference-resources [推理工程] [vLLM] [SGLang] [FlashInfer]
AgentMaster [多Agent] [A2A] [MCP] [模块化框架]

四、建议写入路径

条目 建议路径
ContextPilot inbox/jay/2026-08-15-inference-contextpilot-mlsys2026.md
100 Days of LLM Inference inbox/jay/2026-08-15-inference-cuda-benchmark-dgxspark.md
OWASP Top 10 Agents 2026 inbox/jay/2026-08-15-agent-security-owasp2026.md
Multi-MCP Interoperability inbox/jay/2026-08-15-mcp-crossserver-security-algorithm.md

注:本次筛选不执行 GitHub 写入,路径供后续合并任务参考。


五、本轮新增知识增量评估

  • 推理工程(R1, R2, R3, R7): 新增 4 条,均有不同程度工程实操性
  • Agent 架构(R4, R5, R6, R8): 新增 4 条,OWASP Top 10 和 Multi-MCP Interoperability 最具可直接落地价值
  • 总体判断: 本轮工程价值高于上午场(上午 CSDN 量化数据 + Milvus 案例),下午场推理引擎深度实验 + 安全框架为新增高价值方向

Jay · 2026-08-15T14:50 · 工程筛选第2轮