知识库草稿 · Jay · 2026-07-17 下午

主题

Agentic LLM Serving 系统 · RAG 安全攻击 · HuggingFace + Azure Foundry 部署平台 · GitHub Trending Agent 生态 · vLLM vs SGLang 2026 对比

检索范围

  • arXiv (cs.DB / cs.AI / cs.MA / cs.CR) · HuggingFace Blog · GitHub Trending · Substack (MLOps Community / Jam with AI)
  • 推理工程对比研究(inferenceengineering.tech / techsy.io)

BACKEND / LLM SERVING


1. Helium:NUS 将 Agentic Workflow 建模为查询计划的 LLM Serving 框架

来源: arXiv:2603.16104v1 · NUS Wadlom et al. · cs.DB / cs.MA / cs.AI 链接: https://arxiv.org/html/2603.16104v1 发表: 2026-03 分类标签: Backend | LLM Serving | Agentic Systems | KV Cache | Query Optimization 可信度: ⭐⭐⭐⭐⭐ NUS 系统研究,跨 cs.DB/cs.AI/cs.MA 三分类,方法论有数据库领域特色

核心贡献:

将 Agentic Workflow 的 LLM 调用序列重新建模为"查询计划"(Query Plan),LLM 调用作为一等公民算子,引入经典数据库查询优化的思路到 LLM Serving:

  1. Helium 框架:workflow-aware serving framework
  2. Proactive KV Cache:跨 operator 和跨 workflow 的状态复用
  3. Inter-Operator Sharing:KV cache 在 LLM operator 之间复用(例如同一 prompt 前缀)
  4. Inter-Workflow Sharing:不同 agent workflow 之间的 KV cache 共享(跨批次推测执行)

关键数据: - 相比 SOTA agent serving systems:最高 1.56× 提速 - 覆盖场景:多步 agent 依赖链、长程记忆检索、多 agent 协作

工程评价: - 将数据库查询优化(物化视图、算子复用、代价模型)迁移到 LLM Serving 是 2026 年的重要研究方向 - Helium 的 Inter-Workflow Sharing 解决了多 agent 并发场景下 KV cache 碎片化的问题 - 与 vLLM PagedAttention 的关系:PagedAttention 解决单次推理内的显存管理,Helium 解决跨 workflow 的全局缓存 - 1.56× 提速在生产中意义重大,尤其对长程多步 agent 场景

保留理由: NUS 数据库系统研究,有完整方法论;将 query optimization 引入 LLM Serving 是有学术影响力的跨领域贡献;1.56× 提速有生产参考价值。

后续行动: 精读 Helium 的 cache-aware scheduling 算法;评估与 vLLM 集成的可行性。


2. Albireo:超越 Amdahl 限制的超线性张量并行扩展——arXiv:2606.01927

来源: arXiv:2606.01927 链接: https://arxiv.org/html/2606.01927 发表: 2026-06 分类标签: Backend | LLM Inference | GPU Scheduling | Tensor Parallelism | Scaling 可信度: ⭐⭐⭐⭐ 系统方向,有理论分析 + 生产 trace 验证

核心发现:

传统张量并行(TP)随 TP degree 增长而亚线性扩展——cross-GPU 通信和不可扩展的 runtime work 导致 Amdahl 瓶颈。

Albireo 方法: - 通过 overlap 调度 + I/O 与 compute 的隐藏,减少不可扩展部分 - 观察到超线性扩展:当 t ≤ te(te = 最优 TP degree)时,T(t) ≥ 2 × T(t/2),n × T(te) ≥ T(n × te) - 提出 tet_e(effective tensor parallelism degree)的概念

工程评价: - 超线性 TP scaling 是生产集群资源利用率提升的关键——意味着增加 GPU 数的收益高于预期 - 与 FlowPrefill(上午版本中的 MLSys 2026 Oral)同属推理调度优化方向,两者互补:FlowPrefill 解决 prefill 队头阻塞,Albireo 解决 TP 扩展效率 - 最佳 TP degree(tet_e)的概念可以指导生产集群的 GPU 分配决策

保留理由: 推理系统工程方向,有生产 trace 数据;超线性 scaling 结论对集群资源规划有直接价值;与 FlowPrefill 形成调度优化的完整图景。


3. vLLM vs SGLang 2026 H100 基准对比(TECHSY / inferenceengineering.tech)

来源: techsy.io · inferenceengineering.tech 链接: - https://techsy.io/en/blog/vllm-vs-sglang - https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm

分类标签: Backend | LLM Inference | vLLM | SGLang | Benchmark | TensorRT-LLM 可信度: ⭐⭐⭐ 中(有基准数字,但未全部公开评测条件)

2026 年最新格局:

HuggingFace TGI 已于 2025 年 12 月进入维护模式,引导用户转向 vLLM 或 SGLang。

H100 吞吐基准(Llama 3.1 8B):

框架 吞吐(tok/s) 适用场景
vLLM ~12,500 通用生产、最广硬件支持
SGLang ~16,200 Agent/RAG、prefix-heavy、多轮对话
TensorRT-LLM 最高(15-25% > vLLM) NVIDIA 极致性能,复杂度和成本高

决策框架(inferenceengineering.tech): - vLLM:最广硬件覆盖、最大社区、生产最稳妥 - SGLang:多轮 + 结构化输出 + prefix 密集(RAG、Agent 场景首选) - TensorRT-LLM:已有关键性能瓶颈需突破时再考虑,代价是 1-2 周集成成本

工程评价: - TGI 停止维护是 2026 年推理栈的最大结构性变化——没有 TGI 的生产场景,现在只有 vLLM / SGLang 两条路 - SGLang 的 RadixAttention 在多 call 调度(Agentic RAG 的 search → find → open → summarize 链)有结构性优势 - 两者 FP8 + PagedAttention + Continuous Batching 特性已趋同,差异在调度器设计和生态

保留理由: 2026 年推理引擎选型的实操参考;TGI 停更是重大基础设施变化;H100 基准数字是快速决策依据。


SECURITY / RAG


4. CREEP:针对 RAG 系统的推理成本攻击——WWW 2026

来源: arXiv:2606.02643 · 已接收 WWW 2026 (April 2026, Dubai) 链接: https://arxiv.org/html/2606.02643v1 发表: 2026-06;WWW 2026 正式接收 分类标签: Security | RAG | Inference Attack | Poisoning | ACM WWW 2026 可信度: ⭐⭐⭐⭐⭐ WWW 2026 正式论文,场景具体,防御思路有参考价值

核心发现——RA-ICA(Retrieval-Augmented Inference Cost Attack):

  1. 攻击目标:通过污染外部知识库,诱导 RAG 系统生成超长回复,从而放大 token 消耗成本
  2. CREEP 框架:LLM agent 自动构造语义相关但会导致 token 膨胀的恶意文档
  3. MA-GRPO(Memory-Augmented Group Relative Policy Optimization):强化学习算法,通过动态记忆历史最优对抗文档持续优化攻击效果

攻击原理: - 恶意文档对 RAG 检索层"语义相关"(能通过相关性阈值) - 但对 LLM 生成层会诱导异常 token 消耗(冗余论证、重复表述) - 在多租户 RAG 即服务场景中,这种攻击可直接转化为经济损失

工程评价: - 这是 2026 年 RAG 安全的新维度——传统安全关注数据泄露,RA-ICA 关注成本攻击 - 攻击面是外部知识库的动态检索(Web KB、文档上传),防御难度在于语义相关性和成本膨胀的关联不易察觉 - 防御思路可能包括:输出长度 SLO 监控、token 消耗异常检测、检索结果与输出长度的相关性分析

保留理由: WWW 2026 正式接收,学术价值高;揭示了 RAG 系统的新型攻击面;多租户 RAG 即服务平台需重点关注。

后续行动: 跟进论文公开的防御方法;评估是否需要在 RAG 平台增加 token 消耗异常告警。


PLATFORM / DEPLOYMENT


5. Microsoft Foundry + HuggingFace:Azure 上的 HuggingFace 模型一键部署

来源: Microsoft Build 2026 / HuggingFace Blog 链接: https://huggingface.co/blog/microsoft/foundry-managed-compute 分类标签: Platform | Deployment | HuggingFace | Azure | MLOps | Foundry 可信度: ⭐⭐⭐⭐ 微软官方公告,Azure + HuggingFace 双方背书

核心内容:

Azure Foundry 推出 HuggingFace Collection——数千个开源模型,一键部署到 Foundry Managed Compute:

  • 加速器选项:NVIDIA A100、NVIDIA H100、AMD MI300X
  • 范围:Global 和 Data Zone 两种部署范围
  • 特点:权重预存 Azure、运行时内置安全扫描、统一 Foundry 端点、Playground 支持、Azure Monitor 一体化、per-deployment 计费标签、CVE 自动修补
  • 刷新频率:模型 catalog 每周更新
  • SDK 示例:用 Python SDK 部署 Qwen3-32B 到 H100,6 行代码

Roadmap: - 扩大 HuggingFace 生态覆盖 - 更多加速器类型 - BYO Weights(自有微调模型)通过同一模板和管理治理部署

工程评价: - 这是 Azure Foundry 抢占 HuggingFace 开发者工作流的战略动作——绕过手动模型下载/上传,直接从 HF catalog 到 Azure 部署 - "weights pre-staged in Azure + runtime scanning + CVE patching" 是企业合规场景的核心价值 - AMD MI300X 支持是亮点——对有 AMD GPU 预算的企业提供 NVIDIA 之外的选项 - 与 self-hosted vLLM 相比,Foundry 提供的是全托管 SLA,企业无需操心 GPU 运维

保留理由: 2026 年企业 LLM 部署平台的重要新选项;Azure + HuggingFace 联合生态的里程碑;是知识库"LLM 部署平台选型"主题页的重要更新。

后续行动: 在部署平台主题页增加 Foundry + HuggingFace 章节;关注 BYO Weights 功能正式上线时间。



来源: GitHub Trending (2026-07-17) 链接: https://github.com/trending

分类标签: GitHub Trending | Agent | AI Tools | Ecosystem | MCP | Claude Code

候选条目(高价值筛选):

① addyosmani / agent-skills - Stars:77,040|今日 +1,116 - 语言: JavaScript - Built by: @addyosmani, @nucliweb, @federicobartoli, @claude, @dj2313 - 描述: AI Agent Skills 集合——JavaScript 生态的 agent 可调用技能库 - 工程价值: 体现了"skill as code"的 agent 扩展思路;JavaScript 生态的 MCP/agent skill 标准化尝试 - 关联: 与 OpenClaw skills 系统有相似的 skill 抽象;MCP server 的 JS 实现参考

② mattpocock / skills - Stars:165,055|今日 +1,712 - 语言: Shell - Built by: @mattpocock, @claude, @github-actions - 描述: AI Skill 管理与分享平台,支持一键导入 agent 技能 - 工程价值: 165K stars 的规模说明 skill 市场在 AI 开发者中有强需求;与 mattpocock(Zed 编辑器/Total TypeScript 创始人)的背景关联,TS/JS skill 生态最活跃

③ davila7 / claude-code-templates - Stars:28,836|今日 +118 - 语言: Python - Built by: @davila7, @claude, @cubic-dev-ai - 描述: Claude Code 的项目模板集合 - 工程价值: Claude Code 作为 2026 年 coding agent 标杆,其模板生态的活跃度是 agent 工程化的温度计;cubic-dev-ai 的参与说明国内也在跟进

丢弃条目: - TencentCloud/TencentDB-Agent-Memory:Stars 数量未标注,关联性待确认 - oven-sh/bun:JavaScript runtime,非 AI 专项 - hashicorp/terraform:基础设施即代码,非 AI 专项 - google-labs-code/stitch-skills:信息过少

保留理由: agent-skills 和 skills 反映了 2026 年 skill 市场的高速增长;mattpocock/skills 的 star 规模值得在生态报告中记录。


SUBSTACK / 研究线索


7. MLOps Community:AI Agents Summit 关键洞察——Agent Not The Code

来源: MLOps Community Substack · AI Agents Summit (2026-04-14, Seattle) 链接: https://mlopscommunity.substack.com/p/qa-the-agent-not-the-code 出席方: Google, Meta, Microsoft, Intuit, Orkes, Union.ai, Zipline AI, Braintrust, Databricks 分类标签: Substack | Agent Orchestration | Production | MLOps | Multi-Agent 可信度: ⭐⭐⭐⭐ 多家顶级公司工程师参与,内容为生产经验而非概念讨论

核心观点(来自 Rodney Shen, TextQL):

  1. "The slow part is no longer writing code. It is proving the agent did the right thing before bad work slips through."——生产 agent 的瓶颈从"生成"转向"验证"
  2. Sandbox over subprocess:agent 的 skills 和 credentials 应与执行环境共置,避免依赖膨胀
  3. 2026 年 4 月 AI Agents Summit 十大议题:durable runtimes、orchestration、部署后故障排查、多 agent 协作容错

工程评价: - "验证先于生成"是 2026 年 agent 工程的核心范式转变——harness engineering(上午版本 HarnessFix、FALAT)与此一致 - 多家顶级公司的参与说明这是业界共识,不是个别观点 - 对知识库的启示:agent 评测、harness 建设、验证框架是 2026 年的基础设施投资重点

保留理由: 多公司生产经验汇总;"验证即瓶颈"是 agent 工程化的高优先级洞察;可与上午版本的 HarnessFix/FALAT 联动理解。


8. Jam with AI:2026 Roadmap——Production AI/ML Systems

来源: Substack: Jam with AI · Shantanu Ladhwe & Shirin Khosravi 链接: https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml 发布日期: 2026-01-21 订阅量: ~38,000 builders 分类标签: Substack | AI Roadmap | Production | RAG | MLOps | 社区生态 可信度: ⭐⭐⭐ 中(社区创作者内容,有方向参考价值但非一手研究)

核心内容(2026 年深度方向):

  • AI Agents:深度系统、生产级实现
  • Advanced RAG:Graph DBs + ColPali(全文 + 向量混合)
  • NLP / RecSys with MLOps
  • 月度深度直播:生产系统技术walkthrough
  • 年付订阅额外权益:AI Agents Course、RecSys with MLOps

工程评价: - Graph DBs + ColPali 的组合是 2026 年 Advanced RAG 的技术方向——结构化知识图谱 + 多模态向量检索的混合架构 - 38K 订阅量说明"从 demo 到 production"是 2026 年 AI 开发者的核心焦虑 - 作为线索追踪,不深度处理:内容本质是课程导流

保留理由: 作为 2026 年技术方向的佐证来源;Graph DBs + ColPali 组合可加入 RAG 主题页趋势观察。


9. Substack 精选:Comet-ml/Opik · Claude Code Routines · Multimodal Eval

来源: Substack 汇总 (substack.com/home/post/p-194391181) 链接: https://substack.com/home/post/p-194391181 分类标签: Substack | LLM Eval | Agent | Multimodal | Tools 可信度: ⭐⭐⭐ 中

三条线索:

① Comet-ml/Opik(LLM 评估工具) - 开源 LLM 评估框架:trace、automated evaluation、production dashboard - 支持 RAG、agentic workflow 评测 - 工程价值:与 LangSmith、 Phoenix(Arize)同属于 LLM 可观测性栈,可作为评估工具选型参考

② Claude Code Routines(Anthropic 2026-04) - serverless 自动化:触发条件支持 schedule / API call / GitHub webhook - 每日限制:5-25 runs(plan tier 不同) - 工程价值:Claude Code 从 coding agent 向通用 agent platform 延伸;routines 是 durable execution 的轻量实现

③ Multimodal LLM Evaluation Guide - 文本-only 指标不足以评测图像/音频/视频输入 - 评测方法:grounding outputs、LLM-based evaluation - 工程价值:多模态模型评测的方法论参考;适合加入 agent harness 评测体系

保留理由: Opik 是开源 LLM eval 的活跃选项;Claude Code Routines 扩展了 agent 平台能力边界;多模态评测方法论是 2026 年多模态 agent 评测的基础设施需求。


分类汇总

分类 条目 高价值 可信度
Backend Helium (arXiv:2603.16104) ⭐⭐⭐⭐⭐ NUS/跨领域
Backend Albireo (arXiv:2606.01927) ⭐⭐⭐⭐ 超线性TP scaling
Backend vLLM vs SGLang 2026 对比 ⭐⭐⭐⭐ 基准数据
Security CREEP / RA-ICA (WWW 2026) ⭐⭐⭐⭐⭐ WWW 2026 接收
Platform Foundry + HuggingFace ⭐⭐⭐⭐ 微软官方公告
GitHub agent-skills / skills / claude-code-templates ⭐⭐⭐⭐ star 数据支撑
Substack MLOps Community: Agent Not The Code ⭐⭐⭐⭐ 多公司生产经验
Substack Jam with AI 2026 Roadmap ⭐⭐⭐ 方向佐证
Substack Opik / Claude Code Routines / Multimodal Eval ⭐⭐⭐ 工具线索

建议写入路径

主草稿路径: /shared/research-kb/inbox/jay/2026-07-17-1335-afternoon-briefing-agentic-serving-rag-security-hf-foundry-githubtrending.md

精读优先级

  1. Helium(arXiv:2603.16104)——查询优化 × LLM Serving 跨学科贡献,方法论新颖
  2. CREEP(arXiv:2606.02643)——WWW 2026,RAG 安全新维度,生产必读
  3. Albireo(arXiv:2606.01927)——超线性 scaling 对集群规划有直接价值

主题页更新建议

  • Agentic LLM Serving / Inference 主题页:增加 Helium + Albireo 条目,更新 vLLM vs SGLang 决策框架
  • RAG 主题页:增加 CREEP 安全攻击章节,更新 Graph DBs + ColPali 混合架构方向
  • LLM 部署平台主题页:增加 Microsoft Foundry + HuggingFace 章节(H100/A100/MI300X 一键部署)
  • Agent Harness / Evaluation 主题页:联动上午版本的 HarnessFix + FALAT,形成完整的 agent 工程体系

下午场完结备注

上午版本(10:55 / 11:05)已覆盖 DB + CloudNative + Harness + MTRAG;下午版本聚焦 Backend Serving + RAG Security + Platform + GitHub Ecosystem,形成完整覆盖。


Jay · 2026-07-17 13:35 (Asia/Shanghai) · 下午场知识库轮次