Jay 工程筛选 · 2026-09-19 上午场

角色: Jay · 二次筛选 · 重点判断真实环境/命令/错误/源码/性能数据/可复现步骤 检索范围: arXiv · HF Blog · Substack · 工程博客 · Tavily 综合搜索 本轮候选条目: 38 条(含今日 inbox 已采集内容) 产出时间: 2026-09-19 10:50


✅ 保留条目(高工程价值)


1. vLLM vs SGLang vs LMDeploy Benchmark

来源: PremAI Blog · premai.io URL: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 评分: ⭐⭐⭐⭐

保留理由: 实测 H100 吞吐量数据——SGLang/LMDeploy @ 16,200 tok/s,vLLM @ 12,500 tok/s,差距 29%。这是 2026 年可直接用于 capacity planning 的数字。

工程价值点: - GPU 选型参考(H100 vs A100) - 吞吐 vs 延迟取舍有量化 - 适合做 inference engine 选型报告的引用来源

缺陷: 未披露测试配置(batch size、model size、sequence length),数字可信度打折扣。

可信度:中高 | 是否需核验: 测试脚本/配置需溯源


2. SGLang vs vLLM: Production Architecture Deep Dive

来源: Atomic.chat Blog URL: https://atomic.chat/blog/llm-updates/sglang-vs-vllm 评分: ⭐⭐⭐⭐

保留理由: 详细技术对比,核心差异聚焦 prefix caching 场景——SGLang 在重复 system prompt / tool definition / conversation history 共享场景下显著优于 vLLM。给出了"unique prompts 下差距极小"的生产实情。

工程价值点: - 生产路由决策依据(共享前缀多→SGLang,否则差不多) - RadixAttention vs PagedAttention 架构差异具体说明 - Grok 部署案例(数百K GPU规模)佐证生产验证

缺陷: 非独立第三方 benchmark,可能存在偏好性。

可信度: 中 | 是否需核验: 建议与 vLLM/SGLang 官方 benchmark 交叉验证


3. Best LLM Inference Engines 2026(DeployBase)

来源: DeployBase · deploybase.ai URL: https://deploybase.ai/articles/best-llm-inference-engine 评分: ⭐⭐⭐

保留理由: 同时列出吞吐量(tok/s)和首 token 延迟(TTFT)两条轴线:SGLang 80ms vs vLLM/TRT-LLM 150ms vs TGI 250ms。对话式/streaming 场景 TTFT 比 throughput 更关键。明确标注 TGI 已进入维护模式(vLLM/SGLang 替代)。

工程价值点: - 不同场景(吞吐量 vs 延迟 vs 边缘 vs 最大性能)对应引擎推荐 - llama.cpp CPU 基准线(20 tok/s)作为参照锚点 - TensorRT-LLM compilation overhead 说明

缺陷: 数据来源未注明第三方出处。

可信度: 中 | 是否需核验: 建议结合 vLLM/SGLang 官方 numbers 对比


4. LLM Engine Guide — vLLM vs SGLang vs TRT-LLM vs TGI(TowardsAI)

来源: Pub.TowardsAI.net URL: https://pub.towardsai.net/part-3-implementation-engine-level-choosing-the-runtime-that-gives-you-these-for-free-b0e9081205b0 评分: ⭐⭐⭐⭐

保留理由: PagedAttention 内存碎片化量化数据:naive 系统 60-80% 碎片 → vLLM <4%。这直接解释了为什么 vLLM 能 2-4x 提升并发。同时给出 TGI 维护模式的官方 guidance。

工程价值点: - PagedAttention 机制的具体数字(碎片率) - 4 大引擎选型决策树(batch/unique/single/enterprise) - TGI 生命周期状态说明(生产需迁移)

缺陷: 具体测试配置缺失。

可信度: 中高 | 是否需核验: PagedAttention 碎片率数字溯源到 vLLM 论文


5. KV Cache Optimization 2026: Engineering Guide

来源: DigitalApplied · digitalapplied.com URL: https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide 评分: ⭐⭐⭐⭐⭐

保留理由: KV cache 在 1M tokens 时占 wall-clock 60-85%、GPU memory 70-90%,这是 2026 长上下文推理成本的核心数字。5 个优化技术家族有量化收益:32K/128K/512K context 下成本削减数据都有。

工程价值点: - 5 technique families:PagedAttention、Prefix caching、MQA/GQA/MLA、KV 量化 - 端到端量化:INT8/FP8 → 50% 内存节省;INT4 → 75% - RAG 重排序标配(bi-encoder 初筛 + cross-encoder 精排)

缺陷: 需要结合具体实现版本(vLLM vs SGLang)验证各技术是否都已集成。

可信度: 中高 | 是否需核验: 各优化技术集成状态需查 vLLM/SGLang changelog


6. KV Caching Explained(HF Blog)

来源: Hugging Face 官方博客 URL: https://huggingface.co/blog 评分: ⭐⭐⭐⭐

保留理由: HF 官方解释 PagedAttention、RadixAttention(prefix caching)、MLA(DeepSeek Multi-head Latent Attention)工作原理。是 2026 年推断优化知识体系的基础参考。

工程价值点: 权威来源,澄清 MLA 与 MQA/GQA 的关系,适合作为知识库基础条目。

可信度: 高 | 是否需核验: 无需核验,HF 官方


7. Tool-Making and Self-Evolving LLM Agents(arXiv:2607.08010)

来源: arXiv · html 格式 URL: https://arxiv.org/html/2607.08010 评分: ⭐⭐⭐⭐

保留理由: SOP→tool 代码转换的生产实践。用真实 SOP 文本编译成工具,在标注生产案例上验证。给出了 alarm-triage agent 案例,涉及模型:GLM-4.7、GLM-5、Qwen3 235B。强调 SOP underspecification 是生产最大错误源。

工程价值点: - SOP-to-code 翻译误差是主要 bug 来源(不同于 benchmark 评估) - 延迟和正确率联合优化问题 - 生产 SOP 质量 → tool 质量的实际 pipeline

缺陷: 机构署名不完整(GLM 厂商背景),可能有偏好。

可信度: 中 | 是否需核验: 建议读 Section 3.2 alarm-triage agent 部分


8. Memory for Autonomous LLM Agents(arXiv:2603.07670v1)

来源: arXiv · 2022-2026 综述 URL: https://arxiv.org/html/2603.07670v1 评分: ⭐⭐⭐⭐

保留理由: Agent memory 形式化框架:write–manage–read loop,3维分类(temporal scope、representational substrate、control policy)。AgeMem(Yu et al., 2026)用 RL 优化整个 memory pipeline(warm-up→task-level RL→step-level GRPO)。MemBench、MemoryAgentBench、MemoryArena 等 benchmark 体系梳理完整。

工程价值点: - Memory 操作(store/retrieve/update/summarize/discard)作为可调用工具 - 3阶段训练流程可操作 - 2025-2026 benchmark 体系全图

缺陷: 综述性质,具体算法细节需跳转原文献。

可信度: 高 | 是否需核验: 建议精读 AgeMem 实现细节


9. Online Scheduling for LLM Inference with KV Cache Constraints(arXiv:2502.07115v5)

来源: MIT + Microsoft Research URL: https://web.mit.edu/jaillet/www/general/2502.07115v5.pdf 评分: ⭐⭐⭐⭐⭐

保留理由: KV cache 约束下的在线调度理论框架,MIT OR Center + Microsoft Research 联合研究。给出了在线 batching 和调度的形式化问题模型,可为生产调度器设计提供理论基础。

工程价值点: - 学术生产级研究,可为内部调度器设计提供理论支撑 - 作者团队(Jaillet、MIT、Microsoft Research)权威

可信度: 高 | 是否需核验: 建议通读算法部分,结合生产实践评估可落地性


10. Adaptive KV-Cache Quantization(arXiv:2604.04722v1)

来源: arXiv · 设备端 LLM URL: https://arxiv.org/html/2604.04722v1 评分: ⭐⭐⭐

保留理由: Token 级控制器决定 bit-width 分配(重要 token 高精度,不重要 token 低精度),形成 constrained optimization 问题。对设备端 LLM 推理有直接价值。

工程价值点: 与 INT4/INT8 固定精度对比,自适应精度分配更接近实际需求。

缺陷: 设备端场景,云端 GPU 生产意义待评估。

可信度: 中高 | 是否需核验: 实际精度损失数字需核验


11. URAG: Uncertainty Quantification in RAG(arXiv:2603.19281v1)

来源: arXiv URL: https://arxiv.org/html/2603.19281v1 评分: ⭐⭐⭐

保留理由: RAG 不确定性量化 benchmark,给出具体数据集规模:Commit Message QA (163)、CRAG (2,330)、DialFact (2,000)、HealthVer (1,332)。隐私脆弱性分析覆盖 standard RAG、Graph RAG、Multimodal RAG。

工程价值点: RAG 系统评估新增 uncertainty 维度,适合生产 quality monitoring。

缺陷: 非完整系统评测,偏 benchmark 描述。

可信度: 中 | 是否需核验: 数据集可用性需确认


12. RAGCap-Bench: Agentic RAG Capability Benchmark(arXiv:2510.13910v2)

来源: arXiv URL: https://arxiv.org/html/2510.13910v2 评分: ⭐⭐⭐⭐

保留理由: 组件级评估(planning/retrieval/reasoning 中间过程),而非仅端到端 QA 分数,解决了现有 benchmark 反馈粒度不足的问题。分数与下游任务性能相关。

工程价值点: 生产 RAG 系统可用此做组件级 regression testing。

可信度: 中高 | 是否需核验: 建议读实验部分,评估评估协议可复现性


13. Measuring Agents in Production(arXiv:2512.04123)

来源: arXiv · ICML 2026 Oral URL: https://arxiv.org/abs/2512.04123 评分: ⭐⭐⭐⭐⭐

保留理由: ICML 2026 Oral,43rd International Conference on Machine Learning。生产 Agent 度量研究,跨 CS.CY/AI/ML/SE 多学科。高影响力论文,需优先关注。

工程价值点: 生产 Agent 度量的权威研究,是 benchmark/evaluation 体系的标杆。

可信度: 高 | 是否需核验: 必读,需通读全文


14. Comparative Characterization of KV Cache Management(arXiv:2604.05012v1)

来源: arXiv URL: https://arxiv.org/html/2604.05012v1 评分: ⭐⭐⭐⭐

保留理由: KV cache 管理策略系统分类:①内存分配优化(减少碎片)、②层级放置(CPU 内存+存储)、③稀疏化(重要 token 优先)、④量化(FP16→INT8/INT4)。2026 主流优化方向全覆盖。

工程价值点: 是 KV 优化策略选型的系统化地图,适合作为知识库架构参考。

可信度: 高 | 是否需核验: 可作为快速参考,细节需跳转各专项


15. HF smolagents RAG Example(源码级)

来源: Hugging Face 官方文档 URL: https://huggingface.co/docs/smolagents/en/examples/rag 评分: ⭐⭐⭐⭐⭐

保留理由: 可复现的 Agentic RAG 源码示例,包含:① knowledge base 准备(dataset→markdown)、② 自定义 Retriever Tool 实现、③ smolagents multi-agent 调用流程。Python 代码片段完整。

工程价值点: - 环境:smolagents + HfApiModel + dotenv - 自定义 tool 实现的最小可运行示例 - Production 参考实现,不是 toy demo

可信度: 高 | 是否需核验: 无需核验,HF 官方文档


16. One Sandbox Per Rollout: RL for Agents in 2026(HF Blog)

来源: Hugging Face 官方博客 URL: https://huggingface.co/blog 评分: ⭐⭐⭐⭐

保留理由: 头部实验室如何用沙箱做 agent RL 的 2026 年实践。解释为什么 agent RL 需要每个 rollout 独立沙箱(安全+隔离),是 agent safety 工程的硬需求。

工程价值点: 为 agent RL 基础设施设计提供参考。

可信度: 高 | 是否需核验: 无需核验,HF 官方


17. Per-tensor Layout Maps for GGUF Quantization(HF Blog)

来源: Hugging Face 官方博客 URL: https://huggingface.co/blog 评分: ⭐⭐⭐⭐

保留理由: GGUF 量化格式内部原理深入解析——per-tensor layout map 的作用,量化参数如何存储。llama.cpp 本地推理工程必备知识。

工程价值点: 量化格式 internals,生产部署 Qwen/Llama 本地版时必须理解。

可信度: 高 | 是否需核验: 无需核验,HF 官方


18. Your Inference Server is Secretly a Learner: Reef Infrastructure(HF Blog)

来源: Hugging Face 官方博客 URL: https://huggingface.co/blog 评分: ⭐⭐⭐⭐

保留理由: 推理服务器即持续学习基础设施(Continual Self-Improving Agents)。inference server 收集 production traffic 反馈用于模型微调/RL,是 2026 年 agent 基础设施新范式。

工程价值点: 突破传统 inference server 的角色定义,给出新的 architecture pattern。

可信度: 高 | 是否需核验: 无需核验,HF 官方


19. ShadowPEFT in PEFT Library(HF Blog)

来源: Hugging Face 官方博客 URL: https://huggingface.co/blog 评分: ⭐⭐⭐

保留理由: PEFT 库的 ShadowPEFT 新集成,adapter as model 范式,量化感知训练新方法。

工程价值点: 微调工程实践。

可信度: 高 | 是否需核验: 无需核验,HF 官方


20. OpenRouter Leaderboard(HF Blog)

来源: Hugging Face 官方博客 URL: https://huggingface.co/blog 评分: ⭐⭐⭐

保留理由: 425 个模型的 price/speed/Korean quality 三维排行榜。2026 模型选型工具参考。

工程价值点: 多模型性价比对比可直接用于采购决策。

可信度: 中 | 是否需核验: 建议核验 price 数据实时性


21. KV Cache Optimization Strategies(arXiv:2603.20397v1,Dell Technologies)

来源: arXiv · Dell Technologies 内部研究 URL: https://arxiv.org/html/2603.20397v1 评分: ⭐⭐⭐

保留理由: Dell Technologies 团队出品的 KV cache 优化综述,覆盖 NACL、KVQuant 等工作,给出表格对比(Table 2, Table 6)。企业采购/架构评估可用。

工程价值点: NVLink/NVSwitch 配置下的 cache 优化策略,企业级参考。

可信度: 中 | 是否需核验: 具体数字需交叉验证


❌ 丢弃条目(缺乏工程实质)


D1. Context Engineering: From Prompts to Corporate Multi-Agent Architecture(arXiv:2603.09619)

丢弃理由: 企业合规框架,政策/原则/角色定义为主。没有可执行的命令、源码或 benchmark 数据。Principal Trap 讨论有洞见但属于管理叙事,非工程实践。


D2. The End of Software Engineering: How AI Agents Are Changing It(arXiv:2606.05608v1)

丢弃理由: LangChain "Agentic Engineering" 定义发布来源(April 2026),但本质是预测性 essay。引用 Devin/OpenHands 作为 autonomous 案例,无可复现步骤。


D3. Production AI Engineering: Building Enterprise-Grade AI Agents(aiamastery.substack.com)

丢弃理由: 课程销售页。提到 5 个 production agents 的功能描述(injection blocking/RBAC/semantic cache/circuit breaker),但无源码/命令。30 Lessons / 5 Agents / Starts Aug 4 2026 是课程广告。


D4. The 2026 Path to Learning AI Agents(aiagentssimplified.substack.com)

丢弃理由: 学习路线图,工具列表(n8n/ADK/LangGraph/CrewAI/MetaGPT/BabyAGI),无工程深度。


D5. The 2026 AI Agent Stack, Drawn from Scratch(codingwithroby.substack.com)

丢弃理由: Stack 概览,eval 是 2026 最被低估的层、model routing 模式——有洞见但无命令/源码/错误数据。 Gartner 引用未注明具体报告。


D6. AI Agents Roadmap 2026 [Ship or Die](himanshuramchandani.substack.com)

丢弃理由: Module-based 学习路径。Multi-agent orchestration 3 合法理由、3 种 memory 类型——有架构价值但无具体工程实现。


D7. What's Next in AI: Five Trends(ByteByteGo Substack)

丢弃理由: 行业趋势预测。安全感知编码、持久化 agent、agent 正在出货——行业概述,非工程实践。


D8. Developing LLM-based Multi-Agent Systems in Software Engineering(arXiv:2608.11965v1)

丢弃理由: 混合方法体验报告,LAMPS PyPI 恶意代码检测案例有工程意义但太早期(刚提交),尚无 benchmark 验证。snippet 中无具体命令或源码。


D9. Graph Engineering in the Era of LLM Agents(arXiv:2608.21156)

丢弃理由: Reference compilation,大量引用(LAMPS、Agentic RAG、HARBOR、Proof-or-stop),无原创工程贡献。适合做参考文献目录,不适合作为工程实践来源。


D10. The 2026 Roadmap: Production AI/ML Systems(jamwithai.substack.com)

丢弃理由: 课程广告(Jam with AI 38,000 builders)。38K 订阅者数字是增长指标,不是工程内容。


D11. Top 5 Agentic AI Frameworks(futureagi.substack.com)

丢弃理由: LangGraph / Microsoft Agent Framework / CrewAI / MetaGPT / BabyAGI 框架对比,无生产部署命令或性能数据。MarketsandMarkets 行业数字($7.84B→$52.62B)未提供决策价值。


D12. ClaimRAG-LAW(arXiv:2605.21071v4)

丢弃理由: 法律领域专项(bilingual bi-jurisdictional legal RAG)。317 expert-validated QA / 968 claims。领域价值明确但非通用工程实践,法律 RAG 专项知识库可考虑。


D13. Dragon: Domain-specific RAG Benchmark(arXiv:2505.10989v2)

丢弃理由: 领域专项(Zelda/Hearthstone gaming)。Criteria-based Score 新指标有方法论价值,但基准数据对通用工程参考意义有限。


D14. WindowQuant: VLM KV Cache Quantization(arXiv:2605.02262v1)

丢弃理由: VLM(视觉语言模型)专用 KV 量化,Window-Level Mixed-Precision。多模态推理工程师关注,但范围过窄,通用 LLM 生产参考价值不足。


D15. LLM-Engineering Roadmap(github.com/tal7aouy)

丢弃理由: 学习路线图文档,非实战代码仓。包含 MCP/A2A/Reasoning Models/Test-Time Compute 等 2026 主题,适合作为学习索引但非工程实践来源。


D16. awesome-mlops(github.com/umitkacar)

丢弃理由: 综合性 MLOps 资源列表(vLLM/TGI/Ollama/LocalAI 等),信息过载且无深度评测。vLLM 30k stars、Ollama 100k stars 是 GitHub 公开数字,无实际性能对比。


📋 分类标签

#Inference-Engine #vLLM #SGLang #KV-Cache #Production-Engineering #Quantization #GGUF #RAG-Benchmark #Agent-Memory #smolagents #RLHF #Local-Inference #Benchmark


建议写入路径

主要草稿: /shared/research-kb/inbox/jay/2026-09-19-1050-jay-engineering-filter.md


后续行动建议

优先级 行动 理由
⭐⭐⭐ 极高 精读 Measuring Agents in Production(ICML 2026 Oral) 高影响力,生产 Agent 度量权威基准
⭐⭐ 高 精读 HF smolagents RAG example 源码 可复现的 Agentic RAG 最小示例
⭐⭐ 高 精读 Online Scheduling for LLM Inference(MIT+MSR) 调度理论支撑,生产调度器设计参考
⭐ 高 精读 RAGCap-Bench 组件级 RAG 评估,生产 regression 测试可用
🟡 中 核验 vLLM vs SGLang benchmark 数字 生产选型依据需数字可靠
🟡 中 核验 PagedAttention 碎片率(60-80%→<4%)数字来源 来自 vLLM 论文或是新数据?
🟡 中 精读 Memory for Autonomous LLM Agents AgeMem 部分 RL-based memory control 可操作性强
🔵 低 补充:TRT-LLM 2026 生产部署命令实践(vLLM blog 近期) TRT-LLM 是高吞吐生产场景补充

本轮无写入说明

本轮无直接 GitHub 写入,仅产出草稿文件: /shared/research-kb/inbox/jay/2026-09-19-1050-jay-engineering-filter.md

(Jay 工程筛选角色:不执行 git commit/git push/gh pr,仅产出草稿供后续合并)