Jay 工程实践筛选 · 2026-08-21 上午批次

角色:Jay · 二次筛选(判断是否含真实环境/命令/错误/源码/性能数据/可复现步骤) 筛选时间:2026-08-21 11:50 (Asia/Shanghai) 检索范围:本轮 Tavily + 已有 RSS / arXiv 候选条目 × 13 条


一、候选条目清单与筛选结果

条目 1:InferScale: GPU-Native KV Injection for Personalized LLM Serving

  • 来源:arXiv 2607.27090(~3 周前)
  • URL:https://arxiv.org/abs/2607.27090
  • 类型:学术工程论文(系统方向)
  • 筛选判断:✅ 保留
  • 保留理由
  • 含真实 GPU 显存数字(1.8–4.8 GB KV store per conversation)
  • 与生产基线 Mem0 对比设计明确:prompt injection vs KV injection
  • 含 Jasper proximity graph 部署开销(<25 MB per conversation)
  • 使用 SGLang decode latency 实测数据
  • 可复现:已开源(GitHub 链接在论文中)
  • 工程落地场景:多轮 Agent 内存管理、RAG 个性化注入、长期对话 KV 优化

条目 2:Practical Online KV Cache Compaction for LLM Agents (arXiv 2608.00902)

  • 来源:arXiv(近期)
  • URL:https://arxiv.org/html/2608.00902
  • 类型:学术工程论文
  • 筛选判断:✅ 保留
  • 保留理由
  • 针对"Agent 长轨迹 KV 积累"这一真实生产瓶颈
  • 在线压缩(online compaction)vs 离线压缩区分清晰
  • SGLang decode latency 实测 replay 方法论
  • 含 agent trajectory accuracy vs serving efficiency 权衡数据表
  • 明确指出 KV compaction 瓶颈在推理路径,非离线批处理
  • 工程落地场景:代码生成 Agent、深度研究 Agent、长程任务推理优化

条目 3:Custom CUDA Kernels in the Age of AI Coding Agents — 47billion

  • 来源:47billion.com(技术博客)
  • URL:https://47billion.com/blog/custom-cuda-kernels-in-the-age-of-ai-coding-agents-inside-the-new-agent-skill-workflow-for-gpu-kernel-engineering
  • 类型:✅ 命令 + ✅ 源码分析 + ✅ 性能数据 + ✅ 排障经验
  • 筛选判断:✅ 保留
  • 保留理由
  • 含 vLLM 自定义 kernel 集成完整流程(dispatch systems、build matrices)
  • 明确指出"最难部分不是 kernel,是周围的 dispatch/build/debugging"
  • 含 RoPE/GEGLU fused attention 性能动机分析
  • 实测教训:CUDA/Triton kernel 在 vLLM 集成的坑
  • 提供 agent-as-kernel-engineer 工作流评估
  • 工程落地场景:vLLM 定制内核、高性能推理优化、GPU kernel 调试

条目 4:SageMaker AI Per-GPU Inference Metrics — AWS 官方文档

  • 来源:AWS 官方文档
  • URL:https://docs.aws.amazon.com/sagemaker/latest/dg/monitoring-cloudwatch-detailed-observability.html
  • 类型:✅ 命令 + ✅ 环境配置 + ✅ 监控指标表
  • 筛选判断:✅ 保留
  • 保留理由
  • SageMaker 原生暴露 vLLM/SGLang 指标:TTFT、ITL、KV cache、queue depth、batch size、TPS
  • Per-GPU attribution 实测配置(含 DCGM 集成)
  • OTel Collector + Prometheus scraping 完整命令路径
  • 明确维度标签(endpoint name、IC name、host.id、availability_zone)
  • 工程落地场景:生产推理可观测性、多租户 GPU 监控、推理 SLO 告警

条目 5:CLO: Efficient LLM Inference with CPU-Light KVCache Offloading (arXiv 2511.14510)

  • 来源:arXiv(历史论文,但本轮新发现)
  • URL:https://arxiv.org/html/2511.14510v1
  • 类型:学术系统论文
  • 筛选判断:🟡 暂存(降低优先级)
  • 保留/降低理由
  • 含真实 latency 数据(35.2% 和 30.7% 降低,附加 48%/43.2% 降幅)
  • per-head metadata + at most one cache update 机制有工程参考价值
  • 但论文日期较早(2025.11),且方法偏向学术,可能已被 InferScale 等新工作覆盖
  • 后续行动:如知识库已有 KV offloading 主题页可参考;否则可降级

条目 6:Rethinking Classical Infrastructure Boundaries in LLM Inference Age (arXiv 2608.01526)

  • 来源:arXiv(近期)
  • URL:https://arxiv.org/html/2608.01526v1
  • 类型:综述+系统分析
  • 筛选判断:🟡 暂存
  • 保留/降低理由
  • 含 NVIDIA Rubin GPU 性能数字(50 PFLOPS NVFP4,vs Blackwell Ultra 15 PFLOPS)
  • 存储和传输带宽演进分析
  • 提及 prefix caching 工业实践(vLLM/SGLang 生产配置)
  • 但本文偏向宏观分析,缺乏具体命令或复现步骤
  • 后续行动:适合作为基础设施趋势参考,不适合工程命令页

条目 7:A2A Agent State and Data Consistency — CockroachDB

  • 来源:CockroachDB 官方博客
  • URL:https://www.cockroachlabs.com/blog/a2a-agent-state-data-layer/
  • 作者:Quentin Packard · 2026-08-19
  • 类型:✅ 工程分析 + ✅ 边界条件评估
  • 筛选判断:✅ 保留
  • 保留理由
  • 明确指出 A2A 在单框架内多 Agent 的场景是过度设计("adds latency and failure modes without adding capability")
  • 三个真实边界条件:单框架内 Agent(不需要 A2A)、单 Agent 多工具(MCP 范畴)、跨组织边界(真实 A2A 用例)
  • 对 A2A vs MCP 定位有精准的工程判断
  • 工程落地场景:Agent 架构选型、MCP vs A2A 边界判断、生产多 Agent 系统设计

条目 8:Loop Engineering for RAG — Towards Data Science

  • 来源:Towards Data Science (Medium)
  • URL:https://towardsdatascience.com/loop-engineering-for-rag-the-small-loops-inside-each-step-the-big-loops-across-the-pipeline
  • 类型:✅ 架构分析 + ✅ 反馈循环设计模式
  • 筛选判断:🟡 暂存(降低优先级)
  • 保留/降低理由
  • V1 Article 13 反馈循环模式(dispatcher feedback loop)有工程参考价值
  • 三个 loop 层次:inner loop(dispatcher)、dev loop(engineer)、outer loop(expert)
  • 但文章结构偏论文风,非实战命令或数据

条目 9:SageMaker Per-IC Metrics (vLLM/SGLang native)

  • 来源:AWS 官方(与条目 4 同源)
  • URL:同条目 4
  • 类型:与条目 4 重叠
  • 筛选判断:❌ 丢弃
  • 丢弃理由:同条目 4 内容

条目 10:LLM Inference Interview Questions (aiinterviewprep Substack)

  • 来源:Substack · Hao Hoang · AI Interview Prep
  • URL:https://aiinterviewprep.substack.com/p/llm-inference-interview-questions-5e2 等
  • 类型:面试题解析
  • 筛选判断:🟡 暂存
  • 保留/降低理由
  • 涉及"Abstention Collapse Trap"(reward hacking on tool-use agents)、"Warm-Start Trap"(SFT+RL 顺序)、"Reasoning Budget Trap"(thinking time vs user retention)
  • 这些陷阱有实战工程价值,可作 Agent 训练/评估的反面教材
  • 但非直接工程命令或性能数据,价值偏向方法论层面

条目 11:The Practical Guide to RAG-Based AI Development — Jellyfish

  • 来源:Jellyfish Technologies
  • URL:https://www.jellyfishtechnologies.com/rag-ai-development
  • 类型:✅ 性能数据 + ✅ 评估框架(RAGAS/DeepEval/ARES)
  • 筛选判断:✅ 保留(限精华部分)
  • 保留理由
  • FinanceBench 实测对比数字:Naive Multi-Doc ~19% vs Single-Doc ~50% vs Context-Optimized ~79%
  • 明确指出"fine-tuning 不能教模型新事实,只能改变行为/格式/风格"
  • 含 RAG 四维评估:context recall、context precision、faithfulness、citation correctness
  • 工程落地场景:RAG 架构选型、评估指标设计、Fine-tuning vs RAG 边界判断

条目 12:How to design interoperable AI agents without a security mess — Andela

  • 来源:Andela 技术博客
  • URL:https://www.andela.com/publication/how-to-design-interoperable-ai-agents-without-a-security-mess
  • 类型:✅ 安全分析 + ✅ MCP/A2A 协议评估
  • 筛选判断:✅ 保留
  • 保留理由
  • 明确列出 MCP/A2A 连接后新增的 7 个安全向量
  • "boring question" 测试法(production readiness checklist)
  • 协议连接后的 authority drift、capability overstatement 问题有实战价值
  • 工程落地场景:Agent 安全架构、生产 MCP/A2A 部署 checklist

条目 13:vLLM in 2026: Challenges and Optimizations — CDsoft (YouTube/CDsoft)

  • 来源:Facebook CDsoft · YouTube 视频摘要
  • URL:https://www.facebook.com/cdsoft.co.il/posts/vllm-in-2026-challenges-and-optimizations-as-llms-grow-in-size-context-length-an/1722771949851620
  • 类型:视频摘要
  • 筛选判断:🟡 暂存
  • 保留/降低理由
  • 主题涉及 vLLM 2026 挑战(LLM 规模增长、上下文长度、架构复杂性)
  • 提到 KV cache 管理、GPU kernels、大规模服务、跨硬件努力
  • 但无具体命令、性能数字或可复现步骤,仅视频预告

二、综合筛选结论

保留条目汇总(按工程价值排序)

优先级 条目 来源 核心工程价值
🔴 高 条目 3:Custom CUDA Kernels + vLLM 集成 47billion 源码+排障+命令,含 agent kernel 工作流
🔴 高 条目 4:SageMaker vLLM/SGLang 可观测性 AWS 官方 真实监控命令+指标表+OTel
🔴 高 条目 1:InferScale KV Injection arXiv 2607.27090 显存数字+对比数据+SGLang 集成
🔴 高 条目 7:A2A vs MCP 工程边界 CockroachDB 架构选型决策+边界条件
🟠 中高 条目 2:Online KV Cache Compaction for Agents arXiv 2608.00902 Agent 场景 KV 瓶颈+实测数据
🟠 中高 条目 11:RAG 评估实战数据 Jellyfish FinanceBench 对比数字+四维指标
🟠 中高 条目 12:MCP/A2A 安全架构 Andela 7 个安全向量+生产 checklist
🟡 中 条目 6:LLM 时代基础设施反思 arXiv 2608.01526 宏观趋势+ Rubin GPU 数字
🟡 中 条目 10:LLM 推理面试题陷阱 Substack Agent 训练/评估反模式

丢弃条目

条目 丢弃理由
条目 9 SageMaker per-IC(同条目 4 重复) 完全重复
条目 8 Loop Engineering(整体降级) 无具体命令/性能数据,论文风偏重

分类标签

#推理工程 #vLLM #SGLang #KV-Cache #CUDA-Kernels #SageMaker
#可观测性 #MCP #A2A #RAG评估 #Agent架构 #InferScale
#KEDA #Prometheus #OTel #FinanceBench

三、建议写入路径

本次筛选草稿写入路径

/shared/research-kb/inbox/jay/2026-08-21T1150-jay-engineering-filter.md

无需额外写入:本批次筛选结论已完整,未发现需单独产出高价值条目的情况(条目 3-4 可由上游生产者进一步处理为专项笔记)。

后续行动建议

  1. 精读推荐:条目 3(47billion vLLM CUDA kernel 集成)→ 可产出一篇「vLLM 定制内核集成实战」笔记
  2. 审稿推荐:条目 1(InferScale)→ 显存数字(1.8–4.8 GB/conversation)可用于更新知识库 KV Cache 主题页
  3. 架构决策参考:条目 7(CockroachDB A2A 分析)→ 建议直接引用至 Agent 架构选型主题页
  4. 降级处理:条目 5(CLO)、条目 8(Loop Engineering)→ 归档至知识库"待核实"队列