Jay 工程实践筛选 · 2026-08-21 上午批次
角色:Jay · 二次筛选(判断是否含真实环境/命令/错误/源码/性能数据/可复现步骤) 筛选时间:2026-08-21 11:50 (Asia/Shanghai) 检索范围:本轮 Tavily + 已有 RSS / arXiv 候选条目 × 13 条
一、候选条目清单与筛选结果
条目 1:InferScale: GPU-Native KV Injection for Personalized LLM Serving
- 来源:arXiv 2607.27090(~3 周前)
- URL:https://arxiv.org/abs/2607.27090
- 类型:学术工程论文(系统方向)
- 筛选判断:✅ 保留
- 保留理由:
- 含真实 GPU 显存数字(1.8–4.8 GB KV store per conversation)
- 与生产基线 Mem0 对比设计明确:prompt injection vs KV injection
- 含 Jasper proximity graph 部署开销(<25 MB per conversation)
- 使用 SGLang decode latency 实测数据
- 可复现:已开源(GitHub 链接在论文中)
- 工程落地场景:多轮 Agent 内存管理、RAG 个性化注入、长期对话 KV 优化
条目 2:Practical Online KV Cache Compaction for LLM Agents (arXiv 2608.00902)
- 来源:arXiv(近期)
- URL:https://arxiv.org/html/2608.00902
- 类型:学术工程论文
- 筛选判断:✅ 保留
- 保留理由:
- 针对"Agent 长轨迹 KV 积累"这一真实生产瓶颈
- 在线压缩(online compaction)vs 离线压缩区分清晰
- SGLang decode latency 实测 replay 方法论
- 含 agent trajectory accuracy vs serving efficiency 权衡数据表
- 明确指出 KV compaction 瓶颈在推理路径,非离线批处理
- 工程落地场景:代码生成 Agent、深度研究 Agent、长程任务推理优化
条目 3:Custom CUDA Kernels in the Age of AI Coding Agents — 47billion
- 来源:47billion.com(技术博客)
- URL:https://47billion.com/blog/custom-cuda-kernels-in-the-age-of-ai-coding-agents-inside-the-new-agent-skill-workflow-for-gpu-kernel-engineering
- 类型:✅ 命令 + ✅ 源码分析 + ✅ 性能数据 + ✅ 排障经验
- 筛选判断:✅ 保留
- 保留理由:
- 含 vLLM 自定义 kernel 集成完整流程(dispatch systems、build matrices)
- 明确指出"最难部分不是 kernel,是周围的 dispatch/build/debugging"
- 含 RoPE/GEGLU fused attention 性能动机分析
- 实测教训:CUDA/Triton kernel 在 vLLM 集成的坑
- 提供 agent-as-kernel-engineer 工作流评估
- 工程落地场景:vLLM 定制内核、高性能推理优化、GPU kernel 调试
条目 4:SageMaker AI Per-GPU Inference Metrics — AWS 官方文档
- 来源:AWS 官方文档
- URL:https://docs.aws.amazon.com/sagemaker/latest/dg/monitoring-cloudwatch-detailed-observability.html
- 类型:✅ 命令 + ✅ 环境配置 + ✅ 监控指标表
- 筛选判断:✅ 保留
- 保留理由:
- SageMaker 原生暴露 vLLM/SGLang 指标:TTFT、ITL、KV cache、queue depth、batch size、TPS
- Per-GPU attribution 实测配置(含 DCGM 集成)
- OTel Collector + Prometheus scraping 完整命令路径
- 明确维度标签(endpoint name、IC name、host.id、availability_zone)
- 工程落地场景:生产推理可观测性、多租户 GPU 监控、推理 SLO 告警
条目 5:CLO: Efficient LLM Inference with CPU-Light KVCache Offloading (arXiv 2511.14510)
- 来源:arXiv(历史论文,但本轮新发现)
- URL:https://arxiv.org/html/2511.14510v1
- 类型:学术系统论文
- 筛选判断:🟡 暂存(降低优先级)
- 保留/降低理由:
- 含真实 latency 数据(35.2% 和 30.7% 降低,附加 48%/43.2% 降幅)
- per-head metadata + at most one cache update 机制有工程参考价值
- 但论文日期较早(2025.11),且方法偏向学术,可能已被 InferScale 等新工作覆盖
- 后续行动:如知识库已有 KV offloading 主题页可参考;否则可降级
条目 6:Rethinking Classical Infrastructure Boundaries in LLM Inference Age (arXiv 2608.01526)
- 来源:arXiv(近期)
- URL:https://arxiv.org/html/2608.01526v1
- 类型:综述+系统分析
- 筛选判断:🟡 暂存
- 保留/降低理由:
- 含 NVIDIA Rubin GPU 性能数字(50 PFLOPS NVFP4,vs Blackwell Ultra 15 PFLOPS)
- 存储和传输带宽演进分析
- 提及 prefix caching 工业实践(vLLM/SGLang 生产配置)
- 但本文偏向宏观分析,缺乏具体命令或复现步骤
- 后续行动:适合作为基础设施趋势参考,不适合工程命令页
条目 7:A2A Agent State and Data Consistency — CockroachDB
- 来源:CockroachDB 官方博客
- URL:https://www.cockroachlabs.com/blog/a2a-agent-state-data-layer/
- 作者:Quentin Packard · 2026-08-19
- 类型:✅ 工程分析 + ✅ 边界条件评估
- 筛选判断:✅ 保留
- 保留理由:
- 明确指出 A2A 在单框架内多 Agent 的场景是过度设计("adds latency and failure modes without adding capability")
- 三个真实边界条件:单框架内 Agent(不需要 A2A)、单 Agent 多工具(MCP 范畴)、跨组织边界(真实 A2A 用例)
- 对 A2A vs MCP 定位有精准的工程判断
- 工程落地场景:Agent 架构选型、MCP vs A2A 边界判断、生产多 Agent 系统设计
条目 8:Loop Engineering for RAG — Towards Data Science
- 来源:Towards Data Science (Medium)
- URL:https://towardsdatascience.com/loop-engineering-for-rag-the-small-loops-inside-each-step-the-big-loops-across-the-pipeline
- 类型:✅ 架构分析 + ✅ 反馈循环设计模式
- 筛选判断:🟡 暂存(降低优先级)
- 保留/降低理由:
- V1 Article 13 反馈循环模式(dispatcher feedback loop)有工程参考价值
- 三个 loop 层次:inner loop(dispatcher)、dev loop(engineer)、outer loop(expert)
- 但文章结构偏论文风,非实战命令或数据
条目 9:SageMaker Per-IC Metrics (vLLM/SGLang native)
- 来源:AWS 官方(与条目 4 同源)
- URL:同条目 4
- 类型:与条目 4 重叠
- 筛选判断:❌ 丢弃
- 丢弃理由:同条目 4 内容
条目 10:LLM Inference Interview Questions (aiinterviewprep Substack)
- 来源:Substack · Hao Hoang · AI Interview Prep
- URL:https://aiinterviewprep.substack.com/p/llm-inference-interview-questions-5e2 等
- 类型:面试题解析
- 筛选判断:🟡 暂存
- 保留/降低理由:
- 涉及"Abstention Collapse Trap"(reward hacking on tool-use agents)、"Warm-Start Trap"(SFT+RL 顺序)、"Reasoning Budget Trap"(thinking time vs user retention)
- 这些陷阱有实战工程价值,可作 Agent 训练/评估的反面教材
- 但非直接工程命令或性能数据,价值偏向方法论层面
条目 11:The Practical Guide to RAG-Based AI Development — Jellyfish
- 来源:Jellyfish Technologies
- URL:https://www.jellyfishtechnologies.com/rag-ai-development
- 类型:✅ 性能数据 + ✅ 评估框架(RAGAS/DeepEval/ARES)
- 筛选判断:✅ 保留(限精华部分)
- 保留理由:
- FinanceBench 实测对比数字:Naive Multi-Doc ~19% vs Single-Doc ~50% vs Context-Optimized ~79%
- 明确指出"fine-tuning 不能教模型新事实,只能改变行为/格式/风格"
- 含 RAG 四维评估:context recall、context precision、faithfulness、citation correctness
- 工程落地场景:RAG 架构选型、评估指标设计、Fine-tuning vs RAG 边界判断
条目 12:How to design interoperable AI agents without a security mess — Andela
- 来源:Andela 技术博客
- URL:https://www.andela.com/publication/how-to-design-interoperable-ai-agents-without-a-security-mess
- 类型:✅ 安全分析 + ✅ MCP/A2A 协议评估
- 筛选判断:✅ 保留
- 保留理由:
- 明确列出 MCP/A2A 连接后新增的 7 个安全向量
- "boring question" 测试法(production readiness checklist)
- 协议连接后的 authority drift、capability overstatement 问题有实战价值
- 工程落地场景:Agent 安全架构、生产 MCP/A2A 部署 checklist
条目 13:vLLM in 2026: Challenges and Optimizations — CDsoft (YouTube/CDsoft)
- 来源:Facebook CDsoft · YouTube 视频摘要
- URL:https://www.facebook.com/cdsoft.co.il/posts/vllm-in-2026-challenges-and-optimizations-as-llms-grow-in-size-context-length-an/1722771949851620
- 类型:视频摘要
- 筛选判断:🟡 暂存
- 保留/降低理由:
- 主题涉及 vLLM 2026 挑战(LLM 规模增长、上下文长度、架构复杂性)
- 提到 KV cache 管理、GPU kernels、大规模服务、跨硬件努力
- 但无具体命令、性能数字或可复现步骤,仅视频预告
二、综合筛选结论
保留条目汇总(按工程价值排序)
| 优先级 | 条目 | 来源 | 核心工程价值 |
|---|---|---|---|
| 🔴 高 | 条目 3:Custom CUDA Kernels + vLLM 集成 | 47billion | 源码+排障+命令,含 agent kernel 工作流 |
| 🔴 高 | 条目 4:SageMaker vLLM/SGLang 可观测性 | AWS 官方 | 真实监控命令+指标表+OTel |
| 🔴 高 | 条目 1:InferScale KV Injection | arXiv 2607.27090 | 显存数字+对比数据+SGLang 集成 |
| 🔴 高 | 条目 7:A2A vs MCP 工程边界 | CockroachDB | 架构选型决策+边界条件 |
| 🟠 中高 | 条目 2:Online KV Cache Compaction for Agents | arXiv 2608.00902 | Agent 场景 KV 瓶颈+实测数据 |
| 🟠 中高 | 条目 11:RAG 评估实战数据 | Jellyfish | FinanceBench 对比数字+四维指标 |
| 🟠 中高 | 条目 12:MCP/A2A 安全架构 | Andela | 7 个安全向量+生产 checklist |
| 🟡 中 | 条目 6:LLM 时代基础设施反思 | arXiv 2608.01526 | 宏观趋势+ Rubin GPU 数字 |
| 🟡 中 | 条目 10:LLM 推理面试题陷阱 | Substack | Agent 训练/评估反模式 |
丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| 条目 9 SageMaker per-IC(同条目 4 重复) | 完全重复 |
| 条目 8 Loop Engineering(整体降级) | 无具体命令/性能数据,论文风偏重 |
分类标签
#推理工程 #vLLM #SGLang #KV-Cache #CUDA-Kernels #SageMaker
#可观测性 #MCP #A2A #RAG评估 #Agent架构 #InferScale
#KEDA #Prometheus #OTel #FinanceBench
三、建议写入路径
本次筛选草稿写入路径:
/shared/research-kb/inbox/jay/2026-08-21T1150-jay-engineering-filter.md
无需额外写入:本批次筛选结论已完整,未发现需单独产出高价值条目的情况(条目 3-4 可由上游生产者进一步处理为专项笔记)。
后续行动建议
- 精读推荐:条目 3(47billion vLLM CUDA kernel 集成)→ 可产出一篇「vLLM 定制内核集成实战」笔记
- 审稿推荐:条目 1(InferScale)→ 显存数字(1.8–4.8 GB/conversation)可用于更新知识库 KV Cache 主题页
- 架构决策参考:条目 7(CockroachDB A2A 分析)→ 建议直接引用至 Agent 架构选型主题页
- 降级处理:条目 5(CLO)、条目 8(Loop Engineering)→ 归档至知识库"待核实"队列