工程实践二次筛选报告 · Jay · 2026-07-14 下午场

筛选时间: 2026-07-14 14:50 (Asia/Shanghai) 筛选范围: 今日已产出的 5 份候选草稿 + RSS 来源文件 筛选角色: Jay(工程实践视角:真实环境、命令、错误、源码、性能数据、可复现步骤)


一、候选草稿综合评估

草稿文件 主要内容 工程密度评分 是否保留
2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md P/D 分离 · KVCache 综述 · H100 benchmark ⭐⭐⭐⭐⭐ ✅ 保留
2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md RAG anti-patterns · Agentic RAG · harness ⭐⭐⭐⭐ ✅ 保留(与上午场去重后合并)
2026-07-14-1105-morning-briefing-llm-vecdb-cloudnative-mamba3-inference.md Mamba-3 · KVCache 策略 · 向量数据库 · Cloud-native ⭐⭐⭐⭐⭐ ✅ 保留
2026-07-14-1220-csdn-vllm-sglang-agents-rag-engineering.md CSDN vLLM/SGLang 源码 · 部署命令 · QLoRA 数据 ⭐⭐⭐⭐ ✅ 保留
2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md 推理工程定义 · 20 种高级 RAG · 多模态 RAG · VectorDB 选型 ⭐⭐⭐⭐ ✅ 保留

二、各草稿高价值条目与筛选判断


✅ 草稿 1:2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md

保留理由: P/D Disaggregation 2026 生产化是推理系统工程的核心演进方向,条目质量高、去重清晰。

高价值条目(保留):

条目 核心价值 筛选判断
ByteByteGo AI Inference Engineering Guide(条目1) Prefill/Decode 物理分离条件、Prefix Caching 最佳实践、NIXL 协议细节,2026-06-15 新发布,系统性最强 保留
arXiv 2607.08057 KVCache 综述(条目2) Temporal/Spatial/Structural 三轴分类法,80+ 篇文献,工程落地框架 保留
AIMultiple H100 Benchmark(条目3) SGLang 16,215 tok/s vs vLLM 12,553 tok/s @ Llama3.1 8B H100,具体测试配置 保留(注意离线测试局限)
Spheron PD Disaggregation Guide(条目4) NIXL GPU 选型矩阵、vLLM NixlConnector 配置路径 保留
HaoaiLab DistServe 18 月回顾(条目5) DistServe 团队亲述、GB200 NVL72 实测 3.8x/4.8x 吞吐提升 保留

重叠条目(丢弃/降级): - ByteByteGo EP215(条目6)→ 与条目1 高度重叠,条目1 内容更完整,丢弃条目6


✅ 草稿 2:2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md

保留理由: RAG 生产排障 + Agent harness 覆盖了此前较少深入的两个垂直领域。

高价值条目(保留):

条目 核心价值 筛选判断
RAG Anti-Patterns 7 Failure Modes 句子密度诊断命令、k=3 教学默认值 vs 生产设置、BM25+向量混合检索 recall 数据 保留,可直接映射生产 debug
awesome-llm-token-optimization 2026 年 6-7 月 provider 定价数据、prompt caching 限制差异 保留,持续追踪
awesome-harness-engineering RUCAIBox 500+ 参考文献、IronClaw 案例、VoltAgent 363+ 论文 保留

丢弃条目(维持原判): - "2026 AI Engineer Roadmap" → 概览性,无工程深度 - "Complete Guide to Building AI Agents 2026" → 30+ 框架横向概览,深度不足 - Hugging Face "AI Model Releases Week of July 9" → 模型发布快讯,非工程实践


✅ 草稿 3:2026-07-14-1105-morning-briefing-llm-vecdb-cloudnative-mamba3-inference.md

保留理由: Mamba-3 ICLR 2026 + Energy-to-Token 评估范式 + WAIT 调度器,均有具体数据/代码出处。

高价值条目(保留):

条目 核心价值 筛选判断
Mamba-3 (arXiv:2603.15569, ICLR 2026) 1.5B +1.8pp vs Gated DeltaNet、长序列 decode 快 7 倍、Apache 2.0 精读优先级,7x 数字需核查 Princeton blog 原始数据
Energy-to-Token (arXiv:2605.11733) Joules/token 新评估范式、同精度能耗差异 2-3x 保留,影响成本核算
KV Cache Optimization Strategies (arXiv:2603.20397) 24 页完整综述,PagedAttention 量化数据 保留,作为推理系统工程主题页骨干
WAIT Scheduler (arXiv:2504.11320v4) 与 vLLM Continuous Batching 竞争思路、 Vidur 模拟器+真实 GPU 双验证 保留
Nemotron-3 (NVIDIA, arXiv:2604.12374) Mamba+Transformer+MoE 三元混合,TensorRT-LLM 配套 保留,与 Mamba-3 相互印证
Cloud-native LLM Research Agenda (arXiv:2604.17227) CNCF 生态与 LLM 基础设施交叉,serverless inference 路线图 保留
The AI Engineer 2026 Stack (Substack) Agent 栈六层架构,Memory/Safety 层独立出来 保留,行业洞察高价值
Mamba-3 GitHub (state-spaces/mamba) pip install causal-conv1d>=1.4.0 + mamba-ssm 双依赖 保留,复现基础条目

丢弃条目: Vector Database Market 2026(市场报告,非技术深度)→ 降级为选型参考,不单独归档


✅ 草稿 4:2026-07-14-1220-csdn-vllm-sglang-agents-rag-engineering.md

保留理由: CSDN 中难得包含实测数据、源码路径、部署命令的工程化内容。

高价值条目(保留,按工程密度排序):

条目 核心工程价值 筛选判断
vLLM v0.20.0 超深度架构分析(条目1) PagedAttention 核心设计、KV Cache 显存管理体系、调度器、continuous batching 完整代码路径 保留,结合 v0.20.0 tag 可复现
vLLM vs SGLang vs Ollama 三框架工程化对比(条目8) 同模型同机器同请求横向实测,含吞吐量/延迟/显存/并发稳定性指标 保留,生产选型直接参考
QLoRA vs LoRA 显存/时间/效果对比表(条目11) LoRA r=16: 11.2GB/2.1h/85.7 vs QLoRA r=16 4bit: 6.3GB/2.3h/85.1,有具体数值 保留,可直接用于训练方案选型
SGLang AMD ROCm 源码编译(条目6) AMD 平台依赖说明 + ROCm 源码编译避坑指南,国产 GPU 适配参考 保留,国内生产环境实用
TGI 进入 maintenance mode 分析(条目7) TGI 2025-12 maintenance 依据 + vLLM/SGLang 选型建议,工程决策参考 保留,2026 选型必读
Qwen3.6 GGUF 部署命令(条目4) uv pip install sglang[all] + vLLM 安装步骤 + GGUF 加载方式 保留,有具体命令
GPUStack Qwen3.6 benchmark(条目5) 统一部署管理流程 + 启动参数配置 + 实测数据 保留

降级条目: - vLLM 源码小白教程(条目3)→ 降级为入门参考,不单独归档,但保留在草稿内


保留理由: 推理工程定义框架 + 20 种高级 RAG 分类 + 多模态 RAG 工程决策框架,2026 年中节点系统性梳理。

高价值条目(保留):

条目 核心工程价值 筛选判断
Spheron Inference Engineering Guide Continuous Batching 3-5x 吞吐提升量化、KV Cache 显存计算(70B FP16 单请求 4GB)、Prefix Caching 降低 20-40% 计算量、量化精度对照表 保留,2026 年度最佳入门材料之一
Turing Post 20 Advanced RAG SURE-RAG 证据充分性判断 + abstention、QuCo-RAG 训练统计减少幻觉、Bidirectonal RAG 写回验证,均附 arXiv 链接 保留,精读后纳入 RAG 主题页
Big Data Boutique 多模态 RAG 工程指南 ColPali vs Unified Embedding vs Hybrid Late-Fusion 四架构对比、存储成本经济性(10M 页多向量 = 数TB)、Matryoshka 截断 1024→256 维减少 4x 存储 保留,工程决策框架实用
pgvector vs Pinecone 2026 pgvector 50M 向量 471 QPS @ 99% recall、快 Qdrant 11.4x,选型决策树 保留,2026 年 pgvector 已进入生产就绪区间
Graphify GitHub (85.1k stars) 代码→知识图谱,Claude/Cursor/Codex 集成,SWE-bench 潜力 保留观察,代码理解新范式

降级/丢弃条目: - OpenCut(67.4k stars,非 AI 工程重点)→ 丢弃 - HKUDS/Vibe-Trading(量化交易,个人 Agent)→ 降级,不归档 - airi(陪伴型 AI)→ 丢弃,工程关联度低


三、本日 RSS 来源额外筛选

Import AI #464(Fable 编写 GPU Kernels)⭐

来源: https://importai.substack.com/p/import-ai-464-fables-writes-gpu-kernels Substack 规则合规性: ✅ 作者 Jack Clark(Import AI 资深 newsletter),AI 行业技术洞察 内容摘要: - Fable(YC S21 初创)展示让 AI 自动化编写 GPU kernels 的能力 - 对推理工程有直接意义:kernel 自动优化可能降低 PagedAttention 等核心算子的手工优化门槛 - 不复制原文,仅记录为工程趋势线索

建议: 纳入工程趋势跟踪,标记为"kernel 自动生成"方向

MSR Blog 新条目

条目 工程价值 判断
SkillOpt: Agent Skill 作为可训练参数 将 Skill 编辑转化为训练过程,减少手工 prompt 工程 ✅ 纳入 Agent 记忆/技能工程跟踪
Memora: 谐波记忆表征 平衡抽象性与具体性的记忆表征,解决 context 填满效率下降问题 ✅ 纳入 Agent 记忆系统跟踪
Flint: 可视化语言 for AI Era AI Agent 生成图表的规约语言 ❌ 丢弃,非核心工程实践
Aurora 1.5 天气模型 科学应用,非 LLM 推理系统工程 ❌ 丢弃
SymCrypt Rust 验证 密码学工程,与 LLM 系统关联度低 ❌ 丢弃

ByteByteGo RSS 条目处理

微软如何在企业级规模部署 AI Agent(Marco Casalaina 采访) - 来源可信度高(微软核心 AI 产品VP) - 未读过原文,基于标题判断:企业级 Agent 交付挑战,适合纳入 agent engineering 跟踪 - 建议: 待 Tom/Stephen 实例读完原文后补充工程细节再归档


四、综合去重与合并建议

重叠条目(合并归档)

重叠主题 涉及草稿 合并建议
ByteByteGo AI Inference Engineering 草稿1(条目1)+ 草稿5(Spheron Guide) 草稿1 保留 ByteByteGo 专项;草稿5 保留 Spheron 指南,两者互补不冲突
Mamba-3 SSM 架构 草稿3(条目9)+ 草稿1(P/D disaggregation 可能提及) 草稿3 专项归档,草稿1 无冲突
vLLM/SGLang benchmark 草稿1(H100)+ 草稿4(CSDN)+ 草稿5(Spheron/ByteByteGo) 三者互补:草稿1 学术 benchmark、草稿4 CSDN 实测、草稿5 行业指南
Vector DB 选型 草稿3(市场数据)+ 草稿5(pgvector vs Pinecone) 草稿5 选型框架更完整,草稿3 市场数据降级为补充

建议审稿人关注的条目(按优先级)

优先级 条目 来源 关注点
🔴 精读 Mamba-3 (ICLR 2026) 草稿3 7x decode 加速数字核查 + Apache 2.0 复现路径
🔴 精读 ByteByteGo AI Inference Engineering Guide 草稿1 Prefix Caching prompt 结构设计建议是否与 Spheron 矛盾
🔴 精读 Big Data Boutique 多模态 RAG 指南 草稿5 ColPali 存储成本数据需与实际项目交叉验证
🟡 审稿 vLLM v0.20.0 架构分析(CSDN) 草稿4 代码路径标注是否与 v0.20.0 tag 一致
🟡 审稿 Turing Post 20 Advanced RAG 草稿5 各 RAG 变体 arXiv 链接有效性核查
🟡 审稿 QLoRA vs LoRA 对比数据(CSDN) 草稿4 85.7/85.1 效果指标来源和评估基准说明
🟢 跟踪 Import AI #464 Fable GPU Kernels RSS kernel 自动生成趋势,6 个月后评估工程成熟度
🟢 跟踪 MSR SkillOpt/Memora RSS Agent 技能训练 + 谐波记忆,学术向,非近期生产直接相关

五、分类标签汇总(去重后)

# Inference Engineering
P/D-disaggregation · vLLM · SGLang · TensorRT-LLM · NVIDIA-Dynamo · NIXL
KV-cache · PagedAttention · Prefix-caching · Continuous-batching · RadixAttention
Energy-to-Token · WAIT-scheduler · H100-benchmark · GB200-NVL72

# RAG Engineering
RAG-anti-patterns · Hybrid-retrieval · GraphRAG · Agentic-RAG · Multi-modal-RAG
ColPali · RRF-fusion · SURE-RAG · QuCo-RAG · Bidirectional-RAG
Sentence-density · Chunk-size

# AI Agent
Agent-harness · Loop-engineering · MCP · A2A · Multi-agent
Agentic-SE · SWE-bench · Uncertainty-quantification · SkillOpt · Memora
Self-evolving-agents · BDI-architecture

# Architecture
Mamba-3 · SSM · MoE · Hybrid-Transformer · Knowledge-distillation

# Infrastructure & Ops
Token-optimization · Quantization · FP8 · INT4-AWQ · AMD-GPU · ROCm
pgvector · Pinecone · VectorDB-selection · Cloud-native-LLM · CNCF
CNCF-Q1-2026

# Fine-tuning & Training
QLoRA · LoRA · Fine-tuning-pipeline

# Learning & Reference
awesome-harness-engineering · awesome-llm-token-optimization
ai-system-design-guide · RUCAIBox · SkillOpt · Memora

六、建议写入路径

主草稿(综合本轮二次筛选结论): /shared/research-kb/inbox/jay/2026-07-14-1450-engineering-filter-round2-jul2026.md

关联保留草稿(无需合并,直接归档): - /shared/research-kb/inbox/jay/2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md ✅ - /shared/research-kb/inbox/jay/2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md ✅ - /shared/research-kb/inbox/jay/2026-07-14-1105-morning-briefing-llm-vecdb-cloudnative-mamba3-inference.md ✅ - /shared/research-kb/inbox/jay/2026-07-14-1220-csdn-vllm-sglang-agents-rag-engineering.md ✅ - /shared/research-kb/inbox/jay/2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md

建议新增 RSS 处理条目(待原文精读后归档): - Import AI #464(Fable GPU Kernels)→ 归档路径:2026-07-14-rss-import-ai-fable-gpu-kernels.md(待写入) - ByteByteGo 微软 Agent 采访 → 归档路径:2026-07-14-rss-bytebytego-microsoft-agent.md(待原文精读后判断)


七、主题页更新建议汇总

主题页 更新内容 优先级 负责人
LLM 推理系统工程 补充 Mamba-3 ICLR 2026 + Energy-to-Token 范式 + ByteByteGo Prefill/Decode 详解 Jay
RAG 生产工程 合并 RAG Anti-Patterns 7 Failure + Turing Post 20 种高级 RAG + 多模态 RAG ColPali 架构对比 Jay
Vector DB 工程 补充 pgvector 2026 新基准(50M 向量 471 QPS)+ 选型决策树 Jay
AI Agent 工程栈 合并 The AI Engineer 2026 Stack(6 层架构)+ ByteByteGo EP215 Agent Anatomy + MSR SkillOpt/Memora Jay
Token 成本优化 补充 awesome-llm-token-optimization 2026 年 6-7 月定价数据 低(持续追踪) Jay

本报告由 Jay 实例生成 · 2026-07-14 14:50 (Asia/Shanghai) · 禁止复制全文 · 仅供研究线索和技术洞察用途