工程实践二次筛选报告 · Jay · 2026-07-14 下午场
筛选时间: 2026-07-14 14:50 (Asia/Shanghai) 筛选范围: 今日已产出的 5 份候选草稿 + RSS 来源文件 筛选角色: Jay(工程实践视角:真实环境、命令、错误、源码、性能数据、可复现步骤)
一、候选草稿综合评估
| 草稿文件 | 主要内容 | 工程密度评分 | 是否保留 |
|---|---|---|---|
2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md |
P/D 分离 · KVCache 综述 · H100 benchmark | ⭐⭐⭐⭐⭐ | ✅ 保留 |
2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md |
RAG anti-patterns · Agentic RAG · harness | ⭐⭐⭐⭐ | ✅ 保留(与上午场去重后合并) |
2026-07-14-1105-morning-briefing-llm-vecdb-cloudnative-mamba3-inference.md |
Mamba-3 · KVCache 策略 · 向量数据库 · Cloud-native | ⭐⭐⭐⭐⭐ | ✅ 保留 |
2026-07-14-1220-csdn-vllm-sglang-agents-rag-engineering.md |
CSDN vLLM/SGLang 源码 · 部署命令 · QLoRA 数据 | ⭐⭐⭐⭐ | ✅ 保留 |
2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md |
推理工程定义 · 20 种高级 RAG · 多模态 RAG · VectorDB 选型 | ⭐⭐⭐⭐ | ✅ 保留 |
二、各草稿高价值条目与筛选判断
✅ 草稿 1:2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md
保留理由: P/D Disaggregation 2026 生产化是推理系统工程的核心演进方向,条目质量高、去重清晰。
高价值条目(保留):
| 条目 | 核心价值 | 筛选判断 |
|---|---|---|
| ByteByteGo AI Inference Engineering Guide(条目1) | Prefill/Decode 物理分离条件、Prefix Caching 最佳实践、NIXL 协议细节,2026-06-15 新发布,系统性最强 | ✅ 保留 |
| arXiv 2607.08057 KVCache 综述(条目2) | Temporal/Spatial/Structural 三轴分类法,80+ 篇文献,工程落地框架 | ✅ 保留 |
| AIMultiple H100 Benchmark(条目3) | SGLang 16,215 tok/s vs vLLM 12,553 tok/s @ Llama3.1 8B H100,具体测试配置 | ✅ 保留(注意离线测试局限) |
| Spheron PD Disaggregation Guide(条目4) | NIXL GPU 选型矩阵、vLLM NixlConnector 配置路径 | ✅ 保留 |
| HaoaiLab DistServe 18 月回顾(条目5) | DistServe 团队亲述、GB200 NVL72 实测 3.8x/4.8x 吞吐提升 | ✅ 保留 |
重叠条目(丢弃/降级): - ByteByteGo EP215(条目6)→ 与条目1 高度重叠,条目1 内容更完整,丢弃条目6
✅ 草稿 2:2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md
保留理由: RAG 生产排障 + Agent harness 覆盖了此前较少深入的两个垂直领域。
高价值条目(保留):
| 条目 | 核心价值 | 筛选判断 |
|---|---|---|
| RAG Anti-Patterns 7 Failure Modes | 句子密度诊断命令、k=3 教学默认值 vs 生产设置、BM25+向量混合检索 recall 数据 | ✅ 保留,可直接映射生产 debug |
| awesome-llm-token-optimization | 2026 年 6-7 月 provider 定价数据、prompt caching 限制差异 | ✅ 保留,持续追踪 |
| awesome-harness-engineering | RUCAIBox 500+ 参考文献、IronClaw 案例、VoltAgent 363+ 论文 | ✅ 保留 |
丢弃条目(维持原判): - "2026 AI Engineer Roadmap" → 概览性,无工程深度 - "Complete Guide to Building AI Agents 2026" → 30+ 框架横向概览,深度不足 - Hugging Face "AI Model Releases Week of July 9" → 模型发布快讯,非工程实践
✅ 草稿 3:2026-07-14-1105-morning-briefing-llm-vecdb-cloudnative-mamba3-inference.md
保留理由: Mamba-3 ICLR 2026 + Energy-to-Token 评估范式 + WAIT 调度器,均有具体数据/代码出处。
高价值条目(保留):
| 条目 | 核心价值 | 筛选判断 |
|---|---|---|
| Mamba-3 (arXiv:2603.15569, ICLR 2026) | 1.5B +1.8pp vs Gated DeltaNet、长序列 decode 快 7 倍、Apache 2.0 | ✅ 精读优先级,7x 数字需核查 Princeton blog 原始数据 |
| Energy-to-Token (arXiv:2605.11733) | Joules/token 新评估范式、同精度能耗差异 2-3x | ✅ 保留,影响成本核算 |
| KV Cache Optimization Strategies (arXiv:2603.20397) | 24 页完整综述,PagedAttention 量化数据 | ✅ 保留,作为推理系统工程主题页骨干 |
| WAIT Scheduler (arXiv:2504.11320v4) | 与 vLLM Continuous Batching 竞争思路、 Vidur 模拟器+真实 GPU 双验证 | ✅ 保留 |
| Nemotron-3 (NVIDIA, arXiv:2604.12374) | Mamba+Transformer+MoE 三元混合,TensorRT-LLM 配套 | ✅ 保留,与 Mamba-3 相互印证 |
| Cloud-native LLM Research Agenda (arXiv:2604.17227) | CNCF 生态与 LLM 基础设施交叉,serverless inference 路线图 | ✅ 保留 |
| The AI Engineer 2026 Stack (Substack) | Agent 栈六层架构,Memory/Safety 层独立出来 | ✅ 保留,行业洞察高价值 |
| Mamba-3 GitHub (state-spaces/mamba) | pip install causal-conv1d>=1.4.0 + mamba-ssm 双依赖 | ✅ 保留,复现基础条目 |
丢弃条目: Vector Database Market 2026(市场报告,非技术深度)→ 降级为选型参考,不单独归档
✅ 草稿 4:2026-07-14-1220-csdn-vllm-sglang-agents-rag-engineering.md
保留理由: CSDN 中难得包含实测数据、源码路径、部署命令的工程化内容。
高价值条目(保留,按工程密度排序):
| 条目 | 核心工程价值 | 筛选判断 |
|---|---|---|
| vLLM v0.20.0 超深度架构分析(条目1) | PagedAttention 核心设计、KV Cache 显存管理体系、调度器、continuous batching 完整代码路径 | ✅ 保留,结合 v0.20.0 tag 可复现 |
| vLLM vs SGLang vs Ollama 三框架工程化对比(条目8) | 同模型同机器同请求横向实测,含吞吐量/延迟/显存/并发稳定性指标 | ✅ 保留,生产选型直接参考 |
| QLoRA vs LoRA 显存/时间/效果对比表(条目11) | LoRA r=16: 11.2GB/2.1h/85.7 vs QLoRA r=16 4bit: 6.3GB/2.3h/85.1,有具体数值 | ✅ 保留,可直接用于训练方案选型 |
| SGLang AMD ROCm 源码编译(条目6) | AMD 平台依赖说明 + ROCm 源码编译避坑指南,国产 GPU 适配参考 | ✅ 保留,国内生产环境实用 |
| TGI 进入 maintenance mode 分析(条目7) | TGI 2025-12 maintenance 依据 + vLLM/SGLang 选型建议,工程决策参考 | ✅ 保留,2026 选型必读 |
| Qwen3.6 GGUF 部署命令(条目4) | uv pip install sglang[all] + vLLM 安装步骤 + GGUF 加载方式 | ✅ 保留,有具体命令 |
| GPUStack Qwen3.6 benchmark(条目5) | 统一部署管理流程 + 启动参数配置 + 实测数据 | ✅ 保留 |
降级条目: - vLLM 源码小白教程(条目3)→ 降级为入门参考,不单独归档,但保留在草稿内
✅ 草稿 5:2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md
保留理由: 推理工程定义框架 + 20 种高级 RAG 分类 + 多模态 RAG 工程决策框架,2026 年中节点系统性梳理。
高价值条目(保留):
| 条目 | 核心工程价值 | 筛选判断 |
|---|---|---|
| Spheron Inference Engineering Guide | Continuous Batching 3-5x 吞吐提升量化、KV Cache 显存计算(70B FP16 单请求 4GB)、Prefix Caching 降低 20-40% 计算量、量化精度对照表 | ✅ 保留,2026 年度最佳入门材料之一 |
| Turing Post 20 Advanced RAG | SURE-RAG 证据充分性判断 + abstention、QuCo-RAG 训练统计减少幻觉、Bidirectonal RAG 写回验证,均附 arXiv 链接 | ✅ 保留,精读后纳入 RAG 主题页 |
| Big Data Boutique 多模态 RAG 工程指南 | ColPali vs Unified Embedding vs Hybrid Late-Fusion 四架构对比、存储成本经济性(10M 页多向量 = 数TB)、Matryoshka 截断 1024→256 维减少 4x 存储 | ✅ 保留,工程决策框架实用 |
| pgvector vs Pinecone 2026 | pgvector 50M 向量 471 QPS @ 99% recall、快 Qdrant 11.4x,选型决策树 | ✅ 保留,2026 年 pgvector 已进入生产就绪区间 |
| Graphify GitHub (85.1k stars) | 代码→知识图谱,Claude/Cursor/Codex 集成,SWE-bench 潜力 | ✅ 保留观察,代码理解新范式 |
降级/丢弃条目: - OpenCut(67.4k stars,非 AI 工程重点)→ 丢弃 - HKUDS/Vibe-Trading(量化交易,个人 Agent)→ 降级,不归档 - airi(陪伴型 AI)→ 丢弃,工程关联度低
三、本日 RSS 来源额外筛选
Import AI #464(Fable 编写 GPU Kernels)⭐
来源: https://importai.substack.com/p/import-ai-464-fables-writes-gpu-kernels Substack 规则合规性: ✅ 作者 Jack Clark(Import AI 资深 newsletter),AI 行业技术洞察 内容摘要: - Fable(YC S21 初创)展示让 AI 自动化编写 GPU kernels 的能力 - 对推理工程有直接意义:kernel 自动优化可能降低 PagedAttention 等核心算子的手工优化门槛 - 不复制原文,仅记录为工程趋势线索
建议: 纳入工程趋势跟踪,标记为"kernel 自动生成"方向
MSR Blog 新条目
| 条目 | 工程价值 | 判断 |
|---|---|---|
| SkillOpt: Agent Skill 作为可训练参数 | 将 Skill 编辑转化为训练过程,减少手工 prompt 工程 | ✅ 纳入 Agent 记忆/技能工程跟踪 |
| Memora: 谐波记忆表征 | 平衡抽象性与具体性的记忆表征,解决 context 填满效率下降问题 | ✅ 纳入 Agent 记忆系统跟踪 |
| Flint: 可视化语言 for AI Era | AI Agent 生成图表的规约语言 | ❌ 丢弃,非核心工程实践 |
| Aurora 1.5 天气模型 | 科学应用,非 LLM 推理系统工程 | ❌ 丢弃 |
| SymCrypt Rust 验证 | 密码学工程,与 LLM 系统关联度低 | ❌ 丢弃 |
ByteByteGo RSS 条目处理
微软如何在企业级规模部署 AI Agent(Marco Casalaina 采访) - 来源可信度高(微软核心 AI 产品VP) - 未读过原文,基于标题判断:企业级 Agent 交付挑战,适合纳入 agent engineering 跟踪 - 建议: 待 Tom/Stephen 实例读完原文后补充工程细节再归档
四、综合去重与合并建议
重叠条目(合并归档)
| 重叠主题 | 涉及草稿 | 合并建议 |
|---|---|---|
| ByteByteGo AI Inference Engineering | 草稿1(条目1)+ 草稿5(Spheron Guide) | 草稿1 保留 ByteByteGo 专项;草稿5 保留 Spheron 指南,两者互补不冲突 |
| Mamba-3 SSM 架构 | 草稿3(条目9)+ 草稿1(P/D disaggregation 可能提及) | 草稿3 专项归档,草稿1 无冲突 |
| vLLM/SGLang benchmark | 草稿1(H100)+ 草稿4(CSDN)+ 草稿5(Spheron/ByteByteGo) | 三者互补:草稿1 学术 benchmark、草稿4 CSDN 实测、草稿5 行业指南 |
| Vector DB 选型 | 草稿3(市场数据)+ 草稿5(pgvector vs Pinecone) | 草稿5 选型框架更完整,草稿3 市场数据降级为补充 |
建议审稿人关注的条目(按优先级)
| 优先级 | 条目 | 来源 | 关注点 |
|---|---|---|---|
| 🔴 精读 | Mamba-3 (ICLR 2026) | 草稿3 | 7x decode 加速数字核查 + Apache 2.0 复现路径 |
| 🔴 精读 | ByteByteGo AI Inference Engineering Guide | 草稿1 | Prefix Caching prompt 结构设计建议是否与 Spheron 矛盾 |
| 🔴 精读 | Big Data Boutique 多模态 RAG 指南 | 草稿5 | ColPali 存储成本数据需与实际项目交叉验证 |
| 🟡 审稿 | vLLM v0.20.0 架构分析(CSDN) | 草稿4 | 代码路径标注是否与 v0.20.0 tag 一致 |
| 🟡 审稿 | Turing Post 20 Advanced RAG | 草稿5 | 各 RAG 变体 arXiv 链接有效性核查 |
| 🟡 审稿 | QLoRA vs LoRA 对比数据(CSDN) | 草稿4 | 85.7/85.1 效果指标来源和评估基准说明 |
| 🟢 跟踪 | Import AI #464 Fable GPU Kernels | RSS | kernel 自动生成趋势,6 个月后评估工程成熟度 |
| 🟢 跟踪 | MSR SkillOpt/Memora | RSS | Agent 技能训练 + 谐波记忆,学术向,非近期生产直接相关 |
五、分类标签汇总(去重后)
# Inference Engineering
P/D-disaggregation · vLLM · SGLang · TensorRT-LLM · NVIDIA-Dynamo · NIXL
KV-cache · PagedAttention · Prefix-caching · Continuous-batching · RadixAttention
Energy-to-Token · WAIT-scheduler · H100-benchmark · GB200-NVL72
# RAG Engineering
RAG-anti-patterns · Hybrid-retrieval · GraphRAG · Agentic-RAG · Multi-modal-RAG
ColPali · RRF-fusion · SURE-RAG · QuCo-RAG · Bidirectional-RAG
Sentence-density · Chunk-size
# AI Agent
Agent-harness · Loop-engineering · MCP · A2A · Multi-agent
Agentic-SE · SWE-bench · Uncertainty-quantification · SkillOpt · Memora
Self-evolving-agents · BDI-architecture
# Architecture
Mamba-3 · SSM · MoE · Hybrid-Transformer · Knowledge-distillation
# Infrastructure & Ops
Token-optimization · Quantization · FP8 · INT4-AWQ · AMD-GPU · ROCm
pgvector · Pinecone · VectorDB-selection · Cloud-native-LLM · CNCF
CNCF-Q1-2026
# Fine-tuning & Training
QLoRA · LoRA · Fine-tuning-pipeline
# Learning & Reference
awesome-harness-engineering · awesome-llm-token-optimization
ai-system-design-guide · RUCAIBox · SkillOpt · Memora
六、建议写入路径
主草稿(综合本轮二次筛选结论):
/shared/research-kb/inbox/jay/2026-07-14-1450-engineering-filter-round2-jul2026.md
关联保留草稿(无需合并,直接归档):
- /shared/research-kb/inbox/jay/2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md ✅
- /shared/research-kb/inbox/jay/2026-07-14-1050-engineering-filter-jul2026-rag-harness-arxiv.md ✅
- /shared/research-kb/inbox/jay/2026-07-14-1105-morning-briefing-llm-vecdb-cloudnative-mamba3-inference.md ✅
- /shared/research-kb/inbox/jay/2026-07-14-1220-csdn-vllm-sglang-agents-rag-engineering.md ✅
- /shared/research-kb/inbox/jay/2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md ✅
建议新增 RSS 处理条目(待原文精读后归档):
- Import AI #464(Fable GPU Kernels)→ 归档路径:2026-07-14-rss-import-ai-fable-gpu-kernels.md(待写入)
- ByteByteGo 微软 Agent 采访 → 归档路径:2026-07-14-rss-bytebytego-microsoft-agent.md(待原文精读后判断)
七、主题页更新建议汇总
| 主题页 | 更新内容 | 优先级 | 负责人 |
|---|---|---|---|
| LLM 推理系统工程 | 补充 Mamba-3 ICLR 2026 + Energy-to-Token 范式 + ByteByteGo Prefill/Decode 详解 | 高 | Jay |
| RAG 生产工程 | 合并 RAG Anti-Patterns 7 Failure + Turing Post 20 种高级 RAG + 多模态 RAG ColPali 架构对比 | 高 | Jay |
| Vector DB 工程 | 补充 pgvector 2026 新基准(50M 向量 471 QPS)+ 选型决策树 | 中 | Jay |
| AI Agent 工程栈 | 合并 The AI Engineer 2026 Stack(6 层架构)+ ByteByteGo EP215 Agent Anatomy + MSR SkillOpt/Memora | 中 | Jay |
| Token 成本优化 | 补充 awesome-llm-token-optimization 2026 年 6-7 月定价数据 | 低(持续追踪) | Jay |
本报告由 Jay 实例生成 · 2026-07-14 14:50 (Asia/Shanghai) · 禁止复制全文 · 仅供研究线索和技术洞察用途