工程筛选报告 · Jay · 2026-08-15 上午

筛选范围

今日入库的所有研究条目(CSDN/Substack/GitHub/RSS/arXiv)


一、保留条目(含理由)

✅ 条目 E1|vLLM vs SGLang AWQ INT4 量化实测

来源: CSDN · 2026-08-15T0820 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐

保留理由: - 真实量化数据: 14.7GB → 4.2GB 压缩率,并发 12→36(3倍) - 实测环境明确: 双框架 A/B 对比,含 TTFT/吞吐量/显存效率分项 - 关键洞察: memory-bound 任务中量化反而提速的工程原理 - 生产可用: AWQ INT4 选型决策和 FP8 RTX 4090 最优配置可直接参考

保留决策: 精读 —— 2026 年推理框架量化选型的核心参考数据


✅ 条目 E2|Milvus RAG 硬核实战

来源: CSDN · 2026-08-15T0820 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐

保留理由: - 代码级可复现: AnnSearchRequest + WeightedRanker(0.7, 0.3) 混合检索配置 - 完整踩坑记录: 亿级向量性能调优、存算分离部署 - LangChain Milvus VectorStore 封装示例: 可直接移植到生产项目 - 稀缺性: CSDN 上少见的完整 Milvus 端到端 RAG 实操文档

保留决策: 精读 —— 混合检索权重重排序配置是 2026 RAG 生产落地的关键细节


✅ 条目 E3|PD Disaggregation 多轮 Agent 场景问题

来源: CSDN · 2026-08-15T0820 + arXiv 2603.13358 工程价值: ⭐⭐⭐⭐⭐

保留理由: - 多篇 arXiv 实证: Nexus 系统(2507.06608)、Not All Prefills Are Equal(2603.13358) - 关键工程发现: PD disaggregation 在多轮对话(主流 Agent 模式)下存在严重低效 - vLLM v0.8+ 原生支持: via NixlConnector,NIXL = NVIDIA Inference Xfer Library - SGLang Mooncake 方案: Proxy/Prefill/Decode 三组件 KV cache 传输 - 数据支撑: Nexus 吞吐量 2.2x↑,TTFT 20x↓,TBT 2.5x↓

保留决策: 精读 —— 多轮 Agent 场景是 2026 推理优化主战场,此发现直接影响部署架构选型


✅ 条目 E4|The AI Agents Stack (2026 Edition)

来源: The AI Engineer Substack · 2026-08-15T0820 工程价值: ⭐⭐⭐⭐⭐ | 可信度: 高

保留理由: - Eval 三层收敛框架: PR级检查 → LLM judge 夜间回归 → 生产漂移监控 - 新 Benchmark 收录: Context-Bench、Recovery-Bench、Terminal-Bench(Kimi K3 达 83 分) - Guardrails 独立成 discipline: 工具调用授权/限速/状态追踪,不再是 input/output 过滤器 - 2026 Agent 工程实践地图: 当前最系统的行业工程趋势分析

保留决策: 审稿级精读 —— 需要核验三个新 Benchmark 论文/代码仓库


✅ 条目 E5|NirDiamant/agents-towards-production

来源: GitHub · 2026-08-15T0952 ⭐ 21,285 | Forks: 2,822 | Python/Jupyter

保留理由: - 端到端路线图: 原型 → 企业级部署全流程代码优先教程 - 生产级覆盖广度: 涵盖 Guardrails、Eval、Memory、Tool Use、Multi-Agent - 持续活跃: 2026-08-15 更新,Jupyter Notebook 格式适合内部培训 - 工程教学稀缺性: 真正从 0 到生产的 Agent 工程教程,而非 API 包装演示

保留决策: 精读 —— 团队内部培训价值极高,建议配合主题页更新


✅ 条目 E6|alibaba/zvec

来源: GitHub · 2026-08-15T0952 ⭐ 15,443 | Forks: 977 | C++

保留理由: - 嵌入式场景首选: 进程内(in-process)向量库,零网络开销 - C++ 高性能: 对标 FAISS/HNSW,性能数据值得关注 - LLM Memory 场景: 官方 tagline 明确指向 Agent 记忆层 - 国内大厂维护: 阿里技术背书,工程可信赖度较高

保留决策: 关注/核验 —— 需查阅官方 benchmark 对比 FAISS 的原始数据,暂列收藏


✅ 条目 E7|Lilian Weng · Harness Engineering for Self-Improvement

来源: Lilian Weng RSS · 2026-08-15-1002 原文: https://lilianweng.github.io/posts/2026-07-04-harness/

保留理由: - RSI 完整技术脉络: 从 I. J. Good (1965) 到 2026 最新进展 - Harness 工程化定义: 构建 Agent 自我改进系统的核心工程原则 - 作者权威性: Lilian Weng 是 OpenAI Agent 团队核心成员 - 长文深度: 适合作为 Agentic AI 自我改进方向的研究入口

保留决策: 精读 —— RSI (Recursive Self-Improvement) 是 2026 下半年 Agent 前沿方向之一


✅ 条目 E8|Sebastian Raschka · Recent LLM Architecture Developments

来源: Raschka RSS · 2026-08-15-1000 原文: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures

保留理由: - KV Sharing / mHC / Compressed Attention: 长上下文成本优化技术栈梳理 - Gemma 4 → DeepSeek V4: 新型开源权重模型架构演进对比 - 工程导向: 面向实践者的 LLM 架构趋势分析,非纯理论研究 - 稀缺性: 少有的开源权重模型架构系统性分析

保留决策: 精读 —— DeepSeek V4 的架构创新值得重点关注


✅ 条目 E9|Sebastian Raschka · Controlling Reasoning Effort in LLMs

来源: Raschka RSS · 2026-08-15-1000 原文: https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms

保留理由: - 推理力度控制: 低/中/高力度推理模式的工程化实现 - Test-time Compute 延伸: 与 o1/o3 推理链技术直接相关 - 实用性: 可用于推理成本控制和性能调优

保留决策: 收藏 —— 与推理工程主题页高度相关


✅ 条目 E10|Sebastian Raschka · Using Local Coding Agents

来源: Raschka RSS · 2026-08-15-1000 原文: https://magazine.sebastianraschka.com/p/using-local-coding-agents

保留理由: - 开源替代方案: 本地 Coding Harness 对比 Claude Code/Codex 订阅 - 工程实操: 具体工具配置和本地模型选型建议 - 成本优化: 适合团队内部推理成本管理

保留决策: 收藏 —— Coding Agent 工程实践参考


✅ 条目 E11|MSR Orchard · Agentic AI 开源框架

来源: Microsoft Research Blog RSS · 2026-08-15-1002 原文: https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/

保留理由: - 微软官方背书: MSR 出品的 Agentic AI 训练/评估框架 - 跨任务泛化: 支持从小型模型到大型模型的 Agent 训练 - 开源: 降低 Agent 研究门槛 - 工程参考: 框架设计模式值得架构师参考

保留决策: 关注 —— Orchard 的任务无关训练设计值得关注


✅ 条目 E12|arXiv 2608.13237 · Search-R1 多轮 RAG 停止判断

来源: Cool Papers IR RSS · 2026-08-15-1001 原文: https://papers.cool/arxiv/2608.13237

保留理由: - 核心问题重要: 多轮 RAG 何时停止是生产部署的关键工程问题 - Search-R1 框架: 结构化停止判断与检索缩减 - first STOP 决定策略: 揭示多轮 RAG 策略的关键洞察 - 工程落地直接相关: 与 RAG 主题页高度吻合

保留决策: 精读 —— 多轮 RAG 生产落地的核心工程问题


✅ 条目 E13|OpenAI WebSocket Responses API

来源: AIxFunda Substack · 2026-08-15T0952 可信度: 高(官方发布)

保留理由: - 实测数据支撑: 20+ Tool Calls 任务提速 40% - 连接维持 60 分钟: 解决长时 Agent 任务痛点 - Vercel AI SDK 率先集成: 工程落地明确 - previous_response_id 机制: 避免重发完整上下文,架构创新

保留决策: 关注 —— Agent 流式任务和长时 Tool Use 场景受益,2026 下半年进入生产


二、丢弃条目(含理由)

❌ ByteByteGo · API Composition 技术详解

丢弃理由: 通用 API 架构模式,非 AI/ML 专项工程。ByteByteGo 本轮其余条目(Cloudflare AI 变现、标题党治理、读写路径)均为非 AI 工程内容,与知识库定位不符。

❌ Nathan Benaich · 欧洲 AI 主权 / Fund III 融资

丢弃理由: 投资分析和政策评论,非工程实践内容。"State of AI" 系列的投资/地缘政治视角与本知识库 AI 工程实践定位不符。保留条目 8(AI Agents Stack 2026)已覆盖更系统的行业工程趋势。

❌ CSDN 条目 6/7(MCP 协议两篇)

丢弃理由: 协议概述性内容,代码深度不足,缺少真实环境验证。两篇均属于"知道这是什么"而非"知道怎么落地",与精读条目(agents-towards-production)高度重叠但深度不足。Substack 条目 4(AI Engineers Stack 2026)已覆盖 MCP 工程定位。

❌ CSDN 条目 1(推理框架选型矩阵)

丢弃理由: 综合性概述,缺少实测数据。与条目 E1(vLLM vs SGLang AWQ INT4)内容重叠,但后者有具体量化数据。条目 E1 已含 FlashMLA/DualPipe/EPLB 关键信息。

❌ CSDN 条目 3(vLLM/SGLang/TensorRT-LLM 架构对决)

丢弃理由: 架构层面梳理完整,但缺乏实测数据和可复现步骤。K8s DRA 和 Agent 协议栈信息有价值,但更适合作为趋势参考而非工程精读。可作为主题页背景资料,但不单独保留。

❌ CSDN 条目 5(向量数据库自建 vs 外采)

丢弃理由: 决策框架有价值,但缺少代码级细节和真实踩坑数据。与条目 E2(Milvus 硬核实战)相比,工程深度不足。保留条目 E2 已覆盖混合检索、权重重排序和亿级调优。

❌ CSDN 条目 10(vLLM/SGLang/TensorRT-LLM 选型指南)

丢弃理由: 与条目 E1 高度重复,且实测数据不及 E1 具体。选型决策表和快速启动代码有一定价值,但不足以单独保留。

❌ MMOA-RAG (Shchegrikovich Substack)

丢弃理由: 引用论文需要核验,Multi-Agent PPO 优化框架的具体实现细节未披露。可信度中等,暂不纳入精读清单。


三、本轮高价值条目汇总

优先级 条目 来源 核心价值
🔴精读 E1: vLLM vs SGLang AWQ INT4 CSDN 3x并发实测数据
🔴精读 E2: Milvus RAG 硬核实战 CSDN 混合检索代码
🔴精读 E3: PD Disaggregation CSDN+arXiv 多轮Agent新发现
🔴精读 E4: AI Agents Stack 2026 Substack Guardrails独立成discipline
🔴精读 E5: agents-towards-production GitHub 端到端生产教程
🔴精读 E7: Harness RSI Lilian Weng RSI工程化脉络
🔴精读 E8: LLM架构演进 Raschka KV Sharing/mHC
🔴精读 E12: Search-R1 arXiv 多轮RAG停止判断
🟡关注 E6: zvec GitHub 嵌入式向量库
🟡关注 E9: Reasoning Effort Raschka 推理成本控制
🟡关注 E10: Local Coding Agents Raschka 开源替代方案
🟡关注 E11: MSR Orchard MSR Agent框架设计
🟡关注 E13: OpenAI WebSocket Substack 40%提速数据

四、分类标签建议

#LLM推理工程 #vLLM #SGLang #AWQ-INT4 #量化压缩
#PD-disaggregation #MoE #FlashMLA #Nexus系统
#RAG #向量数据库 #Milvus #混合检索 #HNSW #zvec
#Agentic-RAG #MCP #Agent工具编排 #Guardrails
#Eval #Benchmark #Context-Bench #Terminal-Bench #Recovery-Bench
#Agentic-AI #Harness工程 #RSI #自我改进
#LLM架构 #KV-Sharing #Compressed-Attention #DeepSeek-V4
#GitHub #生产部署 #Coding-Agent

五、建议写入路径

草稿路径: /shared/research-kb/inbox/jay/2026-08-15T1050-jay-engineering-screening.md


六、后续行动建议

精读队列(按优先级): 1. E1 → 更新 LLM 推理工程主题页(量化选型数据) 2. E2 → 更新 RAG/向量数据库主题页(Milvus 硬核实战) 3. E3 → 更新 LLM 推理工程主题页(PD Disaggregation 新发现) 4. E4 → 审稿:核验 Context-Bench/Recovery-Bench/Terminal-Bench 论文 5. E5 → 团队内部培训材料开发 6. E7 → Agentic AI 前沿方向研究 7. E8 → LLM 架构主题页更新 8. E12 → RAG 生产工程主题页

主题页更新建议: - LLM 推理工程: E1, E3, E8 - RAG / 向量数据库: E2, E12 - Agentic AI: E4, E5, E7


本筛选报告由 Jay 生成 · 2026-08-15 10:50 筛选原则: 真实环境/命令/错误/源码/性能数据/可复现步骤优先