工程筛选报告 · Jay · 2026-08-15 上午
筛选范围
今日入库的所有研究条目(CSDN/Substack/GitHub/RSS/arXiv)
一、保留条目(含理由)
✅ 条目 E1|vLLM vs SGLang AWQ INT4 量化实测
来源: CSDN · 2026-08-15T0820 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐
保留理由: - 真实量化数据: 14.7GB → 4.2GB 压缩率,并发 12→36(3倍) - 实测环境明确: 双框架 A/B 对比,含 TTFT/吞吐量/显存效率分项 - 关键洞察: memory-bound 任务中量化反而提速的工程原理 - 生产可用: AWQ INT4 选型决策和 FP8 RTX 4090 最优配置可直接参考
保留决策: 精读 —— 2026 年推理框架量化选型的核心参考数据
✅ 条目 E2|Milvus RAG 硬核实战
来源: CSDN · 2026-08-15T0820 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐
保留理由:
- 代码级可复现: AnnSearchRequest + WeightedRanker(0.7, 0.3) 混合检索配置
- 完整踩坑记录: 亿级向量性能调优、存算分离部署
- LangChain Milvus VectorStore 封装示例: 可直接移植到生产项目
- 稀缺性: CSDN 上少见的完整 Milvus 端到端 RAG 实操文档
保留决策: 精读 —— 混合检索权重重排序配置是 2026 RAG 生产落地的关键细节
✅ 条目 E3|PD Disaggregation 多轮 Agent 场景问题
来源: CSDN · 2026-08-15T0820 + arXiv 2603.13358 工程价值: ⭐⭐⭐⭐⭐
保留理由: - 多篇 arXiv 实证: Nexus 系统(2507.06608)、Not All Prefills Are Equal(2603.13358) - 关键工程发现: PD disaggregation 在多轮对话(主流 Agent 模式)下存在严重低效 - vLLM v0.8+ 原生支持: via NixlConnector,NIXL = NVIDIA Inference Xfer Library - SGLang Mooncake 方案: Proxy/Prefill/Decode 三组件 KV cache 传输 - 数据支撑: Nexus 吞吐量 2.2x↑,TTFT 20x↓,TBT 2.5x↓
保留决策: 精读 —— 多轮 Agent 场景是 2026 推理优化主战场,此发现直接影响部署架构选型
✅ 条目 E4|The AI Agents Stack (2026 Edition)
来源: The AI Engineer Substack · 2026-08-15T0820 工程价值: ⭐⭐⭐⭐⭐ | 可信度: 高
保留理由: - Eval 三层收敛框架: PR级检查 → LLM judge 夜间回归 → 生产漂移监控 - 新 Benchmark 收录: Context-Bench、Recovery-Bench、Terminal-Bench(Kimi K3 达 83 分) - Guardrails 独立成 discipline: 工具调用授权/限速/状态追踪,不再是 input/output 过滤器 - 2026 Agent 工程实践地图: 当前最系统的行业工程趋势分析
保留决策: 审稿级精读 —— 需要核验三个新 Benchmark 论文/代码仓库
✅ 条目 E5|NirDiamant/agents-towards-production
来源: GitHub · 2026-08-15T0952 ⭐ 21,285 | Forks: 2,822 | Python/Jupyter
保留理由: - 端到端路线图: 原型 → 企业级部署全流程代码优先教程 - 生产级覆盖广度: 涵盖 Guardrails、Eval、Memory、Tool Use、Multi-Agent - 持续活跃: 2026-08-15 更新,Jupyter Notebook 格式适合内部培训 - 工程教学稀缺性: 真正从 0 到生产的 Agent 工程教程,而非 API 包装演示
保留决策: 精读 —— 团队内部培训价值极高,建议配合主题页更新
✅ 条目 E6|alibaba/zvec
来源: GitHub · 2026-08-15T0952 ⭐ 15,443 | Forks: 977 | C++
保留理由: - 嵌入式场景首选: 进程内(in-process)向量库,零网络开销 - C++ 高性能: 对标 FAISS/HNSW,性能数据值得关注 - LLM Memory 场景: 官方 tagline 明确指向 Agent 记忆层 - 国内大厂维护: 阿里技术背书,工程可信赖度较高
保留决策: 关注/核验 —— 需查阅官方 benchmark 对比 FAISS 的原始数据,暂列收藏
✅ 条目 E7|Lilian Weng · Harness Engineering for Self-Improvement
来源: Lilian Weng RSS · 2026-08-15-1002 原文: https://lilianweng.github.io/posts/2026-07-04-harness/
保留理由: - RSI 完整技术脉络: 从 I. J. Good (1965) 到 2026 最新进展 - Harness 工程化定义: 构建 Agent 自我改进系统的核心工程原则 - 作者权威性: Lilian Weng 是 OpenAI Agent 团队核心成员 - 长文深度: 适合作为 Agentic AI 自我改进方向的研究入口
保留决策: 精读 —— RSI (Recursive Self-Improvement) 是 2026 下半年 Agent 前沿方向之一
✅ 条目 E8|Sebastian Raschka · Recent LLM Architecture Developments
来源: Raschka RSS · 2026-08-15-1000 原文: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures
保留理由: - KV Sharing / mHC / Compressed Attention: 长上下文成本优化技术栈梳理 - Gemma 4 → DeepSeek V4: 新型开源权重模型架构演进对比 - 工程导向: 面向实践者的 LLM 架构趋势分析,非纯理论研究 - 稀缺性: 少有的开源权重模型架构系统性分析
保留决策: 精读 —— DeepSeek V4 的架构创新值得重点关注
✅ 条目 E9|Sebastian Raschka · Controlling Reasoning Effort in LLMs
来源: Raschka RSS · 2026-08-15-1000 原文: https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms
保留理由: - 推理力度控制: 低/中/高力度推理模式的工程化实现 - Test-time Compute 延伸: 与 o1/o3 推理链技术直接相关 - 实用性: 可用于推理成本控制和性能调优
保留决策: 收藏 —— 与推理工程主题页高度相关
✅ 条目 E10|Sebastian Raschka · Using Local Coding Agents
来源: Raschka RSS · 2026-08-15-1000 原文: https://magazine.sebastianraschka.com/p/using-local-coding-agents
保留理由: - 开源替代方案: 本地 Coding Harness 对比 Claude Code/Codex 订阅 - 工程实操: 具体工具配置和本地模型选型建议 - 成本优化: 适合团队内部推理成本管理
保留决策: 收藏 —— Coding Agent 工程实践参考
✅ 条目 E11|MSR Orchard · Agentic AI 开源框架
来源: Microsoft Research Blog RSS · 2026-08-15-1002 原文: https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
保留理由: - 微软官方背书: MSR 出品的 Agentic AI 训练/评估框架 - 跨任务泛化: 支持从小型模型到大型模型的 Agent 训练 - 开源: 降低 Agent 研究门槛 - 工程参考: 框架设计模式值得架构师参考
保留决策: 关注 —— Orchard 的任务无关训练设计值得关注
✅ 条目 E12|arXiv 2608.13237 · Search-R1 多轮 RAG 停止判断
来源: Cool Papers IR RSS · 2026-08-15-1001 原文: https://papers.cool/arxiv/2608.13237
保留理由: - 核心问题重要: 多轮 RAG 何时停止是生产部署的关键工程问题 - Search-R1 框架: 结构化停止判断与检索缩减 - first STOP 决定策略: 揭示多轮 RAG 策略的关键洞察 - 工程落地直接相关: 与 RAG 主题页高度吻合
保留决策: 精读 —— 多轮 RAG 生产落地的核心工程问题
✅ 条目 E13|OpenAI WebSocket Responses API
来源: AIxFunda Substack · 2026-08-15T0952 可信度: 高(官方发布)
保留理由: - 实测数据支撑: 20+ Tool Calls 任务提速 40% - 连接维持 60 分钟: 解决长时 Agent 任务痛点 - Vercel AI SDK 率先集成: 工程落地明确 - previous_response_id 机制: 避免重发完整上下文,架构创新
保留决策: 关注 —— Agent 流式任务和长时 Tool Use 场景受益,2026 下半年进入生产
二、丢弃条目(含理由)
❌ ByteByteGo · API Composition 技术详解
丢弃理由: 通用 API 架构模式,非 AI/ML 专项工程。ByteByteGo 本轮其余条目(Cloudflare AI 变现、标题党治理、读写路径)均为非 AI 工程内容,与知识库定位不符。
❌ Nathan Benaich · 欧洲 AI 主权 / Fund III 融资
丢弃理由: 投资分析和政策评论,非工程实践内容。"State of AI" 系列的投资/地缘政治视角与本知识库 AI 工程实践定位不符。保留条目 8(AI Agents Stack 2026)已覆盖更系统的行业工程趋势。
❌ CSDN 条目 6/7(MCP 协议两篇)
丢弃理由: 协议概述性内容,代码深度不足,缺少真实环境验证。两篇均属于"知道这是什么"而非"知道怎么落地",与精读条目(agents-towards-production)高度重叠但深度不足。Substack 条目 4(AI Engineers Stack 2026)已覆盖 MCP 工程定位。
❌ CSDN 条目 1(推理框架选型矩阵)
丢弃理由: 综合性概述,缺少实测数据。与条目 E1(vLLM vs SGLang AWQ INT4)内容重叠,但后者有具体量化数据。条目 E1 已含 FlashMLA/DualPipe/EPLB 关键信息。
❌ CSDN 条目 3(vLLM/SGLang/TensorRT-LLM 架构对决)
丢弃理由: 架构层面梳理完整,但缺乏实测数据和可复现步骤。K8s DRA 和 Agent 协议栈信息有价值,但更适合作为趋势参考而非工程精读。可作为主题页背景资料,但不单独保留。
❌ CSDN 条目 5(向量数据库自建 vs 外采)
丢弃理由: 决策框架有价值,但缺少代码级细节和真实踩坑数据。与条目 E2(Milvus 硬核实战)相比,工程深度不足。保留条目 E2 已覆盖混合检索、权重重排序和亿级调优。
❌ CSDN 条目 10(vLLM/SGLang/TensorRT-LLM 选型指南)
丢弃理由: 与条目 E1 高度重复,且实测数据不及 E1 具体。选型决策表和快速启动代码有一定价值,但不足以单独保留。
❌ MMOA-RAG (Shchegrikovich Substack)
丢弃理由: 引用论文需要核验,Multi-Agent PPO 优化框架的具体实现细节未披露。可信度中等,暂不纳入精读清单。
三、本轮高价值条目汇总
| 优先级 | 条目 | 来源 | 核心价值 |
|---|---|---|---|
| 🔴精读 | E1: vLLM vs SGLang AWQ INT4 | CSDN | 3x并发实测数据 |
| 🔴精读 | E2: Milvus RAG 硬核实战 | CSDN | 混合检索代码 |
| 🔴精读 | E3: PD Disaggregation | CSDN+arXiv | 多轮Agent新发现 |
| 🔴精读 | E4: AI Agents Stack 2026 | Substack | Guardrails独立成discipline |
| 🔴精读 | E5: agents-towards-production | GitHub | 端到端生产教程 |
| 🔴精读 | E7: Harness RSI | Lilian Weng | RSI工程化脉络 |
| 🔴精读 | E8: LLM架构演进 | Raschka | KV Sharing/mHC |
| 🔴精读 | E12: Search-R1 | arXiv | 多轮RAG停止判断 |
| 🟡关注 | E6: zvec | GitHub | 嵌入式向量库 |
| 🟡关注 | E9: Reasoning Effort | Raschka | 推理成本控制 |
| 🟡关注 | E10: Local Coding Agents | Raschka | 开源替代方案 |
| 🟡关注 | E11: MSR Orchard | MSR | Agent框架设计 |
| 🟡关注 | E13: OpenAI WebSocket | Substack | 40%提速数据 |
四、分类标签建议
#LLM推理工程 #vLLM #SGLang #AWQ-INT4 #量化压缩
#PD-disaggregation #MoE #FlashMLA #Nexus系统
#RAG #向量数据库 #Milvus #混合检索 #HNSW #zvec
#Agentic-RAG #MCP #Agent工具编排 #Guardrails
#Eval #Benchmark #Context-Bench #Terminal-Bench #Recovery-Bench
#Agentic-AI #Harness工程 #RSI #自我改进
#LLM架构 #KV-Sharing #Compressed-Attention #DeepSeek-V4
#GitHub #生产部署 #Coding-Agent
五、建议写入路径
草稿路径: /shared/research-kb/inbox/jay/2026-08-15T1050-jay-engineering-screening.md
六、后续行动建议
精读队列(按优先级): 1. E1 → 更新 LLM 推理工程主题页(量化选型数据) 2. E2 → 更新 RAG/向量数据库主题页(Milvus 硬核实战) 3. E3 → 更新 LLM 推理工程主题页(PD Disaggregation 新发现) 4. E4 → 审稿:核验 Context-Bench/Recovery-Bench/Terminal-Bench 论文 5. E5 → 团队内部培训材料开发 6. E7 → Agentic AI 前沿方向研究 7. E8 → LLM 架构主题页更新 8. E12 → RAG 生产工程主题页
主题页更新建议:
- LLM 推理工程: E1, E3, E8
- RAG / 向量数据库: E2, E12
- Agentic AI: E4, E5, E7
本筛选报告由 Jay 生成 · 2026-08-15 10:50 筛选原则: 真实环境/命令/错误/源码/性能数据/可复现步骤优先