AI 工程 · GitHub Trending · HuggingFace · LLM 推理 · 2026-08-12 下午
主题
本次聚焦:HuggingFace 模型热度格局、LLM 推理框架 2026 选型对比、pgvector RAG 工程实践、Harness Engineering 自动化前沿、Substack AI 工程技能路线图。
一、HuggingFace Trending 模型格局(2026 年初快照)
来源:burtenshaw/trending-models-top10-2026-03-06(HuggingFace Dataset)
TOP 10 模型排名(按 trending_score)
| 排名 | 模型 | Trending Score | 下载量 | 管线类型 |
|---|---|---|---|---|
| 1 | Qwen/Qwen3.5-9B | 516 | 516K | image-text-to-text |
| 2 | Qwen/Qwen3.5-35B-A3B | 372 | 1M | image-text-to-text |
| 3 | Qwen/Qwen3.5-0.8B | 291 | 265K | image-text-to-text |
| 4 | unsloth/Qwen3.5-35B-A3B-GGUF | 268 | 919K | image-text-to-text |
| 5 | Qwen/Qwen3.5-4B | 258 | 232K | image-text-to-text |
| 6 | Lightricks/LTX-2.3 | 234 | 35K | image-to-video |
| 7 | unsloth/Qwen3.5-9B-GGUF | 213 | 380K | image-text-to-text |
| 8 | Qwen/Qwen3.5-27B | 198 | 562K | image-text-to-text |
| 9 | huihui-ai/Huihui-Qwen3.5-35B-A3B-abliterated | 165 | 21K | image-text-to-text |
| 10 | MiniMaxAI/MiniMax-M2.5 | 148 | 371K | text-generation |
关键洞察 - Qwen3.5 家族完全主导:TOP 10 中 8 个席位为 Qwen3.5 变体,GGUF 量化版与原生版并存。 - MoE 模型是热点:Qwen3.5-35B-A3B(激活 3B)是最受欢迎的非小模型选项,下载量破百万。 - GGUF 量化生态成熟:unsloth 持续输出高质量 GGUF,llama.cpp 生态活跃。 - MiniMax-M2.5 进入前十,text-generation 管线,说明非阿里系模型在中文市场仍有关注度。
可信度:高(HuggingFace 官方 dataset,时间戳 2026-03-06)。 是否需要核验:需要。Qwen3.5 最新版本已迭代,需查 2026-08 月度 trending。
二、LLM 推理框架 2026 选型对比(vLLM vs SGLang vs TensorRT-LLM vs TGI)
综合来源:Swfte AI 博客、inferenceengineering.tech、Towards AI、The AI Engineer Substack
2.1 HuggingFace TGI 正式进入维护模式
重要信号:截至 2026 年,HuggingFace TGI(Text Generation Inference)官方宣布进入维护状态,仅接受 bug 修复 PR,不再开发新功能。官方推荐迁移到 vLLM 或 SGLang。
对工程师的影响:仍在生产环境运行 TGI 的团队需要开始规划迁移路径。TGI 仍可正常工作,但新功能、性能优化和新模型支持将只出现在 vLLM 和 SGLang 中。
2.2 四大框架特征矩阵
| 特性 | vLLM | SGLang | TensorRT-LLM | LMDeploy |
|---|---|---|---|---|
| Continuous Batching | ✅ | ✅ | ✅ | ✅ |
| PagedAttention / RadixAttention | ✅ (Paged) | ✅ (Radix) | ✅ | ✅ |
| Prefix Caching | ✅ | ✅ | ✅ | Partial |
| Chunked Prefill | ✅ | ✅ | ✅ | ✅ |
| FP8 KV Cache | ✅ | ✅ | ✅ | ✅ |
| 结构化输出(JSON) | Outlines(损耗 15-30% 吞吐) | 原生支持(最优) | Custom | Outlines |
| Speculative Decoding | ✅ Eagle3(成熟) | 实验性 | ✅ | ✅ |
| MoE 支持 | ✅ | ✅ | ✅ | ✅ |
| Blackwell / B200 | v0.17.0+ 原生支持 | 追赶中 | ✅ | ❌ |
| 分布式推理 | ✅ | ✅ | ✅ | ✅ |
2.3 核心差异化结论
vLLM 是生产默认选择 - PagedAttention 将 KV cache 内存碎片从 60-80% 降至 <4%,同 GPU 并发提升 2-4 倍。 - Eagle3 投机解码集成成熟,中文延迟敏感场景首选。 - v0.17.0+ 支持 Blackwell B200,FlashAttention-4 后端。
SGLang 是结构化输出场景最优解 - RadixAttention 在 prefix 复用场景(agent 多轮对话、系统提示词复用)性能优于 PagedAttention。 - 原生语法引擎支持结构化输出,不损耗调度器性能。 - 2026 S1 Roadmap 重点:Diffusion LLM(dLLM)、多模态 dLLM(VL-dLLM)、Fast-dLLM v2(并行解码)。
TensorRT-LLM 适合 NVIDIA 硬件 + 极致性能 - 编译耗时 30-90 分钟/模型/GPU 类型,但引擎性能最高。 - 适合延迟敏感、已锁定 NVIDIA 硬件的生产部署。
选型决策树
是否需要结构化输出(JSON / function calling)?
→ 是:SGLang(原生语法引擎,吞吐损耗最小)
→ 否:vLLM(最广泛适配,MoE / Blackwell 最快跟进)
NVIDIA 硬件 + 可投入工程时间 + 极致吞吐?
→ TensorRT-LLM
可信度:高(多源综合,含官方博客和 benchmark 数据) 建议:建议精读 Swfte AI 对比原文, benchmark 数据具有生产参考价值。
三、pgvector 2026 工程状态评估:PostgreSQL 即向量数据库
来源:PE Collective、Instaclustr、Digital Applied、Tessell、DanubeData
3.1 2026 重大更新(pgvector 0.8+)
| 特性 | 说明 |
|---|---|
| 迭代扫描(Iterative Scans) | 过滤查询性能大幅提升,不再被 IVFFlat/HNSW 索引绑架执行计划 |
| 并行 HNSW 索引构建 | 大规模向量集索引构建时间缩短 |
halfvec 量化类型 |
内存占用减半,精度损失可接受 |
| streaming inserts | 批量写入吞吐提升 |
3.2 pgvector vs 专用向量数据库对比
| 维度 | pgvector | Pinecone | Weaviate | Qdrant |
|---|---|---|---|---|
| 事务联表(向量+SQL) | 原生,单 query | 不支持 | 有限 | 有限 |
| Hybrid Search | ✅ (tsvector + pg_trgm + RRF) | ✅ v2 | ✅ | ✅ |
| 量化 | ✅ halfvec | ✅ | ✅ | ✅ |
| 运维负担 | 一个数据库 | +1 服务 +1 供应商 | +1 服务 | +1 服务 |
| 适用规模 | < 1000 万向量 | 不限 | 不限 | 不限 |
| 托管供应商 | Supabase / Neon / AWS RDS 均支持 | 托管 only | 托管+自部署 | 托管+自部署 |
3.3 核心结论
2026 年主流判断:大多数团队使用 pgvector 就够了。 - 若已有 PostgreSQL 基础设施,pgvector 是零成本选择。 - 超过 1000 万向量或需要 sub-50ms p99 延迟时,考虑 Pinecone 等专用方案。 - Managed Postgres(Supabase、Neon、AWS RDS)通常比手动安装更新更快。
可信度:高(多个独立技术测评一致) 建议:生产 RAG pipeline 工程参考 Digital Applied 教程(端到端 schema + Python 实战)
四、Harness Engineering:AI 辅助开发的新工程学科
来源:ai-boost/awesome-harness-engineering(GitHub)
4.1 什么是 Harness Engineering
Harness Engineering 是 2026 年兴起的一个工程学科,专门研究如何设计 AI 编码工具的运行环境,使 AI 写出更好代码。其核心观点:
"AI writes better code when you design the environment it works in."
四大支柱模型: 1. Specs:明确规格,减少 AI 对模糊需求的猜测 2. Skills:给 AI 提供正确的工具和上下文(MCP integrations: CI status、部署日志、运行时指标) 3. Agents:组织多 agent 协作的人机协同方式 4. Vibes:环境氛围——上下文质量和结构化程度
4.2 2026 年关键进展
| 项目 | 机构 | 核心贡献 |
|---|---|---|
| neosigmaai/auto-harness | 2026-04 开源 | 自改进 agentic 系统:自动挖掘 benchmark 失败、优化 harness,gate 变更防回归。支持 Terminal-Bench 2.0 / tau-bench |
| Harness Engineering: Structured Workflows for AI-Assisted Development | Red Hat | 企业视角:结构化上下文 > 自由式 ticket;MCP 集成将 CI/部署/监控作为 AI 实时数据源 |
| 2026 Agentic Coding Trends Report | Anthropic | 基础设施配置是一级优化变量:harness 设置单独可影响 benchmark 5+ 百分点;提出"agentic engineering platform"类别 |
4.3 PROGRAM.md 模式
人类编写优化指令,agent 执行 harness 工程循环——这是 2026 年最可访问的入口模式:
PROGRAM.md:
"优化这个代码任务的测试覆盖率 +20%,不要降低基准性能"
→ agent 自动运行 harness engineering loop
→ gate 变更防止回归
可信度:中高(GitHub 活跃项目 + Anthropic 官方报告) 建议:值得作为 AI 工程平台建设的主题页更新方向
五、Substack 高价值 AI 工程技能路线图
来源:Alexey Grigorev(AI Engineering Field Guide)、Louis Bouchard、Emerging AI、The AI Engineer Substack
5.1 从 1000+ 职位描述提炼的 AI 工程师技能信号(2026)
| 技能 | 出现频率 | 定位 |
|---|---|---|
| RAG | 35.9% | 最强 GenAI 信号,超过 prompt engineering |
| Prompt Engineering | 29.1% | 系统设计和评估的一部分,非独立岗位 |
| LLM Integration | 25.4% | 使用托管 API(需理解 tokens、延迟、成本、可靠性) |
| Agents | 14.4% | 多步工作流、工具调用、编排框架 |
| Fine-tuning | 8.5% | 存在但明显次要 |
5.2 AI 工程师角色二分法(2026)
- AI-first 角色(约 70%):直接构建 LLM / GenAI 系统(RAG、agents、评估、生产部署)
- AI-support 角色(约 28.5%):基础设施和平台(GPU/推理基础设施、数据管道、MLOps 工具)
5.3 Louis Bouchard 的工程判断框架(推荐)
AI 工程的核心问题是能回答 5 个问题: 1. 我们真的需要 LLM 吗?(很多时候不需要) 2. 这应该是 prompt、RAG、fine-tune、workflow 还是 agent? 3. 模型应该访问哪些数据和工具,哪里需要人工介入? 4. 成功的标准是什么,我们如何测量? 5. 模型、工具或 API 失败时会发生什么?
评价:这份 Substack 文章是 2026 年 AI 工程入门的高质量路线图,没有 hype,值得归档。
六、arXiv 前沿论文速览
6.1 AIGen: AI Bill of Materials 生成(arxiv.org/html/2607.26652v1)
- 核心:用 Ollama 本地 LLM 自动生成 SPDX 3.0 格式的 AIBoM(AI Bill of Materials)
- 工程价值:自动化合规文档,支持 EU AI Act 监管要求
- 可信度:中(预印本,Linux Foundation 生态相关)
- 行动:AIBoM 生成可纳入 AI 平台合规流水线参考
6.2 LLM 系统安全生命周期模型(arxiv.org/html/2608.03626v1)
- 核心:提出面向安全的 LLM 系统生命周期模型,将 MLOps / LLMOps 扩展为 Data layer(6 stages)→ Model layer → Application layer
- 评价:MITRE ATLAS、OWASP LLM Top 10 已有威胁目录,这篇提供系统化安全架构视角
- 可信度:中(ARES 2026 EU Projects Symposium 接受论文)
6.3 MLOps 框架开源实证研究(arxiv.org/html/2601.18591v1)
- 核心:实证分析 8 个流行开源 MLOps 框架的实际使用模式,发现开发者往往只用部分功能,缺失重要特性
- 工程价值:了解实际 MLOps 工具使用现状,对框架选型有参考价值
- 可信度:高(学术实证研究)
分类标签
LLM-Inference vLLM SGLang TensorRT-LLM pgvector RAG HuggingFace Harness-Engineering AI-Engineering Backend Database Deployment
建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-08-12-1735-ai-engineering-trending.md✅ - 可考虑单独归档:
pgvector-2026.md(向量数据库选型参考)
是否需要精读 / 审稿 / 主题页更新
| 条目 | 操作 |
|---|---|
| Swfte AI LLM Serving 框架对比 | 建议精读:benchmark 数据有生产选型价值 |
| pgvector 2026 完整测评(Digital Applied) | 建议审稿:端到端 RAG pipeline 实战教程 |
| awesome-harness-engineering | 建议加入主题页:AI 辅助开发新学科 |
| Louis Bouchard Substack | 建议加入知识库:AI 工程路线图高价值参考 |
| arxiv 2601.18591 MLOps 实证 | 建议归档:学术研究,有实际工程参考价值 |
| Qwen3.5 trending 数据 | 建议更新周度 trending 追踪:需 2026-08 月度数据 |
Jay · 2026-08-12 17:35 · 研究知识库