AI 工程 · GitHub Trending · HuggingFace · LLM 推理 · 2026-08-12 下午

主题

本次聚焦:HuggingFace 模型热度格局、LLM 推理框架 2026 选型对比、pgvector RAG 工程实践、Harness Engineering 自动化前沿、Substack AI 工程技能路线图。


来源burtenshaw/trending-models-top10-2026-03-06(HuggingFace Dataset)

TOP 10 模型排名(按 trending_score)

排名 模型 Trending Score 下载量 管线类型
1 Qwen/Qwen3.5-9B 516 516K image-text-to-text
2 Qwen/Qwen3.5-35B-A3B 372 1M image-text-to-text
3 Qwen/Qwen3.5-0.8B 291 265K image-text-to-text
4 unsloth/Qwen3.5-35B-A3B-GGUF 268 919K image-text-to-text
5 Qwen/Qwen3.5-4B 258 232K image-text-to-text
6 Lightricks/LTX-2.3 234 35K image-to-video
7 unsloth/Qwen3.5-9B-GGUF 213 380K image-text-to-text
8 Qwen/Qwen3.5-27B 198 562K image-text-to-text
9 huihui-ai/Huihui-Qwen3.5-35B-A3B-abliterated 165 21K image-text-to-text
10 MiniMaxAI/MiniMax-M2.5 148 371K text-generation

关键洞察 - Qwen3.5 家族完全主导:TOP 10 中 8 个席位为 Qwen3.5 变体,GGUF 量化版与原生版并存。 - MoE 模型是热点:Qwen3.5-35B-A3B(激活 3B)是最受欢迎的非小模型选项,下载量破百万。 - GGUF 量化生态成熟:unsloth 持续输出高质量 GGUF,llama.cpp 生态活跃。 - MiniMax-M2.5 进入前十,text-generation 管线,说明非阿里系模型在中文市场仍有关注度。

可信度:高(HuggingFace 官方 dataset,时间戳 2026-03-06)。 是否需要核验:需要。Qwen3.5 最新版本已迭代,需查 2026-08 月度 trending。


二、LLM 推理框架 2026 选型对比(vLLM vs SGLang vs TensorRT-LLM vs TGI)

综合来源:Swfte AI 博客、inferenceengineering.tech、Towards AI、The AI Engineer Substack

2.1 HuggingFace TGI 正式进入维护模式

重要信号:截至 2026 年,HuggingFace TGI(Text Generation Inference)官方宣布进入维护状态,仅接受 bug 修复 PR,不再开发新功能。官方推荐迁移到 vLLM 或 SGLang。

对工程师的影响:仍在生产环境运行 TGI 的团队需要开始规划迁移路径。TGI 仍可正常工作,但新功能、性能优化和新模型支持将只出现在 vLLM 和 SGLang 中。

2.2 四大框架特征矩阵

特性 vLLM SGLang TensorRT-LLM LMDeploy
Continuous Batching
PagedAttention / RadixAttention ✅ (Paged) ✅ (Radix)
Prefix Caching Partial
Chunked Prefill
FP8 KV Cache
结构化输出(JSON) Outlines(损耗 15-30% 吞吐) 原生支持(最优) Custom Outlines
Speculative Decoding ✅ Eagle3(成熟) 实验性
MoE 支持
Blackwell / B200 v0.17.0+ 原生支持 追赶中
分布式推理

2.3 核心差异化结论

vLLM 是生产默认选择 - PagedAttention 将 KV cache 内存碎片从 60-80% 降至 <4%,同 GPU 并发提升 2-4 倍。 - Eagle3 投机解码集成成熟,中文延迟敏感场景首选。 - v0.17.0+ 支持 Blackwell B200,FlashAttention-4 后端。

SGLang 是结构化输出场景最优解 - RadixAttention 在 prefix 复用场景(agent 多轮对话、系统提示词复用)性能优于 PagedAttention。 - 原生语法引擎支持结构化输出,不损耗调度器性能。 - 2026 S1 Roadmap 重点:Diffusion LLM(dLLM)、多模态 dLLM(VL-dLLM)、Fast-dLLM v2(并行解码)。

TensorRT-LLM 适合 NVIDIA 硬件 + 极致性能 - 编译耗时 30-90 分钟/模型/GPU 类型,但引擎性能最高。 - 适合延迟敏感、已锁定 NVIDIA 硬件的生产部署。

选型决策树

是否需要结构化输出(JSON / function calling)?
  → 是:SGLang(原生语法引擎,吞吐损耗最小)
  → 否:vLLM(最广泛适配,MoE / Blackwell 最快跟进)
  NVIDIA 硬件 + 可投入工程时间 + 极致吞吐?
  → TensorRT-LLM

可信度:高(多源综合,含官方博客和 benchmark 数据) 建议:建议精读 Swfte AI 对比原文, benchmark 数据具有生产参考价值。


三、pgvector 2026 工程状态评估:PostgreSQL 即向量数据库

来源:PE Collective、Instaclustr、Digital Applied、Tessell、DanubeData

3.1 2026 重大更新(pgvector 0.8+)

特性 说明
迭代扫描(Iterative Scans) 过滤查询性能大幅提升,不再被 IVFFlat/HNSW 索引绑架执行计划
并行 HNSW 索引构建 大规模向量集索引构建时间缩短
halfvec 量化类型 内存占用减半,精度损失可接受
streaming inserts 批量写入吞吐提升

3.2 pgvector vs 专用向量数据库对比

维度 pgvector Pinecone Weaviate Qdrant
事务联表(向量+SQL) 原生,单 query 不支持 有限 有限
Hybrid Search ✅ (tsvector + pg_trgm + RRF) ✅ v2
量化 ✅ halfvec
运维负担 一个数据库 +1 服务 +1 供应商 +1 服务 +1 服务
适用规模 < 1000 万向量 不限 不限 不限
托管供应商 Supabase / Neon / AWS RDS 均支持 托管 only 托管+自部署 托管+自部署

3.3 核心结论

2026 年主流判断:大多数团队使用 pgvector 就够了。 - 若已有 PostgreSQL 基础设施,pgvector 是零成本选择。 - 超过 1000 万向量或需要 sub-50ms p99 延迟时,考虑 Pinecone 等专用方案。 - Managed Postgres(Supabase、Neon、AWS RDS)通常比手动安装更新更快。

可信度:高(多个独立技术测评一致) 建议:生产 RAG pipeline 工程参考 Digital Applied 教程(端到端 schema + Python 实战)


四、Harness Engineering:AI 辅助开发的新工程学科

来源ai-boost/awesome-harness-engineering(GitHub)

4.1 什么是 Harness Engineering

Harness Engineering 是 2026 年兴起的一个工程学科,专门研究如何设计 AI 编码工具的运行环境,使 AI 写出更好代码。其核心观点:

"AI writes better code when you design the environment it works in."

四大支柱模型: 1. Specs:明确规格,减少 AI 对模糊需求的猜测 2. Skills:给 AI 提供正确的工具和上下文(MCP integrations: CI status、部署日志、运行时指标) 3. Agents:组织多 agent 协作的人机协同方式 4. Vibes:环境氛围——上下文质量和结构化程度

4.2 2026 年关键进展

项目 机构 核心贡献
neosigmaai/auto-harness 2026-04 开源 自改进 agentic 系统:自动挖掘 benchmark 失败、优化 harness,gate 变更防回归。支持 Terminal-Bench 2.0 / tau-bench
Harness Engineering: Structured Workflows for AI-Assisted Development Red Hat 企业视角:结构化上下文 > 自由式 ticket;MCP 集成将 CI/部署/监控作为 AI 实时数据源
2026 Agentic Coding Trends Report Anthropic 基础设施配置是一级优化变量:harness 设置单独可影响 benchmark 5+ 百分点;提出"agentic engineering platform"类别

4.3 PROGRAM.md 模式

人类编写优化指令,agent 执行 harness 工程循环——这是 2026 年最可访问的入口模式:

PROGRAM.md:
"优化这个代码任务的测试覆盖率 +20%,不要降低基准性能"
→ agent 自动运行 harness engineering loop
→ gate 变更防止回归

可信度:中高(GitHub 活跃项目 + Anthropic 官方报告) 建议:值得作为 AI 工程平台建设的主题页更新方向


五、Substack 高价值 AI 工程技能路线图

来源:Alexey Grigorev(AI Engineering Field Guide)、Louis Bouchard、Emerging AI、The AI Engineer Substack

5.1 从 1000+ 职位描述提炼的 AI 工程师技能信号(2026)

技能 出现频率 定位
RAG 35.9% 最强 GenAI 信号,超过 prompt engineering
Prompt Engineering 29.1% 系统设计和评估的一部分,非独立岗位
LLM Integration 25.4% 使用托管 API(需理解 tokens、延迟、成本、可靠性)
Agents 14.4% 多步工作流、工具调用、编排框架
Fine-tuning 8.5% 存在但明显次要

5.2 AI 工程师角色二分法(2026)

  • AI-first 角色(约 70%):直接构建 LLM / GenAI 系统(RAG、agents、评估、生产部署)
  • AI-support 角色(约 28.5%):基础设施和平台(GPU/推理基础设施、数据管道、MLOps 工具)

5.3 Louis Bouchard 的工程判断框架(推荐)

AI 工程的核心问题是能回答 5 个问题: 1. 我们真的需要 LLM 吗?(很多时候不需要) 2. 这应该是 prompt、RAG、fine-tune、workflow 还是 agent? 3. 模型应该访问哪些数据和工具,哪里需要人工介入? 4. 成功的标准是什么,我们如何测量? 5. 模型、工具或 API 失败时会发生什么?

评价:这份 Substack 文章是 2026 年 AI 工程入门的高质量路线图,没有 hype,值得归档。


六、arXiv 前沿论文速览

6.1 AIGen: AI Bill of Materials 生成(arxiv.org/html/2607.26652v1

  • 核心:用 Ollama 本地 LLM 自动生成 SPDX 3.0 格式的 AIBoM(AI Bill of Materials)
  • 工程价值:自动化合规文档,支持 EU AI Act 监管要求
  • 可信度:中(预印本,Linux Foundation 生态相关)
  • 行动:AIBoM 生成可纳入 AI 平台合规流水线参考

6.2 LLM 系统安全生命周期模型(arxiv.org/html/2608.03626v1

  • 核心:提出面向安全的 LLM 系统生命周期模型,将 MLOps / LLMOps 扩展为 Data layer(6 stages)→ Model layer → Application layer
  • 评价:MITRE ATLAS、OWASP LLM Top 10 已有威胁目录,这篇提供系统化安全架构视角
  • 可信度:中(ARES 2026 EU Projects Symposium 接受论文)

6.3 MLOps 框架开源实证研究(arxiv.org/html/2601.18591v1

  • 核心:实证分析 8 个流行开源 MLOps 框架的实际使用模式,发现开发者往往只用部分功能,缺失重要特性
  • 工程价值:了解实际 MLOps 工具使用现状,对框架选型有参考价值
  • 可信度:高(学术实证研究)

分类标签

LLM-Inference vLLM SGLang TensorRT-LLM pgvector RAG HuggingFace Harness-Engineering AI-Engineering Backend Database Deployment


建议写入路径

  • 主草稿:/shared/research-kb/inbox/jay/2026-08-12-1735-ai-engineering-trending.md
  • 可考虑单独归档:pgvector-2026.md(向量数据库选型参考)

是否需要精读 / 审稿 / 主题页更新

条目 操作
Swfte AI LLM Serving 框架对比 建议精读:benchmark 数据有生产选型价值
pgvector 2026 完整测评(Digital Applied) 建议审稿:端到端 RAG pipeline 实战教程
awesome-harness-engineering 建议加入主题页:AI 辅助开发新学科
Louis Bouchard Substack 建议加入知识库:AI 工程路线图高价值参考
arxiv 2601.18591 MLOps 实证 建议归档:学术研究,有实际工程参考价值
Qwen3.5 trending 数据 建议更新周度 trending 追踪:需 2026-08 月度数据

Jay · 2026-08-12 17:35 · 研究知识库