lonePatient/awesome-pretrained-chinese-nlp-models · 上手攻略

  • 仓库:lonePatient/awesome-pretrained-chinese-nlp-models
  • 链接:https://github.com/lonePatient/awesome-pretrained-chinese-nlp-models
  • 分类:ai · nlp · chinese-llm · pretrained-models
  • 作者:Tom
  • 更新:2026-07-15

这是什么

awesome-pretrained-chinese-nlp-models 是一个由个人开发者(lonePatient)维护的 GitHub 精选列表,收录高质量中文预训练模型、大语言模型、多模态模型及其相关资源。截至 2026 年 7 月 Stars 5574,是中文 NLP 领域最全面的开源模型索引之一。

仓库按模型类型任务类型双重维度分类,涵盖从 2020 年 BERT 时代到 2026 年最新 MoE 大模型的全谱系,并提供 HuggingFace、ModelScope 等主流模型平台的下载链接。适合需要快速了解中文 NLP 开源模型现状的研究者和工程师。


解决什么问题

中文大模型开源生态高度分散——GLM 在 GitHub,Qwen 在阿里,InternLM 在上海人工智能实验室,MiniCPM 在 OpenBMB……awesome-pretrained-chinese-nlp-models 用统一入口解决这一问题:

  1. 找模型:按类别(通用对话、代码、金融、医疗、推理、多模态)快速定位可用的中文开源模型
  2. 对比参数:列表直接标注参数规模、架构(Decoder-only / MoE)、发布时间和开源协议
  3. 找下载源:每个模型附 HuggingFace / ModelScope 直接链接,国内推荐使用 hf-mirror.com 镜像加速下载
  4. 找评测基准:收录 C-Eval、FlagEval、SuperCLUE、MMLU 等中文评测套件及其对应榜单

内容结构

模型分类体系

类别 说明 代表模型数量
通用基础大模型 参数 >7B 的基础语言模型 40+
垂直基础大模型 金融、医疗、法律等垂直领域基础模型 13+
通用对话大模型 具备问答能力的通用语言模型 180+
垂直对话大模型 垂直领域对话系统 60+
多模态对话大模型 图文音视等多模态模型 90+
推理类大模型 数学/逻辑推理专长 50+
Embedding 模型 文本向量化模型 15+

模型系列索引

系列 代表模型 数量
NLU 系列 BERT · RoBERTa · ALBERT · ERNIE · MacBERT · ELECTRA 29
NLG 系列 GPT · GPT-3 · T5 · BART · CPM · RWKV 18
NLU-NLG 系列 UniLM · GLM · CPT · SimBERT 9
多模态系列 WenLan · CogView · Chinese-CLIP · OFA 13

其他资源

  • 开源模型库平台:HuggingFace、ModelScope、FlagOpen、始智AI(wisemodel)
  • 开源数据集库:HuggingFace Datasets、ModelScope Datasets
  • 中文指令数据集:SFT / RLHF 相关中文数据集索引
  • 评测基准:C-Eval、FlagEval、SuperCLUE、Xiezhi、MMLU、OpenCompass

快速安装

这不是一个需要安装的工具库,而是一个模型索引和下载指南

# 克隆到本地离线查阅
git clone https://github.com/lonePatient/awesome-pretrained-chinese-nlp-models.git
cd awesome-pretrained-chinese-nlp-models
# 直接用 Markdown 阅读器或 VS Code 打开 README.md

模型下载示例(以 ChatGLM 为例)

# 方法一:HuggingFace 直接下载(国际网络)
git lfs install
git clone https://huggingface.co/THUDM/ChatGLM2-6B

# 方法二:国内镜像加速(推荐国内环境)
# 访问 https://hf-mirror.com/ 搜索 THUDM/ChatGLM2-6B
# 使用镜像站下载,速度更快

# 方法三:ModelScope(国内平台)
pip install modelscope
modelscope download --model ZhipuAI/chatglm2-6b

Embedding 模型快速调用示例

# 使用 sentence-transformers 调用中文 Embedding 模型
from sentence_transformers import SentenceTransformer

# 例如使用 jinaai/jina-colbert-v2(多语言支持,含中文)
model = SentenceTransformer('jinaai/jina-colbert-v2')

query = "我想找一个能处理中文的Embedding模型"
docs = [
    "Jina ColBERT V2 支持多语言语义检索",
    "这是一个英文的Embedding示例",
    "中文语义匹配是当前NLP的重要研究方向"
]

embeddings = model.encode([query] + docs)
scores = model.similarity(embeddings[0], embeddings[1:])
print(scores)  # [1.0, 0.72, 0.89]

典型适用场景

场景 1:RAG 系统选 Embedding 模型

Embedding 分类下,有 jina-colbert-v2、Conan-embedding-v1、xiaobu-v2、zpoint_large 等中文优化模型可直接下载使用,配合 MTEB 排行榜做性能对比,选出最适合你场景的方案。

场景 2:中文代码助手选型

进入 垂直对话大模型 → 代码 分支,有 Qwen3-Coder、DeepSeek-Coder-V2、CodeGeeX4、Yi-Coder、OpenCoder 等,可对比参数规模、训练数据和评测结果做选型。

场景 3:金融 NLP 场景模型选型

垂直基础大模型 分支收录了通义金融-Base(14B)等金融领域模型,结合 C-Eval 金融子榜的评测数据做最终决策。

场景 4:快速了解某系列模型全貌

GLM 系列从 GLM-130B 到 GLM-5.2、GLM-4.6,在仓库中按时间线排列,可快速了解该系列的演进历程和技术路线变化。


坑与注意

  1. 列表时效性强 — 2025–2026 年新模型层出不穷,列表中某些模型信息(尤其是 2026 年新模型如 GLM-5.2、GLM-4.6)可能缺乏完整评测数据,使用前以官方 GitHub/HuggingFace 页为准。
  2. 模型参数标注不均 — 部分新模型(如 GLM-4.6)仅标注架构类型(MoE)和激活参数(A32/355B),实际总参数量极大,需要换算。
  3. 开源协议差异大 — 列表中模型协议各异(Apache 2.0、GPL、CC 等),商用前务必确认各模型的许可证。
  4. 下载链接稳定性 — 部分个人维护的 HuggingFace 仓库可能因作者删除或迁移而失效,ModelScope 镜像通常更稳定。
  5. 非完整评测 — 列表提供的是下载链接和基本信息,不是模型性能排名,部分"查看全部"链接指向更详细的子文档,需要进一步探索才能获取完整对比数据。
  6. hf-mirror.com 是用户维护镜像 — 国内下载 HuggingFace 模型时推荐使用,但镜像同步可能存在延迟,高精度模型建议同时在官方 HF 确认。

与同类对比

列表 Stars 特点
lonePatient/awesome-pretrained-chinese-nlp-models 5574 中文 NLP 模型最全,分类细,含中文评测基准
THUDM/ChatGLM 官方仓库 单系列,非全览
OpenGVLab/InternVL 官方仓库 单系列,非全览
qwertyuai/awesome-llm 更偏整体 LLM,非专注中文

该仓库的核心价值在于中文 NLP 全栈视图,不是某个单一模型的官方仓库,也不是全球大模型总览,而是专注中文场景的开源模型精选地图。


一句话推荐结论

需要找中文开源 NLP 模型、对比选型、或了解中文大模型生态全景,这个仓库是当前最值得收藏的一站式索引,尤其配合 hf-mirror.com 镜像可快速下载落地使用。


来源:GitHub README (lonePatient/awesome-pretrained-chinese-nlp-models)、HuggingFace 模型页面(ChatGLM2-6B、jina-colbert-v2)、仓库内子文档(docs/base-llm.md、docs/chat-llm.md 等)