IDEA-CCNL/Fengshenbang-LM · 上手攻略

  • 仓库:IDEA-CCNL/Fengshenbang-LM
  • 链接:https://github.com/IDEA-CCNL/Fengshenbang-LM
  • 分类:academic-writing
  • 作者:Tom
  • 更新:2026-08-13

这是什么

封神榜(Fengshenbang-LM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。

三个子项目协同工作: - Fengshenbang Model:预训练大模型全家桶(姜子牙、二郎神、太乙等) - Fengshen Framework:预训练/微调框架 - Fengshenbang Benchmark:评估基准(含中文 SuperGLUE)


解决什么问题

中文 NLP 领域长期存在三个痛点: 1. 英文主导:Huggingface / PyTorch 生态以英文模型为主,中文模型碎片化 2. 重复建设:每个团队都从 0 训 BERT,浪费算力 3. 评测基准缺失:中文缺乏像 SuperGLUE 那样被广泛认可的评测体系

封神榜通过"提供一个中文基础模型体系"来一站式解决:选一个最接近的预训练模型 → 在下游任务微调 → 把新模型开源回体系。


快速安装

# 克隆仓库
git clone https://github.com/IDEA-CCNL/Fengshenbang-LM.git
cd Fengshenbang-LM

# 安装依赖(Python 3.7+)
pip install -r requirements.txt

# 安装封神框架
cd fengshen
pip install .

Python 版本要求:3.7+ 系统支持:Linux / Windows / macOS


核心用法

1. 从 Huggingface 直接加载模型(最简方式)

所有模型均同步至 Huggingface,无需 clone 完整仓库即可使用:

# 姜子牙系列(通用大模型)
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "IDEA-CCNL/Ziya-LLaMA-13B-v1.1"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(model_name, trust_remote_code=True)

# 推理示例
input_text = "用中文解释量子计算的基本原理"
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

2. 二郎神系列(BERT 架构,中文理解)

# 二郎神-MegatronBert-1.3B-NLI(自然语言推理)
from transformers import AutoModel, AutoTokenizer

model_name = "IDEA-CCNL/Erlangshen-MegatronBert-1.3B-NLI"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModel.from_pretrained(model_name)

3. 太乙系列(文生图 / 多模态)

# 太乙文生图(需 GPU)
from diffusers import StableDiffusionPipeline

pipe = StableDiffusionPipeline.from_pretrained("IDEA-CCNL/Taiyi-Stable-Diffusion-XL-3.5B")
pipe = pipe.to("cuda")
prompt = "飞流直下三千尺,油画"
image = pipe(prompt, guidance_scale=7.5).images[0]
image.save("output.png")

4. 线上体验(无需本地部署)

模型 体验链接
Ziya-LLaMA-13B Huggingface Space
Ziya-BLIP2-14B(视觉) Huggingface Space
太乙文生图 Huggingface Space
ModelScope 镜像 Ziya-LLaMA-13B

5. 微调示例

# 参考仓库中的微调脚本
cd fengshen/examples/ziya_llama
# 内含 SFT / LoRA 等微调示例,具体命令见各子目录 README

6. 量化推理(节省显存)

# 参考 fengshen/examples/ziya_inference/
# 支持 GPTQ / AWQ 量化,13B 模型可压缩至 ~8GB 显存

模型系列速查

系列 架构 任务 参数规模 代表模型
姜子牙 LLaMA 通用生成 >70亿 Ziya-LLaMA-13B-v1.1
二郎神 BERT/DeBERTa 语言理解 9千万-39亿 Erlangshen-MegatronBert-1.3B
太乙 CLIP/SD/BLIP2 多模态 8千万-10亿 Taiyi-Stable-Diffusion-XL-3.5B
闻仲 GPT2 语言生成 1亿-35亿 Randeng-GPT2-3.5B
燃灯 T5/PEGASUS 语言转换 7千万-50亿 Randeng-Pegasus-523M
余元 BART/GPT2 领域(医疗/金融/法律) 1亿-35亿 Yuyuan-GPT2-3.5B

⚠️ 上述参数规模来自 2021-2023 年公开信息,最新模型参数规模请以 Huggingface 页面为准。


典型适用场景

  1. 中文 NLP 下游任务微调起点:BERT 时代的中文模型普遍较小,二郎神 1.3B 是当时最大的中文 BERT,FewCLUE / ZeroCLUE 双榜登顶
  2. 中文对话/文案生成:姜子牙系列 Ziya-LLaMA 支持多轮对话,适合客服、文案等场景
  3. 中文文生图:太乙系列首个开源中文 Stable Diffusion,支持中文提示词直出
  4. 领域任务(医疗/金融/法律):余元系列有专门微调的领域模型
  5. 学术研究基准:用 Fengshen Benchmark 评估新模型的中文理解能力

坑与注意

⚠️ 最新模型信息需核验:本攻略参数规模来自 2021-2023 年公开数据,Huggingface 上已有 Ziya2-13B、Ziya-Coding-34B 等新模型,参数规模请以 Huggingface IDEA-CCNL 主页 为准。

⚠️ 13B 模型需大量显存:Ziya-LLaMA-13B 推理需要 ~30GB 显存(FP16),量化后可降至 ~8GB,请评估硬件条件。

⚠️ LLaMA 许可限制:部分模型基于 LLaMA 架构,需遵守 LLaMA 的使用许可限制。

⚠️ 持续更新:封神榜项目声明会持续更新模型,但新模型发布节奏不固定,建议关注 Huggingface 主页或 GitHub Releases。

⚠️ 中文 SuperGLUE 基准:Fengshenbang Benchmark 正在完善中,部分评测基准尚未公开。


与同类对比

方案 机构 特色 中文支持
封神榜 IDEA研究院 6大系列·最全中文NLP全家桶 ✅ 核心定位
Chinese-LLaMA 哈工大 LLaMA 中文增量预训练
ChatGLM 清华 130B 对话模型
Baichuan 百川智能 商用友好
MOSS 复旦 开源对话模型

封神榜的差异化:不只是一个大模型,而是一套覆盖理解/生成/多模态/领域的中文 NLP 全家桶,尤其适合需要多种 NLP 能力的开发者或研究者。


一句话推荐结论

如果你需要一站式解决中文 NLP 任务——从语言理解到文生图,从通用模型到领域专用——封神榜是目前开源生态中覆盖最完整的中文预训练模型体系,选一个最接近的微调,比从 0 训练能节省 90% 的算力。