fighting41love/funNLP · 上手攻略
- 仓库:fighting41love/funNLP
- 链接:https://github.com/fighting41love/funNLP
- 分类:skill / NLP
- 作者:Jay
- 更新:2026-07-13
这是什么
funNLP 是一个中文 NLP 工具与资源的大集合,由 NLP 从业者「fighting41love」整理维护。GitHub Stars 超过 81k,周增 +77(数据截至 2026-07-13),最后提交 2024-05-10。仓库并非一个独立的 Python 包,而是按主题分类的资源索引:每个条目都是一个真实的开源项目、数据集或工具,包含名称、描述和 GitHub/论文链接。
它的定位介于「awesome-list 导航页」和「实用工具合集」之间——既有可直接 pip 安装的包(如 cnocr、Jiagu、Synonyms),也有语料库、预训练模型、数据集、课程资料等资源链接,还有大量「有趣但偏收藏」的娱乐向项目(如汪峰歌词生成器、歌词接龙机器人)。
涵盖领域一览:
| 大类 | 子类 |
|---|---|
| 类 ChatGPT 模型与评测 | ChatBot Arena、C-Eval、OpenCompass、QLoRA |
| LLM 训练 / 推理 / 低资源 | DeepSpeed Chat、Lit-LLaMA、ChatGLM-Efficient-Tuning |
| 提示工程 | Prompt 资源、CoT、ART 等 |
| 语料库 | 词库、百科、成语、诗句、医学、金融、法律 |
| 预训练语言模型 | Chinese-LLaMA、OpenChineseLLaMA、MOSS 等 |
| 信息抽取 / NER | BERT-NER、pke、AmpliGraph |
| 知识图谱 | 百度百科三元组、京东商品图谱、军事知识图谱 |
| 文本生成 & 摘要 | TextTeaser、BERT 摘要、Transformer 摘要 |
| 智能问答 | 医疗问答、金融问答、百度知道 580 万语料 |
| 文档处理 | PDF 表格提取、中文 OCR(cnocr)、doccano 标注 |
| 语音处理 | ASR 语料、masr 中文语音识别、音频增强 |
| 情感分析 | awesome-nlp-sentiment-analysis、ULMFiT |
| 有趣工具 | 对联系统、汪峰歌词生成器、聊天机器人 |
解决什么问题
- 找不到合适的中文 NLP 工具:中文 NLP 资源分散,jieba 之外还有什么好用的分词、NER、情感分析工具?funNLP 用分类索引帮你快速定位。
- 找不到合适的数据集:做中文任务时缺训练语料——成语、古诗、医学对话、金融新闻、谣言数据,funNLP 汇总了 100+ 常用数据集。
- 不知道该用哪个预训练模型:Chinese-LLaMA、ChatGLM、Qwen、MOSS……各模型对比、评测资源一并整理。
- 入门 NLP 没有路线图:从 cs224n 课程到实战比赛,从新词发现到知识图谱,仓库本身就是一张 NLP 全景图。
快速安装
funNLP 本身不是一个可安装的包,而是资源索引目录。推荐用法:
# 方法一:克隆仓库(最常用)
git clone https://github.com/fighting41love/funNLP.git
cd funNLP
# 方法二:只关注特定类别,用 GitHub 的目录搜索
# 访问 https://github.com/fighting41love/funNLP/tree/master/data
如果你想直接使用仓库中推荐的可安装 Python 包,以下是高频工具的标准安装方式(均与 funNLP 仓库本身无关,为独立 pip 包):
# 中文分词(已有 jieba,备选)
pip install jiagu
# 中文 OCR
pip install cnocr
# 中文近义词
pip install synonyms
# 关键词抽取
pip install pke
# 文本纠错(BERT-based)
pip install bert-punc
# 快速数字转换(中文 ↔ 阿拉伯)
pip install chinese-digits # 或参考 funNLP 中的实现
# 英文拼写检查
pip install pyspellchecker
⚠️ 注意:仓库中大量工具安装方式各异,部分依赖特定版本的 TensorFlow/PyTorch,且部分项目已停止维护。使用前建议查看各项目自己的 README 确认兼容性。
核心用法
1. 导航找工具
仓库按目录分类,找到对应场景后直接点击链接跳到源项目:
data/
├── sensitive_words/ ← 中文敏感词检测
├── word2vec/ ← 中文词向量资源
├── corpora/ ← 语料库
├── pretrained_models/ ← 预训练模型
├── nlp_credit/ ← 各公司内部技术文档
├── paper/ ← 论文 PDF
└── tools/ ← 独立可运行工具
推荐从这几个入口切入:
- 想做中文 NER →
data/ner/或直接用pke+ BERT - 想做文本分类 →
data/text_classification/+ Hugging Face 模型 - 想做知识图谱 →
data/knowledge_graph/中的 AmpliGraph、Zincbase - 想做中文 OCR →
cnocr(GitHub: https://github.com/breezedeus/cnocr)
2. 直接安装高频工具包(示例)
# 中文近义词查询
import synonyms
synonyms.compare("北京", "上海") # → 0.78(相似度)
synonyms.display("人工智能") # 打印近义词列表
# 关键词抽取(pke)
from pke import load_document
# 参考 https://github.com/boudinfl/pke
# 数字转换
# 参考 funNLP 中 text_to_number 的实现
3. 使用评测对比资源
# 想对比 LLM 在中文任务上的效果?
# 参考仓库中的 C-Eval 评测体系
# https://github.com/SJTU-LIT/ceval
# 想用 OpenCompass 做本地评测
git clone https://github.com/InternLM/OpenCompass
cd OpenCompass && pip install -e .
4. 知识图谱构建
# 使用 AmpliGraph 做知识图谱表示学习
# pip install ampligraph
from ampligraph.latent_features import ComplEx
model = ComplEx(batches_count=100, epochs=50, k=100)
# 参考 https://github.com/Accenture/AmpliGraph
典型适用场景
| 场景 | 推荐资源 |
|---|---|
| 快速搭建中文聊天机器人 | MOSS、ChatGLM、GPT2-chitchat |
| 中文简历/文档关键信息提取 | 中文 NER + 正则表达式工具 |
| 金融文本分析与情感判断 | 金融 NLP + 情感分析语料 |
| 医学知识图谱问答 | 医学 NLP + 京东/医疗知识图谱 |
| 法律文书 NLP 处理 | Blackstone (spaCy 法律模型) |
| 低资源中文 NLP 任务 | Chinese-LLaMA-Alpaca + QLoRA |
| 对联/歌词生成等趣味项目 | CoupletAI、歌词接龙机器人 |
坑与注意
- 仓库本身已不再活跃更新:最后提交 2024-05-10,部分资源链接可能已失效,尤其是依赖早期版本框架的工具。
- 大量资源是链接而非代码:复制粘贴提示词或脚本不总是能用,需回到各项目源站确认最新用法。
- 版本兼容性问题:很多工具基于 Python 3.7–3.9、TensorFlow 1.x 或早期 PyTorch 版本,在新环境中可能需要降级或 Docker 隔离。
- awesome-list 的「收藏癖」陷阱:仓库条目良莠不齐,部分工具已无人维护,选工具前先查 GitHub 最近更新时间。
- 中文 OCR(cnocr)有独立维护:不要把 cnocr 当作 funNLP 的一部分,它是独立项目,参考其官方文档。
- 中文预训练模型需大显存:如 Chinese-LLaMA-13B 在 FP16 下需要 ~26GB 显存,合理评估硬件。
与同类对比
| 仓库 | Stars | 特点 | 适用阶段 |
|---|---|---|---|
| funNLP | 81k | 中文为主,工具+数据集+论文混合 | 日常参考、快速调研 |
| CLUEbenchmark | 10k+ | 中文 NLP 基准测试平台 | 模型评测 |
| Chinese-LLaMA-Alpaca | 12k+ | 专注中文 LLaMA 指令微调 | 模型微调 |
| awesome-nlp-sentiment-analysis | — | 英文情感分析资源 | 情感分析专项 |
funNLP 的优势是覆盖面极广,劣势是没有质量筛选。它更像一张详尽的地图,告诉你哪里有什么,但具体去不去、怎么去还需要自己做功课。
一句话推荐结论
中文 NLP「字典级」资源站——找工具、找数据、找模型时先来这里导航,但具体使用前务必确认各子项目的维护状态和版本兼容性。