fighting41love/funNLP · 上手攻略

  • 仓库:fighting41love/funNLP
  • 链接:https://github.com/fighting41love/funNLP
  • 分类:skill / NLP
  • 作者:Jay
  • 更新:2026-07-13

这是什么

funNLP 是一个中文 NLP 工具与资源的大集合,由 NLP 从业者「fighting41love」整理维护。GitHub Stars 超过 81k,周增 +77(数据截至 2026-07-13),最后提交 2024-05-10。仓库并非一个独立的 Python 包,而是按主题分类的资源索引:每个条目都是一个真实的开源项目、数据集或工具,包含名称、描述和 GitHub/论文链接。

它的定位介于「awesome-list 导航页」和「实用工具合集」之间——既有可直接 pip 安装的包(如 cnocr、Jiagu、Synonyms),也有语料库、预训练模型、数据集、课程资料等资源链接,还有大量「有趣但偏收藏」的娱乐向项目(如汪峰歌词生成器、歌词接龙机器人)。

涵盖领域一览:

大类 子类
类 ChatGPT 模型与评测 ChatBot Arena、C-Eval、OpenCompass、QLoRA
LLM 训练 / 推理 / 低资源 DeepSpeed Chat、Lit-LLaMA、ChatGLM-Efficient-Tuning
提示工程 Prompt 资源、CoT、ART 等
语料库 词库、百科、成语、诗句、医学、金融、法律
预训练语言模型 Chinese-LLaMA、OpenChineseLLaMA、MOSS 等
信息抽取 / NER BERT-NER、pke、AmpliGraph
知识图谱 百度百科三元组、京东商品图谱、军事知识图谱
文本生成 & 摘要 TextTeaser、BERT 摘要、Transformer 摘要
智能问答 医疗问答、金融问答、百度知道 580 万语料
文档处理 PDF 表格提取、中文 OCR(cnocr)、doccano 标注
语音处理 ASR 语料、masr 中文语音识别、音频增强
情感分析 awesome-nlp-sentiment-analysis、ULMFiT
有趣工具 对联系统、汪峰歌词生成器、聊天机器人

解决什么问题

  1. 找不到合适的中文 NLP 工具:中文 NLP 资源分散,jieba 之外还有什么好用的分词、NER、情感分析工具?funNLP 用分类索引帮你快速定位。
  2. 找不到合适的数据集:做中文任务时缺训练语料——成语、古诗、医学对话、金融新闻、谣言数据,funNLP 汇总了 100+ 常用数据集。
  3. 不知道该用哪个预训练模型:Chinese-LLaMA、ChatGLM、Qwen、MOSS……各模型对比、评测资源一并整理。
  4. 入门 NLP 没有路线图:从 cs224n 课程到实战比赛,从新词发现到知识图谱,仓库本身就是一张 NLP 全景图。

快速安装

funNLP 本身不是一个可安装的包,而是资源索引目录。推荐用法:

# 方法一:克隆仓库(最常用)
git clone https://github.com/fighting41love/funNLP.git
cd funNLP

# 方法二:只关注特定类别,用 GitHub 的目录搜索
# 访问 https://github.com/fighting41love/funNLP/tree/master/data

如果你想直接使用仓库中推荐的可安装 Python 包,以下是高频工具的标准安装方式(均与 funNLP 仓库本身无关,为独立 pip 包):

# 中文分词(已有 jieba,备选)
pip install jiagu

# 中文 OCR
pip install cnocr

# 中文近义词
pip install synonyms

# 关键词抽取
pip install pke

# 文本纠错(BERT-based)
pip install bert-punc

# 快速数字转换(中文 ↔ 阿拉伯)
pip install chinese-digits  # 或参考 funNLP 中的实现

# 英文拼写检查
pip install pyspellchecker

⚠️ 注意:仓库中大量工具安装方式各异,部分依赖特定版本的 TensorFlow/PyTorch,且部分项目已停止维护。使用前建议查看各项目自己的 README 确认兼容性。


核心用法

1. 导航找工具

仓库按目录分类,找到对应场景后直接点击链接跳到源项目:

data/
├── sensitive_words/       ← 中文敏感词检测
├── word2vec/              ← 中文词向量资源
├── corpora/               ← 语料库
├── pretrained_models/      ← 预训练模型
├── nlp_credit/            ← 各公司内部技术文档
├── paper/                  ← 论文 PDF
└── tools/                 ← 独立可运行工具

推荐从这几个入口切入:

  • 想做中文 NER → data/ner/ 或直接用 pke + BERT
  • 想做文本分类 → data/text_classification/ + Hugging Face 模型
  • 想做知识图谱 → data/knowledge_graph/ 中的 AmpliGraph、Zincbase
  • 想做中文 OCR → cnocr(GitHub: https://github.com/breezedeus/cnocr)

2. 直接安装高频工具包(示例)

# 中文近义词查询
import synonyms
synonyms.compare("北京", "上海")       # → 0.78(相似度)
synonyms.display("人工智能")           # 打印近义词列表

# 关键词抽取(pke)
from pke import load_document
# 参考 https://github.com/boudinfl/pke

# 数字转换
# 参考 funNLP 中 text_to_number 的实现

3. 使用评测对比资源

# 想对比 LLM 在中文任务上的效果?
# 参考仓库中的 C-Eval 评测体系
# https://github.com/SJTU-LIT/ceval

# 想用 OpenCompass 做本地评测
git clone https://github.com/InternLM/OpenCompass
cd OpenCompass && pip install -e .

4. 知识图谱构建

# 使用 AmpliGraph 做知识图谱表示学习
# pip install ampligraph
from ampligraph.latent_features import ComplEx
model = ComplEx(batches_count=100, epochs=50, k=100)
# 参考 https://github.com/Accenture/AmpliGraph

典型适用场景

场景 推荐资源
快速搭建中文聊天机器人 MOSS、ChatGLM、GPT2-chitchat
中文简历/文档关键信息提取 中文 NER + 正则表达式工具
金融文本分析与情感判断 金融 NLP + 情感分析语料
医学知识图谱问答 医学 NLP + 京东/医疗知识图谱
法律文书 NLP 处理 Blackstone (spaCy 法律模型)
低资源中文 NLP 任务 Chinese-LLaMA-Alpaca + QLoRA
对联/歌词生成等趣味项目 CoupletAI、歌词接龙机器人

坑与注意

  1. 仓库本身已不再活跃更新:最后提交 2024-05-10,部分资源链接可能已失效,尤其是依赖早期版本框架的工具。
  2. 大量资源是链接而非代码:复制粘贴提示词或脚本不总是能用,需回到各项目源站确认最新用法。
  3. 版本兼容性问题:很多工具基于 Python 3.7–3.9、TensorFlow 1.x 或早期 PyTorch 版本,在新环境中可能需要降级或 Docker 隔离。
  4. awesome-list 的「收藏癖」陷阱:仓库条目良莠不齐,部分工具已无人维护,选工具前先查 GitHub 最近更新时间。
  5. 中文 OCR(cnocr)有独立维护:不要把 cnocr 当作 funNLP 的一部分,它是独立项目,参考其官方文档。
  6. 中文预训练模型需大显存:如 Chinese-LLaMA-13B 在 FP16 下需要 ~26GB 显存,合理评估硬件。

与同类对比

仓库 Stars 特点 适用阶段
funNLP 81k 中文为主,工具+数据集+论文混合 日常参考、快速调研
CLUEbenchmark 10k+ 中文 NLP 基准测试平台 模型评测
Chinese-LLaMA-Alpaca 12k+ 专注中文 LLaMA 指令微调 模型微调
awesome-nlp-sentiment-analysis 英文情感分析资源 情感分析专项

funNLP 的优势是覆盖面极广,劣势是没有质量筛选。它更像一张详尽的地图,告诉你哪里有什么,但具体去不去、怎么去还需要自己做功课。


一句话推荐结论

中文 NLP「字典级」资源站——找工具、找数据、找模型时先来这里导航,但具体使用前务必确认各子项目的维护状态和版本兼容性。