ChaokunHong/MetaScreener · 上手攻略
- 仓库:ChaokunHong/MetaScreener
- 链接:https://github.com/ChaokunHong/MetaScreener
- 分类:AI 科研工具 · 系统评价
- 作者:Tom
- 更新:2026-08-22
是什么
MetaScreener 是一款开源的 AI 驱动系统评价(systematic review)筛选工具。它利用多个开源大语言模型组成并行投票 ensemble,对文献标题和摘要进行批量筛选,决定"纳入"或"排除",并附带置信度评分和不确定性量化。核心设计理念是:不用单一模型做决策,而是让 4+ 个模型同时审阅,通过置信度校准和分层决策路由,用机器替代人工完成系统性综述中最耗时的初筛阶段。
适用场景是用 PICO/PEO/SPIDER 框架定义纳排标准后,将 PubMed/Scopus/Web of Science 等数据库的搜索结果(.ris/.bib/.csv/.xlsx 格式)导入,系统自动完成初筛,仅将高不确定性文献路由给人工复核。
解决什么问题
系统性综述(Systematic Review)是医学、循证社会科学领域的核心方法,其筛选阶段(screening)要求两名审稿人独立阅读所有文献的标题和摘要,耗时通常占整个综述工作的 30-50%。当文献数量达到数千篇时,人工筛选成为严重瓶颈。
MetaScreener 将这一瓶颈自动化:
- 多模型 Ensemble 降低单一模型偏差:同时调用 4+ 开源模型(DeepSeek V3、Qwen 3、Llama 4 等),各模型独立给出"纳入/排除/不确定"的判断
- 置信度校准消除幻觉:使用 Platt Scaling 或 Isotonic Regression 将原始评分映射为真实概率,低置信度文献自动进入人工审核队列
- PICO/PEO/SPIDER 框架原生支持:用户定义研究问题后,系统按对应元素(P/I/C/O)逐条评分,并输出元素级共识分(Element Consensus Score, ECS)
- 主动学习回路:人工复核结果实时反馈给模型,重新校准权重,越筛越准
- 全程可复现:temperature=0.0,seed=42,每次决策均有完整审计日志
快速安装
环境要求
- Python 3.11+
- API Key:OpenRouter(注册免费,按量付费)
- 磁盘空间:约 500 MB(后端服务)
安装方式一:pip(一行安装)
pip install metascreener
python -m metascreener
# 启动后访问 http://localhost:8000
安装方式二:Docker(推荐生产环境使用)
docker pull chaokunhong/metascreener:latest
docker run -p 8000:8000 \
-e OPENROUTER_API_KEY="sk-or-v1-your-key-here" \
chaokunhong/metascreener
# 启动后访问 http://localhost:8000
安装方式三:源码开发模式
git clone https://github.com/ChaokunHong/MetaScreener.git
cd MetaScreener
# 需要 uv (https://docs.astral.sh/uv/) 和 Node.js 18+
uv sync --extra dev # 安装 Python 依赖(含 PyTorch、FastAPI、Vue 等)
python run.py # 同时启动 FastAPI 后端 (http://localhost:8000) 和 Vite 前端 (http://localhost:5173)
API Key 配置方法(三选一):
# 方式 1:环境变量
export OPENROUTER_API_KEY="sk-or-v1-your-key-here"
# 方式 2:启动后在前端 Settings 页面粘贴
# 方式 3:Docker -e 参数(如上所示)
核心用法
四层筛选管道(Hierarchical Consensus Network, HCN)
上传文件 (.ris/.bib/.csv/.xlsx)
↓
Layer 1: 并行 LLM 推理
4+ 模型同时处理每篇文献 → 各自返回决策+置信分+元素级评分+推理链
↓
Layer 2: 规则引擎
硬规则(hard rules)→ 违反非必要条件直接排除
软规则(soft rules)→ 部分匹配施加分数惩罚
↓
Layer 3: CCA + ECS 聚合
Platt/Isotonic 置信度校准 + 元素共识评分 (Element Consensus Score)
↓
Layer 4: 决策路由
Tier 0: 硬规则违反 → 自动排除
Tier 1: 高 ECS (≥0.60) + 模型全同意 → 自动决策
Tier 2: 中等 ECS (≥0.10) + 允许范围内分歧 → 自动决策(置信度降低)
Tier 3: 低置信或高度分歧 → 人工复核
Web UI 操作流程
| 步骤 | 页面 | 操作内容 |
|---|---|---|
| 0 | Criteria | 输入研究问题,AI 自动生成 PICO/PEO/SPIDER 纳排标准 |
| 1 | Settings | 选择模型组合,调整阈值,配置 OpenRouter API Key |
| 2 | Screening (TA) | 上传搜索结果,运行标题/摘要筛选,查看每篇决策 |
| 3 | Screening (FT) | 上传 PDF,运行全文筛选(智能分块) |
| 4 | Extraction | 从纳入的 PDF 中提取结构化数据(表格、字段) |
| 5 | Quality | 风险偏倚评估(RoB 2 / ROBINS-I / QUADAS-2) |
| 6 | Evaluation | 性能指标、校准诊断、可视化 |
| 7 | History | 完整决策溯源审计记录 |
模型组合推荐(OpenRouter 上可用)
| 预设 | 模型数 | 每篇成本(估算) | 最适场景 |
|---|---|---|---|
| Balanced | 4 models | ~$0.005 | 大多数综述 |
| Precision | 2 thinking + 2 large | ~$0.009 | 高风险综述(医学指南) |
| Budget | 1 anchor + 3 fast | ~$0.003 | 大规模初筛 |
支持的模型共 15 个,按能力分三层:Flagship(DeepSeek V3, Qwen 3, Kimi K2.5)、Strong(Llama 4 Maverick, GLM 5 等)、Lightweight(Gemma 3 27B, Mistral Small 4 等)。
最小可跑示例(命令行筛选)
MetaScreener 主要通过 Web UI 操作,暂无独立命令行筛选脚本。核心逻辑在 src/metascreener/module1_screening/ 目录下:
# ⚠️ 以下为示意代码,展示 API 调用结构,实际运行请使用 Web UI
from metascreener.module1_screening import HierarchicalConsensusNetwork
hcn = HierarchicalConsensusNetwork(config="configs/models.yaml")
results = hcn.screen_papers(
input_file="search_results.ris",
criteria="PICO",
criteria_text="Population: adults with hypertension; Intervention: ACE inhibitors; Outcome: mortality reduction",
models=["deepseekv3", "qwen3", "llama4-maverick", "kimi-k2.5"],
thresholds={"tier1_ecs": 0.60, "tier2_ecs": 0.10}
)
支持的输入文件格式
| 格式 | 扩展名 | 来源 |
|---|---|---|
| RIS | .ris | PubMed, Scopus, Web of Science, Ovid, Embase |
| BibTeX | .bib | Google Scholar, Zotero, Mendeley |
| CSV | .csv | 任意电子表格(需含 title 和 abstract 列) |
| Excel | .xlsx | 任意电子表格(需含 title 和 abstract 列) |
| 用于全文筛选和数据提取 |
典型适用场景
- 医学系统性综述 / Meta 分析:Cochrane 风格的系统评价初筛,PRISMA 流程图配套
- 循证社会科学:教育、心理、公共卫生领域的文献综述
- 政策研究报告:大规模文献环境扫描(environmental scan)
- 学术文献初筛:研究生开题前的文献筛选阶段
- 多语言综述:通过选择支持多语言的模型,覆盖非英语文献
坑与注意
⚠️ 依赖 OpenRouter API 密钥:MetaScreener 本身免费开源,但调用 LLM 需要 OpenRouter 账户和 API Key。免费注册有额度,用完后按量付费。每篇 ~$0.003–0.009,成本低但不可忽视。
⚠️ 非完全本地化:模型推理通过 OpenRouter API 调用,并非完全本地运行。涉及敏感数据时请确认数据安全政策,或自行部署模型端点。
⚠️ 无离线模式:在没有网络连接或 OpenRouter 服务不可用时无法运行(除非自行部署兼容 API)。
⚠️ 筛选质量依赖纳排标准表述:PICO/PEO/SPIDER 描述越精确,模型判断越准确。模糊的纳排标准会导致 Tier 3 大量文献进入人工审核,削弱自动化价值。
⚠️ RoB 评估仅限特定量表:目前支持 RoB 2(随机对照试验)、ROBINS-I(非随机干预研究)、QUADAS-2(诊断准确性研究),其他研究类型可能需要手动扩展。
⚠️ GitHub stars 仅 1326:相对较新,用户社区规模不大,遇到问题更多需要自行阅读源码。
与同类对比
| 工具 | 类型 | 模型 | 特点 | 部署方式 |
|---|---|---|---|---|
| MetaScreener(本工具) | 开源 | 多模型 Ensemble(OpenRouter) | HCN 四层管道,置信度校准,主动学习 | pip / Docker / 源码 |
| ASReview | 开源 | 单模型(可选) | 主动学习先驱,界面成熟 | pip / Docker |
| Rayyan | 商业 SaaS | 未公开 | 协作功能强,人工筛选辅助 | 浏览器 |
| Covidence | 商业 SaaS | 未公开 | 完整综述工作流,含数据提取 | 浏览器 |
| Systematic Review Dell AI | 商业 AI | GPT-4 等 | 端到端自动化(成本高) | API |
MetaScreener 的核心差异是多模型 Ensemble + 置信度校准,而非单一模型或人工规则引擎。ASReview 以主动学习见长,但模型选择有限;Rayyan 和 Covidence 是纯人工协作工具,无 LLM 筛选能力。
一句话推荐结论
MetaScreener 是目前开源生态中最接近"系统性综述初筛自动化完整方案"的工具——多模型 Ensemble 降低偏差、置信度校准量化不确定性、主动学习持续提升精度,特别适合需要处理数百至数千篇文献且有一定 AI 使用能力的医学和循证社科研究者。