ChaokunHong/MetaScreener · 上手攻略

  • 仓库:ChaokunHong/MetaScreener
  • 链接:https://github.com/ChaokunHong/MetaScreener
  • 分类:AI 科研工具 · 系统评价
  • 作者:Tom
  • 更新:2026-08-22

是什么

MetaScreener 是一款开源的 AI 驱动系统评价(systematic review)筛选工具。它利用多个开源大语言模型组成并行投票 ensemble,对文献标题和摘要进行批量筛选,决定"纳入"或"排除",并附带置信度评分和不确定性量化。核心设计理念是:不用单一模型做决策,而是让 4+ 个模型同时审阅,通过置信度校准和分层决策路由,用机器替代人工完成系统性综述中最耗时的初筛阶段

适用场景是用 PICO/PEO/SPIDER 框架定义纳排标准后,将 PubMed/Scopus/Web of Science 等数据库的搜索结果(.ris/.bib/.csv/.xlsx 格式)导入,系统自动完成初筛,仅将高不确定性文献路由给人工复核。

解决什么问题

系统性综述(Systematic Review)是医学、循证社会科学领域的核心方法,其筛选阶段(screening)要求两名审稿人独立阅读所有文献的标题和摘要,耗时通常占整个综述工作的 30-50%。当文献数量达到数千篇时,人工筛选成为严重瓶颈。

MetaScreener 将这一瓶颈自动化:

  • 多模型 Ensemble 降低单一模型偏差:同时调用 4+ 开源模型(DeepSeek V3、Qwen 3、Llama 4 等),各模型独立给出"纳入/排除/不确定"的判断
  • 置信度校准消除幻觉:使用 Platt Scaling 或 Isotonic Regression 将原始评分映射为真实概率,低置信度文献自动进入人工审核队列
  • PICO/PEO/SPIDER 框架原生支持:用户定义研究问题后,系统按对应元素(P/I/C/O)逐条评分,并输出元素级共识分(Element Consensus Score, ECS)
  • 主动学习回路:人工复核结果实时反馈给模型,重新校准权重,越筛越准
  • 全程可复现:temperature=0.0,seed=42,每次决策均有完整审计日志

快速安装

环境要求

  • Python 3.11+
  • API Key:OpenRouter(注册免费,按量付费)
  • 磁盘空间:约 500 MB(后端服务)

安装方式一:pip(一行安装)

pip install metascreener
python -m metascreener
# 启动后访问 http://localhost:8000

安装方式二:Docker(推荐生产环境使用)

docker pull chaokunhong/metascreener:latest

docker run -p 8000:8000 \
  -e OPENROUTER_API_KEY="sk-or-v1-your-key-here" \
  chaokunhong/metascreener
# 启动后访问 http://localhost:8000

安装方式三:源码开发模式

git clone https://github.com/ChaokunHong/MetaScreener.git
cd MetaScreener

# 需要 uv (https://docs.astral.sh/uv/) 和 Node.js 18+
uv sync --extra dev   # 安装 Python 依赖(含 PyTorch、FastAPI、Vue 等)
python run.py          # 同时启动 FastAPI 后端 (http://localhost:8000) 和 Vite 前端 (http://localhost:5173)

API Key 配置方法(三选一):

# 方式 1:环境变量
export OPENROUTER_API_KEY="sk-or-v1-your-key-here"

# 方式 2:启动后在前端 Settings 页面粘贴

# 方式 3:Docker -e 参数(如上所示)

核心用法

四层筛选管道(Hierarchical Consensus Network, HCN)

上传文件 (.ris/.bib/.csv/.xlsx)
    ↓
Layer 1: 并行 LLM 推理
  4+ 模型同时处理每篇文献 → 各自返回决策+置信分+元素级评分+推理链
    ↓
Layer 2: 规则引擎
  硬规则(hard rules)→ 违反非必要条件直接排除
  软规则(soft rules)→ 部分匹配施加分数惩罚
    ↓
Layer 3: CCA + ECS 聚合
  Platt/Isotonic 置信度校准 + 元素共识评分 (Element Consensus Score)
    ↓
Layer 4: 决策路由
  Tier 0: 硬规则违反 → 自动排除
  Tier 1: 高 ECS (≥0.60) + 模型全同意 → 自动决策
  Tier 2: 中等 ECS (≥0.10) + 允许范围内分歧 → 自动决策(置信度降低)
  Tier 3: 低置信或高度分歧 → 人工复核

Web UI 操作流程

步骤 页面 操作内容
0 Criteria 输入研究问题,AI 自动生成 PICO/PEO/SPIDER 纳排标准
1 Settings 选择模型组合,调整阈值,配置 OpenRouter API Key
2 Screening (TA) 上传搜索结果,运行标题/摘要筛选,查看每篇决策
3 Screening (FT) 上传 PDF,运行全文筛选(智能分块)
4 Extraction 从纳入的 PDF 中提取结构化数据(表格、字段)
5 Quality 风险偏倚评估(RoB 2 / ROBINS-I / QUADAS-2)
6 Evaluation 性能指标、校准诊断、可视化
7 History 完整决策溯源审计记录

模型组合推荐(OpenRouter 上可用)

预设 模型数 每篇成本(估算) 最适场景
Balanced 4 models ~$0.005 大多数综述
Precision 2 thinking + 2 large ~$0.009 高风险综述(医学指南)
Budget 1 anchor + 3 fast ~$0.003 大规模初筛

支持的模型共 15 个,按能力分三层:Flagship(DeepSeek V3, Qwen 3, Kimi K2.5)、Strong(Llama 4 Maverick, GLM 5 等)、Lightweight(Gemma 3 27B, Mistral Small 4 等)。

最小可跑示例(命令行筛选)

MetaScreener 主要通过 Web UI 操作,暂无独立命令行筛选脚本。核心逻辑在 src/metascreener/module1_screening/ 目录下:

# ⚠️ 以下为示意代码,展示 API 调用结构,实际运行请使用 Web UI
from metascreener.module1_screening import HierarchicalConsensusNetwork

hcn = HierarchicalConsensusNetwork(config="configs/models.yaml")
results = hcn.screen_papers(
    input_file="search_results.ris",
    criteria="PICO",
    criteria_text="Population: adults with hypertension; Intervention: ACE inhibitors; Outcome: mortality reduction",
    models=["deepseekv3", "qwen3", "llama4-maverick", "kimi-k2.5"],
    thresholds={"tier1_ecs": 0.60, "tier2_ecs": 0.10}
)

支持的输入文件格式

格式 扩展名 来源
RIS .ris PubMed, Scopus, Web of Science, Ovid, Embase
BibTeX .bib Google Scholar, Zotero, Mendeley
CSV .csv 任意电子表格(需含 title 和 abstract 列)
Excel .xlsx 任意电子表格(需含 title 和 abstract 列)
PDF .pdf 用于全文筛选和数据提取

典型适用场景

  • 医学系统性综述 / Meta 分析:Cochrane 风格的系统评价初筛,PRISMA 流程图配套
  • 循证社会科学:教育、心理、公共卫生领域的文献综述
  • 政策研究报告:大规模文献环境扫描(environmental scan)
  • 学术文献初筛:研究生开题前的文献筛选阶段
  • 多语言综述:通过选择支持多语言的模型,覆盖非英语文献

坑与注意

⚠️ 依赖 OpenRouter API 密钥:MetaScreener 本身免费开源,但调用 LLM 需要 OpenRouter 账户和 API Key。免费注册有额度,用完后按量付费。每篇 ~$0.003–0.009,成本低但不可忽视。

⚠️ 非完全本地化:模型推理通过 OpenRouter API 调用,并非完全本地运行。涉及敏感数据时请确认数据安全政策,或自行部署模型端点。

⚠️ 无离线模式:在没有网络连接或 OpenRouter 服务不可用时无法运行(除非自行部署兼容 API)。

⚠️ 筛选质量依赖纳排标准表述:PICO/PEO/SPIDER 描述越精确,模型判断越准确。模糊的纳排标准会导致 Tier 3 大量文献进入人工审核,削弱自动化价值。

⚠️ RoB 评估仅限特定量表:目前支持 RoB 2(随机对照试验)、ROBINS-I(非随机干预研究)、QUADAS-2(诊断准确性研究),其他研究类型可能需要手动扩展。

⚠️ GitHub stars 仅 1326:相对较新,用户社区规模不大,遇到问题更多需要自行阅读源码。

与同类对比

工具 类型 模型 特点 部署方式
MetaScreener(本工具) 开源 多模型 Ensemble(OpenRouter) HCN 四层管道,置信度校准,主动学习 pip / Docker / 源码
ASReview 开源 单模型(可选) 主动学习先驱,界面成熟 pip / Docker
Rayyan 商业 SaaS 未公开 协作功能强,人工筛选辅助 浏览器
Covidence 商业 SaaS 未公开 完整综述工作流,含数据提取 浏览器
Systematic Review Dell AI 商业 AI GPT-4 等 端到端自动化(成本高) API

MetaScreener 的核心差异是多模型 Ensemble + 置信度校准,而非单一模型或人工规则引擎。ASReview 以主动学习见长,但模型选择有限;Rayyan 和 Covidence 是纯人工协作工具,无 LLM 筛选能力。

一句话推荐结论

MetaScreener 是目前开源生态中最接近"系统性综述初筛自动化完整方案"的工具——多模型 Ensemble 降低偏差、置信度校准量化不确定性、主动学习持续提升精度,特别适合需要处理数百至数千篇文献且有一定 AI 使用能力的医学和循证社科研究者。