htlin222/meta-pipe · 上手攻略

  • 仓库:htlin222/meta-pipe
  • 链接:https://github.com/htlin222/meta-pipe
  • 分类:AI 应用 · 学术工具 · 系统综述
  • 作者:Jay
  • 更新:2026-09-23

这是什么

meta-pipe 是一个基于 Claude Code 的端到端系统综述(Systematic Review)与元分析(Meta-Analysis)自动化 pipeline。你给一个研究主题,Claude Code 自动完成从文献检索、筛选、数据提取、统计分析到生成符合期刊格式的手稿,整个过程模块化、可重现、留有 5 个强制人工决策点。

核心逻辑:用 Claude(Anthropic) 做 LLM 编排——用 Opus 4 做复杂推理任务(筛选裁定、风险偏倚评估、手稿生成),用 Haiku 3.5 做高吞吐分类任务(标题/摘要分类、数据验证)。统计部分用 R(metametaforgemtcnetmeta),手稿渲染用 Quarto。

配套一个完整示例项目:projects/ici-breast-cancer/——关于免疫检查点抑制剂治疗三阴性乳腺癌的元分析,含 5 项 RCT、N=2,402 患者、主要结局 RR=1.26(95% CI 1.16–1.37),手稿 4,921 词(Lancet Oncology 格式)。


解决什么问题

传统系统综述的核心痛点: - 时间成本极高:一项系统综述手动做 100+ 小时,筛选、提取、录入全靠人工 - 流程不透明:筛选决策无记录,方法不可复现 - 统计门槛:R 的 meta 分析包对临床研究者有学习成本 - 手稿格式:从分析结果到期刊格式手稿还有大量排版工作

meta-pipe 把这四个环节串成一条自动化流水线,Claude Code 当「执行者」,人在 5 个关键节点把关(9 阶段中标注了强制人工审核点)。

⚠️ 注意:这不是一个「一键生成论文」的工具,而是「把重复性最高的筛选和提取工作自动化,保留人工审核关卡」的半自动化流水线。arXiv 论文(2606.28363v1)也指出,API 成本估算约 $15–30/项(5–10 项成对 meta 分析),且超过 50 项研究时的成本 scaling 尚未表征。


快速安装

前置依赖

工具 版本 说明
uv 最新 Python 包管理
R ≥ 4.2 + renv 统计计算
cmake 最新 编译部分 R 包(如 fs),macOS ARM 必需
Quarto 最新 手稿渲染
Claude API Key 填入 .env

安装步骤

① 克隆仓库

git clone https://github.com/htlin222/meta-pipe.git
cd meta-pipe

② 配置环境变量

cp .env.example .env
# 编辑 .env,填入你的 API keys

③ 初始化 Python 环境

cd tooling/python && uv init

④ 创建新项目

# 在仓库根目录运行
uv run tooling/python/init_project.py --name my-meta-analysis
# 项目创建在 projects/my-meta-analysis/

⑤ 编辑研究问题

打开 projects/my-meta-analysis/TOPIC.txt,写入你的 PICO 问题或研究主题。

⑥ 启动 Claude Code

在仓库根目录启动 Claude Code(或 claude CLI),对 Claude 说:

Start project my-meta-analysis

或:

See projects/my-meta-analysis/TOPIC.txt and start

Claude 会自动读取 TOPIC.txt,询问数据库选择、结局指标等澄清问题,然后自动跑完 9 阶段 pipeline。


核心用法

9 阶段 Pipeline

阶段 目录 输出
01_protocol 01_protocol/ pico.yamleligibility.md
02_search 02_search/ dedupe.bib(去重后的文献库)
03_screening 03_screening/ decisions.csv(每篇的纳入/排除决策)
04_fulltext 04_fulltext/ manifest.csv(全文获取清单)
05_extraction 05_extraction/ extraction.csv(提取数据)
06_analysis 06_analysis/ figures/tables/(统计图表)
07_manuscript 07_manuscript/ manuscript.pdf(排版手稿)
08_reviews 08_reviews/ grade_summary.md(证据质量评级)
09_qa 09_qa/ final_qa_report.md(质量保证报告)

手动启动(非交互模式)

如果你只想跑某个阶段而不走完整交互:

# 进入项目目录
cd projects/my-meta-analysis

# 手动触发特定阶段(由 Claude Code 执行)
# 前提:已完成 TOPIC.txt 配置

查看示例完整项目

# 查看已完成的示例
projects/ici-breast-cancer/
├── README.md                          # 项目概览
├── 00_overview/FINAL_PROJECT_SUMMARY.md  # 关键发现
└── 07_manuscript/                    # 完整手稿(5 节)

CLAUDE.md 的作用

仓库根目录有 CLAUDE.md,Claude Code 启动时会自动加载其中定义的 agent 行为规则,包括 9 阶段各自的职责和输出规范。不要删除或修改这个文件,它是 pipeline 正常运转的关键。


典型适用场景

场景 价值
临床医学系统综述 自动完成 PRISMA 流程,从检索到手稿
护理学循证实践 快速生成证据摘要,指导临床决策
公共卫生政策评估 多研究证据合成,输出结构化报告
研究生开题 快速了解领域现有证据,识别研究空白
学术发表(期刊 Letter / Review) 缩短系统综述写作周期

⚠️ 适用前提:已有明确的研究问题(PICO 清晰),零基础用户仍需要理解系统综述的基本流程(PICO 是什么、PRISMA 是什么),Claude 是执行者,不是研究者。


坑与注意

① Claude API 成本不可忽视

官方估算 $15–30/项(5–10 项成对 meta 分析),但这只是筛选和提取阶段的理论值。超过 50 项研究时 cost scaling 未被表征。跑之前先在 Claude Console 看用量。

② 5 个人工决策点是强制关卡,不可跳过

Pipeline 在 9 个阶段中标注了 5 处强制人工审核点。如果跳过这些关卡直接让 Claude 全自动跑,最终结果的方法学质量无法保证,且不符合系统综述的规范要求。

③ 输出质量高度依赖研究问题表述

TOPIC.txt 写得模糊 → 检索策略不准 → 后面的结论全歪。建议先用 Claude 帮你把模糊想法精确化成 PICO 格式。

④ R 包依赖(macOS ARM 用户注意)

renv 管理 R 包环境,macOS ARM(M1/M2/M3)上部分 R 包(如 fs)需要 cmake 编译。先确保:

# macOS
xcode-select --install
brew install cmake

⑤ 统计结果需人工解读

R 的 meta 分析输出是标准统计量(RR、OR、95% CI、I² 等),但临床意义的解读仍需领域知识,Nimble 这类模型无法替代。

⑥ 系统综述注册

规范的系统综述需要事先在 PROSPERO 等平台注册。meta-pipe 不包含注册流程,如需发表可能需要补充。

⑦ 项目文件默认不进入 Git

projects/ 目录在 .gitignore 中,只有示例项目 ici-breast-cancer/ 被 Git 跟踪。新项目需要自己备份。


与同类对比

工具 自动化程度 LLM 引擎 统计集成 适用场景
meta-pipe 高(9 阶段自动) Claude(Opus 4 + Haiku 3.5) R(meta 等包)+ Quarto 完整系统综述
Otto-SR GPT-4 类 部分 文献筛选
MetaScreener 多个 LLM 文献筛选(开源)
raymeta Claude 类 部分 元分析
PRISMA 流程图工具 低(只画图) 仅流程文档

meta-pipe 的核心差异化是端到端(从问题到排版手稿)+ 统计 R 集成 + 5 强制人工关卡。不做文献筛选/评估的单一环节,而是覆盖整个系统综述生命周期。


一句话推荐

如果你正在或计划做系统综述 / 元分析,且对 Claude Code + R + Quarto 这套工具有基本了解——meta-pipe 能把文献筛选和数据提取的重复性工作自动化,将 100+ 小时压缩到以「人工审核节点」为主的十几个小时;前提是研究问题已经过认真提炼,不要期待它替你做研究设计。