littlelelephant/literature-review-agent · 上手攻略

  • 仓库:littlelelephant/literature-review-agent
  • 链接:https://github.com/littlelelephant/literature-review-agent
  • 分类:Agent工具 · 学术写作 · LangGraph工作流
  • 作者:Tom
  • 更新:2026-08-05

是什么

literature-review-agent 是一个基于 LangGraph可审计、可恢复多 Agent 文献综述工作流,包含两个独立可用的 Agent:

  • Literature Search Agent:负责文献检索、去重、引文扩展,输出 literature.csv
  • Literature Review Agent:负责从用户批准提纲和本地文献生成带证据的综述,输出 final_review.md

核心解决的是通用 AI 写作的四大顽疾:参考文献虚构、引用不足、证据范围不可控、文章结构失控。当前版本通过 Europe PMC 和 arXiv 检索、MinerU PDF 解析、确定性引用生成,实现文献综述的端到端可控。


解决什么问题

  1. AI 虚构参考文献:通用模型会编造不存在的论文;本项目强制从真实检索结果和本地文档中提取证据。
  2. 综述引文覆盖不足:Search Agent 支持一跳双向引文扩展(向前查引用、向后查被引),Review Agent 还会按章节分析证据覆盖率。
  3. 证据 corpus 不透明:用户手动检查 Search Agent 返回的链接并下载,确保 Review Agent 只读用户明确授权的文献。
  4. 文章结构失控:用户批准或提供 Markdown 提纲,Review Agent 按提纲自底向上写并审计。
  5. 中断无法续跑:所有中间产物(检索结果、文献卡片、章节草稿)持久化存档,可从任意步骤恢复。

快速安装

环境要求

  • Python 3.11+
  • DeepSeek API Key(默认模型,用于检索和写作)
  • MinerU API Key(仅独立运行 Review Agent 且需解析 PDF 时需要)

安装步骤

# 克隆仓库
git clone https://github.com/littlelelephant/literature-review-agent.git
cd literature-review-agent

# Windows PowerShell
powershell -ExecutionPolicy Bypass -File .\scripts\setup.ps1
.\.venv\Scripts\Activate.ps1

# Linux / macOS
sh ./scripts/setup.sh
source .venv/bin/activate

# 设置 API Key(项目不会自动加载 .env)
# DeepSeek(默认模型)
export DEEPSEEK_API_KEY="your-deepseek-key"

# MinerU(仅 PDF 解析需要)
export MINERU_API_KEY="your-mineru-key"

注意:Windows 用户需要 PowerShell 7+ 以支持某些脚本功能。


核心用法

模式一:完整流水线(Search + Review 组合)

第 1 步:Search Agent 检索文献

# 方式 A:用户自己提供 Markdown 提纲,跳过探索直接检索
literature-search start "Your research topic" \
  --outline-file ./examples/outline.example.md \
  --config ./agents/literature-search/config.yaml

# 方式 B:让 Agent 自己探索并生成提纲,批准后再继续
literature-search start "Reliability of retrieval-augmented generation in healthcare"

Search 完成后会生成 literature.csv,包含每篇文献的 access_url

第 2 步:用户手动下载论文

# 用户检查 literature.csv 中的 access_url
# 将有权访问的 PDF 或 Markdown 论文下载到指定目录
# 例如:./literature/papers/

重要:Search 不自动下载任何文件,用户必须手动检查链接、遵守出版商访问条件,并将文件放入指定目录。

第 3 步:运行 Review Agent

# 前提:已有批准提纲(outline.example.md)+ 下载的文献目录
literature-review start \
  --outline ./examples/outline.example.md \
  --literature-dir ./literature/papers/ \
  --config ./agents/literature-review/config.yaml

Review Agent 会: 1. 将提纲转为标签树 2. 为每篇论文生成证据卡片 3. 自底向上写叶子章节 4. 审计结构、组装全文 5. 生成确定性引用和参考文献(final_review.md

模式二:仅 Search Agent(独立使用)

# 构建可复现的文献集合,不运行 Review
literature-search start "Your research topic" \
  --outline-file ./examples/outline.example.md \
  --config ./agents/literature-search/config.yaml

# 输出:literature.csv(含 deduplication 和引文扩展结果)

模式三:仅 Review Agent(已有本地文献)

# 用户已有本地 PDF/Markdown 文献 + Markdown 提纲
literature-review start \
  --outline ./my-outline.md \
  --literature-dir ./my-papers/ \
  --config ./agents/literature-review/config.yaml

# 输出:final_review.md

最小可跑验证命令

# 1. 确认 Python 版本
python --version  # 需 >= 3.11

# 2. 确认虚拟环境已激活
which literature-search  # 应显示 venv 中的路径

# 3. 验证 Search Agent 基本运行(不加 --outline-file 让它探索)
literature-search start "LLM agents in healthcare" --config ./agents/literature-search/config.yaml

# 4. 检查输出
ls -la literature.csv   # 应存在

# 5. 验证 Review Agent(需先有 outline 和 literature-dir)
# 创建最小测试提纲
echo "# Research Outline\n## Introduction\n## Methods\n## Results\n## Discussion" > /tmp/test-outline.md

# 创建最小文献目录
mkdir -p /tmp/test-papers
# 放入任意 .md 或 .pdf 文件

literature-review start \
  --outline /tmp/test-outline.md \
  --literature-dir /tmp/test-papers/ \
  --config ./agents/literature-review/config.yaml

工作流详解

Search Agent 检索流程

研究主题
  ↓
提纲来源?
  ├─ AI 生成 → 探索性检索 → 证据对齐提纲提案 → 用户批准/反馈 → 正式检索
  └─ 用户 Markdown 提纲 → 直接正式检索
  ↓
Europe PMC + arXiv 检索
  ↓
元数据筛选 + 去重(含出版版本去重)
  ↓
一跳双向引文扩展(通过 Europe PMC)
  ↓
literature.csv(含 access_url)
  ↓
用户检查链接 + 手动下载 PDF/Markdown

Review Agent 写作流程

已批准 Markdown 提纲 + 用户下载的文献目录
  ↓
MinerU PDF → Markdown(如需)
  ↓
提纲 → 稳定标签树(章节语义定义)
  ↓
每篇论文 → 证据卡片
  ↓
标签索引 + 按章节覆盖率分析
  ↓
自底向上写叶子章节(每个引用都有来源)
  ↓
结构审计 + 溯源审计
  ↓
组装全文 + 确定性格式引用
  ↓
final_review.md

典型适用场景

  1. 学术论文文献综述:医学、信息科学等领域,系统性检索 + 证据写作
  2. 研究生开题:探索性检索 + AI 提纲 + 综述草稿
  3. 系统性综述(Systematic Review):多 Agent 协同、用户全程控制证据 corpus
  4. 行业研究报告:基于真实文献的写作,避免 AI 幻觉引文
  5. 课程论文:Literature Review 章节单独生成

坑与注意

说明
PDF 下载需要手动 Search Agent 只返回 access_url,不自动下载;用户必须自行处理出版商访问权限
DeepSeek API Key 必须手动 export 项目不会自动读 .env 文件
Python 3.11+ 硬性要求 旧版 Python 会导致 LangGraph 兼容问题
MinerU API 费用 PDF 解析依赖 MinerU 服务,大批量使用需注意 API 费用
中文文献支持有限 检索源是 Europe PMC 和 arXiv,主要覆盖英文文献
摘要流水线仅适合轻度场景 如果 abstract 级别证据足够才用摘要模式;全文场景建议走完整流程
Windows 用户需 PowerShell 7+ 部分脚本语法需要较新版本 PowerShell
引文扩展仅一跳 是有界扩展,不是全量引文网络;可能遗漏高阶相关工作

与同类对比

工具 特点 literature-review-agent 优势
Elicit / Semantic Scholar 学术搜索引擎 literature-review-agent 可控证据 corpus,用户决定引什么
ChatGPT / Claude 综述 通用 LLM 写作 避免虚构参考文献;全流程可审计;提纲可控
Scopus / Web of Science 专业文献数据库 面向 Agent 工作流,可编程集成;价格更低
rayliot/ai-researcher 自动综述生成 可审计、可恢复、多 Agent 协同;LangGraph 状态管理更健壮
TensorSea/medical知识代理 医学文献综述 literature-review-agent 更通用,不限学科

核心差异:目前最完整的"检索—筛选—写作—审计"闭环开源方案,两个 Agent 独立可用,工作流状态持久化,适合严肃学术写作场景。


一句话推荐结论

如果你需要让 AI 写文献综述但又担心虚构参考文献和结构失控,literature-review-agent 是目前最完整的开源解决方案:Search 检索真实文献 + 用户控制证据 corpus + Review Agent 生成可审计综述,全程 LangGraph 状态管理可从任意步骤恢复。


来源:https://github.com/littlelelephant/literature-review-agent · README.md(EN + ZH-CN)· agents/literature-search/README.md · agents/literature-review/README.md · scripts/setup.sh / setup.ps1
不确定处:DeepSeek 模型版本(v3 / v2)未在文档中明确标注;MinerU API 的解析精度和费用结构未说明;长文本(>50篇文献)的 Review Agent 性能和 Token 消耗未提供基准数据;多轮迭代修订(用户反馈后重新生成)的具体命令接口未在 README 中完整描述