littlelelephant/literature-review-agent · 上手攻略
- 仓库:littlelelephant/literature-review-agent
- 链接:https://github.com/littlelelephant/literature-review-agent
- 分类:Agent工具 · 学术写作 · LangGraph工作流
- 作者:Tom
- 更新:2026-08-05
是什么
literature-review-agent 是一个基于 LangGraph 的可审计、可恢复多 Agent 文献综述工作流,包含两个独立可用的 Agent:
- Literature Search Agent:负责文献检索、去重、引文扩展,输出
literature.csv - Literature Review Agent:负责从用户批准提纲和本地文献生成带证据的综述,输出
final_review.md
核心解决的是通用 AI 写作的四大顽疾:参考文献虚构、引用不足、证据范围不可控、文章结构失控。当前版本通过 Europe PMC 和 arXiv 检索、MinerU PDF 解析、确定性引用生成,实现文献综述的端到端可控。
解决什么问题
- AI 虚构参考文献:通用模型会编造不存在的论文;本项目强制从真实检索结果和本地文档中提取证据。
- 综述引文覆盖不足:Search Agent 支持一跳双向引文扩展(向前查引用、向后查被引),Review Agent 还会按章节分析证据覆盖率。
- 证据 corpus 不透明:用户手动检查 Search Agent 返回的链接并下载,确保 Review Agent 只读用户明确授权的文献。
- 文章结构失控:用户批准或提供 Markdown 提纲,Review Agent 按提纲自底向上写并审计。
- 中断无法续跑:所有中间产物(检索结果、文献卡片、章节草稿)持久化存档,可从任意步骤恢复。
快速安装
环境要求
- Python 3.11+
- DeepSeek API Key(默认模型,用于检索和写作)
- MinerU API Key(仅独立运行 Review Agent 且需解析 PDF 时需要)
安装步骤
# 克隆仓库
git clone https://github.com/littlelelephant/literature-review-agent.git
cd literature-review-agent
# Windows PowerShell
powershell -ExecutionPolicy Bypass -File .\scripts\setup.ps1
.\.venv\Scripts\Activate.ps1
# Linux / macOS
sh ./scripts/setup.sh
source .venv/bin/activate
# 设置 API Key(项目不会自动加载 .env)
# DeepSeek(默认模型)
export DEEPSEEK_API_KEY="your-deepseek-key"
# MinerU(仅 PDF 解析需要)
export MINERU_API_KEY="your-mineru-key"
注意:Windows 用户需要 PowerShell 7+ 以支持某些脚本功能。
核心用法
模式一:完整流水线(Search + Review 组合)
第 1 步:Search Agent 检索文献
# 方式 A:用户自己提供 Markdown 提纲,跳过探索直接检索
literature-search start "Your research topic" \
--outline-file ./examples/outline.example.md \
--config ./agents/literature-search/config.yaml
# 方式 B:让 Agent 自己探索并生成提纲,批准后再继续
literature-search start "Reliability of retrieval-augmented generation in healthcare"
Search 完成后会生成 literature.csv,包含每篇文献的 access_url。
第 2 步:用户手动下载论文
# 用户检查 literature.csv 中的 access_url
# 将有权访问的 PDF 或 Markdown 论文下载到指定目录
# 例如:./literature/papers/
重要:Search 不自动下载任何文件,用户必须手动检查链接、遵守出版商访问条件,并将文件放入指定目录。
第 3 步:运行 Review Agent
# 前提:已有批准提纲(outline.example.md)+ 下载的文献目录
literature-review start \
--outline ./examples/outline.example.md \
--literature-dir ./literature/papers/ \
--config ./agents/literature-review/config.yaml
Review Agent 会:
1. 将提纲转为标签树
2. 为每篇论文生成证据卡片
3. 自底向上写叶子章节
4. 审计结构、组装全文
5. 生成确定性引用和参考文献(final_review.md)
模式二:仅 Search Agent(独立使用)
# 构建可复现的文献集合,不运行 Review
literature-search start "Your research topic" \
--outline-file ./examples/outline.example.md \
--config ./agents/literature-search/config.yaml
# 输出:literature.csv(含 deduplication 和引文扩展结果)
模式三:仅 Review Agent(已有本地文献)
# 用户已有本地 PDF/Markdown 文献 + Markdown 提纲
literature-review start \
--outline ./my-outline.md \
--literature-dir ./my-papers/ \
--config ./agents/literature-review/config.yaml
# 输出:final_review.md
最小可跑验证命令
# 1. 确认 Python 版本
python --version # 需 >= 3.11
# 2. 确认虚拟环境已激活
which literature-search # 应显示 venv 中的路径
# 3. 验证 Search Agent 基本运行(不加 --outline-file 让它探索)
literature-search start "LLM agents in healthcare" --config ./agents/literature-search/config.yaml
# 4. 检查输出
ls -la literature.csv # 应存在
# 5. 验证 Review Agent(需先有 outline 和 literature-dir)
# 创建最小测试提纲
echo "# Research Outline\n## Introduction\n## Methods\n## Results\n## Discussion" > /tmp/test-outline.md
# 创建最小文献目录
mkdir -p /tmp/test-papers
# 放入任意 .md 或 .pdf 文件
literature-review start \
--outline /tmp/test-outline.md \
--literature-dir /tmp/test-papers/ \
--config ./agents/literature-review/config.yaml
工作流详解
Search Agent 检索流程
研究主题
↓
提纲来源?
├─ AI 生成 → 探索性检索 → 证据对齐提纲提案 → 用户批准/反馈 → 正式检索
└─ 用户 Markdown 提纲 → 直接正式检索
↓
Europe PMC + arXiv 检索
↓
元数据筛选 + 去重(含出版版本去重)
↓
一跳双向引文扩展(通过 Europe PMC)
↓
literature.csv(含 access_url)
↓
用户检查链接 + 手动下载 PDF/Markdown
Review Agent 写作流程
已批准 Markdown 提纲 + 用户下载的文献目录
↓
MinerU PDF → Markdown(如需)
↓
提纲 → 稳定标签树(章节语义定义)
↓
每篇论文 → 证据卡片
↓
标签索引 + 按章节覆盖率分析
↓
自底向上写叶子章节(每个引用都有来源)
↓
结构审计 + 溯源审计
↓
组装全文 + 确定性格式引用
↓
final_review.md
典型适用场景
- 学术论文文献综述:医学、信息科学等领域,系统性检索 + 证据写作
- 研究生开题:探索性检索 + AI 提纲 + 综述草稿
- 系统性综述(Systematic Review):多 Agent 协同、用户全程控制证据 corpus
- 行业研究报告:基于真实文献的写作,避免 AI 幻觉引文
- 课程论文:Literature Review 章节单独生成
坑与注意
| 坑 | 说明 |
|---|---|
| PDF 下载需要手动 | Search Agent 只返回 access_url,不自动下载;用户必须自行处理出版商访问权限 |
| DeepSeek API Key 必须手动 export | 项目不会自动读 .env 文件 |
| Python 3.11+ 硬性要求 | 旧版 Python 会导致 LangGraph 兼容问题 |
| MinerU API 费用 | PDF 解析依赖 MinerU 服务,大批量使用需注意 API 费用 |
| 中文文献支持有限 | 检索源是 Europe PMC 和 arXiv,主要覆盖英文文献 |
| 摘要流水线仅适合轻度场景 | 如果 abstract 级别证据足够才用摘要模式;全文场景建议走完整流程 |
| Windows 用户需 PowerShell 7+ | 部分脚本语法需要较新版本 PowerShell |
| 引文扩展仅一跳 | 是有界扩展,不是全量引文网络;可能遗漏高阶相关工作 |
与同类对比
| 工具 | 特点 | literature-review-agent 优势 |
|---|---|---|
| Elicit / Semantic Scholar | 学术搜索引擎 | literature-review-agent 可控证据 corpus,用户决定引什么 |
| ChatGPT / Claude 综述 | 通用 LLM 写作 | 避免虚构参考文献;全流程可审计;提纲可控 |
| Scopus / Web of Science | 专业文献数据库 | 面向 Agent 工作流,可编程集成;价格更低 |
| rayliot/ai-researcher | 自动综述生成 | 可审计、可恢复、多 Agent 协同;LangGraph 状态管理更健壮 |
| TensorSea/medical知识代理 | 医学文献综述 | literature-review-agent 更通用,不限学科 |
核心差异:目前最完整的"检索—筛选—写作—审计"闭环开源方案,两个 Agent 独立可用,工作流状态持久化,适合严肃学术写作场景。
一句话推荐结论
如果你需要让 AI 写文献综述但又担心虚构参考文献和结构失控,literature-review-agent 是目前最完整的开源解决方案:Search 检索真实文献 + 用户控制证据 corpus + Review Agent 生成可审计综述,全程 LangGraph 状态管理可从任意步骤恢复。
来源:https://github.com/littlelelephant/literature-review-agent · README.md(EN + ZH-CN)· agents/literature-search/README.md · agents/literature-review/README.md · scripts/setup.sh / setup.ps1
不确定处:DeepSeek 模型版本(v3 / v2)未在文档中明确标注;MinerU API 的解析精度和费用结构未说明;长文本(>50篇文献)的 Review Agent 性能和 Token 消耗未提供基准数据;多轮迭代修订(用户反馈后重新生成)的具体命令接口未在 README 中完整描述