Aryan-Pardeshi/DeepResearch_AI · 上手攻略

  • 仓库:Aryan-Pardeshi/DeepResearch_AI
  • 链接:https://github.com/Aryan-Pardeshi/DeepResearch_AI
  • 分类:AI 学术研究 / 多智能体工作流
  • 作者:Tom
  • 更新:2026-08-17

这是什么

DeepResearch_AI 是一个 AI 驱动的多智能体研究工作空间,基于 LangGraph + FastAPI 构建,支持两种研究模式:

  1. DeepSearch(快速模式):5 个 researcher agent 并行 fan-out + 聚合,约 1-2 分钟产出带引用的结构化网络研究报告
  2. Research Mode(深度模式):25 个 agent 分 8 阶段协作,支持 PRISMA 流程图、证据矩阵,可导出 PDF/DOCX,约 10-25 分钟写出一篇完整学术论文

两种模式共用一个 FastAPI 后端 + Vanilla JS 前端(无需构建工具),共享 LLM 层、checkpointer 和 SSE 流式传输。支持任意 OpenAI API 兼容的 LLM 端点(本地模型、云端模型均可)。


解决什么问题

学术研究人员在写文献综述或深度报告时面临几个痛点: - 信息碎片化:需要同时查 Tavily、OpenAlex、Semantic Scholar、arXiv 等多个来源 - 引用不可信:AI 生成的"参考文献"往往是幻觉 - 人工介入缺失:全自动流程无法在关键节点把控方向 - 论文写作缺乏规范:没有 PRISMA 流程、缺乏结构化方法论

DeepResearch_AI 用多 agent 流水线 + 4 个人工介入检查点(Research Mode)+ 可验证引用的学术 API 来解决这些问题。


快速安装

环境要求

  • Python 3.10+
  • Tavily API Key(DeepSearch 必需,Tavily 官网注册免费 tier 即可)
  • 学术 API(Research Mode 使用 OpenAlex、Semantic Scholar、arXiv、Unpaywall、PMC、CORE,部分免费)
  • 任意 OpenAI 兼容的 LLM 端点(OpenAI API、Azure OpenAI、Ollama、本地模型等)

安装步骤

# 克隆仓库
git clone https://github.com/Aryan-Pardeshi/DeepResearch_AI.git
cd DeepResearch_AI

# 安装依赖(建议使用虚拟环境)
python -m venv venv
source venv/bin/activate  # Windows: venv\Scripts\activate
pip install -r requirements.txt

# 设置环境变量
export OPENAI_API_KEY="your-openai-api-key"
export TAVILY_API_KEY="your-tavily-api-key"
# 如使用本地模型(如 Ollama):
export OPENAI_BASE_URL="http://localhost:11434/v1"
export OPENAI_MODEL="qwen2.5:14b"  # 替换为你的模型名

# 启动后端
uvicorn app.main:app --reload --port 8000

# 前端无需构建,直接在浏览器打开 static/index.html
# 或通过 uvicorn 的 static 路由访问

⚠️ 未在 requirements.txt 中找到明确的依赖声明(README 未完整列出),建议 pip install langgraph fastapi uvicorn aiohttp 等基础包,具体以仓库实际 requirements.txt 为准。


核心用法

模式一:DeepSearch(快速网络研究)

用户提交查询(含可选主题过滤:News / Academic / Finance / Patents)
    ↓
Query Validator 拒绝模糊查询(避免无意义 token 消耗)
    ↓
Planner 生成问题陈述 + 最多 5 个子任务
    ↓
🧑 用户审批计划(可要求重写)
    ↓
5 个 Researcher Agent 并行 fan-out(LangGraph Send() API)
    ↓
Aggregator 汇总所有发现
    ↓
📄 带引用的结构化 Markdown 报告 + .md 导出

示例 API 调用(通过 SSE 流式获取进度):

import httpx
import sseclient
import json

with httpx.stream("GET", "http://localhost:8000/api/deepsearch", params={"query": "LLM in healthcare"}, timeout=120) as r:
    for event in sseclient.EventSource(r.text).events():
        if event.data:
            data = json.loads(event.data)
            print(data)  # {'type': 'progress', 'stage': 'researchers', 'done': 2/5}
            if data.get('type') == 'result':
                print(data['report'])  # 最终报告

模式二:Research Mode(完整学术论文)

Checkpoint 1(🧑 用户审批):研究范围定义 + 关键词
    ↓
Checkpoint 2(🧑 用户审批):文献语料、综述与理论框架
    ↓
Checkpoint 3(🧑 用户审批):研究假设
    ↓
Checkpoint 4(🧑 用户审批):方法论
    ↓
25 个 Agent 在 8 个阶段中协作
    ↓
输出:论文 + PRISMA 流程图 + 证据矩阵
    ↓
导出为 PDF / DOCX

LLM 配置(使用本地模型)

# Ollama 示例(本地开源模型)
export OPENAI_BASE_URL="http://localhost:11434/v1"
export OPENAI_MODEL="llama3.1:8b"  # 或 qwen2.5:14b 等

# Azure OpenAI 示例
export OPENAI_API_KEY="your-azure-key"
export OPENAI_BASE_URL="https://your-resource.openai.azure.com/v1"
export OPENAI_MODEL="gpt-4o"

典型适用场景

  1. 文献综述加速:DeepSearch 模式 1-2 分钟即可获得某主题的引用报告,比手动检索快数倍
  2. 学术论文初稿:Research Mode 产出带 PRISMA 和证据矩阵的完整论文框架,人工审批后完善
  3. 竞品/市场研究:DeepSearch 抓取多个来源,聚合结构化洞察
  4. 本地模型优先:不想把数据发送到第三方,配置 Ollama 或本地 LLM 使用
  5. 教学/演示:25 agent 流水线清晰可见,适合了解 LangGraph 多阶段工作流

坑与注意

说明
冷启动慢 Demo 部署在 Render 免费版,空闲后首次请求约 50 秒冷启动
Tavily API 费用 DeepSearch 依赖 Tavily,免费 tier 有请求限制,高频使用需付费
引用准确性 幻觉引用仍有极小概率出现,建议对关键文献手动核实
requirements.txt 缺失 ⚠️ README 未完整列出 Python 依赖,需自行补充 langgraph / fastapi 等核心包
Research Mode 耗时长 25 agent × 8 阶段可能跑 10-25 分钟,免费 LLM 配额消耗较快
SQLite 缓存 使用本地 SQLite 缓存 LLM 响应,清理缓存需手动删除 cache.db
论文导出依赖 PDF/DOCX 导出可能需要 pandoc 或 weasyprint(⚠️ 未实测确认)

与同类对比

项目 Agent 数量 学术深度 HITL 检查点 引用来源 部署难度
DeepResearch_AI 5 / 25(双模式) 高(PRISMA + 证据矩阵) 1 或 4 Tavily + 学术 API
GPT-4o research(Bing) 1 网络搜索
Perplexity AI 1 网络搜索
Semantic Scholar API + LLM 需自建 自定义 学术文献
auto-crew / OpenManus 多 agent 自定义

DeepResearch_AI 的核心差异化:多 agent fan-out + 4 个人工介入检查点 + 学术级引用验证,同类产品中少有在同一个界面同时提供快速研究和深度论文写作的组合。


一句话推荐结论

需要快速产出引用扎实的网络研究报告,或想让 AI 在人工把关下写学术论文框架,DeepResearch_AI 是目前开源领域上手最简单、流水线最完整的方案之一;追求极致论文质量仍建议以 AI 草稿 + 人工精修为佳。