Ar9av/PaperOrchestra · 上手攻略
- 仓库:Ar9av/PaperOrchestra
- 链接:https://github.com/Ar9av/PaperOrchestra
- 分类:academic-writing
- 作者:Tom
- 更新:2026-08-16
这是什么
PaperOrchestra 是 Google 研究团队(Song et al., 2026)提出的一种多智能体学术论文写作框架(arXiv:2604.05018),其核心思路是用 5 个专责 Agent 流水线协作,把零散的研究材料(想法、实验记录、图表)转化为可直接投稿的 LaTeX 论文。
Ar9av/PaperOrchestra 则是将这篇论文的实现(Pipeline 提示词、JSON Schema、验证规则)封装为一套即插即用的 Claude Code / Cursor / Cline 等编码 Agent 技能包,让 AI 编程助手在本地直接运行完整的多智能体论文写作流水线。
核心理念:技能包里没有 API Key、没有 SDK、没有内置 LLM 调用——所有推理、搜索、LaTeX 编译都委托给宿主 Agent(Claude Code 等)自行完成。你只需要配置好技能链接,给 Agent 一个方向,它就能端到端跑完整套 Pipeline。
解决什么问题
| 痛点 | PaperOrchestra 解决方案 |
|---|---|
| 单 Agent 写论文质量差(句式模板化、引用不实) | 五 Agent 流水线,专员专责(大纲→绘图→文献→撰写→精修) |
| 文献调研质量低(引用虚假或过旧) | literature-review-agent 用 Levenshtein 相似度 >70 + Semantic Scholar 验证 |
| 图表绘制与正文脱节 | plotting-agent 生成所有图表并配 caption,再由 section-writing-agent 整合 |
| 缺乏 halt rule,Agent 无限制生成 | content-refinement-agent 有严格的接受/回退 halt 规则,防止无限循环 |
| 写完不知质量几何 | 内置 paper-autoraters 自动跑 Citation F1、LitReview 6 轴质量评分 |
快速安装
环境要求
- Node.js / Python 环境(用于运行 skill 脚本)
- Claude Code / Cursor / Antigravity / Cline / Aider / OpenCode 任一编码 Agent(用于承载 LLM 调用)
git clone和基本的终端操作能力
安装步骤
# 1. 克隆仓库
git clone https://github.com/Ar9av/PaperOrchestra.git ~/paper-orchestra
cd ~/paper-orchestra
# 2. 安装 Python 依赖(仅用于确定性脚本,无 LLM 调用)
pip install -r requirements.txt
# 3. 为 Claude Code 创建 skills 目录并软链接(以 paper-orchestra 为例)
mkdir -p ~/.claude/skills
for s in paper-orchestra outline-agent plotting-agent literature-review-agent \
section-writing-agent content-refinement-agent paper-writing-bench \
paper-autoraters agent-research-aggregator; do
ln -sf ~/paper-orchestra/skills/$s ~/.claude/skills/$s
done
其他 Agent:Cursor / Antigravity / Cline / Aider 的安装方式见
skills/paper-orchestra/references/host-integration.md。
核心用法
Pipeline 五步流程
Step 1: Outline ──▶ outline.json (1 次 LLM 调用)
Step 2: Plotting ─┐ (~20-30 次 LLM 调用)
Step 3: Lit Review ┘ (并行) (~20-30 次 LLM 调用)
intro_relwork.tex + refs.bib
Step 4: Section Writing ──▶ drafts/paper.tex (1 次多模态调用)
Step 5: Content Refine ──▶ final/paper.tex (~5-7 次调用,~3 轮)
⚠️ 注意:Step 2 和 Step 3 互相独立,Claude Code 支持并行 sub-agent 时务必并行运行以节省时间。
标准使用方式(直接告诉 Agent)
"用 PaperOrchestra 把我最近的实验写成论文"
"用 paper-orchestra 从我的 idea.md 和实验日志生成会议论文"
"run paper-orchestra on my research folder"
完整手动协议(可选分步执行)
Step 0:准备输入文件
# 脚手架创建工作区
python skills/paper-orchestra/scripts/init_workspace.py --out workspace/
# 用户自行准备以下文件放入 workspace/inputs/:
# - idea.md (必填)想法摘要(Sparse 或 Dense 格式)
# - experimental_log.md (必填)实验日志(含原始数据、观察)
# - template.tex (必填)目标会议 LaTeX 模板
# - conference_guidelines.md(必填)格式规则、页数限制
# - figures/ (可选)预有图表,空则自动生成
Step 1-5:运行验证与执行
# 验证输入文件
python skills/paper-orchestra/scripts/validate_inputs.py --workspace workspace/
# 检查 idea 密度
python skills/paper-orchestra/scripts/check_idea_density.py \
--idea workspace/inputs/idea.md \
--log workspace/inputs/experimental_log.md
# 交叉验证 idea 与实验日志一致性(仅警告,不阻断)
python skills/paper-orchestra/scripts/validate_consistency.py \
--idea workspace/inputs/idea.md \
--log workspace/inputs/experimental_log.md
# 运行 pipeline(告诉 Agent 执行 paper-orchestra skill)
可选:agent-research-aggregator(如果你是用 AI 编码 Agent 做实验)
如果你的实验记录分散在 Claude Code / Cursor 等 Agent 的缓存中,先运行聚合器提取结构化输入:
python skills/agent-research-aggregator/scripts/discover_logs.py \
--search-roots . \
--agents claude \
--out workspace/ara/discovered_logs.json
python skills/agent-research-aggregator/scripts/format_po_inputs.py \
--synthesis workspace/ara/synthesis.json \
--out workspace/inputs/ \
--report workspace/ara/aggregation_report.md
典型适用场景
✅ 非常适合
- AI/ML 会议论文(NeurIPS/ICML/ICLR 等):有明确 LaTeX 模板,Pipeline 天然适配
- 实验记录已有但未整理成文:agent-research-aggregator 自动从 Agent 缓存提取
- 需要高质量文献综述:literature-review-agent 有语义验证机制,引用可信度较高
- 多图表实验论文:plotting-agent 生成 fig+caption,section-writing-agent 统一整合
⚠️ 不适合
- 非 AI/ML 领域的论文(目前 skill 针对 LaTeX 学术论文场景高度定制)
- 完全没有实验数据或 idea 的空壳写作(Pipeline 需要 idea.md 和 experimental_log.md 有实质内容)
- 不熟悉 Claude Code 等 Agent 的用户(需要能够与 Agent 对话并管理文件系统)
坑与注意
-
anti-leakage prompt 必须应用:在所有生成论文内容的 LLM 调用前,必须在系统提示词前加上
references/anti-leakage-prompt.md的内容(来自论文 Appendix D.4),以防止预训练数据泄露影响评估公平性。 -
idea 和 experimental_log 质量决定输出质量:如果输入只有一句话,Pipeline 输出也会是一篇空洞论文。确保
idea.md包含核心贡献点,experimental_log.md包含真实数值数据。 -
Step 2/3 的 ~20-30 次 LLM 调用成本可观:literature-review-agent 会多次调用 Semantic Scholar API(注意速率限制),plotting-agent 会生成多个图表。如果预算紧张,考虑减少绘图数量或使用更便宜的模型跑草稿轮次。
-
** halt rule 严格,不允许"凑字数"**:
content-refinement-agent的 halt 规则会拒绝不符合质量标准的输出,即使 Agent 想生成更多内容也会被阻止——这是好事,但也意味着你需要确保输入内容足够充实。 -
LaTeX 模板需用户自行准备:Pipeline 不会为你创建论文模板,需要从目标会议官网下载官方模板放入
workspace/inputs/template.tex。 -
❓ 版本信息未在 README 明确标注:建议 clone 后查看
requirements.txt确认具体依赖版本。
与同类对比
| 工具 | 平台 | 多 Agent | 引用验证 | 内置 Benchmark | 技能包形式 |
|---|---|---|---|---|---|
| PaperOrchestra | Claude Code 等 | ✅ 5 Agent 流水线 | ✅ Levenshtein+SemScholar | ✅ PaperWritingBench | ✅ 即插即用 skill |
| PaperOrchestra 原论文 | 通用 | ✅ | ✅ | ✅ | ❌ 纯论文 |
| 通用 AI(ChatGPT) | 跨平台 | ❌ | ❌ | ❌ | ❌ |
| Abnerla/AI_paper | Windows 桌面 | ❌ | ❌ | ❌ | ❌ 桌面应用 |
PaperOrchestra 的差异化在于:Google 论文背书的五 Agent 流水线 + 即插即用的 Claude Code skill + 内置 autorater 质量评估,是目前将多 Agent 论文写作工程化程度最高的开源方案之一。
一句话推荐结论
如果你用 Claude Code(或其他编码 Agent)做 AI/ML 实验,希望把零散的实验记录直接转化为高质量 LaTeX 会议论文,PaperOrchestra skill 包是目前将 Google 原论文流水线工程化得最完整、拿来即用的方案——输入准备好,它就能跑完整套 Pipeline;但 idea 和实验数据的质量才是决定输出上限的关键。