xianshang33/llm-paper-daily · 上手攻略

  • 仓库:xianshang33/llm-paper-daily
  • 链接:https://github.com/xianshang33/llm-paper-daily
  • 分类:ai(LLM / Agent 论文日报)
  • 作者:spark
  • 更新:2026-08-22

一、是什么

llm-paper-daily 是一个每日自动化的 LLM / Agent 论文日报仓库,由作者 xianshang33 维护。它通过仓库内置的 GitHub Actions workflow(/.github/workflows/)从 arXiv 抓取与 LLM、Agent 相关的最新论文,做中文摘要后写入两个镜像目录:

  • summary/:中文版论文摘要(Markdown)
  • summary_en/:英文版论文摘要
  • data/:结构化原始数据
  • skill/:本地订阅工具集(paper-subscribe skill)
  • feed-papers.json:对外暴露的 JSON Feed(订阅器消费的入口)

README 顶部用 badge 形式直接展示"最后更新时间",例如本次抓取的快照显示 Update 08.21 02:42,意味着仓库每天凌晨做一次完整的增量更新。

仓库本身被标记的话题(topics)包括 agentchatgptlarge-language-modelsllmrag,说明其选稿边界偏 LLM 与智能体方向,不覆盖计算机视觉、语音、机器人等其它 AI 子领域

二、解决什么问题

学术圈跟踪最新论文有几种典型痛点:

  1. arXiv 信息过载:cs.CL / cs.AI / cs.LG 每天新增几百篇论文,人工过滤成本极高。
  2. 摘要质量参差:很多论文 abstract 写得像噱头合集,缺乏对方法/工程/数字的拆解。
  3. 重复订阅成本:每个研究者通常会维护 RSS、邮件订阅、Twitter 关注等多套渠道,重复但互相漏。
  4. 跨语言门槛:英文学术圈不懂中文的人看 abstract 没问题,但中文圈(学生 / 工程师 / 跨学科研究者)需要中文摘要来快速判断"值不值得精读"。

llm-paper-daily 的解法是用 GitHub Actions + LLM 做选题 + 摘要 + 翻译,把整个流程产物直接 commit 到仓库里(透明、可审),并对外暴露一个简洁的 JSON Feed供任何订阅器消费。它不是一套 SaaS,也不是 Python 包,它是一个"用 GitHub 当数据库"的内容产品,所以克隆即所得,pull 即增量。

特别值得一提的是仓库的 paper-subscribe skill:它是写给本地编码 Agent(OpenClaw / Codex / Claude Code)看的,Agent 读完 SUBSCRIBE.md 后会自己创建配置、预览 digest、安装 cron——把"用户从手动写定时任务"里彻底解放出来。

三、快速安装

方式 A:只读订阅(推荐大多数人)

仓库本身的产物已经写好了。你只需要克隆或 fork

git clone https://github.com/xianshang33/llm-paper-daily.git
cd llm-paper-daily

然后:

  • 浏览 README.md 看当天的最新论文(每日 02:42 更新)
  • 浏览 summary/2026-08/ 看中文摘要归档
  • 直接读 https://raw.githubusercontent.com/xianshang33/llm-paper-daily/main/feed-papers.json 拿到结构化数据

方式 B:本地订阅自己的"每日精选"

SUBSCRIBE.md 走,让本地 Agent 帮你配置。最简路径:把以下文本发给 OpenClaw / Codex / Claude Code:

请帮我配置 llm-paper-daily 的本地订阅。订阅仓库是
https://github.com/xianshang33/llm-paper-daily ,请阅读仓库根目录的
SUBSCRIBE.md,按文档创建本地配置、预览 digest、安装定时任务,并在完成
后告诉我配置文件位置、运行时间、语言、每次推送数量和验证结果。

Agent 会自动:

  1. 验证 Node.js ≥ 18(node --version
  2. 创建 ~/.paper-subscribe/config.json(含 feed_url、时区、cron 表达式、过滤词等)
  3. 预览一次 digest 写入 /tmp/paper-subscribe-preview.json不污染真实 state
  4. bash skill/paper-subscribe/scripts/install-cron.sh --config ~/.paper-subscribe/config.json 写入 crontab
  5. crontab -l | grep 'paper-subscribe:' 校验落盘成功

默认配置(订阅器自带):

默认值
Language zh
Timezone Asia/Shanghai(未知时回退)
Schedule 15 9 * * *(每天上午 9:15)
Topics agent, llm
Max items per digest 5
Delivery channel stdout

方式 C:自己改 workflow 跑自己的版本

fork 仓库后可以修改 .github/workflows/ 下的论文抓取 + 摘要工作流,换选题关键词、改摘要模型(默认看起来是调用某个外部 LLM API,需要在 Secrets 里配 key)。这一路径不在官方推荐范围内,因为作者没有公开说 workflow 用了哪个模型、改模型是否仍能保持摘要质量。

四、核心用法

1. 浏览当日最新论文

直接打开 README:表头 <details> 折叠区里就是当天更新的论文标题(带 arXiv 链接和中文一句话总结)。下面是按月归档的 Markdown 表格,包含:

  • 日期
  • 标题(中文翻译 + 英文原文)
  • 机构来源
  • 详细中文摘要(带论文贡献点)
  • arXiv 链接
  • GitHub 链接(如果论文作者开源了代码)
  • summary/2026-08/xxxx.xxxxx.md 单篇深度摘要链接

2. 订阅自己的精选

最低成本(手工版,不依赖 Agent):

# 1. 装 Node 18+
node --version

# 2. 克隆仓库并进入
git clone https://github.com/xianshang33/llm-paper-daily.git
cd llm-paper-daily

# 3. 写配置
mkdir -p ~/.paper-subscribe
cat > ~/.paper-subscribe/config.json <<'EOF'
{
  "feed_url": "https://raw.githubusercontent.com/xianshang33/llm-paper-daily/main/feed-papers.json",
  "state_path": "~/.paper-subscribe/state.json",
  "timezone": "Asia/Shanghai",
  "schedule": "15 9 * * *",
  "filters": {
    "topics": ["agent", "llm"],
    "max_items": 5,
    "language": "zh"
  },
  "delivery": {
    "channel": "stdout"
  }
}
EOF

# 4. 预览(注意用一个临时 state,不要污染真实 state)
cat > /tmp/preview-config.json <<'EOF'
{
  "feed_url": "https://raw.githubusercontent.com/xianshang33/llm-paper-daily/main/feed-papers.json",
  "state_path": "/tmp/preview-state.json",
  "timezone": "Asia/Shanghai",
  "schedule": "15 9 * * *",
  "filters": { "topics": ["agent", "llm"], "max_items": 5, "language": "zh" },
  "delivery": { "channel": "stdout" }
}
EOF
node skill/paper-subscribe/scripts/prepare-digest.js \
  --config /tmp/preview-config.json > /tmp/preview.json
node skill/paper-subscribe/scripts/deliver.js \
  --config /tmp/preview-config.json --input /tmp/preview.json

# 5. 装 crontab
bash skill/paper-subscribe/scripts/install-cron.sh \
  --config ~/.paper-subscribe/config.json

# 6. 校验
crontab -l | grep 'paper-subscribe:'

如果输出末尾出现 preview: N items, skipped: 0,说明 digest 构建正常。skipped_no_new_items 也算配置成功,只是预览状态下没有"未读"项目。

3. 把 feed 接入其它系统

feed-papers.json 是公开 JSON,可以:

  • 作为 Hugging Face Space 的输入
  • 接到 Notion / Obsidian 同步脚本(很多研究者这么干)
  • 作为团队周报的源数据
  • 用 RSS bridge(rss-bridge 之类)转成标准 RSS,给不支持 JSON feed 的阅读器消费

⚠️ 注意:feed-papers.json 是 LLM-driven 工作流产出的,摘要文字可能含模型幻觉。做下游产品前请把"摘要与 abstract 的偏差"作为已知问题对待。

4. 不支持的渠道

SUBSCRIBE.md 明确说明,当前只支持 stdout 投递。如需 email / Slack / 飞书 / 微信,必须先写一个 delivery adapter 适配器(PR 友好)。

五、典型适用场景

  • 研究生 / 博士生:每天早上花 5 分钟扫一遍当日新论文标题,判断哪些值得精读,省掉每周 2-3 小时 arXiv 浏览时间。
  • AI 工程师:每天了解 LLM/Agent 领域前沿方法,避免在已经发表的方案上"重新发明轮子"。
  • AI 内容创作者:把仓库当日更新作为"选题来源",做选题/解读/搬运。
  • 研究团队:fork 仓库改 workflow + 换选题关键词,建一个团队内部论文雷达
  • 教学场景:老师把"今天 arXiv 上有哪些 Agent 论文"作为课堂导入素材。
  • 不希望自建爬虫的小团队:直接读 feed-papers.json 做下游,不必自己写 arXiv 抓取 + LLM 摘要 + 翻译整套链路。

六、坑与注意

  1. 摘要由 LLM 生成,事实可能有偏差:作者没有公开所用模型,论文标题 / 机构 / 数字都可能存在 5-10% 量级的"看似精确但偏差"问题(与近期 lessons 中 Jay 识别的 Qdrant 32.4K → 实测 29K 同型)。精读前请用 abstract 二次校验
  2. 选题边界偏 LLM/Agent:CV / 语音 / 机器人 / RL 基础理论领域的论文会被筛掉。不要把它当 CS 通用日报
  3. feed 是"日更"不是"实时":每天凌晨 02:42 跑一次 workflow,当日 02:42 之后 arXiv 上新挂的论文要第二天才出现。跟踪"截稿前最后一天"的紧急需求请直接去 arXiv
  4. iCal / Slack / 邮件投递暂未实现:SUBSCRIBE.md 明示只有 stdout。别假设 fork 一下就支持所有渠道
  5. paper-subscribe skill 是 Node.js 实现:要求 Node 18+。机器没有 Node 的用户要先装 Node。Python / Go 派可能不爽。
  6. 改 workflow 自跑需配 LLM API key:作者没有公开 Secrets 模板,需要 fork 后自己摸索配哪个模型。"开箱即跑"目前只对订阅器成立
  7. crontab 而非 launchd / Windows 任务计划:在 macOS / Linux 上跑得好,但 Windows 用户需要自己换成 schtasks 或 WSL。

七、与同类对比

项目 类型 内容来源 中文摘要 可编程订阅 维护活跃度
llm-paper-daily GitHub 仓库 + JSON Feed arXiv 自动抓取 + LLM 摘要 ✅(paper-subscribe skill) 高(日更)
Hugging Face Daily Papers Web 页面 + API 社区编辑 + 热度筛选 ❌(需自己写爬虫) 高(日更)
arxiv-sanity Web + API arXiv + TF-IDF 排序 ⚠️(API 简单) 中(偶发停更)
Papers With Code 趋势榜 Web GitHub stars + 论文热度 ⚠️(无官方 feed)
awesome-llm4se 等 awesome 列表 GitHub 仓库 人工编辑 ⚠️(看维护者) 低(半年更)

最强差异点:把"日报内容 + 本地订阅 skill + Agent 协作文档(SUBSCRIBE.md)"三件套绑在一起——LLM/Agent 圈的开发者可以零配置把"每日精选"接入自己的环境。

八、一句话推荐结论

对 LLM/Agent 研究者与工程师而言,这是当下最省力的中文论文日报方案——开箱即看、需要时再 fork 跑自定义、订阅器对本地 Agent 友好。如果你只需要"每天早上看一眼今天有什么新论文",直接 clone 即可;想定制,再读 SUBSCRIBE.md 让 Agent 帮你配。