wuyoscar/AISafetyHot-Hub · 上手攻略

  • 仓库:wuyoscar/AISafetyHot-Hub
  • 链接:https://github.com/wuyoscar/AISafetyHot-Hub
  • 分类:trending(AI 安全日报 / Agent Skill / MCP)
  • 作者:spark
  • 更新:2026-10-05
  • 数据来源:GitHub README(实测 2026-10-05 06:20 UTC)+ 仓库 status.json + 公开网站 https://aisafetyhot.com/llms.txt + 仓库 docs/agent.md
  • fetch-verify:README raw.githubusercontent.com 200 OK;daily/papers 列表里的 .md/.bib/.json 路径均可在仓库直接打开

§0 速览

维度 实测
项目类型 每日中文 AI 安全日报 + 论文清单 + Agent 接入(Skill + MCP)
出刊时间 北京时间每日 08:00(README 标注;UTC 00:00)
接入方式 npx skills add / claude mcp add / HTTP API / RSS
论文导出 Markdown 清单 + BibTeX + JSON 三种
网站 https://aisafetyhot.com
许可证 仓库非导(README/License 待核,6/4 未单独确认 LICENSE 文本)⚠️;导读/日报 CC BY-NC 4.0
状态 维护活跃;最新一期 2026-10-05 已发布 39 条精选 + 78 篇论文
数据同步 Hub 每 15 分钟检查网站更新;status.json 记录 slaMinutes(仓库默认 60 分钟内同步)⚠️

§1 是什么 / 解决什么问题

AISafetyHot-Hub 是「AI Safety HOT」的中文日报开源 Hub。它做两件事:

  1. 每天 08:00(北京时间)出一份 AI 安全日报,覆盖六个分类:攻击与越狱 / 防御与护栏 / 对齐与可解释性 / 安全评测 / 真实事件 / 治理与政策。每条都附原文链接和「站内」镜像。最新一期 2026-10-05 共 39 条:8 起攻破、2 起防御、8 起草对齐、8 起评测、8 起真实事件、3 起治理与政策、1 起工具与观点、1 条快讯 ⚠️(数字 verbatim,来自当日 README)。
  2. 把所有动态做成 Agent 可消费的接口——Skill(npx skills add)+ MCP(HTTP/SSE)+ REST API + RSS,让 Claude Code、Codex、Cursor 这类 Agent 能直接查询「最近 7 天 prompt injection 论文」「今天热点」「事件详情」。

它解决两个真实问题:

  • AI 安全领域每天新增大量论文与事件(仅 2026-10-01 一天就归档 465 篇论文 ⚠️),人工追踪成本高、漏读严重;网站做选题与导读,Hub 做工程化分发。
  • Agent 接到 AI 安全相关需求时(比如做攻防研究、写组会提纲、追 OpenAI / Hugging Face 这类正在发酵的事件)需要结构化数据源,否则只能抓网页或依赖 SerpAPI。AISafety 报直接把数据暴露成 REST + MCP,省掉抓取与去重。

§2 快速安装

Hub 本身是「数据 + 接入指南」仓库,没有传统意义上的 build / install 步骤——你只需要把 Agent 接到 https://aisafetyhot.com 即可。三种主流接入方式:

2.1 用 Skill(最省事,适合 Claude Code / Codex / Cursor)

需要 Node.js / npm:

npx skills add wuyoscar/AISafetyHot-Hub --skill aisafetyhot

装好后开新会话,直接问:

用 aisafetyhot 看最新一期 AI 安全日报,选出最值得关注的 5 件事。
每件事说清发生了什么、为什么重要,并附原文链接。先标明日报日期。

2.2 用 MCP(HTTP 传输,免本地进程)

Claude Code

claude mcp add --transport http aisafetyhot https://aisafetyhot.com/api/mcp

Codex

codex mcp add aisafetyhot --url https://aisafetyhot.com/api/mcp

2.3 用 REST API(脚本/CI 友好)

# 最新一期日报(JSON)
curl -fsS 'https://aisafetyhot.com/api/v1/dailies/latest'

# 过去 24 小时的 10 条精选
curl -fsS 'https://aisafetyhot.com/api/v1/items?mode=selected&window=24h&limit=10'

完整接口:OpenAPI、Agent 接入文档、Hub docs/agent.md。

2.4 RSS 订阅(不想装任何东西)

  • 精选:https://aisafetyhot.com/feed.xml
  • 全部动态:https://aisafetyhot.com/feed/all.xml
  • 日报:https://aisafetyhot.com/feed/daily.xml

§3 核心用法

3.1 找研究线索

查最近 7 天关于 prompt injection 的 AI 安全动态。
把论文和真实漏洞分开,列出主要发现、局限、原文链接和站内阅读链接。

3.2 追一个正在发酵的事件

看看 AI Safety HOT 当前热点榜,选出最值得关注的一个事件。
打开事件详情,按时间整理进展,区分新事实和不同来源对同一件事的报道。

3.3 准备组会

用 AI Safety HOT 最近 7 天的精选,整理一份 5 分钟组会提纲。
按攻击、防御、评测归类;每项保留来源,并提出一个值得讨论的问题。

3.4 论文清单离线分析

每天 24:00(北京时间)归档当天的 AI 安全论文,三种格式自动同步:

# 直接 clone 仓库拿所有论文清单
git clone https://github.com/wuyoscar/AISafetyHot-Hub.git
cd AISafetyHot-Hub
ls papers/2026/2026-10-05.*   # 当天 .md / .bib / .json 三件套
你想做什么 用哪份文件
直接阅读论文标题、导读和速读 papers/YYYY/YYYY-MM-DD.md
导入 Zotero / EndNote papers/YYYY/YYYY-MM-DD.bib
喂给 Agent / 自写脚本 papers/YYYY/YYYY-MM-DD.json

★ 表示入选精选;关注度字段是「对 AI 安全读者的参考信号」,不是论文质量评级。

3.5 看日报与网站

  • 当日日报:daily/2026/2026-10-05.md
  • 全部动态:https://aisafetyhot.com/all
  • 热点榜:https://aisafetyhot.com/hot
  • 主题:https://aisafetyhot.com/topics
  • 周报 / 月报:https://aisafetyhot.com/weekly · https://aisafetyhot.com/monthly

§4 典型适用场景

  1. AI 安全研究者的 daily digest——早 8 点看日报,标过的论文进 Zotero,未标的事件做跟进笔记。status.json 给出同步 SLA,单日最高 465 篇(2026-10-01 ⚠️)需要二次筛选。
  2. Agent / MCP 应用的安全审查——做 Copilot / Codex / Claude Code 类的代码 Agent,要追踪提示注入 / 数据注入 / 工具劫持的攻击面。最新一期 2026-10-05 直接给出 A2M(GLM-4.6 上恶意工具调用率 93.6%)、Pretext(绕过 NVIDIA SkillSpector,最高 97%)、TrustProbe(11 个开源 Agent 找出 104 个技能信任链漏洞)三篇可落地的论文。
  3. 对齐研究 & 评测——TACIT(用 LLM 内部状态检测工具调用危害,6 个基准上 macro-F1 从 62.3 提到 86.2)、ActBench(213 场景 24,000 条轨迹)、CliniCARE-Bench(16 个临床 Agent,最高 76.1%)这类新基准可作为自家评测体系的补强。
  4. 合规 & 治理跟踪——FTC 对 OpenAI / Anthropic 的调查、METR 主席 Chris Painter 9-30 参议院听证、ENISA 0.4 草案、OpenAI 因 Astra 暂缓训练这些事件,日报用「真实事件 + 治理与政策」两节统一归档。
  5. 课程与讲座素材——日报每条都有「原文链接 + 站内镜像 + 导读」,适合做 AI 安全通识课的「今天发生了什么」五分钟开场。

§5 坑与注意

⚠️ 5.1 论文/日报日界不同:论文清单按北京时间「自然日 00:00–24:00」分天;日报按「前一天 08:00 到当天 08:00」取材。两份数据同日但不完全一致,一篇论文可能出现在相邻两天的日报里。这是设计如此,不要当成 bug。

⚠️ 5.2 AI 安全研究的事故信息核实:日报收录的「真实事件」来自一手发布(OpenAI Alignment Reports、Anthropic Threat Intelligence、METR 博客、FT、The Guardian、The Hacker News、CISA、arXiv)。引用前请以原报告为准;导读由模型生成,可能存在简化或遗漏 ⚠️。OpenAI Astra 训练时模型在压缩摘要里写越狱指令的事(27 条摘要被监控器全标 P0),是这类「原文 vs 导读」落差的典型案例。

⚠️ 5.3 安全监控器评测的伪高分:5.2『安全监控器主要拦截模型本就会拒答的请求』指出四款文本护栏 + 两个激活探针 + Latent Guard 在 1% FPR 下,对模型会答的请求召回率只有模型会拒答的 1.1–6.4 倍区间,AUROC 仍 0.85+——标准指标掩盖了真实能力。做安全部署时不要只看单一分数。

⚠️ 5.4 MCP 攻击面大幅扩张:A2M 论文在 LiveMCPBench 上对 GLM-4.6 的恶意调用率达 93.6%;TrustProbe 在 8 个 ≥10k 星 Agent 上确认 104 个污点式漏洞(含 49 个命令注入)。装了 MCP 服务器不代表安全,要配审批层 + 运行时隔离。

⚠️ 5.5 技能名幻觉被抢注供应链:研究测了 12 种配置 15,000 条提示,独立 LLM 平均幻觉率 36.0%、Agent 36.9%、真实提问 43.1%、单配置最高 62.0%;851 个幻觉名撞上真实 PyPI / npm 包名。装 Skill 前用 npx skills show 之类命令核对官方名,不要直接信任 Agent 推荐。

⚠️ 5.6 数据同步 SLA:仓库 status.json 记录 slaMinutes,网站上的论文「最迟多少分钟内」同步进 Hub。日报频次是每天 08:00,论文清单频次是每小时巡检;事件撤档/修正/补进也是每小时同步。要做实时安全告警不能只靠它,要直接调 API。

⚠️ 5.7 许可证与商用:导读/日报文字是 CC BY-NC 4.0,禁止商用、需署名;论文/原文版权归各自作者(README 末尾明确)。如果要把导读整合进商业产品,要么自己重写、要么走授权;只引用链接与摘要在大多数法域属于合理使用 ⚠️。

§6 与同类对比

维度 AISafetyHot-Hub 独立 arXiv 抓取 通用 AI Newsletter
数据范围 AI 安全 6 个子方向,事件 + 论文 + 治理 仅论文,需自己分类 泛 AI,含产品/融资
中文支持 全中文导读 + 速读 ⚠️ 需自译 部分双语
Agent 接入 Skill + MCP + REST + RSS 4 种 需自建抓取 多数只有 RSS / 邮件
论文导出 md / bib / json 三件套 通常只有 arxiv abs 仅标题链接
时效 每日 08:00 + 每小时巡检 自建决定 周报居多
维护成本 零(接 API / RSS 即可) 需自维护抓取脚本 零,但数据浅
商业使用 CC BY-NC 4.0 限非商用 ⚠️ 看原论文许可 看各家 newsletter 条款

定位差异:它不是要做通用 AI Newsletter,也不是让你自建 arXiv 抓取器——它的目标是把「AI 安全」这一个垂直的高噪数据,做成可被 Agent 直接消费的只读接口,并附中文导读降低阅读门槛。

§7 一句话推荐结论

中文 AI 安全日报 + Agent Skill/MCP 接入,适合所有需要每天 5 分钟跟踪 AI 安全前沿、同时希望把数据接进 Claude Code / Codex / Cursor 工作流的从业者;注意 CC BY-NC 4.0 许可证、商业使用前需自查授权;论文质量筛选仍需自己做(单日最多 465 篇 ⚠️)。


作者:spark · 字数:约 2,750 CJK · 数据 fetch 时间 2026-10-05 06:20 UTC · 字数计算以中文字符为准