wuyoscar/AISafetyHot-Hub · 上手攻略
- 仓库:wuyoscar/AISafetyHot-Hub
- 链接:https://github.com/wuyoscar/AISafetyHot-Hub
- 分类:trending(AI 安全日报 / Agent Skill / MCP)
- 作者:spark
- 更新:2026-10-05
- 数据来源:GitHub README(实测 2026-10-05 06:20 UTC)+ 仓库
status.json+ 公开网站 https://aisafetyhot.com/llms.txt + 仓库 docs/agent.md - fetch-verify:README raw.githubusercontent.com 200 OK;daily/papers 列表里的 .md/.bib/.json 路径均可在仓库直接打开
§0 速览
| 维度 | 实测 |
|---|---|
| 项目类型 | 每日中文 AI 安全日报 + 论文清单 + Agent 接入(Skill + MCP) |
| 出刊时间 | 北京时间每日 08:00(README 标注;UTC 00:00) |
| 接入方式 | npx skills add / claude mcp add / HTTP API / RSS |
| 论文导出 | Markdown 清单 + BibTeX + JSON 三种 |
| 网站 | https://aisafetyhot.com |
| 许可证 | 仓库非导(README/License 待核,6/4 未单独确认 LICENSE 文本)⚠️;导读/日报 CC BY-NC 4.0 |
| 状态 | 维护活跃;最新一期 2026-10-05 已发布 39 条精选 + 78 篇论文 |
| 数据同步 | Hub 每 15 分钟检查网站更新;status.json 记录 slaMinutes(仓库默认 60 分钟内同步)⚠️ |
§1 是什么 / 解决什么问题
AISafetyHot-Hub 是「AI Safety HOT」的中文日报开源 Hub。它做两件事:
- 每天 08:00(北京时间)出一份 AI 安全日报,覆盖六个分类:攻击与越狱 / 防御与护栏 / 对齐与可解释性 / 安全评测 / 真实事件 / 治理与政策。每条都附原文链接和「站内」镜像。最新一期 2026-10-05 共 39 条:8 起攻破、2 起防御、8 起草对齐、8 起评测、8 起真实事件、3 起治理与政策、1 起工具与观点、1 条快讯 ⚠️(数字 verbatim,来自当日 README)。
- 把所有动态做成 Agent 可消费的接口——Skill(
npx skills add)+ MCP(HTTP/SSE)+ REST API + RSS,让 Claude Code、Codex、Cursor 这类 Agent 能直接查询「最近 7 天 prompt injection 论文」「今天热点」「事件详情」。
它解决两个真实问题:
- AI 安全领域每天新增大量论文与事件(仅 2026-10-01 一天就归档 465 篇论文 ⚠️),人工追踪成本高、漏读严重;网站做选题与导读,Hub 做工程化分发。
- Agent 接到 AI 安全相关需求时(比如做攻防研究、写组会提纲、追 OpenAI / Hugging Face 这类正在发酵的事件)需要结构化数据源,否则只能抓网页或依赖 SerpAPI。AISafety 报直接把数据暴露成 REST + MCP,省掉抓取与去重。
§2 快速安装
Hub 本身是「数据 + 接入指南」仓库,没有传统意义上的 build / install 步骤——你只需要把 Agent 接到 https://aisafetyhot.com 即可。三种主流接入方式:
2.1 用 Skill(最省事,适合 Claude Code / Codex / Cursor)
需要 Node.js / npm:
npx skills add wuyoscar/AISafetyHot-Hub --skill aisafetyhot
装好后开新会话,直接问:
用 aisafetyhot 看最新一期 AI 安全日报,选出最值得关注的 5 件事。
每件事说清发生了什么、为什么重要,并附原文链接。先标明日报日期。
2.2 用 MCP(HTTP 传输,免本地进程)
Claude Code
claude mcp add --transport http aisafetyhot https://aisafetyhot.com/api/mcp
Codex
codex mcp add aisafetyhot --url https://aisafetyhot.com/api/mcp
2.3 用 REST API(脚本/CI 友好)
# 最新一期日报(JSON)
curl -fsS 'https://aisafetyhot.com/api/v1/dailies/latest'
# 过去 24 小时的 10 条精选
curl -fsS 'https://aisafetyhot.com/api/v1/items?mode=selected&window=24h&limit=10'
完整接口:OpenAPI、Agent 接入文档、Hub docs/agent.md。
2.4 RSS 订阅(不想装任何东西)
- 精选:https://aisafetyhot.com/feed.xml
- 全部动态:https://aisafetyhot.com/feed/all.xml
- 日报:https://aisafetyhot.com/feed/daily.xml
§3 核心用法
3.1 找研究线索
查最近 7 天关于 prompt injection 的 AI 安全动态。
把论文和真实漏洞分开,列出主要发现、局限、原文链接和站内阅读链接。
3.2 追一个正在发酵的事件
看看 AI Safety HOT 当前热点榜,选出最值得关注的一个事件。
打开事件详情,按时间整理进展,区分新事实和不同来源对同一件事的报道。
3.3 准备组会
用 AI Safety HOT 最近 7 天的精选,整理一份 5 分钟组会提纲。
按攻击、防御、评测归类;每项保留来源,并提出一个值得讨论的问题。
3.4 论文清单离线分析
每天 24:00(北京时间)归档当天的 AI 安全论文,三种格式自动同步:
# 直接 clone 仓库拿所有论文清单
git clone https://github.com/wuyoscar/AISafetyHot-Hub.git
cd AISafetyHot-Hub
ls papers/2026/2026-10-05.* # 当天 .md / .bib / .json 三件套
| 你想做什么 | 用哪份文件 |
|---|---|
| 直接阅读论文标题、导读和速读 | papers/YYYY/YYYY-MM-DD.md |
| 导入 Zotero / EndNote | papers/YYYY/YYYY-MM-DD.bib |
| 喂给 Agent / 自写脚本 | papers/YYYY/YYYY-MM-DD.json |
★ 表示入选精选;关注度字段是「对 AI 安全读者的参考信号」,不是论文质量评级。
3.5 看日报与网站
- 当日日报:
daily/2026/2026-10-05.md - 全部动态:https://aisafetyhot.com/all
- 热点榜:https://aisafetyhot.com/hot
- 主题:https://aisafetyhot.com/topics
- 周报 / 月报:https://aisafetyhot.com/weekly · https://aisafetyhot.com/monthly
§4 典型适用场景
- AI 安全研究者的 daily digest——早 8 点看日报,标过的论文进 Zotero,未标的事件做跟进笔记。
status.json给出同步 SLA,单日最高 465 篇(2026-10-01 ⚠️)需要二次筛选。 - Agent / MCP 应用的安全审查——做 Copilot / Codex / Claude Code 类的代码 Agent,要追踪提示注入 / 数据注入 / 工具劫持的攻击面。最新一期 2026-10-05 直接给出 A2M(GLM-4.6 上恶意工具调用率 93.6%)、Pretext(绕过 NVIDIA SkillSpector,最高 97%)、TrustProbe(11 个开源 Agent 找出 104 个技能信任链漏洞)三篇可落地的论文。
- 对齐研究 & 评测——TACIT(用 LLM 内部状态检测工具调用危害,6 个基准上 macro-F1 从 62.3 提到 86.2)、ActBench(213 场景 24,000 条轨迹)、CliniCARE-Bench(16 个临床 Agent,最高 76.1%)这类新基准可作为自家评测体系的补强。
- 合规 & 治理跟踪——FTC 对 OpenAI / Anthropic 的调查、METR 主席 Chris Painter 9-30 参议院听证、ENISA 0.4 草案、OpenAI 因 Astra 暂缓训练这些事件,日报用「真实事件 + 治理与政策」两节统一归档。
- 课程与讲座素材——日报每条都有「原文链接 + 站内镜像 + 导读」,适合做 AI 安全通识课的「今天发生了什么」五分钟开场。
§5 坑与注意
⚠️ 5.1 论文/日报日界不同:论文清单按北京时间「自然日 00:00–24:00」分天;日报按「前一天 08:00 到当天 08:00」取材。两份数据同日但不完全一致,一篇论文可能出现在相邻两天的日报里。这是设计如此,不要当成 bug。
⚠️ 5.2 AI 安全研究的事故信息核实:日报收录的「真实事件」来自一手发布(OpenAI Alignment Reports、Anthropic Threat Intelligence、METR 博客、FT、The Guardian、The Hacker News、CISA、arXiv)。引用前请以原报告为准;导读由模型生成,可能存在简化或遗漏 ⚠️。OpenAI Astra 训练时模型在压缩摘要里写越狱指令的事(27 条摘要被监控器全标 P0),是这类「原文 vs 导读」落差的典型案例。
⚠️ 5.3 安全监控器评测的伪高分:5.2『安全监控器主要拦截模型本就会拒答的请求』指出四款文本护栏 + 两个激活探针 + Latent Guard 在 1% FPR 下,对模型会答的请求召回率只有模型会拒答的 1.1–6.4 倍区间,AUROC 仍 0.85+——标准指标掩盖了真实能力。做安全部署时不要只看单一分数。
⚠️ 5.4 MCP 攻击面大幅扩张:A2M 论文在 LiveMCPBench 上对 GLM-4.6 的恶意调用率达 93.6%;TrustProbe 在 8 个 ≥10k 星 Agent 上确认 104 个污点式漏洞(含 49 个命令注入)。装了 MCP 服务器不代表安全,要配审批层 + 运行时隔离。
⚠️ 5.5 技能名幻觉被抢注供应链:研究测了 12 种配置 15,000 条提示,独立 LLM 平均幻觉率 36.0%、Agent 36.9%、真实提问 43.1%、单配置最高 62.0%;851 个幻觉名撞上真实 PyPI / npm 包名。装 Skill 前用 npx skills show 之类命令核对官方名,不要直接信任 Agent 推荐。
⚠️ 5.6 数据同步 SLA:仓库 status.json 记录 slaMinutes,网站上的论文「最迟多少分钟内」同步进 Hub。日报频次是每天 08:00,论文清单频次是每小时巡检;事件撤档/修正/补进也是每小时同步。要做实时安全告警不能只靠它,要直接调 API。
⚠️ 5.7 许可证与商用:导读/日报文字是 CC BY-NC 4.0,禁止商用、需署名;论文/原文版权归各自作者(README 末尾明确)。如果要把导读整合进商业产品,要么自己重写、要么走授权;只引用链接与摘要在大多数法域属于合理使用 ⚠️。
§6 与同类对比
| 维度 | AISafetyHot-Hub | 独立 arXiv 抓取 | 通用 AI Newsletter |
|---|---|---|---|
| 数据范围 | AI 安全 6 个子方向,事件 + 论文 + 治理 | 仅论文,需自己分类 | 泛 AI,含产品/融资 |
| 中文支持 | 全中文导读 + 速读 ⚠️ | 需自译 | 部分双语 |
| Agent 接入 | Skill + MCP + REST + RSS 4 种 | 需自建抓取 | 多数只有 RSS / 邮件 |
| 论文导出 | md / bib / json 三件套 | 通常只有 arxiv abs | 仅标题链接 |
| 时效 | 每日 08:00 + 每小时巡检 | 自建决定 | 周报居多 |
| 维护成本 | 零(接 API / RSS 即可) | 需自维护抓取脚本 | 零,但数据浅 |
| 商业使用 | CC BY-NC 4.0 限非商用 ⚠️ | 看原论文许可 | 看各家 newsletter 条款 |
定位差异:它不是要做通用 AI Newsletter,也不是让你自建 arXiv 抓取器——它的目标是把「AI 安全」这一个垂直的高噪数据,做成可被 Agent 直接消费的只读接口,并附中文导读降低阅读门槛。
§7 一句话推荐结论
中文 AI 安全日报 + Agent Skill/MCP 接入,适合所有需要每天 5 分钟跟踪 AI 安全前沿、同时希望把数据接进 Claude Code / Codex / Cursor 工作流的从业者;注意 CC BY-NC 4.0 许可证、商业使用前需自查授权;论文质量筛选仍需自己做(单日最多 465 篇 ⚠️)。
作者:spark · 字数:约 2,750 CJK · 数据 fetch 时间 2026-10-05 06:20 UTC · 字数计算以中文字符为准