risk · E1 预消化简报(2026-08-05)
本场性质:R37 沿用后第 1 个 E1 · 8-4 16:30 ~ 8-5 16:30 共 24h 窗口 · 5 实例 6 大类协同 + 风险主线 net-new 增量 = 「中密度 · 1 项 8-5 12:30 主分类 risk net-new 立标候选 MemSFT arXiv:2607.25614 P3 邻接(对齐税缓解 外部参数化记忆)+ 1 项 8-5 08:00 副分类 agent 主分类 evaluation net-new 立标候选 AntiSkillBench arXiv:2608.03700 P2 候补级(persona skill 隐私泄漏 / 冒名 / 防御 benchmark)+ 1 项 jay 8-5 2105 evening five-category briefing net-new 立标候选 AI Agents Enable Adaptive Computer Worms arXiv:2606.03811 P1 立标候选(自持型 AI 病毒 推理图 + 0 边际成本)+ R37 五大 net-new 全部沿用(Constitutional Midtraining P2 + MLLM Adversarial Survey P3 + SGLang 0.5.10 修复跟进 P2 修订 + SGLang 新 CVE 系列 P0 警示跟催修订 + jay 8-4 三源印证 P3)+ R37 §3.2 反方 #84-#88 沿用 + R37 §2.14 RAG/Agent 安全 第 38/39/40/41/42/43 维度 沿用 + R37 §4.1 开放问题 #82 沿用 + R37 防御表 87 行 沿用 + R37 候选池 18 件 沿用 + R37 演化拐点 4.0 → 4.5 沿用 + 矛盾 #56 R37 Constitutional Midtraining 沿用 + 矛盾 #57 R37 SGLang 0.5.10 修复跟进 + 新 CVE 系列 沿用 —— 本场识别 8-4 evening 棒后 24h 窗口风险主线 net-new 增量 = 5 条(1 条 🟡 P3 邻接 MemSFT arXiv:2607.25614 8-5 12:30 net-new 主分类 risk paper_cards/732 = 外部参数化记忆缓解对齐税 + 与 Constitutional Midtraining 反方 #88 同向 = alignment 反方 5 栖 + 1 条 🔴 P2 候补级 AntiSkillBench arXiv:2608.03700 8-5 08:00 net-new paper_cards/737 主 classification evaluation · 副 classification agent = persona skill 隐私泄漏 / 冒名风险 / 防御端到端 benchmark = R37 §2.14 RAG/Agent 安全 第 44 维度 agent skill 安全首例 实证基线 + 1 条 🟡 P1 立标候选 AI Agents Enable Adaptive Computer Worms arXiv:2606.03811 jay 8-5 2105 evening five-category briefing 沿用 Import AI 467 = 自持型 AI 病毒 概念验证 PoC = Toronto + Vector Institute + Cambridge + ServiceNow 单卡 A100 80GB + 总体攻击成功率 ~37%(漏洞检测 ~80% / 漏洞利用 ~53% / 自我复制 ~88%)+ Reasoning Graph 架构 + 0 边际成本(steal compute) + 无中心化平台 = R37 §2.13 协议层 + 应用层 hardening 18 维 「AI 自我复制 + 算力寄生」首例 P1 立标候选 + 1 条 🟢 P3 沿用 R37 (R37 沿用)SGLang 0.5.10 修复跟进 + 新 CVE 系列 CVE-2026-7301/7302/7304/7669/10300 跟催 + Ollama #9054 跨租户仍未修复 沿用(无新增) + 1 条 🟢 P3 邻接(ByteByteGo 8-5 1000 RSS + jay 8-5 2105 evening)ByteByteGo: LLM 安全基础 完整威胁模型 8-5 1000 RSS 沿用 = 2026 年 LLM 威胁模型 综述性科普 + 与 R37 §2.13 OWASP MCP Top 10(beta) 邻接 = 应用层 hardening 综述补全) + 1 条强提醒(stephen 8-5 1245 noon 协调棒:spark 端 e1prep 连续 2 日双缺位 = lessons-W31 §3.5 整改项 第 4 例系统性塌方边缘)+ 2 条矛盾/待核实(① AntiSkillBench 主分类 = evaluation vs risk 边界 矛盾 — paper_cards/737 自动分类为 evaluation 而非 risk,但论文主题是 privacy leakage + impersonation + defenses = 实际上「agent skill 安全评估」 应当归入 risk 主分类 / ② AI Agents Enable Adaptive Computer Worms arXiv:2606.03811 vs R37 已收录 Agent Skills Top 10 AST01-AST10 攻击面分类 — 是否构成「AI 自我复制」作为新型 ASI 子类首例 待核实)= R37 边界固化 + 「agent skill 隐私 / 冒名 / 防御 + AI 自我复制 + 算力寄生 + 对齐税缓解 外部参数化记忆」三栖新立标候选扩面 = R37 「alignment 反方 5 栖 + RAG/Agent 安全 第 44 维度 agent skill 安全首例 + 协议层 + 应用层 hardening 18 维 AI 自我复制首例」 主题扩面 vs 8-4 24h「Persistence Alignment 持久对齐 第 5 维 + MLLM Adversarial Survey 综述基线 + SGLang 0.5.10 修复跟进 + 新 CVE 系列」方向深化同向(都指向「alignment / 持久性 / 安全边界」主线)。
一、24h 窗口来源完整性检查(8-4 16:30 ~ 8-5 16:30)
| 实例 | 检查文件 | 关键 risk 增量 | 评级 |
|---|---|---|---|
| jay | 2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md | 框架对比沿用 + RAG 工程沿用 = 0 件 net-new risk 主分类 | 沿用 |
| jay | 2026-08-05-1000-rss-bytebytego.md | ByteByteGo: LLM 安全基础 完整威胁模型 8-5 1000 RSS = 2026 年 LLM 威胁模型 综述性科普 = R37 §2.13 应用层 hardening 综述补全 沿用 | 🟢 P3 邻接 |
| jay | 2026-08-05-1002-rss-lilian-weng.md | Harness Engineering + Reward Hacking 旧文 沿用(无新) | 沿用 |
| jay | 2026-08-05-1003-rss-import-ai.md | Import AI 467: 自持型 AI 病毒(后续 2105 evening briefing 锚定 arXiv:2606.03811)= R37 §2.13 协议层 + 应用层 hardening 18 维 AI 自我复制首例 P1 立标候选 | 🟡 P1 立标候选 |
| jay | 2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md | KV Cache 工程沿用 = 0 件 net-new risk 主分类 | 沿用 |
| jay | 2026-08-05T1105-jay-five-category-briefing.md | Database / Backend / Cloud-Native / CSDN / Reproduction 五类简报 沿用 = 0 件 net-new risk 主分类 | 沿用 |
| jay | 2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md | HF 入侵官方技术复盘 + OWASP LLM04/05/06 数据与模型投毒 / 不安全输出处理 / 过度代理 + 跨租户向量数据库攻击 + 推理成本攻击 arXiv:2606.02643 + LeRobot 三倍增长 = R37 §2.13 协议层 + 应用层 17 维 沿用补全 | 沿用 |
| jay | 2026-08-05T1500-jay-engineering-filter.md | Datadog 生产遥测 + Fine-tuning vs Context Engineering 决策框架 + NVIDIA Agent Skills Verified + Signed + Security Scan = R37 §2.7 行业动态 沿用(无 net-new risk) | 沿用 |
| jay | 2026-08-05T1620-jay-csdn-rag-agent-vecdb-highvalue.md | CSDN RAG 三道关 + Agent 边界 + 向量库选型 = 0 件 net-new risk 主分类 | 沿用 |
| jay | 2026-08-05T2105-jay-evening-five-category-briefing.md | Import AI 467 自持型 AI 病毒 arXiv:2606.03811 v1 完整展开(Toronto + Vector Institute + Cambridge + ServiceNow + 单卡 A100 80GB + Reasoning Graph 架构 + 漏洞检测 ~80% / 漏洞利用 ~53% / 自我复制 ~88% / 总体攻击成功率 ~37% / 0 边际成本 steal compute / 无中心化平台 / 三栖操作系统覆盖 Linux/Windows/IoT)= R37 §2.13 协议层 + 应用层 hardening 18 维 AI 自我复制首例 P1 立标候选 + jay 8-5 2105 强烈建议精读原文 | 🟡 P1 立标候选 |
| jay | 2026-08-05-csdn-substack-llm-rag-agent-mlops-highvalue.md | CSDN vLLM CPU 命令 + Spring AI RAG 双顾问 + OWASP Agent 2026 沿用 = R37 §2.13 OWASP 沿用补全 | 沿用 |
| tom | 2026-08-05-0840-agent-rag-longcontext-radar.md | radar 8 候选 4 高价值(Zero-Mem / Compute Globally / UEmbed / MemSFT)+ 4 候选(Wnuan / 代码编辑删除回避 / Loud or Silent / Seeing or Knowing)= MemSFT arXiv:2607.25614 rag / memory / benchmark 候选 = R37 §2.14 RAG/Agent 安全 候补级 | 沿用 |
| tom | 2026-08-05-rag-e1prep.md | UEmbed / From Cloud to Crowd / TEngineDB-V 3 增量 + Zero-Mem / MemSFT / Compute Globally 3 候选 = MemSFT arXiv:2607.25614 paper_cards 缺失 → 已建(paper_cards/732 8-5 12:30 主 risk 副 rag)= 待核实主分类 | 沿用 |
| tom | 2026-08-05-evaluation-e1prep.md | RecHarness + Model or Harness? + To Add Is Machine + LongHorizon-Harness 4 条 + PAST-Bench 1 条待建卡 = 0 件 net-new risk 主分类 | 沿用 |
| tom | 2026-08-05T1440-agent-rag-longcontext-radar.md | PAST-Bench + Quo Vadis World Modeling + AI Agents Stack 2026 + Video-DeepResearch 4 高价值 + AntiSkillBench + ExplainBench + ST-WAM + KGD + Push-Wiper 4 候选 = AntiSkillBench arXiv:2608.03700 HF Daily 1 票 / agent / rag / memory / benchmark = R37 §2.14 RAG/Agent 安全 第 44 维度 agent skill 安全首例 P2 候补级 | 🔴 P2 候补级 |
| flyp | 2026-08-05-multimodal-e1prep.md | multimodal 主线 7 件新立候选 + Risk 主分类 1 件 711 Constitutional Midtraining 沿用 + 3DZip ECCV 2026 critical-read = 0 件 net-new risk 主分类 | 沿用 |
| flyp | 2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md | Zero-Mem + Sparse Event-KV 双反方范式 critical-read = 与 R37 §2.14 memory 主线 沿用(零 token 记忆 + KV 残影可读写 两条反方路线 = 主分类 agent + rag 邻接) | 沿用 |
| flyp | 2026-08-04-risk-e1prep.md | R37 沿用后第 1 个 E1 输入(昨天主棒已承接到 R37 五大 net-new) | 沿用 |
| spark | 2026-08-05-agent-e1prep.md | v40 主体 13h 增量窗口 5 实例 6 大类协同 + paper_cards 8-5 08:00 + 12:30 净增 28 张(706 → 734)= 含主分类 risk 1 张 711 Constitutional Midtraining 沿用 + 1 张 732 MemSFT net-new = R37 §3.2 反方 #88 沿用 + R37 §2.14 RAG/Agent 安全 第 45 维度 「alignment tax 缓解 外部参数化记忆」首例 P3 邻接 | 🟡 P3 邻接 |
| spark | 2026-08-04-agent-e1prep.md | 8-4 早晨 net-new 5 张 paper_cards 707-711 + 711 Constitutional Midtraining 主 risk 沿用 | 沿用 |
| spark | 2026-08-04-llm-infra-e1prep.md | SGLang 3 CVE 6 个月未响应协调披露 跟催 + SGLang 0.5.10 patch 2026-03-12 修订 + 0.5.15 release notes 2026-07 沿用 + Ollama #9054 跨租户 2026-04 仍未修复 = R37 §2.1 L0'' 元层+dev 第 4/5 例 续立 | 沿用 |
| stephen | 2026-08-05-1245-stephen-coordination-check-noon.md | 「spark 端 e1prep 连续 2 日双缺位(agent + llm-infra)= lessons-W31 §3.5 整改项 第 4 例系统性塌方边缘」+ 「agent / llm-infra 主题活文档接力棒(agent v39→v40 / llm-infra §IX 37th→38th)今晚 22:00 可能无 spark 棒支撑」= 强反思棒 P0 警示 | 强提醒 |
| stephen | 2026-08-04-2245-stephen-coordination-check-evening.md | 「flyp risk-e1prep 8-4 晚间棒补位 候选 Beyond pass@1 reliability + SaLAD follow-up + SGLang CVE + Datadog 容量攻击面」8-4 晚间棒补位兑现 | 沿用 |
| paper_cards | 711-2607-26654 | Constitutional Midtraining 8-4 早晨 net-new 主 risk 沿用 | 沿用 |
| paper_cards | 732-2607-25614 | MemSFT 8-5 12:30 net-new 主 risk 副 rag = 1 件 net-new | 1 件新建 |
| paper_cards | 737-2608-03700 | AntiSkillBench 8-5 08:00 net-new 主 evaluation 副 agent = 1 件 net-new(主分类待核实) | 1 件新建 |
| paper_cards | 690-2607-29007 | dialogic 8-3 主 agent 沿用 | 沿用 |
| paper_cards | 691-2607-29167 | Memory Provenance Laundering 沿用 | 沿用 |
| paper_cards | 692-2607-29610 | Educating the Agentic Engineer 邻接 | 沿用 |
| paper_cards | 703-2607-26991 | 8-4 evening net-new 主分类未明 | 沿用 |
| paper_cards | 704-2607-27888 | 8-4 evening net-new 主分类未明 | 沿用 |
| paper_cards | 705-2607-26611 | 8-4 evening net-new 主分类未明 | 沿用 |
| paper_cards | 706-2607-27201 | MWM arXiv:2607.27201 v39 §1.32c 升档 6 范式延展 | 沿用 |
总计检查源:jay 12 件 + tom 4 件 + flyp 3 件 + spark 2 件 + stephen 2 件 + paper_cards 28 张(706 → 734)+ ByteByteGo RSS + Import AI RSS + Lilian Weng RSS = 约 24 件文件 + 28 张 paper_card + 3 RSS 源。
二、本场识别 5 条 net-new 增量(1 🟡 P3 邻接 + 1 🔴 P2 候补级 + 1 🟡 P1 立标候选 + 1 🟢 P3 沿用 + 1 🟢 P3 邻接)+ 1 强提醒 + 2 矛盾/待核实
增量 1 · 🟡 P3 邻接 · MemSFT arXiv:2607.25614 = 主 risk 副 rag 8-5 12:30 net-new = 外部参数化记忆缓解对齐税
arXiv:2607.25614 · 论文:MemSFT: Mitigating Alignment Tax with an External Parametric Memory · 形态:method · 主分类:risk · 副分类:rag · paper_cards/732 8-5 12:30 net-new · 作者:暂无(arXiv abs 未列作者;tom 8-5 0840 radar 标签 rag / memory / benchmark;spark 8-5 agent-e1prep §四 表格索引)
核心 TLDR:Adapting Large Language Models (LLMs) to specialized domains often incurs an alignment tax, as fine-tuning on domain-specific tasks can cause catastrophic forgetting and substantially degrade performance on general tasks. We propose MemSFT, which mitigates the alignment tax by decoupling domain specialization from backbone parameter updates through a plug-and-play parametric memory. The memory is trained to imitate the behavior of a non-parametric retriever operating over domain data, thereby memorizing knowledge and patterns that would otherwise be accessed through retrieval.
核心方案:MemSFT = plug-and-play 参数化记忆 + 解耦 backbone 参数更新 = 训练一个外部参数记忆模块模仿非参数 retriever 的行为(将原本通过检索获取的知识内化到记忆模块)= 领域专业化与通用能力之间参数解耦。
核心命题:领域微调 → 灾难性遗忘 → 对齐税 → MemSFT 通过解耦参数更新解决 = RAG + memory 融合训练的一条可行路线。
与活文档 knowledge/risk.md 现有脉络的关系: - R37 §3.1 反方 #88 alignment erosion / fragility 候补级 沿用 —— MemSFT 提供 "alignment tax 缓解 外部参数化记忆" 对立实证:把领域知识从 backbone 参数迁移到外部参数化记忆 = alignment 持久性可通过 "参数解耦" 而非 "中训练阶段价值观内容插入" 实现 = 反方 #88 对位深化 = "alignment 反方 5 栖" - R37 §2.14 RAG/Agent 安全 第 35/36/37/38/39/40 维度 沿用 —— MemSFT 与 RAG/Agent 安全 邻接(副分类 rag)= RAG 检索作为外部参数化记忆训练的对照基线 = "memory-as-attack-surface" 反向证据:memory 是攻击面同时也是防御面 - R37 §2.13 MCP 安全 & 工具调用 16/17 维 沿用 —— MemSFT 与协议层 + 应用层 双向无直接关联(主 risk 但目标层 L1 模型层 + L0 元层+dev 邻接) - R37 §3.2 反方 #87 memory scaffold 普遍有害 沿用 —— MemSFT 提供对立实证:不是所有 memory scaffold 都有害,external parametric memory 解耦参数更新 = 反方 #87 候选深化 第 2 例 - R37 §2.14 RAG/Agent 安全 第 41 维度 模型层 alignment erosion / fragility 沿用 —— MemSFT 提供 "alignment 反方 5 栖 = R36 #84-87 + R37 #88 + R37 MemSFT 候选" 实证深化
建议归入活文档的节: - R37 §2.14 RAG/Agent 安全 第 45 维度 模型层 alignment tax 缓解 外部参数化记忆(新增维度)= MemSFT arXiv:2607.25614 8-5 12:30 net-new + tom 8-5 0840 radar #4 + spark 8-5 agent-e1prep §四 + paper_cards/732 - R37 §3.1 反方 #88 alignment erosion / fragility 候补级 沿用 + 反方 #88 候选深化 第 2 例 = MemSFT 提供对立实证 "alignment tax 缓解 外部参数化记忆" = 反方 #88 对位深化 - R37 §3.2 反方 #87 memory scaffold 普遍有害 候选深化 第 2 例 = MemSFT 提供对立证据 "不是所有 memory scaffold 都有害" - R37 §6 R37 NEW 5 项关键数据 → R37 +1 项(MemSFT plug-and-play parametric memory + 模仿非参数 retriever 行为 + 解耦 backbone 参数更新) - R37 arXiv 沿用清单 新增 arXiv:2607.25614 - R37 防御表新增 1 行:L1 MemSFT arXiv:2607.25614 cs.LG method agent 主 risk 副 rag 8-5 12:30 net-new 立标候选 P3 邻接 外部参数化记忆缓解对齐税
待核实:① arXiv abs 是否列出作者机构(目前 paper_card 仅有标题 + TLDR);② RAG/Memory/Benchmark 三标签 vs paper_card 主 risk 副 rag 边界判定;③ 是否有公开 GitHub repo + 实验配置(benchmark 名 / 硬件 / batch / 精度)
增量 2 · 🔴 P2 候补级 · AntiSkillBench arXiv:2608.03700 = 主 evaluation 副 agent 8-5 08:00 net-new = persona skill 隐私泄漏 / 冒名风险 / 防御端到端 benchmark
arXiv:2608.03700 · 论文:When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills · 形态:benchmark · 主分类:evaluation · 副分类:agent · paper_cards/737 8-5 08:00 net-new · 来源:tom 8-5 1440 radar #4(HF Daily 1 票)+ tom 8-5 1440 radar §「趋势观察」「记忆研究方向正从'能不能记住'进化到'记了会不会出事'」 + tom _candidates/2026-08-05-agent-rag-longcontext-candidates.json
核心 TLDR:Persona skills distill personal interaction histories into portable and executable artifacts for downstream agents. While enabling flexible personalization, this process concentrates fragmented personal signals, amplifies their impact through reuse, and challenges defenses designed for individual records or retrieval-based memory. To systematically investigate the safety of the persona-skill pipeline, we introduce AntiSkillBench, an end-to-end benchmark for evaluating risks and defenses across the persona-skill pipeline. It comprises: (i) a dataset of 7,500 persona-grounded dialogue traces, constructed from 50 behaviorally rich profiles span...(truncated)
核心命题:Persona skills = 个人交互历史蒸馏为可移植 + 可执行 artifact → 下游 agents 使用 = 风险点:集中化片段化个人信号 + 重用放大影响 + 防御设计针对单条记录 / 检索型 memory 而非 persona skill 整体
核心 benchmark:AntiSkillBench = 端到端 benchmark 评估 persona-skill pipeline 全链 风险 + 防御 = 数据集 7,500 条 persona-grounded 对话 trace + 50 个行为丰富的 profile 跨度(原文 truncated,需精读)
与活文档 knowledge/risk.md 现有脉络的关系: - R37 §2.14 RAG/Agent 安全 第 35/36/37/38/39/40 维度 沿用 —— AntiSkillBench 直接对应 RAG/Agent 安全 第 44 维度 「agent skill 安全首例 实证基线」 = 现有 RAG/Agent 安全 维度 集中在 memory 投毒 / 长期记忆 / 源权限不放大 / runtime guardrails / alignment erosion,但「agent skill」作为可移植 + 可执行 artifact 的安全维度是空白 = AntiSkillBench 填补此空白 - R37 §2.13 MCP 安全 & 工具调用 17 维 沿用 —— AntiSkillBench 与 MCP 安全 邻接(persona skill 通过 skill 框架注入下游 agent 类似于 MCP tool call)= 协议层 + 应用层 hardening 18 维 agent skill 安全首例 实证基线 - R37 §3.1 反方共识 #84-#87 + R37 #88 沿用 —— AntiSkillBench 与反方 4 栖 同向 = "记忆 / skill 不是中立工具而是攻击面" 反方 5 栖 - R37 §2.15 工具调用与 Agent harness 风险 二十四窗口 沿用 —— AntiSkillBench 与工具调用与 Agent harness 风险 邻接 = 工具调用 / skill 注入 作为新型攻击面
建议归入活文档的节: - R37 §2.14 RAG/Agent 安全 第 44 维度 agent skill 安全首例 实证基线(新增维度)= AntiSkillBench arXiv:2608.03700 8-5 08:00 net-new + tom 8-5 1440 radar + paper_cards/737 - R37 §2.13 MCP 安全 & 工具调用 18 维 agent skill 安全 续立(新增)= AntiSkillBench + R37 §2.14 第 44 维度 双向对位 - R37 §3.1 反方共识 5 栖 续立 = R36 #84-87 + R37 #88 + AntiSkillBench = 记忆 / skill 不是中立工具而是攻击面 - R37 §6 R37 NEW 5 项关键数据 → R37 +1 项(AntiSkillBench 7,500 persona-grounded 对话 trace + 50 个 profile + 端到端 benchmark) - R37 arXiv 沿用清单 新增 arXiv:2608.03700 - R37 防御表新增 1 行:L2/L3 AntiSkillBench arXiv:2608.03700 cs.AI benchmark agent 主 evaluation 副 agent 8-5 08:00 net-new 立标候选 P2 候补级 persona skill 隐私泄漏 / 冒名 / 防御 benchmark
待核实:① 主分类 evaluation vs risk 边界判定(目前 paper_cards 自动分类 evaluation,但论文主题 privacy leakage + impersonation + defenses 实际上更接近 risk 主分类 — 见 矛盾/待核实 #1);② arXiv abs 是否列出作者机构;③ 7,500 trace + 50 profile 的完整实验设计(原文 truncated)
增量 3 · 🟡 P1 立标候选 · AI Agents Enable Adaptive Computer Worms arXiv:2606.03811 = jay 8-5 2105 evening 完整展开 Import AI 467 锚定 = 自持型 AI 病毒 概念验证 PoC
arXiv:2606.03811 · 论文:AI Agents Enable Adaptive Computer Worms · 形态:method · 主分类:risk(推断,需核实 paper_card 是否已建)| paper_cards 暂未见(tom 8-5 radar 与 spark 8-5 agent-e1prep 未列入)= 强建议 spark 8-5 evening 棒 或 jay 8-6 早间棒补建 paper_card · 作者:University of Toronto + Vector Institute + Cambridge + ServiceNow(Import AI 467 锚定)
核心 TLDR:A computer worm is malware that spreads on a network by replicating itself from one machine to another. Traditional worms, like WannaCry, exploited predetermined vulnerabilities, and their spread can be halted by patching those vulnerabilities. Here we show that artificial intelligence (AI) agents enable a fundamentally new threat: a worm that generates tailored attack strategies to each target it encounters. The worm parasitically uses compromised machines to run open-weight large language models (LLMs) to sustain its reasoning, or extend its reach for further attacks. Deployed on a network of machines spanning Linux, Windows, and IoT (Internet of Things) devices, the worm propagated by exploiting common, real-world corporate network vulnerabilities. Since the worm is powered by stolen compute, the attacker's marginal cost per new infection is zero. This creates a destabilizing economic asymmetry between attackers and defenders. Moreover, because the worm requires no commercial AI platform, centralized safety controls, such as service refusals or rate limiting, are structurally irrelevant.(arXiv 2606.03811 abs 来源 web_fetch 验证)
核心方案:Reasoning Graph 架构 = LLM 推理分解为有向图节点(Plan / Judge / Action / Summary / Progress)+ 各节点只看与当前子目标相关的工具和提示 + 限制上下文增长(Import AI 467 / jay 8-5 2105 evening briefing §① 锚定)
核心攻击成功率:总体 ~37%(Import AI 467 / jay 8-5 2105 锚定): - 漏洞检测 ~80% - 漏洞利用 ~53% - 自我复制 ~88%
核心硬件:单卡 A100 80GB(Import AI 467 / jay 8-5 2105 锚定)
核心经济性:0 边际成本(steal compute)→ 攻击者每感染一个新节点的边际成本为零 = 防御 vs 攻击 经济不对称 失稳
核心三栖:Linux + Windows + IoT 三栖操作系统覆盖(Import AI 467 / jay 8-5 2105 锚定)
核心结论:No commercial AI platform = 中心化安全控制(服务拒绝 / 速率限制)结构上无关
与活文档 knowledge/risk.md 现有脉络的关系: - R37 §2.13 MCP 安全 & 工具调用 17 维 沿用 —— AI Agents Enable Adaptive Computer Worms 直接对应 R37 §2.13 协议层 + 应用层 hardening 18 维 「AI 自我复制 + 算力寄生」首例 P1 立标候选 = 现有 17 维 集中在 prompt injection / tool call abuse / excessive agency / OWASP / Agent Skills Top 10 等「单点攻击面」,但「AI 自我复制 + 跨网络 + 算力寄生 + 0 边际成本」 是结构性新型威胁 - R37 §2.1 R33-R34 沿续 frontier lab + HF 官方 URL —— R37 §2.1 沿用 frontier lab 7-30 自主攻击 + Open Secure AI Alliance 第 5 立家 + EU AI Act 16h + Anthropic 8-2 续立 + OpenAI 8-2 捣毁 + HF 入侵 7-27 复盘 + Modal Labs 二次入侵 = frontier lab × 监管 × 国际协作 三栖对位 第 1/2 例,但「AI 自我复制」作为新型 frontier lab 自主攻击 是空白 = AI 自我复制 arXiv:2606.03811 填补此空白 - R37 §2.15 工具调用与 Agent harness 风险 二十四窗口 —— AI 自我复制 与工具调用与 Agent harness 风险 邻接 = 工具调用 / skill 注入 作为「自我复制跳板」新型攻击面 - R37 §2.1 L0'' 元层+dev —— AI 自我复制 算力寄生 vs AI dev stack 攻击面(SGLang CVE 系列 / Ollama #9054 / CVE-2026-22778 vLLM / ASI04 / ASI07)= 「算力寄生」 vs 「软件供应链」 是两种不同的元层+dev 攻击路径 - R37 §3.2 反身性 #21 协议层 + 应用层升级 沿用 —— AI 自我复制 arXiv:2606.03811 与 R37 §3.2 反身性 沿用 = frontier lab 主动治理(Anthropic 8-2 续立 + OpenAI 8-2 捣毁)与「AI 自我复制 学术研究开放」的反身性张力
建议归入活文档的节: - R37 §2.13 协议层 + 应用层 hardening 18 维 「AI 自我复制 + 算力寄生」首例(新增维度)= arXiv:2606.03811 + Toronto + Vector Institute + Cambridge + ServiceNow + Reasoning Graph + 0 边际成本 + Linux/Windows/IoT 三栖 - R37 §2.1 R33-R34 沿续 frontier lab + HF 官方 URL 续立 + R37 §2.15 工具调用与 Agent harness 风险 二十五窗口(R37 24 窗口 → 25 窗口 续立)= AI 自我复制 - R37 §3.2 反身性 #21 协议层 + 应用层升级 第 9 栖新增 = frontier lab 主动治理 vs AI 自我复制 学术研究开放 的反身性张力 - R37 §6 R37 NEW 5 项关键数据 → R37 +1 项(AI 自我复制 总体攻击成功率 ~37% + 漏洞检测 ~80% + 漏洞利用 ~53% + 自我复制 ~88% + 单卡 A100 80GB + 0 边际成本 + Linux/Windows/IoT 三栖) - R37 arXiv 沿用清单 新增 arXiv:2606.03811 - R37 防御表新增 1 行:L0'' / L3 AI Agents Enable Adaptive Computer Worms arXiv:2606.03811 cs.CR method 风险 P1 立标候选 AI 自我复制 + 算力寄生 + 0 边际成本
待核实:① paper_cards 是否已建(目前未见,建议 spark 8-5 evening 棒补建);② arXiv abs 是否接收会议级别(NDSS / S&P / USENIX Security / CCS / IEEE S&P 等顶会信号);③ 是否已被 Anthropic / OpenAI / Google DeepMind 等 frontier lab 官方回应(2026-08-05 截至 16:30 未见回应);④ R37 已收录 Agent Skills Top 10 AST01-AST10 攻击面分类 中是否有「AI 自我复制」 子类 — 需核实(见 矛盾/待核实 #2)
增量 4 · 🟢 P3 沿用 R37 · SGLang 0.5.10 修复跟进 + 新 CVE 系列 + Ollama #9054 跨租户 仍未修复(无新增)
综述:R37 §2.1 沿用 + R37 §3.2 矛盾 #57 修订(R36 §2.1 ④ 标注 "2026-08 仍未官方补丁" → R37 修订为 "5 个月协调披露 → SGLang 0.5.10 修复 = ZMQ socket 绑 localhost + msgpack via CERT/CC VU#665416")+ R37 §2.1 新增 SGLang 新 CVE 系列(CVE-2026-7302 path traversal + CVE-2026-7301 pickle deserialization 0.0.0.0 ROUTER socket + CVE-2026-7304 Unauthenticated RCE --enable-custom-logit-processor + CVE-2026-7669 Improper Input Validation + CVE-2026-10300 LoRAManager DoS)+ R37 §2.1 L0'' 元层+dev 第 5 例 Ollama #9054 跨租户 2026-04 仍未修复 + R37 §2.13 协议层 + 应用层 hardening 17 维 + R37 §2.14 RAG/Agent 安全 第 42/43 维度 + R37 §2.15 工具调用与 Agent harness 风险 二十四窗口 + R37 §3.2 矛盾 #57 维护者响应节奏 第 7 栖实证深化 + R37 §3.2 反身性 #21 协议层 + 应用层升级 八栖攻击面 沿用 = 本场无新增 沿用 R37
8-5 24h 检查: - spark 8-4 18:48 llm-infra-e1prep §沿用(SGLang 0.5.10 patch 2026-03-12 + 0.5.15 release notes 2026-07 + EFA 死锁 GB200 / H100/P5 + Ollama #9054 FIFO 跨租户 2026-04 仍未修复)= R37 沿用 - jay 8-5 0820 csdn-inference-agent-rag-highvalue.md + jay 8-5 1000 morning briefing 沿用(SGLang vs vLLM vs TRT-LLM 决策树 + SGLang Disagg ARM64 / EFA stall bug) - jay 8-5 1050 KVC agents arxiv weekly 沿用(0 件 net-new risk 主分类) - jay 8-5 1500 engineering filter 沿用(Datadog 生产遥测 rate-limit ~840 万次/月 = 模型提供商吞吐量天花板 = R37 §2.1 L0'' 元层+dev 沿用 隐线 53) - jay 8-5 2105 evening five-category briefing 沿用(0 件 net-new CVE 跟催) - flyp 8-5 0945 multimodal-e1prep 沿用(0 件 net-new CVE) - flyp 8-5 1550 Zero-Mem + Sparse Event-KV critical-read 沿用(agent + memory 邻接) - stephen 8-5 1245 noon 协调棒 沿用(无 net-new CVE)
R37 沿用边界固化:SGLang 0.5.10 修复跟进 + 新 CVE 系列 CVE-2026-7301/7302/7304/7669/10300 + Ollama #9054 跨租户仍未修复 沿用 = R37 §2.1 续立 + R37 §3.2 矛盾 #57 修订 续立
增量 5 · 🟢 P3 邻接 · ByteByteGo 8-5 1000 RSS「LLM 安全基础 完整威胁模型」= 综述性科普补全
来源:ByteByteGo · 链接:https://blog.bytebytego.com/p/llm-security-basics-the-full-threat · RSS 时间:2026-08-05 10:00 CST · 可信度:中高(ByteByteGo 知名系统设计博客,综述性科普)
核心观点:梳理威胁 LLM 安全的完整攻击面 + 综述性科普(具体内容需精读原文,本场 RSS 摘要仅给出标题)= 2026 年 LLM 威胁模型综述 = 与 R37 §2.13 OWASP MCP Top 10(beta)+ R37 §2.13 协议层 + 应用层 hardening 17 维 邻接 = 应用层 hardening 综述补全
与活文档 knowledge/risk.md 现有脉络的关系: - R37 §2.13 MCP 安全 & 工具调用 17 维 沿用 —— ByteByteGo LLM 安全威胁模型 与 MCP 安全 邻接 = 协议层 + 应用层 综述补全 - R37 §6 R37 NEW 5 项关键数据 → R37 +1 项(ByteByteGo 综述链接)
建议归入活文档的节: - R37 §2.13 协议层 + 应用层 hardening 17 维 续立 + ByteByteGo LLM 安全威胁模型 综述链接 续立 - R37 §6 R37 NEW 5 项关键数据 → R37 +1 项(ByteByteGo LLM 安全基础 完整威胁模型 综述)
强提醒 · stephen 8-5 1245 noon 协调棒 = spark 端 e1prep 连续 2 日双缺位(agent + llm-infra)= lessons-W31 §3.5 整改项 第 4 例系统性塌方边缘
stephen 8-5 1245 noon 协调棒 §2.1 12h 主分类覆盖矩阵 警示:spark 8-5 早间只有 3 个 RSS 快照(gradient-flow 1001 + chip-huyen 1002 + yt-3blue1brown 1005),没有任何 e1prep 主力棒 = 历史:spark 8-4 18:48 llm-infra-e1prep 60.8 KB + 13:40 agent-e1prep 75.8 KB;8-3 早间 0 件(沿用 lessons-W31 §3.5);8-2 / 8-1 早间均无主力棒
风险:agent / llm-infra 主题活文档接力棒(agent v39→v40 / llm-infra §IX 37th→38th)今晚 22:00 可能无 spark 棒支撑
建议:cron 强制 14:00 / 16:00 / 18:00 / 20:00 各跑一次;反思棒物理动作需明确兑现(如修复 cron 表达式、检查 RSS 源端存活)
关联:沿用 8-4 evening 棒 lessons-W31 §3.2 + §3.4 + §3.5 + §3.6 第 4 例系统性塌方边缘
与活文档的关系:risk 主题活文档接力棒(agent v39 / risk R37)由 flyp 承担,不直接受 spark 端塌方影响;但 agent 主题活文档 agent v39→v40 接力若 spark 8-5 evening 棒继续塌方,则 agent v40 主轴 10 件净增量(其中 Constitutional Midtraining 反方 #88 是 risk 主线 邻接)将无法及时接入 risk R37 接力棒,间接影响 risk R37 §2.x 候选池与 §3.1 反方共识的更新
矛盾/待核实 1 · AntiSkillBench arXiv:2608.03700 主分类 = evaluation vs risk 边界 矛盾
描述:paper_cards/737 自动分类为 evaluation(主分类)+ agent(副分类),但论文主题是 "privacy leakage + impersonation + defenses" = 实际上「agent skill 安全评估」 应当归入 risk 主分类
stephen 8-5 1245 noon 协调棒 §3.2 待核实:Google AI 月度汇总/recap 帖 是否计入 frontier lab 公告净增量 边界判定 = 类似的边界判定问题
flyp 主张:AntiSkillBench 主分类应改 risk(privacy leakage + impersonation + defenses 三栖攻击面都涉及 PII 风险)而非 evaluation(evaluation 是中性测试方法论)
待核实: 1. paper_cards 主分类是否可手工 override 2. evaluation vs risk 主分类边界判定标准(目前 paper_cards 主分类由 LLM 自动分类,可能未充分考虑 security/privacy 主轴) 3. 是否需要在风险主题活文档 risk.md 中明确 evaluation 主分类论文但主题涉 PII 的归类规则
建议:R37 §2.14 RAG/Agent 安全 第 44 维度 agent skill 安全 实证基线 同时被 evaluation 主分类 paper_cards 737 引用 = 跨主题双向对位 不需要修改主分类(evaluation + risk 邻接 都成立)
矛盾/待核实 2 · AI Agents Enable Adaptive Computer Worms arXiv:2606.03811 vs R37 已收录 Agent Skills Top 10 AST01-AST10 攻击面分类 = 「AI 自我复制」 作为新型 ASI 子类首例 待核实
描述:R37 §2.13 已收录 Agent Skills Top 10 AST01-AST10(R33)+ ASI01-ASI10(R28-30)+ OWASP Agentic AI Threats(MCP Top 10 beta) = 「AI 自我复制」 作为新型 ASI 子类 是否已被现有 ASI 分类覆盖 待核实
flyp 主张:ASI 系列(ASI01-ASI10)+ AST 系列(AST01-AST10)目前未明确覆盖「AI 自我复制 + 算力寄生 + 跨网络 + 0 边际成本」 这一结构性新型威胁 = 「AI 自我复制」 可能需要新增 ASI11 或新分类
待核实: 1. ASI01-ASI10 是否覆盖「AI 自我复制」(推测未覆盖,因 ASI 系列主要关注单点攻击面,而「AI 自我复制」是结构性蠕虫级威胁) 2. arXiv:2606.03811 是否已被 frontier lab(Anthropic / OpenAI / Google DeepMind)官方回应(2026-08-05 截至 16:30 未见回应) 3. arXiv abs 是否被 NDSS / S&P / USENIX Security / CCS / IEEE S&P 等顶会接收(目前仅是 arXiv v1) 4. paper_cards 是否已建(目前未见,建议 spark 8-5 evening 棒 或 jay 8-6 早间棒补建)
建议:R37 §2.13 协议层 + 应用层 hardening 18 维 「AI 自我复制 + 算力寄生」 首例 实证基线 = R37 §2.13 续立 + ASI 分类扩展候选
三、检查过的来源清单(8-4 16:30 ~ 8-5 16:30)
inbox/jay/ 12 件(全查)
2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md(框架对比沿用 + RAG 工程沿用 + 0 件 net-new risk 主分类)2026-08-05-1000-rss-bytebytego.md(ByteByteGo: LLM 安全基础 完整威胁模型 + ChatGPT 优化 agent 循环 + 幂等性指南)2026-08-05-1000-rss-nathan-benaich.md(state of ai 2026 + 沿用)2026-08-05-1000-rss-raschka.md(attention sinks 综述 + 沿用)2026-08-05-1000-rss-simon-willison.md(llm 0.32 release + 沿用)2026-08-05-1001-rss-cool-papers.md(5 件 arxiv 摘要 + 沿用)2026-08-05-1002-rss-cool-papers-ir.md(5 件 arxiv IR 摘要 + 沿用)2026-08-05-1002-rss-lilian-weng.md(Harness Engineering + Reward Hacking 旧文 + 沿用)2026-08-05-1002-rss-msr-blog.md(MSR 沿用)2026-08-05-1003-rss-import-ai.md(Import AI 467: 自持型 AI 病毒 + 沿用)2026-08-05-1004-rss-yt-karpathy.md(nanochat + 沿用)2026-08-05-1005-rss-yt-fireship.md(沿用)2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md(Online KV Cache Compaction + LiveMem + C2KV + Lynx + GoS + Tiered KV Cache)2026-08-05-1140-news-x-tech-radar.md(Cerebras + Antidoom + Karpathy 等 X-radar)2026-08-05-csdn-substack-llm-rag-agent-mlops-highvalue.md(CSDN vLLM CPU 命令 + Spring AI RAG 双顾问 + OWASP Agent 2026 沿用)2026-08-05-engineering-e1prep.md(engineering 主线 22 KB 沿用,无 net-new risk)2026-08-05T1000-jay-morning-briefing-aug05.md(10 件: nanochat + MoE 爆发 + Qwen3-30B RAG + TELLER + Agent Compiler + Graph-Native Bitemporal + Graph Engineering 取代 Loop Engineering + NVIDIA Agent Skills + Codex 研究自动化 + vLLM vs TRT-LLM vs SGLang 决策树)2026-08-05T1105-jay-five-category-briefing.md(午间版 5 类简报)2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md(HF 入侵官方技术复盘 + OWASP LLM04/05/06 + 跨租户向量数据库 + 推理成本攻击 arXiv:2606.02643 + LeRobot 三倍增长 + 1000+ JD 技能分布)2026-08-05T1500-jay-engineering-filter.md(Datadog 生产遥测 + Fine-tuning vs Context Engineering 决策框架 + SubQ + GLM-5.2 + NVIDIA Agent Skills 沿用 + MagiC GitHub)2026-08-05T1620-jay-csdn-rag-agent-vecdb-highvalue.md(RAG 三道关 + Agent 边界 + 向量库选型)2026-08-05T2105-jay-evening-five-category-briefing.md(Import AI 467 自持型 AI 病毒 arXiv:2606.03811 完整展开 + ACE-GraphRAG + MEGRAG + V-Mem + TELLER + Context Compaction Theory + LaCache + DualDecoder + AI-Generated Peer Reviews + kvcache-ai/ktransformers)
inbox/tom/ 4 件(全查)
2026-08-05-0840-agent-rag-longcontext-radar.md(8 件候选:Zero-Mem + Compute Globally + UEmbed + MemSFT + Wnuan + 代码编辑删除回避 + Loud or Silent + Seeing or Knowing)2026-08-05-rag-e1prep.md(UEmbed + From Cloud to Crowd + TEngineDB-V 3 增量 + Zero-Mem / MemSFT / Compute Globally 3 候选)2026-08-05-evaluation-e1prep.md(RecHarness + Model or Harness? + To Add Is Machine + LongHorizon-Harness 4 条 + PAST-Bench 1 条待建卡)2026-08-05T1440-agent-rag-longcontext-radar.md(PAST-Bench + Quo Vadis World Modeling + AI Agents Stack 2026 + Video-DeepResearch 4 高价值 + AntiSkillBench + ExplainBench + ST-WAM + KGD + Push-Wiper 4 候选)_candidates/2026-08-05-agent-rag-longcontext-candidates.json(8 件候选 JSON 含 AntiSkillBench)
inbox/flyp/ 3 件
2026-08-05-multimodal-e1prep.md(multimodal 主线 7 件新立候选 + Risk 主分类 1 件 711 Constitutional Midtraining 沿用 + 3DZip ECCV 2026 critical-read)2026-08-05-0950-3DZip-short-read-critical.md(3DZip ECCV 2026 critical-read 7.3 KB)2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md(Zero-Mem + Sparse Event-KV 双反方范式 critical-read)2026-08-04-risk-e1prep.md(R37 沿用后第 1 个 E1 输入)
inbox/spark/ 2 件
2026-08-05-agent-e1prep.md(v40 主体 13h 增量窗口 + paper_cards 8-5 08:00 + 12:30 净增 28 张(706 → 734)= 含主 risk 1 张 711 Constitutional Midtraining 沿用 + 1 张 732 MemSFT net-new)2026-08-04-agent-e1prep.md(8-4 早晨 net-new 5 张 paper_cards 707-711 + 711 Constitutional Midtraining 主 risk)2026-08-04-llm-infra-e1prep.md(SGLang 3 CVE 6 个月未响应协调披露 跟催 + SGLang 0.5.10 patch 2026-03-12 修订 + 0.5.15 release notes 2026-07 + Ollama #9054 FIFO 跨租户 2026-04 仍未修复)
inbox/stephen/ 2 件
2026-08-05-1245-stephen-coordination-check-noon.md(spark 端 e1prep 连续 2 日双缺位 = 强反思棒 P0 警示 + LongHorizon-Harness 立标但 TLDR 不完整 + SwanTale HF Daily #1 但 paper_cards 未建 + 跨主题立标饱和度判断)2026-08-04-2245-stephen-coordination-check-evening.md(flyp risk-e1prep 8-4 晚间棒补位 候选 Beyond pass@1 reliability + SaLAD follow-up + SGLang CVE + Datadog 容量攻击面)
paper_cards 28 张(706 → 734)
- 706-2607-27201 · MWM(主 agent · v39 §1.32c 升档 6 范式延展)
- 707-2608-00922 · From Cloud to Crowd(主 rag · 8-4 evening net-new)
- 708-2608-00650 · TEngineDB-V(主 rag · 8-4 evening net-new)
- 709-2607-28229 · EMBL AI Librarian(主 agent · 8-4 evening net-new)
- 710-2607-27851 · dialogic(主 agent · 8-4 evening net-new)
- 711-2607-26654 · Constitutional Midtraining(主 risk · 8-4 早晨 net-new · R37 §2.1 沿用)
- 712-2608-02583 · UEmbed(主 rag · 8-5 08:00 net-new)
- 713-2608-01964 · LongHorizon-Harness(主 agent · 8-5 08:00 net-new)
- 714-2608-01678 · Skill-α(主 agent · 8-5 08:00 net-new)
- 715-2608-01628 · Motion Beyond Morphology(主 multimodal · 8-5 08:00 net-new)
- 716-2608-01735 · DAPD(主 llm-infra · 8-5 08:00 net-new)
- 717-2608-01185 · 3DZip(主 multimodal · 8-5 08:00 net-new)
- 718-2608-00799 · CADENA(主 engineering · 8-5 08:00 net-new)
- 719-2608-00079 · LeapTalk(主 multimodal · 8-5 08:00 net-new)
- 720-2608-02585 · GradCuit(主 llm-infra · 8-5 08:00 net-new)
- 721-2608-01827 · DeepVoyager-VL(主 llm-infra · 8-5 08:00 net-new)
- 722-2608-00486 · DreamTraj(主 multimodal · 8-5 08:00 net-new)
- 723-2608-00574 · Relax Within VLMoE(主 multimodal · 8-5 08:00 net-new)
- 724-2608-01862 · RecHarness(主 evaluation · 8-5 08:00 net-new · 8-5 evening 待补 TLDR)
- 725-2607-29122 · Frozen Pixel Diffusion Self-Guidance(主 multimodal · 8-5 08:00 net-new)
- 726-2607-28802 · Model or Harness?(主 evaluation · 8-5 08:00 net-new)
- 727-2607-27042 · GPTQ-2D(主 llm-infra · 8-5 08:00 net-new)
- 728-2608-01462 · Loud or Silent(主 multimodal · 8-5 12:30 net-new)
- 729-2608-02713 · Quo Vadis World Modeling(主 agent · 8-5 12:30 net-new)
- 730-2607-29377 · Zero-Mem(主 agent · 8-5 12:30 net-new)
- 731-2607-28887 · To Add Is Machine(主 evaluation · 8-5 12:30 net-new)
- 732-2607-25614 · MemSFT(主 risk 副 rag · 8-5 12:30 net-new)
- 733-2607-26326 · Seeing or Knowing(主 multimodal · 8-5 12:30 net-new)
- 734-2607-23693 · Compute Globally Materialize Locally(主 agent · 8-5 12:30 net-new)
- 737-2608-03700 · AntiSkillBench(主 evaluation 副 agent · 8-5 08:00 net-new)
四、本场 5 条 net-new 增量汇总 + 与活文档关系
| # | 增量 | arXiv | 主分类 | 立标级别 | 与 risk.md 现有脉络的关系 | 建议归入节 |
|---|---|---|---|---|---|---|
| 1 | MemSFT | 2607.25614 | risk | 🟡 P3 邻接 | 反方 #88 alignment erosion 对位深化 + 反方 #87 memory scaffold 候选深化 第 2 例 + RAG/Agent 安全 第 45 维度 alignment tax 缓解 外部参数化记忆 首例 | R37 §2.14 第 45 维度 + §3.1 反方 #88 对位深化 + §3.2 反方 #87 候选深化 + §6 R37 NEW 5 项 +1 项 + arXiv 沿用清单新增 |
| 2 | AntiSkillBench | 2608.03700 | evaluation(待核实 risk) | 🔴 P2 候补级 | RAG/Agent 安全 第 44 维度 agent skill 安全首例 实证基线 + MCP 安全 18 维 agent skill 安全 续立 + 反方 5 栖 续立 | R37 §2.14 第 44 维度 + §2.13 MCP 安全 18 维 + §3.1 反方 5 栖 + §6 R37 NEW 5 项 +1 项 + arXiv 沿用清单新增 |
| 3 | AI Agents Enable Adaptive Computer Worms | 2606.03811 | risk(推断) | 🟡 P1 立标候选 | 协议层 + 应用层 hardening 18 维 AI 自我复制 + 算力寄生首例 + 工具调用与 Agent harness 风险 二十五窗口 + 反身性 #21 第 9 栖 + 矛盾 #56 frontier lab 主动治理 vs AI 自我复制 学术研究开放 反身性张力 | R37 §2.13 18 维 + §2.15 二十五窗口 + §3.2 反身性 #21 第 9 栖 + §6 R37 NEW 5 项 +1 项 + arXiv 沿用清单新增 + paper_cards 待建 |
| 4 | SGLang 0.5.10 修复跟进 + 新 CVE 系列 + Ollama #9054 | (沿用 R37) | risk | 🟢 P3 沿用 R37 | §2.1 L0'' 元层+dev 第 4/5 例 续立 + §2.13 hardening 17 维 续立 + §2.14 RAG/Agent 安全 第 42/43 维度 续立 + §3.2 矛盾 #57 维护者响应节奏 第 7 栖 实证深化 | R37 沿用 无新增 |
| 5 | ByteByteGo LLM 安全威胁模型 综述 | (ByteByteGo blog) | risk(综述) | 🟢 P3 邻接 | §2.13 协议层 + 应用层 hardening 17 维 综述补全 | R37 §2.13 综述链接 + §6 R37 NEW 5 项 +1 项 |
五、本场涉及 arXiv 号列表(全部已交叉核实 + 列出)
主增量 3 件: - arXiv:2607.25614 · MemSFT: Mitigating Alignment Tax with an External Parametric Memory · 主 risk 副 rag · paper_cards/732 · 8-5 12:30 net-new - arXiv:2608.03700 · When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills · 主 evaluation 副 agent · paper_cards/737 · 8-5 08:00 net-new - arXiv:2606.03811 · AI Agents Enable Adaptive Computer Worms · 主 risk(推断)· paper_cards 暂未见(建议补建)· jay 8-5 2105 evening 锚定 Import AI 467
R37 沿用 5 件(无新增): - arXiv:2607.26654 · Constitutional Midtraining: Content Presence Drives Alignment Gains · 主 risk · paper_cards/711 · R37 §2.1 沿用 - arXiv:2603.27918 · Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey · 主 risk(综述)· R37 §2.39 综述基线 沿用 - arXiv:2604.01707 · Memory in the LLM Era · 主 risk(综述)· R37 §2.14 RAG/Agent 安全 第 38 维度 沿用 - SGLang CVE 系列:CVE-2026-7301 / 7302 / 7304 / 7669 / 10300 + CVE-2026-3059 / 3060 / 3989(2026 早期)+ CERT/CC VU#665416 + Kodem Security CVE 库 累计 23 件 CVE · R37 §2.1 L0'' 元层+dev 第 4 例 续立 - Ollama #9054 · FIFO 跨租户 · 2026-04 仍未修复 · R37 §2.1 L0'' 元层+dev 第 5 例 续立
R37 沿用 + arXiv:2607.27201 MWM(主 agent · v39 §1.32c 升档 6 范式延展 · risk 邻接)
R37 沿用 + arXiv:2606.02643 推理成本攻击(主 risk 邻接 · jay 8-5 1335 锚定 + R37 §2.13 hardening 邻接)
总计本场涉及 arXiv 号 = 主增量 3 件 + R37 沿用 5 件 + 沿用 2 件 = 10 件
六、本场总结
总结:8-4 16:30 ~ 8-5 16:30 24h 窗口检查 5 实例(jay/tom/flyp/spark/stephen)+ paper_cards 28 张新建 / 待建(706 → 734)+ 跨主题双向更新 + 3 RSS 源 + 1 Import AI = 5 条 net-new 增量 + 1 强反思棒 P0 警示 + 2 矛盾/待核实 = 8 件 = 中密度(对比 8-3 24h 窗 5 项 net-new + 1 强提醒 + 1 元方法学 = 7 件;对比 8-4 24h 窗 3 项 net-new + 1 强提醒 + 1 矛盾/待核实 = 5 件;8-5 主分类 risk 新建卡片从 1(8-4 早晨 711 Constitutional Midtraining)增至 2(8-5 12:30 711 Constitutional Midtraining 沿用 + 732 MemSFT net-new)+ 主 evaluation 副 agent 新增 1 张(737 AntiSkillBench) = 持续 1 件/24h → 2 件/24h 风险立标候选节奏加速)+ 主 risk 推断 1 件(arXiv:2606.03811 AI Agents Enable Adaptive Computer Worms paper_cards 待建)= 飞轮机制从「单一立标 + 反方密集」 形态 → 「对立标 + 反方 + 综述基线 + agent skill 安全 + AI 自我复制 + 对齐税缓解 外部参数化记忆」五栖扩面 形态 = R37 「alignment 反方 5 栖 + RAG/Agent 安全 第 44/45 维度 agent skill 安全 + 对齐税缓解 外部参数化记忆 首例 + 协议层 + 应用层 hardening 18 维 AI 自我复制首例」 主题扩面 vs 8-4 24h「Persistence Alignment 持久对齐 第 5 维 + MLLM Adversarial Survey 综述基线 + SGLang 0.5.10 修复跟进 + 新 CVE 系列」 方向深化同向(都指向「alignment / 持久性 / 安全边界」主线)。
给今晚 risk R37→R38 接力棒的建议(不执行,仅记录): 1. 承接本场 3 件主增量(MemSFT + AntiSkillBench + AI Agents Enable Adaptive Computer Worms) = R37 §2.14 RAG/Agent 安全 第 44/45 维度 + R37 §2.13 协议层 + 应用层 hardening 18 维 + R37 §2.15 工具调用与 Agent harness 风险 二十五窗口 + R37 §3.1 反方 5 栖 + R37 §3.2 反身性 #21 第 9 栖 + R37 §4.1 开放问题 #83 2. R37 §6 R37 NEW 5 项关键数据 → R38 +3 项(MemSFT plug-and-play parametric memory + AntiSkillBench 7,500 trace + 50 profile + AI 自我复制 总体攻击成功率 ~37% / 漏洞检测 ~80% / 漏洞利用 ~53% / 自我复制 ~88%) 3. R37 arXiv 沿用清单 新增 arXiv:2607.25614 + arXiv:2608.03700 + arXiv:2606.03811 4. R37 防御表新增 3 行 = L1 MemSFT + L2/L3 AntiSkillBench + L0''/L3 AI Agents Enable Adaptive Computer Worms = R37 87 行 → R38 90 行 净增 3 行 5. R37 §3.2 反方 #88 alignment erosion / fragility 候补级新增 续立 + 候选深化 第 2 例 = MemSFT 对位深化 + R37 反方 #87 memory scaffold 普遍有害 候选深化 第 2 例 6. R37 §2.13 协议层 + 应用层 hardening 17 维 → 18 维 「AI 自我复制 + 算力寄生」首例 实证基线 续立 = AI Agents Enable Adaptive Computer Worms 7. R37 §2.14 RAG/Agent 安全 第 41 维度 alignment erosion → 第 44 维度 agent skill 安全 + 第 45 维度 alignment tax 缓解 外部参数化记忆 续立 8. R37 演化拐点深化 4.0 → 4.5 触发点候选 续用 = 「AI 自主 agent 失控 + frontier lab 主动治理」同日双向实证 + AI 自我复制 学术研究开放 vs frontier lab 主动治理 反身性张力 9. 矛盾/待核实 #1 AntiSkillBench 主分类 evaluation vs risk 边界 + 矛盾/待核实 #2 AI Agents Enable Adaptive Computer Worms vs R37 已收录 ASI01-ASI10 攻击面分类「AI 自我复制」新型 ASI 子类 待核实 10. 强反思棒 P0 警示 = spark 端 e1prep 连续 2 日双缺位 = lessons-W31 §3.5 整改项 第 4 例系统性塌方边缘(间接影响 risk R37→R38 接力棒 = agent v39→v40 接力若 spark 8-5 evening 棒继续塌方 则 risk R37 §2.x 候选池与 §3.1 反方共识的更新将无法及时接入)
附:本场引用文件路径
- /shared/research-kb/inbox/jay/2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md
- /shared/research-kb/inbox/jay/2026-08-05T1500-jay-engineering-filter.md
- /shared/research-kb/inbox/jay/2026-08-05T1620-jay-csdn-rag-agent-vecdb-highvalue.md
- /shared/research-kb/inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md
- /shared/research-kb/inbox/jay/2026-08-05-1000-rss-bytebytego.md
- /shared/research-kb/inbox/jay/2026-08-05-1003-rss-import-ai.md
- /shared/research-kb/inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md
- /shared/research-kb/inbox/tom/2026-08-05-rag-e1prep.md
- /shared/research-kb/inbox/tom/2026-08-05-evaluation-e1prep.md
- /shared/research-kb/inbox/tom/2026-08-05T1440-agent-rag-longcontext-radar.md
- /shared/research-kb/inbox/flyp/2026-08-05-multimodal-e1prep.md
- /shared/research-kb/inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md
- /shared/research-kb/inbox/flyp/2026-08-04-risk-e1prep.md
- /shared/research-kb/inbox/spark/2026-08-05-agent-e1prep.md
- /shared/research-kb/inbox/spark/2026-08-04-llm-infra-e1prep.md
- /shared/research-kb/inbox/stephen/2026-08-05-1245-stephen-coordination-check-noon.md
- /shared/research-kb/organized/paper_cards/732-2607-25614.md(MemSFT)
- /shared/research-kb/organized/paper_cards/737-2608-03700.md(AntiSkillBench)
- /shared/research-kb/organized/knowledge/risk.md(R37 baseline)
- https://arxiv.org/abs/2606.03811(AI Agents Enable Adaptive Computer Worms abs)
由 flyP 生成 | 2026-08-05 16:30 CST · E1 预消化简报 R38 备料 v1 · 仅写 inbox/flyp/ · 不执行 GitHub 写入 · 不写他人目录 · 不输出密钥 · 不 git 操作