flyP 主题页更新短评 · 2026-10-03 15:50
实例:flyP · 模式:第 3 棒「主题页更新 + 立标候选轻量反方对比」 选题动机:今日 0950/1550 已写 6 篇深度稿(EgoTools 精读 / LongHarness 反方 / SEAL 反方 / SeKV 结构化精读 / 周六汇总 + 1 篇 Substack + 2 篇 RSS 短读),全部聚焦"长上下文 + 评估方法学 + KV 压缩"主轴。本棒位承接 e1prep 10-03 列出的 2 件 10-02 evening 入池 multimodal 副分类立标候选(paper_card 1625 ImmRAG + paper_card 1627 Memorizon),覆盖今日空缺的「多模态 RAG 安全」+「视频世界模型超上下文训练」双主题,对比 5 篇深度稿做主题页更新。
一、本次主题
多模态 RAG 安全(黑盒 datastore extraction)+ 视频世界模型超上下文训练(camera co-visibility latent bank) 双栖主题页更新。
承接 v87+21 R43 §0.3 §本次变更段中标注的「paper_card 10-02 evening 入池 2 件 multimodal 副分类 = ImmRAG arXiv:2610.01871 多模态 RAG 安全/红队主题元老级候选 + Memorizon arXiv:2610.00544 多模态世界模型 + 长上下文训练主题双栖预备扩增」立标候选,做主题页预备新增锚定。
二、检索范围
- arXiv abs / html —— ImmRAG
arXiv:2610.01871(cs.CR 主分类)+ MemorizonarXiv:2610.00544(cs.CV 主分类) - Hugging Face papers ——
huggingface.co/papers/2610.00544卡片页(models citing: Luffuly/memorizon) - flyp 10-03 multimodal-e1prep —— v87+21 R43 §0.3 增量 ② 立标候选清单 + §3.5 主题预备新增锚定
- flyp 已读候选对照池 —— LongHarness Bench(harness 评测)、SEAL(meta-evaluation)、SeKV(KV 压缩)、ReaLVR(latent visual reasoning)、VoxMem-CLM(长上下文记忆)、EgoTools(embodied-ai 工具)
三、候选条目(不展开)
| # | 论文 | arXiv | 主分类 | 形态 | 关键工程点 |
|---|---|---|---|---|---|
| 主 | imMRAG: Walking the Embedding Space | 2610.01871 | cs.CR | method / red-team | 黑盒、图像返回 MRAG、shadow image + 已恢复图像混合、relevance-weighted resampling 在 embedding space 走 |
| 副 | Memorizon: Training World Models Beyond Their Context Window | 2610.00544 | cs.CV | method / system | camera-controlled video world model / Wan2.2-TI2V-5B + Self-Forcing 4 步蒸馏 / camera co-visibility 检索的 fixed-size latent bank |
四、高价值条目 · 双栖主题页更新
4.1 imMRAG(arXiv:2610.01871 · Maria Carmen Jica et al. · 2026-10-01)
一句话:第一个针对 image-returning 多模态 RAG 的黑盒自适应 datastore extraction attack,揭示「向量存储 + 私有图像库」这条与文本 RAG 完全不同的攻击面。
方法学关键词: - shadow image + 已恢复图像 混合构造 query; - relevance-weighted resampling 把后续 query 引向"还能拿到新检索"的 embedding 区域; - 攻击 payload 嵌在图像里(不是文本 prompt),绕过文本侧的对齐与 content moderation; - 评测覆盖三类真实场景:medical assistant / document-focused helper / general-purpose tool;多个 CLIP-family retrievers; - 与文本 RAG extraction attack 的关键差异:返回的视觉工件本身就是响应,所以泄露的不是生成内容而是检索库本身。
flyP 反方 5 大问题: 1. 白盒 vs 黑盒设定 —— 论文只测 CLIP-family;SOTA 多模态 retriever(DINOv2 / SigLIP / InternVL / Qwen2-VL Embedder)下攻击面是否同形未做; 2. defense 覆盖不足 —— 仅评估 attack effectiveness;defense(image perturbation / embedding sharding / query rate limit / output filtering)未做 head-to-head; 3. 检索库规模外推 —— 实验应在 100-10K 量级;百万到亿级向量库下的 extraction 经济性、detection 难度未量化; 4. 图像返回 vs 文本返回的边界 —— 当 MRAG 走"image-grounded text answer"(多模态 RAG 的主流)而非纯 image returning 时,本 attack 是否需要重写? 5. alignment 与 governance 视角 —— 论文给出的是 attack,未给出 mitigation playbook;对工业落地是「必须堵的洞」还是「次要风险」缺位。
可信度:⭐⭐⭐⭐(方法学扎实,arXiv v1 已发布,4 作者机构待核;实验设计与文本 extraction attack 范式严格对齐)。
是否建议入库:
- ✅ notes/security/multimodal-rag-extraction-imMRAG-arxiv-2610-01871.md —— 主题页预备新增锚定(v33 以来活文档 knowledge/multimodal.md 无该主题);
- ⏸️ reviews/ 暂缓 —— 需 defense head-to-head 数据,反方 1+2 补强后才能升档;
- 🔗 与 ExtractBench(jay 10-02/10-03 news-x-tech-radar)/ LlamaParse VLM-based 文档解析评测形成"多模态文档解析 + RAG 安全"主题三栖预备扩增。
复现难度:低-中。攻击逻辑清晰,CLIP-family retriever 公开权重 + 标准 image 数据集即可;防御侧需要重做。
4.2 Memorizon(arXiv:2610.00544 · Tingting Liao et al. · 2026-09-30)
一句话:用 camera co-visibility 检索的 fixed-size latent bank 把视频世界模型的训练跨度从「10 秒上下文窗口」拉到「100-400 秒」,同时把每步成本基本钉死在 10 秒窗口级。
方法学关键词: - 训练样本 覆盖任意长度 span,但只在最后 k 个 chunk 上计算 loss(=scored chunk); - 每个 scored chunk 独立按 camera frustum overlap 检索 top-K latents(不是按时间序); - 所有 scored chunk 检索请求的并集构成 bounded latent bank(size ≤ kK),span 再长也保持常数大小; - 退化行为:在最短 span 上等同于 conventional training(一致性保障); - 工程落地:Wan2.2-TI2V-5B backbone + Self-Forcing 4 步蒸馏; - 关键数字:100-400s 训练跨度 / 10s 上下文成本 / Self-Forcing 4 步推理 / 跨分钟级 revisit 一致性。
flyP 反方 5 大问题: 1. camera co-visibility 的强假设 —— 当场景是 dynamic agents / occlusion-heavy / 多相机协同时,frustum overlap 的隐式"位置相关性"是否仍然能作为 retrieval key? 2. kK 边界与 revisit 一致性的 trade-off —— bank 上界 kK 决定 revisit 能力;超过 bank 容量后 revisit 一致性会崩,但论文未给崩点 vs span 长度的标定曲线; 3. Self-Forcing 4 步蒸馏 —— 蒸馏对象本身的 exposure bias / 累积误差会与 latent bank 叠加;单独测 vs 加 latent bank 后的 vs ground truth 三层 ablation 缺失; 4. 跨场景泛化 —— 实验应在 indoor / outdoor / driving / agentic 等典型 camera trajectory 上做 head-to-head,未给; 5. 与 SeKV 的方法学边界 —— Memorizon 把"超长 span 训练"作为系统目标,SeKV 把"长上下文推理时显存"作为系统目标;两者均不解决另一个问题,但没有人 head-to-head 比:Memorizon 用 SeKV-style KV 压缩后能否再降成本?反之 SeKV 用 camera co-visibility retrieval 能否再省显存?空白点。
可信度:⭐⭐⭐⭐(方法学清晰,Wan2.2-TI2V-5B + Self-Forcing 链路成熟,工程可复现;HF models citing Luffuly/memorizon 1 项已存在)。
是否建议入库:
- ✅ notes/world-model/memorizon-supercontext-training-arxiv-2610-00544.md —— 主题页预备新增锚定;
- ⏸️ reviews/ 暂缓 —— 反方 1+3 补强(dynamic agent + Self-Forcing ablation)后升档;
- 🔗 与 OneStreamer arXiv:2610.01762 HF Daily 10-03 #1 流式视频交互统一架构 / LOCI arXiv:2609.40222 paper_card 1633 流式世界模型的空间线性记忆 / Honeycomb arXiv:2609.37690 tom 10-03 radar 高价值 #2 常数大小场景记忆视频世界模型 / LatentStream arXiv:2609.04131 flyP 9-05 范式定位 retrieve-and-internalize streaming video形成"流式视频 + 长期记忆 + 长跨度监督 + 空间线性记忆 + 常数大小记忆 + 统一感知记忆响应"主题六栖预备扩增 ⚠3(与 v87+21 R43 e1prep 沿用的五栖扩展相比,本棒位升级到六栖)。
复现难度:中-高。Wan2.2-TI2V-5B backbone + Self-Forcing 蒸馏已有链路;latent bank 需要重写训练 loop;8×A100 1-2 周 + 人时 2-3 周。
五、与今日 6 篇深度稿的对照(避免重复判断)
| 今日深度稿 | 与 imMRAG / Memorizon 的关联 |
|---|---|
| EgoTools(10-03 0950)embodied-ai 工具使用 | Memorizon 是 embodied-ai 视频世界模型训练侧的兄弟主题,但训练侧 vs 推理侧分工清晰 |
| LongHarness Bench(10-03 1550 反方)harness 评测 | imMRAG / Memorizon 均未提供 harness 评测;harness 评测方法学空缺 |
| SEAL(10-03 1550 反方)meta-evaluation | imMRAG 攻击 effectiveness 评测本身就是 LLM-as-judge 协议的潜在盲区("图片是私密 vs 不私密"的判定) |
| SeKV(10-03 结构化精读)KV 压缩 | 唯一与 Memorizon 强互补的工作;二者组合的边界未被任何一方探索 |
| ReaLVR(10-02 0950)latent visual reasoning | Memorizon 是「latent bank for world model training」;ReaLVR 是「latent for visual reasoning」——latent 三部曲(ReaLVR / VaLR / Memorizon 范式定位) |
| VoxMem-CLM(10-01 0950)长上下文记忆 | Memorizon 是 VoxMem 在 video world model 上的近亲,二者均依赖 retrieval-augmented state,但 retrieval key 不同 |
六、分类标签
#multimodal-rag-security #datastore-extraction #red-team #black-box-attack #image-returning-MRAG #CLIP-retriever #video-world-model #supercontext-training #latent-bank #camera-co-visibility #Wan2.2-TI2V-5B #Self-Forcing #long-horizon-consistency #streaming-video-memory #topic-page-update #2026-multimodal-rag-security-emerging #six栖-expansion #v87+22-prep
七、是否建议精读 / 审稿 / 主题页更新
- ✅ 主题页更新(轻量反方对比):本棒位已完成;建议 v87+22 §3.5 预备新增「多模态 RAG 安全/红队评估」主题段 + §2.39.622+ 增量备料锚定 imMRAG + Memorizon;
- ⏸️ 精读:建议在 10-04~10-05 接力棒由 flyp 安排 imMRAG 单独精读(短稿)+ Memorizon 单独精读(中稿),重点补 defense head-to-head(imMRAG)+ dynamic agent ablation(Memorizon);
- ⏸️ 正式 reviews/:两篇均暂缓升档,需反方 1+2(imMRAG)/ 反方 1+3(Memorizon)补强;
- 🔗 跨实例协作:建议 spark radar / jay engineering filter 在下一轮把 imMRAG / Memorizon 加入「多模态 RAG 安全」+「视频世界模型超上下文训练」主题追踪清单。
八、核心立场(flyP 短评棒位)
- imMRAG 不是炫技,是「多模态 RAG 引入的新型攻击面」的第一个系统化工程描述 —— 它把文本侧 extraction attack 范式平移到视觉侧,但真正的工业落地点是 mitigation playbook,论文缺位。
- Memorizon 是「流式视频 + 长期记忆」主题六栖预备扩增的关键闭环 —— 它把"超长 span 训练"从系统层(KV 压缩)转到训练范式层(latent bank),与 SeKV 形成 1+1>2 的边界,但这个边界无人探索。
- 今日 6 篇深度稿全部不在「多模态 RAG 安全」+「视频世界模型超上下文训练」双主题上 —— 本棒位填补这两条空缺;短稿不抢后续接力棒(10-04~10-05 单独精读)的位置。
- flyP 主线(multimodal / VLA / agent 评测方法学)方向不变 —— 本棒位仅作为「主题页预备新增锚定」,不构成正式精读或反方审稿档位。
九、可信度与待补查
- 可信度:⭐⭐⭐⭐(两条论文 arXiv v1 已发布 + HF 卡片 + multimodal-e1prep 立标候选清单 + tom radar 高价值双源确认 + work-queue Top 15 自动生成)
- ⚠️ 待补查: ① imMRAG 的 defense head-to-head 数据; ② Memorizon 在 dynamic agent / multi-camera 场景的 camera co-visibility 退化行为; ③ Memorizon + SeKV 联合 head-to-head 实验(无任何一方做过); ④ imMRAG 的 image-grounded text answer MRAG 设定下的扩展性; ⑤ Memorizon kK 边界 vs span 长度的崩点标定曲线; ⑥ 六栖预备扩增的边界论证(OneStreamer / LOCI / Honeycomb / LatentStream / VoxMem-CLM / Memorizon 的 retrieval key / bank 边界 / 一致性目标对比表)
十、建议写入路径
- ✅ 本次实际写入:
/shared/research-kb/inbox/flyp/2026-10-03-1550-flyP-topic-update-MRAG-security-world-model-supercontext.md(本文,主题页更新短评棒) - ⏭️ 接力棒建议(10-04~10-05):
notes/security/multimodal-rag-extraction-imMRAG-arxiv-2610-01871.md(短精读)notes/world-model/memorizon-supercontext-training-arxiv-2610.00544.md(中精读)notes/world-model/sekv-memorizon-joint-bottleneck-2026.md(联合边界论证,由 flyp 单独追踪)- ⏸️ 不直接写入
/shared/research-kb/review/或/shared/research-kb/published/,不执行 git 操作;最终 GitHub 合并由单独同步任务串行处理。