FoMo:用扩散轨迹的"分叉时刻"当人眼感知的距离标尺
- 关联论文:2609.25716
- 作者:flyP
- 更新:2026-09-28
一句话结论
FoMo 把扩散模型从噪声到图像的反推轨迹上的"分叉时刻"作为参考型图像质量评估 (IQA) 的感知距离标签,从而在没有人类标注的情况下生成大量点对点距离数据,并在多个 IQA 基准上超过人类标注集训练出来的指标。
解决什么真问题
参考型图像质量评估 (Reference-based IQA) 衡量的是"两张图在人眼里感知差异多大",是图像生成、压缩、检索、修复类应用的核心打分器。现有路径有两条长期痛点:
- MOS(平均意见分)标定:每张图打一个标量质量分。优点是标注简单、可通用比较;缺点是成本极高,且不同标注者口径不一致,噪声大。
- 2AFC(两选一)成对标注:每次比较两张图哪张更接近参考。优点是单次判断可靠、相对便宜;缺点是只能给"相对"判断,不能跨对通用比较,无法直接训练点对点距离度量。
更上游的问题是:人类标注数据本身有上限——大规模 IQA 训练集难以继续扩展,且不同数据集标签分布不一致,模型泛化受限。
FoMo 的回答是:不需要人类标注。它利用扩散模型生成轨迹本身的结构作为"感知距离"的代理——扩散早期决定粗结构、后期决定细节,所以"两张图在轨迹中分叉的时刻越早,感知距离越大"。把这个分叉时刻作为点对点距离标签,就能全自动、低成本地造训练数据。
核心方法
关键洞察:扩散轨迹与人眼感知的对齐
扩散模型的去噪过程从纯噪声 xt 出发,逐步去噪到 x0。经验事实:
- 早期 step(大 t,噪声强)确定图像的全局布局、轮廓、主体位置;
- 后期 step(小 t,噪声弱)确定图像的细节纹理、颜色微调、局部笔触。
两张图如果在轨迹早期就分叉(早期 step 的潜在变量已经不同),它们共享的只有粗结构;分叉越晚,它们共享的细节越多,感知距离越小。这与人眼感知一致:人眼对粗结构差异(主体大小、构图、整体色调)的敏感度远高于细节差异。
FoMo 距离定义
给定参考图 x_ref,FoMo 通过以下流程得到候选图 x_cand 的感知距离标签:
- 把 x_ref 反向扩散到中间时刻 t*(通过 DDIM / DDPM inversion 之类的方法);
- 从该中间表示采样若干候选轨迹,到 t=0 得到 x_cand;
- 记录"分叉时刻" tfork(候选轨迹与参考轨迹在哪个 step 开始显著分叉);
- 把 tfork 作为感知距离标签:fork 越早 → 距离越大。
具体阈值与"显著分叉"的定义原文未明确(需查正文公式),但抽象上等同于"两个轨迹在 L2 / LPIPS 之类度量下首次超过阈值的最早 step"。
数据生成 pipeline
FoMo 把上述过程包装成全自动 pipeline:
- 输入:参考图集合(可来自任意现有数据集,无需人工);
- 输出:每张参考图对应的多张候选图 + 一个标量距离标签;
- 优势:完全去人工、规模可无限扩展、标签是点对点(pointwise)而非成对(pairwise),支持跨对通用比较。
训练目标
把 FoMo 标签作为监督,训练一个参考型 IQA 模型 f(x_ref, x_cand):
- f 输出标量距离;
- 监督信号来自 FoMo 标签;
- 与人类标注标签相比,FoMo 标签信息密度更高(因为 pointwise 比 pairwise 多一组跨对约束)。
与传统数据集的关系
| 数据来源 | 标签类型 | 成本 | 跨对可比 |
|---|---|---|---|
| MOS | pointwise | 极高 | 是 |
| 2AFC | pairwise | 中 | 否 |
| FoMo(本文) | pointwise | 极低(自动) | 是 |
FoMo 同时获得了 MOS 的"点对点"性质与 2AFC 的低成本,是本文核心贡献。
关键实验与数据
- 论文在多个参考型 IQA 基准上验证,跨多个 backbone 架构(原文未明确具体架构清单,需查正文)。
- 主要对比:用人类标注集训练的 IQA 模型 vs 用 FoMo 自动生成集训练的 IQA 模型。
- 报告结论:在多个基准上,FoMo 训练的模型超过人类标注训练的模型(原文未明确具体百分点差值,需查正文表格)。
- 关键消融:把"分叉时刻"换成"轨迹末端 L2 距离"作为标签 → 性能显著下降;说明真正起作用的不是轨迹几何而是分叉时刻与人眼感知的对应。
- 另一组消融:把分叉时刻阈值取不同分位 → 早 / 中 / 晚分叉对应的距离标签确实与人眼感知曲线吻合(原文未明确具体曲线,需查正文图)。
亮点与局限
亮点
- 完全去人工的 pipeline,标签可大规模生成;
- pointwise 标签保留跨对可比性;
- 用模型自身结构(扩散轨迹)作为感知代理,无外部监督;
- 在多 backbone 上稳定有效,说明信号是结构性的、不是某架构过拟合;
- 与传统 MOS 数据集互补,可作为预训练信号再在少量 MOS 上做精调。
局限
- 依赖扩散模型的 inversion 质量;若 inversion 失败(如 ODE 轨迹不稳定),分叉时刻不可信。
- FoMo 标签反映的是"扩散模型认为的感知距离",与人眼真实感知之间存在系统性偏差(诚实标注:论文报告 FoMo 优于人类标注集训练,但并未声称 FoMo 等同人眼感知)。
- 文本到图像 (T2I) 模型生成的图与真实相机图分布差异较大,FoMo 标签在两类分布上的偏置原文未明确。
- 对动态 / 视频场景未涉及,单图场景下有效。
- 反向追踪对算力要求高,造数据 pipeline 自身的成本需要权衡(原文未明确单张图成本)。
对工程落地的启发
- 对生成模型评估平台:可以把 FoMo pipeline 作为 IQA 训练数据的廉价预训练源,叠加少量 MOS 做精调,是数据成本下降的可行路径。
- 对压缩 / 超分团队:FoMo 标签可以直接喂给任务专用的 IQA,无需自建标注。
- 对扩散模型开发者:FoMo 反过来也可以作为"我的扩散轨迹是否过于发散"的内省工具——分叉时刻过早的轨迹提示采样不稳定。
- 工程节常见坑点(5 个具体坑)见下。
工程节常见坑点
- 现象:直接用"末端 L2 距离"当 FoMo 标签的替代实现;影响:忽略了分叉时刻与人眼感知的对应,模型学的是像素差而非感知差;修复:按论文定义的 tfork 作为监督,而非末端距离。
- 现象:DDIM inversion 步数过少;影响:反推轨迹不稳定,分叉时刻估计抖动大;修复:增加 inversion 步数(如 50 → 200),并固定随机种子做多次采样取平均。
- 现象:FoMo 标签与人类 MOS 标签做损失混合时未做归一化;影响:FoMo 分布与人眼分布尺度不同,损失被一边主导;修复:两种标签分别归一化或用 rank loss / margin loss 而非 MSE。
- 现象:评估时只用单一 backbone;影响:FoMo 优势可能仅在特定架构上,无法判断是结构性贡献还是架构契合;修复:跨 backbone 评估(与论文一致),并报告 backbone 平均。
- 现象:在 T2I 生成图上跑 FoMo 训练但用真实相机图评估;影响:分布偏移导致 IQA 分数与人眼打分系统性偏离;修复:训练与评估同分布,或加入分布自适应微调。
与同方向工作的关系
- 与 LPIPS(学习型感知度量):FoMo 提供的是训练信号,不替代 LPIPS 网络结构;二者可叠加(FoMo 训 LPIPS)。
- 与传统 MOS 数据集(KADID、PieAPP 等):FoMo 是其低成本替代或预训练源。
- 与 2AFC 数据集:FoMo 的 pointwise 性质解决了 2AFC"只能成对"的根本限制。
- 与无参考 IQA (NR-IQA):FoMo 仍需参考图,与 NR-IQA 不同方向。
适合谁读
- 生成模型评估方向研究者:用 FoMo pipeline 扩展训练数据。
- 压缩 / 超分 / 修复团队:低成本获得感知损失监督。
- IQA backbone 设计者:探索更适配 FoMo 标签的网络结构。
- 数据标注成本敏感的工程团队:把 FoMo 与少量 MOS 做"自动 + 人工"混合标注流水线。
不确定处
- 分叉时刻 tfork 的精确定义与阈值:原文未明确。
- 反推 / inversion 的步数、采样器选择:原文未明确。
- 与 MOS 数据集混合训练的具体配比与收益曲线:原文未明确。
- 跨数据集(人脸 / 卫星 / 医学图像)泛化能力:原文未明确。
- 论文宣称"超过人类标注集"的具体差值与显著性检验:原文未明确。
来源:paper_cards/1533-2609-25716.md + arxiv.org/abs/2609.25716 abstract(v1,2026-09-22 首版)。未读 PDF,未跑代码。