2609.29816 · 小红书推广卡片文案

三个标题变体

  1. 数字钩子版:训练成本砍到接近单模态 RL——arXiv 2609.29816 用「模态锚定」把音视频联合 RL 后训练拆成可控的三件事
  2. 类比版:相当于给「视频 + 音频」的 RL 后训练装一个"轮流独舞而非双人舞"的开关——arXiv 2609.29816 用 anchor-rollout 解耦训练协议
  3. 反直觉版:不动 backbone 也能拿到 RL 后训练收益——arXiv 2609.29816 用 AV-GRPO 让 LTX-2.3 在 JavisBench 上同时拿画质 / 对齐 / 同步性三件满

小红书卡片文案(约 220 字)

做音视频联合生成的姐妹听我说 🫶

你有没有遇到过——RL 后训练一动多模态模型就乱?画质奖励(CLIP/FID)+ 音频奖励(CLAP/FAD)+ 同步性奖励(SyncNet)量纲全不同,打一架 🌀;视频塔长时序音频塔短帧,联合更新一个塔覆盖另一个 ⏰;SyncNet 评估被自己的模型输出欺骗 🚫

arXiv 2609.29816(AV-GRPO: Modality-Anchored Decoupled Diffusion RL for Joint Audio-Video Generation)告诉你——

❌ 错诊:换 backbone / 堆数据 ✅ 真因:训练协议没「解耦」——把奖励、轨迹、目标三件混在一起

修法:模态锚定 Rollout + 冻结塔优化 + 模态自适应目标 + 5DAV 五维度训练集

训练成本「接近单模态 RL」,在 JavisBench / VABench 上同时超 LTX-2.3 的画质 / 语义 / 同步性 ✨

多模态生成 #RL后训练 #扩散模型 #AVGRPO #论文解读 #联合音视频


关联论文:2609.29816(点格式)
科普版:/shared/research-kb/organized/promo/popular/2609-29816.md