AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

  • 类型:arxiv
  • 标识:2609.29816
  • 链接:https://arxiv.org/abs/2609.29816
  • 主分类:multimodal
  • 形态:method
  • TLDR:Recent years have witnessed major progress in joint audio-video generation. Existing models still suffer from limited per-modality fidelity, insufficient text-modality alignment and weak cross-modal synchronization. While reinforcement-learning post-training offers a promising remedy, directly adapting it to joint audio-video generation is challenging. Heterogeneous multimodal rewards entangle learning signals and complicate credit assignment. Joint optimization of two modality towers is computationally expensive given their divergent dynamics. Moreover, synchronization evaluation difficulty d
  • 待LLM分类:否
  • 来源文件:
  • /inbox/tom/_candidates/2026-09-26-agent-rag-longcontext-candidates.json