Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
- 类型:arxiv
- 标识:2607.11886
- 链接:https://arxiv.org/abs/2607.11886
- 主分类:engineering
- 形态:method
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:SpectraReward is proposed, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning, and Self-SpectraReward is introduced, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch.
- OpenAlex ID:W7168264862
- OpenAlex DOI:10.48550/arxiv.2607.11886
- DOI:10.48550/arxiv.2607.11886
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.11886
- OpenAlex更新:2026-07-19
- 副分类:multimodal
- 待LLM分类:否
- 标题中文:读回:预训练 MLLM 是文本到图像生成的零样本奖励模型
- TLDR中文:提出 SpectraReward,一种无需训练的将预训练 MLLM 转化为即用型奖励模型的奖励函数,用于图像生成强化学习;并引入 Self-SpectraReward,这是统一多模态模型的一种特例,其中策略自身的理解分支充当其生成分支的奖励模型。
- 来源文件:
- /inbox/tom/_candidates/2026-07-15-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]