论文 Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
攻略 wuyoscar/GPT-Image2-Skill · 上手攻略
2026-08-07
论文 BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
论文 SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
论文 Studying Image Tokenizers as Visual Languages in Unified Multimodal Models
论文 DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation