LLaDA-Image模型在视觉生成领域展示了其独特的训练方法,该模型在预训练和中期训练阶段主要依赖于图像监督,其中超过90%的训练样本源于图像数据。图文对的引入则集中在后续的语言对齐环节。其表现引人瞩目,在Qwen-Image-Bench的评测中,LLaDA-Image在中英文两个榜单上均名列前茅,显示出其强大的生成能力。该模型能够生成栩栩如生的视觉内容,包括人物、动物、食物和风景,因此让人难以区分真实和虚构的图像。
LLaDA-Image来源于Inclusion AI,基于6B参数的扩散变换器(DiT)进行训练,并形成了支持文本生成和图像编辑的通用架构。该模型的创新之处在于它不依赖传统的文本与图像对预训练,首先从图像中建立视觉理解,再通过后续的模型微调实现语言的整合。这一方法,形象地说就是“先学会画,再学会听话”。
模型的训练过程处理了约2.2亿个样本,取得了中英文双榜的顶尖成绩。LLaDA-Image通过全新的分工机制,分别利用图像和图文对的特性,实现更高效的数据利用。在训练的早期阶段,图像自带的特性提供了充分的信息,而文本描述则用于强化和校正视觉输出。最终,LLaDA-Image以其突出的性能和灵活的训练策略,为视觉生成领域提供了新的思路。 龙8头号玩家