Imagen 是 Google Research Brain Team 提出的文本到图像扩散模型,核心目标是把输入文字转换为具有高度写实感的图像。它将大型预训练语言模型对文本的理解能力,与扩散模型的图像生成能力结合起来,重点解决文本描述理解、图像细节保真度以及图像与文字之间的对应关系问题。与部分需要学习潜在空间先验的方案不同,Imagen 不需要学习 latent prior,而是使用更大的冻结文本编码器和级联扩散模型完成生成,并通过 COCO FID 与 DrawBench 等评测验证效果。
核心功能
文本生成图像
Imagen 可以根据自然语言提示生成图像,官网示例涵盖蓝松鸦站在彩虹马卡龙篮子上、戴牛仔帽的熊猫弹吉他、在纽约时代广场骑自行车的柯基等场景。模型关注的不只是单个对象,还包括对象、动作、地点、服饰和视觉风格之间的组合关系。
大型语言模型编码文本
系统使用冻结的 T5-XXL 编码器,将输入文字编码为嵌入表示。官网研究指出,通用的大型语言模型在文本到图像任务中的文本编码效果出人意料地好;扩大语言模型规模,对样本保真度和图文匹配度的提升,比单纯扩大图像扩散模型更明显。
级联扩散生成高分辨率图像
Imagen 先由条件扩散模型根据文本嵌入生成 64×64 图像,再通过文本条件超分辨率扩散模型逐步放大到 256×256,最后达到 1024×1024。该流程把文字理解、基础图像生成和分辨率提升分成多个阶段,以生成更高分辨率的结果。
提升图文对齐与图像保真度
模型采用新的 thresholding diffusion sampler,使其能够使用更大的 classifier-free guidance 权重;同时引入 Efficient U-Net,以提升计算与内存效率并加快收敛。官网称,Imagen 在 COCO 数据集上取得 7.27 的 FID,即使没有在 COCO 上训练,人工评估仍认为其样本在图像与文字对应关系方面接近 COCO 参考图像。
DrawBench 文本到图像评测
Imagen 团队提出了 DrawBench,这是一个用于深入评估文本到图像模型的综合性挑战基准。测试项目包括组合关系、数量、空间关系、长文本、罕见词和困难提示词,并通过并排人工评估比较 Imagen 与 VQ-GAN+CLIP、Latent Diffusion Models、DALL-E 2 等方法。
研究型模型架构与效率改进
官网将 Imagen 描述为“大型预训练语言模型 × 级联扩散模型”的系统,并强调大型冻结文本编码器在文本到图像任务中的作用。Efficient U-Net 被用于减少计算和内存开销,同时改善收敛速度;官网还将 Imagen 与 Google Research 的 Imagen Video、Imagen Editor 和同系列模型 Parti 并列介绍。
使用方式
正文展示了基于文字提示生成图像的交互式示例,用户可以点击示例中的词语组合提示。页面同时提供系统结构可视化和研究结果,但没有提供公开 API、命令行工具或客户端说明。官网明确表示目前不发布代码,也不提供公开演示,并决定暂不开放 Imagen 供公众使用,因此正文没有注册流程、导入导出方式或自备模型 Key 的说明。
适用人群与场景
Imagen 的主要内容面向文本到图像研究者,可用于理解大型语言模型如何编码图像生成提示,以及级联扩散模型如何逐步提升图像分辨率。需要比较不同文本到图像方法的研究人员,可以参考 COCO FID 和 DrawBench 的并排人工评测。关注模型安全与负责任发布的研究者,则可以通过页面列出的数据偏差、社会偏见、人物生成质量和开放发布风险,了解该类模型的限制。
注意事项
Imagen 目前没有发布代码或公开演示,也未开放供公众使用。官网指出,模型依赖在未整理的互联网规模数据上训练的文本编码器,可能继承大型语言模型中的社会偏见与局限;人物图像生成的图像保真度较低,并可能表现出肤色偏向、职业与性别刻板印象等问题。官网还说明,训练数据包含 LAION-400M,其中可能存在不当内容、种族侮辱和有害社会刻板印象。