Gen-2 是 Runway Research 介绍的一套多模态 AI 视频生成系统,面向视频创作与影像制作场景。它不依赖传统拍摄流程,而是根据文字提示、输入图像或视频片段合成新的视频内容:既可以只用文字生成视频,也可以把图像的构图与风格应用到视频结构上,还能对视频的特定区域进行风格化处理。页面还展示了从概念草图、视频素材到动画渲染和定制化模型的多种工作方式,核心差异在于同一系统覆盖了文本生成、图像驱动、视频风格迁移、区域遮罩和渲染增强等多种视频生成路径。
核心功能
文本生成视频
Text to Video 模式只需要文字提示即可合成视频。页面以“纽约城市公寓窗边透进的午后阳光”等描述作为 driving prompt,说明用户可以通过文字表达画面内容,并让系统将其转化为可见的视频结果。该模式强调使用文字描述想象中的影像风格,而不是从现有视频开始制作。
文本与图像共同驱动
Text + Image to Video 模式同时使用一张 driving image 和一段文字提示生成视频。图像提供视觉输入,文字则用于描述希望出现的画面内容,例如低角度拍摄人物走在街道上、周围有酒吧霓虹灯的场景。这个模式适合在已有视觉参考的基础上继续指定动作、镜头或环境表达。
图像驱动与视频风格化
Image to Video(Variations Mode)可以仅使用一张 driving image 生成视频,页面展示了输入图像与输出视频的对应结果。Stylization 模式则把某张图像或文字提示中的风格转移到视频的每一帧,使原有视频沿用指定的视觉风格。两种方式分别对应从单张图像产生动态内容,以及对已有视频进行整体风格处理。
Storyboard、Mask 与 Render
Storyboard 模式用于把 mockups 转化为完整风格化并带有动画的渲染结果。Mask 模式允许只对视频的指定区域应用风格化,同时保持其余部分不变,因此页面将其描述为选择性处理视频区域的方式。Render 模式则面向没有材质的渲染图,通过输入图像或文字提示,为其生成更具真实感的输出。
模型定制
Customization 模式用于定制 Gen-2 模型,以获得更高保真度的结果。官网将这一模式描述为释放 Gen-2 的完整能力,重点在于通过定制模型提升输出的 fidelity。它与直接输入文字、图像或视频片段的生成模式不同,提供了针对模型本身进行调整的路径。
使用方式
官网页面通过“Try Gen-2 in Runway”入口将用户引导至 Runway 的 Gen-2 工具页面,并展示了文字、图像和视频片段作为生成输入的方式。页面没有说明是否必须注册、是否需要自备模型 Key,也没有介绍独立客户端、浏览器插件、命令行或开放 API。已明确展示的工作流包括文字生成视频、图像驱动视频、视频风格化、遮罩处理、渲染增强和模型定制。
适用人群与场景
Gen-2 的页面内容主要面向需要制作影像内容的创作者与电影制作场景:影视创作者可以用文字提示构思并生成新视频,也可以把已有图像或视频作为视觉基础;需要制作概念演示的人可以将 mockups 转化为带动画的风格化渲染;进行视觉实验的人可以测试图像风格迁移、局部区域处理和无材质渲染增强;希望提高输出保真度的使用者则可以使用 Customization 模式定制模型。
注意事项
官网将 Gen-2 描述为多模态 AI 系统,并展示了不同模式的输入图像、输入视频和生成视频结果,但没有在正文中说明具体生成时长、分辨率、使用额度或各模式的技术限制。页面也未提供价格、免费额度或付费档位信息。官网展示的用户研究结果称,Gen-2 的结果在 image-to-image 和 video-to-video translation 中更受偏好,其中相较 Stable Diffusion 1.5 的偏好率为 73.53%,相较 Text2Live 的偏好率为 88.24%。