MusicLM 是 Google Research 介绍的一款音乐生成模型,核心任务是根据文字描述生成音乐。它可以理解包含速度、乐器、曲风、氛围和使用场景的丰富提示,例如“舒缓的小提琴旋律,配以失真的吉他 riff”,并生成 24 kHz 音频。与只接受简单文本标签的音乐示例不同,MusicLM 还展示了长时生成、连续提示的 Story Mode、文字与旋律联合控制,以及根据绘画描述生成音乐等研究场景。页面同时介绍了 MusicCaps 数据集,为后续音乐与文本生成研究提供 5.5k 组音乐—文本配对数据。
核心功能
文字描述生成音乐
MusicLM 将文字描述作为条件,生成与描述内容相对应的音乐。示例中的提示不仅包含音乐类型,也包含节奏、乐器、声音特征和情绪,例如街机游戏配乐、雷鬼与电子舞曲融合、带有混响的合成器琶音,以及由低音和鼓主导的慢速雷鬼歌曲。页面展示的结果覆盖 acoustic guitar、cello、electric guitar、flute 等乐器,也包括 ambient、8 bit、big beat 和 berlin 90s house 等风格。
长时音乐生成
Long Generation 示例以 melodic techno、swing、relaxing jazz 等文本提示生成较长的音乐片段。官网摘要说明,MusicLM 生成的 24 kHz 音频能够在数分钟内保持一致性。该能力面向需要连续音乐内容的场景,页面通过不同音乐提示展示模型的长时生成结果。
Story Mode 连续提示
Story Mode 会按时间顺序提供一组文字提示,让模型继续生成与前一个描述相关的内容。示例将“time to meditate”“time to wake up”“time to run”“time to give 100%”安排在不同时间段,也展示了从电子游戏音乐、河边冥想音乐到火焰和烟花的连续变化。另一组示例则依次经过 jazz、pop、rock、death metal、rap、弦乐四重奏、史诗电影配乐和苏格兰民歌等提示。
文字与旋律联合控制
MusicLM 可以在文字条件之外加入旋律 embedding,使生成的音乐遵循输入旋律,同时按照文字提示改变音乐表现。页面列出了 humming、whistling、piano、strings、marimba 和 fingerstyle guitar 等旋律来源,并将它们与 a cappella chorus、electronic synth lead、guitar solo、jazz with saxophone、opera singer、piano solo、string quartet、tribal drums and flute 等文字提示组合,展示同一旋律在不同音乐表达下的生成结果。
从视觉描述生成音乐
Painting Caption Conditioning 示例使用绘画标题、作者、画面和文字描述作为输入,并展示对应的生成音频。示例包括 Salvador Dalí 的《The Persistence of Memory》、Jacques-Louis David 的《Napoleon Crossing the Alps》、Henri Matisse 的《Dance》和 Edvard Munch 的《The Scream》。页面中的绘画描述涉及融化的钟表、穿越阿尔卑斯山、舞者的运动与节奏,以及自然中的尖叫等视觉和叙事内容,用来探索文字化视觉信息与音乐生成之间的联系。
使用方式
正文以研究展示页的形式提供多组 Text prompt、Generated audio 和 melody prompt 示例,访问者可按文字提示、连续文字提示或文字加旋律的条件查看生成音频。页面还展示了音频多样性实验,包括固定相同文字提示,以及同时固定文字提示和 semantic tokens 的样本。正文没有提供独立客户端、浏览器插件、命令行工具、API 调用方式或注册说明。
适用人群与场景
音乐生成研究者可以参考 MusicLM 的文字条件、旋律条件、长时生成和多样性实验。需要探索配乐概念的创作者,可以从游戏配乐、电影配乐、舞蹈音乐、冥想音乐和不同年代俱乐部音乐等提示示例中了解模型的表达范围。对多模态生成感兴趣的研究者,则可以关注绘画描述生成音乐的案例。数据集使用者还可以利用公开发布的 MusicCaps 音乐—文本配对开展后续研究。
注意事项
页面中的音频区域依赖浏览器音频元素,正文多处显示“Your browser does not support the audio element.”,因此部分浏览器可能无法直接播放示例音频。官网正文只提供研究论文、示例和数据集信息,没有说明面向公众的在线创作入口、商业授权、收费档位或免费使用额度。