跳到主要内容
项目详情

Voicemaker 是一款由官网提供的 AI 音频生成与文本转语音工具,核心方式是将文字提示词转换为带有语音、环境氛围和音效的场景化音频。SuperTTS 支持从单条提示词生成广告、故事、歌曲和音乐配乐,也可以用于旁白、播客、解释视频、电话菜单和新闻播报等内容。它的差异在于提供 SuperSeed、Pulse、Mercury 三种面向不同创作目标的音频模型:Pulse 强调相同提示词得到一致结果,Mercury 面向歌曲、演唱和音乐创作,SuperSeed 则在一致性与表达变化之间平衡;同时还提供传统文字转语音、多音轨项目、语音克隆、Speech to Speech 和 AI 配音等能力。

核心功能

提示词生成场景化音频

用户可以在提示词中描述音频场景,生成包含人物对白、旁白、音效和背景音乐的内容。SuperTTS 可用于广告、故事、歌曲和音乐配乐,示例场景还包括播客开场、产品发布、短视频口播、角色对话、新闻播报、预告片和有声书旁白。每次 SuperTTS 生成最多支持 3,000 个字符,并可通过时长和变体控制调整结果。

三种音频模型

SuperSeed 1.0 用于对话密集型工作流、播客、解释内容、电话菜单和音乐主导的音频,支持快速生成并允许一定的表达变化;其最佳使用范围是 3 分钟以内的短音频。Pulse 1.0 适合故事、音频广告、预告片和对白场景,强调可重复的制作结果,并支持自定义语音、音效和背景音乐在提示词中的精确放置。Mercury 1.0 面向歌曲、演唱、背景音乐和电影感配乐,每次运行会产生独特的表达版本,同样适合 3 分钟以内的短音频。

语音选择与声音控制

Voicemaker 提供多种语音模型和声音效果,可选择预定义或自定义声音,并使用 Expressive、High-Res、Turbo 等模型。Expressive 模型面向更具表现力和提示词驱动的动态语音,High-Res 适合有声书、配音和内容创作,Turbo 则强调低延迟语音生成。生成时还可以调整音量、速度和音高,并添加呼吸、耳语、对话、新闻播报、客服、平静、悲伤、愤怒等语音效果。

文本、文件与多音轨编辑

除了直接输入文字,用户还可以上传 PDF、文本或 DOC 文件,系统会自动转换为文字并放入文本框。项目支持多个音轨,能够进行重新排列、预览、编辑和导出;生成的文件会保存到账户历史中,可重新播放、下载或再次使用,也可以随时从 SuperTTS 音频库中删除。音频设置中可选择采样率,生成内容可以导出为 MP3 和其他常见格式,官网其他功能说明还列出了 WAV、OGG、AAC 和 OPUS。

Speech to Speech、VoxFX 与 AI 配音

Speech to Speech 支持上传或录制声音,再将其转换为其他声音或风格,同时保留音调。VoxFX 可通过参考音频和提示词控制声音效果,最多添加 3 条参考音频,每段最长 30 秒、最大 10MB,支持 WAV 和 MP3。AI Dubbing 可以将一种声音翻译并配音到 130 多种语言,同时保留音调和风格,包括克隆声音;官网还提供自定义声音克隆能力。

使用方式

Voicemaker 以网页端编辑器为主要使用方式:输入文字或提示词,选择模型、声音、语言和音频控制后生成内容。用户也可以上传 PDF、文本、DOC 文件,或上传音频与视频文件进行 Speech to Speech;后者单个文件最大 50MB、时长 5 分钟。生成文件会保存至账户历史,可播放、下载、复用或删除。官网明确提供 Ultra-Fast APIs,但给定正文没有说明 API 的调用方式、注册流程或是否需要自备模型 Key。

适用人群与场景

广告和营销团队可以用 Pulse 生成音频广告、产品发布内容和多语言营销活动;播客、视频与有声书创作者可以用 SuperSeed 或 Mercury 制作播客开场、解释视频、短篇故事、有声书旁白和预告片;音乐创作者可以用 Mercury 制作歌曲、演唱、背景音乐和电影感配乐;客服与产品团队则可以使用对话、客服语音、数字助手和 IVR 电话菜单等语音场景。支持中文、英语、日语、韩语及更多语言,适合需要多语言音频内容的制作工作流。

定价

官网正文没有展示具体订阅价格或套餐金额,但明确提供“Unlimited Free Standard TTS”,默认标准语音可永久免费使用,直至用户选择升级到高级功能。部分模型按积分计费:Expressive 和 High-Res 收取 4 倍积分,Turbo、Static 和 Dynamic 收取 2 倍积分;官网还说明,订阅创建的音频可依照套餐条款用于广告、播客、产品和客户项目等商业用途。

注意事项

SuperTTS 各模型主要适合 3 分钟以内的短音频,单次提示词最多 3,000 个字符。SuperSeed 和 Mercury 的部分提示词可能因安全限制无法工作,并受服务条款约束;Pulse 支持所有明确提示词。Pulse 更重视一致性,在复杂提示词下可能需要更长时间。部分高级语音模型会按 2 倍或 4 倍积分计费,且商业使用需遵循对应套餐条款。

提示词生成音频将文字提示词转换为包含语音、环境氛围和音效的场景化音频。
多模型音频创作提供 SuperSeed、Pulse 和 Mercury 模型,分别侧重混合音频、一致性对白和歌曲音乐创作。
多语言语音Pulse 与 Mercury 支持 70 多种语言,SuperSeed 支持 18 种以上语言。
声音与音频参数控制支持选择语音和声音效果,并调整音量、速度、音高、停顿及发音方式。
文件导入与多音轨项目支持上传 PDF、文本和 DOC 文件自动转为文字,并管理多个音轨、预览、编辑和导出。
Speech to Speech 与 AI 配音可上传或录制声音进行风格转换,并将声音翻译配音至 130 多种语言。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

Voicemaker 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500