跳到主要内容
项目详情

ZideAI 是由卡迪文(上海)互联网软件有限公司提供的中文自然语音生成与多模态人工智能服务,核心方向是使用自研语音生成大模型和海量中文语音数据,生成接近真人表现的合成语音。产品覆盖文本生成声音、视频生成声音、语音克隆和角色微调等能力,重点面向 AI 数字人、新闻配音、视频配音以及需要专业商用语音服务的企业。与单纯的文字转语音工具相比,ZideAI 还提供零样本、少样本克隆和快速微调系统,并开放商用 API、技术文档和专属线路部署等服务选项。

核心功能

中文自然语音合成

ZideAI 的语音合成系统面向中文自然语音生成,使用自研语音生成大模型并训练于海量中文语音数据。系统可以从文本生成声音,并在情感、音色和语速等方面进行语音表现控制,官网将其描述为能够做到与真人无异。产品同时支持中文和英文语言,适用于需要将文字转为配音素材的场景。

零样本与少样本语音克隆

NikaTTS V2 尼卡文字转语音系统提供零样本、少样本的克隆技术,能够使用较少的语音资源完成角色声音克隆。官网特别展示了 3 秒语音克隆能力,用于体现模型的通用性,但同时明确说明该能力在商用场景下存在稳定性问题,因此 3 秒克隆更适合作为技术展示,不能直接视为稳定的商业交付方案。

全自动克隆系统

NikaTTS V2 支持全自动克隆系统,减少语音克隆过程中的人工处理。官网在角色功能区域提供角色句子刷新和重新生成能力,并展示角色微调标识、多情感标识等状态,用于区分已经完成微调或具备多情感能力的角色。相关功能围绕角色声音生成展开,可服务于数字人和配音等使用场景。

快速微调

ZideAI 提供低成本快速微调系统,适用于希望基于语音资源定制角色声音的用户。官网说明,1 分钟至 1 小时的语音资源可以在 1 小时内完成微调,价格为 50 元/角色。该能力可用于建立定制化声音角色,但具体角色数量、服务速度和部署形式会根据个人、小团队、企业或合作伙伴方案有所区别。

多模态声音生成与商用服务

产品不仅支持从文本生成声音,也支持从视频生成声音,官网将其定位为多模态人工智能能力。对于 AI 数字人、新闻配音和视频配音等企业场景,ZideAI 提供专业技术支持,并设有商用 API、技术文档和专属线路部署方向。专业商用客户还可以使用专属线路,合作伙伴方案则支持根据需求定制并提供独立服务器部署。

使用方式

官网展示了基于角色的语音生成界面,用户可以刷新角色句子并重新生成声音,同时查看角色微调和多情感标识。服务支持中文和英文语言,并提供商用 API 与技术文档入口。小团队方案标注为无需任何技术基础即可快速上手;官网没有说明是否必须注册,也没有提到需要用户自备模型 Key。导出格式、客户端和命令行支持情况未在正文中说明。

适用人群与场景

AI 数字人团队可以使用语音合成、角色克隆和多情感能力,为数字人生成声音。新闻内容生产者可将文字转化为新闻配音。视频制作团队可以使用文本生成声音或视频生成声音能力完成视频配音。需要定制角色、批量生成或独立部署的企业与合作伙伴,则可以选择快速微调、商用 API、专属线路或独立服务器部署服务。

定价

NikaTTS V2 的语音生成价格低至 5 元/万字,快速微调价格为 50 元/角色。小团队、企业和合作伙伴分别对应个人及小团队使用、更多角色与功能、按需求定制和独立服务器部署等方案,官网提供充值或联系入口。特定场景和需求可能会针对性提高价格,以保证服务速度和特殊效果;官网同时表示不同策略下的生成质量保持一致。

注意事项

官网明确提示,3 秒克隆技术主要用于展示模型通用性,商业使用存在稳定性问题。快速微调所需语音资源范围为 1 分钟至 1 小时,官网未进一步说明其他输入要求、输出格式或商用授权细则。生成服务在特定场景和需求下可能提高价格,以保障服务速度和特殊效果。

中文自然语音合成基于自研语音生成大模型,从文本生成声音,并支持情感、音色和语速表现。
3秒语音克隆NikaTTS V2 支持 3 秒语音克隆,并提供零样本、少样本克隆能力。
快速语音微调1分钟至1小时语音资源可在1小时内完成微调,价格为50元/角色。
多模态声音生成支持从文本生成声音,也支持从视频生成声音,覆盖多模态应用场景。
商用部署支持提供商用 API、技术文档、专属线路及合作伙伴独立服务器部署选项。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

ZideAI 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500