IBM Text to Speech 是 IBM 提供的云端文字转语音 API 服务,用于将书面文字转换为多种语言和声音的自然语音。它可以接入现有应用,也可以与 watsonx Assistant 配合,为用户生成可听见的语音响应。官网将其应用方向描述为改善客户体验、提升信息可访问性、提供免手阅读的音频选项,以及自动化客户服务交互。与仅提供基础朗读的工具相比,该服务强调深度神经网络生成的自然语音、语音属性控制、品牌声音定制,以及在公有云、私有云、混合云、多云或本地环境中的部署能力。
核心功能
多语言实时语音合成
服务支持实时语音合成,可为客户服务等场景提供多语言、自然听感的语音支持。官网将其定位为能够把书面文字转换为音频,帮助不同语言背景的客户理解信息。具体可使用的语言和声音取决于服务版本;Deploy Anywhere 版本明确包含 16 种受支持的语言和方言。
自然语音与神经网络声音
IBM Text to Speech 使用经过人类语音训练的深度神经网络,自动生成平滑、自然的语音质量。官网将 Neural Voices 描述为由深度神经网络驱动的清晰、自然的声音,可用于改善客户体验。该服务还提供多种声音选择,以适应不同语言和使用场景。
SSML 语音属性控制
服务支持通过 Speech Synthesis Markup Language 调整发音、音量、音高、速度及其他语音属性。对于不常见的词语,可以使用 IPA 或 IBM SPR 指定词语发音,从而明确系统应如何朗读特定词汇。这样,输入文字并不只是被直接朗读,语音输出还可以根据内容要求进行控制。
品牌声音与自定义声音
Premium 版本支持创建品牌专属声音。官网说明,用户可以根据选定的说话者,使用最少一小时的录音来设计独特的品牌神经网络声音。除自定义声音外,服务还提供 Voice transformation,可通过强度、音高、气声、语速、音色等属性个性化声音质量。
表达方式与说话风格
服务提供 Expressiveness 能力,可以通过选择特定说话风格控制语气,包括 GoodNews、Apology 和 Uncertainty。对于需要根据业务情境表达不同情绪或态度的语音交互,这些风格选项可以用于改变语音的表达方式。官网同时将自定义发音、语音属性和声音转换列为可组合使用的语音定制能力。
使用方式
IBM Text to Speech 以云端 API 形式提供,可嵌入现有应用,也可在 watsonx Assistant 中使用。官网提供 API reference、Watson SDK repository 和文档资源,并提供创建语音聊天机器人的示例,用于将 watsonx Assistant 收到的文字转换为电话中的语音响应。服务支持免费试用,页面也提供在线演示入口。对于部署环境,Deploy Anywhere 版本可部署在防火墙之后或任意云环境,并可通过 IBM Cloud Pak for Data 使用;IBM 还说明该服务已经以容器化库形式提供给合作伙伴,用于嵌入商业应用。
适用人群与场景
呼叫中心和客户服务团队可以使用它,让 Watson 驱动的虚拟助手通过电话回答常见问题,减少客户等待时间。需要提升客户可访问性的产品团队,可以将书面信息转换成音频,帮助不同能力的用户理解内容。企业应用和软件厂商可以通过 API、SDK 或容器化库,将自然语音集成到商业应用中,并在 Premium 版本中使用品牌专属神经网络声音。部署有数据治理或基础设施要求的组织,可以选择公有云、私有云、混合云、多云、本地环境,或采用 Deploy Anywhere 方案。
定价
Lite 版本免费,每月可使用 10,000 个字符,适合开始使用。Standard 版本价格低至每千字符 0.02 美元,提供不限字符数、高价值功能和可用性保障。Premium 版本需联系 IBM 获取价格,面向需要更大容量和数据保护的大型及安全敏感型企业,并包含自定义品牌神经网络声音和 99.9% 高可用性及服务级别正常运行时间保证。Deploy Anywhere 版本同样需联系 IBM 获取价格,包含每月不限字符数、35 种神经网络声音和 16 种受支持的语言及方言。
注意事项
自定义品牌神经网络声音属于 Premium 功能。Premium 和 Deploy Anywhere 版本的页面价格均标注为联系 IBM 获取报价;Deploy Anywhere 还明确面向需要在防火墙之后或任意云环境部署的场景。服务页面所在地区显示为美国(英语),页面同时提示来自中国的访问者可切换到相应地区页面获取产品、定价和内容。