Foundry Tools 中的 Azure 语音是 Microsoft 面向开发者提供的语音 AI 服务,使用预生成的可自定义多语言语音 AI 模型,为应用和 AI 智能体提供语音能力。它不只面向文本转语音,还覆盖语音转文本、语音翻译和说话人识别,并可与 Azure OpenAI、Microsoft Foundry 等产品协同使用。服务支持通过 API 和多种编程语言 SDK 集成,也支持使用容器在云中或边缘部署,适合需要在应用、设备、呼叫中心和多语言通信场景中加入语音能力的团队。
核心功能
语音转文本
Azure 语音可以将音频内容转录为文本,用于呼叫中心或会议对话转录,也可生成音频字幕。官网介绍其音频字幕场景覆盖超过 100 种语言,适合需要处理多语言音频内容的应用。服务还支持使用 Azure AI 语音或 Azure OpenAI 中的 OpenAI Whisper 模型转录音频。
文本转语音
服务可以把文本转换为音频,用于构建能够自然说话的机器人和其他支持语音的应用。开发者可以使用定制的真实声音和说话风格区分品牌,也可以通过神经网络定制声音,生成自然的声音。文本转语音的计费依据是要转换为音频的字符数。
语音翻译与多语言通信
Azure 语音支持实时多语言语音转语音翻译和语音转文本听录,可用于翻译音频或文本。官网还介绍了音频或视频数据翻译,以及针对所在行业进行翻译定制的场景;支持的语言会不断扩大,具体语言以当前支持列表为准。
语音智能体与端到端语音
开发者可以使用基础模型,以及自定义音频输入和音频输出模型,为 AI 智能体提供语音支持。端到端语音能力包括自定义听录、语音和虚拟形象,可用于构建支持语音的智能体。Azure 语音也能与 Azure OpenAI 的 GPT 模型结合,用于对话式 AI、通话后分析和视频汇总等解决方案。
自定义声音、虚拟形象与嵌入式语音
服务支持生成自定义语音,也支持使用预构建或自定义的自然声音虚拟形象来呈现品牌。对于云连接时断时续或不可用的环境,可以使用嵌入式语音,在设备上支持语音转文本和文本转语音应用场景。官网同时提供使用容器在云中或边缘部署应用的方式。
使用方式
Azure 语音面向应用和智能体开发,可通过 API 接入,并提供包括 C#、C++ 和 Java 在内的多种编程语言 SDK。官网提供教程、API 参考、示例代码和 SDK 资源,也可以在 Microsoft Foundry 中创建和生成模型。部署方面,服务支持使用容器在云中或边缘运行应用;在网络连接不稳定或不可用的情况下,还可使用嵌入式语音。页面提供“开始使用 Azure”入口,但正文未说明具体注册流程或是否需要自备模型 Key。
适用人群与场景
- AI 应用开发者:为应用或智能体加入语音输入、语音输出、自然对话和虚拟形象。
- 呼叫中心与会议场景团队:将呼叫中心或会议对话转录为文本,并使用通话后分析获取音频或视频录制内容的见解。
- 全球化产品团队:使用多语言语音转文本、语音翻译和音频或视频翻译,支持跨语言通信。
- 设备与边缘应用开发者:在云连接不稳定或不可用的情况下,通过嵌入式语音在设备上实现语音转文本和文本转语音。
定价
Azure 语音采用按使用量付费的方式,仅为所使用内容付费,没有前期成本。语音转文本或语音翻译按需要听录或翻译的音频小时数计费,文本转语音按转换为音频的字符数计费,说话人辨识按事务数计费。Azure 帐户页面提供即付即用或最多 30 天的免费试用选项,正文未列出具体单价。