Tavus 是一家自 2020 年开始探索“人类计算”的 AI 研究实验室,目标是让人与计算机的交流像和朋友或同事交谈一样自然。它将能看、听、行动并进行情绪理解的 AI 应用称为 PAL。PAL 可以作为团队成员、入职引导员、客户专家或陪伴者,服务于培训、HR 入职、客户支持、销售转化和患者信息采集等场景。与只处理文字或单一输入的 AI 工具不同,Tavus 的产品围绕实时视频和语音交互构建,并通过 Phoenix、Raven、Sparrow 等模型处理面部表现、声音、环境、对话节奏和情绪等信号。
核心功能
实时视频与语音交互
PAL 能在实时环境中看、听、理解、说话和做出反应。官网将其描述为具备“perception, understanding, voice, and rendering”能力的交互式对话系统,并提供 Face-to-Face Video 体验。它的目标不是单纯生成文本,而是让 AI 以具有面孔、声音和存在感的方式参与对话。
多模态感知与情绪理解
Raven-1 是 Tavus 的多模态感知模型,负责让机器实时看见、听见并理解信息。它会把面部表情、语气、视线、情绪和环境上下文转化为对话信号,帮助 AI 根据对方的状态和意图做出更具同理心与感知力的回应。
自然对话节奏处理
Sparrow-2 面向实时对话理解,适用于嘈杂和多人说话的环境。模型会处理语义、韵律、说话人身份、附和声、打断、背景语音、噪音和不清晰音频,从而判断何时倾听、等待、说话或继续表达。官网还将其定位为面向实时语音和视频 AI 的新一代轮流发言能力。
实时人脸渲染
Phoenix-4 是 Tavus 的人类渲染模型,用于为 AI 提供面孔、存在感和情绪表现。该模型能够实时合成高保真的面部行为,并根据上下文生成相应的情绪、表情和动作,使 PAL 以更具视觉表现力的方式参与交流。
多场景 PAL 应用
PAL 可用于学习与发展,让它记住学生上次卡住的位置,并再次引导完成相关内容;也可用于 HR 入职,欢迎新员工、介绍公司工具和政策并回答问题。在增长和销售场景中,PAL 能接待网站访客、回答问题并预约会议;在客户支持中,它可以观察故障指示灯或损坏部件,读取保修信息并推进维修;在患者接诊中,它可以按患者自己的节奏完成信息采集,并在临床人员接触患者前提供清晰的情况概览。
使用方式
Tavus 提供三种主要使用路径。开发者可以使用 Developer API,组合感知、理解、语音和渲染能力,创建并部署能够看、听、理解、说话和自然反应的 PAL。企业可以选择由 Tavus 团队设计、构建、调优并在生产环境运行的定制化 PAL 部署,集成和服务保障也由方案团队处理。非开发者则可以通过 PAL Maker 输入一句话,或与 Charlie 对话创建 PAL,并将其部署到网站或应用中;官网提供了开始创建和注册入口。
适用人群与场景
企业培训和学习发展团队可以用 PAL 重复讲解学习内容,并根据学生此前遇到的困难继续引导。HR 团队可以将其用于新员工入职,让 PAL 介绍公司工具和政策、回答入职问题。销售与增长团队可以让 PAL 接待网站访客、回答咨询并预约会议。客户服务和医疗团队则可以分别使用它识别产品问题、处理保修维修,以及在临床人员接诊前完成患者信息采集。
注意事项
官网正文展示了 Developer API、企业定制方案和 PAL Maker,但未提供具体价格、免费额度或付费档位信息。企业定制方案由 Tavus 团队围绕具体工作流设计、构建和运行;API 与无代码创建则对应不同的使用路径。