字幕说是一款面向视频创作的音频文案对齐工具,核心解决已有文案视频的字幕制作问题。它不以传统语音识别为主要路径,而是让用户上传音频与定稿文案,通过强化的对齐算法直接生成字幕时间轴,从而减少多音字、专有名词、方言等识别错误带来的后期修改。官网同时提供语音合成方向,包含数百种中英文拟人声音,面向网课、Vlog 配音和有声书等场景,不过该功能目前标注为“即将上线”,并处于内测招募阶段。
核心功能
音频与文案对齐
字幕说专门针对已经拥有文案的视频进行音频和文字匹配。用户提供音频与文案后,系统通过强化的对齐算法处理两者关系,不需要先经历完整的语音识别流程,重点是让现有文案与实际语音时间位置对应起来。
生成 SRT 字幕轴
对齐完成后可以生成 SRT 字幕轴,官网将其描述为“毫秒级准确”。这项能力适合需要把定稿文案快速转成字幕时间轴的视频内容,也能避免传统识别中错别字和不符合剪辑习惯的断句问题。
基于定稿文案减少识别错误
传统 ASR 在多音字、专有名词和方言场景下可能出现严重错别字,生成结果还需要耗费时间进行改错。字幕说以用户提供的定稿文案作为对齐依据,官网强调可以消除错别字方面的担忧,适用于文案已经确定、重点在时间轴制作的内容。
中英文语音合成
官网展示了语音合成(TTS)方向,提供数百种中英文超自然拟人声音,计划用于网课、Vlog 配音和有声书。该功能页面同时标注“Coming Soon”和“内测招募中”,因此当前属于即将上线的能力,而不是已经明确开放的完整功能。
使用方式
使用时需要上传音频与文案,再进入音文对齐流程生成 SRT 字幕轴。官网提供“立即体验对齐”入口,并说明注册账号即可领取 100 分钟免费额度;页面没有说明必须自备模型 Key,也没有展示 API 或命令行使用方式。语音合成入口与对齐入口同时出现,但语音合成目前仍处于即将上线和内测招募阶段。
适用人群与场景
已有视频文案的创作者可以用它把定稿文字与音频快速对齐,制作 SRT 字幕轴。网课制作者可关注其语音合成方向,用于课程配音;Vlog 创作者可将其用于配音场景;有声书制作人员也属于官网明确列出的语音合成适用人群。对于包含多音字、专有名词或方言、且不希望反复修改识别错字的内容,官网强调了基于定稿文案对齐的方案价值。
定价
字幕说采用免费额度加付费套餐的方式。新用户注册账号即送 100 分钟免费额度;付费方案中,官网展示 ¥125 可使用 30,000 分钟,折算为平均每分钟 0.004 元。页面将该方案定位为专业音文对齐套餐,并称其可显著低于大型识别平台每分钟 0.5—1.5 元的平均收费。
注意事项
语音合成功能目前标注为“即将上线”,并处于内测招募中。字幕对齐功能针对的是已有文案的视频,需要用户提供音频与文案;官网没有说明没有文案时是否能够单独进行语音识别,也没有展示 API、命令行或其他接入方式。