跳到主要内容
项目详情

字幕说是一款面向视频创作的音频文案对齐工具,核心解决已有文案视频的字幕制作问题。它不以传统语音识别为主要路径,而是让用户上传音频与定稿文案,通过强化的对齐算法直接生成字幕时间轴,从而减少多音字、专有名词、方言等识别错误带来的后期修改。官网同时提供语音合成方向,包含数百种中英文拟人声音,面向网课、Vlog 配音和有声书等场景,不过该功能目前标注为“即将上线”,并处于内测招募阶段。

核心功能

音频与文案对齐

字幕说专门针对已经拥有文案的视频进行音频和文字匹配。用户提供音频与文案后,系统通过强化的对齐算法处理两者关系,不需要先经历完整的语音识别流程,重点是让现有文案与实际语音时间位置对应起来。

生成 SRT 字幕轴

对齐完成后可以生成 SRT 字幕轴,官网将其描述为“毫秒级准确”。这项能力适合需要把定稿文案快速转成字幕时间轴的视频内容,也能避免传统识别中错别字和不符合剪辑习惯的断句问题。

基于定稿文案减少识别错误

传统 ASR 在多音字、专有名词和方言场景下可能出现严重错别字,生成结果还需要耗费时间进行改错。字幕说以用户提供的定稿文案作为对齐依据,官网强调可以消除错别字方面的担忧,适用于文案已经确定、重点在时间轴制作的内容。

中英文语音合成

官网展示了语音合成(TTS)方向,提供数百种中英文超自然拟人声音,计划用于网课、Vlog 配音和有声书。该功能页面同时标注“Coming Soon”和“内测招募中”,因此当前属于即将上线的能力,而不是已经明确开放的完整功能。

使用方式

使用时需要上传音频与文案,再进入音文对齐流程生成 SRT 字幕轴。官网提供“立即体验对齐”入口,并说明注册账号即可领取 100 分钟免费额度;页面没有说明必须自备模型 Key,也没有展示 API 或命令行使用方式。语音合成入口与对齐入口同时出现,但语音合成目前仍处于即将上线和内测招募阶段。

适用人群与场景

已有视频文案的创作者可以用它把定稿文字与音频快速对齐,制作 SRT 字幕轴。网课制作者可关注其语音合成方向,用于课程配音;Vlog 创作者可将其用于配音场景;有声书制作人员也属于官网明确列出的语音合成适用人群。对于包含多音字、专有名词或方言、且不希望反复修改识别错字的内容,官网强调了基于定稿文案对齐的方案价值。

定价

字幕说采用免费额度加付费套餐的方式。新用户注册账号即送 100 分钟免费额度;付费方案中,官网展示 ¥125 可使用 30,000 分钟,折算为平均每分钟 0.004 元。页面将该方案定位为专业音文对齐套餐,并称其可显著低于大型识别平台每分钟 0.5—1.5 元的平均收费。

注意事项

语音合成功能目前标注为“即将上线”,并处于内测招募中。字幕对齐功能针对的是已有文案的视频,需要用户提供音频与文案;官网没有说明没有文案时是否能够单独进行语音识别,也没有展示 API、命令行或其他接入方式。

音频文案对齐上传音频与文案,通过强化的对齐算法生成毫秒级精准的字幕时间轴。
SRT 字幕轴生成针对已有文案的视频,快速生成 SRT 字幕轴。
中英文语音合成提供数百种中英文超自然拟人声音,适用于网课、Vlog 配音和有声书。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

字幕说 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500