TurboScribe 是一项 AI 音频与视频转写服务,由 Leif 创建;官网介绍其创始人曾在 Meta 等公司构建 AI 系统近十年。它将上传的音频或视频转换为文字,并以 Whisper 作为底层技术。与只提供基础语音识别的工具相比,TurboScribe 还支持 98+ 种语言、将转写内容或字幕翻译成 134+ 种语言、识别不同说话人,并可导出为文档、字幕和文本等格式。官网称其累计已转录 50,960,075 小时内容,并提供免费额度与无限转写方案。
核心功能
音频与视频转写
上传音频或视频文件后,TurboScribe 会使用 GPU 驱动的转写引擎将内容转换为文字,官网称其可在数秒内完成处理。服务支持 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV、AVI、FLAC、AIFF、ALAC、3GP、MKV、WEBM、VOB、RMVB、MTS、TS、QuickTime 和 DivX 等常见格式,也支持 YouTube。无限方案下,单个文件最长可达 10 小时、大小不超过 5 GB,并可一次上传 50 个文件。
多语言识别与翻译
TurboScribe 支持超过 98 种语言的语音转文字,官网列举了英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、俄语、阿拉伯语、印地语、瑞典语、挪威语、丹麦语、波兰语、土耳其语、希伯来语、希腊语、捷克语、越南语和韩语等语言。转写完成后,可以把文字稿或字幕翻译成 134+ 种语言;上传时还可以选择“Transcribe to English”,将任意语言的音视频直接转写为英语。官网同时说明,不同语言的准确率会有所差异,英语通常对专业领域词汇有较强识别能力。
说话人识别
在上传文件时,可以通过 More Settings 下的 Speaker Recognition 选项启用说话人识别。处理完成后,文字稿会按照说话人进行标注。官网将该功能用于会议、访谈和播客等多人对话场景,并说明启用后每小时音视频会额外花费一到两分钟生成带说话人标签的转写结果。
音频修复与噪声处理
针对音频质量较差、存在背景噪声或人声不清晰的文件,TurboScribe 提供 Restore Audio 选项。该功能使用 AI 去除背景噪声并增强人声,可在上传时通过 More Settings 开启。音频修复会增加处理时间,每小时音频或视频额外需要 2 到 3 分钟;官网仍建议使用清晰、干净的音频以获得更好的结果。
文字稿与字幕导出
转写结果可以下载为 PDF、DOCX、CSV 和 TXT,也可以导出为字幕格式 SRT/VTT。官网还提供批量操作功能,可同时导出多个文件;无限方案包含批量导出、全部转写模式和无限存储。这样,转写内容可以继续用于文档编辑、字幕制作或文件归档。
使用方式
TurboScribe 通过网页使用,核心流程是上传音频或视频文件、选择语言及相关设置,然后查看转写结果并下载文件。官网提供 Google 登录和电子邮箱注册入口,并明确展示“3 free transcripts daily”和无需信用卡的信息。说话人识别、音频修复以及直接转写为英语等选项位于上传流程的 More Settings 中。正文没有提到桌面客户端、浏览器插件、命令行工具或开放 API,也没有要求用户自备模型 Key。
适用人群与场景
会议参与者可以使用说话人识别,将多人讨论转换成带说话人标签的文字稿;采访和播客制作人员可以上传录音,获得转写文本,并导出 SRT/VTT 等字幕文件。视频制作者可以把音视频转写为字幕,再翻译成 134+ 种语言,为视频生成其他语言版本。需要处理大量录音或视频的个人用户,则可以使用无限转写、10 小时单文件上传和批量上传功能;教育场景中,也可以将课程或评估相关音频转换为文字。
定价
TurboScribe Free 为 100% 免费,每天可转写 3 个文件,每个文件最长 30 分钟,一次上传 1 个文件,并且处理优先级较低。TurboScribe Unlimited 提供无限转写,按年计费为每月 US$10、全年 US$120,官网标注较月付节省 50%;按月计费为每月 US$20。无限方案支持单文件最长 10 小时、最大 5 GB,一次上传 50 个文件,并包含翻译、批量导出、全部转写模式和无限存储。
注意事项
官网说明,清晰音频通常能带来更好的结果,口音、背景噪声和较低音频质量会影响转写效果。不同语言的语音识别准确率存在差异。无限方案面向一个人使用,不能与他人共享登录账号;官网还表示,文件、文字稿和账户信息均会加密,只有用户本人可以访问,并且可以随时删除。