跳到主要内容
项目详情

Private AI Audio Transcription & Dictation 是一款在浏览器本地运行的音频转录与语音听写工具,使用 Whisper 将音频或视频转换为文字,也支持通过麦克风进行实时听写。它的主要特点是处理过程在用户自己的浏览器中完成,文件不会上传,也不需要账号或服务器。工具同时提供文件转录和实时语音转写两种使用方式,并支持复制或下载生成的文字结果。\n\n### 核心功能\n\n#### 音频与视频文件转录\n用户可以将文件拖放到页面中,或点击“Browse Files”选择文件。工具支持 MP3、WAV、M4A、OGG、FLAC、MP4、MOV 和 WEBM 等格式,单个文件最大为 2 GB。文件交给浏览器中的 Whisper 处理后,会生成可复制或下载的纯文本转录结果。\n\n#### 浏览器本地处理\n转录过程在浏览器本地执行,官网明确说明文件不会离开设备,也不会上传到服务器。页面展示的运行配置包括 Whisper Base 模型、Wasm(CPU)后端和 CPU 推理,因此音频或视频处理不依赖远程服务器。\n\n#### 实时语音听写\n除了导入已有文件,用户还可以点击麦克风并允许浏览器访问麦克风,然后开始说话。语音会在浏览器中实时转写,文字会随着讲话出现,结束后可以复制或下载听写内容。\n\n#### Whisper 模型缓存\n页面会初始化 Whisper 模型,模型首次下载后会在本地缓存,之后不必重复下载。官网将这一过程描述为只发生一次,并在模型下载完成后保存在本地缓存中。\n\n#### 文字复制与下载\n无论是文件转录还是麦克风听写,完成后都可以复制文字,也可以下载 transcript。输出形式为纯文本,适合直接取用转录或听写结果。\n\n### 使用方式\n\n该工具直接在浏览器页面中使用,不需要注册账号,也不要求把文件上传到服务器。文件转录时,将支持的音频或视频拖入页面,等待 Whisper 在浏览器中完成处理;实时听写时,点击麦克风、允许麦克风访问并开始讲话。模型首次使用时会进行初始化和下载,之后缓存于本地。转录完成后,可以复制或下载纯文本结果。\n\n### 适用人群与场景\n\n需要把 MP3、WAV、M4A 等音频转换为文字的人,可以使用文件转录功能处理本地录音;需要处理 MP4、MOV、WEBM 等视频内容的人,可以导入视频并获取文字稿;进行会议记录、口述内容整理或快速文字输入的人,可以通过麦克风使用实时听写。对于不希望上传音频或视频的用户,浏览器本地处理和“不上传”的设计也提供了对应的使用方式。\n\n### 注意事项\n\n单个导入文件的大小上限为 2 GB。首次使用需要等待 Whisper 模型初始化并下载,模型之后会缓存到本地。实时听写需要允许浏览器访问麦克风。页面显示的默认模型为 Whisper Base,运行配置为 Wasm(CPU)后端和 CPU 推理。

本地浏览器转录使用浏览器中的 Whisper 模型处理音频或视频,文件不会上传。
实时语音听写允许麦克风访问后即可讲话,文字会在浏览器中实时出现。
多格式导入支持 MP3、WAV、M4A、OGG、FLAC、MP4、MOV 和 WEBM,单文件最大 2 GB。
复制或下载文本转录或听写完成后,可以复制或下载纯文本结果。
本地缓存模型Whisper 模型首次下载后会缓存到本地,之后无需重复下载。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

Private AI Audio Transcription & Dictation 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500