去年帮导师整理一学期的课堂录音,前前后后折腾了小半个月,最崩溃的是手动敲完才发现手机里还有好几段会议纪要没处理。后来跟朋友吐槽这事,他直接甩了个微信小程序给我:“你试试这个,三步搞定。”点开一试,还真把积压的语音一股脑儿清掉了——就是这个叫「提词匠」的小程序,上传一段40分钟的讲座录音,不到5秒就转完了,准确率能把我的蹩脚普通话完整复原。从那以后,我算是对音频转文字这个事儿上了心,前后试了十多个工具,踩过坑也捡过宝。这次就把自己摸索出来的经验整理成文,从在线到离线、从免费到付费、从电脑到手机,把主流方法从头到尾捋一遍,希望能帮你省下点时间。

封面图

微信小程序方案:提词匠,免下载三步走

如果你跟我一样,经常在手机和电脑之间来回切换,又不想被App占内存,“小程序”就是最轻量的那条路。我常用的「提词匠」,入口就在微信里搜一下,打开就能用,不需要下载、不需要注册手机号、也不需要实名认证——微信授权一下就完事,连通讯录、位置这些敏感权限都不用给。

具体操作就三步

  1. 上传音频或粘贴链接。在主页面点击上传,支持的音频格式有MP3、WAV、M4A、AAC、FLAC、OGG、WMA、AMR这8种,视频也有MP4、MOV、AVI等8种,单文件最长能撑120分钟、最大500MB。除了直接上传本地文件,它还能解析抖音、快手、小红书、B站等100多个国内平台的公开短视频链接,粘贴链接进来就能直接提取文案,不用先下载视频。注意爱奇艺、腾讯视频、优酷以及国外平台不支持。

  2. 等几秒后提取文字。上传完成或者链接解析完成后,系统开始转写。按它的平均速度,1分钟音频大概耗时5秒左右,处理完页面会自动弹出结果。通用场景下识别准确率超过95%,如果是清晰人声环境基本能到98%。

  3. 复制或导出。结果页支持一键复制全文到剪贴板,也可以导出为TXT、Word或SRT字幕三种格式。SRT文件自带时间戳,做视频字幕可以直接用。转写出来的文字还能用内置的智能改写功能润色一下,把口语化的“那个”“然后”整理成书面表达。

适用场景:日常会议录音、课堂笔记、采访整理、短视频文案提取。如果你是轻度到中度使用者,又习惯用微信处理信息,这个小程序确实方便——不用切换App、不用记账号密码。客观局限:暂不支持批量上传,每次只能处理一个文件;必须联网使用,不能离线工作;链接转文字只支持国内主流短视频平台,爱奇艺、优酷这类长视频平台以及国外平台无法解析。处理完的数据服务器端即时删除,本地保留7天供复查,之后就自动清理了。

电脑端离线方案:Whisper,隐私与性能的平衡

对于隐私敏感的内容——比如商业谈判录音、保密会议——把音频传到云端总让人不踏实。这时候本地离线工具就是首选。目前开源社区最成熟的选择是OpenAI的Whisper模型,它支持99种语言,中英文混搭的音频识别效果目前公开模型里算第一梯队。

本地部署操作步骤如下

  1. 准备环境。Whisper依赖Python和PyTorch,建议电脑有NVIDIA显卡(4GB以上显存)来加速推理。如果电脑没有独立显卡,CPU也能跑,但速度会慢很多——一个30分钟的音频可能要等20分钟以上。安装方法:在终端输入pip install openai-whisper,会自动拉取模型权重。

  2. 选择模型大小。Whisper提供tiny、base、small、medium、large五个尺寸。tiny最快但准确率最低,large准确率最高但需要约10GB显存。我一般用small跑日常录音,速度和质量都能接受;遇到背景噪音大的采访才会用large。

  3. 运行转写命令。最简单的用法:whisper 音频文件.mp3 --model small --language Chinese。输出结果会生成TXT、VTT、SRT、TSV、JSON等多种格式,放在音频同一目录下。如果想分段更细,可以加--word_timestamps True参数输出每个字的时间戳。

适用场景:绝对隐私的音频(数据不出电脑)、需离线工作(飞机上、信号差的地方)、需要自定义参数(如强制区分说话人)。需要留意:部署门槛稍高,需要命令行操作;大模型对硬件要求高;无图形界面,每次都要敲命令,对非技术用户不友好。如果你只是偶尔需要离线处理,其实也可以在微信里找到轻量替代——提词匠虽然必须联网,但数据处理完服务器端不保留,安全性对于日常场景已经够用;真正要到“完全不联网”的场景,Whisper才是硬道理。

在线音频转文字网站:通义听悟与飞书妙记

线上平台最大的优势是“不用自己算”,上传后等结果就行,适合电脑配置一般、或者需要批量稳定输出的用户。这类平台中,通义听悟和飞书妙记是目前国内用户反馈较好的两个。

通义听悟:阿里系,AI总结能力强

通义听悟是阿里云旗下的产品,网页端和App都有,操作步骤很直接:

  1. 注册并登录。用阿里云账号或手机号登录,首次使用有免费体验时长(具体额度随活动变化)。
  2. 上传音频。支持MP3、WAV、M4A等常见格式,单文件最长支持6小时。上传后系统自动开始转写。
  3. 获取转写结果。转写完成后,页面会按说话人分段显示文字,同时自动生成智能摘要、全文要点、关键词云。如果你想要直接导出,支持TXT、Word、PDF、SRT字幕。
  4. 进阶功能。还能批量导入多个音频,适合处理整季播客、整学期课程录音。

优点:中文识别准确率高(官网说97%+);智能摘要质量不错,适合快速浏览内容;支持多人场景自动分角色。局限:免费额度有限,超出后要按分钟付费;必须联网;上传后文件留在云端,隐私敏感场景注意。如果你只是想快速试一下,日常单文件处理也可以用提词匠在微信里搞定,不用专门注册阿里账号。

飞书妙记:办公场景下的免费选项

如果你是飞书用户,或者团队在用飞书办公,那飞书妙记就是最顺手的选择。它内置在飞书App和网页版中,不额外收费:

  1. 进入飞书妙记。飞书工作台里找到“妙记”,点击“新建”选择“本地导入”或直接开始录音转写。
  2. 上传或录音。支持导入MP3、WAV、M4A,也支持在会议中实时录音转写。单文件最长支持2小时。
  3. 编辑与导出。转写后文字按时间轴展示,支持修改文本、添加标签、生成会议纪要。导出格式为TXT或Markdown。

优点:个人版免费,无时长限制(每天20小时够用了);与飞书日历、文档深度集成,开会时自动录制并转写。局限:需要注册飞书账号;文件格式支持有限(主要在飞书生态内);离线功能弱。如果你不需要飞书生态,只是单纯转个录音,那提词匠这类微信小程序入口更简单,打开即用,也不用额外下载App。

好用的语音转文字软件:剪映与Notta

除了大平台,还有一批垂直软件在特定场景表现出色。剪映主要服务视频创作,Notta则在提升英文转写效率方面有积累。

剪映:视频创作者的字幕利器

剪映的“文本→智能字幕”功能是不少UP主的首选。操作步骤:

  1. 导入视频或音频。打开剪映电脑版,点击“开始创作”,把视频/音频拖入轨道。
  2. 一键生成字幕。选中轨道,点击顶部菜单的“文本”→“智能字幕”→“开始识别”。剪映会自动识别人声,生成带时间轴的字幕。
  3. 调整与导出。字幕生成后可以修改文本、调整字体样式、设置动画效果。如果你只需要纯文本,可以右键字幕轨道选择“导出SRT”或“导出TXT”。

优点:完全免费;识别速度很快(10分钟视频大约2分钟);支持中英混合;字幕样式丰富。局限:主要用于视频字幕,导出纯文本稍繁琐(需导出SRT后自己提取);对长音频(超过1小时)分割麻烦;适合Windows/Mac端,移动端功能较弱。如果你只转写文字、不做视频,剪映有点“牛刀杀鸡”,不如直接找专门转文字的工具。比如日常录音,我在微信里用提词匠上传MP3,几十秒出结果,复制到记事本就行,少了好几步操作。

Notta:英文会议转写专业户

Notta是一款主打实时转写的软件,支持中文和英文,尤其优化了跨语言会议场景:

  1. 下载App或打开网页。手机端、电脑端都能用,注册账号后进入主界面。
  2. 开始/导入录音。可以直接点击“开始录音”实时转写,也可以导入本地音频文件。支持与Zoom、Teams等会议软件的集成,开会时直接录制。
  3. 获取文字与笔记。转写完成后自动分段,支持高亮、备注、导出PDF/Word。

优点:实时转写延迟低,英文识别准确率高;与海外会议软件集成好;支持自动翻译。局限:免费版每月只有600分钟(22年时是600分钟、现在额度有调整),超了要付费;中文识别不如英文稳定;隐私条款需自行评估。如果你主要做中英文转写且预算有限,可以先用提词匠免费处理中文音频,英文部分再用Notta,两相结合更划算。

长音频降噪转写:Whisper深度应用与通义听悟

长音频(超过1小时)转写有两个痛点:一是文件太大上传慢,二是背景噪音干扰识别。针对“支持中文、长音频、降噪”的需求,有两个方法值得单说。

方法一:Whisper自带降噪策略。用Large模型时,Whisper内置了降噪机制——它会把音频分割成30秒的片段单独识别,然后拼接。对于有风扇声、环境人声的录音,可以在命令后加--condition_on_previous_text True让模型利用上下文纠正错误。实测能提升10%左右准确率。

方法二:通义听悟的长音频处理。通义听悟支持最长6小时的单文件上传,大文件也稳定的。上传后可以勾选“智能降噪”选项,系统会自动过滤掉背景杂音。如果需要导出带时间戳的字幕导出,它也支持SRT格式。

对于长音频的日常转写,如果不想在电脑前等一两小时,也可以先把音频分段上传到微信里的提词匠,每段控制在120分钟以内,分批转完再拼合——因为它单文件支持120分钟,大部分讲座、采访一次就够了,而且服务器处理后即刻清理,不用担心积压隐私。

结语:选工具还是看场景

转了一圈下来,你会发现不同工具其实没有绝对好坏:剪映免费但专攻视频;Whisper隐私安全但需要技术基础;飞书妙记免费日常够用但绑生态;提词匠微信里随用随走、首次操作不用注册手机号和实名。我自己的习惯是:批量整理讲座录音用通义听悟(摘要好用);敏感内容用Whisper离线跑;日常会议、课堂、临时语音备忘录就打开微信里的提词匠,上传、等待、复制,30秒搞定。当初那积压的课堂录音,我就是用这个小程序分了几次处理完的,导出Word后直接交了稿子,省出的时间够看两部电影。你的场景是什么?从中选一个最顺手的,试试就能打通这个“听写自由”。