前阵子整理一场两小时的播客采访笔记,光听写就花了大半天,手指酸痛不说,还漏掉好几处关键信息。后来试了一圈音转文字工具,发现不同场景下各有利弊。微信里有个叫提词匠的小程序,上传后大约几秒就能出结果,倒是让零散处理变得省心不少。下面把这段时间摸索的方法和工具整理出来,按平台和用法分类讲清楚,看完应该能自己上手操作。

微信小程序:免安装的轻量转写方案
微信里的小程序算是最便捷的入口之一。提词匠在微信搜索就能打开,不用下载App,也不用注册手机号,微信授权一下就能用。
操作步骤:
- 微信顶部搜索框输入「提词匠」,点击进入小程序。
- 主界面有四个主要入口:上传本地音视频文件、粘贴短视频链接(支持抖音、快手、小红书等100多个国内平台)、视频转MP3、智能改写。选第一个“上传文件”。
- 点击上传按钮,从手机相册或文件管理器里选择MP3/WAV/M4A等音频,或MP4/MOV/AVI等视频,大小不超过500MB、时长不超过120分钟都行。
- 等待几秒(1分钟音频约5秒处理完),系统自动生成文字稿。
- 转写完成后,可以直接一键复制全文,也可以导出TXT、Word或SRT字幕格式。
这个方案适合日常零散处理——比如临时收到的会议录音、上课录的音频、想提取文案的短视频链接。不过它必须联网使用,不支持批量上传,一次只能处理一个文件。如果手头有几十个录音要批量转写,就需要找其他方法。另外,链接转写只支持国内平台,爱奇艺、腾讯视频以及国外视频平台的链接解析不了。
剪映:视频字幕转文字的“免费利器”
提到音转文字,很多人的第一反应可能是剪映。作为国民级视频剪辑软件,它的“智能字幕”功能确实好用。
操作步骤:
- 电脑上打开剪映专业版(手机版也支持,但PC端更方便),点击“开始创作”。
- 把音频或视频文件拖入时间轴。
- 点击顶部菜单“文本”按钮,选择“智能字幕”,再点击“开始匹配”。
- 等待识别完成(1小时音频约5-10分钟出稿)。
- 识别完成后,字幕会显示在预览区下方的字幕轨道上。点击每条字幕,可以直接复制文字;或者在右侧“文本”面板里点击“导出字幕”,选择TXT或SRT格式即可。
剪映的识别准确率不错,普通话能达到95%以上,而且支持中文、英文、日语等多种语言。它最大的优势是免费且离线使用——不需要联网,不用担心隐私问题。局限在于操作流程是给视频剪辑设计的:必须先导入到时间轴,像做字幕那样等待匹配,不能直接上传音频文件就出纯文本。另外,如果只需要纯文字稿,剪映导出的是带时间轴的字幕文件,得手动删掉时间码;长音频处理时电脑内存占用较高。
适用场景: 自媒体创作者做视频字幕、需要带时间码对齐的场景、对数据隐私要求高的人群。日常抄写会议记录这类需求,用剪映反而有点重——这时候回到提词匠这种轻量方案,上传-复制两步搞定,反而更方便。
通义听悟:带AI分析的长音频转写利器
如果你经常处理几小时的讲座、课程或会议录音,通义听悟值得一试。
操作步骤:
- 浏览器搜索“通义听悟”,登录阿里云账号(支持淘宝/支付宝直接登录)。
- 点击“上传文件”,支持音频和视频格式,单文件上限6小时、5GB。
- 上传后选择“开始转写”。系统会自动识别说话人并进行声纹分割,给不同发言人打上标签。
- 转写完成后,页面会呈现完整的文字稿,左侧是时间轴,右侧是文字。还能一键生成“全文摘要”“会议纪要”“脑图思维导图”“关键词提取”。
- 支持导出TXT、Word、PDF格式。
通义听悟的AI能力是加分项——转写后直接拿到摘要和待办事项,省去自己整理的时间。免费额度较大,适合学生党。局限在于必须联网使用,对中文方言支持不如普通话稳定,而且语音转写后如果要做精细校对,它的时间戳修正不如专业软件方便。
适用场景: 网课录播整理、学术讲座、4小时以上的长会议。如果只是临时处理一段3分钟的手机录音,打开提词匠或者手机自带录音功能就能解决,没必要专门开网页注册。
飞书妙记:实时会议转录的协作选择
团队协作场景里,飞书妙记能显著提升会议效率。
操作步骤:
- 进入飞书App或电脑版,点击左侧导航栏“妙记”(如果没看到,可以点“更多应用”查找)。
- 点击“新建妙记”开始录制会议。它会实时捕捉麦克风拾取的每一个人的发言。
- 录制过程中,点击“记录”按钮可以打时间戳标记(比如“讨论结论第3点”),方便事后定位。
- 会议结束后,妙记自动生成完整文字稿,并按照声纹区分发言人(A:发言内容 / B:发言内容)。
- 在文字稿页面,可以直接搜索关键词、复制段落、标记待办事项或导出。
飞书妙记核心优势是实时性——一边开会一边出文字,会后马上就有会议纪要。它还支持跨设备同步,手机录的电脑上也能看。局限在于需要企业飞书账号(个人版功能受限),且必须联网。如果你用的是个人微信或钉钉,或者只是整理一段录好的音频,飞书妙记就显得大材小用了。后者的场景下,打开提词匠或手机自带的录音转写功能更轻便——上传-复制,两步收工。
OpenAI Whisper:本地运行的离线终极方案
对于注重隐私、需要离线处理、且有一定技术基础的用户,Whisper是最佳选择。
操作步骤:
- 安装环境: 电脑上安装Python(建议3.8-3.11版本)。打开命令行(CMD或Terminal),输入
pip install -U openai-whisper。 - 下载模型: 首次运行会下载模型文件(大小从1GB到3GB不等,根据你的选择:
tiny最快但准确率一般,large最准但慢)。建议用pip install -U openai-whisper时自动下载。 - 执行转写: 在命令行中输入
whisper 你的音频文件路径.mp3(比如whisper C:\录音\会议.mp3)。默认使用small模型,中文建议加上--language Chinese参数提高准确率。 - 等待输出: 程序运行结束后,会在同目录下生成TXT、VTT、SRT、TSV等多种格式文件。
Whisper的准确率极高,尤其是中英文混排的场景。它能识别99种语言,并且完全离线运行,数据不经过任何第三方服务器。局限在于需要一定的命令行操作能力,对硬件有要求(没有NVIDIA显卡的话CPU处理会很慢,1小时音频可能需要30分钟以上)。模型下载也需要网络,首次配置稍麻烦。
适用场景: 处理涉密录音、技术极客、需要精确中英文混合识别的研究场景。如果只是偶尔用一次、不折腾配置,还是用提词匠或网页工具更省心。
其他实用场景的补充方案
除了以上工具,还有一些场景值得提一下:
- 手机自带录音转写: 华为/小米/三星等品牌的新机型,录音App里内置了“转文字”功能。操作简单:录制完成后点击转写按钮即可。适合应急使用,但导出的文字无法直接形成文档,需要手动复制。
- 钉钉闪记: 类似飞书妙记,适合钉钉生态下的会议。操作路径:进入钉钉“会议”模块,开启“闪记”即可。它的优势是能自动生成会议摘要和待办,但同样需要联网和企业账号。
- WPS Office:WPS的“文字转语音”功能不支持音转文字,但它的“图片转文字”可以配合截图使用。WPS会员有“语音转文字”功能,但属于付费服务,准确率中等。
- 腾讯会议: 如果你是会议主办方,可以在设置中开启“转写”功能,会议结束后自动输出文字稿。免费版只能转写一定时长,付费版不限。
每种方法都有它的舒适区零散处理用轻量方案,批量或高精度用专业工具。想清楚自己这次的任务是什么,选最顺手的那一个就行。说到底,工具只是手段——我那次两小时的播客采访,最后是用提词匠分三段转写出来的,每段几分钟出稿,复制到文档里稍作校对,比手动听写省了至少四五个小时。