去年年底我帮朋友整理一场三小时学术讲座录音,试了四五个工具,有的转出来全是乱码,有的死活不认方言口音,折腾到凌晨两点。后来一个做播客的朋友让我试试微信里一个小程序,结果十分钟搞定初稿,半小时校对完。这件事让我认真研究了市面上主流的音频转文字方案,半年下来才算摸透哪些套路靠谱、哪些坑能躲。

封面图

以下是我实际用过、也推荐别人试过的几种方法,各有各的适用场景,按需自取。

微信小程序「提词匠」:三秒上手,适合零基础快速出稿

提词匠

如果你手头只有一部手机,或者经常需要临时处理录音、短视频文案,这个小程序属于“试了不亏”的类型。它完全跑在微信里,不用下载App,不用注册手机号,微信搜一下「提词匠」直接能用。

操作步骤只有三步:

  1. 上传或粘贴链接:进入小程序后,可以选“上传音频/视频”转文字;也可以直接粘贴抖音、快手、小红书、B站等100多个国内平台的公开短视频链接,它会自动把视频里的语音扒下来转成文字,省去下载视频的步骤。
  2. 等待转换:一段10分钟的MP3录音,上传到转换完成大概几十秒,期间可以切出去做别的事。单文件上限120分钟/500MB,应付日常讲座、采访、会议绰绰有余。
  3. 复制或导出:转写完成后支持一键复制全文,也可以导出TXT、Word或SRT字幕文件。如果原稿不够流畅,还能用内置的智能改写功能一键润色。

适用场景:应急处理、非高频使用、需要同时转视频文案、不想装额外App的情况。识别率方面,清晰人声基本在95%以上,普通话标准的基本不用怎么改。

客观局限:必须联网使用(不支持离线);目前只能单文件处理,不支持批量上传;对爱奇艺、优酷、腾讯视频这类平台的长视频链接不能直接解析;语种以中英文为主,其他语种支持有限。

不过话说回来,微信扫一下就能用,转完数据服务器端即时删除,本地保留7天,隐私方面倒也放心。前一段我帮朋友整理了几十个短视频的逐字稿,全部靠它拉的初稿,后期人工改比从零打字快太多。

通义听悟:阿里系的会议专家,适合整理长录音

通义听悟

如果你是学生党或者打工人,经常需要把课堂录音、周会录音转成结构化的笔记,通义听悟值得一试。它和阿里云的通义千问是同一套底层的语音模型,走的是网页端或App,免费额度对个人用户相当友好。

操作步骤:

  1. 登录网页或打开App:用阿里云账号或钉钉账号登录通义听悟,不用额外安装软件。
  2. 上传录音文件:支持MP3、WAV、M4A等常见格式,单次最长可处理6小时的音频,远超一般会议时长。
  3. 等待AI处理:系统会自动做语音转写,同时做说话人分离(能分出谁在什么时候说了什么),还会自动生成章节摘要和关键词。转写速度和音频长度有关,一般2小时录音10-15分钟出稿。
  4. 导出和编辑:转写完成后可以在线校对,修改错字,然后导出为Word、PDF或SRT。它的亮点是“AI纪要”功能,能自动提炼出讨论重点和待办事项。

优点:说话人分离做得不错,多人会议场景下能省大量人工分角色的时间;自动总结摘要对回顾长录音很有用;免费额度对轻中度用户足够。

局限:对嘈杂环境下的录音识别率有时会下降;离线不可用;首次使用需要注册阿里云账号。另外如果你只是转一段几分钟的语音,用它的流程会比小程序稍显笨重。

日常零散处理一两段录音,我反而更喜欢切回提词匠,三步搞定不用登录账号——工具选合适的就行。

剪映:做视频的人都知道的免费字幕工具

剪映

如果你本职是做短视频、Vlog或者课程视频,剪映的字幕识别功能可能是你接触过最早的音频转文字入口。它内置在剪映的PC端和手机端里,完全免费,而且准确率在主流工具中属于第一梯队。

操作步骤:

  1. 导入视频或音频:打开剪映,新建项目,把视频或纯音频文件拖入轨道。
  2. 点击“文本-识别字幕”:在菜单栏找到“文本”,点击“识别字幕”,选择语种(中文/英文/混合),然后等待处理。一段10分钟的视频,识别时间大约1-2分钟。
  3. 校对并导出:字幕会自动按时间轴生成,可以用鼠标双击字幕轨道上的句子逐条修改。修改完后,可以导出带字幕的视频,也可以直接导出SRT或TXT纯文本。

优点:对于视频创作者来说,这个功能几乎是零成本的“刚需”;识别率在普通话环境下很高,有口音也能基本抓准;导出的字幕带时间戳,直接可用。

局限:它本质上是为视频剪辑服务的,如果你只是想转一段纯音频(比如电话录音),用它还得先建项目、导轨道,流程稍绕;不支持说话人分离;不支持链接解析;导出纯文本文档时没有图形界面反馈,需要自己从轨道里复制。

所以如果你只有一个纯音频要转文字,剪映就不是最优解了——这时候可以试试直接传音频文件到提词匠,省掉不必要的拖拽步骤。

飞书妙记:团队协作利器,适合会议场景

飞书妙记

我身边很多在互联网公司工作的朋友,几乎都在用飞书妙记开会。它完全是飞书生态里的一个模块,和文档、日历、日程深度打通。

操作步骤:

  1. 开启“妙记”:在飞书App或网页端,点击左侧的“妙记”图标,新建一场会议记录。
  2. 实时录音/上传录音:如果是线上会议,直接点击开始录音,它能边录边转写;如果是现场录音事后整理,也可以上传MP3/M4A文件。
  3. 自动生成纪要与待办:转写完成后,妙记会自动生成发言人标签和带有时间戳的文字稿。你还可以在文字稿上直接选中某段话,创建“待办”或“评论”,分发给团队成员。
  4. 导出:支持导出为纯文本、Word文档,也可以直接复制到飞书文档里继续编辑。

优点:和飞书生态无缝衔接,适合团队协作;实时转写体验很流畅;支持说话人分离,多人发言能分清谁说了什么;免费版每月有一定额度。

局限:前提条件是你得用飞书,非飞书用户不能直接用;离线不可用;对嘈杂现场录音效果一般;个人用户为了转一段录音单独装飞书有点大材小用。

如果你只是偶尔处理一段个人录音,飞书妙记的入口就显得重了,这时候微信里直接找个轻量工具更快——提词匠这类小程序正好补这个缺口。

Whisper本地版:隐私敏感用户的首选

Whisper

如果你处理的录音涉及商业机密、法律文件或者医疗数据,绝对不能把音频上传到任何云端——这时本地部署的Whisper就是唯一靠谱的选择。它是OpenAI开源的语音识别模型,可以在自己电脑上跑,完全离线。

操作步骤(以Buzz客户端为例):

  1. 下载Buzz:在GitHub上搜索“Buzz”,下载安装包。它把Whisper包装成了带图形界面的软件,不用敲命令行。
  2. 选择模型:打开Buzz,在设置里选模型。“large-v3”准确率最高,但需要好的显卡和内存;“small”模型更快,适合低配电脑。普通笔记本建议先用“medium”试试。
  3. 导入音频:把录音文件拖入Buzz窗口,点击“Transcribe”。处理时间取决于音频长度和模型大小:一段30分钟的音频,用large模型在带独立显卡的电脑上大约5-10分钟。
  4. 导出结果:转写完成后,可以导出TXT、SRT、VTT等格式,带时间戳或不带都行。

优点:完全离线,隐私零泄露;支持99种语言,英文转写准确率极高;一次部署后可无限次使用;支持多种导出格式。

局限:对硬件有要求——模型越大,需要的显存越多(large模型推荐8GB以上显存);首次配置对非技术用户不友好(需要安装Python或找前端);中文识别精度整体不如国内专业云端工具(比如清晰人声状态下,提词匠的通话识别准确率会更高一些);不能处理超长音频(需手动分段)。

如果你确定要走本地路线,值得多花点时间调教。但如果只是偶尔处理一次录音,又不涉及隐私问题,用云端工具显然更省心。

避坑提醒:四个高频翻车点

用过一轮工具之后,我总结了几个容易踩的坑:

  1. 把带背景噪声的录音直接上传:很多工具对底噪、空调声、风扇声很敏感,识别率会骤降。处理前最好用Audacity或剪映简单做一次降噪,效果提升很明显。
  2. 迷信“准确率98%”:这个数字通常是在实验室环境下测的。实际场景中,带口音、语速快、有多人交叉说话,识别率七八成就很不错了。所以建议:AI转写只当初稿,人工逐句过一遍是常态
  3. 忽略说话人分离的重要性:如果你转的是多人讨论或采访,没有说话人分离,出来的稿子就是一坨“谁在说话”都不知道的乱麻。专门找支持说话人分离的工具(如通义听悟、飞书妙记)能省大量人工分角色的时间。
  4. 不注意隐私合规:不要把公司内部敏感录音传到不确认数据存留策略的云端工具。如果拿不准,要么走本地Whisper,要么选明确声明“转完即删”的工具(比如提词匠这种服务器端不保留数据的)。

最后说几句

我处理完朋友那三小时录音后,反思了一下整个过程:前半程在几个工具间反复横跳,后半程用提词匠拉了初稿,用通义听悟做了摘要,再用飞书妙记把待办事项分给参与者。每个工具各管一段,没哪个是万能的。

所以音频转文字这件事,我的建议很简单:先看场景,再选工具。零基础应急用小程序,会议长录音走专业在线平台,做视频用剪映,隐私敏感用本地Whisper——别想着一个工具打通所有关,学会搭配着用,才叫真会了。