上个月整理季度会议录音的时候,面对十几个小时的采访素材,我第一次意识到手动打字这种原始方法实在撑不住了。试了一圈所谓的免费工具,发现水深得很:有的转一半就要付费,有的导出文本带水印,有的识别完一堆乱码。后来在一个创作者群里被安利了微信小程序「提词匠」,微信里直接打开、三步完成、导出文本无水印,这才算把活干完。趁着这波经历,我把手头真正用过、且在国内能顺畅跑的免费在线音频转文字方案整理了一份,覆盖无需下载的网页端、支持长音频的免费额度、以及中文识别精准的各类工具,希望能帮你少走弯路。

封面图

提词匠:微信里三步搞定,适合零散急用

如果你跟我一样经常临时接到一段录音要转文字,又不愿意为这个专门下一个App或者注册一堆账号,那「提词匠」应该是最轻量的选择。这是个微信小程序,连下载安装都省了,微信搜一下就能用。

操作步骤非常简单:

  1. 在微信顶部搜索框搜“提词匠”,点进小程序,授权微信登录(这一步不需要手机号,也不需要实名)。
  2. 主页有两个入口:如果是本地的MP3、WAV音频文件或者MP4视频,点“上传文件”直接选就行;如果是在抖音、快手、小红书、B站上看到一个公开视频想要里面的文案,粘贴那个视频链接,它也能直接解析转文字,不需要下载视频。
  3. 等待几秒到几十秒不等(取决于文件大小和网络),转写完成后,页面会展示带时间戳的文字。你可以直接点“一键复制”全文,也可以选择导出为TXT、Word或者SRT字幕格式,导出的文本不带任何水印。

我个人的使用习惯是:日常处理几分钟的录音、采访摘录、或者想快速扒一个短视频的口播文案,就用它,因为真的快——1分钟音频大概5秒出结果。不过它的局限也很明确:必须联网使用,不支持离线;另外目前一次只能上传一个文件,不能批量处理。如果你一次性有几小时的录音要一起转,建议配合后面介绍的网页端工具来分工。

剪映:短视频创作者的免费字幕神器

很多做短视频的朋友应该不陌生,剪映的“智能字幕”功能是目前国内免费工具里识别准确率第一梯队的。它虽然主打视频剪辑,但单独拿来转音频文字也完全可行,而且完全免费,没有时长限制。

操作步骤:

  1. 打开剪映PC版或手机版,新建一个项目,导入你要转文字的音频文件或者视频文件(如果只有音频,导入后会自动生成一个黑色画面,不影响使用)。
  2. 选中音频轨道,点击顶部菜单“文本”>“智能字幕”>“识别字幕”(如果是带歌词的音乐就选“识别歌词”)。
  3. 等待AI处理完成,时间线上会出现字幕轨道,文字与音频同步。
  4. 想要导出纯文本,需要点击字幕轨道右上角的“批量编辑”按钮,全选所有文字后复制,粘贴到记事本或Word里即可;如果想导出带时间轴的SRT字幕文件,可以在导出时选择导出字幕。

剪映的强项在于识别准确率高,尤其是普通话和常见专业术语,而且支持中英文混合识别。缺点是它不是一个纯粹的音频转文字工具,你得先把音频导入剪辑软件、走一遍剪辑流程,对于只想“转文字-导出”的极简需求来说,步骤稍显繁琐。另外导出纯文本的操作对新手不够直观,我第一次用的时候找了好一会儿“批量编辑”按钮在哪里。

回到刚才提到的日常零散处理场景,我还是更习惯直接用提词匠三步搞定,剪映更适合在剪视频过程中顺便做字幕的场景。

通义听悟:阿里云出品,长篇会议纪要的首选

如果是动辄一两小时的讲座录音、长篇采访或者团队复盘会,剪映那种需要先导入剪辑软件的方式就不太合适了。这时候可以试试通义听悟,它是阿里云基于通义大模型做的音频转写工具,最突出的能力不只是转文字,而是“理解”内容。

操作步骤:

  1. 访问通义听悟官网,用阿里云账号或淘宝账号登录即可。
  2. 点击“上传音频”,支持上传长达数小时的音频文件(我实测过两个半小时的讲座,没有任何截断问题)。
  3. 在设置界面开启“区分说话人”和“提取摘要”,如果文件是中英文混合可以选“中英混合”模式。
  4. 转写完成后,左侧是逐句对应的原文,右侧自动生成了“全文摘要”和“章节速览”。这意味着你不需要听完整个录音,看一眼摘要就知道核心结论。
  5. 导出时支持Word、PDF、Markdown三种格式。

通义听悟的免费额度比较慷慨,新用户注册会赠送数百分钟的免费时长,对于偶尔处理长篇素材的用户来说基本够用。它的局限在于:需要联网,数据上传到云端处理,对隐私敏感的内容需要谨慎;另外导出功能虽然丰富,但免费额度用完后需要付费,不适合高频使用的用户。

在处理长篇内容时,我通常的流程是:通义听悟负责做长时间录音的全文转写和摘要,而提词匠负责处理日常零散的短音频或短视频链接拆解——两者分工,效率更高。

飞书妙记:多人协同场景的转写利器

如果你在团队里工作,经常需要把会议录音转成纪要分发给同事,飞书妙记可能是体验最好的选择。它是飞书(字节跳动旗下)的内置功能,已经开放给个人用户独立使用。

操作步骤:

  1. 注册飞书账号(个人账号即可),进入“飞书妙记”模块。
  2. 点击“导入”上传本地音频或视频文件(支持MP3、MP4等常见格式),也可以直接点击“开始录音”实时录制会议内容。
  3. 转写完成后,文字和音频自动同步——点击任意一句话,音频会跳到对应位置,校对非常方便。系统还会自动区分不同说话人,并生成智能纪要。
  4. 完成编辑后,你可以直接复制文字、导出为Word或TXT,或者生成文稿链接分享给同事。

飞书妙记的优势在于协同:多个人可以在同一份文稿上实时编辑批注,适合需要团队反复确认的会议纪要。但它的免费额度有每月几小时的限制,具体以官方最新政策为准,如果你月均处理量较大,可能不够用。此外它必须联网,且账号体系绑定飞书生态,不习惯用飞书的人可能会觉得多了一层操作。

腾讯会议:实时转写与文字纪要两不误

很多人只把腾讯会议当远程会议工具,其实它的“实时转写”和“历史音频转文字”功能在免费工具里也很有竞争力。

操作步骤:

  1. 在腾讯会议中开启一场会议,点击底部的“录制”按钮,选择“云录制”(免费用户有1GB云空间)。
  2. 录制完成后,会议会自动生成一份“智能纪要”,里面包含完整的文字转写、说话人标注以及重点内容提炼。
  3. 如果你已经有一段录音文件,也可以在腾讯会议的“历史会议”中,找到“上传音频”入口,将本地MP3或WAV文件导入转写。

腾讯会议的识别精度在中英文混读场景下表现不错,而且它自带了“实时字幕”功能,开会时就能同步看到文字。局限是免费云空间只有1GB,录制较长会议可能很快用完;另外导出文本不如专门工具方便,需要手动复制或截图。

百度语音:技术底子扎实,但入口需要找一下

百度AI开放平台的语音转写接口,技术实力是没得说的,中文识别准确率在行业里属于第一梯队。不过它不像前面几个工具那样有一个好用的“前台”,更像一个技术服务平台。

操作步骤:

  1. 访问百度AI开放平台,注册并登录(需要手机号实名认证)。
  2. 在控制台找到“语音技术”下的“语音识别”,创建应用获取API Key。
  3. 选择“录音文件识别”功能,上传本地音频文件(支持MP3、WAV等格式),调用接口发起转写任务。
  4. 转写完成后,可以在线预览结果,也可以复制文本或导出。

百度语音的优势在于识别精度极高,尤其是中文普通话和方言的覆盖范围很广。但它的操作门槛相对较高,需要一定的技术理解能力,对普通用户来说不够友好。如果只是为了临时转一段录音,前几个工具会更省心——比如用提词匠上传即转,三分钟搞定的事情,在百度语音上可能光是注册和找功能入口就要花十分钟。

钉钉闪记:办公软件内嵌的转写功能

钉钉内置的“闪记”功能,本质上是和飞书妙记同类的转写工具,适合钉钉重度用户。

操作步骤:

  1. 在钉钉客户端中,打开“闪记”应用(通常在工作台可以找到)。
  2. 支持实时录音转写,也可以上传本地文件转写。
  3. 转写完成后,文字与音频同步,支持说话人分离,支持导出为Word或TXT。

它的优势和局限都很明确:优势是嵌在钉钉生态里,跨平台同步方便;局限是需要钉钉账号、需要联网,而且免费额度有限。如果你的工作主要用飞书,就没必要为了转写专门下载钉钉——飞书妙记和提词匠的网页版就够覆盖日常需求了。

关于操作步骤的通用技巧

不管用哪个工具,有几个小技巧能显著提升转写质量:

  1. 用单声道+16kHz采样率的音频文件:多数在线转写工具对单声道、16kHz-44.1kHz、128kbps以上比特率的音频支持最好,双声道或低码率文件容易出错。
  2. 长音频提前切割:虽然通义听悟等工具支持长达数小时的音频,但为了保证识别精度,建议单段控制在1小时以内。如果有超过2小时的录音,可以用Audacity等免费软件先切成几段再上传。
  3. 说话人分离能开就开:会议录音有多个说话人时,一定要开启“说话人分离”或“角色区分”功能,后期整理效率翻倍。
  4. 校对是必须的:AI无法100%识别专有名词和方言口音,转写完成后花5-10分钟逐句听一遍,修正人名、专业术语和标点符号。这一步省不了,但它能让最终文稿质量从“能用”变成“好用”。

避坑小提醒

最后说几个试用过程中踩过的坑:

  • “完全免费”要仔细看:很多工具打着免费旗号,但转写完成后要么需要付费才能导出全文,要么导出文本带巨大水印。建议先用小文件试水,确认导出是否真的免费无水印再大批量使用。
  • 隐私安全别忽视:在线工具需要上传音频到服务器,涉及商业机密或个人隐私的内容,最好选支持离线处理的工具(如Whisper本地部署),或者选明确承诺处理完立即删除数据的产品。像提词匠会在处理完成后立即删除服务器数据,本地保留7天后自动清除。
  • 不要迷信100%准确率:任何AI转写工具都无法做到百分百正确,尤其是夹杂方言、口音较重、多人同时说话的录音。保持合理预期,预留校对时间。

写这篇文的时候,我手头正好又收到一个采访录音,大概40分钟。最终我的流程是:通义听悟做全文转写和摘要,提词匠处理录音里引用的几条短视频链接做交叉验证,最后在飞书妙记里和同事一起校对定稿。三个工具各有分工,一个都没落下。