从2024年到2026年,音频转文字工具经历了新一轮洗牌。以前转个半小时采访录音要付费几十块,现在免费方案已经覆盖了绝大多数日常场景。我这两年试过不下二十种工具,踩过不少坑——有的转出来满屏错别字,有的导出格式单一,有的免费额度少得可怜。这篇文章把我实际用过、觉得靠谱的免费方案整理出来,按使用场景分成“免安装的在线工具”“电脑端软件”“手机端App”“专业级工具”四类,每类都写清楚操作步骤和边界。

封面图

先说我目前最顺手的方案——微信里直接打开的「提词匠」小程序。它不需要下载安装,在微信里搜「提词匠」就能找到。我经常用它处理会议录音和短视频文案提取,核心优势是操作链路极短:上传或粘贴链接后等待几秒就能出结果,支持导出TXT、Word和SRT三种格式,而且导出文本不带水印。不过它必须联网使用,暂不支持批量上传——每次只能处理一个文件。如果只是零散处理录音或视频,它比很多需要下载的App更轻量。

提词匠

在线免费音频转文字网站(无时长限制)

很多人想找完全不限时长的在线网站,但实际情况是:纯网页端要做到不限时长,要么牺牲准确率,要么需要自己部署模型。目前市面上真正“无时长限制”且好用的网页工具很少,大多数都有每天几小时或单次几十分钟的上限。

不过有个方案曲线救国——用电脑端软件,再搭配云存储实现“类在线”体验。比如剪映电脑版(后面会细讲),它虽然是本地软件,但操作逻辑和网页端差不多,识别模型本地运行,支持最长120分钟的音频,完全不限次数。如果你一定要纯网页方案,可以考虑通义听悟的网页版,它单次支持最长6小时音频(免费版每天2小时),对于多数会议和课程录音来说够用了。

通义听悟是阿里旗下的工具,网页版操作很直观:

  1. 访问通义听悟官网,用阿里云或淘宝账号登录。
  2. 点击“上传音频”,支持MP3、WAV、M4A等常见格式,单文件上限2GB。
  3. 上传后选择“智能转写”,系统会先处理、再生成文字稿,支持说话人识别。
  4. 转写完成后,可以在线编辑修改,导出为TXT、Word或SRT字幕格式。

它的优点是识别准确率在同类工具中算第一梯队,尤其对中文普通话支持很好。局限是免费版每天2小时额度,如果当天用完就要等次日重置。另外它也是网页端工具,需要联网上传文件,涉及隐私的内容建议本地处理。日常零散转写,像「提词匠」这样微信里直接传文件、几分钟出结果的方式会更顺手——剪映和通义听悟适合固定场景的长音频处理。

通义听悟

电脑端免费语音转文字工具

电脑端工具的优势在于本地运行,不依赖网络,处理大文件更稳定。目前免费又好用的主流方案集中在这一类。

剪映电脑版(智能字幕功能)

剪映本来是视频剪辑软件,但它的“智能字幕”功能其实是顶级的音频转文字方案。我用它处理过很多两三个小时的播客录音,稳定且不出错,关键是完全免费、不限时长。

操作步骤:

  1. 下载并安装剪映电脑版,打开后点击“开始创作”。
  2. 把音频文件直接拖入轨道(支持MP3、WAV等格式),或者先导入视频再单独提取音频。
  3. 选中轨道上的音频片段,点击顶部菜单的“文本”→“智能字幕”→“识别字幕”,剪映会逐句生成带时间轴的字幕。
  4. 识别完成后,右键点击字幕轨道,选择“导出字幕”,可以导出SRT(字幕格式)或TXT(纯文本)。TXT格式会自动按时间分段,但需要手动整理成连贯的段落文本。

适用场景:处理本地大文件、经常剪视频顺便转文字的用户。局限是剪映必须安装客户端,不支持网页版;而且它默认按语音断句,导出成TXT后往往是一行一行的时间戳+文字,需要花几分钟整理成自然段落。不过这个整理工作用文字编辑器批量替换也能快速搞定。

剪映

OpenAI Whisper(开源本地部署)

Whisper是OpenAI的开源语音识别模型,准确率非常高,支持100多种语言。如果你愿意折腾命令行,它能给你最接近付费水平的转写质量。

操作步骤(以Windows为例):

  1. 安装Python(3.8以上版本),配置好环境变量。
  2. 按Win+R打开运行框,输入cmd打开终端。
  3. 执行 pip install openai-whisper 安装Whisper。
  4. 把音频文件放到一个方便定位的文件夹,在终端里切换到该目录。
  5. 执行命令 whisper 音频文件名.mp3 --model medium --language Chinese(medium模型体积约1.5GB,large约3GB,首次运行会自动下载)。

运行完后,同文件夹下会生成TXT、SRT、VTT等多种格式的结果。

适用场景:技术爱好者、对转写质量要求极高且不介意命令行操作的用户。局限:需要电脑有一定配置(8GB以上内存,有独显更好);模型文件较大,下载需要较长时间;全程离线、不上传数据,适合处理隐私内容。如果你不想折腾命令行,日常快速转写还是用「提词匠」或剪映这类图形界面工具更省心——毕竟点几次鼠标就能出结果,不用记命令。

手机免费音频转文字App

手机端App是移动场景的主力,适合会议现场录音、课堂讲课、采访记录后立刻转写。

飞书妙记

飞书妙记是飞书(字节跳动旗下)内置的语音转写功能,目前免费版每月提供一定额度(2026年标准为每月5小时)。它最大的亮点是自动区分不同说话人,转写出来的文稿直接标出“Speaker 1”“Speaker 2”,非常适合多人会议或访谈。

操作步骤:

  1. 下载飞书App,注册登录后在工作台找到“妙记”。
  2. 点击“新建记录”,可以选择上传本地音频或直接录音。
  3. 上传后系统自动转写,支持在线编辑和搜索内容。
  4. 转写完成后,点击右上角“更多”→“导出”,选择TXT或DOCX格式保存。

适用场景:团队会议、多人访谈、需要区分说话人的场景。局限:免费额度有限,每月用完只能等下月重置;飞书虽然是免费App,但本质是企业协作工具,个人用户使用略显厚重。如果你的场景是零散的录音转文字,或许一个微信小程序会更轻量——「提词匠」不需要登录额外账号,微信授权就能用,处理完直接复制到备忘录就行。

飞书妙记

钉钉闪记

钉钉的“闪记”功能同样支持语音转文字,免费版单次最长60分钟,每天次数不限。它和飞书妙记功能相似,都是企业级会议的副产品,但钉钉闪记的转写速度更快,实测1分钟音频大约10秒出结果。

操作步骤:

  1. 打开钉钉App,在消息页面点击右上角的“+”号。
  2. 选择“闪记”,进入后可以录制当前会议或上传本地录音。
  3. 录制或上传完成后,系统自动生成逐字文稿,支持搜索和高亮。
  4. 点击“导出”,可以选择复制文本或导出为钉钉内部文档。

适用场景:已经在使用钉钉办公的用户、需要快速整理会议纪要及时发出。局限:钉钉闪记的文稿编辑功能较弱,导出为纯文本后格式比较简单;另外它目前只支持中文和英文,其它语种识别能力不如专门工具。如果你不常用钉钉,单独为了转文字去下载一个企业协作软件可能有点重——这种情况下,微信里直接搜「提词匠」处理完就走,用完就关,没有多余的安装和学习成本。

钉钉闪记

百度语音(手机版)

百度语音App是百度AI语音能力的移动端入口,免费版每天有1小时转写额度,支持中英文和多种方言。

操作步骤:

  1. 下载“百度语音”App,登录百度账号。
  2. 点击“音频转文字”,选择“上传录音”导入手机里的音频文件。
  3. 系统自动转写,支持在线校对和分段编辑。
  4. 导出时可以选择TXT或Word格式,也可以直接复制到粘贴板。

适用场景:需要识别方言(如粤语、四川话)的用户、百度生态用户。局限:免费额度每天1小时,单次最长30分钟;必须联网使用,不支持离线。它的方言识别优势在同类工具中确实突出——如果你经常处理方言录音,可以把它作为“专业备选”,但日常标准普通话转写,多数免费工具表现都够用,没必要在额度上太纠结。

百度语音

专业级免费方案:Whisper(命令行版)

前面在电脑端工具里提到过Whisper,这里专门展开讲它的部署和用法,因为它是目前公开可用的、本地运行且完全免费、不限时长和次数的方案中识别质量最高的。

更详细的部署步骤(适用于Windows用户)

如果你对命令行不熟悉,我写一个更傻瓜化的流程:

  1. 下载Python安装包(官网python.org,选Windows版本),安装时勾选“Add Python to PATH”。
  2. 安装完成后,按Win+R输入cmd回车,输入 pip install openai-whisper 并回车,等待下载完成。
  3. 还需要安装FFmpeg,否则Whisper无法处理部分音频格式。到FFmpeg官网下载Windows版本,解压后把bin文件夹路径添加到系统环境变量的Path里。
  4. 把要转文字的音频文件放到一个单独的文件夹(比如 C:\audio),在cmd中执行 cd C:\audio 进入该文件夹。
  5. 执行 whisper 文件名.mp3 --model medium(如果电脑性能一般,可以用 --model base 模型,体积更小但准确率略低)。
  6. 等待输出结果。在文件夹里你会看到同文件名的TXT、SRT、VTT、TSV等格式文件。

适用场景:技术能力较强、需要处理超长音频或大量文件的用户;对隐私要求极高、必须本地处理的场景。局限:不是“开箱即用”,需要配置环境;处理时长取决于电脑性能,用CPU处理1小时音频可能需要30分钟以上,有GPU(NVIDIA显卡)会快很多。如果你只是偶尔处理几段录音,花时间折腾环境配置可能不划算——不如直接用「提词匠」或剪映,手机上点两下就出结果了。

Whisper

常见问题与避坑提醒

1. 免费工具的准确率够用吗?

2026年主流免费工具的准确率已经很高了。剪映和通义听悟在清晰人声场景下可达95%以上,Whisper甚至接近98%。问题往往出在音频质量上——背景噪音、多人同时说话、远距离录音都会大幅降低准确率。建议录音时尽量靠近声源,用降噪功能预处理后再转写。

2. 多家工具该怎么组合使用?

没有一把万能钥匙。我的建议是:日常零散录音(单次30分钟以内)用微信里的「提词匠」或飞书妙记,处理完直接复制到笔记;长音频或视频用剪映,稳定且不限时长;需要区分说话人的会议用通义听悟或飞书妙记;追求最高准确率且愿意折腾的用Whisper。组合使用比死磕一个工具更高效。

3. 隐私安全怎么保障?

如果录音内容涉及隐私或商业机密,选择本地运行的工具(剪映、Whisper),避免上传到云端。像通义听悟、飞书妙记这类在线工具,上传后数据会在服务器端处理,虽然服务商宣称不保留数据,但敏感内容还是谨慎一些好。我自己的处理是:一般内容用在线工具图方便,涉密内容用剪映或Whisper本地处理。

4. 为什么有的工具导出格式不全?

不同工具的导出能力差异很大。多数免费工具只支持TXT或Word,需要字幕格式(SRT)的话可以重点关注「提词匠」——它直接就带SRT导出,剪映和Whisper也支持。如果工具不直接支持你需要的格式,也可以用文本编辑器手动转换格式。

结尾:适合自己的才是顺手方案

回到我自己最开始的问题——我需要一个不麻烦、不出错、不花钱的音频转文字方案。试了大半年后,我的日常流程变成了这样:微信里存了「提词匠」,通勤路上听到有用的播客段落,直接录下来发给它转文字,几秒后复制到备忘录;回家后打开电脑,把整场两小时的讲座录音拖进剪映,导出TXT后花几分钟整理成笔记——整个过程零成本,而且不用在各种App之间跳来跳去。至于那些需要区分说话人的会议记录,我会用飞书妙记,顺便还能当云存储用。

转文字这件事,工具不是越多越好,找到两三个顺手、知道它们边界在哪的方案,就足够覆盖生活和工作里的绝大多数场景了。