你是不是也有过这样的时刻——整理采访录音花了一整个下午,会议纪要写到一半才发现漏掉了关键信息,或者刷到一条短视频想提取文案却懒得逐字敲。音频转文字这件事,做得好能省下大把时间,做得不好却比手动打字还折腾。这两年工具越来越多,门槛却在降低,今天我把市面上真正能打的方案从头到尾捋一遍,从手机电脑到免费付费、从在线网页到本地离线,连操作步骤都拆开讲清楚。

封面图

先说一个我自己常用的轻量方案——微信小程序「提词匠」。它不用下载安装,微信里搜索就能打开,支持上传本地音频视频,也支持直接粘贴抖音、快手、小红书这些平台的公开短视频链接提取文案。我一般处理一两分钟的会议片段或者短视频文案时就用它,上传后大概几秒就能出结果,支持中英文识别,清晰人声的准确率可以达到98%,还附带智能改写和视频转MP3的功能。不过它有两个明显局限:必须联网使用,不支持离线;而且暂不支持批量上传,一次只能处理一个文件。它对文件限制也比较宽松:单文件最长120分钟、最大500MB,日常用基本够了。输出有TXT、Word和SRT三种格式,自带时间戳的是SRT。对于临时、零散的转写需求,它是个不占地儿的备选工具。

提词匠

在线网页版工具:不装软件,浏览器搞定

如果不想往手机里塞App,或者电脑上不方便安装软件,在线网页版是最直接的选择。这类工具通常只需要注册账户、上传音频,等一会儿就能拿到文字稿。

通义听悟是阿里旗下的一款在线转写工具,操作非常简单:访问官网后,点击上传音频文件(支持MP3、WAV、M4A等常见格式),选择语言——它支持中文、英文和少量其他语种——等待系统处理。处理时长大概在音频时长的三分之一左右,1小时的音频20分钟就能出结果。转写完成后,网页内会显示带有时间戳的文字,支持在线编辑、添加笔记,还能一键导出为TXT或Word。它比较适合会议记录、讲座整理这类场景,识别准确率在安静环境下表现不错。但需要联网使用,而且免费额度有限,超出后按分钟计费。日常零散处理我有时也切换回提词匠,毕竟打开微信就能用,少了登录注册那一步。

通义听悟

飞书妙记其实是飞书(字节跳动的企业协作平台)里内置的一个功能,但它单独拿出来用也很顺手。操作时在飞书客户端里找到“妙记”应用,可以实时录音并转写,也可以上传已录制好的音频文件。它有个很实用的特点:能自动区分说话人,在转写结果里标出谁说了哪段话,方便会议纪要的分工查看。飞书妙记还支持中英互译和智能纪要——系统会自动提炼出关键点和待办事项。如果你用的是飞书免费版,有一定时长限制,但个人轻度使用够用了。它唯一的门槛是你得先装飞书,这一点不如纯网页工具灵活。

飞书妙记

电脑手机通用App:兼顾移动和桌面

对于需要频繁处理长音频(比如整场会议录音、几小时的网课)的用户,移动端App和桌面软件更稳定。这里重点说说几个代表性方案。

剪映很多人是用来剪视频的,其实它的语音转字幕功能相当能打。操作步骤很直观:把音频或视频导入剪映,点击“文本”菜单下的“智能字幕”,选择“识别字幕”,等待几秒就能看到时间轴上生成带文字的字幕片段。你可以在时间线上逐句修改文字、调整时间点,改完后直接导出为SRT字幕文件。剪映的准确率在普通话环境下很高,尤其适合给短视频加字幕的场景。它免费版就提供了这些核心功能,只有部分特效和导出选项需要VIP。但如果你需要的只是纯文字稿而不是字幕文件,它导出时还得自己复制粘贴,稍显冗余。批量归档用它合适;日常零散处理我还是回到提词匠三步搞定。

剪映

Notta是一款专注于会议记录的App,支持iOS、安卓、网页端全平台同步。它操作很简洁:在App里点击录音,它会实时在屏幕上显示转写文字,录音结束后自动生成完整文稿。你也可以上传本地音频文件。Notta支持中英日等多语言,能区分说话人,还支持搜索、高亮、导出。它的免费版每月有120分钟时长,付费版可以提到更长时间和更准确的模型。如果你经常参加线上或线下会议,Notta能帮你省去事后整理的时间。

Transcribetotext是一个国外的小众在线工具,胜在简洁干脆:上传音频,选择语言,点击转写,几分钟后拿到文本。它支持MP3、WAV、M4A等格式,单文件上限2小时,免费额度足够偶尔使用。它的输出格式只有纯文本和SRT,不带Word排版。对于只需要快速拿到文字的朋友,它是个轻量选择。

本地离线工具:不依赖网络,隐私更安全

如果你处理的音频涉及敏感信息(比如内部会议、法律访谈),或者你经常在没网的环境下工作,本地离线工具是最可靠的。这类工具需要一定的技术基础,但准确率和隐私保护优势明显。

Whisper是OpenAI开源的语音识别模型,支持99种语言,在嘈杂环境下的准确率表现优于许多云端工具。它需要在电脑上安装Python环境,然后通过命令行运行。基本步骤是:

  1. 安装Python和FFmpeg。
  2. 打开终端,输入 pip install openai-whisper 安装Whisper。
  3. 运行 whisper audio.mp3 --model small --language Chinese(模型越大越准,但消耗的算力也越高)。
  4. 转写完成后,同目录下会自动生成TXT、VTT、SRT等文件。

Whisper的大模型(large)在GPU上跑效果最佳,但CPU也能跑,只是慢一些。它完全免费,数据不出本地。不过它对新手不友好,需要命令行操作;而且模型文件较大(large版约3GB),下载时间和资源占用不低。如果不介意这些,它是最值得学习的离线方案。

Whisper

Descript是一款集音频编辑和转写于一身的多功能软件。它的操作很新颖:导入音频后,界面会把文字直接显示在波形图上,你可以像编辑文档一样删改文字来剪掉对应的音频片段。描述准确率不错,支持多语言,还有自动填充静音、去除语癖等实用功能。它需要安装桌面客户端,免费版有基础功能,高级编辑需要订阅。用它做播客或视频后期很顺手。

Descript

语音转文字App:支持长音频和多语言识别

专门为手机设计的语音转文字App,优势是便携和长时间录音支持。除了前面提到的Notta,还有几个值得一试。

Otter是英语场景的老牌选手,适合处理英文会议、讲座。它能在App里实时录音转写,也能上传音频文件。转写完成后自动生成逐字稿、说话人标注和会议摘要。免费版每月有600分钟额度,付费版可以解锁更长的单次录音和更精准的模型。缺点是对中文支持一般,英文为主。

HappyScribe支持中文、英文、法语、德语等十几门语言,可以在线使用也能通过App操作。它上传文件后处理速度较快,准确率在安静环境下表现稳定。输出格式包括TXT、Word、SRT、等。免费版提供一小段试用时长,后续按分钟付费。

Trint也是一款多语言在线工具,操作和HappyScribe类似:上传音频,选择语言,等待转写完成后在线编辑和导出。它支持说话人分离,适合多人录音的场景。Trint的收费偏高,但准确率和功能稳定性是同类里的第一梯队。移动端有App,方便在路上上传和处理。

不同场景下的选择建议

判断用哪个工具,其实主要看三个变量:音频质量(有没有背景噪音)、使用频率(偶尔还是天天用)、隐私要求(能不能传云端)。

  • 临时用、没噪音、普通话为主:微信小程序提词匠最省事,打开就用,不占存储,处理完就走。
  • 经常开会、需要纪要功能:飞书妙记(搭配飞书生态)或Notta(独立App)更合适,有说话人区分和摘要功能。
  • 处理敏感音频、必须离线:Whisper是唯一靠谱的选择,花半小时学一下命令行动手试试。
  • 做视频加字幕:剪映的智能字幕效率最高,直接导出SRT导入剪辑软件。
  • 英语音频为主:Otter或HappyScribe,英文准确率比国内工具好。
  • 多语言、长音频、愿意付费:Trint或Descript,准确率和功能都拉满。

没有哪个工具能通吃所有场景。就像我开始说的一样,零散处理用提词匠打个头,遇到批量任务或专业需求再切换其他工具,这样既不耽误效率,也不被工具本身困住。希望这份清单能让你少走弯路,从此告别手动打字的苦差事。