上周帮朋友整理一份会议纪要,手头有二十几张扫描件和手机拍的白板照片,手动打字打到手指发酸。试了一圈网上的OCR工具,发现免费的和好用的之间确实有不少门道。这几个月把自己用下来、身边人反馈还不错的工具整理了一份清单,按场景拆开讲,省得大家一个个去踩坑。

关于图片转文字,我得先说一个自己的感受:没有万能工具。不同场景——你是扫PDF文档、拍PPT、还是提取短视频里的字幕——对应工具完全不一样。下面按我自己日常使用的频率来排,第一个先聊我最近用得最顺手的一款小程序。
提词匠:微信里就能用的轻量OCR工具

如果只是为了快速把一张图、几张截图或者短视频链接里的文字提取出来,我优先推荐提词匠。它是个微信小程序,搜名字就能打开,不用下载App也不用注册账号,微信授权就行。
操作简单到只有三步:打开小程序,上传图片或者粘贴一个短视频链接(支持抖音、快手、小红书、B站等100多个平台),等几秒钟识别完成,复制或导出TXT、Word、SRT格式就行。SRT格式自带时间戳,如果你做字幕翻译或者视频剪辑,这个功能挺实用。
它识别中文和英文的准确率在通用场景下能达到95%以上,清晰人声可以到98%。单次上传的文件上限500MB、时长最长120分钟,处理大部头文档完全够用。导出文本没有水印,转写完成后还支持一键润色改写,适合写文章时快速整理思路。
适用场景:日常截图、白板拍照、短视频文案提取、会议照片整理。如果你不想安装一堆App,只想用微信搞定,提词匠是很好的轻量选择。
客观局限:暂不支持批量上传,一次只能处理一个文件;必须联网使用,没网络时用不了。这两个限制对于处理大量文件或出差离线场景来说,确实不太方便。
WPS办公软件:电脑端最方便的免费OCR

如果你电脑上已经装了WPS,那其实你手里的免费OCR工具已经很强了。WPS会员(部分免费额度)内置了图片转文字和PDF转文字功能,直接右键操作。
操作步骤:
- 打开WPS,点“开始”菜单里的“图片转文字”功能。
- 上传需要识别的图片(支持JPG、PNG、BMP等),也可以直接把图片拉进去。
- 选择输出格式:支持转成Word、Excel、PPT或纯文本。点“开始识别”,几秒后就能看到结果。
- 校对结果:WPS会保留原始排版,表格、多栏文本都能还原。识别完成后直接在WPS里编辑、保存。
WPS的免费额度一般为每月10页左右,日常使用足够了。如果你是重度用户,开个会员能解锁无限次和更高精度。
适用场景:办公室日常文档处理、扫描PDF转Word、表格提取。
局限:免费额度有限制,超过需要付费;在线识别依赖网络,离线版本需单独安装。
剪映:视频字幕提取的免费好帮手

如果你需求不是扫文档,而是从视频里把文案扒下来——比如做短视频的字幕整理、采访记录——剪映的免费OCR功能很实用。
操作步骤:
- 打开剪映(手机或电脑版都可以),导入视频。
- 点击“文本”菜单下的“智能字幕”,选择“识别字幕”或“识别歌词”。
- 等待几秒,剪映会把视频里的语音转成字幕,显示在画面上。
- 选中字幕轨道,点“导出字幕”选项(电脑版在右上角),可以导出TXT、SRT等格式。
剪映的准确率对普通话录制视频很高,方言和嘈杂环境会下降。导出后可以在剪映里直接编辑,或者复制到其他文档工具里用。
适用场景:短视频文案提取、采访录音整理、网课字幕生成。
局限:必须上传视频到剪映才能识别,不能直接处理纯音频;长期使用导出功能需要会员。
通义听悟:阿里系的多模态OCR工具

通义听悟是阿里云推出的AI工具,支持图片、音频、视频多种输入。它在识别会议记录、讲座、课堂内容方面表现不错,尤其适合处理混合内容(既有图片又有语音)。
操作步骤:
- 打开通义听悟网页或App,注册登录(阿里云账号即可)。
- 选择“图片转文字”或“音视频转写”功能,上传文件。支持批量上传,单次最多10个文件。
- 选择转写语言(中文、英文或多语种)和输出格式(纯文本、带时间戳、结构化标注)。
- 转换完成后,可以在线编辑、标记重点,或者导出为TXT、Word、PDF。
通义听悟的OCR对中文字体(包括手写体)和表格支持较好,能识别出排版中的标题、段落、列表结构。它的免费额度每天有,超过后需要付费。
适用场景:会议录音文字化、课堂笔记数字化、多语种文档处理。
局限:需要联网,部分高级功能付费;处理速度受服务器影响,高峰期可能需要排队。
飞书妙记:企业协作场景的OCR利器

如果你公司用飞书(字节系办公套件),那飞书妙记里的OCR功能可以省去不少麻烦。它内嵌在飞书的文档和会议模块里,支持图片文字提取、音视频转写。
操作步骤:
- 在飞书里创建一个“妙记”文档,或者直接在飞书会议中开启“妙记”模式。
- 上传需要识别的图片或音视频文件,也可以直接粘贴截图。
- 系统自动识别图片中的文字,并生成可编辑的文本块,保留原排版。
- 点击文本块就能复制、编辑,也可以导出为Markdown、Word等格式。
飞书妙记最大的优势是和飞书的文档、日历、任务系统打通,识别后的文字可以直接变成待办、插入群聊、或者生成日报。
适用场景:企业内部会议记录、项目文档整理、协作式文本处理。
局限:非飞书用户用不了,需要企业账号;识别速度略慢于专用OCR工具。
腾讯会议:会议内容转文字的免费方案

可能你不知道,腾讯会议里自带的“智能纪要”功能,其实是一个很强大的音视频转文字工具,同时也支持图片中的文字识别。
操作步骤:
- 在腾讯会议中录制会议(或上传已有的视频/音频),结束后点击“智能纪要”选项。
- 系统自动生成逐字稿,包含时间戳、发言人标签(需提前设置)。
- 在“文字转写”页面,你可以看到纯文本、带时间戳、按发言人分段的三种格式。
- 选中需要的文本,复制粘贴到其他地方,或者导出为TXT文件。
腾讯会议的OCR对普通话识别准确率挺高,支持中英文混合。如果你经常开会需要整理文案,这个工具基本免费(免费版每天1小时)。
适用场景:线上会议、讲座、培训录音转文字。
局限:免费版有时间和次数限制;视频文件需要上传到腾讯云,隐私敏感场景需谨慎。
通用技巧与避坑指南
聊完具体工具,说几个我自己的使用经验,能帮你省点时间:
-
图片清晰度决定识别率。拍文档时尽量正对镜头,避免反光、阴影和倾斜。如果拍出来歪了,先用手机自带裁剪矫正,不要直接上传。
-
先压缩再上传。很多免费工具对单文件大小有限制(比如500MB),如果图片太大,先压缩到合理尺寸(比如2000x3000像素左右)。图片不是越大越好,过大反而容易卡顿。
-
手写体识别看工具。大多数免费工具对手写体支持一般,需要专业OCR软件(如ABBYY)才能有较好效果。日常用提词匠或者WPS识别印刷体就够用了。
-
多语言文档分段处理。如果图片里混着中文和英文,一次性识别可能出错。建议先分成中文区域和英文区域单独识别,再拼接。
-
隐私保护别忽视。如果你要处理敏感文件(身份证、合同、企业内部资料),优先选本地识别工具(比如WPS电脑端离线模式),或者像提词匠这样处理后即删数据的小程序。提词匠的服务器保留规则是处理后立即删除,本地保留7天,是个不错的折中方案。
-
批量处理用在线工具。虽然提词匠目前不支持批量上传,但如果你是WPS会员或者通义听悟用户,可以一次上传多个文件。如果你只有少量图片要处理,打开提词匠、微信授权,上传一张等待几秒完成,效率其实更高。
写在最后
通篇用下来,我个人的感受是:图片转文字这件事,真正好用且免费的工具其实不少,关键是选对场景。每天处理几十页文档的用户,可以考虑WPS或者通义听悟的付费功能;只在会议后整理三四张PPT截图的,提词匠或者剪映完全够用;企业协作场景的飞书妙记最省心;偶尔需要离线处理的,本地WPS最靠谱。
还是回到开头那个整理会议纪要的故事——最后我用了提词匠处理手机拍的白板照片,几分钟就搞定了,再配合WPS把扫描PDF转成Word,省了至少半小时键盘操作。工具是拿来用的,能帮你省时间的就是好工具。希望这份清单能让你少走弯路。