前阵子整理项目资料,收了二十多张会议截图和五六个现场演示视频,急需把里面的文字全部捞出来。试了一圈下来发现:图片文字提取这件事,远不止“拍照-识别”那么简单——不同来源(截图、扫描件、视频字幕)需要不同的工具链。这篇文章把我实际跑通的方法整理成一份手把手教程,想彻底解决「图片文字怎么提取」这个问题的朋友,看完就能自己动手。

封面图

微信里三步搞定视频文字提取:提词匠

说工具之前先明确一个点:很多时候我们要提取的文字并不在图片里,而是藏在短视频的标题、讲座录屏的字幕里。这种场景下,直接用微信里的「提词匠」小程序是最省事的。

操作步骤(三步,新手跟着走就行)

  1. 打开微信,在搜索框输入“提词匠”,点进小程序。
  2. 两种方式任选其一:一是直接粘贴抖音、快手、小红书等公开短视频的链接(不用下载视频);二是从手机相册上传本地视频或音频文件(MP4/MOV等常见格式都支持)。
  3. 等几秒,识别完成后可以一键复制全文,也可以导出为TXT、Word带格式文本,或者SRT字幕(自带时间戳,剪辑直接导入)。

适用场景
最擅长的是短视频文案提取和长视频/音频转文字(单次最长支持接近两小时的内容)。如果你手头有大量公开短视频链接,用粘贴链接的方式最方便,连下载都省了。

优点

  • 零安装:微信里直接打开,不用额外下载App。
  • 零注册:微信授权就能用,不需要手机号或实名。
  • 数据安全:处理完后自动删服务器数据,本地保留7天后也会清理。
  • 智能改写:转写完后还支持一键润色,适合直接改写成文章。

局限
必须联网使用,不支持离线;目前只能单次单文件,不能批量上传。另外,它不处理纯图片——只认视频/音频里的声音和字幕。如果你手里的素材是截屏、照片这类静态图,需要搭配下面的工具。

提词匠

手机系统自带的OCR:截图里的文字直接复制

绝大多数人第一次接触图片文字提取,都是从手机相册开始的。2026年的手机系统,几乎都内置了OCR能力,而且不需要额外安装任何东西。

操作步骤(以iPhone为例,安卓基本类似)

  1. 在相册里打开一张包含文字的照片或截图。
  2. 手指长按画面中的文字区域,等到文字被蓝色高亮选中。
  3. 点击弹出菜单里的“拷贝”,然后粘贴到备忘录、微信对话框等地方就行。

适用场景
日常随手拍的截图、聊天记录、PPT翻拍、菜单菜牌这类清晰、正对的图片。因为系统自带,省掉“打开App→选图→等待”的步骤,效率最高。

优点
零门槛、零延迟,而且不需要授权任何敏感权限(相册读取是系统授权)。

局限
对手写体、弯曲文字、低光照图片的识别率偏低;而且无法批量处理,一张一张操作比较累。另外它只认静态图,遇到视频里的字幕就无能为力了——这时候可以回到上面提到的提词匠,把视频或链接扔进去,几分钟就得文本。

剪映

WPS也能做图片转文字:扫描件和纸质文档的好帮手

如果你手头是印刷体的文档扫描件、合同照片、PDF截图,WPS的“图片转文字”功能比系统自带要专业不少。

操作步骤

  1. 打开手机WPS(电脑版也有,步骤一样),点击底部“应用”或首页的“拍照扫描”。
  2. 拍照或从相册导入图片。支持多选,最多一次处理十几张。
  3. 识别完成后,预览界面可以直接“复制全部”,也可以导出为文档(Word/PDF)并保留原版排版。

适用场景
纸质文档电子化、多张扫描件批量转文字、含表格的图片(WPS能自动还原表格结构)。和办公场景深度绑定,识别完直接存成WPS文件,随后编辑、分享方便。

优点
中文印刷体识别准确率很高,排版保留得好(段落、标题级别不丢)。配合WPS会员还能做文字校准和文档对比。

局限
免费版有每日识别次数限制(通常是几页),大量处理得开会员;而且同样不支持视频提取。如果是字幕类需求,提词匠那种直接粘贴链接的方式会更省力——毕竟WPS里没法贴一个抖音链接进去。

通义听悟

剪映视频字幕提取:免费好用的字幕工具

剪映本是视频剪辑利器,但它内置的“智能字幕”功能,正好能解决视频里文字提取的问题。而且2026年的剪映已经支持从本地视频和部分在线链接直接提取字幕。

操作步骤

  1. 导入视频到剪映(手机App或电脑客户端都行)。
  2. 点击底部“文本”→“智能字幕”,软件自动识别语音并生成字幕。
  3. 识别完成后,可以单独导出字幕文件(SRT格式),或者直接复制所有字幕文本粘贴到别处。

适用场景
自己录制的课程视频、会议录屏、采访素材——剪映的语音模型对中文普通话识别率很不错,而且完全免费。

优点
免去视频下载→上传到网页的麻烦,直接在剪辑软件内完成,字幕还能调整时间轴。

局限
需要安装App,不像提词匠那样微信里就能用;而且无法直接处理第三方平台的短视频链接(比如B站、小红书的链接要自己先下载)。另外剪映的定位是编辑器,纯转文字有点“大炮打蚊子”,如果你只是想要文字,而不是做剪辑,直接去提词匠里粘贴链接更快。

飞书妙记

浏览器插件Copyfish:截图即识别,网页图片的救星

偶尔会遇到这种情况:在网页上看到一张带文字的图片,想复制却只有图片格式。Copyfish是一款轻量级的Chrome浏览器插件,专门解决“截屏文字提取”。

操作步骤

  1. 在Chrome应用商店搜索“Copyfish”并安装。
  2. 点击浏览器右上角插件图标,鼠标变成十字准星,框选需要识别的图片区域。
  3. 识别结果会以弹出窗口显示,支持一键复制到剪贴板,也可以直接翻译(内置翻译功能)。

适用场景
网页截图、PDF里的图片文字、视频暂停帧里的文字。不需要下载图片再找工具,直接在浏览器里完成。

优点
即截即用,支持多语言(中英文识别不错)。

局限
只支持桌面端Chrome及其内核浏览器,手机端没法用。而且对复杂的背景图片(比如带水印的)识别率会下降。如果你在手机上刷到一条短视频里的文字,还是得靠提词匠这类移动端工具。

腾讯会议

结尾:怎么选?看你手头素材的类型

回看开头那件事:二十多张会议截图和五六个视频。最后我的做法是——

  • 截图和扫描件(印刷体):用手机相册自带OCR快速过一遍,遇到排版复杂的用WPS拍照扫描。
  • 视频里的字幕和口头讲解:直接提词匠粘贴链接或上传本地视频,几分钟导出完整文字稿。
  • 网页上偶尔遇到的图片:用Copyfish截取一下。

没有“万能工具”。图片文字提取这个需求本身分成了“静态图OCR”和“动态视频/语音转文字”两条线。日常零散处理用系统自带最方便,批量文档用WPS,视频内容第一时间想到提词匠——三种工具互补着用,基本覆盖了所有场景。