跳到主要内容
文档小工DocGong · 文件不上传

图片里的文字怎么提取出来(OCR)

截图、照片、扫描件里的字想复制编辑,一条条手敲不现实——这就是「图片里的文字怎么提取出来」 要解决的事。动手前有两件事必须定:识别语言选「中英混合 / 仅中文 / 仅英文」里的哪一个,以及识别不准时是先修图,还是先改设置。 这篇按图片转文字 OCR 界面上的真实按钮讲全流程。

更新于 2026-09-226 分钟对应工具 图片转文字 OCR

图片转文字 OCR

照片、截图里的字提出来

打开工具

文件全程在你的浏览器内处理,不上传服务器,免费不限次数。

OCR 能提什么:印刷体可靠,手写要校对

工具用 tesseract.js 在浏览器里本地跑识别,图片不上传服务器。它把画面里的字符逐个认出、 按行拼成文本,不保留原稿的字号、颜色和表格线—— 拿到的是可复制的纯文本,不是一份排好版的文档。

  • 效果好:打印文档翻拍、PDF 截图、手机拍的印刷资料、屏幕截图里的中英文。
  • 效果一般:艺术字、强透视斜拍、低对比度、花纹底纹上的字,能认出大半但会有错漏。
  • 效果差:潦草手写、连笔字、竖排或极度倾斜的版面。这类内容只能当草稿,逐字人工校对。
  • 不管哪种,「99% 准」意味着一百个字错一个——数字、金额、证件号必须单独核对, 这是所有 OCR 的通病,不是工具坏了。

首次要加载约 10MB,之后走缓存

按钮上方写明:「首次识别会加载引擎与语言包(约 10MB,之后走浏览器缓存); 图片全程在本地识别,不上传服务器。」第一次点识别会看到「正在加载识别引擎」「正在加载语言包」 等状态,多等一会儿;第二次开始基本秒进识别。

语言三选一:选错了会发生什么

语言切换就三个并排按钮:「中英混合」(默认)、「仅中文」、「仅英文」。 选哪个取决于图片里的字符构成:

图片内容选什么选错的后果
中文为主,夹着英文单词、型号中英混合(默认)基本不会错,拿不准就用它
纯中文资料仅中文用中英混合也行,差别通常不大
纯英文文档、英文代码截图仅英文选了中文系会把噪声认成形近汉字
中英混排但英文很多中英混合切成仅英文会丢掉整段中文

实操建议:先按默认的「中英混合」跑一遍,看结果里有没有成片的乱码—— 满屏拉丁字母说明图里其实是英文却没选对,或者反过来。 语言在点「开始识别文字」之前选定,识别过程中不生效变更。

同一张图可以重跑

识别结果不满意就换语言再点一次按钮,不用重新上传。 判断标准很直观:正确语言下输出是通顺的词句,错误语言下输出是不成词的字符堆。

多张批量识别:从上传到下载 TXT

  1. 1「选择图片」或拖入多张。 提示写着「支持多张图片:JPG / PNG / WebP / BMP」,可分批加; 同名同大小的重复文件会自动去重
  2. 2按上一节选定语言;右上角「添加更多图片」可以继续补,不要的图点行尾「移除」。 文件计数显示在语言按钮旁边
  3. 3「开始识别文字」。 状态依次是「正在加载识别引擎(首次约几秒)…」「正在识别第 2/5 张:扫描件-02.jpg」, 识别中有进度条
  4. 4每认完一张就出现在结果区,显示「N 字」;没认出内容的显示「(未识别出文字)」。 全部完成后顶部出现「已识别 5/5 张」
  5. 5单张点「复制」(复制成功变「已复制」,两秒后复原);整批点 「下载全部为 TXT」, 得到「OCR识别结果.txt」

TXT 里每张图之间用「===== 文件名 =====」分隔,顺序就是你添加的顺序—— 扫描件按页码命名后整批识别,导出的文本天然带页序,粘进 Word 不会乱。

识别不准的五个原因,逐个对照改

结果出错时先别怪语言设置——大部分问题出在图片本身。按症状查表:

症状原因怎么改
笔画粘连、小字认不出图片模糊(拍虚、截图缩过)重新截原图;用 PDF 转图片 以 90% 质量导出再识别
成行的字错位、漏字页面拍歪了在系统相册里拉正,或重新正对拍摄——OCR 不做纠偏
字认得出但不成句手写体找打印版重拍;手写内容只能当草稿人工誊录
整块空白或一团乱码反光高光吃掉了字避开光源重拍,不开闪光灯,换个角度
中文输出一堆拉丁字母(或反之)语言选错改回「中英混合」或「仅中文」,重新点识别

修图比改设置更有效

  • 截原图,别截缩略图。长边 2000px 左右是识别率与速度的平衡点;二次压缩过的图神仙也救不回来。
  • 先裁掉无关区域。页眉水印、背景杂物会贡献噪声,裁掉后识别更干净、也更快。
  • 对比度低就先调亮。灰底灰字的拍照件在相册里拉一下对比度,往往立竿见影。

识别结果不要直接拿去交差

金额、证件号、日期、引用编号这四类内容逐个核对。OCR 错一个字符的代价, 远大于从头把这一页读一遍——尤其是要粘进合同或论文的时候。

扫描件 PDF 里的字怎么提出来

OCR 只吃图片。扫描件 PDF 要先拆成页图,四步走完:

  1. 1拆页。用 PDF 转图片 导出:格式选「JPG(体积小)」、质量 90%,点「转出全部页面并打包 ZIP」, 得到「文档-第01页.jpg」这样按页序命名的一串图。
  2. 2整批识别。解压后全部拖进图片转文字 OCR,语言选「中英混合」,点「开始识别文字」。 首次会加载约 10MB 引擎与语言包,之后走缓存。
  3. 3导出文本。逐张检查错字后点「下载全部为 TXT」,分隔符带文件名,页序不乱。
  4. 4按用途分流。要进 Word 就把 TXT 粘过去重建排版;要继续在 PDF 流程里走, 参考 PDF 转 Word 一文的扫描件路线——文字版才能直转,扫描件本来就得先 OCR。

手机现拍的合同、发票同理:拍照扫描件 拍完导出 JPG,再进 OCR。 还有一条更快的近路:如果 PDF 里的文字其实存在(能选中),根本不用 OCR—— 直接用 PDF 转 Word 提取文字层,一次拿到 docx 和 TXT。

识别完怎么用:复制、TXT、接 Word

  • 只要一段话:点该张图的「复制」直接粘走,适合填表、回消息。
  • 整份留存:「下载全部为 TXT」,多张以「===== 文件名 =====」分隔,文件就在本机, 图片与文本都不经过服务器。
  • 进 Word / PPT:TXT 全选粘贴后统一字体、套标题样式;表格要在 Word 里重建, OCR 不会给你表格线。
  • 回填 PDF:本站不把文字写回原 PDF。做法是把识别结果排成新文档再导出 PDF; 论文场景可以用论文格式转换 保持分栏与参考文献的排版。
  • 结果区的字数:每张图显示识别出的字符数,接近 0 说明图片确实没认出内容—— 多半是模糊或语言不对,按上一节排查后重跑。

批量的正确打开方式

一份 20 页的扫描件,拆页后一次全拖进去,比一页一页截图粘贴快得多。 前提是页图命名带页码(PDF 转图片 默认就这样),导出的 TXT 才能按顺序还原整份文档。

常见问题

图片里的文字怎么提取出来?

打开图片转文字 OCR,点「选择图片」上传一张或多张(JPG / PNG / WebP / BMP),选定识别语言后点「开始识别文字」,结果出现在下方文本框里。单张可点「复制」,整批点「下载全部为 TXT」保存。识别在浏览器本地完成,图片不上传。

识别语言该选中英混合还是仅中文?

中文为主、夹着英文型号或单词时用默认的「中英混合」最稳;纯中文两种都行,差别通常不大;纯英文务必选「仅英文」,否则中文模型会把噪声认成形近汉字。拿不准就先用中英混合跑一遍,看输出是否成句,不成句再换语言重跑。

首次识别为什么要加载约 10MB?

首次使用要下载 OCR 引擎核心与语言包(约 10MB),界面会提示「正在加载识别引擎」「正在加载语言包」。下载后走浏览器缓存,同一浏览器再次识别几乎立即开始。这些资源只含识别模型,你的图片本身仍然只在本地处理。

扫描件 PDF 能直接丢进来识别吗?

不能,本工具吃的是图片。先用 PDF 转图片 把扫描件每页导出为 JPG(质量 90%),解压后整批拖进 OCR 识别,再点「下载全部为 TXT」。手机现拍的文件则用拍照扫描件 导出 JPG 后走同一流程。

识别准确率怎么样?手写体行不行?

印刷体中文、英文、截图、打印文档的识别效果好;手写体、艺术字、强透视和反光图片准确率明显下降,只能当草稿并人工校对。数字、金额、证件号务必逐个核对——任何 OCR 都可能错在单个字符上。

能一次识别多张吗?结果怎么保存?

支持多张批量识别:全部拖进去后点「开始识别文字」,逐张出结果,顶部显示「已识别 N/N 张」。单张点「复制」进剪贴板,整批点「下载全部为 TXT」得到 OCR识别结果.txt,各张之间用「===== 文件名 =====」分隔,顺序即添加顺序。

图片转文字 OCR

照片、截图里的字提出来

打开工具

文件全程在你的浏览器内处理,不上传服务器,免费不限次数。

相关教程

全部教程 →