图片里的文字怎么提取出来(OCR)
截图、照片、扫描件里的字想复制编辑,一条条手敲不现实——这就是「图片里的文字怎么提取出来」 要解决的事。动手前有两件事必须定:识别语言选「中英混合 / 仅中文 / 仅英文」里的哪一个,以及识别不准时是先修图,还是先改设置。 这篇按图片转文字 OCR 界面上的真实按钮讲全流程。
图片转文字 OCR
照片、截图里的字提出来
文件全程在你的浏览器内处理,不上传服务器,免费不限次数。
OCR 能提什么:印刷体可靠,手写要校对
工具用 tesseract.js 在浏览器里本地跑识别,图片不上传服务器。它把画面里的字符逐个认出、 按行拼成文本,不保留原稿的字号、颜色和表格线—— 拿到的是可复制的纯文本,不是一份排好版的文档。
- 效果好:打印文档翻拍、PDF 截图、手机拍的印刷资料、屏幕截图里的中英文。
- 效果一般:艺术字、强透视斜拍、低对比度、花纹底纹上的字,能认出大半但会有错漏。
- 效果差:潦草手写、连笔字、竖排或极度倾斜的版面。这类内容只能当草稿,逐字人工校对。
- 不管哪种,「99% 准」意味着一百个字错一个——数字、金额、证件号必须单独核对, 这是所有 OCR 的通病,不是工具坏了。
首次要加载约 10MB,之后走缓存
语言三选一:选错了会发生什么
语言切换就三个并排按钮:「中英混合」(默认)、「仅中文」、「仅英文」。 选哪个取决于图片里的字符构成:
| 图片内容 | 选什么 | 选错的后果 |
|---|---|---|
| 中文为主,夹着英文单词、型号 | 中英混合(默认) | 基本不会错,拿不准就用它 |
| 纯中文资料 | 仅中文 | 用中英混合也行,差别通常不大 |
| 纯英文文档、英文代码截图 | 仅英文 | 选了中文系会把噪声认成形近汉字 |
| 中英混排但英文很多 | 中英混合 | 切成仅英文会丢掉整段中文 |
实操建议:先按默认的「中英混合」跑一遍,看结果里有没有成片的乱码—— 满屏拉丁字母说明图里其实是英文却没选对,或者反过来。 语言在点「开始识别文字」之前选定,识别过程中不生效变更。
同一张图可以重跑
多张批量识别:从上传到下载 TXT
- 1点「选择图片」或拖入多张。 提示写着「支持多张图片:JPG / PNG / WebP / BMP」,可分批加; 同名同大小的重复文件会自动去重
- 2按上一节选定语言;右上角「添加更多图片」可以继续补,不要的图点行尾「移除」。 文件计数显示在语言按钮旁边
- 3点「开始识别文字」。 状态依次是「正在加载识别引擎(首次约几秒)…」「正在识别第 2/5 张:扫描件-02.jpg」, 识别中有进度条
- 4每认完一张就出现在结果区,显示「N 字」;没认出内容的显示「(未识别出文字)」。 全部完成后顶部出现「已识别 5/5 张」
- 5单张点「复制」(复制成功变「已复制」,两秒后复原);整批点 「下载全部为 TXT」, 得到「OCR识别结果.txt」
TXT 里每张图之间用「===== 文件名 =====」分隔,顺序就是你添加的顺序—— 扫描件按页码命名后整批识别,导出的文本天然带页序,粘进 Word 不会乱。
识别不准的五个原因,逐个对照改
结果出错时先别怪语言设置——大部分问题出在图片本身。按症状查表:
| 症状 | 原因 | 怎么改 |
|---|---|---|
| 笔画粘连、小字认不出 | 图片模糊(拍虚、截图缩过) | 重新截原图;用 PDF 转图片 以 90% 质量导出再识别 |
| 成行的字错位、漏字 | 页面拍歪了 | 在系统相册里拉正,或重新正对拍摄——OCR 不做纠偏 |
| 字认得出但不成句 | 手写体 | 找打印版重拍;手写内容只能当草稿人工誊录 |
| 整块空白或一团乱码 | 反光高光吃掉了字 | 避开光源重拍,不开闪光灯,换个角度 |
| 中文输出一堆拉丁字母(或反之) | 语言选错 | 改回「中英混合」或「仅中文」,重新点识别 |
修图比改设置更有效
- 截原图,别截缩略图。长边 2000px 左右是识别率与速度的平衡点;二次压缩过的图神仙也救不回来。
- 先裁掉无关区域。页眉水印、背景杂物会贡献噪声,裁掉后识别更干净、也更快。
- 对比度低就先调亮。灰底灰字的拍照件在相册里拉一下对比度,往往立竿见影。
识别结果不要直接拿去交差
扫描件 PDF 里的字怎么提出来
OCR 只吃图片。扫描件 PDF 要先拆成页图,四步走完:
- 1拆页。用 PDF 转图片 导出:格式选「JPG(体积小)」、质量 90%,点「转出全部页面并打包 ZIP」, 得到「文档-第01页.jpg」这样按页序命名的一串图。
- 2整批识别。解压后全部拖进图片转文字 OCR,语言选「中英混合」,点「开始识别文字」。 首次会加载约 10MB 引擎与语言包,之后走缓存。
- 3导出文本。逐张检查错字后点「下载全部为 TXT」,分隔符带文件名,页序不乱。
- 4按用途分流。要进 Word 就把 TXT 粘过去重建排版;要继续在 PDF 流程里走, 参考 PDF 转 Word 一文的扫描件路线——文字版才能直转,扫描件本来就得先 OCR。
手机现拍的合同、发票同理:拍照扫描件 拍完导出 JPG,再进 OCR。 还有一条更快的近路:如果 PDF 里的文字其实存在(能选中),根本不用 OCR—— 直接用 PDF 转 Word 提取文字层,一次拿到 docx 和 TXT。
识别完怎么用:复制、TXT、接 Word
- 只要一段话:点该张图的「复制」直接粘走,适合填表、回消息。
- 整份留存:「下载全部为 TXT」,多张以「===== 文件名 =====」分隔,文件就在本机, 图片与文本都不经过服务器。
- 进 Word / PPT:TXT 全选粘贴后统一字体、套标题样式;表格要在 Word 里重建, OCR 不会给你表格线。
- 回填 PDF:本站不把文字写回原 PDF。做法是把识别结果排成新文档再导出 PDF; 论文场景可以用论文格式转换 保持分栏与参考文献的排版。
- 结果区的字数:每张图显示识别出的字符数,接近 0 说明图片确实没认出内容—— 多半是模糊或语言不对,按上一节排查后重跑。
批量的正确打开方式
常见问题
图片里的文字怎么提取出来?
打开图片转文字 OCR,点「选择图片」上传一张或多张(JPG / PNG / WebP / BMP),选定识别语言后点「开始识别文字」,结果出现在下方文本框里。单张可点「复制」,整批点「下载全部为 TXT」保存。识别在浏览器本地完成,图片不上传。
识别语言该选中英混合还是仅中文?
中文为主、夹着英文型号或单词时用默认的「中英混合」最稳;纯中文两种都行,差别通常不大;纯英文务必选「仅英文」,否则中文模型会把噪声认成形近汉字。拿不准就先用中英混合跑一遍,看输出是否成句,不成句再换语言重跑。
首次识别为什么要加载约 10MB?
首次使用要下载 OCR 引擎核心与语言包(约 10MB),界面会提示「正在加载识别引擎」「正在加载语言包」。下载后走浏览器缓存,同一浏览器再次识别几乎立即开始。这些资源只含识别模型,你的图片本身仍然只在本地处理。
扫描件 PDF 能直接丢进来识别吗?
不能,本工具吃的是图片。先用 PDF 转图片 把扫描件每页导出为 JPG(质量 90%),解压后整批拖进 OCR 识别,再点「下载全部为 TXT」。手机现拍的文件则用拍照扫描件 导出 JPG 后走同一流程。
识别准确率怎么样?手写体行不行?
印刷体中文、英文、截图、打印文档的识别效果好;手写体、艺术字、强透视和反光图片准确率明显下降,只能当草稿并人工校对。数字、金额、证件号务必逐个核对——任何 OCR 都可能错在单个字符上。
能一次识别多张吗?结果怎么保存?
支持多张批量识别:全部拖进去后点「开始识别文字」,逐张出结果,顶部显示「已识别 N/N 张」。单张点「复制」进剪贴板,整批点「下载全部为 TXT」得到 OCR识别结果.txt,各张之间用「===== 文件名 =====」分隔,顺序即添加顺序。
图片转文字 OCR
照片、截图里的字提出来
文件全程在你的浏览器内处理,不上传服务器,免费不限次数。