Python中怎么识别图片里的文字

这篇文章将为大家详细讲解有关Python中怎么识别图片里的文字，文章内容质量较高，因此小编分享给大家做个参考，希望大家阅读完这篇文章后对相关知识有一定的了解。

专注于为中小企业提供网站制作、成都网站制作服务,电脑端+手机端+微信端的三站合一,更高效的管理,为中小企业驿城免费做网站提供优质的服务。我们立足成都，凝聚了一批互联网行业人才，有力地推动了近千家企业的稳健成长，帮助中小企业通过网站建设实现规模扩充和转变。

1.Tesseract的安装及配置

Tesseract的安装我们可以移步到该网址 https://digi.bib.uni-mannheim.de/tesseract/，我们可以看到如下界面：

有很多版本供大家选择，大家可以根据自己的需求选择。其中w32表示32位系统，w64表示64位系统，大家选择合适的版本即可。

可能下载速度比较慢，大家可以选择链接：https://pan.baidu.com/s/1jKZe_ACLQCVXiCmvHj9adw 提取码：ayel下载。安装时我们需要知道我们安装的位置，将安装目录配置到系统path变量当中，我们路径是D:\CodeField\Tesseract-OCR。

我们右击我的电脑/此电脑->属性->高级系统设置->环境变量->Path->编辑->新建然后将我们的路径复制进去即可。添加好系统变量后后我们还需要依次点确定，这样才算配置好了。

2.下载语言包

Tesseract默认是不支持中文的，如果想要识别中文或者其它语言需要下载相应的语言包，下载地址如下：https://tesseract-ocr.github.io/tessdoc/Data-Files ，进入网站后我们往下翻：

其中有两个中文语言包，一个Chinese-Simplified和Chinese-Traditional，它们分别是简体中文和繁体中文，我们选择需要的下载即可。下载完成后我们需要放到Tesseract的路径下的tessdata目录下，我们路径是D:\CodeField\Tesseract-OCR\tessdata。

3.其它模块下载

除了上面的步骤，我们还需要下载两个模块：

pip install pytesseract
pip install pillow

第一个是用于文字识别的，第二个是用于图片读取的。接下来我们就可以进行文字识别了。

三、文字识别

1.单张图片识别

接下来的操作就要简单的多，下面是我们要识别的图片：

接下来就是我们文字识别的代码：

import pytesseract
from PIL import Image
# 读取图片
im = Image.open('sentence.jpg')
# 识别文字
string = pytesseract.image_to_string(im)
print(string)

识别结果如下：

Do not go gentle into that good night!

因为默认是支持英文的，所以我们可以直接识别，但是当我们要识别中文或其它语言时就需要做些修改：

import pytesseract
from PIL import Image
# 读取图片
im = Image.open('sentence.png')
# 识别文字，并指定语言
string = pytesseract.image_to_string(im, lang='chi_sim')
print(string)

在识别时，我们设置lang='chi_sim'，也就是把语言设置为简体中文，只有当你的tessdata目录下有简体中文包该设置才会生效。下面是我们用来识别的图片：

识别结果如下：

不 要 温 顺 的 走 进 那 个 良 夜

图片内容被准确识别出来了。有一点我们需要知道，在我们将语言设置为简体中文或其它语言后，Tesseract还是可以识别出英文字符。

2.批量图片识别

既然我们把单张图片识别列出来了，就肯定还有批量图片识别这个功能，这就需要我们准备一个txt文件了，比如我有text.txt文件，内容如下：

sentence1.jpg
sentence2.jpg

我们将代码修改为如下：

import pytesseract
# 识别文字
string = pytesseract.image_to_string('text.txt', lang='chi_sim')
print(string)

但是这样自己写一个txt文件难免有些麻烦，因此我们又可以进行如下修改：

import os
import pytesseract
# 文字图片的路径
path = 'text_img/'
# 获取图片路径列表
imgs = [path + i for i in os.listdir(path)]
# 打开文件
f = open('text.txt', 'w+', encoding='utf-8')
# 将各个图片的路径写入text.txt文件当中
for img in imgs:
    f.write(img + '\n')
# 关闭文件
f.close()
# 文字识别
string = pytesseract.image_to_string('text.txt', lang='chi_sim')
print(string)

关于Python中怎么识别图片里的文字就分享到这里了，希望以上内容可以对大家有一定的帮助，可以学到更多知识。如果觉得文章不错，可以把它分享出去让更多的人看到。

分享名称：Python中怎么识别图片里的文字
标题路径：http://chengdu.cdxwcx.cn/article/ishido.html

甜橘子，专注成都网站制作网站设计与营销型网站建设与优化

首页

网站建设

网站制作案例

解决方案

网站设计报价

网站制作动态

关于我们

联系我们

成都网站建设设计将想法与焦点和您一起共享

Python中怎么识别图片里的文字

1.Tesseract的安装及配置

2.下载语言包

3.其它模块下载

三、文字识别

1.单张图片识别

2.批量图片识别

其他资讯

Go探讨了13年，怎么解决再赋值的坑？

抖音群为什么收不到消息

同事老是吐槽我的接口性能差，原来真凶就在这里

备案信息变更时，是否需要提交核验单？（实行电子化备案之后还需要上传核验单吗）

服务器放家里需要备案吗？换服务器要不要备案

甜橘子，专注成都网站制作网站设计与营销型网站建设与优化

成都网站建设设计 将想法与焦点和您一起共享

Python中怎么识别图片里的文字

1.Tesseract的安装及配置

2.下载语言包

3.其它模块下载

三、文字识别

1.单张图片识别

2.批量图片识别

其他资讯

Go探讨了13年，怎么解决再赋值的坑？

抖音群为什么收不到消息

同事老是吐槽我的接口性能差，原来真凶就在这里

备案信息变更时，是否需要提交核验单？（实行电子化备案之后还需要上传核验单吗）

服务器放家里需要备案吗？换服务器要不要备案

成都网站建设设计将想法与焦点和您一起共享