【每日随记】Tesseract 文字识别搭建
2023-04-08 / 0 评论 / 57 阅读 / 2 点赞

【每日随记】Tesseract 文字识别搭建

发光的神
2023-04-08 / 0 评论 / 57 阅读 / 正在检测是否收录...

简介

Tesseract是一个开源OCR(Optical Character Recognition)引擎,由HP实验室开发并在2005年至2006年之间作为开源软件发布,Tesseract能够将图像文件中的文本转换为可编辑和可搜索的文本格式,支持多种语言的识别,并且在处理低质量图像时表现出色,目前Tesseract已成为最受欢迎的OCR引擎之一,被广泛应用于各种应用领域,如数字化档案管理、自然语言处理、机器人技术等。

lgn3ozz5.png

Github项目

lgn37gbu.png

Tesseract下载

安装步骤

下载好Tesseract后,傻瓜式安装很简单的一直下一步就行。

lgn3gt4n.png

lgn3i3dh.png

留意下这个路径要放在一个你知道的地方,现在可以复制下路径,因为要添加环境变量。(可参考以下)
系统变量:PATH 添加 D:\Tesseract-OCR
系统变量: TESSDATA_PREFIX 添加 D:\Tesseract-OCR\tessdata

lgn52s7m.png

完成以上步骤后,到终端输入以下命令。

lgn3t9ur.png

tesseract -v

出现以上图片效果就证明安装成功了。

lgn3z0yo.png

lgn40sog.png

tesseract E:\Desktop\5.png E:\Desktop\1.txt

我这里截取了一张tesseract历史发展介绍,用这个作为例子进行识别。

Py3使用

pip install pytesseract
from PIL import Image
import pytesseract

image = Image.open(r'E:\Desktop\5.png')
# result = pytesseract.image_to_string(image,'chi_sim') # 指定模型'chi_sim'是中文语言包 需要自行下载
result = pytesseract.image_to_string(image)
print(result)

中文语言包

lgn4mz9g.png

下载好的中文语言包,放入tesseract安装目录里的tessdata文件夹中,就可以进行中文识别了。

2

评论 (0)

取消
0:00