简介
Tesseract是一个开源OCR(Optical Character Recognition)引擎,由HP实验室开发并在2005年至2006年之间作为开源软件发布,Tesseract能够将图像文件中的文本转换为可编辑和可搜索的文本格式,支持多种语言的识别,并且在处理低质量图像时表现出色,目前Tesseract已成为最受欢迎的OCR引擎之一,被广泛应用于各种应用领域,如数字化档案管理、自然语言处理、机器人技术等。


安装步骤
下载好Tesseract后,傻瓜式安装很简单的一直下一步就行。


留意下这个路径要放在一个你知道的地方,现在可以复制下路径,因为要添加环境变量。(可参考以下)
系统变量:PATH 添加 D:\Tesseract-OCR
系统变量: TESSDATA_PREFIX 添加 D:\Tesseract-OCR\tessdata

完成以上步骤后,到终端输入以下命令。

tesseract -v出现以上图片效果就证明安装成功了。


tesseract E:\Desktop\5.png E:\Desktop\1.txt我这里截取了一张tesseract历史发展介绍,用这个作为例子进行识别。
Py3使用
pip install pytesseractfrom PIL import Image
import pytesseract
image = Image.open(r'E:\Desktop\5.png')
# result = pytesseract.image_to_string(image,'chi_sim') # 指定模型'chi_sim'是中文语言包 需要自行下载
result = pytesseract.image_to_string(image)
print(result)
下载好的中文语言包,放入tesseract安装目录里的tessdata文件夹中,就可以进行中文识别了。
评论 (0)