tesseract基本用法之识别图片文字

Tesseract 是一个 OCR 库,目前由 Google 赞助(Google 也是一家以 OCR 和机器学习技术闻名于世的公司)。Tesseract 是目前公认最优秀、最精确的开源 OCR 系统,除了极高的精确度,Tesseract 也具有很高的灵活性。它可以通过训练识别出任何字体,也可以识别出任何 Unicode 字符。

安装Tesseract

Windows 系统

下载可执行安装文件:https://code.google.com/p/tesseract-ocr/downloads/list 安装。

Ubuntu Linux系统

可以通过 apt-get 安装: $sudo apt-get tesseract-ocr

Mac OS X系统

用 Homebrew可以很方便地安装: brew install tesseract

要使用 Tesseract 的功能,比如后面的示例中训练程序识别字母,要先在系统中设置一 个新的环境变量 $TESSDATA_PREFIX,让 Tesseract 知道训练的数据文件存储在哪里,然后搞一份tessdata数据文件,放到Tesseract目录下。
  • 在大多数 Linux 系统和 Mac OS X 系统上,你可以这么设置(假设Tesseract数据文件目录在/usr/local/share/下): $export TESSDATA_PREFIX=/usr/local/share/Tesseract

  • 在 Windows 系统上也类似,你可以通过下面这行命令设置环境变量: #setx TESSDATA_PREFIX C:\Program Files\Tesseract OCR\Tesseract

安装pytesseract

Tesseract 是一个命令行工具,安装之后,要用 tesseract 命令在 Python 的外面运行,但我们可以通过 pip 安装支持 Python 版本的 Tesseract库:pytesseract

pip install pytesseract

先出一段代码:

先看一张图片:


import pytesseract
from PIL import Image

# image = Image.open("07test.jpg")
image = Image.open("排序算法.png")
result = pytesseract.image_to_string(image,lang='chi_sim')

print(result)

看结果:


效果还是可以的,大家可以玩一下


猜你喜欢

转载自blog.csdn.net/master_ning/article/details/80698873