Tesseract 是一款开源的 OCR 引擎,由 Google 维护。它支持多种语言的文字识别,具有较高的识别准确率和良好的扩展性。Tesseract 的核心作用是对经过预处理的图像进行分析,提取其中的文字信息并转换为文本。它可以处理不同字体、大小和格式的文字,并且能够通过训练来提高对特定场景文字的识别能力。
官方网站:https://github.com/Tesseract-ocr/Tesseract
官方文档:https://github.com/Tesseract-ocr/tessdoc
语言包地址:https://github.com/Tesseract-ocr/tessdata
下载地址:https://digi.bib.uni-mannheim.de/Tesseract/
View Details