简单使用tesseract-ocr提取图片中的文字

该文章已生成可运行项目,

访问Introduction | tessdoc,下载Windows版本的安装包和其他语言的训练数据

安装包下载地址:Home · UB-Mannheim/tesseract Wiki · GitHub

其他语言的训练数据下载地址:Traineddata Files for Version 4.00 + | tessdoc

1、下载Tesseract-OCR软件
下载地址:https://github.com/UB-Mannheim/tesseract/releases/download/v5.4.0.20240606/tesseract-ocr-w64-setup-5.4.0.20240606.exe

2、安装Tesseract-OCR软件

3、添加环境变量
在环境变量的path变量增加Tesseract-OCR安装路径

4、下载中文简体语言训练数据(chi_sim)
下载地址:https://github.com/tesseract-ocr/tessdata/raw/4.00/chi_sim.traineddata

5、把下载好的chi_sim.traineddata文件放在 Tesseract-OCR安装目录下的tessdata目录
说明:Tesseract-OCR安装目录下的tessdata目录默认已有eng.traineddata

6.1、测试:提取图片中的英文
截图内容:https://tesseract-ocr.github.io/tessdoc/Installation.html
执行命令:tesseract test1.png test1-output
输出文件:test1-output.txt

6.2、测试:提取图片中的中文
截图内容:https://alk.12348.gov.cn/Detail?dbID=75&dbName=CWZC&sysID=152
执行命令:tesseract test2.png test2-output -l chi_sim
输出文件:test2-output.txt

7、说明
使用Tesseract-OCR提取的内容不一定准确
本文章已经生成可运行项目
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值