三步起步 Umi-OCR:免费离线文字识别软件的上手全记录

三步起步 Umi-OCR:免费离线文字识别软件的上手全记录

【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。 【免费下载链接】Umi-OCR 项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

先讲一个真实发生过的下午。你收到一份扫描版的合同 PDF,老板催着要把里面的关键条款整理成 Word;电脑桌面上还堆着十几张课程 PPT 的截图,想复制文字却只能对着屏幕手打;手机相册里躺着几十张纸质笔记的照片,早就想整理成电子笔记,却一直懒得动手。这些"图片里的文字搬不出来"的瞬间,是不是很熟悉?

Umi-OCR 就是专门解决这个问题的——一款免费、开源、完全离线运行的文字识别软件。它最大的卖点是:解压即用、不联网也能跑,图片丢进去,文字吐出来。下面这份记录,是我从下载到熟练使用全程的亲测总结,希望能让你少走弯路。

它到底是个什么工具?一句话说清楚

Umi-OCR 是一个运行在电脑本地的小软件,把图片里的文字识别成可复制、可编辑的文本。它不需要注册账号,不需要上传文件到云端,所有识别都在你自己的电脑上完成——对隐私敏感的人可以放心用。

它的能力可以浓缩成一张表:

能力一句话说明典型场景
截图识别快捷键框选屏幕任意区域,即时出文字网页、软件界面、视频里的字
批量识别一次性导入大量图片统一处理扫描件、照片、截图归档
文档识别读取 PDF 等电子文档并提取文字扫描版 PDF 转可搜索文本
二维码既能扫码也能生成码信息分享、快捷录入

三步走:从下载到第一次成功识别

别被"OCR"这种术语吓到,上手真的只要三步:

  1. 下载并解压。项目仓库提供 .7z 压缩包,解压到任意目录(建议纯英文路径,能避免很多兼容性小问题)。
  2. 双击启动。运行 Umi-OCR.exe(Windows)或 umi-ocr.sh(Linux x64),不需要安装,解压即用。
  3. 打开"截图OCR"标签页,按下快捷键。默认的截图快捷键可以框选屏幕区域,松开鼠标,识别结果立刻就出来了。

Umi-OCR离线OCR软件截图识别界面

截图识别界面:左侧是原图,右侧是识别记录,鼠标划选即可复制

第一次成功把屏幕上的字"搬"成可编辑文本的那一刻,你会觉得:原来 OCR 软件离普通人这么近。

入门:把截图识别练成肌肉记忆

截图识别是这个软件使用频率最高的功能,值得花十分钟把细节摸透。

  • 识别结果怎么用:识别完成后,文字出现在右侧记录栏,你可以用鼠标划选多行一起复制,也可以右键呼出菜单,一键"复制全部"。
  • 不用截图也能识别:在别的软件里复制了一张图片?直接粘贴到 Umi-OCR,照样能识别。截错图了也不用重截,支持对上次截图重复操作。
  • 排版乱的救星:识别出来的文字顺序不对、一段一段乱跳?这是排版解析的问题。软件内置了"文本后处理"方案,默认的"多栏-按自然段换行"适合大多数页面,会自动理解多栏布局并按正确顺序输出。

这里有个小技巧:如果你经常需要识别代码截图,记得把排版方案切换为"单栏-保留缩进"。它能保住行首缩进和行中空格,识别出来的代码几乎可以直接粘回编辑器里用。

Umi-OCR代码截图识别效果

代码截图识别:保留缩进与代码结构,是程序员的顺手小工具

读完这节你能得到:掌握了截图识别的完整操作流,包括快捷键、复制技巧和排版解析的选法,日常"搬字"需求基本覆盖。

熟练:批量处理,把"能用"变成"好用"

当你的需求从"偶尔截个图"变成"把几百张图一次性转成文字",就该打开批量OCR标签页了。

操作路径很直观:把图片拖进列表 → 点"开始任务" → 在右侧记录里查看每张图的结果。整个任务有进度条和耗时统计,一次塞几百张图片也没问题。

Umi-OCR批量OCR任务界面

批量识别:左侧文件列表带进度和置信度,右侧逐张查看识别记录

批量场景里有两个值得专门学会的设定:

  • 输出格式:识别结果可以保存为 txtjsonlmdcsv(Excel 可用)四种格式。想做笔记就选 Markdown,想做数据分析就选 CSV,按需取用。
  • 忽略区域:批量处理的图片里经常带着水印、LOGO、页眉页脚,这些字混进结果里非常碍事。忽略区域编辑器允许你在预览图上按住右键框出矩形,把这些"不想识别的区域"排除掉,识别结果立刻干净一大截。

任务跑完还能设置自动关机或待机——睡前挂上几百张图的识别任务,第二天醒来直接收结果,属于懒人福音。

读完这节你能得到:批量导入、格式输出、忽略区域三个核心操作,从此处理大量图片不再手忙脚乱。

进阶:文档、二维码,以及让软件替你打工

当你对图形界面已经驾轻就熟,可以试试这三件"进阶武器"。

第一件:PDF 文档识别。 把扫描版 PDF 拖进"文档识别"标签页,它能把里面的文字提取出来,甚至生成双层可搜索 PDF——也就是"看起来还是扫描件,但里面的文字可以搜索、可以复制"。处理带页眉页脚的扫描书时,照样可以画忽略区域把它们排除掉。支持 pdfxpsepubmobifb2cbz 等多种文档格式。

第二件:二维码。 截图、粘贴或拖入一张带二维码的图片,可以读出里面的内容,一张图里多个码也能一起识别。反过来,输入一段文本就能生成二维码图片,还支持 19 种条码协议和纠错等级参数,应急扫码或生成分享码都很方便。

第三件:让软件替你打工——命令行与 HTTP 接口。 Umi-OCR 支持用命令行直接操控,比如:

# 对指定图片/文件夹执行识别,结果输出到文件
umi-ocr --path "D:/扫描件目录" --output result.txt

# 直接弹起截图,识别完自动复制到剪贴板
umi-ocr --screenshot --clip

# 识别二维码图片
umi-ocr --qrcode_read "D:/code.png"

所有指令支持前几个字母简写,比如 --screenshot 可以写成 --sc。如果你写脚本,还可以调用它内置的 HTTP 接口(默认 127.0.0.1:1224,仅本地回环,不会泄露到外部网络),把 OCR 能力接进自己的程序里。完整的指令清单见 命令行手册,接口定义见 HTTP 接口文档

顺带一提,界面语言、主题、字体、快捷键这些都能在"全局设置"里调,第一次启动时会跟随系统语言自动切换,多语言界面长这样:

Umi-OCR多语言设置界面

读完这节你能得到:把 Umi-OCR 从"手动工具"升级成"可脚本化的生产力组件"的能力。

一场完整实战:手机照片变成 Markdown 笔记

把前面的能力串起来,走一遍真实流程。假设你有 30 张纸质笔记的照片,想整理成电子版:

  1. 把照片从手机传到电脑,统一放进一个文件夹;
  2. 打开 Umi-OCR 的批量OCR页,把整个文件夹拖进去;
  3. 输出格式选 md,点开始任务,等待跑完;
  4. 若照片里有水印或无关文字,先在"忽略区域"里框掉再跑;
  5. 得到一份 Markdown 文件,导入笔记软件,收工。

整个过程不需要联网,识别速度取决于你的 CPU,半小时内通常能完成。如果你经常做这件事,甚至可以写一个命令行脚本,把这套流程彻底自动化。

踩坑手记:几个常见问题与解决口诀

新手最容易在下面几个地方卡住,我踩过,帮你把坑填平:

  • 截屏时画面闪烁、界面错位 → 多半是显卡加速渲染的问题。去"全局设置 → 界面和外观 → 渲染器"切换渲染方案,或直接关闭硬件加速,一般立刻痊愈。口诀:闪烁就切渲染器
  • 长图、大图识别不全 → 默认会压缩超大图片以换取速度,导致细节丢失。在页面的"设置 → 文字识别 → 限制图像边长"里调高数值,甚至选"无限制"。口诀:大图先看边长限制
  • 识别结果混进一堆水印文字 → 批量页里用忽略区域框住水印,重跑一次。口诀:水印画框屏蔽掉
  • 命令行指令没反应 → 先确认全局设置里"HTTP 服务"是开启的,命令行依赖它做跨进程通信。口诀:命令行依赖本地服务

坦诚的边界:它不擅长什么

有经验的用户都知道,一个工具最有价值的说明,往往写在"它做不到什么"里。Umi-OCR 目前也有一些明确的边界:

  • 不支持把表格图片直接还原成 Excel 表格(输出 CSV 是识别文本的 CSV,不是重建表格结构);
  • 没有图片翻译、离线翻译功能,数学公式识别也仍在远期规划中;
  • 它目前主要面向 Windows 7 x64 和 Linux x64,macOS 尚不支持;
  • HTTP 接口对并发调用支持较弱,大批量持续调用时偶尔会出现连接报错,重试即可。

了解这些边界,能帮你避免把它用错地方——它是优秀的文字提取工具,而不是万能的文档处理套件。开发者如果感兴趣,可以查看项目的 更新日志构建说明 来了解它的演进方向。

写在最后

如果你也经常跟"图片里的文字"打交道,我建议你今天就把 Umi-OCR 下载下来,用三分钟完成那"三步走",然后对着屏幕随便截个图试试。工具是免费的,试错的成本是零,但省下来的时间却是实打实的。

最后多说一句:Umi-OCR 是开发者用业余时间维护的开源项目,如果你用着顺手,觉得它帮到了你,不妨在社区里给它点个赞、反馈一条使用建议,或通过官方渠道支持作者。你的一点点善意,是这类免费工具能长久走下去的动力。

【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。 【免费下载链接】Umi-OCR 项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值