三步起步 Umi-OCR:免费离线文字识别软件的上手全记录
先讲一个真实发生过的下午。你收到一份扫描版的合同 PDF,老板催着要把里面的关键条款整理成 Word;电脑桌面上还堆着十几张课程 PPT 的截图,想复制文字却只能对着屏幕手打;手机相册里躺着几十张纸质笔记的照片,早就想整理成电子笔记,却一直懒得动手。这些"图片里的文字搬不出来"的瞬间,是不是很熟悉?
Umi-OCR 就是专门解决这个问题的——一款免费、开源、完全离线运行的文字识别软件。它最大的卖点是:解压即用、不联网也能跑,图片丢进去,文字吐出来。下面这份记录,是我从下载到熟练使用全程的亲测总结,希望能让你少走弯路。
它到底是个什么工具?一句话说清楚
Umi-OCR 是一个运行在电脑本地的小软件,把图片里的文字识别成可复制、可编辑的文本。它不需要注册账号,不需要上传文件到云端,所有识别都在你自己的电脑上完成——对隐私敏感的人可以放心用。
它的能力可以浓缩成一张表:
| 能力 | 一句话说明 | 典型场景 |
|---|---|---|
| 截图识别 | 快捷键框选屏幕任意区域,即时出文字 | 网页、软件界面、视频里的字 |
| 批量识别 | 一次性导入大量图片统一处理 | 扫描件、照片、截图归档 |
| 文档识别 | 读取 PDF 等电子文档并提取文字 | 扫描版 PDF 转可搜索文本 |
| 二维码 | 既能扫码也能生成码 | 信息分享、快捷录入 |
三步走:从下载到第一次成功识别
别被"OCR"这种术语吓到,上手真的只要三步:
- 下载并解压。项目仓库提供
.7z压缩包,解压到任意目录(建议纯英文路径,能避免很多兼容性小问题)。 - 双击启动。运行
Umi-OCR.exe(Windows)或umi-ocr.sh(Linux x64),不需要安装,解压即用。 - 打开"截图OCR"标签页,按下快捷键。默认的截图快捷键可以框选屏幕区域,松开鼠标,识别结果立刻就出来了。
截图识别界面:左侧是原图,右侧是识别记录,鼠标划选即可复制
第一次成功把屏幕上的字"搬"成可编辑文本的那一刻,你会觉得:原来 OCR 软件离普通人这么近。
入门:把截图识别练成肌肉记忆
截图识别是这个软件使用频率最高的功能,值得花十分钟把细节摸透。
- 识别结果怎么用:识别完成后,文字出现在右侧记录栏,你可以用鼠标划选多行一起复制,也可以右键呼出菜单,一键"复制全部"。
- 不用截图也能识别:在别的软件里复制了一张图片?直接粘贴到 Umi-OCR,照样能识别。截错图了也不用重截,支持对上次截图重复操作。
- 排版乱的救星:识别出来的文字顺序不对、一段一段乱跳?这是排版解析的问题。软件内置了"文本后处理"方案,默认的"多栏-按自然段换行"适合大多数页面,会自动理解多栏布局并按正确顺序输出。
这里有个小技巧:如果你经常需要识别代码截图,记得把排版方案切换为"单栏-保留缩进"。它能保住行首缩进和行中空格,识别出来的代码几乎可以直接粘回编辑器里用。
代码截图识别:保留缩进与代码结构,是程序员的顺手小工具
读完这节你能得到:掌握了截图识别的完整操作流,包括快捷键、复制技巧和排版解析的选法,日常"搬字"需求基本覆盖。
熟练:批量处理,把"能用"变成"好用"
当你的需求从"偶尔截个图"变成"把几百张图一次性转成文字",就该打开批量OCR标签页了。
操作路径很直观:把图片拖进列表 → 点"开始任务" → 在右侧记录里查看每张图的结果。整个任务有进度条和耗时统计,一次塞几百张图片也没问题。
批量识别:左侧文件列表带进度和置信度,右侧逐张查看识别记录
批量场景里有两个值得专门学会的设定:
- 输出格式:识别结果可以保存为
txt、jsonl、md、csv(Excel 可用)四种格式。想做笔记就选 Markdown,想做数据分析就选 CSV,按需取用。 - 忽略区域:批量处理的图片里经常带着水印、LOGO、页眉页脚,这些字混进结果里非常碍事。忽略区域编辑器允许你在预览图上按住右键框出矩形,把这些"不想识别的区域"排除掉,识别结果立刻干净一大截。
任务跑完还能设置自动关机或待机——睡前挂上几百张图的识别任务,第二天醒来直接收结果,属于懒人福音。
读完这节你能得到:批量导入、格式输出、忽略区域三个核心操作,从此处理大量图片不再手忙脚乱。
进阶:文档、二维码,以及让软件替你打工
当你对图形界面已经驾轻就熟,可以试试这三件"进阶武器"。
第一件:PDF 文档识别。 把扫描版 PDF 拖进"文档识别"标签页,它能把里面的文字提取出来,甚至生成双层可搜索 PDF——也就是"看起来还是扫描件,但里面的文字可以搜索、可以复制"。处理带页眉页脚的扫描书时,照样可以画忽略区域把它们排除掉。支持 pdf、xps、epub、mobi、fb2、cbz 等多种文档格式。
第二件:二维码。 截图、粘贴或拖入一张带二维码的图片,可以读出里面的内容,一张图里多个码也能一起识别。反过来,输入一段文本就能生成二维码图片,还支持 19 种条码协议和纠错等级参数,应急扫码或生成分享码都很方便。
第三件:让软件替你打工——命令行与 HTTP 接口。 Umi-OCR 支持用命令行直接操控,比如:
# 对指定图片/文件夹执行识别,结果输出到文件
umi-ocr --path "D:/扫描件目录" --output result.txt
# 直接弹起截图,识别完自动复制到剪贴板
umi-ocr --screenshot --clip
# 识别二维码图片
umi-ocr --qrcode_read "D:/code.png"
所有指令支持前几个字母简写,比如 --screenshot 可以写成 --sc。如果你写脚本,还可以调用它内置的 HTTP 接口(默认 127.0.0.1:1224,仅本地回环,不会泄露到外部网络),把 OCR 能力接进自己的程序里。完整的指令清单见 命令行手册,接口定义见 HTTP 接口文档。
顺带一提,界面语言、主题、字体、快捷键这些都能在"全局设置"里调,第一次启动时会跟随系统语言自动切换,多语言界面长这样:
读完这节你能得到:把 Umi-OCR 从"手动工具"升级成"可脚本化的生产力组件"的能力。
一场完整实战:手机照片变成 Markdown 笔记
把前面的能力串起来,走一遍真实流程。假设你有 30 张纸质笔记的照片,想整理成电子版:
- 把照片从手机传到电脑,统一放进一个文件夹;
- 打开 Umi-OCR 的批量OCR页,把整个文件夹拖进去;
- 输出格式选
md,点开始任务,等待跑完; - 若照片里有水印或无关文字,先在"忽略区域"里框掉再跑;
- 得到一份 Markdown 文件,导入笔记软件,收工。
整个过程不需要联网,识别速度取决于你的 CPU,半小时内通常能完成。如果你经常做这件事,甚至可以写一个命令行脚本,把这套流程彻底自动化。
踩坑手记:几个常见问题与解决口诀
新手最容易在下面几个地方卡住,我踩过,帮你把坑填平:
- 截屏时画面闪烁、界面错位 → 多半是显卡加速渲染的问题。去"全局设置 → 界面和外观 → 渲染器"切换渲染方案,或直接关闭硬件加速,一般立刻痊愈。口诀:闪烁就切渲染器。
- 长图、大图识别不全 → 默认会压缩超大图片以换取速度,导致细节丢失。在页面的"设置 → 文字识别 → 限制图像边长"里调高数值,甚至选"无限制"。口诀:大图先看边长限制。
- 识别结果混进一堆水印文字 → 批量页里用忽略区域框住水印,重跑一次。口诀:水印画框屏蔽掉。
- 命令行指令没反应 → 先确认全局设置里"HTTP 服务"是开启的,命令行依赖它做跨进程通信。口诀:命令行依赖本地服务。
坦诚的边界:它不擅长什么
有经验的用户都知道,一个工具最有价值的说明,往往写在"它做不到什么"里。Umi-OCR 目前也有一些明确的边界:
- 它不支持把表格图片直接还原成 Excel 表格(输出 CSV 是识别文本的 CSV,不是重建表格结构);
- 它没有图片翻译、离线翻译功能,数学公式识别也仍在远期规划中;
- 它目前主要面向 Windows 7 x64 和 Linux x64,macOS 尚不支持;
- HTTP 接口对并发调用支持较弱,大批量持续调用时偶尔会出现连接报错,重试即可。
了解这些边界,能帮你避免把它用错地方——它是优秀的文字提取工具,而不是万能的文档处理套件。开发者如果感兴趣,可以查看项目的 更新日志 和 构建说明 来了解它的演进方向。
写在最后
如果你也经常跟"图片里的文字"打交道,我建议你今天就把 Umi-OCR 下载下来,用三分钟完成那"三步走",然后对着屏幕随便截个图试试。工具是免费的,试错的成本是零,但省下来的时间却是实打实的。
最后多说一句:Umi-OCR 是开发者用业余时间维护的开源项目,如果你用着顺手,觉得它帮到了你,不妨在社区里给它点个赞、反馈一条使用建议,或通过官方渠道支持作者。你的一点点善意,是这类免费工具能长久走下去的动力。
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考







