行业资讯
📅 2026/8/20 19:09:29
eSearch离线OCR:四步搭好古籍竖排识别工作台
eSearch离线OCR四步搭好古籍竖排识别工作台【免费下载链接】eSearch截屏 离线OCR 搜索翻译 以图搜图 贴图 录屏 万向滚动截屏 屏幕翻译 Screenshot Offline OCR Search Translate Search for picture Paste the picture on the screen Screen recorder Omnidirectional scrolling screenshot Screen translator 支持Windows Linux macOS项目地址: https://gitcode.com/GitHub_Trending/es/eSearcheSearch 是一款免费开源的截屏与离线OCR工具把截屏、文字识别、搜索翻译、贴图、录屏收进同一个软件。许多人冲着它的竖排文字识别而来——古籍、家谱、竖排 PDF 都能在完全离线的状态下完成识别不联网、不注册、不花钱。这篇文章把 eSearch 拆成一条可照做的流程用四个阶段搭起一套古籍数字化工作台每一阶段都给出可验证的完成标准边做边检查不绕弯路。之所以叫工作台而不是一个功能是因为竖排识别从来不是按一下按钮就结束的事。一套能稳定出结果的工作流至少包含三块拼图识别引擎负责读字识别参数负责读懂版面方向与段落校对手段负责把误识挑出来。下面四个阶段正好对应这三块拼图外加一步提速扩容。拆箱安装用一次框选识别完成首次验收安装方式按系统挑一个即可Windows 用户可在命令行执行winget install esearchLinux 用户如 Arch在 AUR 中搜索e-search想自己编译源码克隆仓库后安装依赖git clone https://gitcode.com/GitHub_Trending/es/eSearch cd eSearch npm install运行 eSearch 后按下默认快捷键AltCmacOS 为⌥C进入截屏也可以右键点击托盘图标选择截屏搜索。此时框选你要识别的区域——把古籍那一页框出来直接按回车。识别结果会连同原图一起出现在编辑页左侧图片区显示原图右侧编辑区是可编辑的文字。第一阶段完成标准✅ 框选→回车后编辑页出现可编辑文本且图片区保留原图。这里值得先弄清一个概念为什么 eSearch 默认走离线OCR它内置了基于 PaddleOCR 的离线识别引擎开箱即用在线 OCR百度、有道等速度更快但需要申请 API 密钥而且要上传图片。古籍扫描件往往涉及隐私内容离线方案在这类场景下的优势很直接维度离线OCR在线OCR费用完全免费需申请 API Key多数限次数网络全程不需要断网即失效隐私图片不出本机图片需上传服务器体积模型较大占磁盘不占本地空间校准竖排方向关闭整体方向识别开启段落分析第一次识别成功后先别急着录入。竖排识别成败的关键在设置里的文字识别OCR一栏默认参数是按横排书写的习惯设计的需要手动校准两个开关关闭整体方向识别。这个开关的官方说明写得明明白白——识别整体方向并纠正不适合竖排文字。开启时引擎会把竖排内容强行纠正成横排结果就是整列读反、顺序全乱。竖排场景下务必关掉它。开启识别段落。它的作用是通过排版识别算法分析段落和阅读顺序。古籍讲究从右到左、从上到下开启后引擎会按版面结构排出正确的阅读顺序而不是把一列字当成一行横排硬拼。原理上这两个开关分别负责两个层次方向校准解决这一列从上到下还是从下到上段落识别解决多列之间先读哪一列。方向关了、段落开了输出顺序天然就是从右到左、从上到下。如果识别后仍有行尾被切断的情况可以再打开**自动删除换行**。它会分析行尾标点把多余的换行合并掉遇到拉丁文字还会在合并时自动补上空格整理英文或德文材料时同样适用。第二阶段完成标准✅ 识别文本的列序正确从右到左、从上到下段落结构完整。若个别地方段落顺序仍错乱不必手工重排——在编辑区按撤销快捷键可以恢复到未识别段落的原始排版重新整理即可。搭建校对闭环让图片区与编辑区双向定位识别结果再漂亮也挡不住繁体字、异体字和印刷瑕疵造成的误判。eSearch 的校对方式是把看原文和改文字放进同一个屏幕在左侧图片区点选文字右侧编辑区会同步选中对应内容——类似手机上实况文本的体验但选区是真实可编辑的。反向同样成立在编辑区选中文字图片区会自动定位到原文位置。即使你在编辑区增删了文字双向定位依然有效因为同步逻辑基于 diff 算法能尽可能还原增删后的对应关系。编辑器还会启用 Chrome 的拼写检查用蓝色波浪线标出可疑词误识的繁体字往往一眼就能暴露。这套设计的思路是人是最终的校对者软件只负责辅助——双向同步解决了图上有字、编辑器里有文却对不上号的最大麻烦。第三阶段完成标准✅ 图上选字时编辑区同步选中改正错字后仍能在图上定位到对应原文。扩容提速下载语言模型并开启框选自动识别最后一步把工作台的适用范围和效率拉满。换语言不用换软件。离线 OCR 的模型列表在设置里直接下载除默认的中英混合外还有中文繁体、英文、日文、韩文、泰卢固文、卡纳达文、泰米尔文、拉丁文、阿拉伯字母、斯拉夫字母、梵文字母等模型。需要说明的是模型按文字而非语言命名比如德语对应拉丁文模型。下载完成后模型会自动加入列表随时切换。省两步让识别自己跑。两处设置能显著减少重复操作把框选后默认操作设为文字识别框选完即自动识别连回车都省了开启OCR 后自动复制到剪贴板识别完直接去文档里粘贴。嫌慢可以换推理后端。离线 OCR 默认用 CPU 运行模型速度在可接受范围内如果你的设备支持还可以切换到 CUDA、Core MLmacOS或 DirectMLWindows后端加速推理。具体说明见项目文档 docs/use/ocr.md 的AI 后端一节。第四阶段完成标准✅ 成功切换语言模型并识别对应文字框选后自动出结果无需多余点击。四关全过从书柜第一页开工回看整条流程四个阶段其实是四道验收关拆箱确认工具跑通校准让竖排读出正确顺序校对把误识逐个揪出扩容让工具覆盖更多语种和更快的节奏。四关都过你的古籍数字化工作台就算真正落成——书柜里那本家谱的第一页随时可以开工。想深挖每个设置的细节官方文档是最顺手的入口docs/use/ocr.md 讲透识别、段落与模型下载docs/use/start.md 覆盖截屏与主页面操作docs/use/editor.md 说明校对相关的编辑功能。使用时遇到问题或有改进想法也欢迎向项目反馈——这正是开源软件的常态工具被人用起来才会被改得更好用。【免费下载链接】eSearch截屏 离线OCR 搜索翻译 以图搜图 贴图 录屏 万向滚动截屏 屏幕翻译 Screenshot Offline OCR Search Translate Search for picture Paste the picture on the screen Screen recorder Omnidirectional scrolling screenshot Screen translator 支持Windows Linux macOS项目地址: https://gitcode.com/GitHub_Trending/es/eSearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考