适配umiocr的pp-ocr v6插件,无需安装额外依赖环境等等,基于 ncnn 推理引擎实现 PP-OCRv3/v4/v5/v6 系列模型的高效推理,拷贝到相应文件夹就能用。
Author: baibufeixueyanCreated Jun 29, 2026Updated Jul 23, 2026
bug反馈: 使用umiocr 2.1.5 paddle版本时,识别繁体竖排PDF时,生成的双层可搜索和单层纯文本PDF中的可编辑文字位置不对,打开单层纯文本PDF中可以看到很多文字重叠在一起。图片中可以体现,这个bug是否可以修复?
建议1: paddle模型已经出了最新的pp-ocr v6 medium模型,识别的准确度有了极大的提高。我在
https://gitee.com/ginkdu/paddle-ocr-ncnn-cpp_plugin/releases
下载到适配umiocr的ppocrv6插件,无需安装额外依赖环境等等,就像umioc其他的通用插件使用方法一样,拷贝到相应文件夹就能用了。这个插件还支持vulkan显卡加速模式。 使用pp-ocr v6 medium模型即便是繁体竖排pdf文档,识别的准确度也非常高,当测试结果出来的时候,我特别惊讶。umiocr使用pp-ocr v6 medium模型后识别的准确度有了脱胎换骨的改变。希望作者能够做出新版本的UmiUCR,是基于pp-ocr v6 medium模型的新UmiOCR。
建议2: 增加表格识别功能,最后输出为xlsx格式,我在
https://www.52pojie.cn/thread-2114198-1-1.html
这里下载到某程序(OCR识别助手)的1.1版本,1.2.1和1.2版本的表格识别功能不好用,这个程序有表格识别功能,据作者的描述:表格识别目前主要是OCR 后做文本整理。我简单用了用表格识别功能,简单的表格能够识别。如果umiocr能增加表格识别功能就好了。
Source: hiroi-sora/Umi-OCR