私有化部署 OCR 解决方案请教

2025 年 7 月 24 日
 Sh1xin
目前有 PDF 和图片两种数据源;又可细分为
PDF:标准 PDF 和扫描件 PDF
图片:截图形式及拍照形式

当前验证方案:PaddleOCR——PP-OCRv5 进行 OCR 识别,之后把解析结果传送至 Gemma 3 27b 进行结果分析,并把需要的内容转换为 json 输出
问题:部分业务场景 OCR 识别粘连,多个相近的文本识别为同一个检测框;以及原本就是多行的文本,但是需求是要转换成一行。这两种在直接把识别结果发送给 Gemma 的时候都会解析错误。即使提示词严格显示输出的内容和要求,依然会获取错误。有没有什么好的方案
8086 次点击
所在节点    程序员
58 条回复
SWBMESSI
2025 年 7 月 24 日
@ersic 项目删除了?
iorilu
2025 年 7 月 24 日
@andyskaura 一大堆 fork 阿, 点进去看
stacke
2025 年 7 月 24 日
当时 fork 了一个微信 OCR ,不知道还能不能用:
https://github.com/Git-cup/wxocr
Rorysky
2025 年 7 月 24 日
这需求属于上古场景,还不需要动用 llm 吧
xiadengmaX1
2025 年 7 月 24 日
paddleocr 的参数调一调吧
alexsz
2025 年 7 月 24 日
扫描件的 OCR 结果不可靠,无解
anyx
2025 年 7 月 24 日
部分业务场景 OCR 识别粘连,多个相近的文本识别为同一个检测框;以及原本就是多行的文本,但是需求是要转换成一行
-----------------------------
看来你需要的是多模态识别能力,可以试试 qweb2.5-vl 系列模型
anyx
2025 年 7 月 24 日
qwen2.5-vl
7b 的模型识别效果就很好了
nno
2025 年 7 月 24 日
检测框出问题是因为你模型输入图片分辨率太低
johnnyyeen
2025 年 7 月 24 日
问一下楼主,Geema 3 对比以前深度学习模型解决方案,有很大提升吗?
bigtear
2025 年 7 月 24 日
直接上多模态大模型,没必要加个 ocr
ersic
2025 年 7 月 24 日
@SWBMESSI github 删了,docker 还在
Sh1xin
2025 年 7 月 24 日
@Ipsum @ersic 刚试了 wxocr 的效果,很差....文字识别错误,多检测框重合。至少 Paddle 文字识别全部正确
Sh1xin
2025 年 7 月 24 日
@bigtear 私有化部署的多模态大模型直接识别图片效果不好,信息安全角度没法使用 api 调用市面上先进方案
pushMeUp
2025 年 7 月 24 日
@SWBMESSI 看 forked list 然后找到别人当时 fork 的版本
Mithril
2025 年 7 月 24 日
这个你可以调一下 paddle 的参数试试。

在 det 里面的 unclip ,dilation ,db_threshold 都可以改改看,然后找个合适的参数。

除非识别率特别低,不然多模态的大模型部署成本还是挺高的,没什么换的必要。
iorilu
2025 年 7 月 24 日
没有好的私有化部署方案很正常

因为这个服务现在是可以卖钱的, 就像 claude 4 一样

如果人人能自己部署且有很好效果, 怎么可能拿来卖钱呢

能卖钱的总是有些独有优化方案的
my3157
2025 年 7 月 24 日
ollama + markitdown 试试,先统一处理为 markdown ,后续再分情况处理
cfer
2025 年 7 月 24 日
@Sh1xin #11 目前国内大厂依然提供 ocr 付费 api 。这意味着在国内你很难找到合适自己的 ocr 方案。他们总是做事滴水不漏 。
nexo
2025 年 7 月 24 日
@iorilu 收钱的 tencent 私有化部署 ocr 10w 一年

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1147272

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX