有什么办法把复印件和扫描件的内容提取出来吗?

6 天前
 BaiLinfeng

有哪家 ai 的 ocr 强大的吗?或者是哪个插件和库强大的?我想把扫描文件和复印文件,使用 ocr 把文件的内容提取出来,主流的 ai 我都试了下,我发现老是不理想。有更好的办法吗?提高精准度提取的方案。

3938 次点击
所在节点    程序员
53 条回复
BaiLinfeng
5 天前
@gpt5 #39 那我这应该跑不动
gwbw
5 天前
看下百度飞桨,又名 PaddleOCR ,专门做文档识别的
linwenzhi0528
5 天前
布丁扫描不是挺好的吗?
tianhongmei
5 天前
可以试试我的小工具,文档和扫描件转 md.
https://zjsthm.pro/works/markany.html
catinsides
5 天前
自用?批量?还是对外提供服务?单纯的提取都不需要上 AI ,随便找个 OCR 识别不就行了。
JuSH
5 天前
试试 mineru ,我之前用来识别一批旧的标准文档,里面的数学公式都能识别。
snoopygao
5 天前
wps
lyxxxh2
5 天前
不相信你说的,你应该附带的图片。
我用最垃圾的豆包视觉模型(就是 lite 版本)识别游戏截屏,可能有 10-20%概率抽风。
我解决:
1. 发起 2 次识别,结果一样,证明模型没抽风,识别可信。
2. 抽风就多发几次,汇总结果,取最多次的。
encro
5 天前
你用的是假 ai 。


你用百度飞桨,就是 ocr 第一的,如果他不能满足你,其他也别用了。
lefer
5 天前
AI 或者 OCR 不行的话,只能让人去识别了,精确度最高。

搞个 2-3 个人的复核小组,三个人提供的答案一致算是通过,精确度最最最高。
nailaojiang
5 天前
如果内容较多,分批次 AI OCR
iyaozhen
5 天前
你至少发个 demo 吧。现在 OCR 已经很强了
yigedala
4 天前
除了盖在文字上面的图章,影响识别结果外,基本上主流的 ocr 都没啥问题。当然图片要清晰,拍照角度要正

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1234753

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX