OCR 哪家强

3 月 27 日
 sq892246139

百度系

PaddleOCR
PaddleVL
PaddleStructure
QianFanOCR
QianFanOCR fast

Paddle 和 QianFan 系不知道有什么区别

Deepseek 系
DeepseekOCR 不支持 latex 公式

智谱系
GLMOCR 好像输出直接能对齐 PaddleOCR PaddleVL PaddleStructure 这 3 个加一起的输出能力

GLMOCR 是按照 token 计费的,0.2 元/M token
PaddleOCR QianFanOCR QianFanOCR fast DeepseekOCR 也都是 token 计费,但是都比 GLMOCR 贵 PaddleVL PaddleStructure 是按照 0.09 元/页计费的

GLMOCR 性能好,也便宜

最后我给 extractfromimg 使用 GLMOCR 来做 OCR 识别

2785 次点击
所在节点    程序员
6 条回复
luya
3 月 27 日
纯代码不要钱百度的还是可以的,文字都能识别的挺好的,上公式啥的我没用过
crab
3 月 28 日
试了几个还是百度的好。
pluto1
3 月 28 日
可以试试 mistral 的 ocr 3 ,我试下来感觉不错,注册下用量不大好像是不要钱的(反正我没花过
snb9
3 月 28 日
腾讯的怎么样
momo1999
3 月 28 日
sq892246139
3 月 29 日
@snb9 没用过啊,没看到腾讯开源的是啥模型,我都是在 https://huggingface.co/看看每家发布的模型,并且使用自己熟悉的公司的

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1201746

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX