有了这个解析插件,大模型能读取 3000 多项 PDF 文档,并根据提问回答问题。

4 月 24 日
 cxd8190102

现在的大模型虽然上下文窗口大,但理解的范围不大,如果全部丢给它,估计会被塞爆。

如果 PDF 里面还包含了图片、表格等等的话,那就更不用说了。

https://imgur.com/a/Guu8GR2

所以,我做了一个专治非结构化数据的文件解析插件 Knowhere ,它能够识别复杂的 PDF 、Excel 、PPT 等格式,然后把文件按照思维导图的逻辑进行解析,最大程度地保留文档的层级和结构,最后按照格式分门别类,方便大模型的调用和读取。这时候你再向大模型提问,它的回答就靠谱多了。

我测试了一下,对比传统简单粗暴的 RAG ,这种树形结构的拆分法更符合 AI 的学习逻辑,出来的结果也更准确了,大大减少了大模型的幻觉。

有需要的老哥可以试用一下: https://knowhereto.ai/?utm_source=V2EX

1940 次点击
所在节点    分享创造
13 条回复
facat
4 月 24 日
能透露一下后台用的是什么服务吗?
cxd8190102
4 月 24 日
@facat #1 我准备把它开源出去,后面你可以关注一下,就知道了。
FrankAdler
4 月 25 日
腾讯的 ima ?
v2zhao
4 月 26 日
最近正好需要 期待分享
wsbqdyhm
4 月 27 日
可以,看起来不错的样子
cxd8190102
4 月 27 日
@FrankAdler #3 不是,自己搞的小项目,ima 装不下这么大的量,解析效果也不好。
FrankAdler
4 月 27 日
@cxd8190102 ima 有 50GB 空间啊,怎么会不够用
cxd8190102
4 月 27 日
@FrankAdler #7 企业级的不行,而且还要解析和调用
cxd8190102
5 月 26 日
@facat #1 现已开源,欢迎体验: https://github.com/Ontos-AI/knowhere
cxd8190102
5 月 26 日
@v2zhao 现已开源,欢迎体验: https://github.com/Ontos-AI/knowhere
cxd8190102
5 月 26 日
@wsbqdyhm #5 现已开源,欢迎体验: https://github.com/Ontos-AI/knowhere
cxd8190102
5 月 26 日
@FrankAdler #7 现已开源,欢迎体验: https://github.com/Ontos-AI/knowhere
facat
5 月 27 日
@cxd8190102 #9 感谢

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1208343

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX