做了一个给 agent 用的 brain,现在已经有 2500 star 了

9 小时 15 分钟前
 g418572664

之前在读博的时候,手搓过一个解析小插件,用来辅助我读文献、写论文,处理那些大部头的文山著海。后来毕业之后,发现现在做 RAG 相关的,或者开发知识型 agent 照样用得上,所以我就用 AI 完善了一下,开源出去了: https://knowhereto.ai/github/?utm_source=v2ex

简单说一下,Knowhere 是一个文档解析与记忆层工具,它在 RAG 的整体流程中,主要做的是从原始文档到结构化知识的前期准备与管理工作。你可以把它理解为连接“混乱的原始文档”和“AI Agent”之间的一个高级中间件。跟我们常见的 MinerU 这类文档解析工具相比,它算是更新、更进一步的、AI 原生的产品。

区别就在于,MinerU 是传统 GOT-OCR 2.0 架构的代表,它底层是几个模型拼接的:

最后由一套规则把所有结果拼接整合,生成结构化输出。

这样平时在学术论文、技术报告等标准文档上是够用的,但是弊端也有,因为每个模型只管自己那一块嘛,所以任何一个出了问题,整条流水线的结果都会变差。

其次就是,遇到非标准文档(工程图纸、扫描件、手写笔记),各个模型容易水土不服,效果急剧变差。这也是困扰了我很久,并且想要自己动手做工具的起因。

最后就是维护成本高了,每个模型都要单独训练、单独升级、单独部署。

2025 年的时候,纯视觉路线出来了,整个流程被压缩为一步:不需要版面分析、不需要区域分类、不需要独立的文字识别器、表格识别器、公式识别器。一个足够强大的视觉语言模型,直接看着页面图片,输出你想要的任何格式化文本。

这种简化,得益于多模态大模型的发展,对于越来越多的文档类型,纯视觉路线已经达到甚至超过了传统 pipeline 的质量,同时大幅降低了系统复杂度。

Knowhere 就是在这个路线上做起来的。

它能把从原始文件——解析与结构化——chunking——embedding——形成记忆,这整个流程的活儿都给你干了,你直接接上就行。

除了省事之外,它还有以下改进:

根据我们的测试,使用 Knowhere 处理后的文档,AI 回答准确率从 53%提升至 79%,首次搜索准确率提升了 36%。

如果你在 AI 平台里面使用,Knowhere 起码能为你省下一半的 token ,再也不用看到大的文档就肉疼了。

如果你也在做 agent 开发或知识库类的项目,那不妨尝试一下,希望能帮到各位老哥,谢谢: https://knowhereto.ai/?utm_source=v2ex

264 次点击
所在节点    分享创造
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1237434

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX