关于 RAG/CKG 的问题咨询

1 月 14 日
 jolly336

现在公司有超过百万文件的大仓,在现有的 AI Agent (Cursor/ClaudeCode/Antigravity)下可以 Agentic Search 走 grep 、find 、ls 等命令根据关键词全局找相关代码,然后修改,但这种有几个问题:

  1. 检索能力受限 在大仓上,检索的关键词容易遗漏关键路径,把不相干的内容加入时会占用上下文窗口,后续模型会遗漏一些文件;
  2. 缺少代码结构 检索是 AI 自己给的关键词进行,缺乏真实代码的语义和代码调用、依赖关系等

因此,我们实现了一个 CKG 方案,解析了文件结构之后,分析出依赖、调用关系之后生成代码摘要,然后向量存储,最后提供 MCP 给 Agent 做大仓代码检索。

但理想是好的,现实使用时遇到了问题:

关于这个大家有什么好的想法?

1261 次点击
所在节点    人工智能
2 条回复
111111111111
1 月 14 日
请求来自于 agent ,可以考虑使用一个 LLM 对请求进行加工和理解(比如翻译为中英双语、生成多个候选检索词),然后再进行检索
另外谷歌提过 agent call agent 的思路,可以考虑做一个 agent 来进行细致可控的检索,然后通过 mcp 提供给原 agent
jolly336
1 月 15 日
@111111111111 有道理,现在准备对 LLM 关键词进行二次理解和处理多路查询下,之前还想过对检索这里单独做个 agent ,在里面控制下流程,还能节省主 agent 的上下文

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1185672

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX