AnyCrawl: 基于 TS 的高性能爬虫,用于将任意 Web 转为干净的数据喂给 Agent

20 天前
 thans

求 Star:https://github.com/any4ai/AnyCrawl

主打这些功能:

  1. 搜索引擎抓取:支持多个搜索引擎,批量操作友好
  2. 网页内容提取:精准抓取单页内容
  3. 整站爬取:完整遍历采集网站内容
  4. 性能强劲:支持多线程/多进程
  5. 批量任务:稳定高效处理海量任务
  6. AI 智能解析:用大语言模型( LLM )从网页提取结构化数据( JSON 格式)
  7. 完美适配 LLM:集成简单,开箱即用
1555 次点击
所在节点    分享创造
2 条回复
YAFEIML
19 天前
star 支持
thans
19 天前
@YAFEIML 感谢!

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1232326

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX