开源了一个"录一次、永久跑"的浏览器采集平台 AegisCrawler(Go + TS, GPL)

9 月 21 日
 aaa69532

搞过采集的都知道,写爬虫不难,难的是维护:页面一改版,选择器全废;人一离职,脚本没人敢动。我们团队被这个折磨久了,就做了个思路不一样的东西——录制即规则,规则即任务:

  1. 装个 Chrome 扩展,在目标网站上像平时一样操作(点、输、翻页),它把你的操作录下来
  2. 录完自动生成一份可读的 DSL 规则( YAML ),向导里能看步骤、看 YAML ,还会真实浏览器完整回放一遍验证,逐步人工确认后存为不可变版本
  3. 服务端( Go + SQLite ,单二进制)把规则当任务调度:租约认领、心跳、重试、死信队列、分级限流、熔断
  4. 浏览器端的 ScriptCat worker 认领任务,真实标签页里执行,结果实时回传

30 秒演示 GIF (在 books.toscrape.com 演示站录制): https://github.com/singhand-labs/AegisCrawler/raw/main/.github/assets/demo.gif

仓库: https://github.com/singhand-labs/AegisCrawler ( GPL-3.0-or-later ,闭源商用单独授权; README 双语; Docker 镜像 GHCR )

几个可能被问的点,先答了:

欢迎拍砖,尤其想听 DSL 设计上的意见——这是整个项目的核心赌注。


版本 B:Linux.do

标题: [分享] 开源浏览器采集平台 AegisCrawler:录制浏览器操作 → 生成可审计 DSL 规则 → 定时任务执行

正文:

(结构与 V2EX 版一致,语气更技术向,可直接用 Markdown 。差异点:)

两站通用注意事项:

331 次点击
所在节点    程序员
1 条回复
catamaran
9 月 22 日
ai 生成的针对 linux.do 的推广稿都舍不得删掉,合适吗?

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1243693

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX