crawling
标记 crawling 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 crawling 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 crawling 主题的项目。
- #1★ 78,099+941近 7 天星标变化
- #2★ 64,179+81近 7 天星标变化
- #3
Crawlee — 用于 Node.js 的网页抓取与浏览器自动化库,支持 JavaScript 与 TypeScript。可为 AI、LLM、RAG 或 GPT 抽取数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Puppeteer、Playwright、Cheerio、JSDOM 与原始 HTTP,支持有头与无头模式,并提供代理轮换。
★ 25,622+66近 7 天星标变化 - #4★ 25,494+6近 7 天星标变化
- #5★ 17,349+27近 7 天星标变化
- #6★ 15,148+2近 7 天星标变化
- #7
Crawlee — 用于 Python 的网页抓取和浏览器自动化库,用于构建可靠的爬虫。提取 AI、LLM、RAG 或 GPT 的数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Parsel、BeautifulSoup、Playwright 与原始 HTTP,支持有头和无头模式,并具代理轮换功能。
★ 9,481+4近 7 天星标变化 - #8
Web 抓取与数据处理的库、工具和 API 列表
★ 8,139+1近 7 天星标变化 - #9★ 7,084+2近 7 天星标变化
- #10★ 5,117+1近 7 天星标变化
- #11
Exa MCP 用于网络搜索与网页爬虫
★ 4,956+11近 7 天星标变化 - #12
一份 AI 代理与机器人封锁清单
★ 4,097+12近 7 天星标变化 - #13
Headless Chrome .NET API
★ 3,917+1近 7 天星标变化 - #14★ 3,758+2近 7 天星标变化
- #15★ 3,283+4近 7 天星标变化
- #16
精选的 Puppeteer 资源列表。
★ 2,575+3近 7 天星标变化 - #17★ 2,463+0近 7 天星标变化
- #18
📅🇨🇳中国法定节假日数据 自动每日抓取国务院公告
★ 2,120+9近 7 天星标变化 - #19
蓝天采集器是一款开源免费的爬虫系统,仅需点选编辑规则即可采集数据,可运行在本地、虚拟主机或云服务器中,几乎能采集所有类型的网页,无缝对接各类CMS建站程序,免登录实时发布数据,全自动无需人工干预!是网页大数据采集软件中完全跨平台的云端爬虫系统
★ 2,088-1近 7 天星标变化 - #20★ 1,455+0近 7 天星标变化
- #21
用于 Puppeteer 与 Playwright 的补丁集合,可避免自动化检测与泄漏。有助于规避 Cloudflare 与 DataDome CAPTCHA 页面。易于修补与解除修补,可依需求启用或禁用。
★ 1,422-1近 7 天星标变化 - #22★ 1,386+1近 7 天星标变化
- #23
《把六个月的工作在一天内完成的工作自动化(生能出版社,2020)》的示例代码。这是为从未学过 Python 的读者所设计的示例,提供从 Excel、设计、宏到爬虫等各种与工作自动化相关的领域示例。
★ 1,150+1近 7 天星标变化 - #24
在单一 Docker 容器中执行高保真基于浏览器的网页归档爬虫
★ 1,127+5近 7 天星标变化 - #25★ 1,116+2近 7 天星标变化
- #26
适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本
★ 1,076+5近 7 天星标变化 - #27
用于处理使用 Selenium 之 JavaScript 页面的 Scrapy 中间件
★ 950+0近 7 天星标变化 - #28★ 902+6近 7 天星标变化
- #29
SiteOne Crawler 是一个跨平台的网站爬虫与分析工具,适用于 SEO、安全性、无障碍性与性能优化——非常适合开发人员、DevOps、QA 工程师与顾问。支持 Windows、macOS 和 Linux (x64 和 arm64)。
★ 896+14近 7 天星标变化 - #30★ 884+2近 7 天星标变化