跳到主要内容
buildradar
Sign in
主题 · crawling

crawling

标记 crawling 主题、收录中的开源项目,按星标数排序。

项目数
39
总星标数
303,335
平均星标数
7,778
占比
0.02%

常跟 crawling 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 crawling 主题的项目。

  • donsetch@dondai44423

    Web fetch, search, and crawl for AI agents. Built from scratch in Rust. No keys, no accounts. AGPL v3.

    632
  • Scrapling@D4Vinci

    🕷️ 一个自适应的网络爬虫框架,能够处理单一请求到全规模爬取的所有需求!

    78,099+941近 7 天星标变化
  • scrapy@scrapy

    Scrapy,一个快速的高阶 Python 网页爬虫与抓取框架。

    64,179+81近 7 天星标变化
  • crawlee@apify

    Crawlee — 用于 Node.js 的网页抓取与浏览器自动化库,支持 JavaScript 与 TypeScript。可为 AI、LLM、RAG 或 GPT 抽取数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Puppeteer、Playwright、Cheerio、JSDOM 与原始 HTTP,支持有头与无头模式,并提供代理轮换。

    25,622+66近 7 天星标变化
  • colly@gocolly

    Elegant Scraper and Crawler Framework for Golang

    25,494+6近 7 天星标变化
  • maxun@getmaxun

    🔥 开源无代码平台,用于网页爬取、爬虫、搜索与 AI 数据抽取 • 只需几分钟即可将网站转化为结构化 API 🔥

    17,349+27近 7 天星标变化
  • newspaper@codelucas

    newspaper3k 是一个用于 Python 3 的新闻、全文与文章元数据抽取工具。高级文档:

    15,148+2近 7 天星标变化
  • crawlee-python@apify

    Crawlee — 用于 Python 的网页抓取和浏览器自动化库,用于构建可靠的爬虫。提取 AI、LLM、RAG 或 GPT 的数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Parsel、BeautifulSoup、Playwright 与原始 HTTP,支持有头和无头模式,并具代理轮换功能。

    9,481+4近 7 天星标变化
  • awesome-web-scraping@lorien

    Web 抓取与数据处理的库、工具和 API 列表

    8,139+1近 7 天星标变化
  • rod@go-rod

    Chrome DevTools 协议驱动,用于网页自动化与抓取

    7,084+2近 7 天星标变化
  • hakrawler@hakluke

    简单、快速的网页爬虫,设计用于轻松、快速发现网页应用程序内的端点与资产

    5,117+1近 7 天星标变化
  • exa-mcp-server@exa-labs

    Exa MCP 用于网络搜索与网页爬虫

    4,956+11近 7 天星标变化
  • ai.robots.txt@ai-robots-txt

    一份 AI 代理与机器人封锁清单

    4,097+12近 7 天星标变化
  • puppeteer-sharp@hardkoded

    Headless Chrome .NET API

    3,917+1近 7 天星标变化
  • cariddi@edoardottt

    输入域名清单,爬取网址并扫描端点、秘密、API 密钥、文件扩展名、令牌等信息

    3,758+2近 7 天星标变化
  • nutch@apache

    Apache Nutch 是一个具扩展性与伸缩性的网络爬虫

    3,283+4近 7 天星标变化
  • awesome-puppeteer@transitive-bullshit

    精选的 Puppeteer 资源列表。

    2,575+3近 7 天星标变化
  • grab@lorien

    网页爬虫框架

    2,463+0近 7 天星标变化
  • holiday-cn@NateScarlet

    📅🇨🇳中国法定节假日数据 自动每日抓取国务院公告

    2,120+9近 7 天星标变化
  • skycaiji@zorlan

    蓝天采集器是一款开源免费的爬虫系统,仅需点选编辑规则即可采集数据,可运行在本地、虚拟主机或云服务器中,几乎能采集所有类型的网页,无缝对接各类CMS建站程序,免登录实时发布数据,全自动无需人工干预!是网页大数据采集软件中完全跨平台的云端爬虫系统

    2,088-1近 7 天星标变化
  • core@roach-php

    PHP 的完整网页爬虫工具包。

    1,455+0近 7 天星标变化
  • rebrowser-patches@rebrowser

    用于 Puppeteer 与 Playwright 的补丁集合,可避免自动化检测与泄漏。有助于规避 Cloudflare 与 DataDome CAPTCHA 页面。易于修补与解除修补,可依需求启用或禁用。

    1,422-1近 7 天星标变化
  • mlscraper@lorey

    🤖 仅需提供示例即可从 HTML 网站自动抓取数据

    1,386+1近 7 天星标变化
  • bhban_rpa@needleworm

    《把六个月的工作在一天内完成的工作自动化(生能出版社,2020)》的示例代码。这是为从未学过 Python 的读者所设计的示例,提供从 Excel、设计、宏到爬虫等各种与工作自动化相关的领域示例。

    1,150+1近 7 天星标变化
  • browsertrix-crawler@webrecorder

    在单一 Docker 容器中执行高保真基于浏览器的网页归档爬虫

    1,127+5近 7 天星标变化
  • crawly@elixir-crawly

    Crawly,一个适用于 Elixir 的高级网络爬虫与数据抓取框架。

    1,116+2近 7 天星标变化
  • scrapfly-scrapers@scrapfly

    适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本

    1,076+5近 7 天星标变化
  • scrapy-selenium@clemfromspace

    用于处理使用 Selenium 之 JavaScript 页面的 Scrapy 中间件

    950+0近 7 天星标变化
  • AdminHack@mishakorzik

    今天我们要入侵网站的管理后台。

    902+6近 7 天星标变化
  • siteone-crawler@janreges

    SiteOne Crawler 是一个跨平台的网站爬虫与分析工具,适用于 SEO、安全性、无障碍性与性能优化——非常适合开发人员、DevOps、QA 工程师与顾问。支持 Windows、macOS 和 Linux (x64 和 arm64)。

    896+14近 7 天星标变化
  • scrapyrt@scrapinghub

    Scrapy 爬虫的 HTTP API

    884+2近 7 天星标变化
← 返回主题列表