跳到主要内容
buildradar
Sign in
主题 · web-scraping

web-scraping

标记 web-scraping 主题、收录中的开源项目,按星标数排序。

项目数
119
总星标数
843,479
平均星标数
7,088
占比
0.04%

常跟 web-scraping 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 web-scraping 主题的项目。

  • moli@lexmount

    最适合 AI 代理的无头浏览器。轻量、快速、高兼容性。以 Rust 编写。

    1,841
  • creatorhub@3441293738

    多平台内容监控·采集·搬运 一个 Web 面板管起抖音 / 小红书 / 快手

    1,833
  • trawl@germondai

    自托管爬虫引擎 — 可绕过任何 JS 挑战与验证码:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作为 FlareSolverr 与 Byparr 的替代方案,可直接替换至您的 *arr 堆栈中。

    793
  • browser-search@Johell1NS

    A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.

    515
  • oc@only-cli

    Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.

    441
  • firecrawl@firecrawl

    提供大规模搜索、抓取与交互的 Context API。🔥

    175,781+0近 7 天星标变化
  • Scrapling@D4Vinci

    🕷️ 一个自适应的网络爬虫框架,能够处理单一请求到全规模爬取的所有需求!

    78,099+0近 7 天星标变化
  • scrapy@scrapy

    Scrapy,一个快速的高阶 Python 网页爬虫与抓取框架。

    64,179+0近 7 天星标变化
  • ai-website-cloner-template@JCodesMore

    使用 AI 编码代理,一条指令即可克隆任意网站

    33,686+0近 7 天星标变化
  • changedetection.io@dgtlmoon

    最佳且最简单的网站变更检测工具,支持网页监控与变更提醒。适合追踪内容变更、价格下降、补货提醒与网站被篡改监测——免费或使用我们的 SaaS 计划!

    33,494+0近 7 天星标变化
  • CloakBrowser@CloakHQ

    隐形 Chromium,通过所有机器人检测测试。可直接替代 Playwright,提供源代码层级的指纹修补。30/30 测试通过。

    31,110+0近 7 天星标变化
  • Scrapegraph-ai@ScrapeGraphAI

    基于 AI 的 Python 抓取工具

    30,435+0近 7 天星标变化
  • AIHawk@feder-cr

    用 Python 实现的开源 AI 求职申请机器人:自动浏览、抓取职位信息,并为每个职位自动填写简历和求职信。

    30,304+0近 7 天星标变化
  • crawlee@apify

    Crawlee — 用于 Node.js 的网页抓取与浏览器自动化库,支持 JavaScript 与 TypeScript。可为 AI、LLM、RAG 或 GPT 抽取数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Puppeteer、Playwright、Cheerio、JSDOM 与原始 HTTP,支持有头与无头模式,并提供代理轮换。

    25,622+0近 7 天星标变化
  • 🚀「Douyin_TikTok_Download_API」是一个开箱即用的高性能异步抖音、快手、TikTok、Bilibili数据爬取工具,支持 API 调用,在线批量解析及下载。

    19,789+0近 7 天星标变化
  • maxun@getmaxun

    🔥 开源无代码平台,用于网页爬取、爬虫、搜索与 AI 数据抽取 • 只需几分钟即可将网站转化为结构化 API 🔥

    17,349+0近 7 天星标变化
  • SurfSense@MODSetter

    开源 NotebookLM 替代方案。通过单一平台、API 或 MCP 服务器,在开放网络上实时检索 Reddit、YT、IG、TikTok、Indeed、Google Search、Maps 等数据。加入我们的 Discord: https://discord.gg/ejRNvftDp9

    16,066+0近 7 天星标变化
  • Skill_Seekers@yusufkaraaslan

    将文档网站、GitHub 仓库和 PDF 转换为 Claude AI 技能,并自动检测冲突

    14,888+0近 7 天星标变化
  • SeleniumBase@seleniumbase

    📊 用于网页自动化、测试与绕过机器人检测的 API

    12,972+0近 7 天星标变化
  • jsoup@jhy

    jsoup:用于 HTML 编辑、清理、抓取与 XSS 防护的 Java HTML 解析器

    11,385+0近 7 天星标变化
  • pinchtab@pinchtab

    高性能浏览器自动化桥接和多实例编排器,具高级隐蔽注入和实时仪表盘。

    10,219+0近 7 天星标变化
  • crawlee-python@apify

    Crawlee — 用于 Python 的网页抓取和浏览器自动化库,用于构建可靠的爬虫。提取 AI、LLM、RAG 或 GPT 的数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Parsel、BeautifulSoup、Playwright 与原始 HTTP,支持有头和无头模式,并具代理轮换功能。

    9,481+0近 7 天星标变化
  • camofox-browser@jo-inc

    为 AI 代理设计的隐形无头浏览器 — 绕过 Cloudflare、机器人检测与防抓取。即插即用的 Puppeteer/Playwright 替代方案。

    9,039+0近 7 天星标变化
  • helium@mherrmann

    使用 Python 实现的轻量级网页自动化工具

    8,322+0近 7 天星标变化
  • awesome-web-scraping@lorien

    Web 抓取与数据处理的库、工具和 API 列表

    8,139+0近 7 天星标变化
  • autoscraper@alirezamika

    一个智慧、全自动、快速且轻量的 Python 网页爬虫

    7,932+0近 7 天星标变化
  • API-mega-list@cporter202

    此 GitHub 仓库是 API 的强大集合,可立即使用,从简单自动化到全规模应用皆可构建。GitHub 上最有价值的 API 清单——毫无疑问。💪

    7,585+0近 7 天星标变化
  • firecrawl-mcp-server@firecrawl

    🔥 官方 Firecrawl MCP 服务器 - 为 Cursor、Claude 和其他 LLM 客户端添加强大的网页抓取和搜索功能

    7,381+0近 7 天星标变化
  • rod@go-rod

    Chrome DevTools 协议驱动,用于网页自动化与抓取

    7,084+0近 7 天星标变化
  • pydoll@autoscrape-labs

    Pydoll 是一个在不使用 WebDriver 的情况下自动化基于 Chromium 浏览器的库,提供逼真的交互。

    7,060+0近 7 天星标变化
  • trafilatura@adbar

    Python 与命令行工具,用于在网络上收集文本和元数据:爬取、抓取、抽取,输出为 CSV、JSON、HTML、MD、TXT、XML

    6,754+0近 7 天星标变化
  • curl_cffi@lexiforest

    Python 绑定 curl-impersonate 分支 via cffi。可模仿浏览器 TLS/JA3/HTTP2 指纹的 HTTP 客户端。

    6,432+0近 7 天星标变化
  • ferret@MontFerret

    声明式数据自动化语言与 Go 运行时,用于结构化抽取工作流。

    6,009+0近 7 天星标变化
  • 从 Google Maps 擷取数据。提取名称、地址、电话号、网站 URL、评分、评论数、纬度经度、评论、电子邮件等信息

    5,710+0近 7 天星标变化
  • skills@browser-act

    Browser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.

    5,549+0近 7 天星标变化
← 返回主题列表