跳到主要内容
buildradar
主题 · web-crawler

web-crawler

标记 web-crawler 主题、收录中的开源项目,按星标数排序。

项目数
31
总星标数
313,958
平均星标数
10,128
占比
0.02%

常跟 web-crawler 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 web-crawler 主题的项目。

  • moli@lexmount

    最适合 AI 代理的无头浏览器。轻量、快速、高兼容性。以 Rust 编写。

    1,499
  • firecrawl@firecrawl

    提供大规模搜索、抓取与交互的 Context API。🔥

    174,034+3,406近 7 天星标变化
  • Scrapegraph-ai@ScrapeGraphAI

    基于 AI 的 Python 抓取工具

    30,047+244近 7 天星标变化
  • crawlee@apify

    Crawlee — 用于 Node.js 的网页抓取与浏览器自动化库,支持 JavaScript 与 TypeScript。可为 AI、LLM、RAG 或 GPT 抽取数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Puppeteer、Playwright、Cheerio、JSDOM 与原始 HTTP,支持有头与无头模式,并提供代理轮换。

    25,556+98近 7 天星标变化
  • crawlab@crawlab-team

    分布式爬虫管理平台,支持任何语言和框架的蜘蛛管理

    12,264+4近 7 天星标变化
  • crawlee-python@apify

    Crawlee — 用于 Python 的网页抓取和浏览器自动化库,用于构建可靠的爬虫。提取 AI、LLM、RAG 或 GPT 的数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Parsel、BeautifulSoup、Playwright 与原始 HTTP,支持有头和无头模式,并具代理轮换功能。

    9,477+19近 7 天星标变化
  • omniparse@adithya-s-k

    获取、解析并优化任何数据格式 ➡️ 从文档到多媒体 ➡️ 提升与 GenAI 框架的兼容性

    7,819+5近 7 天星标变化
  • firecrawl-mcp-server@firecrawl

    🔥 官方 Firecrawl MCP 服务器 - 为 Cursor、Claude 和其他 LLM 客户端添加强大的网页抓取和搜索功能

    7,347+58近 7 天星标变化
  • 各种语言的优秀网络爬虫与蜘蛛集合

    7,298+6近 7 天星标变化
  • wigolo@KnockOutEZ

    你的 AI 代码代理的首选网络——本地优先搜索、抓取、爬取与研究 MCP。无 API 密钥、无云端、$0/查询。公开测试版

    4,752+131近 7 天星标变化
  • Argus@jasonxtn

    终极信息收集工具包

    4,088+21近 7 天星标变化
  • nutch@apache

    Apache Nutch 是一个具扩展性与伸缩性的网络爬虫

    3,279+4近 7 天星标变化
  • 从特定 URL 开始爬取网站、寻找相关网页并提取数据——完全由您的自然语言提示引导。

    3,237+38近 7 天星标变化
  • spider@spider-rs

    为 AI 代理和大型语言模型(LLM)获取网页数据

    2,681+14近 7 天星标变化
  • anakin@Anakin-Inc

    开源网页抓取 API。将任何网站转为整洁的 markdown 或结构化 JSON。具备防检测浏览器、代理服务器自动选择、可自托管等特性。一行指令:make up

    2,453+178近 7 天星标变化
  • webclaw@0xMassi

    为 LLM 提供快速、本机优先的网页内容撷取工具。使用 Rust 进行网页抓取、爬取、撷取结构化资料。提供 CLI、REST API 与 MCP 服务器。

    2,313+15近 7 天星标变化
  • abot@sjdirect

    为速度与灵活性而构建的跨平台 C# 网络爬虫框架。请帮这个项目点个 star!+1。

    2,310+0近 7 天星标变化
  • MarginaliaSearch@MarginaliaSearch

    面向文本网站的互联网搜索引擎。索引小型、古老与奇特的网络世界。

    1,929+8近 7 天星标变化
  • single-file-cli@gildas-lormeau

    用于在单个 HTML 文件中保存完整网页真实副本的 CLI 工具(基于 SingleFile)

    1,573+21近 7 天星标变化
  • moli@lexmount

    最适合 AI 代理的无头浏览器。轻量、快速、高兼容性。以 Rust 编写。

    1,499+556近 7 天星标变化
  • linkinator@JustinBeckwith

    用于爬取网站并验证链接的坏链接检查器。寻找网站、文件和本地文件中的坏链接、死链接和无效 URL。非常适合 SEO 审计与 CI/CD。

    1,255+4近 7 天星标变化
  • browsertrix-crawler@webrecorder

    在单一 Docker 容器中执行高保真基于浏览器的网页归档爬虫

    1,124+6近 7 天星标变化
  • scrapfly-scrapers@scrapfly

    适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本

    1,071+5近 7 天星标变化
  • stormcrawler@apache

    基于 Apache Storm 的可扩展、成熟且多功能的网页爬虫

    994+1近 7 天星标变化
  • LibreCrawl@PhialsBasement

    免费桌面端 SEO 爬虫 - Screaming Frog 及同类工具的开源替代方案。无需订阅费即可抓取网站、分析链接、提取 SEO 数据并导出结果。完全可自定义且可扩展!

    890+16近 7 天星标变化
  • crw@us

    用 Rust 编写的快速、轻量级 Firecrawl/Tavily 替代方案。具备 MCP 服务器的网页爬虫、抓取与搜索 API,专为 AI agent 设计。兼容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能测试中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。仅需 6 MB RAM、单一执行档。可自架或使用托管云端。

    876+230近 7 天星标变化
  • spidr@postmodern

    一个功能多样的 Ruby 网络爬虫库,可以爬取网站、多个域、特定链接或进行无限爬取。Spidr 的设计宗旨是快速且易于使用。

    836+0近 7 天星标变化
  • firecrawl-app-examples@firecrawl

    🔥 此仓库包含使用 Firecrawl 开发的完整应用程序示例,包括网站和其他项目。

    811+2近 7 天星标变化
  • Craw4LLM@cxcscmu

    “Craw4LLM: Efficient Web Crawling for LLM Pretraining”官方仓库

    663+1近 7 天星标变化
  • Stealth-Requests@jpjacobpadilla

    Python 中隐蔽的网页爬虫与无缝 HTML 解析工具!

    561+2近 7 天星标变化
  • reader@vakra-dev

    用于 AI 的开源网页基础设施。支持网页抓取、爬虫、自动化、Markdown 清理与浏览器会话,为你的 Agent 做好准备。

    558+0近 7 天星标变化
← 返回主题列表