web-crawler
标记 web-crawler 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 web-crawler 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 web-crawler 主题的项目。
- #1★ 174,034+3,406近 7 天星标变化
- #2
基于 AI 的 Python 抓取工具
★ 30,047+244近 7 天星标变化 - #3
Crawlee — 用于 Node.js 的网页抓取与浏览器自动化库,支持 JavaScript 与 TypeScript。可为 AI、LLM、RAG 或 GPT 抽取数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Puppeteer、Playwright、Cheerio、JSDOM 与原始 HTTP,支持有头与无头模式,并提供代理轮换。
★ 25,556+98近 7 天星标变化 - #4★ 12,264+4近 7 天星标变化
- #5
Crawlee — 用于 Python 的网页抓取和浏览器自动化库,用于构建可靠的爬虫。提取 AI、LLM、RAG 或 GPT 的数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Parsel、BeautifulSoup、Playwright 与原始 HTTP,支持有头和无头模式,并具代理轮换功能。
★ 9,477+19近 7 天星标变化 - #6★ 7,819+5近 7 天星标变化
- #7
🔥 官方 Firecrawl MCP 服务器 - 为 Cursor、Claude 和其他 LLM 客户端添加强大的网页抓取和搜索功能
★ 7,347+58近 7 天星标变化 - #8
各种语言的优秀网络爬虫与蜘蛛集合
★ 7,298+6近 7 天星标变化 - #9★ 4,752+131近 7 天星标变化
- #10★ 4,088+21近 7 天星标变化
- #11★ 3,279+4近 7 天星标变化
- #12
从特定 URL 开始爬取网站、寻找相关网页并提取数据——完全由您的自然语言提示引导。
★ 3,237+38近 7 天星标变化 - #13★ 2,681+14近 7 天星标变化
- #14★ 2,453+178近 7 天星标变化
- #15★ 2,313+15近 7 天星标变化
- #16★ 2,310+0近 7 天星标变化
- #17
面向文本网站的互联网搜索引擎。索引小型、古老与奇特的网络世界。
★ 1,929+8近 7 天星标变化 - #18
用于在单个 HTML 文件中保存完整网页真实副本的 CLI 工具(基于 SingleFile)
★ 1,573+21近 7 天星标变化 - #19★ 1,499+556近 7 天星标变化
- #20
用于爬取网站并验证链接的坏链接检查器。寻找网站、文件和本地文件中的坏链接、死链接和无效 URL。非常适合 SEO 审计与 CI/CD。
★ 1,255+4近 7 天星标变化 - #21
在单一 Docker 容器中执行高保真基于浏览器的网页归档爬虫
★ 1,124+6近 7 天星标变化 - #22
适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本
★ 1,071+5近 7 天星标变化 - #23
基于 Apache Storm 的可扩展、成熟且多功能的网页爬虫
★ 994+1近 7 天星标变化 - #24
免费桌面端 SEO 爬虫 - Screaming Frog 及同类工具的开源替代方案。无需订阅费即可抓取网站、分析链接、提取 SEO 数据并导出结果。完全可自定义且可扩展!
★ 890+16近 7 天星标变化 - #25
用 Rust 编写的快速、轻量级 Firecrawl/Tavily 替代方案。具备 MCP 服务器的网页爬虫、抓取与搜索 API,专为 AI agent 设计。兼容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能测试中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。仅需 6 MB RAM、单一执行档。可自架或使用托管云端。
★ 876+230近 7 天星标变化 - #26★ 836+0近 7 天星标变化
- #27
🔥 此仓库包含使用 Firecrawl 开发的完整应用程序示例,包括网站和其他项目。
★ 811+2近 7 天星标变化 - #28★ 663+1近 7 天星标变化
- #29
Python 中隐蔽的网页爬虫与无缝 HTML 解析工具!
★ 561+2近 7 天星标变化 - #30★ 558+0近 7 天星标变化