web-scraping
标记 web-scraping 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 web-scraping 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 web-scraping 主题的项目。
- #1★ 1,841
- #2
多平台内容监控·采集·搬运 一个 Web 面板管起抖音 / 小红书 / 快手
★ 1,833 - #3
自托管爬虫引擎 — 可绕过任何 JS 挑战与验证码:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作为 FlareSolverr 与 Byparr 的替代方案,可直接替换至您的 *arr 堆栈中。
★ 793 - #4
A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.
★ 515 - #5
Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.
★ 441
- #1★ 175,781+0近 7 天星标变化
- #2★ 78,099+0近 7 天星标变化
- #3★ 64,179+0近 7 天星标变化
- #4
使用 AI 编码代理,一条指令即可克隆任意网站
★ 33,686+0近 7 天星标变化 - #5
最佳且最简单的网站变更检测工具,支持网页监控与变更提醒。适合追踪内容变更、价格下降、补货提醒与网站被篡改监测——免费或使用我们的 SaaS 计划!
★ 33,494+0近 7 天星标变化 - #6
隐形 Chromium,通过所有机器人检测测试。可直接替代 Playwright,提供源代码层级的指纹修补。30/30 测试通过。
★ 31,110+0近 7 天星标变化 - #7
基于 AI 的 Python 抓取工具
★ 30,435+0近 7 天星标变化 - #8★ 30,304+0近 7 天星标变化
- #9
Crawlee — 用于 Node.js 的网页抓取与浏览器自动化库,支持 JavaScript 与 TypeScript。可为 AI、LLM、RAG 或 GPT 抽取数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Puppeteer、Playwright、Cheerio、JSDOM 与原始 HTTP,支持有头与无头模式,并提供代理轮换。
★ 25,622+0近 7 天星标变化 - #10
🚀「Douyin_TikTok_Download_API」是一个开箱即用的高性能异步抖音、快手、TikTok、Bilibili数据爬取工具,支持 API 调用,在线批量解析及下载。
★ 19,789+0近 7 天星标变化 - #11★ 17,349+0近 7 天星标变化
- #12
开源 NotebookLM 替代方案。通过单一平台、API 或 MCP 服务器,在开放网络上实时检索 Reddit、YT、IG、TikTok、Indeed、Google Search、Maps 等数据。加入我们的 Discord: https://discord.gg/ejRNvftDp9
★ 16,066+0近 7 天星标变化 - #13
将文档网站、GitHub 仓库和 PDF 转换为 Claude AI 技能,并自动检测冲突
★ 14,888+0近 7 天星标变化 - #14
📊 用于网页自动化、测试与绕过机器人检测的 API
★ 12,972+0近 7 天星标变化 - #15★ 11,385+0近 7 天星标变化
- #16★ 10,219+0近 7 天星标变化
- #17
Crawlee — 用于 Python 的网页抓取和浏览器自动化库,用于构建可靠的爬虫。提取 AI、LLM、RAG 或 GPT 的数据,下载 HTML、PDF、JPG、PNG 等文件,兼容 Parsel、BeautifulSoup、Playwright 与原始 HTTP,支持有头和无头模式,并具代理轮换功能。
★ 9,481+0近 7 天星标变化 - #18
为 AI 代理设计的隐形无头浏览器 — 绕过 Cloudflare、机器人检测与防抓取。即插即用的 Puppeteer/Playwright 替代方案。
★ 9,039+0近 7 天星标变化 - #19★ 8,322+0近 7 天星标变化
- #20
Web 抓取与数据处理的库、工具和 API 列表
★ 8,139+0近 7 天星标变化 - #21
一个智慧、全自动、快速且轻量的 Python 网页爬虫
★ 7,932+0近 7 天星标变化 - #22
此 GitHub 仓库是 API 的强大集合,可立即使用,从简单自动化到全规模应用皆可构建。GitHub 上最有价值的 API 清单——毫无疑问。💪
★ 7,585+0近 7 天星标变化 - #23
🔥 官方 Firecrawl MCP 服务器 - 为 Cursor、Claude 和其他 LLM 客户端添加强大的网页抓取和搜索功能
★ 7,381+0近 7 天星标变化 - #24★ 7,084+0近 7 天星标变化
- #25★ 7,060+0近 7 天星标变化
- #26
Python 与命令行工具,用于在网络上收集文本和元数据:爬取、抓取、抽取,输出为 CSV、JSON、HTML、MD、TXT、XML
★ 6,754+0近 7 天星标变化 - #27★ 6,432+0近 7 天星标变化
- #28★ 6,009+0近 7 天星标变化
- #29
从 Google Maps 擷取数据。提取名称、地址、电话号、网站 URL、评分、评论数、纬度经度、评论、电子邮件等信息
★ 5,710+0近 7 天星标变化 - #30
Browser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.
★ 5,549+0近 7 天星标变化