跳到主要内容
buildradar
登录
主题 · web-scraping

web-scraping

标记 web-scraping 主题、收录中的开源项目,按星标数排序。

共 119 个项目
  • finvizfinance@lit26

    Finviz 分析 Python 库。

    1,624+0近 7 天星标变化
  • DAT8@justmarkham

    General Assembly 于华盛顿特区举办的 2015 年 Data Science 课程

    1,620+0近 7 天星标变化
  • Scweet@Altimis

    从 Twitter/X 抓取推文、个人资料、粉丝与关注中,无需 API 密钥。具备智能多账号池化、代理支持与异步的 Python 库。

    1,607+0近 7 天星标变化
  • ai-map-py@oxylabs

    AI Map 是由 Oxylabs AI Studio 开发的 AI 驱动网站地图工具,使用自然语言提示词智能探索并从任何网站提取相关 URL。

    1,598+0近 7 天星标变化
  • single-file-cli@gildas-lormeau

    用于在单个 HTML 文件中保存完整网页真实副本的 CLI 工具(基于 SingleFile)

    1,579+0近 7 天星标变化
  • rvest@tidyverse

    适用于 R 的简单网页抓取工具

    1,520+0近 7 天星标变化
  • patchright-python@Kaliiiiiiiiii-Vinyzu

    Playwright 测试与自动化库的未检测 Python 版本。

    1,492+0近 7 天星标变化
  • fredy@orangecoding

    ❤️ Fredy - 轻松寻找房地产 - Fredy 持续在 ImmoScout24、Immowelt、eBay Kleinanzeigen 等德国平台上搜索新公寓与房屋,并通过 Slack、Telegram、Email、Discord 或 ntfy 即时将结果传送给您,让您专注于生活中更重要的事 ;)

    1,462+0近 7 天星标变化
  • core@roach-php

    PHP 的完整网页爬虫工具包。

    1,455+0近 7 天星标变化
  • agentql@tinyfish-io

    AgentQL 是一套用于将 AI 连接至网络的工具。具备查询语言与 Playwright 集成功能,可快速、精确且大规模地与元素交互并提取数据。包含 REST API、Python 与 JavaScript SDK,以及浏览器调试工具。

    1,454+0近 7 天星标变化
  • wreq-python@0x676e67

    一个符合人体工程学且注重隐私的 Python HTTP 客户端

    1,438+0近 7 天星标变化
  • rebrowser-patches@rebrowser

    用于 Puppeteer 与 Playwright 的补丁集合,可避免自动化检测与泄漏。有助于规避 Cloudflare 与 DataDome CAPTCHA 页面。易于修补与解除修补,可依需求启用或禁用。

    1,422+0近 7 天星标变化
  • 使用 Web Scraper API 从 Google Finance 提取数据,包含股票名称、价格与百分比价格变动。

    1,403+0近 7 天星标变化
  • open-scouts@firecrawl

    🔥 AI 驱动的网页监控平台。创建自动化侦察工具来搜索网络,并在找到目标内容时发送电子邮件警报。

    1,360+0近 7 天星标变化
  • openserp@karust

    用于 AI、SEO 与自动化的自托管 SERP API。通过浏览器渲染 Google、Bing、Yandex、Baidu、DuckDuckGo 与 Ecosia 搜索并进行页面提取 🎉

    1,335+0近 7 天星标变化
  • WebAI2API@foxhui

    WebAI2API:基于 Camoufox 的网页 AI 转 API 工具,支持 LMArena/Gemini 等,具备多窗口并发与账号隔离功能。

    1,315+0近 7 天星标变化
  • httpcloak@sardanioss

    具备浏览器相同 TLS/HTTP2 指纹识别功能的 Go HTTP 客户端。在密码学层级(JA3/JA4、Akamai 指纹、标头顺序)完美模仿 Chrome、Firefox 与 Safari 以绕过机器人检测。支持 HTTP/1.1、HTTP/2、HTTP/3、会话、Cookie 与代理服务器。

    1,275+0近 7 天星标变化
  • Decodo@Decodo

    HTTP(S)/SOCKS5 轮换住宅代理 - 代码示例与一般信息。

    1,245+0近 7 天星标变化
  • user-agents@intoli

    一个用于生成随机用户代理(User Agent)的 JavaScript 库,其数据每日更新。

    1,189+0近 7 天星标变化
  • miasma@austin-weeks

    将 AI 网络爬虫困在无尽的毒药坑中。

    1,187+0近 7 天星标变化
  • reverse-api-engineer@nottelabs

    能将网站转化为 API 的 Agent!

    1,145+2近 7 天星标变化
  • faster-than-requests@juancarlospaco

    在 Python 3 上提供更快的 requests 性能

    1,128+0近 7 天星标变化
  • kimuraframework@vifreefly

    使用简洁、AI 辅助的 DSL 在 Ruby 中编写网络爬虫。Kimurai 利用 AI 来找出数据所在位置,然后缓存选择器并使用纯 Ruby 进行爬取。获得 LLM 的智慧,而无需付出每次请求的延迟或 Token 成本。

    1,102+0近 7 天星标变化
  • scrapfly-scrapers@scrapfly

    适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本

    1,079+5近 7 天星标变化
  • ShardBrowser@ProxyShard

    免费、开源的防关联浏览器启动器,用于网络爬虫与多账号管理。由 ProxyShard 团队开发。内含 Chromium 148 的引擎级指纹伪装(WebGL / WebGPU / Client Hints / 字体 / TLS),内置 170+ 种设备配置文件,通过 SOCKS5 支持稳定的 QUIC + WebRTC。

    1,012+184近 7 天星标变化
  • awesome-agent-apis@Anil-matcha

    OpenClaw 资源、工具、技能、教程与文章的精选列表。OpenClaw(前称 Moltbot / Clawdbot)— 适用于 WhatsApp、Telegram、Discord 及 50 多种集成的开源自托管 AI agent。

    1,007+8近 7 天星标变化
  • crw@us

    用 Rust 编写的快速、轻量级 Firecrawl/Tavily 替代方案。具备 MCP 服务器的网页爬虫、抓取与搜索 API,专为 AI agent 设计。兼容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能测试中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。仅需 6 MB RAM、单一执行档。可自架或使用托管云端。

    973+56近 7 天星标变化
  • 通过发送带有有效 ChatGPT 抓取 API 凭证的提示词,从 ChatGPT 抓取工具收集结构化响应。只需几个参数即可启用实时搜索、注入 HTML 内容,并自动化智能抓取 ChatGPT 工作流程。

    965+153近 7 天星标变化
  • x-reader@runesleo

    支持 10+ 个平台的通用内容阅读器 MCP Server

    961+0近 7 天星标变化
  • Oxylabs 产品的官方 Agent 技能。

    871+0近 7 天星标变化
← 返回主题列表