跳到主要内容
buildradar
登录
主题 · scraping

scraping

标记 scraping 主题、收录中的开源项目,按星标数排序。

共 100 个项目
  • OF-Scraper@datawhores

    一个完全翻新与重新设计的分支,基于原版 onlyfans-scraper 从头重新构想

    1,153+0近 7 天星标变化
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k,备受喜爱的 Newspaper3k 的分支。从新闻网站提取文章、标题与元数据。

    1,141+0近 7 天星标变化
  • reverse-api-engineer@nottelabs

    能将网站转化为 API 的 Agent!

    1,121+2近 7 天星标变化
  • crawly@elixir-crawly

    Crawly,一个适用于 Elixir 的高级网络爬虫与数据抓取框架。

    1,116+0近 7 天星标变化
  • auto-archiver@bellingcat

    自动从 Google 电子表格(及其他来源)归档视频、图片和社交媒体内容的链接

    1,113+1近 7 天星标变化
  • socid-extractor@soxoj

    ⛏️ Maigret 背后的提取引擎:将任何个人资料 URL 转化为跨越 150 多个网站的结构化 OSINT 记录

    1,082+5近 7 天星标变化
  • scrapfly-scrapers@scrapfly

    适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本

    1,078+5近 7 天星标变化
  • clean-text@jfilter

    🧹 用于文本清理的 Python 软件包

    1,028+0近 7 天星标变化
  • hrequests@daijro

    🚀 适合人类使用的网页爬虫

    1,022+0近 7 天星标变化
  • 通过发送带有有效 ChatGPT 抓取 API 凭证的提示词,从 ChatGPT 抓取工具收集结构化响应。只需几个参数即可启用实时搜索、注入 HTML 内容,并自动化智能抓取 ChatGPT 工作流程。

    942+153近 7 天星标变化
  • loconotion@leoncvlt

    📄 将 Notion.so 页面转换为轻量、可自定义的静态网站的 Python 工具

    857+0近 7 天星标变化
  • pdf.tocgen@Krasjet

    一个可自动为 PDF 文件生成目录的 CLI 工具集。

    848+0近 7 天星标变化
  • easy-scraping-tutorial@MorvanZhou

    简单但实用的 Python 网页爬虫教程代码。

    820+0近 7 天星标变化
  • trawl@germondai

    自托管爬虫引擎 — 可绕过任何 JS 挑战与验证码:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作为 FlareSolverr 与 Byparr 的替代方案,可直接替换至您的 *arr 堆栈中。

    793+26近 7 天星标变化
  • linkedin-profile-scraper-api@josephlimtech

    🕵️‍♂️ 爬取 LinkedIn 个人资料并以 JSON 格式返回结构化数据。

    776+0近 7 天星标变化
  • lookyloo@Lookyloo

    Lookyloo 是一个网页界面,允许用户截取网页并显示域名间的调用树状图。

    774+1近 7 天星标变化
  • dark-knowledge@prescience-data

    😈📚 专为反检测与网页隐私爱好者策展的研究论文与简报库。

    771+2近 7 天星标变化
  • 通过 SERP API 获取 Google 搜索结果的 Python 软件包

    755+2近 7 天星标变化
  • rota@alpkeskin

    具备自动 IP 管理与实时健康状态监控的高性能代理服务器轮换引擎

    748+5近 7 天星标变化
  • HomeHarvest@ZacharyHampton

    用于抓取房地产数据的 Python 套件

    739+2近 7 天星标变化
  • comic-dl@Xonshiz

    Comic-dl 是一个命令行工具,用于从各种漫画网站下载漫画。支持的网站:readcomiconline.to、mangafox.me、comic naver 等等。

    676+2近 7 天星标变化
  • :card_index: 使用正则表达式提取社交媒体个人资料及更多信息

    656+0近 7 天星标变化
  • pricewise@adrianhajdin

    深入网页爬虫,并在单一视频中构建 Next.js 13 电商价格追踪器,教您数据爬虫、定期任务(cron jobs)、发送电子邮件、部署等功能。

    636+1近 7 天星标变化
  • h5i@h5i-dev

    多 Agent 团队的沙盒化协作:一个以 Git 为基底的消息论坛,每个 Agent 都在各自的一次性沙盒中隔离。无需共享凭证或主机访问权限即可跨机器协调。

    633+22近 7 天星标变化
  • juriscraper@freelawproject

    用于爬取美国法院网站元数据的 API。

    631+3近 7 天星标变化
  • Kemono-Downloader@Yuvi9587

    Kemono pawchive Downloader 是一款快速的 PyQt5 应用程序,用于从 Kemono、Coomer、Bunkr、Erome、Saint2.su、nhentai 与 Discord 等多种网站存档内容。具备创作者浏览器、更新检查器,并支持多线程与多部分下载。会话可暂停、恢复或复原。

    630+10近 7 天星标变化
  • docker-selenium-lambda@umihico

    在 AWS Lambda 中使用 Python 与 Selenium 进行 Chrome 自动化的最简示例

    618+0近 7 天星标变化
  • Ominis-OSINT@AnonCatalyst

    此 Python 应用程序是一个名为“Ominis OSINT - Web Hunter”的 OSINT(开源情报)工具。它通过向 Google 查询与用户输入相关的搜索结果来进行在线信息搜集,并从结果中提取相关信息,例如标题、URL 以及对该查询的潜在提及。

    614+2近 7 天星标变化
  • LinkedInDumper@l4rm4nd

    用于从 LinkedIn API 转储/抓取/提取公司员工的 Python 3 脚本

    611+0近 7 天星标变化
  • reddit-universal-scraper@ksanjeev284

    通用 Reddit 爬虫,适用于任何 Subreddit 或用户。

    597+4近 7 天星标变化
← 返回主题列表