跳到主要内容
buildradar
登录
主题 · scraper

scraper

标记 scraper 主题、收录中的开源项目,按星标数排序。

共 114 个项目
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k,备受喜爱的 Newspaper3k 的分支。从新闻网站提取文章、标题与元数据。

    1,141+0近 7 天星标变化
  • crawly@elixir-crawly

    Crawly,一个适用于 Elixir 的高级网络爬虫与数据抓取框架。

    1,116+0近 7 天星标变化
  • kimuraframework@vifreefly

    使用简洁、AI 辅助的 DSL 在 Ruby 中编写网络爬虫。Kimurai 利用 AI 来找出数据所在位置,然后缓存选择器并使用纯 Ruby 进行爬取。获得 LLM 的智慧,而无需付出每次请求的延迟或 Token 成本。

    1,102+0近 7 天星标变化
  • scrapfly-scrapers@scrapfly

    适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本

    1,078+5近 7 天星标变化
  • jikan@jikan-me

    非官方的 MyAnimeList PHP+REST API,提供官方 API 以外的功能

    1,073+5近 7 天星标变化
  • URS@JosephLai241

    Universal Reddit Scraper - 一款功能全面的 Reddit 爬虫与归档命令行工具。

    1,022+1近 7 天星标变化
  • GreenResourcesManager@klsdf

    一个管理电脑内资源,并提供游戏化的综合管理器

    1,020+6近 7 天星标变化
  • wreq@0x676e67

    一个符合人体工学且注重隐私的 Rust HTTP Client

    1,020+11近 7 天星标变化
  • google-play-scraper@JoMingyu

    受 <facundoolano/google-play-scraper> 启发的 Python Google Play 爬虫

    1,010+2近 7 天星标变化
  • 首款匿名查看“Instagram 私密帖子”的工具

    996+10近 7 天星标变化
  • x-tweet-fetcher@ythx-101

    无需登录或 API 密钥即可获取 X/Twitter 推文、回复、时间轴与文章——专为 AI agents 设计的实地工具。

    957+3近 7 天星标变化
  • crawler@fredwu

    基于 Elixir 的高性能网络爬虫 / 抓取器。

    956+0近 7 天星标变化
  • scrapyrt@scrapinghub

    Scrapy 爬虫的 HTTP API

    884+2近 7 天星标变化
  • skrape.it@skrapeit

    一个基于 Kotlin 的测试/抓取/解析库,能够从 HTML(服务端与客户端渲染)中分析并提取数据。它通过提供直观的 DSL,特别强调易用性与高度可读性。旨在成为一个测试库,同时也能以便利的方式用于网页爬虫。

    875+1近 7 天星标变化
  • xidel@benibela

    使用 CSS、XPath 3.0、XQuery 3.0、JSONiq 或模式匹配从 HTML/XML 页面或 JSON-API 下载并提取数据的命令行工具。它还可以创建新或转换后的 XML/HTML/JSON 文档。

    843+0近 7 天星标变化
  • zimit@openzim

    从任何网站制作 ZIM 文件并进行离线浏览!

    842+3近 7 天星标变化
  • HDoujinDownloader@HDoujinDownloader

    一个通用的同人志与图片库下载器

    841+1近 7 天星标变化
  • epublifier@maoserr

    将部分网络小说转换为 epub 格式

    840+1近 7 天星标变化
  • spidr@postmodern

    一个功能多样的 Ruby 网络爬虫库,可以爬取网站、多个域、特定链接或进行无限爬取。Spidr 的设计宗旨是快速且易于使用。

    836+0近 7 天星标变化
  • jvppeteer@fanyong920

    适用于 Chrome 与 Firefox 的 Java API

    805+0近 7 天星标变化
  • opensanctions@opensanctions

    一个国际制裁数据、关注人物与政治公众人物的开放数据库

    799+4近 7 天星标变化
  • trawl@germondai

    自托管爬虫引擎 — 可绕过任何 JS 挑战与验证码:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作为 FlareSolverr 与 Byparr 的替代方案,可直接替换至您的 *arr 堆栈中。

    793+26近 7 天星标变化
  • linkedin-profile-scraper-api@josephlimtech

    🕵️‍♂️ 爬取 LinkedIn 个人资料并以 JSON 格式返回结构化数据。

    776+0近 7 天星标变化
  • operative framework 是一个基于 Rust 的 OSINT 调查框架,您可以与多个目标互动、执行多个模块、建立与目标的链接、将报告导出为 PDF 文件、新增备忘录给目标或结果、与 RESTful API 互动,以及编写您自己的模块。

    749-1近 7 天星标变化
  • Discount-Bandit@Cybrarist

    一个用于 Amazon、Aliexpress、ebay 等多个网站及自定义商店的多用户自建价格追踪器。当价格符合用户设定的一或多个条件时接收通知

    740+4近 7 天星标变化
  • HomeHarvest@ZacharyHampton

    用于抓取房地产数据的 Python 套件

    739+2近 7 天星标变化
  • slash@theahmadov

    Slash OSINT 工具

    738+1近 7 天星标变化
  • scala-scraper@ruippeixotog

    一个用于从 HTML 页面抓取内容的 Scala 库

    732+0近 7 天星标变化
  • scrapers@cassidoo

    网络上的各种爬虫程序清单。

    730+0近 7 天星标变化
  • Twitter 内部 API 文档

    712+2近 7 天星标变化
← 返回主题列表