跳到主要內容
buildradar
Sign in
主題 · scraper

scraper

標記 scraper 主題、收錄中的開源專案,依星數排序。

共 114 個專案
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k,備受喜愛的 Newspaper3k 的分支。從新聞網站擷取文章、標題與中繼資料。

    1,141+1近 7 天星數變化
  • crawly@elixir-crawly

    Crawly,一個適用於 Elixir 的高階網路爬蟲與資料擷取框架。

    1,116+2近 7 天星數變化
  • kimuraframework@vifreefly

    使用簡潔、AI 輔助的 DSL 在 Ruby 中編寫網路爬蟲。Kimurai 利用 AI 來找出資料所在位置,然後快取選取器並使用純 Ruby 進行爬取。獲得 LLM 的智慧,而無需付出每次請求的延遲或 Token 成本。

    1,102+0近 7 天星數變化
  • scrapfly-scrapers@scrapfly

    適用於 40 多個熱門域名的可擴充 Python 網路爬蟲腳本

    1,076+4近 7 天星數變化
  • jikan@jikan-me

    非官方的 MyAnimeList PHP+REST API,提供官方 API 以外的功能

    1,072+6近 7 天星數變化
  • URS@JosephLai241

    Universal Reddit Scraper - 一款功能全面的 Reddit 爬蟲與歸檔命令列工具。

    1,022+1近 7 天星數變化
  • GreenResourcesManager@klsdf

    一個管理電腦內資源,並提供遊戲化的綜合管理器

    1,019+6近 7 天星數變化
  • wreq@0x676e67

    一個符合人體工學且注重隱私的 Rust HTTP Client

    1,017+12近 7 天星數變化
  • google-play-scraper@JoMingyu

    受 <facundoolano/google-play-scraper> 啟發的 Python Google Play 爬蟲

    1,010+2近 7 天星數變化
  • 首款匿名檢視「Instagram 私密貼文」的工具

    994+13近 7 天星數變化
  • crawler@fredwu

    基於 Elixir 的高效能網路爬蟲 / 擷取器。

    956+0近 7 天星數變化
  • x-tweet-fetcher@ythx-101

    無需登入或 API 金鑰即可取得 X/Twitter 推文、回覆、時間軸與文章——專為 AI agents 設計的實地工具。

    955+6近 7 天星數變化
  • scrapyrt@scrapinghub

    Scrapy 爬蟲的 HTTP API

    884+1近 7 天星數變化
  • skrape.it@skrapeit

    一個基於 Kotlin 的測試/擷取/解析庫,能夠從 HTML(伺服器端與客戶端渲染)中分析並提取資料。它透過提供直觀的 DSL,特別強調易用性與高度可讀性。旨在成為一個測試庫,同時也能以便利的方式用於網頁爬蟲。

    875-1近 7 天星數變化
  • xidel@benibela

    使用 CSS、XPath 3.0、XQuery 3.0、JSONiq 或模式比對從 HTML/XML 頁面或 JSON-API 下載並擷取資料的命令列工具。它也可以建立新或轉換後的 XML/HTML/JSON 文件。

    844+1近 7 天星數變化
  • zimit@openzim

    從任何網站製作 ZIM 檔案並進行離線瀏覽!

    842+5近 7 天星數變化
  • HDoujinDownloader@HDoujinDownloader

    一個通用的同人誌與圖片庫下載器

    841+0近 7 天星數變化
  • epublifier@maoserr

    將部分網路小說轉換為 epub 格式

    840+1近 7 天星數變化
  • spidr@postmodern

    一個功能多樣的 Ruby 網路爬蟲庫,可以爬取網站、多個網域、特定連結或進行無限爬取。Spidr 的設計宗旨是快速且易於使用。

    836+0近 7 天星數變化
  • jvppeteer@fanyong920

    適用於 Chrome 與 Firefox 的 Java API

    805+0近 7 天星數變化
  • opensanctions@opensanctions

    一個國際制裁資料、關注人物與政治公眾人物的開放資料庫

    797+6近 7 天星數變化
  • trawl@germondai

    自託管爬蟲引擎 — 可繞過任何 JS 挑戰與驗證碼:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作為 FlareSolverr 與 Byparr 的替代方案,可直接替換至您的 *arr 堆疊中。

    782+46近 7 天星數變化
  • linkedin-profile-scraper-api@josephlimtech

    🕵️‍♂️ 爬取 LinkedIn 個人檔案並以 JSON 格式回傳結構化資料。

    776+0近 7 天星數變化
  • operative framework 是一個基於 Rust 的 OSINT 調查框架,您可以與多個目標互動、執行多個模組、建立與目標的連結、將報告匯出為 PDF 檔案、新增備忘錄給目標或結果、與 RESTful API 互動,以及編寫您自己的模組。

    749-1近 7 天星數變化
  • HomeHarvest@ZacharyHampton

    用於抓取房地產資料的 Python 套件

    739+3近 7 天星數變化
  • Discount-Bandit@Cybrarist

    一個用於 Amazon、Aliexpress、ebay 等多個網站及自訂商店的多使用者自架價格追蹤器。當價格符合使用者設定的一或多個條件時接收通知

    738+2近 7 天星數變化
  • slash@theahmadov

    Slash OSINT 工具

    737+1近 7 天星數變化
  • scala-scraper@ruippeixotog

    一個用於從 HTML 頁面擷取內容的 Scala 函式庫

    732+0近 7 天星數變化
  • scrapers@cassidoo

    網路上的各種爬蟲程式清單。

    730+0近 7 天星數變化
  • Twitter 內部 API 文件

    711+1近 7 天星數變化
← 返回主題列表