跳到主要內容
buildradar
登入
主題 · scraping

scraping

標記 scraping 主題、收錄中的開源專案,依星數排序。

共 100 個專案
  • OF-Scraper@datawhores

    一個完全翻新與重新設計的分支,基於原版 onlyfans-scraper 從頭重新構想

    1,153+0近 7 天星數變化
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k,備受喜愛的 Newspaper3k 的分支。從新聞網站擷取文章、標題與中繼資料。

    1,141+0近 7 天星數變化
  • reverse-api-engineer@nottelabs

    能將網站轉化為 API 的 Agent!

    1,121+2近 7 天星數變化
  • crawly@elixir-crawly

    Crawly,一個適用於 Elixir 的高階網路爬蟲與資料擷取框架。

    1,116+0近 7 天星數變化
  • auto-archiver@bellingcat

    自動從 Google 試算表(及其他來源)封存影片、圖片和社群媒體內容的連結

    1,113+1近 7 天星數變化
  • socid-extractor@soxoj

    ⛏️ Maigret 背後的擷取引擎:將任何個人檔案 URL 轉化為跨越 150 多個網站的結構化 OSINT 記錄

    1,082+5近 7 天星數變化
  • scrapfly-scrapers@scrapfly

    適用於 40 多個熱門域名的可擴充 Python 網路爬蟲腳本

    1,078+5近 7 天星數變化
  • clean-text@jfilter

    🧹 用於文字清理的 Python 套件

    1,028+0近 7 天星數變化
  • hrequests@daijro

    🚀 適合人類使用的網頁爬蟲

    1,022+0近 7 天星數變化
  • 透過發送帶有有效 ChatGPT 抓取 API 憑證的提示詞,從 ChatGPT 抓取工具收集結構化回應。只需幾個參數即可啟用即時搜尋、注入 HTML 內容,並自動化智慧抓取 ChatGPT 工作流程。

    942+153近 7 天星數變化
  • loconotion@leoncvlt

    📄 將 Notion.so 頁面轉換為輕量、可自訂的靜態網站的 Python 工具

    857+0近 7 天星數變化
  • pdf.tocgen@Krasjet

    一個可自動為 PDF 檔案產生目錄的 CLI 工具集。

    848+0近 7 天星數變化
  • easy-scraping-tutorial@MorvanZhou

    簡單但實用的 Python 網頁爬蟲教學程式碼。

    820+0近 7 天星數變化
  • trawl@germondai

    自託管爬蟲引擎 — 可繞過任何 JS 挑戰與驗證碼:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作為 FlareSolverr 與 Byparr 的替代方案,可直接替換至您的 *arr 堆疊中。

    793+26近 7 天星數變化
  • linkedin-profile-scraper-api@josephlimtech

    🕵️‍♂️ 爬取 LinkedIn 個人檔案並以 JSON 格式回傳結構化資料。

    776+0近 7 天星數變化
  • lookyloo@Lookyloo

    Lookyloo 是一個網頁介面,允許使用者擷取網頁並顯示網域間的呼叫樹狀圖。

    774+1近 7 天星數變化
  • dark-knowledge@prescience-data

    😈📚 專為反偵測與網頁隱私愛好者策展的研究論文與簡報庫。

    771+2近 7 天星數變化
  • 透過 SERP API 取得 Google 搜尋結果的 Python 套件

    755+2近 7 天星數變化
  • rota@alpkeskin

    具備自動 IP 管理與即時健康狀態監控的高效能代理伺服器輪替引擎

    748+5近 7 天星數變化
  • HomeHarvest@ZacharyHampton

    用於抓取房地產資料的 Python 套件

    739+2近 7 天星數變化
  • comic-dl@Xonshiz

    Comic-dl 是一個命令列工具,用於從各種漫畫網站下載漫畫。支援的網站:readcomiconline.to、mangafox.me、comic naver 等等。

    676+2近 7 天星數變化
  • :card_index: 使用正規表示式擷取社群媒體個人檔案及更多資訊

    656+0近 7 天星數變化
  • pricewise@adrianhajdin

    深入網頁爬蟲,並在單一影片中建立 Next.js 13 電商價格追蹤器,教您資料爬蟲、定期任務(cron jobs)、發送電子郵件、部署等功能。

    636+1近 7 天星數變化
  • h5i@h5i-dev

    多 Agent 團隊的沙盒化協作:一個以 Git 為基底的訊息論壇,每個 Agent 都在各自的一次性沙盒中隔離。無需共用憑證或主機存取權即可跨機器協調。

    633+22近 7 天星數變化
  • juriscraper@freelawproject

    用於爬取美國法院網站中繼資料的 API。

    631+3近 7 天星數變化
  • Kemono-Downloader@Yuvi9587

    Kemono pawchive Downloader 是一款快速的 PyQt5 應用程式,用於從 Kemono、Coomer、Bunkr、Erome、Saint2.su、nhentai 與 Discord 等多種網站封存內容。具備創作者瀏覽器、更新檢查器,並支援多執行緒與多部分下載。工作階段可暫停、恢復或復原。

    630+10近 7 天星數變化
  • docker-selenium-lambda@umihico

    在 AWS Lambda 中使用 Python 與 Selenium 進行 Chrome 自動化的最簡範例

    618+0近 7 天星數變化
  • Ominis-OSINT@AnonCatalyst

    此 Python 應用程式是一個名為「Ominis OSINT - Web Hunter」的 OSINT(開源情報)工具。它透過向 Google 查詢與使用者輸入相關的搜尋結果來進行線上資訊收集,並從結果中擷取相關資訊,例如標題、URL 以及對該查詢的潛在提及。

    614+2近 7 天星數變化
  • LinkedInDumper@l4rm4nd

    用於從 LinkedIn API 轉儲/抓取/提取公司員工的 Python 3 指令碼

    611+0近 7 天星數變化
  • reddit-universal-scraper@ksanjeev284

    通用 Reddit 爬蟲,適用於任何 Subreddit 或使用者。

    597+4近 7 天星數變化
← 返回主題列表