跳到主要內容
buildradar
登入
主題 · scraping

scraping

標記 scraping 主題、收錄中的開源專案,依星數排序。

共 100 個專案
  • geziyor@geziyor

    Geziyor,適用於 Go 的極速網頁爬蟲與數據抓取框架。支援 JS 渲染。

    2,776+0近 7 天星數變化
  • twscrape@vladkens

    用於 X/Twitter 爬取的 Python 函式庫與 CLI,支援多帳號輪替與內建速率限制處理。

    2,732+0近 7 天星數變化
  • spider@spider-rs

    為 AI 代理和大型語言模型(LLM)獲取網頁資料

    2,687+0近 7 天星數變化
  • brightdata-mcp@brightdata

    一款強大的 Model Context Protocol (MCP) 伺服器,為公開網路存取提供全方位解決方案。

    2,624+0近 7 天星數變化
  • BotBrowser@botswin

    具備統一指紋防禦的高級隱私瀏覽器核心:Cloudflare、Akamai、Kasada、Shape、DataDome、PerimeterX、hCaptcha、FunCaptcha、Imperva、reCAPTCHA、ThreatMetrix、Adscore

    2,601+0近 7 天星數變化
  • fingerprint-suite@apify

    用於將爬蟲匿名化的瀏覽器指紋工具。由 Apify 開發。

    2,588+0近 7 天星數變化
  • awesome-puppeteer@transitive-bullshit

    精選的 Puppeteer 資源列表。

    2,575+0近 7 天星數變化
  • shot-scraper@simonw

    一款 CLI 工具,用於對網站進行螢幕截圖、錄製影片示範以及使用 JavaScript 爬取網站

    2,559+0近 7 天星數變化
  • grab@lorien

    網頁爬蟲框架

    2,463+0近 7 天星數變化
  • OSINT 速查表、OSINT 工具清單、wiki、資料集、文章、書籍、駭客專用的紅隊 OSINT、OSINT 技巧與 OSINT 分支。本儲存庫將隨著研究不斷成長,包含研究、科學與技術、教學。請善加利用。

    2,196+0近 7 天星數變化
  • Embed@php-embed

    從任何網路服務或網頁取得資訊

    2,140+0近 7 天星數變化
  • 適用於 Playwright 的免費防檢測隱身瀏覽器:未被偵測的無頭 Firefox 指紋。Python 爬蟲、recaptcha 與機器人檢測繞過。開源

    1,962+0近 7 天星數變化
  • iiab@iiab

    Internet-in-a-Box - 使用 Raspberry Pi 建立你自己的亞歷山大圖書館!

    1,948+0近 7 天星數變化
  • 反偵測與擬人化工具及瀏覽器列表,包含驗證碼解決器與簡訊驗證碼啟用工具。

    1,909+0近 7 天星數變化
  • cloudproxy@claffin

    將您的爬蟲 IP 隱藏在雲端背後。在不同的雲端供應商之間佈建代理伺服器,以提高您的爬蟲成功率。

    1,720+0近 7 天星數變化
  • 在本教學中,我們將展示如何使用 Python 與 Oxylabs API 擷取公開的 Google 資料。

    1,692+0近 7 天星數變化
  • thepipe@emcf

    藉由視覺語言模型(VLM),從複雜的文件中取得乾淨的資料 ⚡

    1,524+0近 7 天星數變化
  • agentql@tinyfish-io

    AgentQL 是一套用於將 AI 連線至網 pecul 的工具。具備查詢語言與 Playwright 整合功能,可快速、精確且大規模地與元素互動並擷取資料。包含 REST API、Python 與 JavaScript SDK,以及瀏覽器偵錯工具。

    1,454+0近 7 天星數變化
  • rebrowser-patches@rebrowser

    用於 Puppeteer 與 Playwright 的修補程式集合,可避免自動化偵測與洩漏。有助於規避 Cloudflare 與 DataDome CAPTCHA 頁面。易於修補與解除修補,可依需求啟用或停用。

    1,422+0近 7 天星數變化
  • mlscraper@lorey

    🤖 僅需提供範例即可從 HTML 網站自動擷取資料

    1,386+0近 7 天星數變化
  • querido-diario@okfn-brasil

    📰 讓所有人都能存取的巴西官方公報。

    1,375+0近 7 天星數變化
  • Auto-Gmail-Creator@ai-to-ai

    使用 Selenium 與 Seleniumwire (Python) 的開源批量自動 Gmail 建立機器人。歡迎隨時聯絡我進行 Django/Flask、ML、AI、GPT、自動化、網路爬蟲相關合作。

    1,371+0近 7 天星數變化
  • parsera@raznem

    使用 LLM 進行網站爬蟲的輕量級函式庫

    1,353+0近 7 天星數變化
  • parsel@scrapy

    Parsel 讓你能夠使用 XPath 或 CSS 選擇器從 XML/HTML 文件中擷取資料

    1,353+0近 7 天星數變化
  • mov-cli@mov-cli

    在終端機中監看所有內容。

    1,294+0近 7 天星數變化
  • Decodo@Decodo

    HTTP(S)/SOCKS5 輪換住宅代理 - 程式碼範例與一般資訊。

    1,244+0近 7 天星數變化
  • browserforge@daijro

    🎭 智慧型瀏覽器標頭與指紋產生器

    1,237+0近 7 天星數變化
  • websurfx@neon-mmd

    searx 的開源替代方案,提供外觀現代、極速、注重隱私、安全的中繼搜尋引擎

    1,189+0近 7 天星數變化
  • rama@plabayo

    用於移動與轉換網路封包的模組化服務框架

    1,181+0近 7 天星數變化
  • oj@online-judge-tools

    用於各種線上評測系統(OJ)的工具。包含下載範例測資、產生額外測資、測試程式碼以及提交。

    1,169+0近 7 天星數變化
← 返回主題列表