scraper
標記 scraper 主題、收錄中的開源專案,依星數排序。
- #61
📰 Newspaper4k,備受喜愛的 Newspaper3k 的分支。從新聞網站擷取文章、標題與中繼資料。
★ 1,141+1近 7 天星數變化 - #62★ 1,116+2近 7 天星數變化
- #63
使用簡潔、AI 輔助的 DSL 在 Ruby 中編寫網路爬蟲。Kimurai 利用 AI 來找出資料所在位置,然後快取選取器並使用純 Ruby 進行爬取。獲得 LLM 的智慧,而無需付出每次請求的延遲或 Token 成本。
★ 1,102+0近 7 天星數變化 - #64
適用於 40 多個熱門域名的可擴充 Python 網路爬蟲腳本
★ 1,076+4近 7 天星數變化 - #65★ 1,072+6近 7 天星數變化
- #66★ 1,022+1近 7 天星數變化
- #67
一個管理電腦內資源,並提供遊戲化的綜合管理器
★ 1,019+6近 7 天星數變化 - #68★ 1,017+12近 7 天星數變化
- #69
受 <facundoolano/google-play-scraper> 啟發的 Python Google Play 爬蟲
★ 1,010+2近 7 天星數變化 - #70
首款匿名檢視「Instagram 私密貼文」的工具
★ 994+13近 7 天星數變化 - #71★ 956+0近 7 天星數變化
- #72
無需登入或 API 金鑰即可取得 X/Twitter 推文、回覆、時間軸與文章——專為 AI agents 設計的實地工具。
★ 955+6近 7 天星數變化 - #73★ 884+1近 7 天星數變化
- #74
一個基於 Kotlin 的測試/擷取/解析庫,能夠從 HTML(伺服器端與客戶端渲染)中分析並提取資料。它透過提供直觀的 DSL,特別強調易用性與高度可讀性。旨在成為一個測試庫,同時也能以便利的方式用於網頁爬蟲。
★ 875-1近 7 天星數變化 - #75
使用 CSS、XPath 3.0、XQuery 3.0、JSONiq 或模式比對從 HTML/XML 頁面或 JSON-API 下載並擷取資料的命令列工具。它也可以建立新或轉換後的 XML/HTML/JSON 文件。
★ 844+1近 7 天星數變化 - #76★ 842+5近 7 天星數變化
- #77
一個通用的同人誌與圖片庫下載器
★ 841+0近 7 天星數變化 - #78
將部分網路小說轉換為 epub 格式
★ 840+1近 7 天星數變化 - #79★ 836+0近 7 天星數變化
- #80★ 805+0近 7 天星數變化
- #81
一個國際制裁資料、關注人物與政治公眾人物的開放資料庫
★ 797+6近 7 天星數變化 - #82
自託管爬蟲引擎 — 可繞過任何 JS 挑戰與驗證碼:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作為 FlareSolverr 與 Byparr 的替代方案,可直接替換至您的 *arr 堆疊中。
★ 782+46近 7 天星數變化 - #83
🕵️♂️ 爬取 LinkedIn 個人檔案並以 JSON 格式回傳結構化資料。
★ 776+0近 7 天星數變化 - #84
operative framework 是一個基於 Rust 的 OSINT 調查框架,您可以與多個目標互動、執行多個模組、建立與目標的連結、將報告匯出為 PDF 檔案、新增備忘錄給目標或結果、與 RESTful API 互動,以及編寫您自己的模組。
★ 749-1近 7 天星數變化 - #85
用於抓取房地產資料的 Python 套件
★ 739+3近 7 天星數變化 - #86
一個用於 Amazon、Aliexpress、ebay 等多個網站及自訂商店的多使用者自架價格追蹤器。當價格符合使用者設定的一或多個條件時接收通知
★ 738+2近 7 天星數變化 - #87★ 737+1近 7 天星數變化
- #88
一個用於從 HTML 頁面擷取內容的 Scala 函式庫
★ 732+0近 7 天星數變化 - #89★ 730+0近 7 天星數變化
- #90
Twitter 內部 API 文件
★ 711+1近 7 天星數變化