scraping
標記 scraping 主題、收錄中的開源專案,依星數排序。
- #61
一個完全翻新與重新設計的分支,基於原版 onlyfans-scraper 從頭重新構想
★ 1,153+0近 7 天星數變化 - #62
📰 Newspaper4k,備受喜愛的 Newspaper3k 的分支。從新聞網站擷取文章、標題與中繼資料。
★ 1,141+0近 7 天星數變化 - #63
能將網站轉化為 API 的 Agent!
★ 1,121+2近 7 天星數變化 - #64★ 1,116+0近 7 天星數變化
- #65
自動從 Google 試算表(及其他來源)封存影片、圖片和社群媒體內容的連結
★ 1,113+1近 7 天星數變化 - #66
⛏️ Maigret 背後的擷取引擎:將任何個人檔案 URL 轉化為跨越 150 多個網站的結構化 OSINT 記錄
★ 1,082+5近 7 天星數變化 - #67
適用於 40 多個熱門域名的可擴充 Python 網路爬蟲腳本
★ 1,078+5近 7 天星數變化 - #68
🧹 用於文字清理的 Python 套件
★ 1,028+0近 7 天星數變化 - #69★ 1,022+0近 7 天星數變化
- #70
透過發送帶有有效 ChatGPT 抓取 API 憑證的提示詞,從 ChatGPT 抓取工具收集結構化回應。只需幾個參數即可啟用即時搜尋、注入 HTML 內容,並自動化智慧抓取 ChatGPT 工作流程。
★ 942+153近 7 天星數變化 - #71
📄 將 Notion.so 頁面轉換為輕量、可自訂的靜態網站的 Python 工具
★ 857+0近 7 天星數變化 - #72
一個可自動為 PDF 檔案產生目錄的 CLI 工具集。
★ 848+0近 7 天星數變化 - #73
簡單但實用的 Python 網頁爬蟲教學程式碼。
★ 820+0近 7 天星數變化 - #74
自託管爬蟲引擎 — 可繞過任何 JS 挑戰與驗證碼:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作為 FlareSolverr 與 Byparr 的替代方案,可直接替換至您的 *arr 堆疊中。
★ 793+26近 7 天星數變化 - #75
🕵️♂️ 爬取 LinkedIn 個人檔案並以 JSON 格式回傳結構化資料。
★ 776+0近 7 天星數變化 - #76★ 774+1近 7 天星數變化
- #77
😈📚 專為反偵測與網頁隱私愛好者策展的研究論文與簡報庫。
★ 771+2近 7 天星數變化 - #78
透過 SERP API 取得 Google 搜尋結果的 Python 套件
★ 755+2近 7 天星數變化 - #79★ 748+5近 7 天星數變化
- #80
用於抓取房地產資料的 Python 套件
★ 739+2近 7 天星數變化 - #81
Comic-dl 是一個命令列工具,用於從各種漫畫網站下載漫畫。支援的網站:readcomiconline.to、mangafox.me、comic naver 等等。
★ 676+2近 7 天星數變化 - #82
:card_index: 使用正規表示式擷取社群媒體個人檔案及更多資訊
★ 656+0近 7 天星數變化 - #83★ 636+1近 7 天星數變化
- #84★ 633+22近 7 天星數變化
- #85
用於爬取美國法院網站中繼資料的 API。
★ 631+3近 7 天星數變化 - #86
Kemono pawchive Downloader 是一款快速的 PyQt5 應用程式,用於從 Kemono、Coomer、Bunkr、Erome、Saint2.su、nhentai 與 Discord 等多種網站封存內容。具備創作者瀏覽器、更新檢查器,並支援多執行緒與多部分下載。工作階段可暫停、恢復或復原。
★ 630+10近 7 天星數變化 - #87
在 AWS Lambda 中使用 Python 與 Selenium 進行 Chrome 自動化的最簡範例
★ 618+0近 7 天星數變化 - #88
此 Python 應用程式是一個名為「Ominis OSINT - Web Hunter」的 OSINT(開源情報)工具。它透過向 Google 查詢與使用者輸入相關的搜尋結果來進行線上資訊收集,並從結果中擷取相關資訊,例如標題、URL 以及對該查詢的潛在提及。
★ 614+2近 7 天星數變化 - #89
用於從 LinkedIn API 轉儲/抓取/提取公司員工的 Python 3 指令碼
★ 611+0近 7 天星數變化 - #90
通用 Reddit 爬蟲,適用於任何 Subreddit 或使用者。
★ 597+4近 7 天星數變化