Chuyển tới nội dung chính
buildradar
Đăng nhập
Chủ đề · scraping

scraping

Các kho mã nguồn mở đang theo dõi được gắn thẻ scraping, sắp xếp theo số sao.

100 kho mã
  • OF-Scraper@datawhores

    Một bản fork được làm mới và thiết kế lại hoàn toàn, được tái tưởng tượng từ đầu dựa trên onlyfans-scraper gốc

    1.153+0Thay đổi số sao trong 7 ngày qua
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k, một nhánh (fork) của Newspaper3k được yêu thích. Trích xuất bài viết, tiêu đề và siêu dữ liệu từ các trang web tin tức.

    1.141+0Thay đổi số sao trong 7 ngày qua
  • reverse-api-engineer@nottelabs

    Tác nhân biến các trang web thành API!

    1.121+2Thay đổi số sao trong 7 ngày qua
  • crawly@elixir-crawly

    Crawly, một framework cào và thu thập dữ liệu web cấp cao dành cho Elixir.

    1.116+0Thay đổi số sao trong 7 ngày qua
  • auto-archiver@bellingcat

    Tự động lưu trữ liên kết đến video, hình ảnh và nội dung mạng xã hội từ Google Sheets (và nhiều hơn nữa).

    1.113+1Thay đổi số sao trong 7 ngày qua
  • socid-extractor@soxoj

    ⛏️ Công cụ trích xuất đằng sau Maigret: biến bất kỳ URL hồ sơ nào thành bản ghi OSINT có cấu trúc trên hơn 150 trang web

    1.082+5Thay đổi số sao trong 7 ngày qua
  • scrapfly-scrapers@scrapfly

    Các tập lệnh cào dữ liệu web Python có khả năng mở rộng cho hơn 40 tên miền phổ biến

    1.078+5Thay đổi số sao trong 7 ngày qua
  • clean-text@jfilter

    🧹 Gói Python dùng để làm sạch văn bản

    1.028+0Thay đổi số sao trong 7 ngày qua
  • hrequests@daijro

    🚀 Web scraping dành cho mọi người

    1.022+0Thay đổi số sao trong 7 ngày qua
  • Thu thập phản hồi có cấu trúc từ trình cạo dữ liệu ChatGPT bằng cách gửi prompt với thông tin xác thực API hợp lệ. Kích hoạt tìm kiếm trực tiếp, chèn ngữ cảnh HTML và tự động hóa quy trình làm việc của trình cạo ChatGPT chỉ với vài tham số.

    942+153Thay đổi số sao trong 7 ngày qua
  • loconotion@leoncvlt

    Công cụ Python để chuyển đổi các trang Notion.so thành các trang web tĩnh nhẹ và có thể tùy chỉnh.

    857+0Thay đổi số sao trong 7 ngày qua
  • pdf.tocgen@Krasjet

    Bộ công cụ CLI để tự động tạo mục lục cho các tệp PDF

    848+0Thay đổi số sao trong 7 ngày qua
  • easy-scraping-tutorial@MorvanZhou

    Mã nguồn hướng dẫn web scraping bằng Python đơn giản nhưng hữu ích.

    820+0Thay đổi số sao trong 7 ngày qua
  • trawl@germondai

    Công cụ scraping tự lưu trữ — vượt qua mọi thử thách JS và captcha: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Giải pháp thay thế cho FlareSolverr và Byparr cho ngăn xếp *arr của bạn.

    793+26Thay đổi số sao trong 7 ngày qua
  • linkedin-profile-scraper-api@josephlimtech

    Công cụ thu thập dữ liệu hồ sơ LinkedIn trả về dữ liệu hồ sơ có cấu trúc dưới dạng JSON.

    776+0Thay đổi số sao trong 7 ngày qua
  • lookyloo@Lookyloo

    Lookyloo là giao diện web cho phép người dùng chụp lại một trang web và hiển thị cây các tên miền liên kết với nhau.

    774+1Thay đổi số sao trong 7 ngày qua
  • dark-knowledge@prescience-data

    Thư viện tổng hợp các bài báo nghiên cứu và bài thuyết trình dành cho những người quan tâm đến chống phát hiện và quyền riêng tư trên web.

    771+2Thay đổi số sao trong 7 ngày qua
  • Gói Python cho kết quả tìm kiếm Google thông qua SERP API

    755+2Thay đổi số sao trong 7 ngày qua
  • rota@alpkeskin

    Công cụ xoay proxy hiệu năng cao với quản lý IP tự động và giám sát trạng thái theo thời gian thực

    748+5Thay đổi số sao trong 7 ngày qua
  • HomeHarvest@ZacharyHampton

    Gói Python để thu thập dữ liệu bất động sản

    739+2Thay đổi số sao trong 7 ngày qua
  • comic-dl@Xonshiz

    Comic-dl là công cụ dòng lệnh dùng để tải truyện tranh và manga từ nhiều trang web khác nhau. Các trang được hỗ trợ: readcomiconline.to, mangafox.me, comic naver và nhiều trang khác.

    676+2Thay đổi số sao trong 7 ngày qua
  • Trích xuất hồ sơ mạng xã hội và nhiều thông tin khác bằng biểu thức chính quy

    656+0Thay đổi số sao trong 7 ngày qua
  • pricewise@adrianhajdin

    Tìm hiểu về web scraping và xây dựng trình theo dõi giá thương mại điện tử bằng Next.js 13 trong một video duy nhất, bao gồm kỹ thuật thu thập dữ liệu, cron job, gửi email, triển khai và hơn thế nữa.

    636+1Thay đổi số sao trong 7 ngày qua
  • h5i@h5i-dev

    Cộng tác trong môi trường sandbox cho các nhóm đa tác nhân: diễn đàn tin nhắn dựa trên Git với mỗi tác nhân được cô lập trong sandbox riêng. Biến kho lưu trữ Git thành diễn đàn bảo mật cho các tác nhân AI.

    633+22Thay đổi số sao trong 7 ngày qua
  • juriscraper@freelawproject

    Một API để thu thập dữ liệu meta từ các trang web tòa án Hoa Kỳ.

    631+3Thay đổi số sao trong 7 ngày qua
  • Kemono-Downloader@Yuvi9587

    Kemono pawchive Downloader là một ứng dụng PyQt5 nhanh dùng để lưu trữ nội dung từ nhiều trang web, bao gồm Kemono, Coomer, Bunkr, Erome, Saint2.su, nhentai và Discord. Ứng dụng có trình duyệt Creator, kiểm tra cập nhật và hỗ trợ tải xuống đa luồng, đa phần. Các phiên có thể tạm dừng, tiếp tục hoặc khôi phục.

    630+10Thay đổi số sao trong 7 ngày qua
  • docker-selenium-lambda@umihico

    Demo đơn giản nhất về tự động hóa chrome bằng python và selenium trong AWS Lambda

    618+0Thay đổi số sao trong 7 ngày qua
  • Ominis-OSINT@AnonCatalyst

    Ứng dụng Python này là một công cụ OSINT (Tình báo nguồn mở) có tên "Ominis OSINT - Web Hunter". Nó thực hiện thu thập thông tin trực tuyến bằng cách truy vấn Google để lấy kết quả tìm kiếm liên quan đến truy vấn do người dùng nhập. Công cụ này trích xuất các thông tin liên quan như tiêu đề, URL và các đề cập tiềm năng về truy vấn trong kết quả.

    614+2Thay đổi số sao trong 7 ngày qua
  • LinkedInDumper@l4rm4nd

    Script Python 3 để dump/scrape/trích xuất nhân viên công ty từ LinkedIn API

    611+0Thay đổi số sao trong 7 ngày qua
  • reddit-universal-scraper@ksanjeev284

    Universal Reddit Scraper - Hoạt động trên mọi Subreddit hoặc Người dùng

    597+4Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề