Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · scraper

scraper

Các kho mã nguồn mở đang theo dõi được gắn thẻ scraper, sắp xếp theo số sao.

114 kho mã
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k, một nhánh (fork) của Newspaper3k được yêu thích. Trích xuất bài viết, tiêu đề và siêu dữ liệu từ các trang web tin tức.

    1.141+1Thay đổi số sao trong 7 ngày qua
  • crawly@elixir-crawly

    Crawly, một framework cào và thu thập dữ liệu web cấp cao dành cho Elixir.

    1.116+2Thay đổi số sao trong 7 ngày qua
  • kimuraframework@vifreefly

    Viết web scraper bằng Ruby sử dụng một DSL sạch, được hỗ trợ bởi AI. Kimurai sử dụng AI để tìm vị trí của dữ liệu, sau đó lưu cache các bộ chọn và cào dữ liệu bằng Ruby thuần túy. Nhận sự thông minh của LLM mà không có độ trễ trên mỗi yêu cầu hoặc chi phí token.

    1.102+0Thay đổi số sao trong 7 ngày qua
  • scrapfly-scrapers@scrapfly

    Các tập lệnh cào dữ liệu web Python có khả năng mở rộng cho hơn 40 tên miền phổ biến

    1.077+5Thay đổi số sao trong 7 ngày qua
  • jikan@jikan-me

    API PHP+REST không chính thức của MyAnimeList cung cấp các tính năng ngoài API chính thức

    1.073+6Thay đổi số sao trong 7 ngày qua
  • URS@JosephLai241

    Universal Reddit Scraper - Công cụ dòng lệnh toàn diện để trích xuất và lưu trữ dữ liệu Reddit.

    1.022+1Thay đổi số sao trong 7 ngày qua
  • GreenResourcesManager@klsdf

    Trình quản lý tổng hợp tài nguyên máy tính, tích hợp cơ chế trò chơi hóa (gamification)

    1.020+9Thay đổi số sao trong 7 ngày qua
  • wreq@0x676e67

    Một HTTP Client bằng Rust tiện dụng và tôn trọng quyền riêng tư.

    1.018+13Thay đổi số sao trong 7 ngày qua
  • google-play-scraper@JoMingyu

    Công cụ cào dữ liệu Google Play cho Python, lấy cảm hứng từ <facundoolano/google-play-scraper>

    1.010+3Thay đổi số sao trong 7 ngày qua
  • Công cụ đầu tiên cho phép xem "bài đăng riêng tư trên Instagram" một cách ẩn danh

    995+14Thay đổi số sao trong 7 ngày qua
  • crawler@fredwu

    Trình thu thập / cào dữ liệu web hiệu suất cao bằng Elixir.

    956+0Thay đổi số sao trong 7 ngày qua
  • x-tweet-fetcher@ythx-101

    Lấy các tweet, phản hồi, dòng thời gian và bài viết trên X/Twitter mà không cần đăng nhập hoặc khóa API — công cụ thực tế cho các AI agent.

    955+7Thay đổi số sao trong 7 ngày qua
  • scrapyrt@scrapinghub

    HTTP API cho Scrapy spiders

    884+2Thay đổi số sao trong 7 ngày qua
  • skrape.it@skrapeit

    Thư viện kiểm thử/cào dữ liệu/phân tích cú pháp dựa trên Kotlin, cung cấp khả năng phân tích và trích xuất dữ liệu từ HTML (kết xuất phía máy chủ và máy khách). Thư viện chú trọng vào tính dễ sử dụng và khả năng đọc cao thông qua DSL trực quan. Mục tiêu chính là thư viện kiểm thử, nhưng cũng có thể được sử dụng để cào dữ liệu trang web một cách thuận tiện.

    875+0Thay đổi số sao trong 7 ngày qua
  • xidel@benibela

    Công cụ dòng lệnh để tải xuống và trích xuất dữ liệu từ các trang HTML/XML hoặc JSON-API, sử dụng CSS, XPath 3.0, XQuery 3.0, JSONiq hoặc khớp mẫu. Nó cũng có thể tạo mới hoặc chuyển đổi các tài liệu XML/HTML/JSON.

    844+1Thay đổi số sao trong 7 ngày qua
  • zimit@openzim

    Tạo tệp ZIM từ bất kỳ trang web nào và duyệt ngoại tuyến!

    842+5Thay đổi số sao trong 7 ngày qua
  • HDoujinDownloader@HDoujinDownloader

    Trình tải xuống doujinshi và thư viện ảnh đa năng

    841+0Thay đổi số sao trong 7 ngày qua
  • epublifier@maoserr

    Chuyển đổi một số tiểu thuyết web sang định dạng epub

    840+2Thay đổi số sao trong 7 ngày qua
  • spidr@postmodern

    Thư viện web spidering linh hoạt cho Ruby, có thể quét một trang web, nhiều tên miền, các liên kết cụ thể hoặc vô hạn. Spidr được thiết kế để nhanh chóng và dễ sử dụng.

    836+0Thay đổi số sao trong 7 ngày qua
  • jvppeteer@fanyong920

    Java API cho Chrome và Firefox

    805+0Thay đổi số sao trong 7 ngày qua
  • opensanctions@opensanctions

    Cơ sở dữ liệu mở về dữ liệu trừng phạt quốc tế, các cá nhân cần quan tâm và các cá nhân có ảnh hưởng chính trị

    797+6Thay đổi số sao trong 7 ngày qua
  • trawl@germondai

    Công cụ scraping tự lưu trữ — vượt qua mọi thử thách JS và captcha: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Giải pháp thay thế cho FlareSolverr và Byparr cho ngăn xếp *arr của bạn.

    786+46Thay đổi số sao trong 7 ngày qua
  • linkedin-profile-scraper-api@josephlimtech

    Công cụ thu thập dữ liệu hồ sơ LinkedIn trả về dữ liệu hồ sơ có cấu trúc dưới dạng JSON.

    776+0Thay đổi số sao trong 7 ngày qua
  • Operative framework là một framework OSINT dựa trên Rust, cho phép tương tác với nhiều mục tiêu, thực thi nhiều module, tạo liên kết với mục tiêu, xuất báo cáo sang PDF, thêm ghi chú vào mục tiêu hoặc kết quả, tương tác với RESTFul API và tự viết module riêng.

    749-1Thay đổi số sao trong 7 ngày qua
  • Discount-Bandit@Cybrarist

    Công cụ theo dõi giá tự lưu trữ đa người dùng cho Amazon, Aliexpress, ebay và nhiều trang khác cùng với các cửa hàng tùy chỉnh. Nhận thông báo khi giá khớp với một hoặc nhiều tiêu chí do người dùng thiết lập.

    740+3Thay đổi số sao trong 7 ngày qua
  • HomeHarvest@ZacharyHampton

    Gói Python để thu thập dữ liệu bất động sản

    739+3Thay đổi số sao trong 7 ngày qua
  • slash@theahmadov

    Công cụ OSINT Slash

    738+1Thay đổi số sao trong 7 ngày qua
  • scala-scraper@ruippeixotog

    Thư viện Scala dùng để cào nội dung từ các trang HTML

    732+0Thay đổi số sao trong 7 ngày qua
  • scrapers@cassidoo

    Danh sách các trình thu thập dữ liệu (scrapers) từ khắp nơi trên web.

    730+0Thay đổi số sao trong 7 ngày qua
  • Tài liệu API nội bộ của Twitter

    711+2Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề