Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · crawler

crawler

Các kho mã nguồn mở đang theo dõi được gắn thẻ crawler, sắp xếp theo số sao.

153 kho mã
  • sperm@darbra

    Tổng hợp các bài viết reverse engineering hay đã đọc, rất đáng xem

    1.410+0Thay đổi số sao trong 7 ngày qua
  • mlscraper@lorey

    🤖 Tự động thu thập dữ liệu từ các trang web HTML chỉ bằng cách cung cấp ví dụ.

    1.386+1Thay đổi số sao trong 7 ngày qua
  • crawler@kgspider

    Chia sẻ mã nguồn cào dữ liệu của anh K, dịch ngược JS, nâng cao kỹ năng cào dữ liệu. Theo dõi tài khoản chính thức: K哥爬虫

    1.379+0Thay đổi số sao trong 7 ngày qua
  • wombat@felipecsl

    Trình thu thập/cạo dữ liệu web Ruby nhẹ với DSL thanh lịch, trích xuất dữ liệu có cấu trúc từ các trang.

    1.360+0Thay đổi số sao trong 7 ngày qua
  • XSRFProbe@0xInfection

    Bộ công cụ kiểm toán và khai thác Cross Site Request Forgery (CSRF) hàng đầu.

    1.303+1Thay đổi số sao trong 7 ngày qua
  • go-dork@dwisiswant0

    Trình quét dork nhanh nhất được viết bằng Go.

    1.302+0Thay đổi số sao trong 7 ngày qua
  • 📝 Thu thập nhanh thông tin (ví dụ: người theo dõi, thẻ, v.v.) của một cấu hình Instagram.

    1.302+1Thay đổi số sao trong 7 ngày qua
  • boss-zhipin-scraper@eatmoreduck

    Trình thu thập dữ liệu việc làm BOSS Zhipin dựa trên giao thức Chrome CDP để tái sử dụng trạng thái đăng nhập thực tế, vượt qua cơ chế chống thu thập font chữ, xuất dữ liệu lương dạng văn bản thuần túy JSON/CSV + phân tích kỹ năng lương.

    1.282+33Thay đổi số sao trong 7 ngày qua
  • Beanbun@kiddyuchina

    Beanbun là một framework trình thu thập thông tin mạng đa tiến trình được viết bằng PHP, có tính mở tốt, khả năng mở rộng cao, dựa trên Workerman.

    1.258-1Thay đổi số sao trong 7 ngày qua
  • Trình tải xuống truyện tranh Bilibili hữu ích với giao diện đồ họa, hỗ trợ tìm kiếm từ khóa, đăng nhập bằng mã QR, tải xuống các chương chưa mở khóa, tải xuống đa luồng, nhiều định dạng lưu trữ, quản lý truyện tranh cục bộ và kiểm tra cập nhật chỉ với một cú nhấp chuột.

    1.243+1Thay đổi số sao trong 7 ngày qua
  • AppCrawler@seveniruby

    Công cụ duyệt tự động ứng dụng dựa trên appium

    1.237+0Thay đổi số sao trong 7 ngày qua
  • tumblr-crawler@dixudx

    Dễ dàng tải xuống tất cả ảnh/video từ các blog Tumblr.

    1.157+0Thay đổi số sao trong 7 ngày qua
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k, một nhánh (fork) của Newspaper3k được yêu thích. Trích xuất bài viết, tiêu đề và siêu dữ liệu từ các trang web tin tức.

    1.141+1Thay đổi số sao trong 7 ngày qua
  • fess@codelibs

    Máy chủ tìm kiếm doanh nghiệp và trang web tự lưu trữ, mã nguồn mở được xây dựng trên OpenSearch. Thu thập dữ liệu web / tệp / cơ sở dữ liệu / đám mây, hơn 20 ngôn ngữ, REST API, cùng với AI/RAG và tìm kiếm ngữ nghĩa. Apache-2.0.

    1.128+1Thay đổi số sao trong 7 ngày qua
  • browsertrix-crawler@webrecorder

    Chạy trình thu thập dữ liệu lưu trữ web dựa trên trình duyệt có độ trung thực cao trong một container Docker duy nhất

    1.127+5Thay đổi số sao trong 7 ngày qua
  • crawly@elixir-crawly

    Crawly, một framework cào và thu thập dữ liệu web cấp cao dành cho Elixir.

    1.116+2Thay đổi số sao trong 7 ngày qua
  • kimuraframework@vifreefly

    Viết web scraper bằng Ruby sử dụng một DSL sạch, được hỗ trợ bởi AI. Kimurai sử dụng AI để tìm vị trí của dữ liệu, sau đó lưu cache các bộ chọn và cào dữ liệu bằng Ruby thuần túy. Nhận sự thông minh của LLM mà không có độ trễ trên mỗi yêu cầu hoặc chi phí token.

    1.102+0Thay đổi số sao trong 7 ngày qua
  • scrapfly-scrapers@scrapfly

    Các tập lệnh cào dữ liệu web Python có khả năng mở rộng cho hơn 40 tên miền phổ biến

    1.077+5Thay đổi số sao trong 7 ngày qua
  • parse-video@wujunwei928

    Công cụ xóa watermark video ngắn bằng Golang: Douyin, Pipixia, Huoshan, Weishi, Zuiyou, Kuaishou, Quanmin Xiaoshipin, Pipigaoxiao, Xigua Video, Huya, Pear Video, Acfun, Haokan Video...

    1.032+11Thay đổi số sao trong 7 ngày qua
  • wreq@0x676e67

    Một HTTP Client bằng Rust tiện dụng và tôn trọng quyền riêng tư.

    1.018+13Thay đổi số sao trong 7 ngày qua
  • Tải xuống tiểu thuyết | Trình thu thập tiểu thuyết | Qidian | Biquge | Xuất Markdown | Xuất txt | Chuyển đổi epub | Lọc quảng cáo | Tự động hiệu chỉnh

    1.018+9Thay đổi số sao trong 7 ngày qua
  • google-play-scraper@JoMingyu

    Công cụ cào dữ liệu Google Play cho Python, lấy cảm hứng từ <facundoolano/google-play-scraper>

    1.010+3Thay đổi số sao trong 7 ngày qua
  • Pxer@pea3nut

    Công cụ dành cho pixiv.net. Trình thu thập dữ liệu pixiv mà mọi người đều có thể sử dụng

    1.009-1Thay đổi số sao trong 7 ngày qua
  • stormcrawler@apache

    Trình thu thập dữ liệu web có thể mở rộng, trưởng thành và linh hoạt dựa trên Apache Storm

    995+1Thay đổi số sao trong 7 ngày qua
  • SpiderSuite@spidersuite

    Các bản phát hành, wiki và lộ trình của SpiderSuite (web security crawler)

    975+1Thay đổi số sao trong 7 ngày qua
  • crw@us

    Giải pháp thay thế Firecrawl/Tavily nhanh, nhẹ viết bằng Rust. Web scraper, crawler và API tìm kiếm với máy chủ MCP cho AI agents. API tương thích với Firecrawl (/scrape, /crawl, /search). Nhanh hơn 2.3 lần so với Tavily và 1.5 lần so với Firecrawl trong các bài kiểm tra 1K-URL. RAM 6 MB, tệp nhị phân đơn lẻ. Hỗ trợ tự lưu trữ hoặc sử dụng cloud được quản lý.

    959+90Thay đổi số sao trong 7 ngày qua
  • crawler@fredwu

    Trình thu thập / cào dữ liệu web hiệu suất cao bằng Elixir.

    956+0Thay đổi số sao trong 7 ngày qua
  • x-kit@xiaoxiunique

    Các công cụ giao thức thuần Python và ghi chú nghiên cứu cho X.com, kèm theo tập dữ liệu tài khoản Twitter VibeLoft

    940-1Thay đổi số sao trong 7 ngày qua
  • icrawler@hellock

    Khung crawl đa luồng với nhiều trình crawl hình ảnh tích hợp sẵn.

    933+1Thay đổi số sao trong 7 ngày qua
  • chatWeb@SkywalkerDarren

    ChatWeb có thể cào trang web, đọc PDF, DOCX, TXT và trích xuất nội dung chính, sau đó trả lời các câu hỏi của bạn dựa trên nội dung hoặc tóm tắt các điểm chính.

    916+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề