Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · crawling

crawling

Các kho mã nguồn mở đang theo dõi được gắn thẻ crawling, sắp xếp theo số sao.

Kho mã
39
Tổng số sao
303.335
Số sao trung bình
7.778
Tỷ trọng
0,02%

Những chủ đề thường xuất hiện cùng crawling trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ crawling.

  • donsetch@dondai44423

    Web fetch, search, and crawl for AI agents. Built from scratch in Rust. No keys, no accounts. AGPL v3.

    624
  • Scrapling@D4Vinci

    🕷️ Một framework Web Scraping thích ứng xử lý mọi thứ từ một yêu cầu đơn lẻ đến việc thu thập dữ liệu quy mô lớn!

    78.099+941Thay đổi số sao trong 7 ngày qua
  • scrapy@scrapy

    Scrapy, một framework cào và thu thập dữ liệu web cấp cao, tốc độ cao dành cho Python.

    64.179+81Thay đổi số sao trong 7 ngày qua
  • crawlee@apify

    Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Node.js để xây dựng các trình thu thập dữ liệu đáng tin cậy. Bằng JavaScript và TypeScript. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ trang web. Hoạt động với Puppeteer, Playwright, Cheerio, JSDOM và HTTP thô. Cả chế độ hiển thị giao diện và không có giao diện. Có tính năng xoay proxy.

    25.622+66Thay đổi số sao trong 7 ngày qua
  • colly@gocolly

    Framework cào web và thu thập dữ liệu thanh lịch dành cho Golang

    25.494+6Thay đổi số sao trong 7 ngày qua
  • maxun@getmaxun

    🔥 Nền tảng no-code mã nguồn mở để cào web, thu thập, tìm kiếm và trích xuất dữ liệu AI • Biến các trang web thành API có cấu trúc trong vài phút 🔥

    17.349+27Thay đổi số sao trong 7 ngày qua
  • newspaper@codelucas

    newspaper3k là công cụ trích xuất tin tức, toàn bộ văn bản và dữ liệu tả (metadata) bài viết trong Python 3. Tài liệu nâng cao:

    15.148+2Thay đổi số sao trong 7 ngày qua
  • crawlee-python@apify

    Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Python để xây dựng các trình thu thập dữ liệu đáng tin cậy. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ các trang web. Hoạt động với Parsel, BeautifulSoup, Playwright và HTTP thô. Cả chế độ hiển thị giao diện và chạy ẩn. Hỗ trợ xoay proxy.

    9.481+4Thay đổi số sao trong 7 ngày qua
  • awesome-web-scraping@lorien

    Danh sách các thư viện, công cụ và API dùng cho web scraping và xử lý dữ liệu.

    8.139+1Thay đổi số sao trong 7 ngày qua
  • rod@go-rod

    Một driver Chrome DevTools Protocol dành cho tự động hóa web và scraping.

    7.084+2Thay đổi số sao trong 7 ngày qua
  • hakrawler@hakluke

    Trình thu thập thông tin web đơn giản, nhanh chóng được thiết kế để dễ dàng và nhanh chóng phát hiện các endpoint và tài nguyên trong một ứng dụng web.

    5.117+1Thay đổi số sao trong 7 ngày qua
  • exa-mcp-server@exa-labs

    Exa MCP cho tìm kiếm web và cào dữ liệu web!

    4.956+11Thay đổi số sao trong 7 ngày qua
  • ai.robots.txt@ai-robots-txt

    Danh sách các AI agent và robot cần chặn.

    4.097+12Thay đổi số sao trong 7 ngày qua
  • puppeteer-sharp@hardkoded

    API .NET cho Headless Chrome

    3.917+1Thay đổi số sao trong 7 ngày qua
  • cariddi@edoardottt

    Nhận danh sách tên miền, thu thập URL và quét các điểm cuối, thông tin mật, khóa API, phần mở rộng tệp, mã thông báo và nhiều hơn nữa

    3.758+2Thay đổi số sao trong 7 ngày qua
  • nutch@apache

    Apache Nutch là một trình thu thập thông tin web (web crawler) có thể mở rộng và nâng cấp quy mô

    3.283+4Thay đổi số sao trong 7 ngày qua
  • awesome-puppeteer@transitive-bullshit

    Danh sách chọn lọc các tài nguyên tuyệt vời về Puppeteer.

    2.575+3Thay đổi số sao trong 7 ngày qua
  • grab@lorien

    Framework cào dữ liệu web

    2.463+0Thay đổi số sao trong 7 ngày qua
  • holiday-cn@NateScarlet

    📅🇨🇳 Dữ liệu ngày nghỉ lễ chính thức của Trung Quốc, tự động thu thập thông báo từ Quốc vụ viện hàng ngày

    2.120+9Thay đổi số sao trong 7 ngày qua
  • skycaiji@zorlan

    BlueSky Crawler là một hệ thống thu thập dữ liệu nguồn mở miễn phí. Chỉ cần nhấp và chọn quy tắc chỉnh sửa để thu thập dữ liệu, có thể chạy trên máy cục bộ, hosting ảo hoặc máy chủ đám mox, có thể thu thập hầu như mọi loại trang web, tích hợp liền mạch với các chương trình tạo trang web CMS, đăng dữ liệu thời gian thực không cần đăng nhập, hoàn toàn tự động không cần can thiệp thủ công! Đây là một hệ thống cào dữ liệu đám mây đa nền tảng hoàn chỉnh trong phần mềm thu thập dữ liệu lớn trang web

    2.088-1Thay đổi số sao trong 7 ngày qua
  • core@roach-php

    Bộ công cụ web scraping hoàn chỉnh cho PHP.

    1.455+0Thay đổi số sao trong 7 ngày qua
  • rebrowser-patches@rebrowser

    Tập hợp các bản vá dành cho Puppeteer và Playwright nhằm tránh bị phát hiện tự động hóa và rò rỉ thông tin. Giúp vượt qua các trang CAPTCHA của Cloudflare và DataDome. Dễ dàng áp dụng hoặc gỡ bỏ bản vá theo nhu cầu.

    1.422-1Thay đổi số sao trong 7 ngày qua
  • mlscraper@lorey

    🤖 Tự động thu thập dữ liệu từ các trang web HTML chỉ bằng cách cung cấp ví dụ.

    1.386+1Thay đổi số sao trong 7 ngày qua
  • bhban_rpa@needleworm

    Mã ví dụ cho cuốn sách 'Tự động hóa công việc giúp hoàn thành khối lượng công việc 6 tháng trong một ngày' (Saengneung Publishing, 2020). Dành cho người chưa từng học Python, cung cấp các ví dụ từ Excel đến thiết kế, macro và thu thập dữ liệu.

    1.150+1Thay đổi số sao trong 7 ngày qua
  • browsertrix-crawler@webrecorder

    Chạy trình thu thập dữ liệu lưu trữ web dựa trên trình duyệt có độ trung thực cao trong một container Docker duy nhất

    1.127+5Thay đổi số sao trong 7 ngày qua
  • crawly@elixir-crawly

    Crawly, một framework cào và thu thập dữ liệu web cấp cao dành cho Elixir.

    1.116+2Thay đổi số sao trong 7 ngày qua
  • scrapfly-scrapers@scrapfly

    Các tập lệnh cào dữ liệu web Python có khả năng mở rộng cho hơn 40 tên miền phổ biến

    1.076+4Thay đổi số sao trong 7 ngày qua
  • scrapy-selenium@clemfromspace

    Scrapy middleware để xử lý các trang javascript sử dụng selenium

    950+0Thay đổi số sao trong 7 ngày qua
  • AdminHack@mishakorzik

    hôm nay chúng ta sẽ hack bảng quản trị của trang web.

    902+5Thay đổi số sao trong 7 ngày qua
  • siteone-crawler@janreges

    SiteOne Crawler là trình thu thập và phân tích trang web đa nền tảng dành cho SEO, bảo mật, khả năng truy cập và tối ưu hóa hiệu suất—lý tưởng cho các nhà phát triển, DevOps, kỹ sư QA và tư vấn viên. Hỗ trợ Windows, macOS và Linux (x64 và arm64).

    896+13Thay đổi số sao trong 7 ngày qua
  • scrapyrt@scrapinghub

    HTTP API cho Scrapy spiders

    884+1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề