crawler
Các kho mã nguồn mở đang theo dõi được gắn thẻ crawler, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng crawler trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ crawler.
- #1
Hệ thống giám sát, thu thập và chuyển tiếp nội dung đa nền tảng. Một bảng điều khiển web duy nhất quản lý Douyin / Xiaohongshu / Kuaishou.
★ 1.781 - #2
Trình thu thập dữ liệu việc làm BOSS Zhipin dựa trên giao thức Chrome CDP để tái sử dụng trạng thái đăng nhập thực tế, vượt qua cơ chế chống thu thập font chữ, xuất dữ liệu lương dạng văn bản thuần túy JSON/CSV + phân tích kỹ năng lương.
★ 1.256
- #1★ 174.034+3.406Thay đổi số sao trong 7 ngày qua
- #2
🕷️ Một framework Web Scraping thích ứng xử lý mọi thứ từ một yêu cầu đơn lẻ đến việc thu thập dữ liệu quy mô lớn!
★ 77.158+1.432Thay đổi số sao trong 7 ngày qua - #3
Scrapy, một framework cào và thu thập dữ liệu web cấp cao, tốc độ cao dành cho Python.
★ 64.098+106Thay đổi số sao trong 7 ngày qua - #4
Một công cụ thu thập thông tin/quét web trực quan không cần mã (no-code/code-free). 易采集 (Dịch vụ thu thập dễ dàng): Một phần mềm kiểm thử tự động hóa trình duyệt/thu thập dữ liệu/quét web trực quan, có thể thiết kế và thực thi các tác vụ quét web bằng đồ họa không cần mã. Tên khác: ServiceWrapper - hệ thống đóng gói dịch vụ thông minh dành cho ứng dụng Web.
★ 44.470+72Thay đổi số sao trong 7 ngày qua - #5★ 31.659+21Thay đổi số sao trong 7 ngày qua
- #6
Bot ứng tuyển công việc AI mã nguồn mở bằng Python: tự động hóa trình duyệt và cạo web để đọc tin tuyển dụng, sau đó tự động nộp đơn với sơ yếu lý lịch và thư xin việc được cá nhân hóa cho từng tin tuyển dụng.
★ 30.278+58Thay đổi số sao trong 7 ngày qua - #7
Công cụ cào dữ liệu Python dựa trên AI
★ 30.047+244Thay đổi số sao trong 7 ngày qua - #8
Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Node.js để xây dựng các trình thu thập dữ liệu đáng tin cậy. Bằng JavaScript và TypeScript. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ trang web. Hoạt động với Puppeteer, Playwright, Cheerio, JSDOM và HTTP thô. Cả chế độ hiển thị giao diện và không có giao diện. Có tính năng xoay proxy.
★ 25.556+98Thay đổi số sao trong 7 ngày qua - #9★ 25.488+26Thay đổi số sao trong 7 ngày qua
- #10
ProxyPool Python dành cho web crawler.
★ 23.648+31Thay đổi số sao trong 7 ngày qua - #11
🚀「Douyin_TikTok_Download_API」là một công cụ cào dữ liệu Douyin, Kuaishou, TikTok, Bilibili hiệu suất cao bất đồng bộ, sẵn sàng sử dụng ngay, hỗ trợ gọi API, phân tích và tải xuống hàng loạt trực tuyến.
★ 19.727+192Thay đổi số sao trong 7 ngày qua - #12★ 17.358+18Thay đổi số sao trong 7 ngày qua
- #13
🔥 Nền tảng no-code mã nguồn mở để cào web, thu thập, tìm kiếm và trích xuất dữ liệu AI • Biến các trang web thành API có cấu trúc trong vài phút 🔥
★ 17.322+70Thay đổi số sao trong 7 ngày qua - #14
newspaper3k là công cụ trích xuất tin tức, toàn bộ văn bản và dữ liệu tả (metadata) bài viết trong Python 3. Tài liệu nâng cao:
★ 15.146+8Thay đổi số sao trong 7 ngày qua - #15
Một số ví dụ về trình thu thập dữ liệu web bằng python rất thú vị và thân thiện với người mới bắt đầu, chủ yếu thu thập dữ liệu từ các trang web như Taobao, Tmall, WeChat, WeChat Read, Douban, QQ, v.v.
★ 14.681+6Thay đổi số sao trong 7 ngày qua - #16★ 13.156+29Thay đổi số sao trong 7 ngày qua
- #17
Nền tảng quản lý trình thu thập dữ liệu web phân tán để quản lý các spider bất kể ngôn ngữ và framework.
★ 12.264+4Thay đổi số sao trong 7 ngày qua - #18★ 11.680+0Thay đổi số sao trong 7 ngày qua
- #19
Script Python. Mô phỏng đăng nhập Zhihu, trình thu thập dữ liệu (crawler), thao tác excel, tài khoản chính thức WeChat, bật nguồn từ xa
★ 10.803+12Thay đổi số sao trong 7 ngày qua - #20
Hệ thống quản lý phim AV, crawler avmoo, javbus, javlibrary, thư viện phim AV trực tuyến, cơ sở dữ liệu liên kết magnet AV, Thư viện phim người lớn Nhật Bản, Liên kết Magnet phim người lớn - Cơ sở dữ liệu phim người lớn Nhật Bản
★ 10.044+10Thay đổi số sao trong 7 ngày qua - #21
Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Python để xây dựng các trình thu thập dữ liệu đáng tin cậy. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ các trang web. Hoạt động với Parsel, BeautifulSoup, Playwright và HTTP thô. Cả chế độ hiển thị giao diện và chạy ẩn. Hỗ trợ xoay proxy.
★ 9.477+19Thay đổi số sao trong 7 ngày qua - #22
Agent thu hút khách hàng truyền thông tự phát được thiết kế riêng cho các doanh nghiệp vừa, nhỏ và vi mô
★ 8.475+32Thay đổi số sao trong 7 ngày qua - #23
Danh sách các thư viện, công cụ và API dùng cho web scraping và xử lý dữ liệu.
★ 8.138+10Thay đổi số sao trong 7 ngày qua - #24
Công cụ cào dữ liệu web thông minh, tự động, nhanh chóng và nhẹ cho Python
★ 7.915+25Thay đổi số sao trong 7 ngày qua - #25
Một bộ sưu tập các web crawler và spider tuyệt vời bằng nhiều ngôn ngữ khác nhau.
★ 7.298+6Thay đổi số sao trong 7 ngày qua - #26
Pydoll là một thư viện tự động hóa các trình duyệt dựa trên Chromium không cần WebDriver, mang lại các tương tác thực tế.
★ 7.053+16Thay đổi số sao trong 7 ngày qua - #27
Python API cho JMComic | Cung cấp Python API truy cập JMComic, hỗ trợ cả phiên bản web và di động | Trình tải xuống JMComic qua GitHub Actions 🚀
★ 7.038+90Thay đổi số sao trong 7 ngày qua - #28
Web Crawler/Spider cho NodeJS kết hợp server-side jQuery ;-)
★ 6.798+0Thay đổi số sao trong 7 ngày qua - #29
Công cụ Python & dòng lệnh thu thập văn bản và siêu dữ liệu trên web: Thu thập, cào dữ liệu, trích xuất, xuất ra định dạng CSV, JSON, HTML, MD, TXT, XML
★ 6.728+50Thay đổi số sao trong 7 ngày qua - #30
Giao diện cào dữ liệu WeChat Official Account dựa trên Sogou WeChat Search
★ 6.378+0Thay đổi số sao trong 7 ngày qua