web-crawler
Các kho mã nguồn mở đang theo dõi được gắn thẻ web-crawler, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng web-crawler trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ web-crawler.
- #1★ 175.781+0Thay đổi số sao trong 7 ngày qua
- #2
Công cụ cào dữ liệu Python dựa trên AI
★ 30.435+0Thay đổi số sao trong 7 ngày qua - #3
Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Node.js để xây dựng các trình thu thập dữ liệu đáng tin cậy. Bằng JavaScript và TypeScript. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ trang web. Hoạt động với Puppeteer, Playwright, Cheerio, JSDOM và HTTP thô. Cả chế độ hiển thị giao diện và không có giao diện. Có tính năng xoay proxy.
★ 25.622+0Thay đổi số sao trong 7 ngày qua - #4
Nền tảng quản lý trình thu thập dữ liệu web phân tán để quản lý các spider bất kể ngôn ngữ và framework.
★ 12.268+0Thay đổi số sao trong 7 ngày qua - #5
Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Python để xây dựng các trình thu thập dữ liệu đáng tin cậy. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ các trang web. Hoạt động với Parsel, BeautifulSoup, Playwright và HTTP thô. Cả chế độ hiển thị giao diện và chạy ẩn. Hỗ trợ xoay proxy.
★ 9.481+0Thay đổi số sao trong 7 ngày qua - #6
Thu thập, phân tích cú pháp và tối ưu hóa mọi định dạng dữ liệu ➡️ từ tài liệu đến đa phương tiện ➡️ để nâng cao khả năng tương thích với các framework GenAI
★ 7.823+0Thay đổi số sao trong 7 ngày qua - #7
🔥 Máy chủ Firecrawl MCP chính thức - Thêm tính năng thu thập dữ liệu web và tìm kiếm mạnh mẽ cho Cursor, Claude và bất kỳ ứng dụng khách LLM nào khác.
★ 7.381+0Thay đổi số sao trong 7 ngày qua - #8
Một bộ sưu tập các web crawler và spider tuyệt vời bằng nhiều ngôn ngữ khác nhau.
★ 7.303+0Thay đổi số sao trong 7 ngày qua - #9
Trang web chuyên dụng cho AI coding agent của bạn — tìm kiếm, lấy dữ liệu, crawl và nghiên cứu cục bộ qua MCP. Không cần API key, không cần đám mây, 0 USD/truy vấn. Bản thử nghiệm công khai.
★ 4.865+0Thay đổi số sao trong 7 ngày qua - #10★ 4.098+0Thay đổi số sao trong 7 ngày qua
- #11
Apache Nutch là một trình thu thập thông tin web (web crawler) có thể mở rộng và nâng cấp quy mô
★ 3.283+0Thay đổi số sao trong 7 ngày qua - #12
Quét trang web bắt đầu từ một URL, tìm các trang liên quan và trích xuất dữ liệu - tất cả đều được hướng dẫn bằng câu lệnh ngôn ngữ tự nhiên của bạn
★ 3.264+0Thay đổi số sao trong 7 ngày qua - #13★ 2.687+0Thay đổi số sao trong 7 ngày qua
- #14
API cào web mã nguồn mở. Chuyển đổi mọi trang web thành markdown sạch hoặc JSON có cấu trúc. Trình duyệt chống phát hiện, tự động chọn proxy, tự lưu trữ. Một lệnh: make up
★ 2.599+0Thay đổi số sao trong 7 ngày qua - #15
Trích xuất nội dung web nhanh chóng, ưu tiên local cho LLMs. Scrape, crawl, trích xuất dữ liệu có cấu trúc — tất cả từ Rust. CLI, REST API và MCP server.
★ 2.318+0Thay đổi số sao trong 7 ngày qua - #16
Khung web crawler C# đa nền tảng được xây dựng vì tốc độ và tính linh hoạt. Hãy đánh dấu sao cho dự án này! +1.
★ 2.310+0Thay đổi số sao trong 7 ngày qua - #17
Công cụ tìm kiếm internet cho các trang web hướng văn bản. Lập chỉ mục web nhỏ, cũ và kỳ lạ.
★ 1.938+0Thay đổi số sao trong 7 ngày qua - #18
Headless browser tốt nhất cho các AI agent. Nhẹ, nhanh, khả năng tương thích cao. Xây dựng bằng Rust
★ 1.841+204Thay đổi số sao trong 7 ngày qua - #19
Công cụ CLI để lưu bản sao chính xác của một trang web hoàn chỉnh vào một tệp HTML duy nhất (dựa trên SingleFile)
★ 1.579+0Thay đổi số sao trong 7 ngày qua - #20
Công cụ kiểm tra liên kết hỏng, quét trang web và xác thực đường dẫn. Tìm liên kết hỏng, liên kết chết và URL không hợp lệ trên website, tài liệu và file cục bộ. Hoàn hảo cho kiểm toán SEO và CI/CD.
★ 1.255+0Thay đổi số sao trong 7 ngày qua - #21
Chạy trình thu thập dữ liệu lưu trữ web dựa trên trình duyệt có độ trung thực cao trong một container Docker duy nhất
★ 1.127+0Thay đổi số sao trong 7 ngày qua - #22
Các tập lệnh cào dữ liệu web Python có khả năng mở rộng cho hơn 40 tên miền phổ biến
★ 1.078+5Thay đổi số sao trong 7 ngày qua - #23
Trình thu thập dữ liệu web có thể mở rộng, trưởng thành và linh hoạt dựa trên Apache Storm
★ 995+1Thay đổi số sao trong 7 ngày qua - #24
Giải pháp thay thế Firecrawl/Tavily nhanh, nhẹ viết bằng Rust. Web scraper, crawler và API tìm kiếm với máy chủ MCP cho AI agents. API tương thích với Firecrawl (/scrape, /crawl, /search). Nhanh hơn 2.3 lần so với Tavily và 1.5 lần so với Firecrawl trong các bài kiểm tra 1K-URL. RAM 6 MB, tệp nhị phân đơn lẻ. Hỗ trợ tự lưu trữ hoặc sử dụng cloud được quản lý.
★ 965+56Thay đổi số sao trong 7 ngày qua - #25
Trình thu thập SEO máy tính để bàn miễn phí - giải pháp mã nguồn mở thay thế cho Screaming Frog và các công cụ tương tự. Thu thập dữ liệu trang web, phân tích liên kết, trích xuất dữ liệu SEO và xuất kết quả mà không mất phí đăng ký. Hoàn toàn có thể tùy chỉnh và mở rộng!
★ 909+13Thay đổi số sao trong 7 ngày qua - #26
Thư viện web spidering linh hoạt cho Ruby, có thể quét một trang web, nhiều tên miền, các liên kết cụ thể hoặc vô hạn. Spidr được thiết kế để nhanh chóng và dễ sử dụng.
★ 836+0Thay đổi số sao trong 7 ngày qua - #27
Kho lưu trữ này chứa các ví dụ ứng dụng hoàn chỉnh, bao gồm trang web và các dự án khác, được phát triển bằng Firecrawl.
★ 815+1Thay đổi số sao trong 7 ngày qua - #28
Kho lưu trữ chính thức cho "Craw4LLM: Thu thập dữ liệu web hiệu quả để tiền huấn luyện LLM"
★ 664+0Thay đổi số sao trong 7 ngày qua - #29
Web-scraping không bị phát hiện và phân tích HTML liền mạch trong Python!
★ 563+2Thay đổi số sao trong 7 ngày qua - #30
Cơ sở hạ tầng web mã nguồn mở cho AI. Cào, thu thập và tự động hóa web, làm sạch markdown, phiên trình duyệt, sẵn sàng cho các tác nhân (agents) của bạn
★ 560+2Thay đổi số sao trong 7 ngày qua