web-crawling
Các kho mã nguồn mở đang theo dõi được gắn thẻ web-crawling, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng web-crawling trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ web-crawling.
- #1
Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Node.js để xây dựng các trình thu thập dữ liệu đáng tin cậy. Bằng JavaScript và TypeScript. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ trang web. Hoạt động với Puppeteer, Playwright, Cheerio, JSDOM và HTTP thô. Cả chế độ hiển thị giao diện và không có giao diện. Có tính năng xoay proxy.
★ 25.556+98Thay đổi số sao trong 7 ngày qua - #2
Crawlee—Một thư viện cào web và tự động hóa trình duyệt dành cho Python để xây dựng các trình thu thập dữ liệu đáng tin cậy. Trích xuất dữ liệu cho AI, LLMs, RAG hoặc GPTs. Tải xuống HTML, PDF, JPG, PNG và các tệp khác từ các trang web. Hoạt động với Parsel, BeautifulSoup, Playwright và HTTP thô. Cả chế độ hiển thị giao diện và chạy ẩn. Hỗ trợ xoay proxy.
★ 9.477+19Thay đổi số sao trong 7 ngày qua - #3
Ngôn ngữ tự động hóa dữ liệu khai báo và runtime Go dành cho các luồng công việc trích xuất có cấu trúc.
★ 6.008-1Thay đổi số sao trong 7 ngày qua - #4
Framework tất cả trong một để xây dựng các trình thu thập dữ liệu không thể đánh bại
★ 5.692+12Thay đổi số sao trong 7 ngày qua - #5
Một máy chủ Model Context Protocol (MCP) mạnh mẽ cung cấp giải pháp tất cả trong một để truy cập web công khai.
★ 2.614+10Thay đổi số sao trong 7 ngày qua - #6
Headless browser tốt nhất cho các AI agent. Nhẹ, nhanh, khả năng tương thích cao. Xây dựng bằng Rust
★ 1.512+556Thay đổi số sao trong 7 ngày qua - #7
Kho lưu trữ chính thức cho "Craw4LLM: Thu thập dữ liệu web hiệu quả để tiền huấn luyện LLM"
★ 664+1Thay đổi số sao trong 7 ngày qua