crawling
Repositori open source terpantau bertanda crawling, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan crawling di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda crawling.
- #1
🕷️ Kerangka kerja Web Scraping adaptif yang menangani segalanya, mulai dari permintaan tunggal hingga perayapan skala penuh!
★ 78.099+1.424Perubahan bintang dalam 7 hari terakhir - #2★ 64.179+130Perubahan bintang dalam 7 hari terakhir
- #3
Crawlee—Pustaka web scraping dan otomatisasi browser untuk Node.js guna membangun crawler yang andal. Tersedia dalam JavaScript dan TypeScript. Ekstrak data untuk AI, LLM, RAG, atau GPT. Unduh HTML, PDF, JPG, PNG, dan file lainnya dari situs web. Mendukung Puppeteer, Playwright, Cheerio, JSDOM, dan HTTP mentah. Mendukung mode headful dan headless, serta rotasi proxy.
★ 25.622+105Perubahan bintang dalam 7 hari terakhir - #4★ 25.494+12Perubahan bintang dalam 7 hari terakhir
- #5
Platform no-code open-source untuk web scraping, crawling, pencarian, dan ekstraksi data AI • Ubah situs web menjadi API terstruktur dalam hitungan menit
★ 17.349+49Perubahan bintang dalam 7 hari terakhir - #6
newspaper3k adalah alat ekstraksi berita, teks lengkap, dan metadata artikel dalam Python 3. Dokumentasi lengkap:
★ 15.148+4Perubahan bintang dalam 7 hari terakhir - #7
Crawlee—Pustaka web scraping dan otomatisasi browser untuk Python guna membangun crawler yang andal. Ekstrak data untuk AI, LLM, RAG, atau GPT. Unduh HTML, PDF, JPG, PNG, dan file lainnya dari situs web. Bekerja dengan Parsel, BeautifulSoup, Playwright, dan HTTP mentah. Mendukung mode headful dan headless. Dengan rotasi proxy.
★ 9.481+11Perubahan bintang dalam 7 hari terakhir - #8
Daftar pustaka, alat, dan API untuk web scraping dan pemrosesan data.
★ 8.139+6Perubahan bintang dalam 7 hari terakhir - #9★ 7.084+7Perubahan bintang dalam 7 hari terakhir
- #10
Web crawler yang sederhana dan cepat, dirancang untuk penemuan endpoint dan aset dalam aplikasi web secara mudah dan cepat
★ 5.117+1Perubahan bintang dalam 7 hari terakhir - #11
Exa MCP untuk pencarian web dan perayapan web!
★ 4.956+30Perubahan bintang dalam 7 hari terakhir - #12
Daftar agen AI dan robot untuk diblokir.
★ 4.097+15Perubahan bintang dalam 7 hari terakhir - #13
API .NET untuk Headless Chrome.
★ 3.917+1Perubahan bintang dalam 7 hari terakhir - #14
Mengambil daftar domain, merayapi URL, dan memindai endpoint, rahasia, kunci API, ekstensi file, token, dan lainnya
★ 3.758+5Perubahan bintang dalam 7 hari terakhir - #15★ 3.283+6Perubahan bintang dalam 7 hari terakhir
- #16
Daftar pilihan sumber daya puppeteer yang luar biasa.
★ 2.575+3Perubahan bintang dalam 7 hari terakhir - #17★ 2.463+0Perubahan bintang dalam 7 hari terakhir
- #18
Data hari libur resmi Tiongkok, diperbarui secara otomatis setiap hari dari pengumuman Dewan Negara.
★ 2.120+14Perubahan bintang dalam 7 hari terakhir - #19
LanTian Crawler adalah sistem crawler sumber terbuka gratis yang memungkinkan pengumpulan data hanya dengan mengklik dan mengedit aturan. Dapat dijalankan secara lokal, di hosting virtual, atau server cloud, mampu mengumpulkan hampir semua jenis halaman web, terintegrasi dengan berbagai CMS, mempublikasikan data secara real-time tanpa login, dan sepenuhnya otomatis. Ini adalah sistem crawler cloud lintas platform untuk pengumpulan data web besar.
★ 2.088-1Perubahan bintang dalam 7 hari terakhir - #20★ 1.455+0Perubahan bintang dalam 7 hari terakhir
- #21
Kumpulan patch untuk puppeteer dan playwright untuk menghindari deteksi otomatisasi dan kebocoran. Membantu menghindari halaman CAPTCHA Cloudflare dan DataDome. Mudah dipatch/unpatch, dapat diaktifkan/dinonaktifkan sesuai kebutuhan.
★ 1.422-2Perubahan bintang dalam 7 hari terakhir - #22★ 1.386+1Perubahan bintang dalam 7 hari terakhir
- #23
Kode contoh dari buku "Otomatisasi Pekerjaan yang Menyelesaikan Pekerjaan 6 Bulan dalam Sehari" (Saengneung Publishing, 2020). Ditujukan bagi pemula yang belum pernah belajar Python, mencakup berbagai topik otomatisasi perkantoran dari Excel, desain, makro, hingga web scraping.
★ 1.150+1Perubahan bintang dalam 7 hari terakhir - #24
Menjalankan crawler pengarsipan web berbasis peramban berketepatan tinggi dalam satu container Docker
★ 1.127+7Perubahan bintang dalam 7 hari terakhir - #25★ 1.116+2Perubahan bintang dalam 7 hari terakhir
- #26
Skrip web scraping Python yang dapat diskalakan untuk +40 domain populer
★ 1.075+3Perubahan bintang dalam 7 hari terakhir - #27
Middleware Scrapy untuk menangani halaman JavaScript menggunakan Selenium
★ 950-1Perubahan bintang dalam 7 hari terakhir - #28★ 901+3Perubahan bintang dalam 7 hari terakhir
- #29
SiteOne Crawler adalah perayap dan penganalisis situs web lintas platform untuk SEO, keamanan, aksesibilitas, dan optimasi performa—ideal untuk pengembang, DevOps, insinyur QA, dan konsultan. Mendukung Windows, macOS, dan Linux (x64 dan arm64).
★ 895+12Perubahan bintang dalam 7 hari terakhir - #30★ 883+0Perubahan bintang dalam 7 hari terakhir