crawling
Dépôts open source suivis étiquetés crawling, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de crawling sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés crawling.
- #1
🕷️ Un framework de web scraping adaptatif qui gère tout, d'une simple requête à un crawl à grande échelle !
★ 78 099+941Évolution des étoiles sur les 7 derniers jours - #2
Scrapy, un framework de crawling et de scraping web rapide et de haut niveau pour Python.
★ 64 179+81Évolution des étoiles sur les 7 derniers jours - #3
Crawlee — Une bibliothèque de web scraping et d'automatisation de navigateur pour Node.js afin de créer des crawlers fiables. En JavaScript et TypeScript. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Fonctionne avec Puppeteer, Playwright, Cheerio, JSDOM et HTTP brut. Modes avec et sans interface graphique. Avec rotation de proxy.
★ 25 622+66Évolution des étoiles sur les 7 derniers jours - #4★ 25 494+6Évolution des étoiles sur les 7 derniers jours
- #5
La plateforme open-source no-code pour le web scraping, le crawling, la recherche et l'extraction de données par IA • Transformez des sites web en API structurées en quelques minutes
★ 17 349+27Évolution des étoiles sur les 7 derniers jours - #6
newspaper3k est une bibliothèque Python 3 pour l'extraction d'actualités, de textes complets et de métadonnées d'articles.
★ 15 148+2Évolution des étoiles sur les 7 derniers jours - #7
Crawlee : une bibliothèque de web scraping et d'automatisation de navigateur pour Python permettant de créer des crawlers fiables. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Compatible avec Parsel, BeautifulSoup, Playwright et HTTP brut. Modes avec ou sans interface graphique, avec rotation de proxy.
★ 9 481+4Évolution des étoiles sur les 7 derniers jours - #8
Liste de bibliothèques, outils et API pour le web scraping et le traitement de données.
★ 8 139+1Évolution des étoiles sur les 7 derniers jours - #9★ 7 084+2Évolution des étoiles sur les 7 derniers jours
- #10
Crawler web simple et rapide conçu pour la découverte facile et rapide de points de terminaison et d'actifs au sein d'une application web
★ 5 117+1Évolution des étoiles sur les 7 derniers jours - #11
Exa MCP pour la recherche et le crawling web !
★ 4 956+11Évolution des étoiles sur les 7 derniers jours - #12
Une liste d'agents IA et de robots à bloquer.
★ 4 097+12Évolution des étoiles sur les 7 derniers jours - #13
API .NET pour Headless Chrome.
★ 3 917+1Évolution des étoiles sur les 7 derniers jours - #14
Prend une liste de domaines, explore les URL et recherche des points de terminaison, des secrets, des clés API, des extensions de fichiers, des jetons et plus encore.
★ 3 758+2Évolution des étoiles sur les 7 derniers jours - #15★ 3 283+4Évolution des étoiles sur les 7 derniers jours
- #16
Une liste organisée de ressources exceptionnelles sur Puppeteer.
★ 2 575+3Évolution des étoiles sur les 7 derniers jours - #17★ 2 463+0Évolution des étoiles sur les 7 derniers jours
- #18
Données sur les jours fériés chinois, récupérées automatiquement chaque jour depuis les annonces du Conseil des affaires d'État
★ 2 120+9Évolution des étoiles sur les 7 derniers jours - #19
BlueSky Crawler est un système de scraping open source gratuit. Il permet de collecter des données par simple clic, fonctionne en local, sur hébergement mutualisé ou cloud, supporte presque tous les types de pages web, s'intègre aux CMS et publie les données en temps réel sans intervention humaine.
★ 2 088-1Évolution des étoiles sur les 7 derniers jours - #20★ 1 455+0Évolution des étoiles sur les 7 derniers jours
- #21
Collection de correctifs pour puppeteer et playwright afin d'éviter la détection d'automatisation et les fuites. Aide à contourner les pages CAPTCHA de Cloudflare et DataDome. Facile à appliquer ou retirer, activable à la demande.
★ 1 422-1Évolution des étoiles sur les 7 derniers jours - #22
Scraping automatique de données à partir de sites web HTML en fournissant simplement des exemples.
★ 1 386+1Évolution des étoiles sur les 7 derniers jours - #23
Exemples de code du livre « Automatisation du travail : accomplir 6 mois de tâches en une journée » (Saengneung Publishing, 2020). Conçu pour les débutants en Python, couvrant l'automatisation d'Excel, le design, les macros et le web scraping.
★ 1 150+1Évolution des étoiles sur les 7 derniers jours - #24
Exécutez un crawler d'archivage web haute fidélité basé sur un navigateur dans un conteneur Docker unique.
★ 1 127+5Évolution des étoiles sur les 7 derniers jours - #25
Crawly, un framework de crawling et de scraping web de haut niveau pour Elixir.
★ 1 116+2Évolution des étoiles sur les 7 derniers jours - #26
Scripts de web scraping Python évolutifs pour plus de 40 domaines populaires
★ 1 076+5Évolution des étoiles sur les 7 derniers jours - #27
Middleware Scrapy pour gérer les pages JavaScript via Selenium.
★ 950+0Évolution des étoiles sur les 7 derniers jours - #28★ 902+6Évolution des étoiles sur les 7 derniers jours
- #29
SiteOne Crawler est un outil multiplateforme d'exploration et d'analyse de sites web pour le SEO, la sécurité, l'accessibilité et l'optimisation des performances. Idéal pour les développeurs, DevOps, ingénieurs QA et consultants. Supporte Windows, macOS et Linux (x64 et arm64).
★ 897+14Évolution des étoiles sur les 7 derniers jours - #30★ 884+2Évolution des étoiles sur les 7 derniers jours