web-scraping
Dépôts open source suivis étiquetés web-scraping, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de web-scraping sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés web-scraping.
- #1
Le meilleur navigateur headless pour les agents IA. Léger, rapide, haute compatibilité. Construit en Rust.
★ 1 841 - #2
Surveillance, collecte et transfert de contenu multiplateforme via un panneau Web pour gérer Douyin, Xiaohongshu et Kuaishou.
★ 1 833 - #3
Moteur de scraping auto-hébergé — contourne tous les défis JS et captchas : Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Alternative à FlareSolverr & Byparr et remplacement direct pour votre suite *arr.
★ 793 - #4
A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.
★ 515 - #5
Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.
★ 441
- #1
L'API contextuelle pour rechercher, extraire et interagir avec le Web à grande échelle.
★ 175 781+0Évolution des étoiles sur les 7 derniers jours - #2
🕷️ Un framework de web scraping adaptatif qui gère tout, d'une simple requête à un crawl à grande échelle !
★ 78 099+0Évolution des étoiles sur les 7 derniers jours - #3
Scrapy, un framework de crawling et de scraping web rapide et de haut niveau pour Python.
★ 64 179+0Évolution des étoiles sur les 7 derniers jours - #4
Clonez n'importe quel site web avec une seule commande en utilisant des agents de codage IA
★ 33 686+0Évolution des étoiles sur les 7 derniers jours - #5
L'outil le plus simple et efficace pour la détection de changements, la surveillance de pages web et les alertes de modification de sites. Idéal pour suivre les changements de contenu, les baisses de prix, les alertes de réapprovisionnement et la surveillance de défiguration de sites, gratuitement ou via notre offre SaaS.
★ 33 494+0Évolution des étoiles sur les 7 derniers jours - #6
Chromium furtif capable de réussir tous les tests de détection de bots. Remplacement direct de Playwright avec des correctifs d'empreinte numérique au niveau du code source. 30 tests sur 30 réussis.
★ 31 110+0Évolution des étoiles sur les 7 derniers jours - #7
Scraper Python basé sur l'IA.
★ 30 435+0Évolution des étoiles sur les 7 derniers jours - #8
Bot open source de candidature à des emplois en Python : automatisation de navigateur et web scraping pour lire les offres, puis candidature automatique avec un CV et une lettre de motivation personnalisés pour chaque poste.
★ 30 304+0Évolution des étoiles sur les 7 derniers jours - #9
Crawlee — Une bibliothèque de web scraping et d'automatisation de navigateur pour Node.js afin de créer des crawlers fiables. En JavaScript et TypeScript. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Fonctionne avec Puppeteer, Playwright, Cheerio, JSDOM et HTTP brut. Modes avec et sans interface graphique. Avec rotation de proxy.
★ 25 622+0Évolution des étoiles sur les 7 derniers jours - #10
Douyin_TikTok_Download_API est un outil de scraping asynchrone haute performance prêt à l'emploi pour Douyin, Kuaishou, TikTok et Bilibili, prenant en charge les appels API, l'analyse par lots en ligne et le téléchargement.
★ 19 789+0Évolution des étoiles sur les 7 derniers jours - #11
La plateforme open-source no-code pour le web scraping, le crawling, la recherche et l'extraction de données par IA • Transformez des sites web en API structurées en quelques minutes
★ 17 349+0Évolution des étoiles sur les 7 derniers jours - #12
Alternative open-source à NotebookLM. Effectuez des recherches sur le Web avec des données en temps réel (Reddit, YT, IG, TikTok, Indeed, Google Search, Maps, etc.) via une plateforme unique, une API ou un serveur MCP.
★ 16 066+0Évolution des étoiles sur les 7 derniers jours - #13
Convertissez des sites de documentation, des dépôts GitHub et des PDF en compétences pour Claude AI avec détection automatique des conflits.
★ 14 888+0Évolution des étoiles sur les 7 derniers jours - #14
📊 API pour l'automatisation web, les tests et le contournement de la détection de bots.
★ 12 972+0Évolution des étoiles sur les 7 derniers jours - #15
jsoup : le parseur HTML Java conçu pour l'édition, le nettoyage, le scraping et la sécurité XSS.
★ 11 385+0Évolution des étoiles sur les 7 derniers jours - #16
Pont d'automatisation de navigateur haute performance et orchestrateur multi-instances avec injection furtive avancée et tableau de bord en temps réel.
★ 10 219+0Évolution des étoiles sur les 7 derniers jours - #17
Crawlee : une bibliothèque de web scraping et d'automatisation de navigateur pour Python permettant de créer des crawlers fiables. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Compatible avec Parsel, BeautifulSoup, Playwright et HTTP brut. Modes avec ou sans interface graphique, avec rotation de proxy.
★ 9 481+0Évolution des étoiles sur les 7 derniers jours - #18
Navigateur headless furtif pour agents IA — contourne Cloudflare, la détection de bots et l'anti-scraping. Remplacement direct pour Puppeteer/Playwright.
★ 9 039+0Évolution des étoiles sur les 7 derniers jours - #19★ 8 322+0Évolution des étoiles sur les 7 derniers jours
- #20
Liste de bibliothèques, outils et API pour le web scraping et le traitement de données.
★ 8 139+0Évolution des étoiles sur les 7 derniers jours - #21
Un scraper web intelligent, automatique, rapide et léger pour Python
★ 7 932+0Évolution des étoiles sur les 7 derniers jours - #22
Ce dépôt GitHub est une collection puissante d'API que vous pouvez utiliser immédiatement pour créer tout type de projet, des automatisations simples aux applications à grande échelle. L'une des listes d'API les plus précieuses sur GitHub.
★ 7 585+0Évolution des étoiles sur les 7 derniers jours - #23
Serveur MCP officiel Firecrawl - Ajoute des capacités puissantes de web scraping et de recherche à Cursor, Claude et tout autre client LLM.
★ 7 381+0Évolution des étoiles sur les 7 derniers jours - #24★ 7 084+0Évolution des étoiles sur les 7 derniers jours
- #25
Pydoll est une bibliothèque d'automatisation pour navigateurs basés sur Chromium sans WebDriver, offrant des interactions réalistes.
★ 7 060+0Évolution des étoiles sur les 7 derniers jours - #26
Outil Python et en ligne de commande pour collecter du texte et des métadonnées sur le Web : crawling, scraping, extraction, avec sortie en CSV, JSON, HTML, MD, TXT, XML.
★ 6 754+0Évolution des étoiles sur les 7 derniers jours - #27
Binding Python pour le fork de curl-impersonate via cffi. Un client HTTP capable d'imiter les empreintes TLS/JA3/HTTP2 des navigateurs.
★ 6 432+0Évolution des étoiles sur les 7 derniers jours - #28
Langage déclaratif d'automatisation des données et runtime Go pour les flux d'extraction structurés
★ 6 009+0Évolution des étoiles sur les 7 derniers jours - #29
Extraction de données depuis Google Maps. Récupère des informations telles que le nom, l'adresse, le numéro de téléphone, l'URL du site web, la note, le nombre d'avis, la latitude et la longitude, les avis, l'e-mail et plus encore pour chaque lieu.
★ 5 710+0Évolution des étoiles sur les 7 derniers jours - #30
CLI d'automatisation de navigateur conçue pour les agents IA. Contournez les protections anti-bot et transférez la main aux humains en cas de blocage. Exécution multitâche parallèle, fonctionnement multi-session indépendant et navigation multi-compte isolée.
★ 5 549+0Évolution des étoiles sur les 7 derniers jours