crawler
Dépôts open source suivis étiquetés crawler, triés par étoiles.
- #61
Prompts GPTs ayant fuité pour contourner la limite de 25 messages ou pour essayer des GPTs sans abonnement Plus.
★ 2 469+1Évolution des étoiles sur les 7 derniers jours - #62★ 2 463+0Évolution des étoiles sur les 7 derniers jours
- #63
CrawlerDetect est une classe PHP pour détecter les bots, crawlers et spiders via l'user agent
★ 2 403+2Évolution des étoiles sur les 7 derniers jours - #64
Framework de crawler web multiplateforme en C# conçu pour la vitesse et la flexibilité
★ 2 310+0Évolution des étoiles sur les 7 derniers jours - #65
Website Cloner - Utilise de puissantes routines Go pour cloner des sites web sur votre ordinateur en quelques secondes.
★ 2 239+5Évolution des étoiles sur les 7 derniers jours - #66
Téléchargeur de médias depuis divers sites, incluant Twitter, Reddit, Instagram, BlueSky, TikTok, Threads, Facebook, OnlyFans, YouTube, Pinterest, PornHub, XHamster, XVIDEOS, ThisVid, etc.
★ 2 161+8Évolution des étoiles sur les 7 derniers jours - #67
Transformer le contenu web en données prêtes pour les LLM
★ 2 158+32Évolution des étoiles sur les 7 derniers jours - #68
BlueSky Crawler est un système de scraping open source gratuit. Il permet de collecter des données par simple clic, fonctionne en local, sur hébergement mutualisé ou cloud, supporte presque tous les types de pages web, s'intègre aux CMS et publie les données en temps réel sans intervention humaine.
★ 2 088-1Évolution des étoiles sur les 7 derniers jours - #69★ 2 019+0Évolution des étoiles sur les 7 derniers jours
- #70
Collection d'exemples de scrapers. Inclut, sans s'y limiter : Taobao, JD, Tmall, Douban, Douyin, Kuaishou, Weibo, WeChat, Alibaba, Toutiao, PDD, Youku, iQIYI, Ctrip, 12306, 58, Sohu, divers indices, Weipu, Wanfang, Zlibrary, Oalib, romans, sites d'appels d'offres, sites d'achats, Xiaohongshu, Dianping, Twitter, Maimai, Zhihu.
★ 1 967+1Évolution des étoiles sur les 7 derniers jours - #71
Navigateur antidétection gratuit pour Playwright : empreinte Firefox headless indétectable. Scraping Python, contournement de recaptcha et de détection de bots. Open source.
★ 1 962+13Évolution des étoiles sur les 7 derniers jours - #72
Bibliothèque principale de NewPipe pour l'extraction de données depuis des sites de streaming
★ 1 960+3Évolution des étoiles sur les 7 derniers jours - #73
Solution d'exploration de la mémoire du navigateur (en cours d'exploration...).
★ 1 912+0Évolution des étoiles sur les 7 derniers jours - #74★ 1 891+3Évolution des étoiles sur les 7 derniers jours
- #75★ 1 879+2Évolution des étoiles sur les 7 derniers jours
- #76
Surveillance, collecte et transfert de contenu multiplateforme via un panneau Web pour gérer Douyin, Xiaohongshu et Kuaishou.
★ 1 833+65Évolution des étoiles sur les 7 derniers jours - #77
Diskover Community Edition - Indexeur de fichiers, moteur de recherche de fichiers et outil de gestion et d'analyse de données open source propulsé par Elasticsearch
★ 1 816-2Évolution des étoiles sur les 7 derniers jours - #78
Web crawler d'images multiprocessus pour Google et Naver (Selenium)
★ 1 692+1Évolution des étoiles sur les 7 derniers jours - #79
Liaison Python pour les moteurs Modest et Lexbor. Analyseur HTML5 rapide avec sélecteurs CSS pour Python.
★ 1 671+4Évolution des étoiles sur les 7 derniers jours - #80
Collection de scrapers Python : musique NetEase, vidéos Bilibili, questions Zhihu, fonds d'écran, vidéos xvideos, livres audio, Weibo, données Anjuke avec visualisation, extracteur de miniatures Bilibili, pool de proxys IP, et analyse de données utilisateurs Zhihu.
★ 1 649+4Évolution des étoiles sur les 7 derniers jours - #81
Web crawler pour archivistes : sortie au format WARC, tableau de bord pour tous les crawls et modèles d'exclusion dynamiques.
★ 1 609+2Évolution des étoiles sur les 7 derniers jours - #82
Crawler Douyin : collecte de données publiques telles que les pages de profil, les likes, les favoris, les pistes audio, les hashtags, les recherches, les collections, les publications, les abonnements et les abonnés.
★ 1 605+1Évolution des étoiles sur les 7 derniers jours - #83
ScopeSentry - Cartographie du cyberespace, énumération de sous-domaines, scan de ports, découverte d'informations sensibles, scan de vulnérabilités, nœuds distribués
★ 1 601+9Évolution des étoiles sur les 7 derniers jours - #84
Outil CLI pour enregistrer une copie fidèle d'une page Web complète dans un seul fichier HTML (basé sur SingleFile)
★ 1 579+9Évolution des étoiles sur les 7 derniers jours - #85
❤️ Fredy - [F]ind [R]eal [E]state [D]amn Eas[y] - Fredy recherche en continu de nouveaux appartements et maisons en Europe sur des plateformes comme ImmoScout24, Immowelt, eBay Kleinanzeigen et vous transmet instantanément les résultats via Slack, Telegram, Email, Discord ou ntfy, pour que vous puissiez vous concentrer sur l'essentiel ;)
★ 1 462+11Évolution des étoiles sur les 7 derniers jours - #86★ 1 451+0Évolution des étoiles sur les 7 derniers jours
- #87
Un client HTTP Python ergonomique et respectueux de la vie privée.
★ 1 438+1Évolution des étoiles sur les 7 derniers jours - #88
Outil de collecte de données pour Xiaohongshu, permettant le téléchargement par lots d'images et de vidéos depuis le site web.
★ 1 436+2Évolution des étoiles sur les 7 derniers jours - #89
Collection de correctifs pour puppeteer et playwright afin d'éviter la détection d'automatisation et les fuites. Aide à contourner les pages CAPTCHA de Cloudflare et DataDome. Facile à appliquer ou retirer, activable à la demande.
★ 1 422-1Évolution des étoiles sur les 7 derniers jours - #90★ 1 417-1Évolution des étoiles sur les 7 derniers jours