Aller au contenu principal
buildradar
Sign in
Sujet · crawling

crawling

Dépôts open source suivis étiquetés crawling, triés par étoiles.

Dépôts
39
Total d'étoiles
303 335
Étoiles en moyenne
7 778
Part
0,02%

Sujets qui apparaissent souvent aux côtés de crawling sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés crawling.

  • donsetch@dondai44423

    Web fetch, search, and crawl for AI agents. Built from scratch in Rust. No keys, no accounts. AGPL v3.

    632
  • Scrapling@D4Vinci

    🕷️ Un framework de web scraping adaptatif qui gère tout, d'une simple requête à un crawl à grande échelle !

    78 099+941Évolution des étoiles sur les 7 derniers jours
  • scrapy@scrapy

    Scrapy, un framework de crawling et de scraping web rapide et de haut niveau pour Python.

    64 179+81Évolution des étoiles sur les 7 derniers jours
  • crawlee@apify

    Crawlee — Une bibliothèque de web scraping et d'automatisation de navigateur pour Node.js afin de créer des crawlers fiables. En JavaScript et TypeScript. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Fonctionne avec Puppeteer, Playwright, Cheerio, JSDOM et HTTP brut. Modes avec et sans interface graphique. Avec rotation de proxy.

    25 622+66Évolution des étoiles sur les 7 derniers jours
  • colly@gocolly

    Framework de scraping et de crawling élégant pour Golang

    25 494+6Évolution des étoiles sur les 7 derniers jours
  • maxun@getmaxun

    La plateforme open-source no-code pour le web scraping, le crawling, la recherche et l'extraction de données par IA • Transformez des sites web en API structurées en quelques minutes

    17 349+27Évolution des étoiles sur les 7 derniers jours
  • newspaper@codelucas

    newspaper3k est une bibliothèque Python 3 pour l'extraction d'actualités, de textes complets et de métadonnées d'articles.

    15 148+2Évolution des étoiles sur les 7 derniers jours
  • crawlee-python@apify

    Crawlee : une bibliothèque de web scraping et d'automatisation de navigateur pour Python permettant de créer des crawlers fiables. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Compatible avec Parsel, BeautifulSoup, Playwright et HTTP brut. Modes avec ou sans interface graphique, avec rotation de proxy.

    9 481+4Évolution des étoiles sur les 7 derniers jours
  • awesome-web-scraping@lorien

    Liste de bibliothèques, outils et API pour le web scraping et le traitement de données.

    8 139+1Évolution des étoiles sur les 7 derniers jours
  • rod@go-rod

    Un pilote du protocole Chrome DevTools pour l'automatisation et le scraping web.

    7 084+2Évolution des étoiles sur les 7 derniers jours
  • hakrawler@hakluke

    Crawler web simple et rapide conçu pour la découverte facile et rapide de points de terminaison et d'actifs au sein d'une application web

    5 117+1Évolution des étoiles sur les 7 derniers jours
  • exa-mcp-server@exa-labs

    Exa MCP pour la recherche et le crawling web !

    4 956+11Évolution des étoiles sur les 7 derniers jours
  • ai.robots.txt@ai-robots-txt

    Une liste d'agents IA et de robots à bloquer.

    4 097+12Évolution des étoiles sur les 7 derniers jours
  • puppeteer-sharp@hardkoded

    API .NET pour Headless Chrome.

    3 917+1Évolution des étoiles sur les 7 derniers jours
  • cariddi@edoardottt

    Prend une liste de domaines, explore les URL et recherche des points de terminaison, des secrets, des clés API, des extensions de fichiers, des jetons et plus encore.

    3 758+2Évolution des étoiles sur les 7 derniers jours
  • nutch@apache

    Apache Nutch est un robot d'indexation web extensible et évolutif

    3 283+4Évolution des étoiles sur les 7 derniers jours
  • awesome-puppeteer@transitive-bullshit

    Une liste organisée de ressources exceptionnelles sur Puppeteer.

    2 575+3Évolution des étoiles sur les 7 derniers jours
  • grab@lorien

    Framework de web scraping

    2 463+0Évolution des étoiles sur les 7 derniers jours
  • holiday-cn@NateScarlet

    Données sur les jours fériés chinois, récupérées automatiquement chaque jour depuis les annonces du Conseil des affaires d'État

    2 120+9Évolution des étoiles sur les 7 derniers jours
  • skycaiji@zorlan

    BlueSky Crawler est un système de scraping open source gratuit. Il permet de collecter des données par simple clic, fonctionne en local, sur hébergement mutualisé ou cloud, supporte presque tous les types de pages web, s'intègre aux CMS et publie les données en temps réel sans intervention humaine.

    2 088-1Évolution des étoiles sur les 7 derniers jours
  • core@roach-php

    La boîte à outils complète de web scraping pour PHP.

    1 455+0Évolution des étoiles sur les 7 derniers jours
  • rebrowser-patches@rebrowser

    Collection de correctifs pour puppeteer et playwright afin d'éviter la détection d'automatisation et les fuites. Aide à contourner les pages CAPTCHA de Cloudflare et DataDome. Facile à appliquer ou retirer, activable à la demande.

    1 422-1Évolution des étoiles sur les 7 derniers jours
  • mlscraper@lorey

    Scraping automatique de données à partir de sites web HTML en fournissant simplement des exemples.

    1 386+1Évolution des étoiles sur les 7 derniers jours
  • bhban_rpa@needleworm

    Exemples de code du livre « Automatisation du travail : accomplir 6 mois de tâches en une journée » (Saengneung Publishing, 2020). Conçu pour les débutants en Python, couvrant l'automatisation d'Excel, le design, les macros et le web scraping.

    1 150+1Évolution des étoiles sur les 7 derniers jours
  • browsertrix-crawler@webrecorder

    Exécutez un crawler d'archivage web haute fidélité basé sur un navigateur dans un conteneur Docker unique.

    1 127+5Évolution des étoiles sur les 7 derniers jours
  • crawly@elixir-crawly

    Crawly, un framework de crawling et de scraping web de haut niveau pour Elixir.

    1 116+2Évolution des étoiles sur les 7 derniers jours
  • scrapfly-scrapers@scrapfly

    Scripts de web scraping Python évolutifs pour plus de 40 domaines populaires

    1 076+5Évolution des étoiles sur les 7 derniers jours
  • scrapy-selenium@clemfromspace

    Middleware Scrapy pour gérer les pages JavaScript via Selenium.

    950+0Évolution des étoiles sur les 7 derniers jours
  • AdminHack@mishakorzik

    Aujourd'hui, nous allons pirater le panneau d'administration du site.

    902+6Évolution des étoiles sur les 7 derniers jours
  • siteone-crawler@janreges

    SiteOne Crawler est un outil multiplateforme d'exploration et d'analyse de sites web pour le SEO, la sécurité, l'accessibilité et l'optimisation des performances. Idéal pour les développeurs, DevOps, ingénieurs QA et consultants. Supporte Windows, macOS et Linux (x64 et arm64).

    897+14Évolution des étoiles sur les 7 derniers jours
  • scrapyrt@scrapinghub

    API HTTP pour les spiders Scrapy

    884+2Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets