web-crawling
Dépôts open source suivis étiquetés web-crawling, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de web-crawling sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés web-crawling.
- #1
Crawlee — Une bibliothèque de web scraping et d'automatisation de navigateur pour Node.js afin de créer des crawlers fiables. En JavaScript et TypeScript. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Fonctionne avec Puppeteer, Playwright, Cheerio, JSDOM et HTTP brut. Modes avec et sans interface graphique. Avec rotation de proxy.
★ 25 622+66Évolution des étoiles sur les 7 derniers jours - #2
Crawlee : une bibliothèque de web scraping et d'automatisation de navigateur pour Python permettant de créer des crawlers fiables. Extrayez des données pour l'IA, les LLM, le RAG ou les GPT. Téléchargez des fichiers HTML, PDF, JPG, PNG et autres depuis des sites web. Compatible avec Parsel, BeautifulSoup, Playwright et HTTP brut. Modes avec ou sans interface graphique, avec rotation de proxy.
★ 9 481+4Évolution des étoiles sur les 7 derniers jours - #3
Langage déclaratif d'automatisation des données et runtime Go pour les flux d'extraction structurés
★ 6 009+1Évolution des étoiles sur les 7 derniers jours - #4
Le framework tout-en-un pour créer des scrapers invincibles
★ 5 695+3Évolution des étoiles sur les 7 derniers jours - #5
Un serveur Model Context Protocol (MCP) puissant offrant une solution tout-en-un pour l'accès au web public.
★ 2 624+10Évolution des étoiles sur les 7 derniers jours - #6
Le meilleur navigateur headless pour les agents IA. Léger, rapide, haute compatibilité. Construit en Rust.
★ 1 785+353Évolution des étoiles sur les 7 derniers jours - #7
Dépôt officiel pour "Craw4LLM: Crawling web efficace pour le pré-entraînement des LLM"
★ 664+1Évolution des étoiles sur les 7 derniers jours