data-extraction
Dépôts open source suivis étiquetés data-extraction, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de data-extraction sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés data-extraction.
- #1
Extracteur open source gratuit pour l'historique de chat des assistants de codage IA. Prend en charge Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code, et plus encore.
★ 554
- #1
L'API contextuelle pour rechercher, extraire et interagir avec le Web à grande échelle.
★ 175 781+1 747Évolution des étoiles sur les 7 derniers jours - #2
🕷️ Un framework de web scraping adaptatif qui gère tout, d'une simple requête à un crawl à grande échelle !
★ 78 099+941Évolution des étoiles sur les 7 derniers jours - #3
Scraper Python basé sur l'IA.
★ 30 435+388Évolution des étoiles sur les 7 derniers jours - #4
La plateforme open-source no-code pour le web scraping, le crawling, la recherche et l'extraction de données par IA • Transformez des sites web en API structurées en quelques minutes
★ 17 349+27Évolution des étoiles sur les 7 derniers jours - #5
Langage déclaratif d'automatisation des données et runtime Go pour les flux d'extraction structurés
★ 6 009+1Évolution des étoiles sur les 7 derniers jours - #6★ 5 709-3Évolution des étoiles sur les 7 derniers jours
- #7
CLI d'automatisation de navigateur conçue pour les agents IA. Contournez les protections anti-bot et transférez la main aux humains en cas de blocage. Exécution multitâche parallèle, fonctionnement multi-session indépendant et navigation multi-compte isolée.
★ 5 549+27Évolution des étoiles sur les 7 derniers jours - #8
Un serveur Model Context Protocol (MCP) puissant offrant une solution tout-en-un pour l'accès au web public.
★ 2 624+10Évolution des étoiles sur les 7 derniers jours - #9
Plateforme d'automatisation de navigateur auto-hébergée indétectable. Propulsée par Camoufox (Firefox) pour un taux de détection de 0 %. Conçue pour la vitesse, la confidentialité et l'évolutivité.
★ 2 279+7Évolution des étoiles sur les 7 derniers jours - #10
Package Python pour le scraping de données de recettes
★ 2 218+2Évolution des étoiles sur les 7 derniers jours - #11
ContextGem : extraction simplifiée de documents pour LLM
★ 1 996+1Évolution des étoiles sur les 7 derniers jours - #12
Pour extraire un article à partir d'une URL donnée.
★ 1 911+1Évolution des étoiles sur les 7 derniers jours - #13
Flux de travail de préparation de données agiles simplifiés avec Pandas, Dask, cuDF, Dask-cuDF, Vaex et PySpark
★ 1 536+0Évolution des étoiles sur les 7 derniers jours - #14
Une boîte à outils Python puissante et accessible aux débutants pour l'analyse financière et l'automatisation, conçue pour rendre l'investissement moderne accessible à tous.
★ 1 391+3Évolution des étoiles sur les 7 derniers jours - #15★ 1 353+3Évolution des étoiles sur les 7 derniers jours
- #16
Le moteur d'extraction derrière Maigret : transforme n'importe quelle URL de profil en un enregistrement OSINT structuré sur plus de 150 sites.
★ 1 081+5Évolution des étoiles sur les 7 derniers jours - #17
La bibliothèque PDF la plus rapide pour Python et Rust. Extraction de texte et d'images, conversion markdown, création et édition de PDF. Moyenne de 0,8 ms, 5 fois plus rapide que les leaders du marché, 100 % de réussite sur 3 830 fichiers PDF. Licence MIT/Apache-2.0.
★ 1 015+11Évolution des étoiles sur les 7 derniers jours - #18
Alternative rapide et légère de Firecrawl/Tavily en Rust. Web scraper, crawler & API de recherche avec serveur MCP pour agents IA. API compatible Firecrawl en drop-in (/scrape, /crawl, /search). 2,3 fois plus rapide que Tavily, 1,5 fois plus rapide que Firecrawl dans les benchmarks 1K-URL. 6 Mo de RAM, binaire unique. Héberger soi-même ou utiliser le cloud géré.
★ 955+87Évolution des étoiles sur les 7 derniers jours - #19
Assistant IA open-source local-first pour vos données. Unifiez tâches, notes, documents, photos et favoris. Privé, auto-hébergé et extensible via API.
★ 918+5Évolution des étoiles sur les 7 derniers jours - #20
Laissez ChatGPT résumer Hacker News pour vous.
★ 756+0Évolution des étoiles sur les 7 derniers jours - #21
Effortlessly extract data with our AI scraper API. Simplify data extraction, get clean JSON outputs and adapt to page changes. Try it free today!
★ 706+135Évolution des étoiles sur les 7 derniers jours - #22
Analyse de texte et de tableaux à partir de fichiers PDF.
★ 704+0Évolution des étoiles sur les 7 derniers jours - #23
🤖 éditeur de scraping web alimenté par IA avec constructeur de flux de travail visuel. Créez, testez et déployez des scrapers web en utilisant le langage naturel. Propulsé par ScrapeGraphAI & LangGraph.
★ 695+10Évolution des étoiles sur les 7 derniers jours - #24
Intégration de l'API Google Reviews et extracteur d'avis Google évolutif pour extraire les notes, le texte des avis et les analyses commerciales de Google Maps à l'aide d'une API Google Review structurée.
★ 594+1Évolution des étoiles sur les 7 derniers jours - #25
Web-scraping indétectable et analyse HTML fluide en Python !
★ 563+2Évolution des étoiles sur les 7 derniers jours - #26
La "page d'état GitHub manquante" -- une tentative via Flat Data pour documenter historiquement les statuts de GitHub.
★ 562+0Évolution des étoiles sur les 7 derniers jours - #27
Infrastructure web open source pour l'IA. Extrayez, explorez et automatisez le web, du markdown propre, des sessions de navigateur, prêts pour vos agents.
★ 559+0Évolution des étoiles sur les 7 derniers jours - #28
Extracteur open source gratuit pour l'historique de chat des assistants de codage IA. Prend en charge Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code, et plus encore.
★ 554+5Évolution des étoiles sur les 7 derniers jours