Aller au contenu principal
buildradar
Sign in
Sujet · data-extraction

data-extraction

Dépôts open source suivis étiquetés data-extraction, triés par étoiles.

Dépôts
28
Total d'étoiles
343 727
Étoiles en moyenne
12 276
Part
0,02%

Sujets qui apparaissent souvent aux côtés de data-extraction sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés data-extraction.

  • ai-data-extractor@bawadou

    Extracteur open source gratuit pour l'historique de chat des assistants de codage IA. Prend en charge Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code, et plus encore.

    554
  • firecrawl@firecrawl

    L'API contextuelle pour rechercher, extraire et interagir avec le Web à grande échelle.

    175 781+1 747Évolution des étoiles sur les 7 derniers jours
  • Scrapling@D4Vinci

    🕷️ Un framework de web scraping adaptatif qui gère tout, d'une simple requête à un crawl à grande échelle !

    78 099+941Évolution des étoiles sur les 7 derniers jours
  • Scrapegraph-ai@ScrapeGraphAI

    Scraper Python basé sur l'IA.

    30 435+388Évolution des étoiles sur les 7 derniers jours
  • maxun@getmaxun

    La plateforme open-source no-code pour le web scraping, le crawling, la recherche et l'extraction de données par IA • Transformez des sites web en API structurées en quelques minutes

    17 349+27Évolution des étoiles sur les 7 derniers jours
  • ferret@MontFerret

    Langage déclaratif d'automatisation des données et runtime Go pour les flux d'extraction structurés

    6 009+1Évolution des étoiles sur les 7 derniers jours
  • flashtext@vi3k6i5

    Extraire des mots-clés d'une phrase ou remplacer des mots-clés dans des phrases.

    5 709-3Évolution des étoiles sur les 7 derniers jours
  • skills@browser-act

    CLI d'automatisation de navigateur conçue pour les agents IA. Contournez les protections anti-bot et transférez la main aux humains en cas de blocage. Exécution multitâche parallèle, fonctionnement multi-session indépendant et navigation multi-compte isolée.

    5 549+27Évolution des étoiles sur les 7 derniers jours
  • brightdata-mcp@brightdata

    Un serveur Model Context Protocol (MCP) puissant offrant une solution tout-en-un pour l'accès au web public.

    2 624+10Évolution des étoiles sur les 7 derniers jours
  • HeadlessX@saifyxpro

    Plateforme d'automatisation de navigateur auto-hébergée indétectable. Propulsée par Camoufox (Firefox) pour un taux de détection de 0 %. Conçue pour la vitesse, la confidentialité et l'évolutivité.

    2 279+7Évolution des étoiles sur les 7 derniers jours
  • recipe-scrapers@hhursev

    Package Python pour le scraping de données de recettes

    2 218+2Évolution des étoiles sur les 7 derniers jours
  • contextgem@shcherbak-ai

    ContextGem : extraction simplifiée de documents pour LLM

    1 996+1Évolution des étoiles sur les 7 derniers jours
  • article-extractor@extractus

    Pour extraire un article à partir d'une URL donnée.

    1 911+1Évolution des étoiles sur les 7 derniers jours
  • optimus@hi-primus

    Flux de travail de préparation de données agiles simplifiés avec Pandas, Dask, cuDF, Dask-cuDF, Vaex et PySpark

    1 536+0Évolution des étoiles sur les 7 derniers jours
  • vnstock@thinh-vu

    Une boîte à outils Python puissante et accessible aux débutants pour l'analyse financière et l'automatisation, conçue pour rendre l'investissement moderne accessible à tous.

    1 391+3Évolution des étoiles sur les 7 derniers jours
  • parsera@raznem

    Bibliothèque légère pour le scraping de sites web avec des LLM.

    1 353+3Évolution des étoiles sur les 7 derniers jours
  • socid-extractor@soxoj

    Le moteur d'extraction derrière Maigret : transforme n'importe quelle URL de profil en un enregistrement OSINT structuré sur plus de 150 sites.

    1 081+5Évolution des étoiles sur les 7 derniers jours
  • pdf_oxide@yfedoseev

    La bibliothèque PDF la plus rapide pour Python et Rust. Extraction de texte et d'images, conversion markdown, création et édition de PDF. Moyenne de 0,8 ms, 5 fois plus rapide que les leaders du marché, 100 % de réussite sur 3 830 fichiers PDF. Licence MIT/Apache-2.0.

    1 015+11Évolution des étoiles sur les 7 derniers jours
  • crw@us

    Alternative rapide et légère de Firecrawl/Tavily en Rust. Web scraper, crawler & API de recherche avec serveur MCP pour agents IA. API compatible Firecrawl en drop-in (/scrape, /crawl, /search). 2,3 fois plus rapide que Tavily, 1,5 fois plus rapide que Firecrawl dans les benchmarks 1K-URL. 6 Mo de RAM, binaire unique. Héberger soi-même ou utiliser le cloud géré.

    955+87Évolution des étoiles sur les 7 derniers jours
  • eclaire@eclaire-labs

    Assistant IA open-source local-first pour vos données. Unifiez tâches, notes, documents, photos et favoris. Privé, auto-hébergé et extensible via API.

    918+5Évolution des étoiles sur les 7 derniers jours
  • hacker-news-digest@polyrabbit

    Laissez ChatGPT résumer Hacker News pour vous.

    756+0Évolution des étoiles sur les 7 derniers jours
  • ai-web-scraper@ScrapingBee

    Effortlessly extract data with our AI scraper API. Simplify data extraction, get clean JSON outputs and adapt to page changes. Try it free today!

    706+135Évolution des étoiles sur les 7 derniers jours
  • npm-pdfreader@adrienjoly

    Analyse de texte et de tableaux à partir de fichiers PDF.

    704+0Évolution des étoiles sur les 7 derniers jours
  • scrapecraft@ScrapeGraphAI

    🤖 éditeur de scraping web alimenté par IA avec constructeur de flux de travail visuel. Créez, testez et déployez des scrapers web en utilisant le langage naturel. Propulsé par ScrapeGraphAI & LangGraph.

    695+10Évolution des étoiles sur les 7 derniers jours
  • Intégration de l'API Google Reviews et extracteur d'avis Google évolutif pour extraire les notes, le texte des avis et les analyses commerciales de Google Maps à l'aide d'une API Google Review structurée.

    594+1Évolution des étoiles sur les 7 derniers jours
  • Stealth-Requests@jpjacobpadilla

    Web-scraping indétectable et analyse HTML fluide en Python !

    563+2Évolution des étoiles sur les 7 derniers jours
  • github-statuses@mrshu

    La "page d'état GitHub manquante" -- une tentative via Flat Data pour documenter historiquement les statuts de GitHub.

    562+0Évolution des étoiles sur les 7 derniers jours
  • reader@vakra-dev

    Infrastructure web open source pour l'IA. Extrayez, explorez et automatisez le web, du markdown propre, des sessions de navigateur, prêts pour vos agents.

    559+0Évolution des étoiles sur les 7 derniers jours
  • ai-data-extractor@bawadou

    Extracteur open source gratuit pour l'historique de chat des assistants de codage IA. Prend en charge Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code, et plus encore.

    554+5Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets