Aller au contenu principal
buildradar
Sign in
Sujet · data-engineering

data-engineering

Dépôts open source suivis étiquetés data-engineering, triés par étoiles.

97 dépôts
  • pyjanitor@pyjanitor-devs

    API propres pour le nettoyage de données. Implémentation Python du package R Janitor

    1 498+0Évolution des étoiles sur les 7 derniers jours
  • data-science-on-gcp@GoogleCloudPlatform

    Code source accompagnant le livre : Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017

    1 429+1Évolution des étoiles sur les 7 derniers jours
  • odd-platform@opendatadiscovery

    Première plateforme open source de découverte et d'observabilité des données. Nous simplifions la vie des praticiens de la donnée pour que vous puissiez vous concentrer sur votre activité.

    1 427+1Évolution des étoiles sur les 7 derniers jours
  • mlops-python-package@fmind

    Un modèle de package Python complet pour démarrer et standardiser vos initiatives MLOps et vos pipelines de données.

    1 416+0Évolution des étoiles sur les 7 derniers jours
  • Une sélection de plus de 300 articles de blogs techniques issus des meilleures entreprises du secteur. Découvrez comment les meilleures équipes d'ingénierie résolvent des problèmes réels à grande échelle.

    1 388+8Évolution des étoiles sur les 7 derniers jours
  • sql-ultimate-course@DataWithBaraa

    Le guide SQL le plus complet rédigé par un expert du terrain ! Apprenez tout, des bases aux requêtes avancées, en passant par les optimisations et les cas d'utilisation réels.

    1 384+7Évolution des étoiles sur les 7 derniers jours
  • quilt@quiltdata

    Quilt est une plateforme de gestion de données scientifiques sur AWS qui aide les équipes et l'IA à trouver, fiabiliser et réutiliser des données via des paquets de données richement contextuels et versionnés.

    1 370+0Évolution des étoiles sur les 7 derniers jours
  • duckle@slothflowlabs

    Solution ETL/ELT open-source à déployer sur vos propres serveurs ou dans le cloud. Basée sur DuckDB : pipelines visuels no-code/low-code ou SQL, 385 composants, dbt, CDC, qualité des données, reverse ETL, lignage, MCP pour agents IA. Sans cloud propriétaire ni facturation par ligne.

    1 262+15Évolution des étoiles sur les 7 derniers jours
  • Une liste organisée, bien qu'incomplète, de ressources sur l'IA centrée sur les données.

    1 159+1Évolution des étoiles sur les 7 derniers jours
  • around-dataengineering@abhishek-ch

    Un centre de connaissances dédié à l'ingénierie des données et au machine learning.

    1 146+0Évolution des étoiles sur les 7 derniers jours
  • Référentiel de l'Open Data Contract Standard (ODCS).

    1 118+18Évolution des étoiles sur les 7 derniers jours
  • awesome-data-catalogs@opendatadiscovery

    Répertoire de catalogues de données et de plateformes d'observabilité.

    1 068+5Évolution des étoiles sur les 7 derniers jours
  • datacontract-cli@datacontract

    Appliquer des contrats de données

    1 060+8Évolution des étoiles sur les 7 derniers jours
  • flow@estuary

    Synchronisez en continu les systèmes où résident vos données vers les systèmes où vous souhaitez qu'elles soient, en gérant vos flux de données avec Estuary.

    972+7Évolution des étoiles sur les 7 derniers jours
  • FlyFish@CloudWise-OpenSource

    FlyFish est une plateforme de codage pour la visualisation de données. Elle permet de créer rapidement un modèle de données et de générer des solutions de visualisation par simple glisser-déposer.

    961+0Évolution des étoiles sur les 7 derniers jours
  • Un guide complet pour construire un entrepôt de données moderne avec SQL Server, incluant les processus ETL, la modélisation des données et l'analyse.

    934+14Évolution des étoiles sur les 7 derniers jours
  • egeria@odpi

    Cœur d'Egeria

    921+0Évolution des étoiles sur les 7 derniers jours
  • Un dépôt supplémentaire regroupant des concepts fondamentaux, des défis techniques et des ressources sur l'ingénierie des données en espagnol.

    896+1Évolution des étoiles sur les 7 derniers jours
  • bacalhau@bacalhau-project

    Framework communautaire, simple et puissant pour un calcul distribué sur données rapide et économique.

    871+1Évolution des étoiles sur les 7 derniers jours
  • NeumAI@NeumTry

    Neum AI est un framework de premier ordre pour gérer la création et la synchronisation d'embeddings vectoriels à grande échelle.

    867+0Évolution des étoiles sur les 7 derniers jours
  • Matériel complémentaire pour le cours Udemy The Complete dbt (Data Build Tool) Bootcamp.

    827+0Évolution des étoiles sur les 7 derniers jours
  • practical-data-engineering@ssp-data

    Ingénierie de données pratique : guide de projet concret dans l'immobilier.

    823+2Évolution des étoiles sur les 7 derniers jours
  • koheesio@Nike-Inc

    Framework Python pour construire des pipelines de données efficaces. Il favorise la modularité et la collaboration, permettant la création de pipelines complexes à partir de composants simples et réutilisables.

    818+0Évolution des étoiles sur les 7 derniers jours
  • altimate-code@AltimateAI

    Plateforme d'ingénierie de données agentique open source pour dbt, SQL et les entrepôts de données cloud. Plus de 100 outils, 10 entrepôts, propulsé par l'IA.

    808+3Évolution des étoiles sur les 7 derniers jours
  • datavines@datavane

    Mieux connaître vos données ! Datavines est une plateforme d'observabilité des données de nouvelle génération, prenant en charge la gestion des métadonnées et la qualité des données.

    761+1Évolution des étoiles sur les 7 derniers jours
  • bigfunctions@unytics

    Optimisez BigQuery avec BigFunctions

    759+0Évolution des étoiles sur les 7 derniers jours
  • Failed-ML@kennethleungty

    Compilation d'exemples concrets et notables de projets de machine learning ayant échoué

    751+0Évolution des étoiles sur les 7 derniers jours
  • vectorflow@dgarnitz

    VectorFlow est un pipeline d'embedding vectoriel à haut volume qui ingère des données brutes, les transforme en vecteurs et les écrit dans la base de données vectorielle de votre choix.

    703+0Évolution des étoiles sur les 7 derniers jours
  • DataFlow-Engine@risesoft-y9

    Un moteur de flux de données conçu pour l'intégration, la synchronisation, l'échange et le partage de données, ainsi que pour la configuration et la planification des tâches. Il utilise une architecture de séparation entre le contrôle et l'exécution, des couches multi-flux et des bibliothèques de plugins pour résoudre les problèmes pratiques liés aux tâches de données à grande échelle, aux rapports et collectes de données à haute fréquence, et à la compatibilité des données hétérogènes.

    696+0Évolution des étoiles sur les 7 derniers jours
  • synmetrix@synmetrix

    Synmetrix – couche sémantique open source prête pour la production sur Cube

    626+2Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets