data-engineering
Dépôts open source suivis étiquetés data-engineering, triés par étoiles.
- #61
API propres pour le nettoyage de données. Implémentation Python du package R Janitor
★ 1 498+0Évolution des étoiles sur les 7 derniers jours - #62
Code source accompagnant le livre : Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1 429+1Évolution des étoiles sur les 7 derniers jours - #63
Première plateforme open source de découverte et d'observabilité des données. Nous simplifions la vie des praticiens de la donnée pour que vous puissiez vous concentrer sur votre activité.
★ 1 427+1Évolution des étoiles sur les 7 derniers jours - #64
Un modèle de package Python complet pour démarrer et standardiser vos initiatives MLOps et vos pipelines de données.
★ 1 416+0Évolution des étoiles sur les 7 derniers jours - #65
Une sélection de plus de 300 articles de blogs techniques issus des meilleures entreprises du secteur. Découvrez comment les meilleures équipes d'ingénierie résolvent des problèmes réels à grande échelle.
★ 1 388+8Évolution des étoiles sur les 7 derniers jours - #66
Le guide SQL le plus complet rédigé par un expert du terrain ! Apprenez tout, des bases aux requêtes avancées, en passant par les optimisations et les cas d'utilisation réels.
★ 1 384+7Évolution des étoiles sur les 7 derniers jours - #67
Quilt est une plateforme de gestion de données scientifiques sur AWS qui aide les équipes et l'IA à trouver, fiabiliser et réutiliser des données via des paquets de données richement contextuels et versionnés.
★ 1 370+0Évolution des étoiles sur les 7 derniers jours - #68
Solution ETL/ELT open-source à déployer sur vos propres serveurs ou dans le cloud. Basée sur DuckDB : pipelines visuels no-code/low-code ou SQL, 385 composants, dbt, CDC, qualité des données, reverse ETL, lignage, MCP pour agents IA. Sans cloud propriétaire ni facturation par ligne.
★ 1 262+15Évolution des étoiles sur les 7 derniers jours - #69
Une liste organisée, bien qu'incomplète, de ressources sur l'IA centrée sur les données.
★ 1 159+1Évolution des étoiles sur les 7 derniers jours - #70
Un centre de connaissances dédié à l'ingénierie des données et au machine learning.
★ 1 146+0Évolution des étoiles sur les 7 derniers jours - #71
Référentiel de l'Open Data Contract Standard (ODCS).
★ 1 118+18Évolution des étoiles sur les 7 derniers jours - #72
Répertoire de catalogues de données et de plateformes d'observabilité.
★ 1 068+5Évolution des étoiles sur les 7 derniers jours - #73
Appliquer des contrats de données
★ 1 060+8Évolution des étoiles sur les 7 derniers jours - #74
Synchronisez en continu les systèmes où résident vos données vers les systèmes où vous souhaitez qu'elles soient, en gérant vos flux de données avec Estuary.
★ 972+7Évolution des étoiles sur les 7 derniers jours - #75
FlyFish est une plateforme de codage pour la visualisation de données. Elle permet de créer rapidement un modèle de données et de générer des solutions de visualisation par simple glisser-déposer.
★ 961+0Évolution des étoiles sur les 7 derniers jours - #76
Un guide complet pour construire un entrepôt de données moderne avec SQL Server, incluant les processus ETL, la modélisation des données et l'analyse.
★ 934+14Évolution des étoiles sur les 7 derniers jours - #77★ 921+0Évolution des étoiles sur les 7 derniers jours
- #78
Un dépôt supplémentaire regroupant des concepts fondamentaux, des défis techniques et des ressources sur l'ingénierie des données en espagnol.
★ 896+1Évolution des étoiles sur les 7 derniers jours - #79
Framework communautaire, simple et puissant pour un calcul distribué sur données rapide et économique.
★ 871+1Évolution des étoiles sur les 7 derniers jours - #80
Neum AI est un framework de premier ordre pour gérer la création et la synchronisation d'embeddings vectoriels à grande échelle.
★ 867+0Évolution des étoiles sur les 7 derniers jours - #81
Matériel complémentaire pour le cours Udemy The Complete dbt (Data Build Tool) Bootcamp.
★ 827+0Évolution des étoiles sur les 7 derniers jours - #82
Ingénierie de données pratique : guide de projet concret dans l'immobilier.
★ 823+2Évolution des étoiles sur les 7 derniers jours - #83
Framework Python pour construire des pipelines de données efficaces. Il favorise la modularité et la collaboration, permettant la création de pipelines complexes à partir de composants simples et réutilisables.
★ 818+0Évolution des étoiles sur les 7 derniers jours - #84
Plateforme d'ingénierie de données agentique open source pour dbt, SQL et les entrepôts de données cloud. Plus de 100 outils, 10 entrepôts, propulsé par l'IA.
★ 808+3Évolution des étoiles sur les 7 derniers jours - #85
Mieux connaître vos données ! Datavines est une plateforme d'observabilité des données de nouvelle génération, prenant en charge la gestion des métadonnées et la qualité des données.
★ 761+1Évolution des étoiles sur les 7 derniers jours - #86
Optimisez BigQuery avec BigFunctions
★ 759+0Évolution des étoiles sur les 7 derniers jours - #87
Compilation d'exemples concrets et notables de projets de machine learning ayant échoué
★ 751+0Évolution des étoiles sur les 7 derniers jours - #88
VectorFlow est un pipeline d'embedding vectoriel à haut volume qui ingère des données brutes, les transforme en vecteurs et les écrit dans la base de données vectorielle de votre choix.
★ 703+0Évolution des étoiles sur les 7 derniers jours - #89
Un moteur de flux de données conçu pour l'intégration, la synchronisation, l'échange et le partage de données, ainsi que pour la configuration et la planification des tâches. Il utilise une architecture de séparation entre le contrôle et l'exécution, des couches multi-flux et des bibliothèques de plugins pour résoudre les problèmes pratiques liés aux tâches de données à grande échelle, aux rapports et collectes de données à haute fréquence, et à la compatibilité des données hétérogènes.
★ 696+0Évolution des étoiles sur les 7 derniers jours - #90★ 626+2Évolution des étoiles sur les 7 derniers jours