big-data
Dépôts open source suivis étiquetés big-data, triés par étoiles.
- #61★ 1 766-1Évolution des étoiles sur les 7 derniers jours
- #62
Data lake de sécurité open source pour la chasse aux menaces, la détection, la réponse et l'analyse de cybersécurité à l'échelle du pétaoctet sur AWS
★ 1 694+0Évolution des étoiles sur les 7 derniers jours - #63
Tutoriels Apache Spark et Python (pySpark) pour l'analyse de Big Data et le Machine Learning sous forme de notebooks IPython / Jupyter
★ 1 660+1Évolution des étoiles sur les 7 derniers jours - #64
Tonbo est une base de données embarquée pour les environnements d'exécution serverless et edge.
★ 1 618+3Évolution des étoiles sur les 7 derniers jours - #65
Tableaux de bord utilisant des fichiers YAML ou JSON
★ 1 582+1Évolution des étoiles sur les 7 derniers jours - #66
Dremio - le chaînon manquant dans les données modernes.
★ 1 492+1Évolution des étoiles sur les 7 derniers jours - #67
Solution de stockage de données haute performance
★ 1 452+0Évolution des étoiles sur les 7 derniers jours - #68★ 1 384+0Évolution des étoiles sur les 7 derniers jours
- #69
Une base de données MPP (Massively Parallel Processing) avancée et mature. Alternative open source à Greenplum Database.
★ 1 382+8Évolution des étoiles sur les 7 derniers jours - #70
Extension pour Scikit-learn permettant d'accélérer facilement vos applications Scikit-learn
★ 1 356+0Évolution des étoiles sur les 7 derniers jours - #71
PySpark-Tutorial fournit des algorithmes de base utilisant PySpark.
★ 1 280+1Évolution des étoiles sur les 7 derniers jours - #72
Système de stockage distribué, évolutif et fiable, optimisé pour l'analyse de données et les charges de travail de stockage d'objets.
★ 1 270+4Évolution des étoiles sur les 7 derniers jours - #73
Application de bureau Windows simple pour visualiser et interroger des fichiers Apache Parquet.
★ 1 231+2Évolution des étoiles sur les 7 derniers jours - #74
GraphFrames est un package pour Apache Spark fournissant des graphes basés sur les DataFrames
★ 1 202+1Évolution des étoiles sur les 7 derniers jours - #75
Apache Amoro (en incubation) est un système de gestion de Lakehouse basé sur des formats de lac de données ouverts.
★ 1 171+2Évolution des étoiles sur les 7 derniers jours - #76★ 1 165+2Évolution des étoiles sur les 7 derniers jours
- #77
ClickBench : un benchmark pour les bases de données analytiques
★ 1 094+3Évolution des étoiles sur les 7 derniers jours - #78
Répertoire de catalogues de données et de plateformes d'observabilité.
★ 1 068+4Évolution des étoiles sur les 7 derniers jours - #79
ADAM est une plateforme d'analyse génomique utilisant des formats de fichiers spécialisés basés sur Apache Avro, Apache Spark et Apache Parquet. Sous licence Apache 2.
★ 1 059+2Évolution des étoiles sur les 7 derniers jours - #80
Un fork de ClickHouse prenant en charge la recherche vectorielle et la recherche plein texte haute performance.
★ 1 040+1Évolution des étoiles sur les 7 derniers jours - #81
Opérateur Kubernetes pour Apache Flink.
★ 1 031+3Évolution des étoiles sur les 7 derniers jours - #82
Ressources de carrière pour la science des données, l'apprentissage automatique, le Big Data et l'analyse commerciale.
★ 1 022+1Évolution des étoiles sur les 7 derniers jours - #83
Serveur pour le projet ListenBrainz, incluant le code front-end (javascript/react) et tous les composants de traitement de données utilisés par LB.
★ 1 006+5Évolution des étoiles sur les 7 derniers jours - #84
Plugin NVIDIA cuDF pour Apache Spark - accélérez Apache Spark avec les GPU.
★ 998+1Évolution des étoiles sur les 7 derniers jours - #85
Sparkling Water intègre les fonctionnalités de H2O au sein d'un cluster Spark.
★ 980+0Évolution des étoiles sur les 7 derniers jours - #86
Un protocole ouvert pour le partage sécurisé de données.
★ 957+0Évolution des étoiles sur les 7 derniers jours - #87
Algorithmes en un seul passage pour les statistiques.
★ 897+0Évolution des étoiles sur les 7 derniers jours - #88
Un dépôt supplémentaire regroupant des concepts fondamentaux, des défis techniques et des ressources sur l'ingénierie des données en espagnol.
★ 896+0Évolution des étoiles sur les 7 derniers jours - #89
Structure de données apprise de pointe permettant des recherches rapides, des prédécesseurs, des recherches par plage et des mises à jour dans des tableaux de milliards d'éléments en utilisant beaucoup moins d'espace que les index traditionnels
★ 873+1Évolution des étoiles sur les 7 derniers jours - #90
Projets d'IA
★ 868+1Évolution des étoiles sur les 7 derniers jours