spark
Dépôts open source suivis étiquetés spark, triés par étoiles.
- #61
Solution de stockage de données haute performance
★ 1 452+0Évolution des étoiles sur les 7 derniers jours - #62
Dépôt GitHub pour Learning Spark : Lightning-Fast Data Analytics [2e édition].
★ 1 402+3Évolution des étoiles sur les 7 derniers jours - #63
Plus de 50 images DockerHub publiques pour Docker et Kubernetes - DevOps, CI/CD, GitHub Actions, CircleCI, Jenkins, TeamCity, Alpine, CentOS, Debian, Fedora, Ubuntu, Hadoop, Kafka, ZooKeeper, HBase, Cassandra, Solr, SolrCloud, Presto, Apache Drill, Nifi, Spark, Consul, Riak.
★ 1 379+0Évolution des étoiles sur les 7 derniers jours - #64
Magics et kernels Jupyter pour travailler avec des clusters Spark distants.
★ 1 365-1Évolution des étoiles sur les 7 derniers jours - #65
Taier est une plateforme de développement Big Data dédiée à la soumission, la planification, l'exploitation, la maintenance et l'affichage d'indicateurs.
★ 1 284+0Évolution des étoiles sur les 7 derniers jours - #66
PySpark-Tutorial fournit des algorithmes de base utilisant PySpark.
★ 1 280+1Évolution des étoiles sur les 7 derniers jours - #67
Accélérateur Spark Apache DataFusion Comet
★ 1 262+4Évolution des étoiles sur les 7 derniers jours - #68
Gestion évolutive des données de référence, résolution d'identité, résolution d'entités et déduplication utilisant le ML.
★ 1 243+5Évolution des étoiles sur les 7 derniers jours - #69
GraphFrames est un package pour Apache Spark fournissant des graphes basés sur les DataFrames
★ 1 202+1Évolution des étoiles sur les 7 derniers jours - #70
Apache Amoro (en incubation) est un système de gestion de Lakehouse basé sur des formats de lac de données ouverts.
★ 1 171+2Évolution des étoiles sur les 7 derniers jours - #71
Un centre de connaissances dédié à l'ingénierie des données et au machine learning.
★ 1 146+1Évolution des étoiles sur les 7 derniers jours - #72
Apache Celeborn est un service élastique et haute performance pour le shuffle et les données déversées.
★ 1 062+0Évolution des étoiles sur les 7 derniers jours - #73
ADAM est une plateforme d'analyse génomique utilisant des formats de fichiers spécialisés basés sur Apache Avro, Apache Spark et Apache Parquet. Sous licence Apache 2.
★ 1 059+2Évolution des étoiles sur les 7 derniers jours - #74
Serveur pour le projet ListenBrainz, incluant le code front-end (javascript/react) et tous les composants de traitement de données utilisés par LB.
★ 1 006+5Évolution des étoiles sur les 7 derniers jours - #75
Plugin NVIDIA cuDF pour Apache Spark - accélérez Apache Spark avec les GPU.
★ 998+1Évolution des étoiles sur les 7 derniers jours - #76
Un tutoriel gratuit pour Apache Spark.
★ 988+0Évolution des étoiles sur les 7 derniers jours - #77
Sparkling Water intègre les fonctionnalités de H2O au sein d'un cluster Spark.
★ 980+0Évolution des étoiles sur les 7 derniers jours - #78★ 972+0Évolution des étoiles sur les 7 derniers jours
- #79
Apache Livy est une interface REST open source permettant d'interagir avec Apache Spark depuis n'importe où.
★ 961+0Évolution des étoiles sur les 7 derniers jours - #80
Projet open source pour la préparation de données destinées aux applications GenAI
★ 958+2Évolution des étoiles sur les 7 derniers jours - #81
Un protocole ouvert pour le partage sécurisé de données.
★ 957+0Évolution des étoiles sur les 7 derniers jours - #82★ 948+0Évolution des étoiles sur les 7 derniers jours
- #83
Connecteur Spark permettant la lecture et l'écriture vers un cluster Redis.
★ 945+0Évolution des étoiles sur les 7 derniers jours - #84★ 895-1Évolution des étoiles sur les 7 derniers jours
- #85★ 889+0Évolution des étoiles sur les 7 derniers jours
- #86
Une liste organisée de ressources sur les langages de programmation Ada et SPARK
★ 864+0Évolution des étoiles sur les 7 derniers jours - #87
DoEKS est un outil pour construire, déployer et mettre à l'échelle des plateformes de données sur Amazon EKS.
★ 856-1Évolution des étoiles sur les 7 derniers jours - #88
Ce dépôt contient le code de développement de sparkMeasure, une bibliothèque d'analyse et de dépannage des performances pour Apache Spark. Elle simplifie la collecte, l'agrégation et l'exportation des métriques de tâches et d'étapes Spark, et est conçue pour une utilisation pratique par les développeurs et les ingénieurs de données dans les flux de travail d'analyse interactive, de test et de surveillance en production.
★ 829+1Évolution des étoiles sur les 7 derniers jours - #89
Plus de 80 outils CLI pour DevOps et Data : AWS, GCP, GCF Python Cloud Functions, anonymiseur de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, convertisseurs et validateurs de données Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+1Évolution des étoiles sur les 7 derniers jours - #90
Scriptis est un outil d'analyse de données interactive avec développement de scripts (SQL, Pyspark, HiveQL), soumission de tâches (Spark, Hive), UDF, fonctions, gestion des ressources et diagnostic intelligent.
★ 814+0Évolution des étoiles sur les 7 derniers jours