pyspark
Dépôts open source suivis étiquetés pyspark, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de pyspark sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés pyspark.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1★ 6 650+1Évolution des étoiles sur les 7 derniers jours
- #2
Bibliothèque Python d'apprentissage automatique simple et distribuée, portant des algorithmes ML pour Spark
★ 5 245+3Évolution des étoiles sur les 7 derniers jours - #3★ 4 160+1Évolution des étoiles sur les 7 derniers jours
- #4
Apache Linkis construit une couche de middleware de calcul pour faciliter la connexion, la gouvernance et l'orchestration entre les applications supérieures et les moteurs de données sous-jacents.
★ 3 409+2Évolution des étoiles sur les 7 derniers jours - #5
Remplacement prêt à l'emploi pour Apache Spark écrit en Rust, unifiant le traitement par lots, le traitement de flux et les charges de travail IA intensives.
★ 3 341+4Évolution des étoiles sur les 7 derniers jours - #6
Liste organisée de ressources et de paquets Apache Spark.
★ 1 893+0Évolution des étoiles sur les 7 derniers jours - #7
La bibliothèque Petastorm permet l'entraînement et l'évaluation distribués ou sur machine unique de modèles de deep learning à partir de jeux de données au format Apache Parquet. Elle prend en charge des frameworks ML tels que Tensorflow, Pytorch et PySpark et peut être utilisée depuis du code Python pur.
★ 1 892+0Évolution des étoiles sur les 7 derniers jours - #8
Couche de compatibilité légère et extensible entre les bibliothèques de dataframe !
★ 1 714+4Évolution des étoiles sur les 7 derniers jours - #9
Tutoriels Apache Spark et Python (pySpark) pour l'analyse de Big Data et le Machine Learning sous forme de notebooks IPython / Jupyter
★ 1 660+0Évolution des étoiles sur les 7 derniers jours - #10
Flux de travail de préparation de données agiles simplifiés avec Pandas, Dask, cuDF, Dask-cuDF, Vaex et PySpark
★ 1 536+0Évolution des étoiles sur les 7 derniers jours - #11
Magics et kernels Jupyter pour travailler avec des clusters Spark distants.
★ 1 365-1Évolution des étoiles sur les 7 derniers jours - #12
Hopsworks - Plateforme d'IA à forte intensité de données avec un Feature Store
★ 1 304+1Évolution des étoiles sur les 7 derniers jours - #13
PySpark-Tutorial fournit des algorithmes de base utilisant PySpark.
★ 1 280+0Évolution des étoiles sur les 7 derniers jours - #14
GraphFrames est un package pour Apache Spark fournissant des graphes basés sur les DataFrames
★ 1 202+0Évolution des étoiles sur les 7 derniers jours - #15
MapReduce, Spark, Java et Scala pour le livre Data Algorithms.
★ 1 080-2Évolution des étoiles sur les 7 derniers jours - #16
Sparkling Water intègre les fonctionnalités de H2O au sein d'un cluster Spark.
★ 980+1Évolution des étoiles sur les 7 derniers jours - #17
Plus de 80 outils CLI pour DevOps et Data : AWS, GCP, GCF Python Cloud Functions, anonymiseur de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, convertisseurs et validateurs de données Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Évolution des étoiles sur les 7 derniers jours - #18
Framework Python pour construire des pipelines de données efficaces. Il favorise la modularité et la collaboration, permettant la création de pipelines complexes à partir de composants simples et réutilisables.
★ 818+0Évolution des étoiles sur les 7 derniers jours - #19
Scriptis est un outil d'analyse de données interactive avec développement de scripts (SQL, Pyspark, HiveQL), soumission de tâches (Spark, Hive), UDF, fonctions, gestion des ressources et diagnostic intelligent.
★ 814+0Évolution des étoiles sur les 7 derniers jours - #20★ 772-1Évolution des étoiles sur les 7 derniers jours
- #21★ 689+0Évolution des étoiles sur les 7 derniers jours
- #22
Comparaison de DataFrames Pandas, Polars, Spark et Snowpark, conçue pour les humains et plus encore.
★ 658+0Évolution des étoiles sur les 7 derniers jours - #23
Apprenez Apache Spark en Scala, Python (PySpark) et R (SparkR) en construisant votre propre cluster avec une interface JupyterLab sur Docker. :zap:
★ 512+0Évolution des étoiles sur les 7 derniers jours