pyspark
Repositorios de código abierto monitorizados etiquetados con pyspark, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a pyspark en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con pyspark.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1★ 6650+1Variación de estrellas de los últimos 7 días
- #2
Biblioteca de Python de Machine Learning simple y distribuida que adapta algoritmos de ML para Spark
★ 5245+3Variación de estrellas de los últimos 7 días - #3★ 4160+1Variación de estrellas de los últimos 7 días
- #4
Apache Linkis construye una capa de middleware de computación para facilitar la conexión, gobernanza y orquestación entre las aplicaciones superiores y los motores de datos subyacentes.
★ 3409+2Variación de estrellas de los últimos 7 días - #5
Reemplazo directo de Apache Spark escrito en Rust, que unifica el procesamiento por lotes, el procesamiento de flujos y las cargas de trabajo de IA intensivas en computación.
★ 3341+4Variación de estrellas de los últimos 7 días - #6
Una lista seleccionada de recursos y paquetes increíbles para Apache Spark.
★ 1893+0Variación de estrellas de los últimos 7 días - #7
La biblioteca Petastorm permite el entrenamiento y evaluación distribuida o en máquina única de modelos de deep learning desde conjuntos de datos en formato Apache Parquet.
★ 1892+0Variación de estrellas de los últimos 7 días - #8★ 1714+4Variación de estrellas de los últimos 7 días
- #9
Tutoriales de Apache Spark y Python (pySpark) para análisis de Big Data y Machine Learning en formato de notebooks de IPython / Jupyter.
★ 1660+0Variación de estrellas de los últimos 7 días - #10
:truck: Flujos de trabajo de preparación de datos ágiles facilitados con Pandas, Dask, cuDF, Dask-cuDF, Vaex y PySpark
★ 1536+0Variación de estrellas de los últimos 7 días - #11
Magics y kernels de Jupyter para trabajar con clústeres remotos de Spark.
★ 1365-1Variación de estrellas de los últimos 7 días - #12★ 1304+1Variación de estrellas de los últimos 7 días
- #13
PySpark-Tutorial ofrece algoritmos básicos utilizando PySpark
★ 1280+0Variación de estrellas de los últimos 7 días - #14
GraphFrames es un paquete para Apache Spark que proporciona grafos basados en DataFrames.
★ 1202+0Variación de estrellas de los últimos 7 días - #15
Libro de algoritmos de datos con MapReduce, Spark, Java y Scala
★ 1080-2Variación de estrellas de los últimos 7 días - #16
Sparkling Water proporciona funcionalidad de H2O dentro de un clúster de Spark
★ 980+1Variación de estrellas de los últimos 7 días - #17
Más de 80 herramientas CLI para DevOps y datos: AWS, GCP, GCF Python Cloud Functions, anonimizador de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, conversores y validadores de datos Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Variación de estrellas de los últimos 7 días - #18
Framework de Python para construir pipelines de datos eficientes. Promueve la modularidad y la colaboración, permitiendo la creación de pipelines complejos a partir de componentes simples y reutilizables.
★ 818+0Variación de estrellas de los últimos 7 días - #19
Scriptis es una herramienta para el análisis interactivo de datos con desarrollo de scripts (SQL, Pyspark, HiveQL), envío de tareas (Spark, Hive), UDF, funciones, gestión de recursos y diagnóstico inteligente.
★ 814+0Variación de estrellas de los últimos 7 días - #20★ 772-1Variación de estrellas de los últimos 7 días
- #21★ 689+0Variación de estrellas de los últimos 7 días
- #22
Comparación de DataFrames de Pandas, Polars, Spark y Snowpark para humanos y más.
★ 658+0Variación de estrellas de los últimos 7 días - #23
Aprende Apache Spark en Scala, Python (PySpark) y R (SparkR) construyendo tu propio clúster con una interfaz de JupyterLab en Docker.
★ 512+0Variación de estrellas de los últimos 7 días