pyspark
Repositórios de código aberto acompanhados marcados com pyspark, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de pyspark no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com pyspark.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1★ 6.650+1Variação de estrelas nos últimos 7 dias
- #2
Biblioteca Python de Machine Learning simples e distribuída, portando algoritmos de ML para Spark
★ 5.245+3Variação de estrelas nos últimos 7 dias - #3★ 4.160+1Variação de estrelas nos últimos 7 dias
- #4
O Apache Linkis cria uma camada de middleware de computação para facilitar a conexão, governança e orquestração entre as aplicações superiores e os motores de dados subjacentes.
★ 3.409+2Variação de estrelas nos últimos 7 dias - #5
Substituto direto para o Apache Spark escrito em Rust, unificando processamento em lote, processamento de fluxo e cargas de trabalho de IA intensivas em computação.
★ 3.341+4Variação de estrelas nos últimos 7 dias - #6
Uma lista selecionada de pacotes e recursos incríveis do Apache Spark.
★ 1.893+0Variação de estrelas nos últimos 7 dias - #7
A biblioteca Petastorm permite o treinamento e avaliação, em máquina única ou distribuída, de modelos de deep learning a partir de datasets no formato Apache Parquet. Suporta frameworks de ML como Tensorflow, Pytorch e PySpark, podendo ser utilizada a partir de código Python puro
★ 1.892+0Variação de estrelas nos últimos 7 dias - #8★ 1.714+4Variação de estrelas nos últimos 7 dias
- #9
Tutoriais de Apache Spark e Python (pySpark) para análise de Big Data e Machine Learning em notebooks IPython / Jupyter
★ 1.660+0Variação de estrelas nos últimos 7 dias - #10
Fluxos de trabalho de preparação de dados ágeis facilitados com Pandas, Dask, cuDF, Dask-cuDF, Vaex e PySpark
★ 1.536+0Variação de estrelas nos últimos 7 dias - #11
Magics e kernels do Jupyter para trabalhar com clusters Spark remotos.
★ 1.365-1Variação de estrelas nos últimos 7 dias - #12★ 1.304+1Variação de estrelas nos últimos 7 dias
- #13
PySpark-Tutorial fornece algoritmos básicos usando PySpark
★ 1.280+0Variação de estrelas nos últimos 7 dias - #14
GraphFrames é um pacote para o Apache Spark que fornece grafos baseados em DataFrame.
★ 1.202+0Variação de estrelas nos últimos 7 dias - #15
MapReduce, Spark, Java e Scala para o livro Data Algorithms
★ 1.080-2Variação de estrelas nos últimos 7 dias - #16
O Sparkling Water fornece funcionalidade H2O dentro do cluster Spark
★ 980+1Variação de estrelas nos últimos 7 dias - #17
Mais de 80 ferramentas CLI para DevOps e Dados - AWS, GCP, GCF Python Cloud Functions, anonimizador de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, conversores e validadores de dados Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Variação de estrelas nos últimos 7 dias - #18
Framework Python para construir pipelines de dados eficientes. Promove modularidade e colaboração, permitindo a criação de pipelines complexos a partir de componentes simples e reutilizáveis.
★ 818+0Variação de estrelas nos últimos 7 dias - #19
Scriptis é para análise interativa de dados com desenvolvimento de scripts (SQL, Pyspark, HiveQL), submissão de tarefas (Spark, Hive), UDF, gerenciamento de funções e recursos e diagnóstico inteligente.
★ 814+0Variação de estrelas nos últimos 7 dias - #20★ 772-1Variação de estrelas nos últimos 7 dias
- #21★ 689+0Variação de estrelas nos últimos 7 dias
- #22
Comparação de DataFrames em Pandas, Polars, Spark e Snowpark para humanos e muito mais!
★ 658+0Variação de estrelas nos últimos 7 dias - #23
Aprenda Apache Spark em Scala, Python (PySpark) e R (SparkR) construindo seu próprio cluster com interface JupyterLab no Docker. :zap:
★ 512+0Variação de estrelas nos últimos 7 dias