spark
Repositórios de código aberto acompanhados marcados com spark, ordenados por estrelas.
- #61
Solução de armazenamento de dados de alto desempenho.
★ 1.452+0Variação de estrelas nos últimos 7 dias - #62
Este é o repositório GitHub para Learning Spark: Lightning-Fast Data Analytics [2ª Edição]
★ 1.402+2Variação de estrelas nos últimos 7 dias - #63
Mais de 50 imagens públicas do DockerHub para Docker e Kubernetes - DevOps, CI/CD, GitHub Actions, CircleCI, Jenkins, TeamCity, Alpine, CentOS, Debian, Fedora, Ubuntu, Hadoop, Kafka, ZooKeeper, HBase, Cassandra, Solr, SolrCloud, Presto, Apache Drill, Nifi, Spark, Consul, Riak
★ 1.379+0Variação de estrelas nos últimos 7 dias - #64
Magics e kernels do Jupyter para trabalhar com clusters Spark remotos.
★ 1.365-1Variação de estrelas nos últimos 7 dias - #65
Taier é uma plataforma de desenvolvimento de big data para submissão, agendamento, operação, manutenção e exibição de informações de indicadores.
★ 1.284+0Variação de estrelas nos últimos 7 dias - #66
PySpark-Tutorial fornece algoritmos básicos usando PySpark
★ 1.280+0Variação de estrelas nos últimos 7 dias - #67
Acelerador Apache DataFusion Comet para Spark
★ 1.262+2Variação de estrelas nos últimos 7 dias - #68
Gerenciamento de dados mestres escalável, resolução de identidade, resolução de entidades e deduplicação usando ML.
★ 1.243+5Variação de estrelas nos últimos 7 dias - #69
GraphFrames é um pacote para o Apache Spark que fornece grafos baseados em DataFrame.
★ 1.202+0Variação de estrelas nos últimos 7 dias - #70
Apache Amoro (em incubação) é um sistema de gerenciamento de Lakehouse construído sobre formatos de data lake abertos.
★ 1.171+0Variação de estrelas nos últimos 7 dias - #71
Um Hub de Conhecimento de Engenharia de Dados e Machine Learning
★ 1.146+0Variação de estrelas nos últimos 7 dias - #72
Apache Celeborn é um serviço elástico e de alto desempenho para dados de shuffle e spilled.
★ 1.062+2Variação de estrelas nos últimos 7 dias - #73
ADAM é uma plataforma de análise genômica com formatos de arquivo especializados construída usando Apache Avro, Apache Spark e Apache Parquet. Licenciado sob Apache 2.
★ 1.059+2Variação de estrelas nos últimos 7 dias - #74
Servidor para o projeto ListenBrainz, incluindo o código front-end (JavaScript/React) e todos os componentes de processamento de dados utilizados pelo projeto.
★ 1.007+4Variação de estrelas nos últimos 7 dias - #75
Plugin NVIDIA cuDF para Apache Spark - acelere o Apache Spark com GPUs
★ 999+1Variação de estrelas nos últimos 7 dias - #76
Um tutorial gratuito para Apache Spark.
★ 988+0Variação de estrelas nos últimos 7 dias - #77
O Sparkling Water fornece funcionalidade H2O dentro do cluster Spark
★ 980+1Variação de estrelas nos últimos 7 dias - #78★ 971-1Variação de estrelas nos últimos 7 dias
- #79
Apache Livy é uma interface REST de código aberto para interagir com o Apache Spark de qualquer lugar.
★ 962+2Variação de estrelas nos últimos 7 dias - #80
Um protocolo aberto para compartilhamento seguro de dados
★ 958-1Variação de estrelas nos últimos 7 dias - #81
Projeto open source para preparação de dados para aplicações GenAI
★ 958+2Variação de estrelas nos últimos 7 dias - #82★ 948+0Variação de estrelas nos últimos 7 dias
- #83
Um conector para o Spark que permite leitura e escrita de/para o cluster Redis
★ 945+0Variação de estrelas nos últimos 7 dias - #84★ 895-2Variação de estrelas nos últimos 7 dias
- #85★ 889+0Variação de estrelas nos últimos 7 dias
- #86
Uma lista curada de recursos incríveis relacionados às linguagens de programação Ada e SPARK.
★ 865+2Variação de estrelas nos últimos 7 dias - #87
DoEKS é uma ferramenta para construir, implantar e escalar Plataformas de Dados no Amazon EKS
★ 856-1Variação de estrelas nos últimos 7 dias - #88
Este repositório contém o código de desenvolvimento do sparkMeasure, uma biblioteca de análise de desempenho e solução de problemas para o Apache Spark. Ele simplifica a coleta, agregação e exportação de métricas de tarefas/estágios do Spark, sendo projetado para uso prático por desenvolvedores e engenheiros de dados em fluxos de trabalho de análise interativa, testes e monitoramento de produção.
★ 827-2Variação de estrelas nos últimos 7 dias - #89
Mais de 80 ferramentas CLI para DevOps e Dados - AWS, GCP, GCF Python Cloud Functions, anonimizador de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, conversores e validadores de dados Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Variação de estrelas nos últimos 7 dias - #90
Scriptis é para análise interativa de dados com desenvolvimento de scripts (SQL, Pyspark, HiveQL), submissão de tarefas (Spark, Hive), UDF, gerenciamento de funções e recursos e diagnóstico inteligente.
★ 814+0Variação de estrelas nos últimos 7 dias