Pular para o conteúdo principal
buildradar
Sign in
Tópico · spark

spark

Repositórios de código aberto acompanhados marcados com spark, ordenados por estrelas.

115 repositórios
  • carbondata@apache

    Solução de armazenamento de dados de alto desempenho.

    1.452+0Variação de estrelas nos últimos 7 dias
  • LearningSparkV2@databricks

    Este é o repositório GitHub para Learning Spark: Lightning-Fast Data Analytics [2ª Edição]

    1.402+2Variação de estrelas nos últimos 7 dias
  • Dockerfiles@HariSekhon

    Mais de 50 imagens públicas do DockerHub para Docker e Kubernetes - DevOps, CI/CD, GitHub Actions, CircleCI, Jenkins, TeamCity, Alpine, CentOS, Debian, Fedora, Ubuntu, Hadoop, Kafka, ZooKeeper, HBase, Cassandra, Solr, SolrCloud, Presto, Apache Drill, Nifi, Spark, Consul, Riak

    1.379+0Variação de estrelas nos últimos 7 dias
  • sparkmagic@jupyter-incubator

    Magics e kernels do Jupyter para trabalhar com clusters Spark remotos.

    1.365-1Variação de estrelas nos últimos 7 dias
  • Taier@DTStack

    Taier é uma plataforma de desenvolvimento de big data para submissão, agendamento, operação, manutenção e exibição de informações de indicadores.

    1.284+0Variação de estrelas nos últimos 7 dias
  • pyspark-tutorial@mahmoudparsian

    PySpark-Tutorial fornece algoritmos básicos usando PySpark

    1.280+0Variação de estrelas nos últimos 7 dias
  • Acelerador Apache DataFusion Comet para Spark

    1.262+2Variação de estrelas nos últimos 7 dias
  • zingg@zinggAI

    Gerenciamento de dados mestres escalável, resolução de identidade, resolução de entidades e deduplicação usando ML.

    1.243+5Variação de estrelas nos últimos 7 dias
  • graphframes@graphframes

    GraphFrames é um pacote para o Apache Spark que fornece grafos baseados em DataFrame.

    1.202+0Variação de estrelas nos últimos 7 dias
  • amoro@apache

    Apache Amoro (em incubação) é um sistema de gerenciamento de Lakehouse construído sobre formatos de data lake abertos.

    1.171+0Variação de estrelas nos últimos 7 dias
  • around-dataengineering@abhishek-ch

    Um Hub de Conhecimento de Engenharia de Dados e Machine Learning

    1.146+0Variação de estrelas nos últimos 7 dias
  • celeborn@apache

    Apache Celeborn é um serviço elástico e de alto desempenho para dados de shuffle e spilled.

    1.062+2Variação de estrelas nos últimos 7 dias
  • adam@bigdatagenomics

    ADAM é uma plataforma de análise genômica com formatos de arquivo especializados construída usando Apache Avro, Apache Spark e Apache Parquet. Licenciado sob Apache 2.

    1.059+2Variação de estrelas nos últimos 7 dias
  • listenbrainz-server@metabrainz

    Servidor para o projeto ListenBrainz, incluindo o código front-end (JavaScript/React) e todos os componentes de processamento de dados utilizados pelo projeto.

    1.007+4Variação de estrelas nos últimos 7 dias
  • cudf-spark@NVIDIA

    Plugin NVIDIA cuDF para Apache Spark - acelere o Apache Spark com GPUs

    999+1Variação de estrelas nos últimos 7 dias
  • spark-scala-tutorial@deanwampler

    Um tutorial gratuito para Apache Spark.

    988+0Variação de estrelas nos últimos 7 dias
  • O Sparkling Water fornece funcionalidade H2O dentro do cluster Spark

    980+1Variação de estrelas nos últimos 7 dias
  • sparklyr@sparklyr

    Interface R para o Apache Spark

    971-1Variação de estrelas nos últimos 7 dias
  • livy@apache

    Apache Livy é uma interface REST de código aberto para interagir com o Apache Spark de qualquer lugar.

    962+2Variação de estrelas nos últimos 7 dias
  • delta-sharing@delta-io

    Um protocolo aberto para compartilhamento seguro de dados

    958-1Variação de estrelas nos últimos 7 dias
  • data-prep-kit@data-prep-kit

    Projeto open source para preparação de dados para aplicações GenAI

    958+2Variação de estrelas nos últimos 7 dias
  • Mobius@microsoft

    Bindings de linguagem e extensões em C# e F# para o Apache Spark

    948+0Variação de estrelas nos últimos 7 dias
  • spark-redis@RedisLabs

    Um conector para o Spark que permite leitura e escrita de/para o cluster Redis

    945+0Variação de estrelas nos últimos 7 dias
  • frameless@typelevel

    Tipos expressivos para Spark.

    895-2Variação de estrelas nos últimos 7 dias
  • tispark@pingcap

    O TiSpark foi criado para executar o Apache Spark sobre o TiDB/TiKV.

    889+0Variação de estrelas nos últimos 7 dias
  • Uma lista curada de recursos incríveis relacionados às linguagens de programação Ada e SPARK.

    865+2Variação de estrelas nos últimos 7 dias
  • data-on-eks@awslabs

    DoEKS é uma ferramenta para construir, implantar e escalar Plataformas de Dados no Amazon EKS

    856-1Variação de estrelas nos últimos 7 dias
  • sparkMeasure@LucaCanali

    Este repositório contém o código de desenvolvimento do sparkMeasure, uma biblioteca de análise de desempenho e solução de problemas para o Apache Spark. Ele simplifica a coleta, agregação e exportação de métricas de tarefas/estágios do Spark, sendo projetado para uso prático por desenvolvedores e engenheiros de dados em fluxos de trabalho de análise interativa, testes e monitoramento de produção.

    827-2Variação de estrelas nos últimos 7 dias
  • DevOps-Python-tools@HariSekhon

    Mais de 80 ferramentas CLI para DevOps e Dados - AWS, GCP, GCF Python Cloud Functions, anonimizador de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, conversores e validadores de dados Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.

    824+0Variação de estrelas nos últimos 7 dias
  • Scriptis@WeBankFinTech

    Scriptis é para análise interativa de dados com desenvolvimento de scripts (SQL, Pyspark, HiveQL), submissão de tarefas (Spark, Hive), UDF, gerenciamento de funções e recursos e diagnóstico inteligente.

    814+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos