spark
Repositórios de código aberto acompanhados marcados com spark, ordenados por estrelas.
- #31
LakeSoul é um framework Lakehouse nativo em nuvem, de ponta a ponta e em tempo real, para ingestão rápida de dados, atualizações concorrentes, análises incrementais, processamento de dados multimodais e busca vetorial — impulsionando cargas de trabalho de BI e IA de próxima geração.
★ 3.249+2Variação de estrelas nos últimos 7 dias - #32
Aprendizado de Big Data do zero, incluindo vídeos de treinamento, materiais de entrevista e guias de estudo para cada etapa.
★ 3.224+5Variação de estrelas nos últimos 7 dias - #33
Operador Kubernetes para gerenciar o ciclo de vida de aplicações Apache Spark no Kubernetes.
★ 3.150+0Variação de estrelas nos últimos 7 dias - #34
Servidor de jobs REST para Apache Spark
★ 2.836+0Variação de estrelas nos últimos 7 dias - #35★ 2.829+16Variação de estrelas nos últimos 7 dias
- #36
Exemplos de aprendizado rápido baseados em Spring Boot, integrando frameworks de código aberto como: rabbitmq (fila de atraso), Kafka, jpa, redis, oauth2, swagger, jsp, docker, k3s, k3d, k8s, plugin de criptografia mybatis, tratamento de exceções, log, desenvolvimento multimodular, empacotamento multiambiente, cache, web crawler, jwt, GraphQL, dubbo, zookeeper e Async, entre outros.
★ 2.787+1Variação de estrelas nos últimos 7 dias - #37
Sistema de análise de big data de fluxo de passageiros do metrô de Shenzhen 🚇🚄🌟
★ 2.475+1Variação de estrelas nos últimos 7 dias - #38
Spark é uma ferramenta de administração remota (RAT) baseada na web, multiplataforma e completa, escrita em Go, que permite controlar todos os seus dispositivos de qualquer lugar.
★ 2.386+3Variação de estrelas nos últimos 7 dias - #39
Vinculação de dados probabilística rápida, precisa e escalável com suporte para múltiplos backends SQL.
★ 2.375+6Variação de estrelas nos últimos 7 dias - #40
O Apache Kyuubi é um gateway distribuído e multi-tenant que fornece SQL serverless em data warehouses e lakehouses.
★ 2.364+1Variação de estrelas nos últimos 7 dias - #41
TransmogrifAI (pronunciado trăns-mŏgˈrə-fī) é uma biblioteca de AutoML para construir fluxos de trabalho de aprendizado de máquina fortemente tipados, reutilizáveis e modulares no Apache Spark com ajuste manual mínimo
★ 2.277+0Variação de estrelas nos últimos 7 dias - #42
YTsaurus é uma plataforma de big data de código aberto escalável e tolerante a falhas.
★ 2.203+0Variação de estrelas nos últimos 7 dias - #43
Ferramentas para manipular firmwares de produtos DJI, com foco em quadricópteros.
★ 2.193+3Variação de estrelas nos últimos 7 dias - #44
Uma interface unificada para computação distribuída. O Fugue executa código SQL, Python, Pandas e Polars no Spark, Dask e Ray sem necessidade de reescrita.
★ 2.170+0Variação de estrelas nos últimos 7 dias - #45★ 2.166+0Variação de estrelas nos últimos 7 dias
- #46
.NET for Apache® Spark™ torna o Apache Spark™ facilmente acessível para desenvolvedores .NET.
★ 2.096-2Variação de estrelas nos últimos 7 dias - #47★ 1.994+1Variação de estrelas nos últimos 7 dias
- #48
Conector do Apache Spark para Apache Cassandra
★ 1.955+1Variação de estrelas nos últimos 7 dias - #49
Repositório de conhecimento de Big Data abrangendo modelagem de data warehouse, computação em tempo real, Big Data, data middle platform, design de sistemas, Java, algoritmos, etc.
★ 1.811+3Variação de estrelas nos últimos 7 dias - #50
O acelerador Auron para frameworks de computação distribuída (ex: Spark) utiliza execução vetorizada nativa para acelerar o processamento de consultas
★ 1.798+2Variação de estrelas nos últimos 7 dias - #51★ 1.768+2Variação de estrelas nos últimos 7 dias
- #52
Organização de código aberto ApacheCN: anúncios, introdução, membros, atividades e canais de comunicação
★ 1.754+0Variação de estrelas nos últimos 7 dias - #53
Mais de 2000 perguntas de entrevista para engenheiros de dados.
★ 1.721+5Variação de estrelas nos últimos 7 dias - #54
Elassandra = Elasticsearch + Apache Cassandra
★ 1.714+0Variação de estrelas nos últimos 7 dias - #55
Tutoriais de Apache Spark e Python (pySpark) para análise de Big Data e Machine Learning em notebooks IPython / Jupyter
★ 1.660+0Variação de estrelas nos últimos 7 dias - #56★ 1.625+0Variação de estrelas nos últimos 7 dias
- #57
Os fundamentos internos do Apache Spark
★ 1.549+0Variação de estrelas nos últimos 7 dias - #58★ 1.544+1Variação de estrelas nos últimos 7 dias
- #59
Fluxos de trabalho de preparação de dados ágeis facilitados com Pandas, Dask, cuDF, Dask-cuDF, Vaex e PySpark
★ 1.536+0Variação de estrelas nos últimos 7 dias - #60★ 1.498+1Variação de estrelas nos últimos 7 dias