big-data
Repositórios de código aberto acompanhados marcados com big-data, ordenados por estrelas.
- #31
Motor de dados de alto desempenho para IA e cargas de trabalho multimodais. Processe imagens, áudio, vídeo e dados estruturados em qualquer escala.
★ 5.736+4Variação de estrelas nos últimos 7 dias - #32
Biblioteca Python de Machine Learning simples e distribuída, portando algoritmos de ML para Spark
★ 5.245+3Variação de estrelas nos últimos 7 dias - #33★ 5.180+2Variação de estrelas nos últimos 7 dias
- #34★ 5.082+2Variação de estrelas nos últimos 7 dias
- #35
Stream Framework é uma biblioteca Python que permite construir feeds de notícias, fluxos de atividades e sistemas de notificação usando Cassandra e/ou Redis. Os autores do Stream-Framework também fornecem um serviço em nuvem para tecnologia de feeds:
★ 4.742-2Variação de estrelas nos últimos 7 dias - #36
⚡️ Um componente Vue que suporta listas com grandes volumes de dados com alto desempenho de renderização e eficiência.
★ 4.505-1Variação de estrelas nos últimos 7 dias - #37
Converta facilmente grandes conjuntos de URLs de imagens em um dataset de imagens. Pode baixar, redimensionar e empacotar 100 milhões de URLs em 20 horas em uma única máquina.
★ 4.445+2Variação de estrelas nos últimos 7 dias - #38
CrateDB é um banco de dados SQL distribuído e escalável para armazenar e analisar grandes volumes de dados em tempo quase real, mesmo com consultas complexas. É compatível com PostgreSQL e baseado em Lucene.
★ 4.432+3Variação de estrelas nos últimos 7 dias - #39★ 4.399+2Variação de estrelas nos últimos 7 dias
- #40
Roteiro de Ciência de Dados de A a Z.
★ 4.354+3Variação de estrelas nos últimos 7 dias - #41
GraphScope: Um sistema de computação em grafos de grande escala e solução única do Alibaba.
★ 3.557+1Variação de estrelas nos últimos 7 dias - #42
Analisador léxico e sintático de SQL extensível para Rust
★ 3.446+9Variação de estrelas nos últimos 7 dias - #43
Apache Paimon é um formato de lake que permite construir uma arquitetura Realtime Lakehouse com Flink e Spark para operações de streaming e batch.
★ 3.388+3Variação de estrelas nos últimos 7 dias - #44★ 3.374+1Variação de estrelas nos últimos 7 dias
- #45
Substituto direto para o Apache Spark escrito em Rust, unificando processamento em lote, processamento de fluxo e cargas de trabalho de IA intensivas em computação.
★ 3.341+4Variação de estrelas nos últimos 7 dias - #46
Um banco de dados de grafos que suporta mais de 100 bilhões de dados, alta performance e escalabilidade (Inclui Motor OLTP, REST-API e Backends)
★ 3.167+6Variação de estrelas nos últimos 7 dias - #47★ 3.098+1Variação de estrelas nos últimos 7 dias
- #48★ 2.656+14Variação de estrelas nos últimos 7 dias
- #49
ArcticDB é um banco de dados de DataFrame serverless de alto desempenho, construído para o ecossistema de Ciência de Dados em Python.
★ 2.505+8Variação de estrelas nos últimos 7 dias - #50★ 2.379+2Variação de estrelas nos últimos 7 dias
- #51
O Apache Ambari simplifica o provisionamento, gerenciamento e monitoramento de clusters Apache Hadoop.
★ 2.311+0Variação de estrelas nos últimos 7 dias - #52
YTsaurus é uma plataforma de big data de código aberto escalável e tolerante a falhas.
★ 2.203+0Variação de estrelas nos últimos 7 dias - #53★ 2.131+11Variação de estrelas nos últimos 7 dias
- #54
Mecanismo de consulta distribuída Apache DataFusion Ballista
★ 2.127+7Variação de estrelas nos últimos 7 dias - #55★ 2.022+0Variação de estrelas nos últimos 7 dias
- #56
Apache BookKeeper - um serviço de armazenamento escalável, tolerante a falhas e de baixa latência, otimizado para cargas de trabalho de apenas anexação
★ 2.011+1Variação de estrelas nos últimos 7 dias - #57
Abstração e aceleração de dados fluida e elástica para aplicações de BigData/IA na nuvem. (Projeto sob a CNCF).
★ 1.967+0Variação de estrelas nos últimos 7 dias - #58★ 1.913+0Variação de estrelas nos últimos 7 dias
- #59
🚀 Mais de 500 recursos selecionados para Análise de Dados e Ciência de Dados: Python, SQL, Estatística, ML, IA, Visualização, Cheatsheets, Roadmaps e preparação para entrevistas. Para iniciantes e especialistas.
★ 1.890+8Variação de estrelas nos últimos 7 dias - #60
O acelerador Auron para frameworks de computação distribuída (ex: Spark) utiliza execução vetorizada nativa para acelerar o processamento de consultas
★ 1.798+2Variação de estrelas nos últimos 7 dias