Pular para o conteúdo principal
buildradar
Sign in
Tópico · big-data

big-data

Repositórios de código aberto acompanhados marcados com big-data, ordenados por estrelas.

110 repositórios
  • Daft@Eventual-Inc

    Motor de dados de alto desempenho para IA e cargas de trabalho multimodais. Processe imagens, áudio, vídeo e dados estruturados em qualquer escala.

    5.736+4Variação de estrelas nos últimos 7 dias
  • SynapseML@microsoft

    Biblioteca Python de Machine Learning simples e distribuída, portando algoritmos de ML para Spark

    5.245+3Variação de estrelas nos últimos 7 dias
  • calcite@apache

    Apache Calcite

    5.180+2Variação de estrelas nos últimos 7 dias
  • ignite@apache

    Apache Ignite

    5.082+2Variação de estrelas nos últimos 7 dias
  • Stream-Framework@tschellenbach

    Stream Framework é uma biblioteca Python que permite construir feeds de notícias, fluxos de atividades e sistemas de notificação usando Cassandra e/ou Redis. Os autores do Stream-Framework também fornecem um serviço em nuvem para tecnologia de feeds:

    4.742-2Variação de estrelas nos últimos 7 dias
  • ⚡️ Um componente Vue que suporta listas com grandes volumes de dados com alto desempenho de renderização e eficiência.

    4.505-1Variação de estrelas nos últimos 7 dias
  • img2dataset@rom1504

    Converta facilmente grandes conjuntos de URLs de imagens em um dataset de imagens. Pode baixar, redimensionar e empacotar 100 milhões de URLs em 20 horas em uma única máquina.

    4.445+2Variação de estrelas nos últimos 7 dias
  • crate@crate

    CrateDB é um banco de dados SQL distribuído e escalável para armazenar e analisar grandes volumes de dados em tempo quase real, mesmo com consultas complexas. É compatível com PostgreSQL e baseado em Lucene.

    4.432+3Variação de estrelas nos últimos 7 dias
  • fastjson2@alibaba

    🚄 FASTJSON2 é uma biblioteca JSON para Java com excelente desempenho.

    4.399+2Variação de estrelas nos últimos 7 dias
  • Data-Science-Roadmap@Moataz-Elmesmary

    Roteiro de Ciência de Dados de A a Z.

    4.354+3Variação de estrelas nos últimos 7 dias
  • GraphScope@alibaba

    GraphScope: Um sistema de computação em grafos de grande escala e solução única do Alibaba.

    3.557+1Variação de estrelas nos últimos 7 dias
  • Analisador léxico e sintático de SQL extensível para Rust

    3.446+9Variação de estrelas nos últimos 7 dias
  • paimon@apache

    Apache Paimon é um formato de lake que permite construir uma arquitetura Realtime Lakehouse com Flink e Spark para operações de streaming e batch.

    3.388+3Variação de estrelas nos últimos 7 dias
  • koalas@databricks

    Koalas: API do pandas no Apache Spark

    3.374+1Variação de estrelas nos últimos 7 dias
  • sail@lakehq

    Substituto direto para o Apache Spark escrito em Rust, unificando processamento em lote, processamento de fluxo e cargas de trabalho de IA intensivas em computação.

    3.341+4Variação de estrelas nos últimos 7 dias
  • hugegraph@apache

    Um banco de dados de grafos que suporta mais de 100 bilhões de dados, alta performance e escalabilidade (Inclui Motor OLTP, REST-API e Backends)

    3.167+6Variação de estrelas nos últimos 7 dias
  • CBoard@TuiQiao

    Uma plataforma de BI e relatórios de autoatendimento fácil de usar.

    3.098+1Variação de estrelas nos últimos 7 dias
  • kafka-ui@kafbat

    Interface web de código aberto para gerenciar clusters Apache Kafka

    2.656+14Variação de estrelas nos últimos 7 dias
  • ArcticDB@man-group

    ArcticDB é um banco de dados de DataFrame serverless de alto desempenho, construído para o ecossistema de Ciência de Dados em Python.

    2.505+8Variação de estrelas nos últimos 7 dias
  • quary@quarylabs

    BI de código aberto para engenheiros

    2.379+2Variação de estrelas nos últimos 7 dias
  • ambari@apache

    O Apache Ambari simplifica o provisionamento, gerenciamento e monitoramento de clusters Apache Hadoop.

    2.311+0Variação de estrelas nos últimos 7 dias
  • ytsaurus@ytsaurus

    YTsaurus é uma plataforma de big data de código aberto escalável e tolerante a falhas.

    2.203+0Variação de estrelas nos últimos 7 dias
  • fluss@apache

    Apache Fluss é um armazenamento de streaming criado para análise em tempo real.

    2.131+11Variação de estrelas nos últimos 7 dias
  • Mecanismo de consulta distribuída Apache DataFusion Ballista

    2.127+7Variação de estrelas nos últimos 7 dias
  • drill@apache

    Apache Drill é uma camada de consulta MPP distribuída para dados autodescritivos.

    2.022+0Variação de estrelas nos últimos 7 dias
  • bookkeeper@apache

    Apache BookKeeper - um serviço de armazenamento escalável, tolerante a falhas e de baixa latência, otimizado para cargas de trabalho de apenas anexação

    2.011+1Variação de estrelas nos últimos 7 dias
  • fluid@fluid-cloudnative

    Abstração e aceleração de dados fluida e elástica para aplicações de BigData/IA na nuvem. (Projeto sob a CNCF).

    1.967+0Variação de estrelas nos últimos 7 dias
  • kudu@apache

    Mirror do Apache Kudu

    1.913+0Variação de estrelas nos últimos 7 dias
  • awesome-data-analysis@PavelGrigoryevDS

    🚀 Mais de 500 recursos selecionados para Análise de Dados e Ciência de Dados: Python, SQL, Estatística, ML, IA, Visualização, Cheatsheets, Roadmaps e preparação para entrevistas. Para iniciantes e especialistas.

    1.890+8Variação de estrelas nos últimos 7 dias
  • auron@apache

    O acelerador Auron para frameworks de computação distribuída (ex: Spark) utiliza execução vetorizada nativa para acelerar o processamento de consultas

    1.798+2Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos