Pular para o conteúdo principal
buildradar
Sign in
Tópico · big-data

big-data

Repositórios de código aberto acompanhados marcados com big-data, ordenados por estrelas.

110 repositórios
  • genie@Netflix

    Serviço distribuído de orquestração de Big Data

    1.766-1Variação de estrelas nos últimos 7 dias
  • matano@matanolabs

    Data lake de segurança de código aberto para busca de ameaças, detecção e resposta, e análise de cibersegurança em escala de petabytes na AWS

    1.694+0Variação de estrelas nos últimos 7 dias
  • spark-py-notebooks@jadianes

    Tutoriais de Apache Spark e Python (pySpark) para análise de Big Data e Machine Learning em notebooks IPython / Jupyter

    1.660+0Variação de estrelas nos últimos 7 dias
  • tonbo@tonbo-io

    Tonbo é um banco de dados embarcado para runtimes serverless e edge.

    1.618+3Variação de estrelas nos últimos 7 dias
  • just-dashboard@kantord

    Dashboards usando arquivos YAML ou JSON.

    1.582+1Variação de estrelas nos últimos 7 dias
  • dremio-oss@dremio

    Dremio - o elo perdido nos dados modernos

    1.492+1Variação de estrelas nos últimos 7 dias
  • carbondata@apache

    Solução de armazenamento de dados de alto desempenho.

    1.452+0Variação de estrelas nos últimos 7 dias
  • avsc@mtth

    Avro para JavaScript :zap:

    1.384+0Variação de estrelas nos últimos 7 dias
  • Um banco de dados MPP (Massively Parallel Processing) avançado e maduro. Alternativa de código aberto ao Greenplum Database.

    1.382+5Variação de estrelas nos últimos 7 dias
  • scikit-learn-intelex@uxlfoundation

    Extensão para Scikit-learn que oferece uma maneira simples de acelerar suas aplicações Scikit-learn

    1.356+0Variação de estrelas nos últimos 7 dias
  • pyspark-tutorial@mahmoudparsian

    PySpark-Tutorial fornece algoritmos básicos usando PySpark

    1.280+0Variação de estrelas nos últimos 7 dias
  • ozone@apache

    Sistema de armazenamento distribuído, escalável e confiável, otimizado para análise de dados e cargas de trabalho de armazenamento de objetos.

    1.270+1Variação de estrelas nos últimos 7 dias
  • Aplicativo de desktop Windows simples para visualizar e consultar arquivos Apache Parquet.

    1.231+2Variação de estrelas nos últimos 7 dias
  • graphframes@graphframes

    GraphFrames é um pacote para o Apache Spark que fornece grafos baseados em DataFrame.

    1.202+0Variação de estrelas nos últimos 7 dias
  • amoro@apache

    Apache Amoro (em incubação) é um sistema de gerenciamento de Lakehouse construído sobre formatos de data lake abertos.

    1.171+0Variação de estrelas nos últimos 7 dias
  • accumulo@apache

    Apache Accumulo

    1.165+2Variação de estrelas nos últimos 7 dias
  • ClickBench@ClickHouse

    ClickBench: um benchmark para bancos de dados analíticos.

    1.094+2Variação de estrelas nos últimos 7 dias
  • awesome-data-catalogs@opendatadiscovery

    📙 Awesome Data Catalogs e plataformas de observabilidade.

    1.068+5Variação de estrelas nos últimos 7 dias
  • adam@bigdatagenomics

    ADAM é uma plataforma de análise genômica com formatos de arquivo especializados construída usando Apache Avro, Apache Spark e Apache Parquet. Licenciado sob Apache 2.

    1.059+2Variação de estrelas nos últimos 7 dias
  • MyScaleDB@myscale

    Um fork do @ClickHouse que suporta busca vetorial de alto desempenho e busca de texto completo.

    1.040+0Variação de estrelas nos últimos 7 dias
  • Operador Kubernetes para Apache Flink

    1.031+3Variação de estrelas nos últimos 7 dias
  • Repositório de recursos de carreira para Ciência de Dados, Machine Learning, Big Data e Business Analytics

    1.022+2Variação de estrelas nos últimos 7 dias
  • listenbrainz-server@metabrainz

    Servidor para o projeto ListenBrainz, incluindo o código front-end (JavaScript/React) e todos os componentes de processamento de dados utilizados pelo projeto.

    1.006+4Variação de estrelas nos últimos 7 dias
  • cudf-spark@NVIDIA

    Plugin NVIDIA cuDF para Apache Spark - acelere o Apache Spark com GPUs

    998+1Variação de estrelas nos últimos 7 dias
  • O Sparkling Water fornece funcionalidade H2O dentro do cluster Spark

    980+1Variação de estrelas nos últimos 7 dias
  • delta-sharing@delta-io

    Um protocolo aberto para compartilhamento seguro de dados

    957-1Variação de estrelas nos últimos 7 dias
  • OnlineStats.jl@joshday

    ⚡ Algoritmos de passagem única para estatísticas

    897+0Variação de estrelas nos últimos 7 dias
  • Mais um repositório com conceitos básicos, desafios técnicos e recursos sobre engenharia de dados em espanhol 🧙✨

    896+1Variação de estrelas nos últimos 7 dias
  • PGM-index@gvinciguerra

    Estrutura de dados aprendida de última geração que permite buscas rápidas, antecessores, pesquisas de intervalo e atualizações em arrays de bilhões de itens, usando ordens de magnitude menos espaço do que índices tradicionais

    873+1Variação de estrelas nos últimos 7 dias
  • ai_projects@miguelgfierro

    Projetos de IA

    868+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos