Pular para o conteúdo principal
buildradar
Sign in
Tópico · data-engineering

data-engineering

Repositórios de código aberto acompanhados marcados com data-engineering, ordenados por estrelas.

97 repositórios
  • pyjanitor@pyjanitor-devs

    APIs limpas para limpeza de dados. Implementação em Python do pacote R Janitor.

    1.498+0Variação de estrelas nos últimos 7 dias
  • data-science-on-gcp@GoogleCloudPlatform

    Código-fonte que acompanha o livro: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017

    1.429+1Variação de estrelas nos últimos 7 dias
  • odd-platform@opendatadiscovery

    Primeira plataforma de descoberta e observabilidade de dados de código aberto. Facilitamos a vida dos profissionais de dados para que possam focar no seu negócio.

    1.427+1Variação de estrelas nos últimos 7 dias
  • mlops-python-package@fmind

    Um template de pacote Python abrangente para iniciar e padronizar suas iniciativas de MLOps e pipelines de dados.

    1.416+0Variação de estrelas nos últimos 7 dias
  • Uma coleção curada de mais de 300 artigos de blogs de engenharia das principais empresas de tecnologia. Aprenda como as melhores equipes de engenharia resolvem problemas do mundo real em escala.

    1.388+8Variação de estrelas nos últimos 7 dias
  • sql-ultimate-course@DataWithBaraa

    O guia de SQL mais abrangente de um especialista do mundo real! Aprenda tudo, desde o básico até consultas avançadas, otimizações e SQL no mundo real

    1.384+7Variação de estrelas nos últimos 7 dias
  • quilt@quiltdata

    Quilt é uma plataforma de gerenciamento de dados científicos na AWS que ajuda equipes e IA a encontrar, confiar e reutilizar dados por meio de pacotes de dados profundamente versionados e ricos em contexto.

    1.370+0Variação de estrelas nos últimos 7 dias
  • duckle@slothflowlabs

    ETL/ELT open-source para implantar nos seus próprios servidores ou nuvem. Construído sobre DuckDB: pipelines visuais no-code/low-code ou SQL, 385 componentes, dbt, CDC, qualidade de dados, reverse ETL, linhagem e MCP para agentes de IA. Sem nuvem de fornecedor, sem cobrança por linha.

    1.262+15Variação de estrelas nos últimos 7 dias
  • Uma lista curada, porém incompleta, de recursos de IA centrados em dados.

    1.159+1Variação de estrelas nos últimos 7 dias
  • around-dataengineering@abhishek-ch

    Um Hub de Conhecimento de Engenharia de Dados e Machine Learning

    1.146+0Variação de estrelas nos últimos 7 dias
  • Repositório oficial do Open Data Contract Standard (ODCS).

    1.118+18Variação de estrelas nos últimos 7 dias
  • awesome-data-catalogs@opendatadiscovery

    📙 Awesome Data Catalogs e plataformas de observabilidade.

    1.068+5Variação de estrelas nos últimos 7 dias
  • datacontract-cli@datacontract

    Impor contratos de dados.

    1.060+8Variação de estrelas nos últimos 7 dias
  • flow@estuary

    🌊 Sincronize continuamente os sistemas onde seus dados residem com os sistemas onde você deseja que eles estejam, gerenciando seus fluxos de dados com o Estuary. 🌊

    972+7Variação de estrelas nos últimos 7 dias
  • FlyFish@CloudWise-OpenSource

    FlyFish é uma plataforma de código de visualização de dados. Podemos criar um modelo de dados rapidamente de forma simples e gerar rapidamente um conjunto de soluções de visualização de dados arrastando e soltando.

    961+0Variação de estrelas nos últimos 7 dias
  • Um guia abrangente para construir um data warehouse moderno com SQL Server, incluindo processos de ETL, modelagem de dados e análises.

    934+14Variação de estrelas nos últimos 7 dias
  • egeria@odpi

    Núcleo do Egeria

    921+0Variação de estrelas nos últimos 7 dias
  • Mais um repositório com conceitos básicos, desafios técnicos e recursos sobre engenharia de dados em espanhol 🧙✨

    896+1Variação de estrelas nos últimos 7 dias
  • bacalhau@bacalhau-project

    Framework orientado pela comunidade, simples, porém poderoso, para computação distribuída sobre dados de forma rápida e econômica.

    871+1Variação de estrelas nos últimos 7 dias
  • NeumAI@NeumTry

    Neum AI é um framework de primeira linha para gerenciar a criação e sincronização de embeddings vetoriais em larga escala.

    867+0Variação de estrelas nos últimos 7 dias
  • Materiais suplementares para o curso da Udemy The Complete dbt (Data Build Tool) Bootcamp

    827+0Variação de estrelas nos últimos 7 dias
  • practical-data-engineering@ssp-data

    Engenharia de Dados Prática: Um guia prático de projeto imobiliário

    823+2Variação de estrelas nos últimos 7 dias
  • koheesio@Nike-Inc

    Framework Python para construir pipelines de dados eficientes. Promove modularidade e colaboração, permitindo a criação de pipelines complexos a partir de componentes simples e reutilizáveis.

    818+0Variação de estrelas nos últimos 7 dias
  • altimate-code@AltimateAI

    Estrutura de engenharia de dados agêntica e de código aberto para dbt, SQL e data warehouses em nuvem. Mais de 100 ferramentas, 10 warehouses, com tecnologia de IA.

    808+3Variação de estrelas nos últimos 7 dias
  • datavines@datavane

    Conheça melhor seus dados! Datavines é uma plataforma de observabilidade de dados de nova geração, com suporte para gerenciamento de metadados e qualidade de dados.

    761+1Variação de estrelas nos últimos 7 dias
  • bigfunctions@unytics

    Potencialize o BigQuery com BigFunctions.

    759+0Variação de estrelas nos últimos 7 dias
  • Failed-ML@kennethleungty

    Compilação de exemplos reais de alto perfil de projetos de machine learning que falharam.

    751+0Variação de estrelas nos últimos 7 dias
  • vectorflow@dgarnitz

    VectorFlow é um pipeline de incorporação de vetores de alto volume que ingere dados brutos, os transforma em vetores e os grava em um banco de dados vetorial de sua escolha.

    703+0Variação de estrelas nos últimos 7 dias
  • DataFlow-Engine@risesoft-y9

    O Data Flow Engine é um motor impulsionado por dados de baixo nível voltado para integração, sincronização, troca e compartilhamento de dados, além de configuração e agendamento de tarefas. Ele adota arquiteturas como separação de controle e execução, múltiplas camadas de fluxo e biblioteca de plugins para lidar com problemas reais de dados, como tarefas de dados em grande escala, relatórios de alta frequência, coleta de alta frequência e compatibilidade com dados heterogêneos.

    696+0Variação de estrelas nos últimos 7 dias
  • synmetrix@synmetrix

    Synmetrix – camada semântica de código aberto pronta para produção no Cube

    626+2Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos