Pular para o conteúdo principal
buildradar
Sign in
Tópico · data-pipeline

data-pipeline

Repositórios de código aberto acompanhados marcados com data-pipeline, ordenados por estrelas.

Repositórios
33
Total de estrelas
135.349
Média de estrelas
4.101
Participação
0,01%

Tópicos que aparecem com frequência ao lado de data-pipeline no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com data-pipeline.

  • hflow@Hebbian-Robotics

    Open source SDK for building multimodal data-quality, processing, enrichment, and curation pipelines for robotics and Physical AI.

    143
  • airbyte@airbytehq

    Movimentação de dados de código aberto para pipelines ELT e agentes de IA — de APIs, bancos de dados e arquivos para warehouses, lakes e aplicações de IA. Tanto auto-hospedado quanto em nuvem.

    21.981+9Variação de estrelas nos últimos 7 dias
  • Capacitando a inteligência de dados com SQL distribuído para fragmentação, escalabilidade e segurança em todos os bancos de dados.

    20.788-3Variação de estrelas nos últimos 7 dias
  • debezium@debezium

    Captura de dados alterados (CDC) para diversos bancos de dados. Por favor, registre problemas em https://github.com/debezium/dbz/issues.

    13.072+16Variação de estrelas nos últimos 7 dias
  • rocketride-server@rocketride-org

    Motor de pipeline de IA de alto desempenho com núcleo em C++ e mais de 50 nós extensíveis em Python. Construa, depure e dimensione fluxos de trabalho de LLM com mais de 13 provedores de modelos, mais de 8 bancos de dados vetoriais e orquestração de agentes, tudo a partir da sua IDE. Inclui extensão para VS Code, SDKs em TypeScript/Python e implantação via Docker.

    7.641+270Variação de estrelas nos últimos 7 dias
  • snowplow@snowplow

    Líder em infraestrutura de dados de clientes.

    7.032+2Variação de estrelas nos últimos 7 dias
  • data-juicer@datajuicer

    Processamento de dados para e com modelos de fundação! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6.975+26Variação de estrelas nos últimos 7 dias
  • flink-cdc@apache

    Flink CDC é uma ferramenta de integração de dados em streaming

    6.469+0Variação de estrelas nos últimos 7 dias
  • whodb@clidey

    Onde o acesso a dados encontra a inteligência operacional.

    5.019+2Variação de estrelas nos últimos 7 dias
  • rudder-server@rudderlabs

    Alternativa ao Segment focada em privacidade e segurança, escrita em Golang e React

    4.483+4Variação de estrelas nos últimos 7 dias
  • Uma lista de recursos úteis para aprender Engenharia de Dados do zero.

    4.009-2Variação de estrelas nos últimos 7 dias
  • ingestr@bruin-data

    ingestr é uma ferramenta CLI para copiar dados entre quaisquer bancos de dados com um único comando de forma integrada.

    3.935+18Variação de estrelas nos últimos 7 dias
  • dagu@dagucloud

    Orquestrador de fluxo de trabalho auto-hospedável para equipes cujo foco principal não é a orquestração. YAML declarativo sobre seus scripts, comandos SSH, containers, etc.; mantém fluxos de trabalho separados da lógica de negócios. Um binário, sem banco de dados, roda em recursos de hardware limitados. Alternativa ao Airflow / Cron / Agendador de Tarefas.

    3.832+17Variação de estrelas nos últimos 7 dias
  • memphis@superstreamlabs

    Memphis.dev é uma plataforma de streaming de dados altamente escalável e de fácil utilização

    3.440+0Variação de estrelas nos últimos 7 dias
  • sie@superlinked

    Servidor de inferência open-source e cluster de produção para todos os modelos que seu agente precisa.

    3.030+173Variação de estrelas nos últimos 7 dias
  • whylogs@whylabs

    Uma biblioteca de registro de dados de código aberto para modelos de machine learning e pipelines de dados. 📚 Fornece visibilidade sobre a qualidade dos dados e o desempenho do modelo ao longo do tempo. 🛡️ Suporta coleta de dados com preservação de privacidade, garantindo segurança e robustez. 📈

    2.831+0Variação de estrelas nos últimos 7 dias
  • elementary@elementary-data

    Solução de observabilidade de dados nativa do dbt para engenheiros de dados e análise. Monitore seus pipelines de dados em minutos. Disponível como serviço self-hosted ou em nuvem com recursos premium.

    2.405+4Variação de estrelas nos últimos 7 dias
  • Uma biblioteca leve de processamento de fluxo para Go

    2.172+1Variação de estrelas nos últimos 7 dias
  • doit@pydoit

    Ferramenta de linha de comando para gerenciamento de tarefas e automação

    2.083-1Variação de estrelas nos últimos 7 dias
  • multiwoven@Multiwoven

    🔥🔥🔥 Reverse ETL open source - alternativa ao hightouch e census.

    1.673+0Variação de estrelas nos últimos 7 dias
  • olake@datazip-inc

    OLake - Replicação mais rápida de bancos de dados, Kafka e S3 para Apache Iceberg com otimização de tabelas (chamada OLake Fusion). Ingestão de dados eficiente, rápida e escalável para análise em tempo real. Fontes suportadas: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.

    1.435+2Variação de estrelas nos últimos 7 dias
  • data-science-on-gcp@GoogleCloudPlatform

    Código-fonte que acompanha o livro: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017

    1.429+1Variação de estrelas nos últimos 7 dias
  • duckle@slothflowlabs

    ETL/ELT open-source para implantar nos seus próprios servidores ou nuvem. Construído sobre DuckDB: pipelines visuais no-code/low-code ou SQL, 385 componentes, dbt, CDC, qualidade de dados, reverse ETL, linhagem e MCP para agentes de IA. Sem nuvem de fornecedor, sem cobrança por linha.

    1.262+15Variação de estrelas nos últimos 7 dias
  • zerocode@authorjapps

    zerocode-tdd é uma estrutura de testes automatizados de código aberto, orientada a resultados, para pipelines de dados, ETL, REST API, Kafka, bancos de dados e cenários de carga, tudo definido em JSON ou YAML simples — sem necessidade de codificação.

    1.013+1Variação de estrelas nos últimos 7 dias
  • flow@estuary

    🌊 Sincronize continuamente os sistemas onde seus dados residem com os sistemas onde você deseja que eles estejam, gerenciando seus fluxos de dados com o Estuary. 🌊

    972+7Variação de estrelas nos últimos 7 dias
  • seatunnel-web@apache

    O SeaTunnel é uma plataforma de integração de dados distribuída de alto desempenho para sincronização e transformação de dados massivos (offline e tempo real).

    877+5Variação de estrelas nos últimos 7 dias
  • klio@spotify

    Pipelines de dados mais inteligentes para áudio.

    876+2Variação de estrelas nos últimos 7 dias
  • covalent@AgnostiqHQ

    Ferramenta pythonica para orquestrar fluxos de trabalho de aprendizado de máquina, alto desempenho e computação quântica em ambientes de computação heterogêneos.

    869+0Variação de estrelas nos últimos 7 dias
  • practical-data-engineering@ssp-data

    Engenharia de Dados Prática: Um guia prático de projeto imobiliário

    823+2Variação de estrelas nos últimos 7 dias
  • conduit@ConduitIO

    O Conduit transmite dados entre armazenamentos de dados. Um substituto para o Kafka Connect. Não requer JVM.

    608+0Variação de estrelas nos últimos 7 dias
  • Uma lista curada de ferramentas de código aberto usadas em plataformas de análise e no ecossistema de engenharia de dados

    604+3Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos