data-pipeline
Repositórios de código aberto acompanhados marcados com data-pipeline, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de data-pipeline no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com data-pipeline.
- #1
Movimentação de dados de código aberto para pipelines ELT e agentes de IA — de APIs, bancos de dados e arquivos para warehouses, lakes e aplicações de IA. Tanto auto-hospedado quanto em nuvem.
★ 21.981+9Variação de estrelas nos últimos 7 dias - #2
Capacitando a inteligência de dados com SQL distribuído para fragmentação, escalabilidade e segurança em todos os bancos de dados.
★ 20.788-3Variação de estrelas nos últimos 7 dias - #3
Captura de dados alterados (CDC) para diversos bancos de dados. Por favor, registre problemas em https://github.com/debezium/dbz/issues.
★ 13.072+16Variação de estrelas nos últimos 7 dias - #4
Motor de pipeline de IA de alto desempenho com núcleo em C++ e mais de 50 nós extensíveis em Python. Construa, depure e dimensione fluxos de trabalho de LLM com mais de 13 provedores de modelos, mais de 8 bancos de dados vetoriais e orquestração de agentes, tudo a partir da sua IDE. Inclui extensão para VS Code, SDKs em TypeScript/Python e implantação via Docker.
★ 7.641+270Variação de estrelas nos últimos 7 dias - #5★ 7.032+2Variação de estrelas nos últimos 7 dias
- #6
Processamento de dados para e com modelos de fundação! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6.975+26Variação de estrelas nos últimos 7 dias - #7★ 6.469+0Variação de estrelas nos últimos 7 dias
- #8★ 5.019+2Variação de estrelas nos últimos 7 dias
- #9
Alternativa ao Segment focada em privacidade e segurança, escrita em Golang e React
★ 4.483+4Variação de estrelas nos últimos 7 dias - #10
Uma lista de recursos úteis para aprender Engenharia de Dados do zero.
★ 4.009-2Variação de estrelas nos últimos 7 dias - #11
ingestr é uma ferramenta CLI para copiar dados entre quaisquer bancos de dados com um único comando de forma integrada.
★ 3.935+18Variação de estrelas nos últimos 7 dias - #12
Orquestrador de fluxo de trabalho auto-hospedável para equipes cujo foco principal não é a orquestração. YAML declarativo sobre seus scripts, comandos SSH, containers, etc.; mantém fluxos de trabalho separados da lógica de negócios. Um binário, sem banco de dados, roda em recursos de hardware limitados. Alternativa ao Airflow / Cron / Agendador de Tarefas.
★ 3.832+17Variação de estrelas nos últimos 7 dias - #13
Memphis.dev é uma plataforma de streaming de dados altamente escalável e de fácil utilização
★ 3.440+0Variação de estrelas nos últimos 7 dias - #14
Servidor de inferência open-source e cluster de produção para todos os modelos que seu agente precisa.
★ 3.030+173Variação de estrelas nos últimos 7 dias - #15
Uma biblioteca de registro de dados de código aberto para modelos de machine learning e pipelines de dados. 📚 Fornece visibilidade sobre a qualidade dos dados e o desempenho do modelo ao longo do tempo. 🛡️ Suporta coleta de dados com preservação de privacidade, garantindo segurança e robustez. 📈
★ 2.831+0Variação de estrelas nos últimos 7 dias - #16
Solução de observabilidade de dados nativa do dbt para engenheiros de dados e análise. Monitore seus pipelines de dados em minutos. Disponível como serviço self-hosted ou em nuvem com recursos premium.
★ 2.405+4Variação de estrelas nos últimos 7 dias - #17
Uma biblioteca leve de processamento de fluxo para Go
★ 2.172+1Variação de estrelas nos últimos 7 dias - #18★ 2.083-1Variação de estrelas nos últimos 7 dias
- #19
🔥🔥🔥 Reverse ETL open source - alternativa ao hightouch e census.
★ 1.673+0Variação de estrelas nos últimos 7 dias - #20
OLake - Replicação mais rápida de bancos de dados, Kafka e S3 para Apache Iceberg com otimização de tabelas (chamada OLake Fusion). Ingestão de dados eficiente, rápida e escalável para análise em tempo real. Fontes suportadas: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1.435+2Variação de estrelas nos últimos 7 dias - #21
Código-fonte que acompanha o livro: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1.429+1Variação de estrelas nos últimos 7 dias - #22
ETL/ELT open-source para implantar nos seus próprios servidores ou nuvem. Construído sobre DuckDB: pipelines visuais no-code/low-code ou SQL, 385 componentes, dbt, CDC, qualidade de dados, reverse ETL, linhagem e MCP para agentes de IA. Sem nuvem de fornecedor, sem cobrança por linha.
★ 1.262+15Variação de estrelas nos últimos 7 dias - #23
zerocode-tdd é uma estrutura de testes automatizados de código aberto, orientada a resultados, para pipelines de dados, ETL, REST API, Kafka, bancos de dados e cenários de carga, tudo definido em JSON ou YAML simples — sem necessidade de codificação.
★ 1.013+1Variação de estrelas nos últimos 7 dias - #24
🌊 Sincronize continuamente os sistemas onde seus dados residem com os sistemas onde você deseja que eles estejam, gerenciando seus fluxos de dados com o Estuary. 🌊
★ 972+7Variação de estrelas nos últimos 7 dias - #25
O SeaTunnel é uma plataforma de integração de dados distribuída de alto desempenho para sincronização e transformação de dados massivos (offline e tempo real).
★ 877+5Variação de estrelas nos últimos 7 dias - #26★ 876+2Variação de estrelas nos últimos 7 dias
- #27
Ferramenta pythonica para orquestrar fluxos de trabalho de aprendizado de máquina, alto desempenho e computação quântica em ambientes de computação heterogêneos.
★ 869+0Variação de estrelas nos últimos 7 dias - #28
Engenharia de Dados Prática: Um guia prático de projeto imobiliário
★ 823+2Variação de estrelas nos últimos 7 dias - #29
O Conduit transmite dados entre armazenamentos de dados. Um substituto para o Kafka Connect. Não requer JVM.
★ 608+0Variação de estrelas nos últimos 7 dias - #30
Uma lista curada de ferramentas de código aberto usadas em plataformas de análise e no ecossistema de engenharia de dados
★ 604+3Variação de estrelas nos últimos 7 dias