data-engineering
Repositórios de código aberto acompanhados marcados com data-engineering, ordenados por estrelas.
- #31
SQL Translator é uma ferramenta para converter consultas em linguagem natural em código SQL usando inteligência artificial. Este projeto é 100% gratuito e de código aberto.
★ 4.321+0Variação de estrelas nos últimos 7 dias - #32
pandas no AWS - Integração fácil com Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer e S3 (Parquet, CSV, JSON e EXCEL).
★ 4.119+0Variação de estrelas nos últimos 7 dias - #33
Uma lista de recursos úteis para aprender Engenharia de Dados do zero.
★ 4.009-2Variação de estrelas nos últimos 7 dias - #34★ 3.831+0Variação de estrelas nos últimos 7 dias
- #35★ 3.774+4Variação de estrelas nos últimos 7 dias
- #36
Memphis.dev é uma plataforma de streaming de dados altamente escalável e de fácil utilização
★ 3.440+0Variação de estrelas nos últimos 7 dias - #37
Aprenda a projetar, desenvolver, implantar e iterar aplicações de ML em nível de produção.
★ 3.399+2Variação de estrelas nos últimos 7 dias - #38
Substituto direto para o Apache Spark escrito em Rust, unificando processamento em lote, processamento de fluxo e cargas de trabalho de IA intensivas em computação.
★ 3.341+4Variação de estrelas nos últimos 7 dias - #39
Uma lista incrível de projetos de engenharia de dados de código aberto.
★ 3.278+5Variação de estrelas nos últimos 7 dias - #40
Apache DevLake é uma plataforma de dados de desenvolvimento de código aberto para ingerir, analisar e visualizar dados fragmentados de ferramentas de DevOps, extraindo insights para excelência em engenharia, experiência do desenvolvedor e crescimento da comunidade.
★ 3.121+5Variação de estrelas nos últimos 7 dias - #41
Aprenda a construir seu assistente de IA 'Second Brain' com LLMs, agentes, RAG, fine-tuning, LLMOps e técnicas de sistemas de IA.
★ 3.068+9Variação de estrelas nos últimos 7 dias - #42
Meltano: o motor de integração de dados declarativo e code-first que impulsiona suas ideias mais ousadas de produtos baseados em dados e ML. Diga adeus à escrita, manutenção e escalonamento de suas próprias integrações de API.
★ 2.616+2Variação de estrelas nos últimos 7 dias - #43
O Apache Hamilton ajuda cientistas de dados e engenheiros a definir fluxos de dados testáveis, modulares e auto-documentados, que codificam linhagem/rastreamento e metadados. Executa e escala em qualquer lugar onde o Python execute.
★ 2.584+1Variação de estrelas nos últimos 7 dias - #44
Um novo SOTA para RAG — uma arquitetura de recuperação original e uma base de conhecimento open source para humanos e agentes.
★ 2.456+20Variação de estrelas nos últimos 7 dias - #45
Um serviço de classificação personalizada de Machine Learning low-code para artigos, listagens, resultados de pesquisa e recomendações que aumenta o engajamento do usuário. Um motor de Learn-to-Rank amigável.
★ 2.434+0Variação de estrelas nos últimos 7 dias - #46★ 2.420-1Variação de estrelas nos últimos 7 dias
- #47★ 2.303+1Variação de estrelas nos últimos 7 dias
- #48★ 2.048+1Variação de estrelas nos últimos 7 dias
- #49
O melhor lugar para aprender engenharia de dados. Criado e mantido pela comunidade de engenharia de dados.
★ 2.021+3Variação de estrelas nos últimos 7 dias - #50
Feathr – Uma plataforma escalável e unificada de engenharia de dados e IA para empresas.
★ 1.937+0Variação de estrelas nos últimos 7 dias - #51
Uma lista curada de recursos incríveis sobre dbt
★ 1.722+1Variação de estrelas nos últimos 7 dias - #52
Mais de 2000 perguntas de entrevista para engenheiros de dados.
★ 1.721+5Variação de estrelas nos últimos 7 dias - #53
MLRun é uma plataforma MLOps de código aberto para construir e gerenciar rapidamente aplicações de ML contínuas ao longo de seu ciclo de vida. O MLRun integra-se ao seu ambiente de desenvolvimento e CI/CD, automatizando a entrega de dados de produção, pipelines de ML e aplicações online.
★ 1.694+1Variação de estrelas nos últimos 7 dias - #54
🔥🔥🔥 Reverse ETL open source - alternativa ao hightouch e census.
★ 1.673+0Variação de estrelas nos últimos 7 dias - #55
Uma lista abrangente de mais de 180 canais do YouTube sobre Ciência de Dados, Engenharia de Dados, Aprendizado de Máquina, Aprendizado Profundo, Ciência da Computação, programação, engenharia de software, etc.
★ 1.624+1Variação de estrelas nos últimos 7 dias - #56
nao é um agente de análise de código aberto. (1) Crie contexto com a CLI nao-core, (2) implante a interface de chat nao para todos.
★ 1.600+9Variação de estrelas nos últimos 7 dias - #57
Dashboards usando arquivos YAML ou JSON.
★ 1.582+1Variação de estrelas nos últimos 7 dias - #58
ktx é uma camada de contexto executável para agentes de dados e análise 🐙 Permite que Claude Code, Codex ou outros agentes de IA consultem bancos de dados analíticos com precisão e contexto completo da sua empresa
★ 1.571+5Variação de estrelas nos últimos 7 dias - #59
DataFrames de streaming em Python para Kafka
★ 1.569+1Variação de estrelas nos últimos 7 dias - #60★ 1.517-1Variação de estrelas nos últimos 7 dias