data-engineering
Repositorios de código abierto monitorizados etiquetados con data-engineering, ordenados por estrellas.
- #61
APIs limpias para la limpieza de datos. Implementación en Python del paquete de R Janitor
★ 1498+0Variación de estrellas de los últimos 7 días - #62
Código fuente que acompaña al libro: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017.
★ 1429+1Variación de estrellas de los últimos 7 días - #63
La primera plataforma de descubrimiento y observabilidad de datos de código abierto. Facilitamos la vida a los profesionales de datos para que puedas centrarte en tu negocio.
★ 1427+1Variación de estrellas de los últimos 7 días - #64
Una plantilla completa de paquetes de Python para iniciar y estandarizar tus iniciativas de MLOps y pipelines de datos.
★ 1416+0Variación de estrellas de los últimos 7 días - #65
Una colección curada de más de 300 artículos de blogs de ingeniería de empresas tecnológicas líderes. Aprenda cómo los mejores equipos de ingeniería resuelven problemas del mundo real a escala.
★ 1388+8Variación de estrellas de los últimos 7 días - #66
¡La guía de SQL más completa de un experto del mundo real! Aprenda todo, desde conceptos básicos hasta consultas avanzadas, optimizaciones y SQL en el mundo real
★ 1384+7Variación de estrellas de los últimos 7 días - #67
Quilt es una plataforma de gestión de datos científicos en AWS que ayuda a los equipos y a la IA a encontrar, confiar y reutilizar datos a través de paquetes de datos con versiones profundas y ricos en contexto.
★ 1370+0Variación de estrellas de los últimos 7 días - #68
ETL/ELT de código abierto para desplegar en servidores propios o en la nube. Construido sobre DuckDB: pipelines visuales sin código/bajo código o SQL, 385 componentes, dbt, CDC, calidad de datos, ETL inverso, linaje y MCP para agentes de IA. Sin nube de proveedores ni facturación por fila.
★ 1262+15Variación de estrellas de los últimos 7 días - #69
Una lista curada, aunque incompleta, de recursos de IA centrados en datos.
★ 1159+1Variación de estrellas de los últimos 7 días - #70
Un centro de conocimiento sobre ingeniería de datos y aprendizaje automático
★ 1146+0Variación de estrellas de los últimos 7 días - #71
Hogar del Estándar de Contrato de Datos Abiertos (ODCS).
★ 1118+18Variación de estrellas de los últimos 7 días - #72
📙 Lista de catálogos de datos y plataformas de observabilidad destacados.
★ 1068+5Variación de estrellas de los últimos 7 días - #73
Aplicación de contratos de datos
★ 1058+8Variación de estrellas de los últimos 7 días - #74
🌊 Sincroniza continuamente los sistemas donde residen tus datos con los sistemas donde _quieres_ que residan, gestionando tus flujos de datos con Estuary. 🌊
★ 972+7Variación de estrellas de los últimos 7 días - #75
FlyFish es una plataforma de codificación para visualización de datos. Permite crear modelos de datos rápidamente de forma sencilla y generar soluciones de visualización mediante arrastrar y soltar.
★ 961+0Variación de estrellas de los últimos 7 días - #76
Una guía completa para construir un almacén de datos moderno con SQL Server, incluyendo procesos ETL, modelado de datos y análisis.
★ 932+14Variación de estrellas de los últimos 7 días - #77★ 921+0Variación de estrellas de los últimos 7 días
- #78
Un repositorio más con conceptos básicos, desafíos técnicos y recursos sobre ingeniería de datos en español 🧙✨
★ 896+1Variación de estrellas de los últimos 7 días - #79
Framework impulsado por la comunidad, simple pero potente, para computación distribuida sobre datos de forma rápida y rentable.
★ 871+1Variación de estrellas de los últimos 7 días - #80
Neum AI es un framework de primera clase para gestionar la creación y sincronización de incrustaciones vectoriales a gran escala.
★ 867+0Variación de estrellas de los últimos 7 días - #81
Material complementario para el curso de Udemy The Complete dbt (Data Build Tool) Bootcamp.
★ 827+0Variación de estrellas de los últimos 7 días - #82
Ingeniería de datos práctica: una guía de proyectos prácticos sobre bienes raíces
★ 823+2Variación de estrellas de los últimos 7 días - #83
Framework de Python para construir pipelines de datos eficientes. Promueve la modularidad y la colaboración, permitiendo la creación de pipelines complejos a partir de componentes simples y reutilizables.
★ 818+0Variación de estrellas de los últimos 7 días - #84
Plataforma de ingeniería de datos basada en agentes de código abierto para dbt, SQL y almacenes de datos en la nube. Más de 100 herramientas, 10 almacenes y potenciado por IA.
★ 805+3Variación de estrellas de los últimos 7 días - #85
Conozca mejor sus datos. Datavines es una plataforma de observabilidad de datos de próxima generación que admite la gestión de metadatos y la calidad de los datos.
★ 761+1Variación de estrellas de los últimos 7 días - #86
Potencia BigQuery con BigFunctions.
★ 759+0Variación de estrellas de los últimos 7 días - #87
Compilación de ejemplos reales y destacados de proyectos de machine learning fallidos
★ 751+0Variación de estrellas de los últimos 7 días - #88
VectorFlow es un pipeline de embedding vectorial de alto volumen que ingiere datos sin procesar, los transforma en vectores y los escribe en la base de datos vectorial de tu elección.
★ 703+0Variación de estrellas de los últimos 7 días - #89
El motor de flujo de datos es un motor subyacente impulsado por datos orientado a la integración, sincronización, intercambio y compartición de datos, así como a la configuración y programación de tareas. Adopta una arquitectura de separación de control y ejecución, múltiples capas de flujo y bibliotecas de complementos para abordar problemas reales de tareas de datos a gran escala, informes y recopilación de datos de alta frecuencia, y compatibilidad con datos heterogéneos.
★ 696+0Variación de estrellas de los últimos 7 días - #90
Synmetrix: una capa semántica de código abierto lista para producción basada en Cube.
★ 626+2Variación de estrellas de los últimos 7 días