Saltar al contenido principal
buildradar
Sign in
Tema · data-engineering

data-engineering

Repositorios de código abierto monitorizados etiquetados con data-engineering, ordenados por estrellas.

97 repositorios
  • pyjanitor@pyjanitor-devs

    APIs limpias para la limpieza de datos. Implementación en Python del paquete de R Janitor

    1498+0Variación de estrellas de los últimos 7 días
  • data-science-on-gcp@GoogleCloudPlatform

    Código fuente que acompaña al libro: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017.

    1429+1Variación de estrellas de los últimos 7 días
  • odd-platform@opendatadiscovery

    La primera plataforma de descubrimiento y observabilidad de datos de código abierto. Facilitamos la vida a los profesionales de datos para que puedas centrarte en tu negocio.

    1427+1Variación de estrellas de los últimos 7 días
  • mlops-python-package@fmind

    Una plantilla completa de paquetes de Python para iniciar y estandarizar tus iniciativas de MLOps y pipelines de datos.

    1416+0Variación de estrellas de los últimos 7 días
  • Una colección curada de más de 300 artículos de blogs de ingeniería de empresas tecnológicas líderes. Aprenda cómo los mejores equipos de ingeniería resuelven problemas del mundo real a escala.

    1388+8Variación de estrellas de los últimos 7 días
  • sql-ultimate-course@DataWithBaraa

    ¡La guía de SQL más completa de un experto del mundo real! Aprenda todo, desde conceptos básicos hasta consultas avanzadas, optimizaciones y SQL en el mundo real

    1384+7Variación de estrellas de los últimos 7 días
  • quilt@quiltdata

    Quilt es una plataforma de gestión de datos científicos en AWS que ayuda a los equipos y a la IA a encontrar, confiar y reutilizar datos a través de paquetes de datos con versiones profundas y ricos en contexto.

    1370+0Variación de estrellas de los últimos 7 días
  • duckle@slothflowlabs

    ETL/ELT de código abierto para desplegar en servidores propios o en la nube. Construido sobre DuckDB: pipelines visuales sin código/bajo código o SQL, 385 componentes, dbt, CDC, calidad de datos, ETL inverso, linaje y MCP para agentes de IA. Sin nube de proveedores ni facturación por fila.

    1262+15Variación de estrellas de los últimos 7 días
  • Una lista curada, aunque incompleta, de recursos de IA centrados en datos.

    1159+1Variación de estrellas de los últimos 7 días
  • around-dataengineering@abhishek-ch

    Un centro de conocimiento sobre ingeniería de datos y aprendizaje automático

    1146+0Variación de estrellas de los últimos 7 días
  • Hogar del Estándar de Contrato de Datos Abiertos (ODCS).

    1118+18Variación de estrellas de los últimos 7 días
  • awesome-data-catalogs@opendatadiscovery

    📙 Lista de catálogos de datos y plataformas de observabilidad destacados.

    1068+5Variación de estrellas de los últimos 7 días
  • datacontract-cli@datacontract

    Aplicación de contratos de datos

    1058+8Variación de estrellas de los últimos 7 días
  • flow@estuary

    🌊 Sincroniza continuamente los sistemas donde residen tus datos con los sistemas donde _quieres_ que residan, gestionando tus flujos de datos con Estuary. 🌊

    972+7Variación de estrellas de los últimos 7 días
  • FlyFish@CloudWise-OpenSource

    FlyFish es una plataforma de codificación para visualización de datos. Permite crear modelos de datos rápidamente de forma sencilla y generar soluciones de visualización mediante arrastrar y soltar.

    961+0Variación de estrellas de los últimos 7 días
  • Una guía completa para construir un almacén de datos moderno con SQL Server, incluyendo procesos ETL, modelado de datos y análisis.

    932+14Variación de estrellas de los últimos 7 días
  • egeria@odpi

    Núcleo de Egeria

    921+0Variación de estrellas de los últimos 7 días
  • Un repositorio más con conceptos básicos, desafíos técnicos y recursos sobre ingeniería de datos en español 🧙✨

    896+1Variación de estrellas de los últimos 7 días
  • bacalhau@bacalhau-project

    Framework impulsado por la comunidad, simple pero potente, para computación distribuida sobre datos de forma rápida y rentable.

    871+1Variación de estrellas de los últimos 7 días
  • NeumAI@NeumTry

    Neum AI es un framework de primera clase para gestionar la creación y sincronización de incrustaciones vectoriales a gran escala.

    867+0Variación de estrellas de los últimos 7 días
  • Material complementario para el curso de Udemy The Complete dbt (Data Build Tool) Bootcamp.

    827+0Variación de estrellas de los últimos 7 días
  • practical-data-engineering@ssp-data

    Ingeniería de datos práctica: una guía de proyectos prácticos sobre bienes raíces

    823+2Variación de estrellas de los últimos 7 días
  • koheesio@Nike-Inc

    Framework de Python para construir pipelines de datos eficientes. Promueve la modularidad y la colaboración, permitiendo la creación de pipelines complejos a partir de componentes simples y reutilizables.

    818+0Variación de estrellas de los últimos 7 días
  • altimate-code@AltimateAI

    Plataforma de ingeniería de datos basada en agentes de código abierto para dbt, SQL y almacenes de datos en la nube. Más de 100 herramientas, 10 almacenes y potenciado por IA.

    805+3Variación de estrellas de los últimos 7 días
  • datavines@datavane

    Conozca mejor sus datos. Datavines es una plataforma de observabilidad de datos de próxima generación que admite la gestión de metadatos y la calidad de los datos.

    761+1Variación de estrellas de los últimos 7 días
  • bigfunctions@unytics

    Potencia BigQuery con BigFunctions.

    759+0Variación de estrellas de los últimos 7 días
  • Failed-ML@kennethleungty

    Compilación de ejemplos reales y destacados de proyectos de machine learning fallidos

    751+0Variación de estrellas de los últimos 7 días
  • vectorflow@dgarnitz

    VectorFlow es un pipeline de embedding vectorial de alto volumen que ingiere datos sin procesar, los transforma en vectores y los escribe en la base de datos vectorial de tu elección.

    703+0Variación de estrellas de los últimos 7 días
  • DataFlow-Engine@risesoft-y9

    El motor de flujo de datos es un motor subyacente impulsado por datos orientado a la integración, sincronización, intercambio y compartición de datos, así como a la configuración y programación de tareas. Adopta una arquitectura de separación de control y ejecución, múltiples capas de flujo y bibliotecas de complementos para abordar problemas reales de tareas de datos a gran escala, informes y recopilación de datos de alta frecuencia, y compatibilidad con datos heterogéneos.

    696+0Variación de estrellas de los últimos 7 días
  • synmetrix@synmetrix

    Synmetrix: una capa semántica de código abierto lista para producción basada en Cube.

    626+2Variación de estrellas de los últimos 7 días
← Volver a temas