datalake
Repositorios de código abierto monitorizados etiquetados con datalake, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a datalake en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con datalake.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Chatea con tu base de datos o tu lago de datos (SQL, CSV, parquet). PandasAI hace que el análisis de datos sea conversacional usando LLMs y RAG.
★ 23.778+14Variación de estrellas de los últimos 7 días - #2
Repositorio oficial de Trino, el motor de consultas SQL distribuido para big data, anteriormente conocido como PrestoSQL (https://trino.io).
★ 13.194+24Variación de estrellas de los últimos 7 días - #3
El motor de consultas abierto más rápido del mundo para análisis sub-segundo dentro y fuera del data lakehouse. Con la flexibilidad de soportar casi cualquier escenario, StarRocks ofrece el mejor rendimiento de su clase para análisis multidimensionales, análisis en tiempo real y consultas ad-hoc. Un proyecto de la Linux Foundation.
★ 12.057+28Variación de estrellas de los últimos 7 días - #4
Deeplake es un entorno de ejecución de datos de IA para agentes. Proporciona Postgres sin servidor con un datalake multimodal, lo que permite la recuperación y el entrenamiento escalables.
★ 9230+3Variación de estrellas de los últimos 7 días - #5
Inserciones actualizadas (upserts), eliminaciones y procesamiento incremental en Big Data.
★ 6227+12Variación de estrellas de los últimos 7 días - #6★ 5499+8Variación de estrellas de los últimos 7 días
- #7
Dinky es una plataforma de desarrollo de datos en tiempo real basada en Apache Flink, que permite el desarrollo, despliegue y operación ágil de datos.
★ 3754+3Variación de estrellas de los últimos 7 días - #8
El catálogo de datos abiertos más potente del mundo para construir un lago de metadatos federado, geo-distribuido y de alto rendimiento.
★ 3189+3Variación de estrellas de los últimos 7 días - #9
Broker compatible con Apache Kafka® con S3, PostgreSQL, SQLite, Apache Iceberg y Delta Lake
★ 1852+2Variación de estrellas de los últimos 7 días - #10★ 1594+0Variación de estrellas de los últimos 7 días
- #11
Gestión de datos maestros escalable, resolución de identidad, resolución de entidades y deduplicación mediante ML
★ 1238+2Variación de estrellas de los últimos 7 días - #12
ClickBench: una prueba de rendimiento para bases de datos analíticas
★ 1092+4Variación de estrellas de los últimos 7 días - #13
Una guía completa para construir un almacén de datos moderno con SQL Server, incluyendo procesos ETL, modelado de datos y análisis.
★ 921+14Variación de estrellas de los últimos 7 días - #14
Lista de artículos actualizada continuamente sobre avances en Agentes de Datos. Repositorio complementario a nuestro artículo "Una encuesta sobre Agentes de Datos: ¿Paradigma emergente o exageración excesiva?"
★ 721+14Variación de estrellas de los últimos 7 días - #15
Una lista curada de herramientas de código abierto utilizadas en plataformas de análisis y en el ecosistema de ingeniería de datos
★ 600+0Variación de estrellas de los últimos 7 días - #16
Paquete dbt gratuito para crear y cargar almacenes de datos compatibles con Data Vault 2.0 (impulsado por dbt, una herramienta de ingeniería de datos de código abierto)
★ 595-1Variación de estrellas de los últimos 7 días - #17
Recopilación de recursos relacionados con Apache Hudi.
★ 556+0Variación de estrellas de los últimos 7 días