bigdata
Repositorios de código abierto monitorizados etiquetados con bigdata, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a bigdata en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con bigdata.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Este es un repositorio con enlaces a todo lo que desearías aprender sobre ingeniería de datos
★ 43.905+88Variación de estrellas de los últimos 7 días - #2
🚀 2.3 veces más rápido que MinIO para cargas útiles de objetos de 4KB. RustFS es un sistema de almacenamiento de objetos de alto rendimiento, de código abierto y compatible con S3, que admite la migración y la coexistencia con otras plataformas compatibles con S3 como MinIO y Ceph.
★ 31.528+238Variación de estrellas de los últimos 7 días - #3
Base de datos de series temporales de alto rendimiento y escalable diseñada para escenarios de IoT industrial (IIoT)
★ 25.093+15Variación de estrellas de los últimos 7 días - #4
Potenciando la inteligencia de datos con SQL distribuido para fragmentación, escalabilidad y seguridad en todas las bases de datos.
★ 20.791+10Variación de estrellas de los últimos 7 días - #5
Guía de introducción a Big Data :star:
★ 16.958+6Variación de estrellas de los últimos 7 días - #6
Una lista curada de impresionantes frameworks de big data, recursos y otras maravillas.
★ 14.601+63Variación de estrellas de los últimos 7 días - #7★ 14.371+19Variación de estrellas de los últimos 7 días
- #8
Data Agent Ready Warehouse: Uno para análisis, búsqueda, IA y entorno aislado de Python. Reconstruido desde cero. Arquitectura unificada en tu S3.
★ 9426+3Variación de estrellas de los últimos 7 días - #9
DataFrame híbrido fuera de núcleo (out-of-core) de Apache Arrow/NumPy para Python, aprendizaje automático, visualización y exploración de grandes datos tabulares a mil millones de filas por segundo 🚀
★ 8509+1Variación de estrellas de los últimos 7 días - #10
Inserciones actualizadas (upserts), eliminaciones y procesamiento incremental en Big Data.
★ 6227+12Variación de estrellas de los últimos 7 días - #11★ 5907+30Variación de estrellas de los últimos 7 días
- #12
Más de 100 plantillas HTML5 de visualización de grandes datos; incluye industrias como comunidad, bienes raíces, gobierno, transporte, finanzas y banca, siendo las más nuevas, numerosas, completas y llamativas de la web. Actualizaciones en curso.
★ 5298+21Variación de estrellas de los últimos 7 días - #13★ 4100+1Variación de estrellas de los últimos 7 días
- #14
🔨 Genera sentencias SQL estructuradas usando JSON, implementado con Vue3 + TypeScript + Vite + Ant Design + MonacoEditor. El proyecto es simple (enfocado en la lógica más que en la interfaz), ideal para practicar.
★ 3424-3Variación de estrellas de los últimos 7 días - #15★ 3301+3Variación de estrellas de los últimos 7 días
- #16
Aprendizaje de Big Data, aprenda Big Data desde cero, incluyendo videos de aprendizaje de varias etapas de Big Data y materiales de entrevistas
★ 3219+9Variación de estrellas de los últimos 7 días - #17
GridDB es una base de datos de código abierto de próxima generación que hace que las series temporales de IoT y Big Data sean rápidas y sencillas.
★ 2475+0Variación de estrellas de los últimos 7 días - #18
Aix-DB se basa en los frameworks LangChain/LangGraph, combinados con la arquitectura de colaboración multiagente MCP Skills, para lograr la conversión de extremo a extremo de lenguaje natural a información de datos.
★ 2237+10Variación de estrellas de los últimos 7 días - #19
.NET for Apache® Spark™ hace que Apache Spark™ sea fácilmente accesible para los desarrolladores de .NET.
★ 2097+0Variación de estrellas de los últimos 7 días - #20
Extensión de SQL en tiempo real basada en Apache Flink de código abierto; implementa principalmente la unión (join) entre streams y tablas de dimensiones, compatible con toda la sintaxis de Flink SQL nativo.
★ 2051+0Variación de estrellas de los últimos 7 días - #21
Byzer (anteriormente MLSQL): Un lenguaje de programación de código abierto de bajo código para pipelines de datos, analítica e IA.
★ 1835-1Variación de estrellas de los últimos 7 días - #22
Repositorio de conocimientos de Big Data que abarca el modelado de almacenes de datos, computación en tiempo real, Big Data, centros de datos (data mid-end), diseño de sistemas, Java, algoritmos, etc.
★ 1808+3Variación de estrellas de los últimos 7 días - #23★ 1767+0Variación de estrellas de los últimos 7 días
- #24
Rastreador web de imágenes multiproceso para Google y Naver (Selenium)
★ 1691-1Variación de estrellas de los últimos 7 días - #25
Tutoriales de Apache Spark y Python (pySpark) para análisis de Big Data y Machine Learning en formato de notebooks de IPython / Jupyter.
★ 1660+1Variación de estrellas de los últimos 7 días - #26
:truck: Flujos de trabajo de preparación de datos ágiles facilitados con Pandas, Dask, cuDF, Dask-cuDF, Vaex y PySpark
★ 1536+0Variación de estrellas de los últimos 7 días - #27
La primera plataforma de descubrimiento y observabilidad de datos de código abierto. Facilitamos la vida a los profesionales de datos para que puedas centrarte en tu negocio.
★ 1426+2Variación de estrellas de los últimos 7 días - #28
Apache Celeborn es un servicio elástico y de alto rendimiento para datos de shuffle y desbordamiento.
★ 1061-1Variación de estrellas de los últimos 7 días - #29★ 979+0Variación de estrellas de los últimos 7 días
- #30
Apache Livy es una interfaz REST de código abierto para interactuar con Apache Spark desde cualquier lugar.
★ 960+0Variación de estrellas de los últimos 7 días