big-data
Repositorios de código abierto monitorizados etiquetados con big-data, ordenados por estrellas.
- #61★ 1766-1Variación de estrellas de los últimos 7 días
- #62
Data lake de seguridad de código abierto para búsqueda de amenazas, detección, respuesta y análisis de ciberseguridad a escala de petabytes en AWS.
★ 1694+0Variación de estrellas de los últimos 7 días - #63
Tutoriales de Apache Spark y Python (pySpark) para análisis de Big Data y Machine Learning en formato de notebooks de IPython / Jupyter.
★ 1660+1Variación de estrellas de los últimos 7 días - #64★ 1618+3Variación de estrellas de los últimos 7 días
- #65
:bar_chart: :clipboard: Paneles de control usando archivos YAML o JSON
★ 1582+1Variación de estrellas de los últimos 7 días - #66
Dremio: el eslabón perdido en los datos modernos.
★ 1492+1Variación de estrellas de los últimos 7 días - #67
Solución de almacenamiento de datos de alto rendimiento
★ 1452+0Variación de estrellas de los últimos 7 días - #68★ 1384+0Variación de estrellas de los últimos 7 días
- #69
Una base de datos MPP (procesamiento masivamente paralelo) avanzada y madura de código abierto. Alternativa de código abierto a Greenplum Database.
★ 1382+8Variación de estrellas de los últimos 7 días - #70
Extensión para Scikit-learn que ofrece una forma sencilla de acelerar tus aplicaciones de Scikit-learn
★ 1356+0Variación de estrellas de los últimos 7 días - #71
PySpark-Tutorial ofrece algoritmos básicos utilizando PySpark
★ 1280+1Variación de estrellas de los últimos 7 días - #72
Sistema de almacenamiento distribuido, escalable y confiable, optimizado para análisis de datos y cargas de trabajo de almacenamiento de objetos.
★ 1270+4Variación de estrellas de los últimos 7 días - #73
Aplicación de escritorio simple para Windows para ver y consultar archivos Apache Parquet
★ 1231+2Variación de estrellas de los últimos 7 días - #74
GraphFrames es un paquete para Apache Spark que proporciona grafos basados en DataFrames.
★ 1202+1Variación de estrellas de los últimos 7 días - #75
Apache Amoro (en incubación) es un sistema de gestión de Lakehouse construido sobre formatos de lago de datos abiertos.
★ 1171+2Variación de estrellas de los últimos 7 días - #76★ 1165+2Variación de estrellas de los últimos 7 días
- #77
ClickBench: una prueba de rendimiento para bases de datos analíticas
★ 1094+3Variación de estrellas de los últimos 7 días - #78
📙 Lista de catálogos de datos y plataformas de observabilidad destacados.
★ 1068+4Variación de estrellas de los últimos 7 días - #79
ADAM es una plataforma de análisis genómico con formatos de archivo especializados construidos usando Apache Avro, Apache Spark y Apache Parquet. Licenciado bajo Apache 2.
★ 1059+2Variación de estrellas de los últimos 7 días - #80
Un fork de ClickHouse que admite búsqueda vectorial de alto rendimiento y búsqueda de texto completo.
★ 1040+1Variación de estrellas de los últimos 7 días - #81
Operador de Kubernetes para Apache Flink.
★ 1031+3Variación de estrellas de los últimos 7 días - #82
Recursos profesionales para Data Science, Machine Learning, Big Data y Business Analytics
★ 1022+1Variación de estrellas de los últimos 7 días - #83
Servidor para el proyecto ListenBrainz, que incluye el código de la interfaz (JavaScript/React) que sirve y todos los componentes de procesamiento de datos que utiliza.
★ 1006+5Variación de estrellas de los últimos 7 días - #84
Complemento de NVIDIA cuDF para Apache Spark: acelera Apache Spark con GPUs
★ 998+1Variación de estrellas de los últimos 7 días - #85
Sparkling Water proporciona funcionalidad de H2O dentro de un clúster de Spark
★ 980+0Variación de estrellas de los últimos 7 días - #86
Un protocolo abierto para el intercambio seguro de datos.
★ 957+0Variación de estrellas de los últimos 7 días - #87
⚡ Algoritmos de una sola pasada para estadística
★ 897+0Variación de estrellas de los últimos 7 días - #88
Un repositorio más con conceptos básicos, desafíos técnicos y recursos sobre ingeniería de datos en español 🧙✨
★ 896+0Variación de estrellas de los últimos 7 días - #89
Estructura de datos aprendida de última generación que permite búsquedas rápidas, predecesores, búsquedas de rango y actualizaciones en matrices de miles de millones de elementos, utilizando órdenes de magnitud menos espacio que los índices tradicionales.
★ 873+1Variación de estrellas de los últimos 7 días - #90
Proyectos de IA.
★ 868+1Variación de estrellas de los últimos 7 días