spark
Repositorios de código abierto monitorizados etiquetados con spark, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a spark en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con spark.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Data Engineering Zoomcamp es un curso gratuito de 9 semanas sobre cómo construir tuberías de datos listas para producción. La próxima cohorte comienza en enero de 2026. Únete al curso aquí 👇🏼
★ 45.183+114Variación de estrellas de los últimos 7 días - #2
Apache Spark: un motor de analítica unificado para el procesamiento de datos a gran escala
★ 43.943+42Variación de estrellas de los últimos 7 días - #3
Notebooks de Python para ciencia de datos: Aprendizaje profundo (TensorFlow, Theano, Caffe, Keras), scikit-learn, Kaggle, big data (Spark, Hadoop MapReduce, HDFS), matplotlib, pandas, NumPy, SciPy, fundamentos de Python, AWS y varias líneas de comandos.
★ 29.339+5Variación de estrellas de los últimos 7 días - #4
Haz que tu empresa se impulse mediante datos. Conéctate a cualquier fuente de datos, visualiza fácilmente, crea paneles y comparte tu información.
★ 28.778+11Variación de estrellas de los últimos 7 días - #5
Última tecnología de contenedores Docker, ¡aprende las mejores prácticas a partir de casos reales! | ¡Aprende y comprende las tecnologías de Docker y contenedores con práctica real de DevOps!
★ 26.231+7Variación de estrellas de los últimos 7 días - #6
Guía de introducción a Big Data :star:
★ 16.962+4Variación de estrellas de los últimos 7 días - #7
Lista de hojas de referencia de ciencia de datos para dominar el mundo
★ 16.329-1Variación de estrellas de los últimos 7 días - #8
Interfaz gráfica para la API de ChatGPT y muchos LLMs. Soporta agentes, preguntas y respuestas basadas en archivos, ajuste fino de GPT y consultas con búsqueda web. Todo con una interfaz limpia.
★ 15.274-2Variación de estrellas de los últimos 7 días - #9
Blog de aprendizaje de Flink. http://www.54tianzhisheng.cn/ Incluye introducción, conceptos, principios, práctica, optimización de rendimiento y análisis de código fuente de Flink. Abarca casos de estudio de Flink Connector, Metrics, Library, DataStream API, Table API y SQL, así como casos de proyectos a gran escala (PVUV, almacenamiento de logs, deduplicación en tiempo real de miles de millones de datos, monitoreo y alertas). ¡Bienvenido a apoyar mi columna de artículos!
★ 15.096+1Variación de estrellas de los últimos 7 días - #10
Columna de entrevistas en grandes empresas: Una guía técnica que todo programador de Java necesita, incluye preguntas de entrevistas, arquitectura de sistemas, consejos profesionales, middleware principal y más para ayudarte a convertirte en un mejor profesional.
★ 14.733-1Variación de estrellas de los últimos 7 días - #11
Conjunto de herramientas para desplegar y entrenar modelos de deep learning utilizando la JVM. Destaca la importación de modelos para Keras, TensorFlow y ONNX/PyTorch, una biblioteca modular y ligera en C++ para ejecutar código matemático y una biblioteca matemática basada en Java construida sobre la biblioteca central en C++. También incluye SameDiff: una biblioteca similar a PyTorch/TensorFlow para ejecutar deep learning...
★ 14.248+0Variación de estrellas de los últimos 7 días - #12★ 9588+9Variación de estrellas de los últimos 7 días
- #13
Un marco de almacenamiento de código abierto que permite construir una arquitectura Lakehouse con motores de computación que incluyen Spark, PrestoDB, Flink, Trino y Hive, y APIs
★ 8984+22Variación de estrellas de los últimos 7 días - #14★ 8818+4Variación de estrellas de los últimos 7 días
- #15
H2O es una plataforma de Machine Learning de código abierto, distribuida, rápida y escalable: Deep Learning, Gradient Boosting (GBM) y XGBoost, Random Forest, Modelado Lineal Generalizado (GLM con Elastic Net), K-Means, PCA, Modelos Aditivos Generalizados (GAM), RuleFit, Support Vector Machine (SVM), Stacked Ensembles, Machine Learning Automático (AutoML), etc.
★ 7499+3Variación de estrellas de los últimos 7 días - #16★ 7234+3Variación de estrellas de los últimos 7 días
- #17★ 6788+1Variación de estrellas de los últimos 7 días
- #18
Cuaderno web que permite análisis de datos interactivos y basados en datos, y documentos colaborativos con SQL, Scala y más.
★ 6655+0Variación de estrellas de los últimos 7 días - #19
Biblioteca de Python de Machine Learning simple y distribuida que adapta algoritmos de ML para Spark
★ 5245+3Variación de estrellas de los últimos 7 días - #20
cube studio开源云原生一站式机器学习/深度学习/大模型AI平台,mlops算法链路全流程,算力租赁平台,notebook在线开发,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务VGPU虚拟化,边缘计算,标注平台自动化标注,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库,AI模型市场,支持国产cpu/gpu/npu 昇腾生态,支持RDMA,支持pytorch/tf/mxnet/deepspeed/paddle/colossalai/horovod/ray/volcano等分布式
★ 5078+3Variación de estrellas de los últimos 7 días - #21★ 4160+1Variación de estrellas de los últimos 7 días
- #22★ 3931+0Variación de estrellas de los últimos 7 días
- #23
Un mejor bitset comprimido en Java: utilizado por Apache Spark, Netflix Atlas, Apache Pinot, Tablesaw y muchos más
★ 3921+2Variación de estrellas de los últimos 7 días - #24
Deequ es una biblioteca construida sobre Apache Spark para definir "pruebas unitarias para datos", que miden la calidad de los datos en grandes conjuntos de datos.
★ 3642+0Variación de estrellas de los últimos 7 días - #25
🔨 Genera sentencias SQL estructuradas usando JSON, implementado con Vue3 + TypeScript + Vite + Ant Design + MonacoEditor. El proyecto es simple (enfocado en la lógica más que en la interfaz), ideal para practicar.
★ 3424+0Variación de estrellas de los últimos 7 días - #26
Apache Linkis construye una capa de middleware de computación para facilitar la conexión, gobernanza y orquestación entre las aplicaciones superiores y los motores de datos subyacentes.
★ 3409+2Variación de estrellas de los últimos 7 días - #27
Apache Paimon es un formato de lago que permite construir una arquitectura Realtime Lakehouse con Flink y Spark tanto para operaciones de streaming como por lotes.
★ 3388+3Variación de estrellas de los últimos 7 días - #28★ 3374+1Variación de estrellas de los últimos 7 días
- #29
Reemplazo directo de Apache Spark escrito en Rust, que unifica el procesamiento por lotes, el procesamiento de flujos y las cargas de trabajo de IA intensivas en computación.
★ 3341+4Variación de estrellas de los últimos 7 días - #30
DataSphereStudio es un portal integral de desarrollo y gestión de aplicaciones de datos, que abarca escenarios como intercambio de datos, enmascaramiento/limpieza, análisis/minería, medición de calidad, visualización y programación de tareas.
★ 3262-1Variación de estrellas de los últimos 7 días