Saltar al contenido principal
buildradar
Sign in
Tema · spark

spark

Repositorios de código abierto monitorizados etiquetados con spark, ordenados por estrellas.

Repositorios
115
Estrellas totales
480.010
Estrellas de media
4174
Proporción
0,02%

Temas que aparecen con frecuencia junto a spark en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con spark.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • data-engineering-zoomcamp@DataTalksClub

    Data Engineering Zoomcamp es un curso gratuito de 9 semanas sobre cómo construir tuberías de datos listas para producción. La próxima cohorte comienza en enero de 2026. Únete al curso aquí 👇🏼

    45.183+114Variación de estrellas de los últimos 7 días
  • spark@apache

    Apache Spark: un motor de analítica unificado para el procesamiento de datos a gran escala

    43.943+42Variación de estrellas de los últimos 7 días
  • Notebooks de Python para ciencia de datos: Aprendizaje profundo (TensorFlow, Theano, Caffe, Keras), scikit-learn, Kaggle, big data (Spark, Hadoop MapReduce, HDFS), matplotlib, pandas, NumPy, SciPy, fundamentos de Python, AWS y varias líneas de comandos.

    29.339+5Variación de estrellas de los últimos 7 días
  • redash@getredash

    Haz que tu empresa se impulse mediante datos. Conéctate a cualquier fuente de datos, visualiza fácilmente, crea paneles y comparte tu información.

    28.778+11Variación de estrellas de los últimos 7 días
  • Última tecnología de contenedores Docker, ¡aprende las mejores prácticas a partir de casos reales! | ¡Aprende y comprende las tecnologías de Docker y contenedores con práctica real de DevOps!

    26.231+7Variación de estrellas de los últimos 7 días
  • BigData-Notes@heibaiying

    Guía de introducción a Big Data :star:

    16.962+4Variación de estrellas de los últimos 7 días
  • ds-cheatsheets@FavioVazquez

    Lista de hojas de referencia de ciencia de datos para dominar el mundo

    16.329-1Variación de estrellas de los últimos 7 días
  • ChuanhuChatGPT@GaiZhenbiao

    Interfaz gráfica para la API de ChatGPT y muchos LLMs. Soporta agentes, preguntas y respuestas basadas en archivos, ajuste fino de GPT y consultas con búsqueda web. Todo con una interfaz limpia.

    15.274-2Variación de estrellas de los últimos 7 días
  • flink-learning@zhisheng17

    Blog de aprendizaje de Flink. http://www.54tianzhisheng.cn/ Incluye introducción, conceptos, principios, práctica, optimización de rendimiento y análisis de código fuente de Flink. Abarca casos de estudio de Flink Connector, Metrics, Library, DataStream API, Table API y SQL, así como casos de proyectos a gran escala (PVUV, almacenamiento de logs, deduplicación en tiempo real de miles de millones de datos, monitoreo y alertas). ¡Bienvenido a apoyar mi columna de artículos!

    15.096+1Variación de estrellas de los últimos 7 días
  • technology-talk@aalansehaiyang

    Columna de entrevistas en grandes empresas: Una guía técnica que todo programador de Java necesita, incluye preguntas de entrevistas, arquitectura de sistemas, consejos profesionales, middleware principal y más para ayudarte a convertirte en un mejor profesional.

    14.733-1Variación de estrellas de los últimos 7 días
  • deeplearning4j@deeplearning4j

    Conjunto de herramientas para desplegar y entrenar modelos de deep learning utilizando la JVM. Destaca la importación de modelos para Keras, TensorFlow y ONNX/PyTorch, una biblioteca modular y ligera en C++ para ejecutar código matemático y una biblioteca matemática basada en Java construida sobre la biblioteca central en C++. También incluye SameDiff: una biblioteca similar a PyTorch/TensorFlow para ejecutar deep learning...

    14.248+0Variación de estrellas de los últimos 7 días
  • sqlglot@tobymao

    Analizador y transpilador de SQL en Python

    9588+9Variación de estrellas de los últimos 7 días
  • delta@delta-io

    Un marco de almacenamiento de código abierto que permite construir una arquitectura Lakehouse con motores de computación que incluyen Spark, PrestoDB, Flink, Trino y Hive, y APIs

    8984+22Variación de estrellas de los últimos 7 días
  • mage-ai@mage-ai

    🧙 Construye, ejecuta y gestiona canales de datos para integrar y transformar datos.

    8818+4Variación de estrellas de los últimos 7 días
  • h2o-3@h2oai

    H2O es una plataforma de Machine Learning de código abierto, distribuida, rápida y escalable: Deep Learning, Gradient Boosting (GBM) y XGBoost, Random Forest, Modelado Lineal Generalizado (GLM con Elastic Net), K-Means, PCA, Modelos Aditivos Generalizados (GAM), RuleFit, Support Vector Machine (SVM), Stacked Ensembles, Machine Learning Automático (AutoML), etc.

    7499+3Variación de estrellas de los últimos 7 días
  • alluxio@Alluxio

    Alluxio, orquestación de datos para análisis y aprendizaje automático en la nube

    7234+3Variación de estrellas de los últimos 7 días
  • angel@Angel-ML

    Un Parameter Server flexible y potente para aprendizaje automático a gran escala

    6788+1Variación de estrellas de los últimos 7 días
  • zeppelin@apache

    Cuaderno web que permite análisis de datos interactivos y basados en datos, y documentos colaborativos con SQL, Scala y más.

    6655+0Variación de estrellas de los últimos 7 días
  • SynapseML@microsoft

    Biblioteca de Python de Machine Learning simple y distribuida que adapta algoritmos de ML para Spark

    5245+3Variación de estrellas de los últimos 7 días
  • cube-studio@tencentmusic

    cube studio开源云原生一站式机器学习/深度学习/大模型AI平台,mlops算法链路全流程,算力租赁平台,notebook在线开发,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务VGPU虚拟化,边缘计算,标注平台自动化标注,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库,AI模型市场,支持国产cpu/gpu/npu 昇腾生态,支持RDMA,支持pytorch/tf/mxnet/deepspeed/paddle/colossalai/horovod/ray/volcano等分布式

    5078+3Variación de estrellas de los últimos 7 días
  • spark-nlp@JohnSnowLabs

    Procesamiento de Lenguaje Natural de última generación

    4160+1Variación de estrellas de los últimos 7 días
  • HELK@Cyb3rWard0g

    The Hunting ELK

    3931+0Variación de estrellas de los últimos 7 días
  • RoaringBitmap@RoaringBitmap

    Un mejor bitset comprimido en Java: utilizado por Apache Spark, Netflix Atlas, Apache Pinot, Tablesaw y muchos más

    3921+2Variación de estrellas de los últimos 7 días
  • deequ@awslabs

    Deequ es una biblioteca construida sobre Apache Spark para definir "pruebas unitarias para datos", que miden la calidad de los datos en grandes conjuntos de datos.

    3642+0Variación de estrellas de los últimos 7 días
  • 🔨 Genera sentencias SQL estructuradas usando JSON, implementado con Vue3 + TypeScript + Vite + Ant Design + MonacoEditor. El proyecto es simple (enfocado en la lógica más que en la interfaz), ideal para practicar.

    3424+0Variación de estrellas de los últimos 7 días
  • linkis@apache

    Apache Linkis construye una capa de middleware de computación para facilitar la conexión, gobernanza y orquestación entre las aplicaciones superiores y los motores de datos subyacentes.

    3409+2Variación de estrellas de los últimos 7 días
  • paimon@apache

    Apache Paimon es un formato de lago que permite construir una arquitectura Realtime Lakehouse con Flink y Spark tanto para operaciones de streaming como por lotes.

    3388+3Variación de estrellas de los últimos 7 días
  • koalas@databricks

    Koalas: API de pandas en Apache Spark

    3374+1Variación de estrellas de los últimos 7 días
  • sail@lakehq

    Reemplazo directo de Apache Spark escrito en Rust, que unifica el procesamiento por lotes, el procesamiento de flujos y las cargas de trabajo de IA intensivas en computación.

    3341+4Variación de estrellas de los últimos 7 días
  • DataSphereStudio@WeBankFinTech

    DataSphereStudio es un portal integral de desarrollo y gestión de aplicaciones de datos, que abarca escenarios como intercambio de datos, enmascaramiento/limpieza, análisis/minería, medición de calidad, visualización y programación de tareas.

    3262-1Variación de estrellas de los últimos 7 días
← Volver a temas