spark
Repositorios de código abierto monitorizados etiquetados con spark, ordenados por estrellas.
- #61
Solución de almacenamiento de datos de alto rendimiento
★ 1452+0Variación de estrellas de los últimos 7 días - #62
Repositorio de GitHub para Learning Spark: Lightning-Fast Data Analytics [2.ª edición].
★ 1402+2Variación de estrellas de los últimos 7 días - #63
Más de 50 imágenes públicas de DockerHub para Docker y Kubernetes - DevOps, CI/CD, GitHub Actions, CircleCI, Jenkins, TeamCity, Alpine, CentOS, Debian, Fedora, Ubuntu, Hadoop, Kafka, ZooKeeper, HBase, Cassandra, Solr, SolrCloud, Presto, Apache Drill, Nifi, Spark, Consul, Riak
★ 1379+0Variación de estrellas de los últimos 7 días - #64
Magics y kernels de Jupyter para trabajar con clústeres remotos de Spark.
★ 1365-1Variación de estrellas de los últimos 7 días - #65
Taier es una plataforma de desarrollo de big data para el envío, programación, operación, mantenimiento y visualización de información de indicadores.
★ 1284+0Variación de estrellas de los últimos 7 días - #66
PySpark-Tutorial ofrece algoritmos básicos utilizando PySpark
★ 1280+0Variación de estrellas de los últimos 7 días - #67
Acelerador Spark Apache DataFusion Comet
★ 1262+2Variación de estrellas de los últimos 7 días - #68
Gestión de datos maestros escalable, resolución de identidad, resolución de entidades y deduplicación mediante ML
★ 1243+5Variación de estrellas de los últimos 7 días - #69
GraphFrames es un paquete para Apache Spark que proporciona grafos basados en DataFrames.
★ 1202+0Variación de estrellas de los últimos 7 días - #70
Apache Amoro (en incubación) es un sistema de gestión de Lakehouse construido sobre formatos de lago de datos abiertos.
★ 1171+0Variación de estrellas de los últimos 7 días - #71
Un centro de conocimiento sobre ingeniería de datos y aprendizaje automático
★ 1146+0Variación de estrellas de los últimos 7 días - #72
Apache Celeborn es un servicio elástico y de alto rendimiento para datos de shuffle y desbordamiento.
★ 1062+1Variación de estrellas de los últimos 7 días - #73
ADAM es una plataforma de análisis genómico con formatos de archivo especializados construidos usando Apache Avro, Apache Spark y Apache Parquet. Licenciado bajo Apache 2.
★ 1059+2Variación de estrellas de los últimos 7 días - #74
Servidor para el proyecto ListenBrainz, que incluye el código de la interfaz (JavaScript/React) que sirve y todos los componentes de procesamiento de datos que utiliza.
★ 1006+4Variación de estrellas de los últimos 7 días - #75
Complemento de NVIDIA cuDF para Apache Spark: acelera Apache Spark con GPUs
★ 998+1Variación de estrellas de los últimos 7 días - #76
Tutorial gratuito para Apache Spark.
★ 988+0Variación de estrellas de los últimos 7 días - #77
Sparkling Water proporciona funcionalidad de H2O dentro de un clúster de Spark
★ 980+1Variación de estrellas de los últimos 7 días - #78★ 972+0Variación de estrellas de los últimos 7 días
- #79
Apache Livy es una interfaz REST de código abierto para interactuar con Apache Spark desde cualquier lugar.
★ 961+1Variación de estrellas de los últimos 7 días - #80
Proyecto de código abierto para la preparación de datos en aplicaciones de GenAI
★ 958+2Variación de estrellas de los últimos 7 días - #81
Un protocolo abierto para el intercambio seguro de datos.
★ 957-1Variación de estrellas de los últimos 7 días - #82★ 948+0Variación de estrellas de los últimos 7 días
- #83
Un conector para Spark que permite leer y escribir en clústeres de Redis
★ 945+0Variación de estrellas de los últimos 7 días - #84★ 895-2Variación de estrellas de los últimos 7 días
- #85★ 889+0Variación de estrellas de los últimos 7 días
- #86
Una lista curada de recursos increíbles relacionados con los lenguajes de programación Ada y SPARK
★ 864+2Variación de estrellas de los últimos 7 días - #87
DoEKS es una herramienta para construir, desplegar y escalar plataformas de datos en Amazon EKS
★ 856-1Variación de estrellas de los últimos 7 días - #88
Este repositorio contiene el código de desarrollo de sparkMeasure, una biblioteca de análisis y resolución de problemas de rendimiento para Apache Spark. Simplifica la recopilación, agregación y exportación de métricas de tareas/etapas de Spark, diseñada para desarrolladores e ingenieros de datos en flujos de trabajo de análisis interactivo, pruebas y monitoreo de producción.
★ 829+0Variación de estrellas de los últimos 7 días - #89
Más de 80 herramientas CLI para DevOps y datos: AWS, GCP, GCF Python Cloud Functions, anonimizador de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, conversores y validadores de datos Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Variación de estrellas de los últimos 7 días - #90
Scriptis es una herramienta para el análisis interactivo de datos con desarrollo de scripts (SQL, Pyspark, HiveQL), envío de tareas (Spark, Hive), UDF, funciones, gestión de recursos y diagnóstico inteligente.
★ 814+0Variación de estrellas de los últimos 7 días