spark
Dépôts open source suivis étiquetés spark, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de spark sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés spark.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Data Engineering Zoomcamp est un cours gratuit de 9 semaines sur la création de pipelines de données prêts pour la production. La prochaine session débute en janvier 2026.
★ 45 183+114Évolution des étoiles sur les 7 derniers jours - #2
Apache Spark - Un moteur d'analyse unifié pour le traitement de données à grande échelle.
★ 43 943+42Évolution des étoiles sur les 7 derniers jours - #3
Notebooks Python pour la science des données : Deep learning (TensorFlow, Theano, Caffe, Keras), scikit-learn, Kaggle, big data (Spark, Hadoop MapReduce, HDFS), matplotlib, pandas, NumPy, SciPy, fondamentaux de Python, AWS et diverses lignes de commande.
★ 29 339+5Évolution des étoiles sur les 7 derniers jours - #4
Rendez votre entreprise axée sur les données. Connectez-vous à n'importe quelle source de données, visualisez facilement, créez des tableaux de bord et partagez vos données.
★ 28 778+11Évolution des étoiles sur les 7 derniers jours - #5
Technologie Docker de pointe, apprenez les meilleures pratiques à travers des cas réels de DevOps.
★ 26 231+7Évolution des étoiles sur les 7 derniers jours - #6
Guide d'introduction au Big Data :star:
★ 16 962+4Évolution des étoiles sur les 7 derniers jours - #7
Liste de fiches mémo sur la science des données pour conquérir le monde.
★ 16 329-1Évolution des étoiles sur les 7 derniers jours - #8
Interface graphique pour l'API ChatGPT et de nombreux LLM. Prend en charge les agents, le QA basé sur des fichiers, le fine-tuning GPT et les requêtes avec recherche web, le tout dans une interface soignée.
★ 15 274-2Évolution des étoiles sur les 7 derniers jours - #9
Blog d'apprentissage Flink. Contient des introductions, concepts, principes, cas pratiques, optimisation des performances et analyse du code source de Flink. Inclut des études de cas sur les connecteurs, métriques, bibliothèques, DataStream API, Table API & SQL, ainsi que des projets réels (PV/UV, stockage de logs, déduplication en temps réel de milliards de données, surveillance et alertes).
★ 15 096+1Évolution des étoiles sur les 7 derniers jours - #10
Guide technique pour les développeurs Java : entretiens, architecture système, conseils de carrière et middlewares courants pour progresser professionnellement.
★ 14 733-1Évolution des étoiles sur les 7 derniers jours - #11
Suite d'outils pour le déploiement et l'entraînement de modèles de deep learning utilisant la JVM. Les points forts incluent l'importation de modèles pour Keras, TensorFlow et ONNX/PyTorch, une bibliothèque C++ modulaire et légère pour l'exécution de calculs mathématiques, ainsi qu'une bibliothèque Java basée sur ce cœur C++. Inclut également SameDiff : une bibliothèque de type PyTorch/TensorFlow pour l'exécution de deep learning.
★ 14 248+0Évolution des étoiles sur les 7 derniers jours - #12★ 9 588+9Évolution des étoiles sur les 7 derniers jours
- #13
Un framework de stockage open-source permettant de construire une architecture Lakehouse avec des moteurs de calcul tels que Spark, PrestoDB, Flink, Trino, Hive et des API.
★ 8 984+22Évolution des étoiles sur les 7 derniers jours - #14
Construisez, exécutez et gérez des pipelines de données pour l'intégration et la transformation de données.
★ 8 818+4Évolution des étoiles sur les 7 derniers jours - #15
H2O est une plateforme d'apprentissage automatique open source, distribuée, rapide et évolutive : Deep Learning, Gradient Boosting (GBM) & XGBoost, Random Forest, modélisation linéaire généralisée (GLM avec Elastic Net), K-Means, PCA, modèles additifs généralisés (GAM), RuleFit, machines à vecteurs de support (SVM), Stacked Ensembles, apprentissage automatique automatique (AutoML), etc.
★ 7 499+3Évolution des étoiles sur les 7 derniers jours - #16
Alluxio, orchestration de données pour l'analytique et l'apprentissage automatique dans le cloud.
★ 7 234+3Évolution des étoiles sur les 7 derniers jours - #17
Un serveur de paramètres flexible et puissant pour l'apprentissage automatique à grande échelle.
★ 6 788+1Évolution des étoiles sur les 7 derniers jours - #18
Notebook basé sur le web permettant l'analyse de données interactive et collaborative avec SQL, Scala et plus encore.
★ 6 655+0Évolution des étoiles sur les 7 derniers jours - #19
Bibliothèque Python d'apprentissage automatique simple et distribuée, portant des algorithmes ML pour Spark
★ 5 245+3Évolution des étoiles sur les 7 derniers jours - #20
cube studio开源云原生一站式机器学习/深度学习/大模型AI平台,mlops算法链路全流程,算力租赁平台,notebook在线开发,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务VGPU虚拟化,边缘计算,标注平台自动化标注,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库,AI模型市场,支持国产cpu/gpu/npu 昇腾生态,支持RDMA,支持pytorch/tf/mxnet/deepspeed/paddle/colossalai/horovod/ray/volcano等分布式
★ 5 078+3Évolution des étoiles sur les 7 derniers jours - #21★ 4 160+1Évolution des étoiles sur les 7 derniers jours
- #22★ 3 931+0Évolution des étoiles sur les 7 derniers jours
- #23
Un bitset compressé optimisé en Java : utilisé par Apache Spark, Netflix Atlas, Apache Pinot, Tablesaw et bien d'autres
★ 3 921+2Évolution des étoiles sur les 7 derniers jours - #24
Deequ est une bibliothèque construite sur Apache Spark pour définir des "tests unitaires pour les données", permettant de mesurer la qualité des données dans les grands jeux de données.
★ 3 642+0Évolution des étoiles sur les 7 derniers jours - #25
Utilisez JSON pour générer des requêtes SQL structurées. Basé sur Vue3, TypeScript, Vite, Ant Design et MonacoEditor, ce projet est simple, axé sur la logique et idéal pour s'exercer.
★ 3 424+0Évolution des étoiles sur les 7 derniers jours - #26
Apache Linkis construit une couche de middleware de calcul pour faciliter la connexion, la gouvernance et l'orchestration entre les applications supérieures et les moteurs de données sous-jacents.
★ 3 409+2Évolution des étoiles sur les 7 derniers jours - #27
Apache Paimon est un format de lac de données permettant de construire une architecture Lakehouse en temps réel avec Flink et Spark pour les opérations de streaming et de traitement par lots.
★ 3 388+3Évolution des étoiles sur les 7 derniers jours - #28★ 3 374+1Évolution des étoiles sur les 7 derniers jours
- #29
Remplacement prêt à l'emploi pour Apache Spark écrit en Rust, unifiant le traitement par lots, le traitement de flux et les charges de travail IA intensives.
★ 3 341+4Évolution des étoiles sur les 7 derniers jours - #30
DataSphereStudio est un portail complet de développement et de gestion d'applications de données, couvrant l'échange de données, le nettoyage, l'analyse, l'exploration, la mesure de qualité, la visualisation et la planification des tâches.
★ 3 262-1Évolution des étoiles sur les 7 derniers jours