Aller au contenu principal
buildradar
Sign in
Sujet · spark

spark

Dépôts open source suivis étiquetés spark, triés par étoiles.

Dépôts
115
Total d'étoiles
480 010
Étoiles en moyenne
4 174
Part
0,02%

Sujets qui apparaissent souvent aux côtés de spark sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés spark.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • data-engineering-zoomcamp@DataTalksClub

    Data Engineering Zoomcamp est un cours gratuit de 9 semaines sur la création de pipelines de données prêts pour la production. La prochaine session débute en janvier 2026.

    45 183+114Évolution des étoiles sur les 7 derniers jours
  • spark@apache

    Apache Spark - Un moteur d'analyse unifié pour le traitement de données à grande échelle.

    43 943+42Évolution des étoiles sur les 7 derniers jours
  • Notebooks Python pour la science des données : Deep learning (TensorFlow, Theano, Caffe, Keras), scikit-learn, Kaggle, big data (Spark, Hadoop MapReduce, HDFS), matplotlib, pandas, NumPy, SciPy, fondamentaux de Python, AWS et diverses lignes de commande.

    29 339+5Évolution des étoiles sur les 7 derniers jours
  • redash@getredash

    Rendez votre entreprise axée sur les données. Connectez-vous à n'importe quelle source de données, visualisez facilement, créez des tableaux de bord et partagez vos données.

    28 778+11Évolution des étoiles sur les 7 derniers jours
  • Technologie Docker de pointe, apprenez les meilleures pratiques à travers des cas réels de DevOps.

    26 231+7Évolution des étoiles sur les 7 derniers jours
  • BigData-Notes@heibaiying

    Guide d'introduction au Big Data :star:

    16 962+4Évolution des étoiles sur les 7 derniers jours
  • ds-cheatsheets@FavioVazquez

    Liste de fiches mémo sur la science des données pour conquérir le monde.

    16 329-1Évolution des étoiles sur les 7 derniers jours
  • ChuanhuChatGPT@GaiZhenbiao

    Interface graphique pour l'API ChatGPT et de nombreux LLM. Prend en charge les agents, le QA basé sur des fichiers, le fine-tuning GPT et les requêtes avec recherche web, le tout dans une interface soignée.

    15 274-2Évolution des étoiles sur les 7 derniers jours
  • flink-learning@zhisheng17

    Blog d'apprentissage Flink. Contient des introductions, concepts, principes, cas pratiques, optimisation des performances et analyse du code source de Flink. Inclut des études de cas sur les connecteurs, métriques, bibliothèques, DataStream API, Table API & SQL, ainsi que des projets réels (PV/UV, stockage de logs, déduplication en temps réel de milliards de données, surveillance et alertes).

    15 096+1Évolution des étoiles sur les 7 derniers jours
  • technology-talk@aalansehaiyang

    Guide technique pour les développeurs Java : entretiens, architecture système, conseils de carrière et middlewares courants pour progresser professionnellement.

    14 733-1Évolution des étoiles sur les 7 derniers jours
  • deeplearning4j@deeplearning4j

    Suite d'outils pour le déploiement et l'entraînement de modèles de deep learning utilisant la JVM. Les points forts incluent l'importation de modèles pour Keras, TensorFlow et ONNX/PyTorch, une bibliothèque C++ modulaire et légère pour l'exécution de calculs mathématiques, ainsi qu'une bibliothèque Java basée sur ce cœur C++. Inclut également SameDiff : une bibliothèque de type PyTorch/TensorFlow pour l'exécution de deep learning.

    14 248+0Évolution des étoiles sur les 7 derniers jours
  • sqlglot@tobymao

    Analyseur et transpileur SQL pour Python.

    9 588+9Évolution des étoiles sur les 7 derniers jours
  • delta@delta-io

    Un framework de stockage open-source permettant de construire une architecture Lakehouse avec des moteurs de calcul tels que Spark, PrestoDB, Flink, Trino, Hive et des API.

    8 984+22Évolution des étoiles sur les 7 derniers jours
  • mage-ai@mage-ai

    Construisez, exécutez et gérez des pipelines de données pour l'intégration et la transformation de données.

    8 818+4Évolution des étoiles sur les 7 derniers jours
  • h2o-3@h2oai

    H2O est une plateforme d'apprentissage automatique open source, distribuée, rapide et évolutive : Deep Learning, Gradient Boosting (GBM) & XGBoost, Random Forest, modélisation linéaire généralisée (GLM avec Elastic Net), K-Means, PCA, modèles additifs généralisés (GAM), RuleFit, machines à vecteurs de support (SVM), Stacked Ensembles, apprentissage automatique automatique (AutoML), etc.

    7 499+3Évolution des étoiles sur les 7 derniers jours
  • alluxio@Alluxio

    Alluxio, orchestration de données pour l'analytique et l'apprentissage automatique dans le cloud.

    7 234+3Évolution des étoiles sur les 7 derniers jours
  • angel@Angel-ML

    Un serveur de paramètres flexible et puissant pour l'apprentissage automatique à grande échelle.

    6 788+1Évolution des étoiles sur les 7 derniers jours
  • zeppelin@apache

    Notebook basé sur le web permettant l'analyse de données interactive et collaborative avec SQL, Scala et plus encore.

    6 655+0Évolution des étoiles sur les 7 derniers jours
  • SynapseML@microsoft

    Bibliothèque Python d'apprentissage automatique simple et distribuée, portant des algorithmes ML pour Spark

    5 245+3Évolution des étoiles sur les 7 derniers jours
  • cube-studio@tencentmusic

    cube studio开源云原生一站式机器学习/深度学习/大模型AI平台,mlops算法链路全流程,算力租赁平台,notebook在线开发,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务VGPU虚拟化,边缘计算,标注平台自动化标注,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库,AI模型市场,支持国产cpu/gpu/npu 昇腾生态,支持RDMA,支持pytorch/tf/mxnet/deepspeed/paddle/colossalai/horovod/ray/volcano等分布式

    5 078+3Évolution des étoiles sur les 7 derniers jours
  • spark-nlp@JohnSnowLabs

    État de l'art du traitement du langage naturel

    4 160+1Évolution des étoiles sur les 7 derniers jours
  • HELK@Cyb3rWard0g

    The Hunting ELK.

    3 931+0Évolution des étoiles sur les 7 derniers jours
  • RoaringBitmap@RoaringBitmap

    Un bitset compressé optimisé en Java : utilisé par Apache Spark, Netflix Atlas, Apache Pinot, Tablesaw et bien d'autres

    3 921+2Évolution des étoiles sur les 7 derniers jours
  • deequ@awslabs

    Deequ est une bibliothèque construite sur Apache Spark pour définir des "tests unitaires pour les données", permettant de mesurer la qualité des données dans les grands jeux de données.

    3 642+0Évolution des étoiles sur les 7 derniers jours
  • Utilisez JSON pour générer des requêtes SQL structurées. Basé sur Vue3, TypeScript, Vite, Ant Design et MonacoEditor, ce projet est simple, axé sur la logique et idéal pour s'exercer.

    3 424+0Évolution des étoiles sur les 7 derniers jours
  • linkis@apache

    Apache Linkis construit une couche de middleware de calcul pour faciliter la connexion, la gouvernance et l'orchestration entre les applications supérieures et les moteurs de données sous-jacents.

    3 409+2Évolution des étoiles sur les 7 derniers jours
  • paimon@apache

    Apache Paimon est un format de lac de données permettant de construire une architecture Lakehouse en temps réel avec Flink et Spark pour les opérations de streaming et de traitement par lots.

    3 388+3Évolution des étoiles sur les 7 derniers jours
  • koalas@databricks

    Koalas : API pandas sur Apache Spark

    3 374+1Évolution des étoiles sur les 7 derniers jours
  • sail@lakehq

    Remplacement prêt à l'emploi pour Apache Spark écrit en Rust, unifiant le traitement par lots, le traitement de flux et les charges de travail IA intensives.

    3 341+4Évolution des étoiles sur les 7 derniers jours
  • DataSphereStudio@WeBankFinTech

    DataSphereStudio est un portail complet de développement et de gestion d'applications de données, couvrant l'échange de données, le nettoyage, l'analyse, l'exploration, la mesure de qualité, la visualisation et la planification des tâches.

    3 262-1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets