big-data
Dépôts open source suivis étiquetés big-data, triés par étoiles.
- #31
Moteur de données haute performance pour l'IA et les charges de travail multimodales. Traitez des images, de l'audio, de la vidéo et des données structurées à n'importe quelle échelle.
★ 5 736+4Évolution des étoiles sur les 7 derniers jours - #32
Bibliothèque Python d'apprentissage automatique simple et distribuée, portant des algorithmes ML pour Spark
★ 5 245+3Évolution des étoiles sur les 7 derniers jours - #33★ 5 180+2Évolution des étoiles sur les 7 derniers jours
- #34★ 5 082+2Évolution des étoiles sur les 7 derniers jours
- #35
Stream Framework est une bibliothèque Python permettant de créer des flux d'actualités, des flux d'activités et des systèmes de notification en utilisant Cassandra et/ou Redis. Les auteurs de Stream-Framework proposent également un service cloud pour la technologie de flux.
★ 4 742-2Évolution des étoiles sur les 7 derniers jours - #36
Composant Vue supportant de grands volumes de données avec des performances de rendu élevées et efficaces.
★ 4 505-1Évolution des étoiles sur les 7 derniers jours - #37
Transformez facilement de grands ensembles d'URL d'images en un jeu de données. Capable de télécharger, redimensionner et empaqueter 100 millions d'URL en 20 heures sur une seule machine.
★ 4 445+2Évolution des étoiles sur les 7 derniers jours - #38
CrateDB est une base de données SQL distribuée et évolutive conçue pour stocker et analyser des volumes massifs de données en temps quasi réel, même avec des requêtes complexes. Compatible avec PostgreSQL et basée sur Lucene.
★ 4 432+3Évolution des étoiles sur les 7 derniers jours - #39★ 4 399+2Évolution des étoiles sur les 7 derniers jours
- #40
Feuille de route complète pour la science des données
★ 4 354+3Évolution des étoiles sur les 7 derniers jours - #41
🔨 🍇 💻 🚀 GraphScope : Un système de calcul sur graphes à grande échelle tout-en-un par Alibaba
★ 3 557+1Évolution des étoiles sur les 7 derniers jours - #42
Analyseur lexical et syntaxique SQL extensible pour Rust.
★ 3 446+9Évolution des étoiles sur les 7 derniers jours - #43
Apache Paimon est un format de lac de données permettant de construire une architecture Lakehouse en temps réel avec Flink et Spark pour les opérations de streaming et de traitement par lots.
★ 3 388+3Évolution des étoiles sur les 7 derniers jours - #44★ 3 374+1Évolution des étoiles sur les 7 derniers jours
- #45
Remplacement prêt à l'emploi pour Apache Spark écrit en Rust, unifiant le traitement par lots, le traitement de flux et les charges de travail IA intensives.
★ 3 341+4Évolution des étoiles sur les 7 derniers jours - #46
Une base de données orientée graphe supportant plus de 100 milliards de données, avec des performances et une scalabilité élevées (inclut moteur OLTP, API REST et backends).
★ 3 167+6Évolution des étoiles sur les 7 derniers jours - #47
Une plateforme de reporting BI et de tableaux de bord en libre-service, facile à utiliser.
★ 3 098+1Évolution des étoiles sur les 7 derniers jours - #48★ 2 656+14Évolution des étoiles sur les 7 derniers jours
- #49
ArcticDB est une base de données DataFrame haute performance et sans serveur, conçue pour l'écosystème de science des données Python.
★ 2 505+8Évolution des étoiles sur les 7 derniers jours - #50★ 2 379+2Évolution des étoiles sur les 7 derniers jours
- #51
Apache Ambari simplifie le provisionnement, la gestion et la surveillance des clusters Apache Hadoop.
★ 2 311+0Évolution des étoiles sur les 7 derniers jours - #52
YTsaurus est une plateforme de Big Data open source, évolutive et tolérante aux pannes.
★ 2 203+0Évolution des étoiles sur les 7 derniers jours - #53★ 2 131+11Évolution des étoiles sur les 7 derniers jours
- #54
Moteur de requête distribué Apache DataFusion Ballista
★ 2 127+7Évolution des étoiles sur les 7 derniers jours - #55
Apache Drill est une couche de requête MPP distribuée pour les données auto-descriptives
★ 2 022+0Évolution des étoiles sur les 7 derniers jours - #56
Apache BookKeeper : un service de stockage évolutif, tolérant aux pannes et à faible latence, optimisé pour les charges de travail en ajout seul.
★ 2 011+1Évolution des étoiles sur les 7 derniers jours - #57
Abstraction et accélération de données fluides et élastiques pour les applications BigData/IA dans le cloud. (Projet sous CNCF)
★ 1 967+0Évolution des étoiles sur les 7 derniers jours - #58★ 1 913+0Évolution des étoiles sur les 7 derniers jours
- #59
Plus de 500 ressources sélectionnées pour l'analyse de données et la science des données : Python, SQL, statistiques, ML, IA, visualisation, aide-mémoire, feuilles de route, préparation aux entretiens. Pour débutants et experts.
★ 1 890+8Évolution des étoiles sur les 7 derniers jours - #60
L'accélérateur Auron pour les frameworks de calcul distribué (ex: Spark) exploite l'exécution vectorisée native pour accélérer le traitement des requêtes
★ 1 798+2Évolution des étoiles sur les 7 derniers jours