parquet
Dépôts open source suivis étiquetés parquet, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de parquet sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés parquet.
- #1★ 17 295+6Évolution des étoiles sur les 7 derniers jours
- #2
Apache Arrow est le format colonnaire universel et la boîte à outils multilingue pour l'échange rapide de données et l'analyse en mémoire.
★ 17 078+6Évolution des étoiles sur les 7 derniers jours - #3
Moteur de données haute performance pour l'IA et les charges de travail multimodales. Traitez des images, de l'audio, de la vidéo et des données structurées à n'importe quelle échelle.
★ 5 736+4Évolution des étoiles sur les 7 derniers jours - #4★ 3 600+4Évolution des étoiles sur les 7 derniers jours
- #5
Créez des API complètes pour des jeux de données à évolution lente sans écrire une seule ligne de code.
★ 3 429+1Évolution des étoiles sur les 7 derniers jours - #6
Remplacement prêt à l'emploi pour Apache Spark écrit en Rust, unifiant le traitement par lots, le traitement de flux et les charges de travail IA intensives.
★ 3 341+4Évolution des étoiles sur les 7 derniers jours - #7
Apache Parquet pour Java
★ 3 078+0Évolution des étoiles sur les 7 derniers jours - #8★ 2 862+11Évolution des étoiles sur les 7 derniers jours
- #9
Format Apache Parquet
★ 2 563+7Évolution des étoiles sur les 7 derniers jours - #10
Parseable est une plateforme d'observabilité d'infrastructure unifiée open source, construite en Rust sur une architecture de lac de données. Elle suit les logs, les métriques, les traces et les événements à travers les applications, les agents et les systèmes, réduisant les coûts de stockage jusqu'à 90 % grâce à la compression de télémétrie en colonnes.
★ 2 450+2Évolution des étoiles sur les 7 derniers jours - #11
Apache Drill est une couche de requête MPP distribuée pour les données auto-descriptives
★ 2 022+0Évolution des étoiles sur les 7 derniers jours - #12
Analytique en temps réel sur les tables Postgres.
★ 2 003+0Évolution des étoiles sur les 7 derniers jours - #13
La bibliothèque Petastorm permet l'entraînement et l'évaluation distribués ou sur machine unique de modèles de deep learning à partir de jeux de données au format Apache Parquet. Elle prend en charge des frameworks ML tels que Tensorflow, Pytorch et PySpark et peut être utilisée depuis du code Python pur.
★ 1 892+0Évolution des étoiles sur les 7 derniers jours - #14
Courtier compatible avec Apache Kafka® prenant en charge S3, PostgreSQL, SQLite, Apache Iceberg et Delta Lake.
★ 1 853+1Évolution des étoiles sur les 7 derniers jours - #15
Une interface SQL unique pour plus de 60 outils (ex: GitHub, Notion, Airtable). Connexion à tout LLM via MCP.
★ 1 772+2Évolution des étoiles sur les 7 derniers jours - #16
Tonbo est une base de données embarquée pour les environnements d'exécution serverless et edge.
★ 1 618+3Évolution des étoiles sur les 7 derniers jours - #17
cryo est le moyen le plus simple d'extraire des données de blockchain vers des formats parquet, csv, json ou des dataframes python
★ 1 582+1Évolution des étoiles sur les 7 derniers jours - #18★ 1 531+0Évolution des étoiles sur les 7 derniers jours
- #19
OLake - Réplication ultra-rapide de bases de données, Kafka et S3 vers Apache Iceberg avec optimisation de table (appelée OLake Fusion). Ingestion de données efficace, rapide et évolutive pour l'analyse en temps réel. Sources prises en charge : Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1 435+2Évolution des étoiles sur les 7 derniers jours - #20
Quilt est une plateforme de gestion de données scientifiques sur AWS qui aide les équipes et l'IA à trouver, fiabiliser et réutiliser des données via des paquets de données richement contextuels et versionnés.
★ 1 370+0Évolution des étoiles sur les 7 derniers jours - #21
Application de bureau Windows simple pour visualiser et interroger des fichiers Apache Parquet.
★ 1 231+2Évolution des étoiles sur les 7 derniers jours - #22
ClickBench : un benchmark pour les bases de données analytiques
★ 1 094+2Évolution des étoiles sur les 7 derniers jours - #23
ADAM est une plateforme d'analyse génomique utilisant des formats de fichiers spécialisés basés sur Apache Avro, Apache Spark et Apache Parquet. Sous licence Apache 2.
★ 1 059+2Évolution des étoiles sur les 7 derniers jours - #24★ 963+1Évolution des étoiles sur les 7 derniers jours
- #25★ 950+8Évolution des étoiles sur les 7 derniers jours
- #26
Framework ETL pour .NET (analyseur/générateur pour les formats CSV, Flat, Xml, JSON, Key-Value, Parquet, Yaml et Avro).
★ 860+0Évolution des étoiles sur les 7 derniers jours - #27
Plus de 80 outils CLI pour DevOps et Data : AWS, GCP, GCF Python Cloud Functions, anonymiseur de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, convertisseurs et validateurs de données Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Évolution des étoiles sur les 7 derniers jours - #28
Package Go haute performance pour la lecture et l'écriture de fichiers Parquet
★ 769+2Évolution des étoiles sur les 7 derniers jours - #29
Graph Data Science : une couche d'abstraction en Python pour construire des graphes de connaissances, intégrée aux bibliothèques de graphes populaires – au-dessus de Pandas, NetworkX, RAPIDS, RDFlib, pySHACL, PyVis, morph-kgc, pslpython, pyarrow, etc.
★ 691+2Évolution des étoiles sur les 7 derniers jours - #30
Copier vers/à partir du format Parquet dans S3, Azure Blob Storage, Google Cloud Storage, magasins http(s), fichiers locaux ou flux d’entrée/sortie standard depuis PostgreSQL
★ 685+0Évolution des étoiles sur les 7 derniers jours