parquet
Erfasste Open-Source-Repos mit dem Tag parquet, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit parquet am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit parquet getaggt wurden.
- #1★ 17.295+6Sterne-Änderung der letzten 7 Tage
- #2
Apache Arrow ist das universelle Spaltenformat und die mehrsprachige Toolbox für schnellen Datenaustausch und In-Memory-Analysen
★ 17.078+6Sterne-Änderung der letzten 7 Tage - #3
Hochleistungs-Daten-Engine für KI- und multimodale Workloads. Verarbeitet Bilder, Audio, Video und strukturierte Daten in beliebigem Maßstab.
★ 5.736+4Sterne-Änderung der letzten 7 Tage - #4★ 3.600+4Sterne-Änderung der letzten 7 Tage
- #5
Erstellen Sie vollwertige APIs für sich langsam ändernde Datensätze, ohne eine einzige Zeile Code zu schreiben.
★ 3.429+1Sterne-Änderung der letzten 7 Tage - #6
Drop-in-Ersatz für Apache Spark, geschrieben in Rust, der Batch-Verarbeitung, Stream-Verarbeitung und rechenintensive KI-Workloads vereint.
★ 3.341+4Sterne-Änderung der letzten 7 Tage - #7
Apache Parquet Java
★ 3.078+0Sterne-Änderung der letzten 7 Tage - #8★ 2.862+11Sterne-Änderung der letzten 7 Tage
- #9
Apache Parquet Format
★ 2.563+7Sterne-Änderung der letzten 7 Tage - #10
Parseable ist eine in Rust auf einer Data-Lake-Architektur entwickelte Open-Source-Plattform für einheitliche Infrastruktur-Observability. Sie erfasst Logs, Metriken, Traces und Events über Apps, Agenten und Systeme hinweg und reduziert Speicherkosten durch spaltenbasierte Telemetriekompression um bis zu 90 %.
★ 2.450+2Sterne-Änderung der letzten 7 Tage - #11★ 2.022+0Sterne-Änderung der letzten 7 Tage
- #12
Echtzeit-Analysen auf Postgres-Tabellen
★ 2.003+0Sterne-Änderung der letzten 7 Tage - #13
Die Petastorm-Bibliothek ermöglicht das Training und die Evaluierung von Deep-Learning-Modellen auf einzelnen Maschinen oder verteilt aus Datensätzen im Apache Parquet-Format. Sie unterstützt ML-Frameworks wie Tensorflow, Pytorch und PySpark und kann aus reinem Python-Code heraus verwendet werden.
★ 1.892+0Sterne-Änderung der letzten 7 Tage - #14
Apache Kafka®-kompatibler Broker mit S3, PostgreSQL, SQLite, Apache Iceberg und Delta Lake
★ 1.853+1Sterne-Änderung der letzten 7 Tage - #15
Eine SQL-Schnittstelle für über 60 Tools (z. B. GitHub, Notion, Airtable). Anbindung an jedes LLM über MCP.
★ 1.772+2Sterne-Änderung der letzten 7 Tage - #16★ 1.618+3Sterne-Änderung der letzten 7 Tage
- #17
cryo ist der einfachste Weg, Blockchain-Daten in die Formate parquet, csv, json oder in python dataframes zu exportieren
★ 1.582+1Sterne-Änderung der letzten 7 Tage - #18★ 1.531+0Sterne-Änderung der letzten 7 Tage
- #19
OLake – Die schnellste Replikation von Datenbanken, Kafka und S3 zu Apache Iceberg mit Tabellenoptimierung (genannt OLake Fusion). Effiziente, schnelle und skalierbare Datenaufnahme für Echtzeitanalysen. Unterstützte Quellen: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1.435+2Sterne-Änderung der letzten 7 Tage - #20
Quilt ist eine Scientific-Data-Management-Plattform auf AWS, die Teams und KI dabei unterstützt, Daten durch tief versionierte, kontextreiche Datenpakete zu finden, zu vertrauen und wiederzuverwenden.
★ 1.370+0Sterne-Änderung der letzten 7 Tage - #21
Einfache Windows-Desktopanwendung zum Anzeigen und Abfragen von Apache Parquet-Dateien
★ 1.231+2Sterne-Änderung der letzten 7 Tage - #22
ClickBench: Ein Benchmark für analytische Datenbanken
★ 1.100+8Sterne-Änderung der letzten 7 Tage - #23
ADAM ist eine Genomanalyse-Plattform mit spezialisierten Dateiformaten, entwickelt unter Verwendung von Apache Avro, Apache Spark und Apache Parquet. Lizenziert unter Apache 2.
★ 1.059+2Sterne-Änderung der letzten 7 Tage - #24★ 963+1Sterne-Änderung der letzten 7 Tage
- #25★ 950+8Sterne-Änderung der letzten 7 Tage
- #26
ETL-Framework für .NET (Parser/Writer für CSV-, Flat-, Xml-, JSON-, Key-Value-, Parquet-, Yaml- und Avro-formatierte Dateien)
★ 859+0Sterne-Änderung der letzten 7 Tage - #27
80+ DevOps- und Data-CLI-Tools – AWS, GCP, GCF Python Cloud Functions, Log Anonymizer, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, Spark Data Converters & Validators (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr usw.
★ 824+0Sterne-Änderung der letzten 7 Tage - #28
Leistungsstarkes Go-Paket zum Lesen und Schreiben von Parquet-Dateien
★ 769+2Sterne-Änderung der letzten 7 Tage - #29
Graph Data Science: Eine Abstraktionsschicht in Python zum Erstellen von Wissensgraphen, integriert in gängige Graph-Bibliotheken – basierend auf Pandas, NetworkX, RAPIDS, RDFlib, pySHACL, PyVis, morph-kgc, pslpython, pyarrow usw.
★ 691+2Sterne-Änderung der letzten 7 Tage - #30
Kopieren von Parquet-Daten zwischen S3, Azure Blob Storage, Google Cloud Storage, HTTP(S)-Speichern, lokalen Dateien oder Standard-Streams direkt aus PostgreSQL.
★ 685+0Sterne-Änderung der letzten 7 Tage