parquet
Repositórios de código aberto acompanhados marcados com parquet, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de parquet no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com parquet.
- #1★ 17.295+6Variação de estrelas nos últimos 7 dias
- #2
Apache Arrow é o formato colunar universal e a caixa de ferramentas multilíngue para troca rápida de dados e análise em memória
★ 17.078+6Variação de estrelas nos últimos 7 dias - #3
Motor de dados de alto desempenho para IA e cargas de trabalho multimodais. Processe imagens, áudio, vídeo e dados estruturados em qualquer escala.
★ 5.736+4Variação de estrelas nos últimos 7 dias - #4★ 3.600+4Variação de estrelas nos últimos 7 dias
- #5
Crie APIs completas para conjuntos de dados de movimentação lenta sem escrever uma única linha de código.
★ 3.429+1Variação de estrelas nos últimos 7 dias - #6
Substituto direto para o Apache Spark escrito em Rust, unificando processamento em lote, processamento de fluxo e cargas de trabalho de IA intensivas em computação.
★ 3.341+4Variação de estrelas nos últimos 7 dias - #7
Apache Parquet Java
★ 3.078+0Variação de estrelas nos últimos 7 dias - #8★ 2.862+11Variação de estrelas nos últimos 7 dias
- #9
Formato Apache Parquet.
★ 2.563+7Variação de estrelas nos últimos 7 dias - #10
Parseable é uma plataforma de observabilidade de infraestrutura unificada de código aberto, construída em Rust sobre uma arquitetura de data lake. Ela rastreia logs, métricas, traces e eventos em aplicativos, agentes e sistemas, reduzindo os custos de armazenamento em até 90% por meio de compressão de telemetria colunar.
★ 2.450+2Variação de estrelas nos últimos 7 dias - #11★ 2.022+0Variação de estrelas nos últimos 7 dias
- #12
Análise em tempo real em tabelas Postgres
★ 2.003+0Variação de estrelas nos últimos 7 dias - #13
A biblioteca Petastorm permite o treinamento e avaliação, em máquina única ou distribuída, de modelos de deep learning a partir de datasets no formato Apache Parquet. Suporta frameworks de ML como Tensorflow, Pytorch e PySpark, podendo ser utilizada a partir de código Python puro
★ 1.892+0Variação de estrelas nos últimos 7 dias - #14
Broker compatível com Apache Kafka® com suporte para S3, PostgreSQL, SQLite, Apache Iceberg e Delta Lake.
★ 1.853+1Variação de estrelas nos últimos 7 dias - #15
Uma interface SQL para mais de 60 ferramentas (ex: GitHub, Notion, Airtable). Conecte-se a qualquer LLM via MCP.
★ 1.772+2Variação de estrelas nos últimos 7 dias - #16★ 1.618+3Variação de estrelas nos últimos 7 dias
- #17
cryo é a maneira mais fácil de extrair dados de blockchain para parquet, csv, json ou dataframes do python
★ 1.582+1Variação de estrelas nos últimos 7 dias - #18★ 1.531+0Variação de estrelas nos últimos 7 dias
- #19
OLake - Replicação mais rápida de bancos de dados, Kafka e S3 para Apache Iceberg com otimização de tabelas (chamada OLake Fusion). Ingestão de dados eficiente, rápida e escalável para análise em tempo real. Fontes suportadas: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1.435+2Variação de estrelas nos últimos 7 dias - #20
Quilt é uma plataforma de gerenciamento de dados científicos na AWS que ajuda equipes e IA a encontrar, confiar e reutilizar dados por meio de pacotes de dados profundamente versionados e ricos em contexto.
★ 1.370+0Variação de estrelas nos últimos 7 dias - #21
Aplicativo de desktop Windows simples para visualizar e consultar arquivos Apache Parquet.
★ 1.231+2Variação de estrelas nos últimos 7 dias - #22
ClickBench: um benchmark para bancos de dados analíticos.
★ 1.101+8Variação de estrelas nos últimos 7 dias - #23
ADAM é uma plataforma de análise genômica com formatos de arquivo especializados construída usando Apache Avro, Apache Spark e Apache Parquet. Licenciado sob Apache 2.
★ 1.059+2Variação de estrelas nos últimos 7 dias - #24★ 963+1Variação de estrelas nos últimos 7 dias
- #25★ 950+8Variação de estrelas nos últimos 7 dias
- #26
Framework ETL para .NET (Parser / Writer para arquivos formatados em CSV, Flat, Xml, JSON, Key-Value, Parquet, Yaml, Avro)
★ 859+0Variação de estrelas nos últimos 7 dias - #27
Mais de 80 ferramentas CLI para DevOps e Dados - AWS, GCP, GCF Python Cloud Functions, anonimizador de logs, Spark, Hadoop, HBase, Hive, Impala, Linux, Docker, conversores e validadores de dados Spark (Avro/Parquet/JSON/CSV/INI/XML/YAML), Travis CI, AWS CloudFormation, Elasticsearch, Solr, etc.
★ 824+0Variação de estrelas nos últimos 7 dias - #28
Pacote Go de alto desempenho para leitura e escrita de arquivos Parquet
★ 769+2Variação de estrelas nos últimos 7 dias - #29
Graph Data Science: uma camada de abstração em Python para construir grafos de conhecimento, integrada com bibliotecas de grafos populares – sobre Pandas, NetworkX, RAPIDS, RDFlib, pySHACL, PyVis, morph-kgc, pslpython, pyarrow, etc.
★ 691+2Variação de estrelas nos últimos 7 dias - #30
Copiar para/de Parquet no S3, Azure Blob Storage, Google Cloud Storage, armazenamentos http(s), arquivos locais ou fluxo de entrada/saída padrão a partir do PostgreSQL
★ 685+0Variação de estrelas nos últimos 7 dias