data-processing
Dépôts open source suivis étiquetés data-processing, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de data-processing sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés data-processing.
- #1
MARVIS-Agent : agent de risque de crédit polyvalent pour le développement de modèles, la validation, le traitement des données, l'ingénierie des fonctionnalités et les flux de travail stratégiques.
★ 518
- #1
Framework ETL Python pour le traitement de flux, l'analyse en temps réel, les pipelines LLM et le RAG.
★ 62 365-36Évolution des étoiles sur les 7 derniers jours - #2
Moteur incrémental pour agents à long terme 🌟 Mettez une étoile si vous aimez !
★ 11 430+48Évolution des étoiles sur les 7 derniers jours - #3
Collection de commandes Bash et astuces de terminal pour le traitement de données et la maintenance Linux.
★ 10 767+5Évolution des étoiles sur les 7 derniers jours - #4
Miller est l'équivalent de awk, sed, cut, join et sort pour les données indexées par nom telles que CSV, TSV et JSON tabulaire.
★ 10 005+4Évolution des étoiles sur les 7 derniers jours - #5
Requêtage, transformation et modification unifiés pour JSON, TOML, YAML, XML, INI, HCL, KDL et CSV.
★ 8 028+7Évolution des étoiles sur les 7 derniers jours - #6
Préparation de données simplifiée grâce aux derniers opérateurs et pipelines basés sur les LLM.
★ 7 825+164Évolution des étoiles sur les 7 derniers jours - #7
Moteur de pipeline IA haute performance avec un cœur en C++ et plus de 50 nœuds extensibles en Python. Construisez, déboguez et mettez à l'échelle des flux de travail LLM avec plus de 13 fournisseurs de modèles, plus de 8 bases de données vectorielles et une orchestration d'agents, le tout depuis votre IDE. Inclut une extension VS Code, des SDK TypeScript/Python et un déploiement Docker.
★ 7 371+416Évolution des étoiles sur les 7 derniers jours - #8
Traitement de données pour et avec des modèles de fondation !
★ 6 949+28Évolution des étoiles sur les 7 derniers jours - #9
Bibliothèque accélérée par GPU contenant des blocs de construction hautement optimisés et un moteur d'exécution pour le traitement de données, afin d'accélérer l'entraînement et l'inférence en deep learning.
★ 5 738+4Évolution des étoiles sur les 7 derniers jours - #10★ 5 002+5Évolution des étoiles sur les 7 derniers jours
- #11
Une bibliothèque de test de données statistiques légère, flexible et expressive.
★ 4 443+5Évolution des étoiles sur les 7 derniers jours - #12
Plateforme native Kubernetes pour exécuter des tâches de données et de streaming massivement parallèles
★ 2 827+2Évolution des étoiles sur les 7 derniers jours - #13
Couche de contexte pour données non structurées : jeux de données typés et versionnés sur S3, GCS et Azure.
★ 2 811+3Évolution des étoiles sur les 7 derniers jours - #14
Ingestion et traitement de données concurrents et multi-étapes avec Elixir.
★ 2 677+1Évolution des étoiles sur les 7 derniers jours - #15
Boîte à outils pour l'apprentissage automatique, le traitement du langage naturel et la génération de texte avec TensorFlow. Fait partie du projet CASL : http://casl-project.ai/
★ 2 389+0Évolution des étoiles sur les 7 derniers jours - #16★ 2 048+1Évolution des étoiles sur les 7 derniers jours
- #17
Boîte à outils évolutive de prétraitement et de curation de données pour les LLM.
★ 1 740+12Évolution des étoiles sur les 7 derniers jours - #18★ 1 538+2Évolution des étoiles sur les 7 derniers jours
- #19★ 1 518+0Évolution des étoiles sur les 7 derniers jours
- #20
Code source accompagnant le livre : Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1 428+1Évolution des étoiles sur les 7 derniers jours - #21
Distribuez et exécutez des charges de travail IA sur Kubernetes comme par magie en Python, tel PyTorch pour l'infrastructure ML.
★ 1 224+0Évolution des étoiles sur les 7 derniers jours - #22
Outil en ligne de commande pour télécharger et extraire des données de pages HTML/XML ou d'API JSON, en utilisant CSS, XPath 3.0, XQuery 3.0, JSONiq ou la correspondance de motifs. Il peut également créer ou transformer des documents XML/HTML/JSON.
★ 843+0Évolution des étoiles sur les 7 derniers jours - #23
Déduplication de texte tout-en-un
★ 765+0Évolution des étoiles sur les 7 derniers jours - #24
HStreamDB est une base de données de streaming open-source et native pour le cloud, conçue pour l'IoT et au-delà. Modernisez votre stack de données pour les applications en temps réel.
★ 722+0Évolution des étoiles sur les 7 derniers jours - #25★ 705+1Évolution des étoiles sur les 7 derniers jours
- #26
Une liste sur Apache Kafka
★ 591+0Évolution des étoiles sur les 7 derniers jours - #27★ 581+1Évolution des étoiles sur les 7 derniers jours
- #28
Un outil qui utilise des simulations de Monte-Carlo avancées et le traitement parallèle Turbit pour créer des scénarios prédictifs possibles pour Bitcoin.
★ 526+0Évolution des étoiles sur les 7 derniers jours - #29
MARVIS-Agent : agent de risque de crédit polyvalent pour le développement de modèles, la validation, le traitement des données, l'ingénierie des fonctionnalités et les flux de travail stratégiques.
★ 518+2Évolution des étoiles sur les 7 derniers jours - #30★ 505+1Évolution des étoiles sur les 7 derniers jours