data-engineering
Erfasste Open-Source-Repos mit dem Tag data-engineering, sortiert nach Sternen.
- #61
Saubere APIs für die Datenbereinigung. Python-Implementierung des R-Pakets Janitor
★ 1.498+0Sterne-Änderung der letzten 7 Tage - #62
Quellcode zum Buch: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1.429+1Sterne-Änderung der letzten 7 Tage - #63
Die erste Open-Source-Plattform zur Datenerkennung und -beobachtbarkeit. Wir erleichtern Datenexperten das Leben, damit Sie sich auf Ihr Geschäft konzentrieren können.
★ 1.427+1Sterne-Änderung der letzten 7 Tage - #64
Eine umfassende Python-Paketvorlage zum Starten und Standardisieren Ihrer MLOps-Initiativen und Daten-Pipelines.
★ 1.416+0Sterne-Änderung der letzten 7 Tage - #65
Eine kuratierte Sammlung von über 300 technischen Blogartikeln von Top-Tech-Unternehmen. Erfahren Sie, wie die besten Engineering-Teams reale Probleme im großen Maßstab lösen.
★ 1.388+8Sterne-Änderung der letzten 7 Tage - #66
Der umfassendste SQL-Leitfaden von einem Experten aus der Praxis! Lernen Sie alles von den Grundlagen bis zu fortgeschrittenen Abfragen, Optimierungen und echtem SQL.
★ 1.384+7Sterne-Änderung der letzten 7 Tage - #67
Quilt ist eine Scientific-Data-Management-Plattform auf AWS, die Teams und KI dabei unterstützt, Daten durch tief versionierte, kontextreiche Datenpakete zu finden, zu vertrauen und wiederzuverwenden.
★ 1.370+0Sterne-Änderung der letzten 7 Tage - #68
Open-Source-ETL/ELT, das Sie auf Ihren eigenen Servern oder in der Cloud bereitstellen. Basiert auf DuckDB: No-Code/Low-Code visuelle Pipelines oder SQL, 385 Komponenten, dbt, CDC, Datenqualität, Reverse ETL, Lineage, MCP für AI-Agenten. Keine Anbieter-Cloud, keine Abrechnung pro Zeile.
★ 1.262+15Sterne-Änderung der letzten 7 Tage - #69
Eine kuratierte, aber unvollständige Liste datenzentrierter KI-Ressourcen.
★ 1.159+1Sterne-Änderung der letzten 7 Tage - #70
Ein Wissenszentrum für Data Engineering & Machine Learning
★ 1.146+0Sterne-Änderung der letzten 7 Tage - #71
Heimat des Open Data Contract Standard (ODCS).
★ 1.118+18Sterne-Änderung der letzten 7 Tage - #72
📙 Awesome Data Catalogs und Observability Platforms.
★ 1.068+5Sterne-Änderung der letzten 7 Tage - #73
Datenverträge durchsetzen
★ 1.060+10Sterne-Änderung der letzten 7 Tage - #74
🌊 Synchronisieren Sie kontinuierlich die Systeme, in denen sich Ihre Daten befinden, mit den Systemen, in denen Sie sie haben möchten, indem Sie Ihre Datenströme mit Estuary verwalten. 🌊
★ 972+7Sterne-Änderung der letzten 7 Tage - #75
FlyFish ist eine Datenvisualisierungs-Programmierplattform. Wir können auf einfache Weise schnell ein Datenmodell erstellen und durch Ziehen schnell eine Reihe von Datenvisualisierungslösungen generieren.
★ 961+0Sterne-Änderung der letzten 7 Tage - #76
Ein umfassender Leitfaden zum Erstellen eines modernen Data Warehouse mit SQL Server, einschließlich ETL-Prozessen, Datenmodellierung und Analysen.
★ 934+16Sterne-Änderung der letzten 7 Tage - #77★ 921+0Sterne-Änderung der letzten 7 Tage
- #78
Ein weiteres Repository mit grundlegenden Konzepten, technischen Herausforderungen und Ressourcen zum Thema Data Engineering auf Spanisch 🧙✨
★ 896+1Sterne-Änderung der letzten 7 Tage - #79
Community-getriebenes, einfaches und dennoch leistungsstarkes Framework für schnelle, kostengünstige verteilte Compute-over-Data.
★ 871+1Sterne-Änderung der letzten 7 Tage - #80
Neum AI ist ein erstklassiges Framework zur Verwaltung der Erstellung und Synchronisierung von Vektor-Embeddings im großen Maßstab.
★ 867+0Sterne-Änderung der letzten 7 Tage - #81
Ergänzende Materialien für den Udemy-Kurs „The Complete dbt (Data Build Tool) Bootcamp“
★ 827+0Sterne-Änderung der letzten 7 Tage - #82
Praktische Data Engineering: Ein praxisorientierter Immobilienprojekt-Leitfaden
★ 823+2Sterne-Änderung der letzten 7 Tage - #83
Python-Framework zum Erstellen effizienter Datenpipiilines. Es fördert Modularität und Zusammenarbeit und ermöglicht die Erstellung komplexer Pipelines aus einfachen, wiederverwendbaren Komponenten.
★ 818+0Sterne-Änderung der letzten 7 Tage - #84
Open-Source-Agenten-Framework für Data Engineering für dbt, SQL und Cloud-Dateisysteme. Über 100 Tools, 10 Data Warehouses, KI-gestützt.
★ 808+6Sterne-Änderung der letzten 7 Tage - #85
Lernen Sie Ihre Daten besser kennen! Datavines ist eine Data-Observability-Plattform der nächsten Generation mit Unterstützung für Metadatenmanagement und Datenqualität.
★ 761+1Sterne-Änderung der letzten 7 Tage - #86
BigQuery mit BigFunctions optimieren
★ 759+0Sterne-Änderung der letzten 7 Tage - #87
Sammlung prominenter Praxisbeispiele gescheiterter Machine-Learning-Projekte
★ 751+0Sterne-Änderung der letzten 7 Tage - #88
VectorFlow ist eine hochvolumige Vektor-Embedding-Pipeline, die Rohdaten aufnimmt, in Vektoren umwandelt und in eine Vektordatenbank Ihrer Wahl schreibt.
★ 703+0Sterne-Änderung der letzten 7 Tage - #89
Eine datengesteuerte Engine für Datenintegration, -synchronisation, -austausch, -freigabe, Task-Konfiguration und -Scheduling. Nutzt Architektur mit getrennter Steuerung und Ausführung, mehrere Streaming-Ebenen und Plugin-Bibliotheken zur Bewältigung großer Datenmengen, hoher Berichterstattungsraten, häufiger Erfassung und heterogener Kompatibilität.
★ 696+0Sterne-Änderung der letzten 7 Tage - #90★ 626+2Sterne-Änderung der letzten 7 Tage