data-pipeline
Erfasste Open-Source-Repos mit dem Tag data-pipeline, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit data-pipeline am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit data-pipeline getaggt wurden.
- #1
Open-Source-Datentransfer für ELT-Pipelines und KI-Agenten – von APIs, Datenbanken und Dateien bis hin zu Warehouses, Lakes und KI-Anwendungen. Sowohl selbst gehostet als auch in der Cloud.
★ 21.981+9Sterne-Änderung der letzten 7 Tage - #2
Stärkung der Datenintelligenz durch verteiltes SQL für Sharding, Skalierbarkeit und Sicherheit über alle Datenbanken hinweg.
★ 20.788-3Sterne-Änderung der letzten 7 Tage - #3
Change Data Capture für verschiedene Datenbanken. Bitte melden Sie Probleme unter https://github.com/debezium/dbz/issues.
★ 13.072+16Sterne-Änderung der letzten 7 Tage - #4
Hochleistungs-KI-Pipeline-Engine mit einem C++-Kern und über 50 per Python erweiterbaren Nodes. Erstellen, debuggen und skalieren Sie LLM-Workflows mit über 13 Modellanbietern, über 8 Vektordatenbanken und Agenten-Orchestrierung, alles direkt aus Ihrer IDE. Inklusive VS Code-Erweiterung, TypeScript/Python-SDKs und Docker-Deployment.
★ 7.641+270Sterne-Änderung der letzten 7 Tage - #5★ 7.032+2Sterne-Änderung der letzten 7 Tage
- #6
Datenverarbeitung für und mit Foundation Models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6.975+26Sterne-Änderung der letzten 7 Tage - #7★ 6.469+0Sterne-Änderung der letzten 7 Tage
- #8★ 5.019+2Sterne-Änderung der letzten 7 Tage
- #9
Datenschutz- und sicherheitsfokussierte Segment-Alternative in Golang und React
★ 4.483+4Sterne-Änderung der letzten 7 Tage - #10
Eine Liste nützlicher Ressourcen, um Data Engineering von Grund auf zu lernen.
★ 4.009-2Sterne-Änderung der letzten 7 Tage - #11
ingestr ist ein CLI-Tool, um Daten nahtlos mit einem einzigen Befehl zwischen beliebigen Datenbanken zu kopieren.
★ 3.935+18Sterne-Änderung der letzten 7 Tage - #12
Selbst gehosteter Workflow-Orchestrator für Teams, deren Hauptarbeit nicht aus Orchestrierung besteht. Deklaratives YAML für Skripte, SSH-Befehle, Container usw.; trennt Workflows von der Geschäftslogik. Eine Binärdatei, keine Datenbank, läuft auf ressourcenbeschränkter Hardware. Alternative zu Airflow / Cron / Job-Scheduler.
★ 3.832+17Sterne-Änderung der letzten 7 Tage - #13★ 3.440+0Sterne-Änderung der letzten 7 Tage
- #14
Open-Source-Inferenzserver und Produktionscluster für alle Modelle, die Ihr Agent benötigt.
★ 3.030+173Sterne-Änderung der letzten 7 Tage - #15
Eine Open-Source-Datenprotokollierungsbibliothek für Modelle des maschinellen Lernens und Daten-Pipelines. 📚 Bietet Einblick in Datenqualität und Modellleistung im Zeitverlauf. 🛡️ Unterstützt datenschutzfreundliche Datenerfassung für Sicherheit und Robustheit. 📈
★ 2.831+0Sterne-Änderung der letzten 7 Tage - #16
Die dbt-native Daten-Observability-Lösung für Data- und Analytics-Engineers. Überwachen Sie Ihre Daten-Pipelines in wenigen Minuten. Als Self-Hosted- oder Cloud-Service mit Premium-Funktionen verfügbar.
★ 2.405+4Sterne-Änderung der letzten 7 Tage - #17
Eine leichtgewichtige Stream-Processing-Bibliothek für Go
★ 2.172+1Sterne-Änderung der letzten 7 Tage - #18★ 2.083-1Sterne-Änderung der letzten 7 Tage
- #19
🔥🔥🔥 Open-Source-Reverse-ETL – Alternative zu Hightouch und Census.
★ 1.673+0Sterne-Änderung der letzten 7 Tage - #20
OLake – Die schnellste Replikation von Datenbanken, Kafka und S3 zu Apache Iceberg mit Tabellenoptimierung (genannt OLake Fusion). Effiziente, schnelle und skalierbare Datenaufnahme für Echtzeitanalysen. Unterstützte Quellen: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1.435+2Sterne-Änderung der letzten 7 Tage - #21
Quellcode zum Buch: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1.429+1Sterne-Änderung der letzten 7 Tage - #22
Open-Source-ETL/ELT, das Sie auf Ihren eigenen Servern oder in der Cloud bereitstellen. Basiert auf DuckDB: No-Code/Low-Code visuelle Pipelines oder SQL, 385 Komponenten, dbt, CDC, Datenqualität, Reverse ETL, Lineage, MCP für AI-Agenten. Keine Anbieter-Cloud, keine Abrechnung pro Zeile.
★ 1.262+15Sterne-Änderung der letzten 7 Tage - #23
zerocode-tdd ist ein von der Community entwickeltes, kostenloses, Open-Source-basiertes und ergebnisorientiertes automatisiertes Testen für Datenpipelines, ETL, REST-APIs, Kafka (Datenströme), Datenbanken und Lastszenarien – alles definiert in einfachem JSON oder YAML – ganz ohne Programmierung.
★ 1.013+1Sterne-Änderung der letzten 7 Tage - #24
🌊 Synchronisieren Sie kontinuierlich die Systeme, in denen sich Ihre Daten befinden, mit den Systemen, in denen Sie sie haben möchten, indem Sie Ihre Datenströme mit Estuary verwalten. 🌊
★ 972+7Sterne-Änderung der letzten 7 Tage - #25
SeaTunnel ist eine verteilte, leistungsstarke Datenintegrationsplattform für die Synchronisation und Transformation massiver Daten (Offline und Echtzeit).
★ 877+5Sterne-Änderung der letzten 7 Tage - #26★ 876+2Sterne-Änderung der letzten 7 Tage
- #27
Pythonisches Tool zur Orchestrierung von Workflows für maschinelles Lernen, High-Performance-Computing und Quantencomputing in heterogenen Rechenumgebungen.
★ 869+0Sterne-Änderung der letzten 7 Tage - #28
Praktische Data Engineering: Ein praxisorientierter Immobilienprojekt-Leitfaden
★ 823+2Sterne-Änderung der letzten 7 Tage - #29
Conduit streamt Daten zwischen Datenspeichern. Ersatz für Kafka Connect. Keine JVM erforderlich.
★ 608+0Sterne-Änderung der letzten 7 Tage - #30
Eine kuratierte Liste von Open-Source-Tools für Analyseplattformen und Data-Engineering-Ökosysteme
★ 604+4Sterne-Änderung der letzten 7 Tage