data-pipeline
Repositori open source terpantau bertanda data-pipeline, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan data-pipeline di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda data-pipeline.
- #1
Pemindahan data sumber terbuka untuk pipeline ELT dan agen AI — dari API, database & file ke gudang data, danau data, dan aplikasi AI. Tersedia dalam versi self-hosted dan Cloud.
★ 21.981+9Perubahan bintang dalam 7 hari terakhir - #2
Memberdayakan kecerdasan data dengan SQL terdistribusi untuk sharding, skalabilitas, dan keamanan di semua database.
★ 20.788-3Perubahan bintang dalam 7 hari terakhir - #3
Change data capture untuk berbagai database. Silakan laporkan masalah di https://github.com/debezium/dbz/issues.
★ 13.072+16Perubahan bintang dalam 7 hari terakhir - #4
Engine AI pipeline berkinerja tinggi dengan core C++ dan 50+ node yang dapat diperluas dengan Python. Buat, debug, dan tingkatkan skala alur kerja LLM dengan 13+ penyedia model, 8+ database vektor, dan orkestrasi agent, semuanya dari IDE Anda. Termasuk ekstensi VS Code, SDK TypeScript/Python, dan penyebaran Docker.
★ 7.641+270Perubahan bintang dalam 7 hari terakhir - #5★ 7.032+2Perubahan bintang dalam 7 hari terakhir
- #6
Pemrosesan data untuk dan dengan foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6.975+26Perubahan bintang dalam 7 hari terakhir - #7★ 6.469+0Perubahan bintang dalam 7 hari terakhir
- #8★ 5.019+2Perubahan bintang dalam 7 hari terakhir
- #9
Alternatif Segment yang berfokus pada privasi dan keamanan, dibangun dengan Golang dan React
★ 4.483+4Perubahan bintang dalam 7 hari terakhir - #10
Daftar sumber daya berguna untuk mempelajari Data Engineering dari awal.
★ 4.009-2Perubahan bintang dalam 7 hari terakhir - #11
ingestr adalah alat CLI untuk menyalin data antar database apa pun dengan satu perintah secara mulus.
★ 3.935+18Perubahan bintang dalam 7 hari terakhir - #12
Orkestrator alur kerja yang dapat di-host sendiri untuk tim yang pekerjaan utamanya bukan orkestrasi. YAML deklaratif untuk skrip, perintah SSH, kontainer, dll; memisahkan alur kerja dari logika bisnis. Satu biner, tanpa database, berjalan pada sumber daya perangkat keras terbatas. Alternatif untuk Airflow / Cron / Penjadwal Tugas.
★ 3.832+17Perubahan bintang dalam 7 hari terakhir - #13
Memphis.dev adalah platform data streaming yang sangat dapat menskalakan dan mudah digunakan
★ 3.440+0Perubahan bintang dalam 7 hari terakhir - #14
Server inferensi sumber terbuka dan kluster produksi untuk semua model yang dibutuhkan agen Anda.
★ 3.030+173Perubahan bintang dalam 7 hari terakhir - #15
Pustaka pencatatan data sumber terbuka untuk model machine learning dan pipeline data. 📚 Memberikan visibilitas ke dalam kualitas data & kinerja model dari waktu ke waktu. 🛡️ Mendukung pengumpulan data yang menjaga privasi, memastikan keamanan & ketahanan. 📈
★ 2.831+0Perubahan bintang dalam 7 hari terakhir - #16
Solusi observabilitas data berbasis dbt untuk data & analytics engineer. Pantau pipeline data Anda dalam hitungan menit. Tersedia sebagai layanan self-hosted atau cloud dengan fitur premium.
★ 2.405+4Perubahan bintang dalam 7 hari terakhir - #17
Pustaka pemrosesan aliran data yang ringan untuk Go
★ 2.172+1Perubahan bintang dalam 7 hari terakhir - #18★ 2.083-1Perubahan bintang dalam 7 hari terakhir
- #19
🔥🔥🔥 Reverse ETL sumber terbuka - alternatif untuk hightouch dan census.
★ 1.673+0Perubahan bintang dalam 7 hari terakhir - #20
OLake - Replikasi Database, Kafka & S3 Tercepat ke Apache Iceberg dengan optimasi tabel (Disebut OLake Fusion). ⚡ Ingesti data yang efisien, cepat, dan dapat ditingkatkan untuk analitik real-time. Sumber yang didukung: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1.435+2Perubahan bintang dalam 7 hari terakhir - #21
Kode sumber pendamping buku: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1.429+1Perubahan bintang dalam 7 hari terakhir - #22
ETL/ELT open-source yang Anda deploy di server atau cloud Anda sendiri. Dibangun di atas DuckDB: pipeline visual tanpa kode/rendah kode atau SQL, 385 komponen, dbt, CDC, kualitas data, reverse ETL, lineage, MCP untuk agen AI. Tanpa cloud vendor, tanpa penagihan per baris.
★ 1.262+15Perubahan bintang dalam 7 hari terakhir - #23
zerocode-tdd adalah pengujian otomatis berbasis hasil yang dikembangkan oleh komunitas untuk Data Pipeline, ETL, REST API, Kafka, Database, dan skenario beban yang didefinisikan dalam JSON atau YAML.
★ 1.013+1Perubahan bintang dalam 7 hari terakhir - #24
🌊 Sinkronisasikan sistem tempat data Anda berada secara terus-menerus ke sistem tempat Anda _menginginkannya_ berada, dengan mengelola aliran data Anda menggunakan Estuary. 🌊
★ 972+7Perubahan bintang dalam 7 hari terakhir - #25
SeaTunnel adalah platform integrasi data terdistribusi dan berkinerja tinggi untuk sinkronisasi dan transformasi data besar-besaran (offline & real-time).
★ 877+5Perubahan bintang dalam 7 hari terakhir - #26★ 876+2Perubahan bintang dalam 7 hari terakhir
- #27
Alat Pythonic untuk mengorkestrasi alur kerja machine learning/performa tinggi/komputasi kuantum di lingkungan komputasi heterogen.
★ 869+0Perubahan bintang dalam 7 hari terakhir - #28
Data Engineering Praktis: Panduan Proyek Real-Estate Langsung
★ 823+2Perubahan bintang dalam 7 hari terakhir - #29
Conduit mengalirkan data antar penyimpanan data. Pengganti Kafka Connect. Tidak memerlukan JVM.
★ 608+0Perubahan bintang dalam 7 hari terakhir - #30
Daftar kurasi alat sumber terbuka yang digunakan dalam platform analitik dan ekosistem data engineering
★ 603+3Perubahan bintang dalam 7 hari terakhir