data-pipeline
data-pipeline टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर data-pipeline के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और data-pipeline टैग वाली रिपॉजिटरी।
- #1
ELT पाइपलाइनों और AI एजेंट्स के लिए ओपन-सोर्स डेटा मूवमेंट — API, डेटाबेस और फ़ाइलों से लेकर वेयरहाउस, लेक और AI एप्लिकेशन तक। सेल्फ-होस्टेड और क्लाउड दोनों।
★ 21,981+9पिछले 7 दिनों में स्टार का बदलाव - #2
सभी डेटाबेस में शarding, स्केलेबिलिटी और सुरक्षा के लिए वितरित SQL के साथ डेटा इंटेलिजेंस को सशक्त बनाना।
★ 20,788-3पिछले 7 दिनों में स्टार का बदलाव - #3
विभिन्न प्रकार के डेटाबेस के लिए डेटा कैप्चर बदलें। कृपया https://github.com/debezium/dbz/issues पर समस्याएँ दर्ज करें।
★ 13,072+16पिछले 7 दिनों में स्टार का बदलाव - #4
C++ कोर और 50+ पायथन-एक्सटेंसिबल नोड्स के साथ उच्च-प्रदर्शन AI पाइपलाइन इंजन। अपने IDE से 13+ मॉडल प्रदाताओं, 8+ वेक्टर डेटाबेस और एजेंट ऑर्केस्ट्रेशन के साथ LLM वर्कफ़्लो बनाएं, डीबग करें और स्केल करें। इसमें VS Code एक्सटेंशन, TypeScript/Python SDKs और Docker परिनियोजन शामिल हैं।
★ 7,641+270पिछले 7 दिनों में स्टार का बदलाव - #5★ 7,032+2पिछले 7 दिनों में स्टार का बदलाव
- #6
फाउंडेशन मॉडल के लिए और उनके साथ डेटा प्रोसेसिंग! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6,975+26पिछले 7 दिनों में स्टार का बदलाव - #7★ 6,469+0पिछले 7 दिनों में स्टार का बदलाव
- #8★ 5,019+2पिछले 7 दिनों में स्टार का बदलाव
- #9
Golang और React में गोपनीयता और सुरक्षा पर केंद्रित Segment का विकल्प
★ 4,483+4पिछले 7 दिनों में स्टार का बदलाव - #10
शुरुआत से डेटा इंजीनियरिंग सीखने के लिए उपयोगी संसाधनों की सूची
★ 4,009-2पिछले 7 दिनों में स्टार का बदलाव - #11
ingestr एक ही कमांड के साथ किसी भी डेटाबेस के बीच डेटा को निर्बाध रूप से कॉपी करने के लिए एक CLI टूल है।
★ 3,935+18पिछले 7 दिनों में स्टार का बदलाव - #12
उन टीमों के लिए सेल्फ-होस्टेबल वर्कफ़्लो ऑर्केस्ट्रेटर जिनका मुख्य काम ऑर्केस्ट्रेशन नहीं है।
★ 3,832+17पिछले 7 दिनों में स्टार का बदलाव - #13★ 3,440+0पिछले 7 दिनों में स्टार का बदलाव
- #14
आपके एजेंट को आवश्यक सभी मॉडलों के लिए ओपन-सोर्स इन्फेरेंस सर्वर और प्रोडक्शन क्लस्टर।
★ 3,030+173पिछले 7 दिनों में स्टार का बदलाव - #15
मशीन लर्निंग मॉडल और डेटा पाइपलाइन के लिए एक ओपन-सोर्स डेटा लॉगिंग लाइब्रेरी। 📚 समय के साथ डेटा की गुणवत्ता और मॉडल के प्रदर्शन की दृश्यता प्रदान करता है। 🛡️ गोपनीयता-संरक्षण डेटा संग्रह का समर्थन करता है, सुरक्षा और मजबूती सुनिश्चित करता है। 📈
★ 2,831+0पिछले 7 दिनों में स्टार का बदलाव - #16
डेटा और एनालिटिक्स इंजीनियरों के लिए dbt-नेटिव डेटा ऑब्जर्बेबिलिटी समाधान। मिनटों में अपने डेटा पाइपलाइन मॉनिटर करें। प्रीमियम सुविधाओं के साथ सेल्फ-होस्टेड या क्लाउड सर्विस के रूप में उपलब्ध।
★ 2,405+4पिछले 7 दिनों में स्टार का बदलाव - #17
Go के लिए एक हल्की स्ट्रीम प्रोसेसिंग लाइब्रेरी
★ 2,172+1पिछले 7 दिनों में स्टार का बदलाव - #18★ 2,083-1पिछले 7 दिनों में स्टार का बदलाव
- #19
🔥🔥🔥 ओपन सोर्स रिवर्स ETL - hightouch और census का विकल्प।
★ 1,673+0पिछले 7 दिनों में स्टार का बदलाव - #20
OLake - टेबल ऑप्टिमाइज़ेशन के साथ Apache Iceberg के लिए सबसे तेज डेटाबेस, Kafka और S3 प्रतिकृति (OLake Fusion कहा जाता है)। रियल-टाइम एनालिटिक्स के लिए कुशल, त्वरित और स्केलेबल डेटा इंजेशन। समर्थित स्रोत: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3।
★ 1,435+2पिछले 7 दिनों में स्टार का बदलाव - #21
पुस्तक के साथ आने वाला स्रोत कोड: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1,429+1पिछले 7 दिनों में स्टार का बदलाव - #22
ओपन-सोर्स ETL/ELT जिसे आप अपने सर्वर या क्लाउड पर तैनात कर सकते हैं। DuckDB पर निर्मित: नो-कोड/लो-कोड विजुअल पाइपलाइन या SQL, 385 घटक, dbt, CDC, डेटा गुणवत्ता, रिवर्स ETL, लाइनage, AI एजेंटों के लिए MCP। कोई वेंडर क्लाउड नहीं, प्रति-पंक्ति बिलिंग नहीं।
★ 1,262+15पिछले 7 दिनों में स्टार का बदलाव - #23
zerocode-tdd डेटा पाइपलाइनों, ETL, REST API, Kafka, डेटाबेस और लोड परिदृश्यों के लिए एक समुदाय-विकसित, मुफ्त, ओपन-सोर्स और परिणाम-संचालित स्वचालित परीक्षण टूल है। सब कुछ सरल JSON या YAML में परिभाषित है — बिना किसी कोडिंग के।
★ 1,013+1पिछले 7 दिनों में स्टार का बदलाव - #24
Estuary के साथ डेटा प्रवाह को प्रबंधित करके, उन सिस्टम्स को लगातार सिंक्रोनाइज़ करें जहाँ आपका डेटा रहता है, उन सिस्टम्स के साथ जहाँ आप इसे रखना चाहते हैं।
★ 972+7पिछले 7 दिनों में स्टार का बदलाव - #25
SeaTunnel भारी डेटा (ऑफ़लाइन और वास्तविक समय) के सिंक्रनाइज़ेशन और रूपांतरण के लिए एक वितरित, उच्च-प्रदर्शन डेटा एकीकरण प्लेटफ़ॉर्म है।
★ 877+5पिछले 7 दिनों में स्टार का बदलाव - #26★ 876+2पिछले 7 दिनों में स्टार का बदलाव
- #27
विषम कंप्यूटिंग वातावरण में मशीन-लर्निंग/उच्च-प्रदर्शन/क्वांटम-कंप्यूटिंग वर्कफ़्लो को ऑर्केस्ट्रेट करने के लिए Pythonic टूल।
★ 869+0पिछले 7 दिनों में स्टार का बदलाव - #28
प्रैक्टिकल डेटा इंजीनियरिंग: एक हैंड्स-ऑन रियल-एस्टेट प्रोजेक्ट गाइड
★ 823+2पिछले 7 दिनों में स्टार का बदलाव - #29
कंड्यूट डेटा स्टोर के बीच डेटा को स्ट्रीम करता है। Kafka Connect का विकल्प। किसी JVM की आवश्यकता नहीं है।
★ 608+0पिछले 7 दिनों में स्टार का बदलाव - #30
एनालिटिक्स प्लेटफॉर्म और डेटा इंजीनियरिंग इकोसिस्टम में उपयोग किए जाने वाले ओपन सोर्स टूल्स की एक क्यूरेटेड सूची
★ 604+4पिछले 7 दिनों में स्टार का बदलाव