data-pipeline
Các kho mã nguồn mở đang theo dõi được gắn thẻ data-pipeline, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng data-pipeline trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ data-pipeline.
- #1
Di chuyển dữ liệu mã nguồn mở cho các đường ống ELT và AI agents — từ API, cơ sở dữ liệu & tệp đến kho dữ liệu, hồ dữ liệu và các ứng dụng AI. Hỗ trợ cả tự lưu trữ và Cloud.
★ 21.981+9Thay đổi số sao trong 7 ngày qua - #2
Trao quyền cho trí tuệ dữ liệu với SQL phân tán để sharding, khả năng mở rộng và bảo mật trên tất cả các cơ sở dữ liệu.
★ 20.788-3Thay đổi số sao trong 7 ngày qua - #3
Thay đổi bắt dữ liệu (change data capture) cho nhiều cơ sở dữ liệu khác nhau. Vui lòng ghi nhận sự cố tại https://github.com/debezium/dbz/issues.
★ 13.072+16Thay đổi số sao trong 7 ngày qua - #4
Công cụ pipeline AI hiệu năng cao với lõi C++ và hơn 50 node mở rộng bằng Python. Xây dựng, gỡ lỗi và mở rộng quy trình làm việc LLM với hơn 13 nhà cung cấp mô hình, hơn 8 cơ sở dữ liệu vector và điều phối agent, tất cả ngay từ IDE của bạn. Bao gồm tiện ích mở rộng VS Code, SDK TypeScript/Python và triển khai Docker.
★ 7.641+270Thay đổi số sao trong 7 ngày qua - #5★ 7.032+2Thay đổi số sao trong 7 ngày qua
- #6
Xử lý dữ liệu cho và bằng foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6.975+26Thay đổi số sao trong 7 ngày qua - #7★ 6.469+0Thay đổi số sao trong 7 ngày qua
- #8★ 5.019+2Thay đổi số sao trong 7 ngày qua
- #9
Giải pháp thay thế Segment tập trung vào quyền riêng tư và bảo mật, viết bằng Golang và React
★ 4.483+4Thay đổi số sao trong 7 ngày qua - #10
Danh sách tài nguyên hữu ích để học Data Engineering từ đầu
★ 4.009-2Thay đổi số sao trong 7 ngày qua - #11
ingestr là một công cụ CLI giúp sao chép dữ liệu giữa bất kỳ cơ sở dữ liệu nào một cách mượt mà chỉ với một lệnh.
★ 3.935+18Thay đổi số sao trong 7 ngày qua - #12
Trình điều phối quy trình làm việc tự lưu trữ dành cho các nhóm có công việc chính không phải là điều phối. YAML khai báo trên các tập lệnh, lệnh SSH, container, v.v. của bạn; giữ quy trình làm việc tách biệt với logic nghiệp vụ. Một file nhị phân duy nhất, không có cơ sở dữ liệu, chạy trên tài nguyên phần cứng hạn chế. Giải pháp thay thế cho Airflow / Cron / Job Scheduler.
★ 3.832+17Thay đổi số sao trong 7 ngày qua - #13
Memphis.dev là một nền tảng truyền phát dữ liệu có khả năng mở rộng cao và dễ sử dụng
★ 3.440+0Thay đổi số sao trong 7 ngày qua - #14
Máy chủ suy luận mã nguồn mở và cụm sản xuất cho tất cả các mô hình mà agent của bạn cần.
★ 3.030+173Thay đổi số sao trong 7 ngày qua - #15
Thư viện ghi nhật ký dữ liệu mã nguồn mở cho các mô hình machine learning và data pipeline. 📚 Cung cấp khả năng hiển thị chất lượng dữ liệu & hiệu suất mô hình theo thời gian. 🛡️ Hỗ trợ thu thập dữ liệu bảo vệ quyền riêng tư, đảm bảo an toàn & tính mạnh mẽ. 📈
★ 2.831+0Thay đổi số sao trong 7 ngày qua - #16
Giải pháp quan sát dữ liệu gốc dbt dành cho các kỹ sư dữ liệu & phân tích. Theo dõi các đường ống dữ liệu của bạn trong vài phút. Có sẵn dưới dạng tự lưu trữ hoặc dịch vụ đám mây với các tính năng cao cấp.
★ 2.405+4Thay đổi số sao trong 7 ngày qua - #17
Thư viện xử lý luồng nhẹ dành cho Go
★ 2.172+1Thay đổi số sao trong 7 ngày qua - #18★ 2.083-1Thay đổi số sao trong 7 ngày qua
- #19
🔥🔥🔥 Reverse ETL mã nguồn mở - giải pháp thay thế cho hightouch và census.
★ 1.673+0Thay đổi số sao trong 7 ngày qua - #20
OLake - Công cụ replication Cơ sở dữ liệu, Kafka & S3 nhanh nhất sang Apache Iceberg với tính năng tối ưu hóa bảng (được gọi là OLake Fusion). ⚡ Thu nạp dữ liệu hiệu quả, nhanh chóng và có khả năng mở rộng cho phân tích thời gian thực. Các nguồn được hỗ trợ: Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3.
★ 1.435+2Thay đổi số sao trong 7 ngày qua - #21
Mã nguồn đi kèm sách: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1.429+1Thay đổi số sao trong 7 ngày qua - #22
Mã nguồn mở ETL/ELT để bạn triển khai trên server riêng hoặc đám mây. Xây dựng trên DuckDB: chuỗi quy trình trực quan no-code/low-code hoặc SQL, 385 thành phần, dbt, CDC, chất lượng dữ liệu, reverse ETL, lineage, MCP cho AI agent. Không có đám mây nhà cung cấp, không tính phí theo dòng.
★ 1.262+15Thay đổi số sao trong 7 ngày qua - #23
zerocode-tdd là công cụ kiểm thử tự động hướng kết quả, mã nguồn mở, miễn phí do cộng đồng phát triển dành cho Data Pipelines, ETL, REST API, Kafka (Data Streams), Cơ sở dữ liệu và các kịch bản tải. Tất cả được định nghĩa bằng JSON hoặc YAML đơn giản — hoàn toàn không cần lập trình.
★ 1.013+1Thay đổi số sao trong 7 ngày qua - #24
🌊 Liên tục đồng bộ hóa các hệ thống lưu trữ dữ liệu của bạn sang các hệ thống bạn muốn, bằng cách quản lý luồng dữ liệu với Estuary. 🌊
★ 972+7Thay đổi số sao trong 7 ngày qua - #25
SeaTunnel là nền tảng tích hợp dữ liệu phân tán, hiệu suất cao dùng để đồng bộ và chuyển đổi dữ liệu lớn (ngoại tuyến và thời gian thực).
★ 878+5Thay đổi số sao trong 7 ngày qua - #26★ 876+2Thay đổi số sao trong 7 ngày qua
- #27
Công cụ theo phong cách Python để điều phối các quy trình làm việc về học máy/hiệu năng cao/điện toán lượng tử trong các môi trường tính toán không đồng nhất.
★ 869+0Thay đổi số sao trong 7 ngày qua - #28
Kỹ thuật dữ liệu thực tế: Hướng dẫn dự án bất động sản thực hành
★ 823+2Thay đổi số sao trong 7 ngày qua - #29
Conduit truyền dữ liệu giữa các kho lưu trữ. Giải pháp thay thế Kafka Connect, không yêu cầu JVM.
★ 608+0Thay đổi số sao trong 7 ngày qua - #30
Danh sách chọn lọc các công cụ mã nguồn mở được sử dụng trong các nền tảng phân tích và hệ sinh thái kỹ thuật dữ liệu (data engineering)
★ 604+4Thay đổi số sao trong 7 ngày qua