data-engineering
Các kho mã nguồn mở đang theo dõi được gắn thẻ data-engineering, sắp xếp theo số sao.
- #61
Các API sạch cho việc làm sạch dữ liệu. Triển khai Python của gói R Janitor.
★ 1.498+0Thay đổi số sao trong 7 ngày qua - #62
Mã nguồn đi kèm sách: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017
★ 1.429+1Thay đổi số sao trong 7 ngày qua - #63
Nền tảng khám phá và quan sát dữ liệu mã nguồn mở đầu tiên. Chúng tôi giúp công việc của các chuyên gia dữ liệu trở nên dễ dàng hơn để bạn có thể tập trung vào doanh nghiệp của mình.
★ 1.427+1Thay đổi số sao trong 7 ngày qua - #64
Một mẫu gói Python toàn diện để khởi1 đầu và chuẩn hóa các sáng kiến MLOps và đường ống dữ liệu của bạn.
★ 1.416+0Thay đổi số sao trong 7 ngày qua - #65
Một bộ sưu tập tuyển chọn gồm hơn 300 bài viết blog kỹ thuật từ các công ty công nghệ hàng đầu. Tìm hiểu cách các nhóm kỹ thuật tốt nhất giải quyết các vấn đề trong thế giới thực ở quy mô lớn.
★ 1.388+8Thay đổi số sao trong 7 ngày qua - #66
Hướng dẫn SQL toàn diện nhất từ một chuyên gia thực tế! Học mọi thứ từ cơ bản đến truy vấn nâng cao, tối ưu hóa và SQL thực tế
★ 1.384+7Thay đổi số sao trong 7 ngày qua - #67
Quilt là Nền tảng Quản lý Dữ liệu Khoa học trên AWS giúp các nhóm và AI tìm kiếm, tin tưởng và tái sử dụng dữ liệu thông qua các gói dữ liệu có phiên bản sâu và giàu ngữ cảnh.
★ 1.370+0Thay đổi số sao trong 7 ngày qua - #68
Mã nguồn mở ETL/ELT để bạn triển khai trên server riêng hoặc đám mây. Xây dựng trên DuckDB: chuỗi quy trình trực quan no-code/low-code hoặc SQL, 385 thành phần, dbt, CDC, chất lượng dữ liệu, reverse ETL, lineage, MCP cho AI agent. Không có đám mây nhà cung cấp, không tính phí theo dòng.
★ 1.262+15Thay đổi số sao trong 7 ngày qua - #69
Danh sách các tài nguyên AI tập trung vào dữ liệu được tuyển chọn nhưng chưa đầy đủ.
★ 1.159+1Thay đổi số sao trong 7 ngày qua - #70
Trung tâm kiến thức về Kỹ thuật dữ liệu & Học máy
★ 1.146+0Thay đổi số sao trong 7 ngày qua - #71
Trang chủ của Open Data Contract Standard (ODCS).
★ 1.118+18Thay đổi số sao trong 7 ngày qua - #72
📙 Danh mục Data Catalogs và nền tảng Observability tuyệt vời.
★ 1.068+5Thay đổi số sao trong 7 ngày qua - #73
Thực thi Hợp đồng Dữ liệu (Data Contracts).
★ 1.060+10Thay đổi số sao trong 7 ngày qua - #74
🌊 Liên tục đồng bộ hóa các hệ thống lưu trữ dữ liệu của bạn sang các hệ thống bạn muốn, bằng cách quản lý luồng dữ liệu với Estuary. 🌊
★ 972+7Thay đổi số sao trong 7 ngày qua - #75
FlyFish là một nền tảng lập trình trực quan hóa dữ liệu. Chúng ta có thể tạo mô hình dữ liệu nhanh chóng một cách đơn giản và nhanh chóng tạo ra một tập hợp các giải pháp trực quan hóa dữ liệu bằng cách kéo thả.
★ 961+0Thay đổi số sao trong 7 ngày qua - #76
Hướng dẫn toàn diện về cách xây dựng kho dữ liệu hiện đại với SQL Server, bao gồm các quy trình ETL, mô hình hóa dữ liệu và phân tích.
★ 934+16Thay đổi số sao trong 7 ngày qua - #77★ 921+0Thay đổi số sao trong 7 ngày qua
- #78
Một kho lưu trữ khác chứa các khái niệm cơ bản, thử thách kỹ thuật và tài nguyên về kỹ thuật dữ liệu bằng tiếng Tây Ban Nha.
★ 896+1Thay đổi số sao trong 7 ngày qua - #79
Framework do cộng đồng phát triển, đơn giản nhưng mạnh mẽ để tính toán phân tán trên Dữ liệu nhanh chóng và tiết kiệm chi phí.
★ 871+1Thay đổi số sao trong 7 ngày qua - #80
Neum AI là framework hàng đầu để quản lý việc tạo và đồng bộ hóa vector embeddings ở quy mô lớn.
★ 867+0Thay đổi số sao trong 7 ngày qua - #81
Tài liệu bổ sung cho khóa học The Complete dbt (Data Build Tool) Bootcamp trên Udemy
★ 827+0Thay đổi số sao trong 7 ngày qua - #82
Kỹ thuật dữ liệu thực tế: Hướng dẫn dự án bất động sản thực hành
★ 823+2Thay đổi số sao trong 7 ngày qua - #83
Framework Python để xây dựng các đường ống dữ liệu hiệu quả. Nó thúc đẩy tính mô-đun và cộng tác, cho phép tạo ra các đường ống phức tạp từ các thành phần đơn giản, có thể tái sử dụng.
★ 818+0Thay đổi số sao trong 7 ngày qua - #84
Công cụ kỹ thuật dữ liệu tác nhân mã nguồn mở cho dbt, SQL và kho dữ liệu đám mây. Hơn 100 công cụ, 10 kho dữ liệu, được hỗ trợ bởi AI.
★ 808+6Thay đổi số sao trong 7 ngày qua - #85
Hiểu rõ dữ liệu của bạn hơn! Datavines là nền tảng quan sát dữ liệu thế hệ mới, hỗ trợ quản lý siêu dữ liệu và chất lượng dữ liệu.
★ 761+1Thay đổi số sao trong 7 ngày qua - #86
Tăng cường sức mạnh cho BigQuery với BigFunctions
★ 759+0Thay đổi số sao trong 7 ngày qua - #87★ 751+0Thay đổi số sao trong 7 ngày qua
- #88
VectorFlow là một pipeline vector embedding lưu lượng lớn, giúp tiếp nhận dữ liệu thô, chuyển đổi thành vector và ghi vào cơ sở dữ liệu vector tùy chọn của bạn.
★ 703+0Thay đổi số sao trong 7 ngày qua - #89
Công cụ luồng dữ liệu là một engine điều khiển dữ liệu cấp thấp dành cho tích hợp, đồng bộ hóa, trao đổi, chia sẻ, cấu hình và lập lịch tác vụ dữ liệu. Công cụ này sử dụng kiến trúc tách biệt quản lý và thực thi, đa tầng luồng và thư viện plugin để giải quyết các vấn đề thực tế về tác vụ dữ liệu quy mô lớn, báo cáo và thu thập dữ liệu tần suất cao, cũng như khả năng tương thích dữ liệu không đồng nhất.
★ 696+0Thay đổi số sao trong 7 ngày qua - #90★ 626+2Thay đổi số sao trong 7 ngày qua