big-data
Các kho mã nguồn mở đang theo dõi được gắn thẻ big-data, sắp xếp theo số sao.
- #31
Công cụ dữ liệu hiệu năng cao cho AI và khối lượng công việc đa thức (multimodal). Xử lý hình ảnh, âm thanh, video và dữ liệu có cấu trúc ở bất kỳ quy mô nào
★ 5.736+4Thay đổi số sao trong 7 ngày qua - #32
Thư viện Python Machine Learning đơn giản và phân tán, chuyển đổi các thuật toán ML cho Spark
★ 5.245+3Thay đổi số sao trong 7 ngày qua - #33★ 5.180+2Thay đổi số sao trong 7 ngày qua
- #34★ 5.082+2Thay đổi số sao trong 7 ngày qua
- #35
Stream Framework là một thư viện Python, cho phép bạn xây dựng bảng tin, luồng hoạt động và hệ thống thông báo sử dụng Cassandra và/hoặc Redis. Các tác giả của Stream-Framework cũng cung cấp dịch vụ đám mây cho công nghệ bảng tin:
★ 4.742-2Thay đổi số sao trong 7 ngày qua - #36
⚡️ Một component Vue hỗ trợ danh sách dữ liệu số lượng lớn với hiệu suất kết xuất cao và hiệu quả.
★ 4.505-1Thay đổi số sao trong 7 ngày qua - #37
Dễ dàng chuyển đổi các tập hợp lớn URL hình ảnh thành một bộ dữ liệu hình ảnh. Có thể tải xuống, thay đổi kích thước và đóng gói 100 triệu URL trong 20 giờ trên một máy duy nhất.
★ 4.445+2Thay đổi số sao trong 7 ngày qua - #38
CrateDB là cơ sở dữ liệu SQL phân tán và có thể mở rộng để lưu trữ và phân tích lượng lớn dữ liệu gần như thời gian thực, ngay cả với các truy vấn phức tạp. Nó tương thích với PostgreSQL và dựa trên Lucene.
★ 4.432+3Thay đổi số sao trong 7 ngày qua - #39★ 4.399+2Thay đổi số sao trong 7 ngày qua
- #40
Lộ trình Khoa học Dữ liệu từ A đến Z
★ 4.354+3Thay đổi số sao trong 7 ngày qua - #41
🔨 🍇 💻 🚀 GraphScope: Hệ thống tính toán đồ thị quy mô lớn một điểm dừng (one-stop) từ Alibaba | 一站式图计算系统
★ 3.557+1Thay đổi số sao trong 7 ngày qua - #42
Bộ phân tích cú pháp và từ vựng SQL có thể mở rộng cho Rust
★ 3.446+9Thay đổi số sao trong 7 ngày qua - #43
Apache Paimon là một định dạng hồ chứa dữ liệu cho phép xây dựng Kiến trúc Realtime Lakehouse với Flink và Spark cho cả hoạt động stream và batch.
★ 3.388+3Thay đổi số sao trong 7 ngày qua - #44★ 3.374+1Thay đổi số sao trong 7 ngày qua
- #45
Giải pháp thay thế Apache Spark thả nổi được viết bằng Rust, hợp nhất xử lý hàng loạt, xử lý luồng và khối lượng công việc AI đòi hỏi tính toán cao.
★ 3.341+4Thay đổi số sao trong 7 ngày qua - #46
Một cơ sở dữ liệu đồ thị hỗ trợ hơn 100 tỷ dữ liệu, hiệu năng và khả năng mở rộng cao (Bao gồm OLTP Engine & REST-API & Backends)
★ 3.167+6Thay đổi số sao trong 7 ngày qua - #47★ 3.098+1Thay đổi số sao trong 7 ngày qua
- #48★ 2.656+14Thay đổi số sao trong 7 ngày qua
- #49
ArcticDB là một cơ sở dữ liệu DataFrame phi máy chủ, hiệu năng cao được xây dựng cho hệ sinh thái Python Data Science.
★ 2.505+8Thay đổi số sao trong 7 ngày qua - #50★ 2.379+2Thay đổi số sao trong 7 ngày qua
- #51★ 2.311+0Thay đổi số sao trong 7 ngày qua
- #52
YTsaurus là một nền tảng dữ liệu lớn (big data) nguồn mở, có khả năng mở rộng và chịu lỗi tốt.
★ 2.203+0Thay đổi số sao trong 7 ngày qua - #53
Apache Fluss là một bộ lưu trữ phát trực tuyến được xây dựng cho phân tích thời gian thực.
★ 2.131+11Thay đổi số sao trong 7 ngày qua - #54
Engine truy vấn phân tán Apache DataFusion Ballista
★ 2.127+7Thay đổi số sao trong 7 ngày qua - #55★ 2.022+0Thay đổi số sao trong 7 ngày qua
- #56
Apache BookKeeper - dịch vụ lưu trữ có khả năng mở rộng, chịu lỗi và độ trễ thấp được tối ưu hóa cho khối lượng công việc chỉ nối thêm (append-only)
★ 2.011+1Thay đổi số sao trong 7 ngày qua - #57
Trừu tượng hóa và tăng tốc dữ liệu linh hoạt, co giãn cho các ứng dụng BigData/AI trên đám mây. (Dự án thuộc CNCF)
★ 1.967+0Thay đổi số sao trong 7 ngày qua - #58★ 1.913+0Thay đổi số sao trong 7 ngày qua
- #59
🚀 Hơn 500 tài nguyên được tuyển chọn cho Phân tích Dữ liệu & Khoa học Dữ liệu: Python, SQL, Thống kê, ML, AI, Trực quan hóa, Bảng gian lận, Lộ trình, Chuẩn bị phỏng vấn. Dành cho người mới bắt đầu và chuyên gia.
★ 1.890+8Thay đổi số sao trong 7 ngày qua - #60
Trình tăng tốc Auron cho khung tính toán phân tán (ví dụ: Spark) tận dụng khả năng thực thi vector hóa gốc để tăng tốc độ xử lý truy vấn
★ 1.798+2Thay đổi số sao trong 7 ngày qua