big-data
Các kho mã nguồn mở đang theo dõi được gắn thẻ big-data, sắp xếp theo số sao.
- #61★ 1.766-1Thay đổi số sao trong 7 ngày qua
- #62
Data lake bảo mật mã nguồn mở dành cho săn lùng mối đe dọa, phát hiện & phản ứng, và phân tích an ninh mạng ở quy mô petabyte trên AWS
★ 1.694+0Thay đổi số sao trong 7 ngày qua - #63
Hướng dẫn Apache Spark & Python (pySpark) cho Phân tích Dữ liệu lớn và Máy học dưới dạng Jupyter / IPython notebook
★ 1.660+1Thay đổi số sao trong 7 ngày qua - #64
Tonbo là một cơ sở dữ liệu nhúng dành cho các môi trường thực thi serverless và edge.
★ 1.618+3Thay đổi số sao trong 7 ngày qua - #65
:bar_chart: :clipboard: Bảng điều khiển sử dụng file YAML hoặc JSON
★ 1.582+1Thay đổi số sao trong 7 ngày qua - #66
Dremio - mảnh ghép còn thiếu trong dữ liệu hiện đại
★ 1.492+1Thay đổi số sao trong 7 ngày qua - #67
Giải pháp lưu trữ dữ liệu hiệu năng cao
★ 1.452+0Thay đổi số sao trong 7 ngày qua - #68★ 1.384+0Thay đổi số sao trong 7 ngày qua
- #69
Một cơ sở dữ liệu MPP (Xử lý song song hàng loạt) mã nguồn mở tiên tiến và trưởng thành. Giải pháp thay thế mã nguồn mở cho Greenplum Database.
★ 1.382+8Thay đổi số sao trong 7 ngày qua - #70
Phần mở rộng cho Scikit-learn là cách mượt mà để tăng tốc ứng dụng Scikit-learn của bạn
★ 1.356+0Thay đổi số sao trong 7 ngày qua - #71
PySpark-Tutorial cung cấp các thuật toán cơ bản sử dụng PySpark
★ 1.280+1Thay đổi số sao trong 7 ngày qua - #72
Hệ thống lưu trữ phân tán có khả năng mở rộng, đáng tin cậy, được tối ưu hóa cho phân tích dữ liệu và khối lượng công việc lưu trữ đối tượng.
★ 1.270+4Thay đổi số sao trong 7 ngày qua - #73
Ứng dụng desktop Windows đơn giản để xem và truy vấn tệp Apache Parquet
★ 1.231+2Thay đổi số sao trong 7 ngày qua - #74
GraphFrames là một gói dành cho Apache Spark cung cấp các đồ thị dựa trên DataFrame
★ 1.202+1Thay đổi số sao trong 7 ngày qua - #75
Apache Amoro (đang ủ) là một hệ thống quản lý Lakehouse được xây dựng trên các định dạng hồ dữ liệu mở.
★ 1.171+2Thay đổi số sao trong 7 ngày qua - #76★ 1.165+2Thay đổi số sao trong 7 ngày qua
- #77
ClickBench: Điểm chuẩn dành cho các cơ sở dữ liệu phân tích
★ 1.094+3Thay đổi số sao trong 7 ngày qua - #78
📙 Danh mục Data Catalogs và nền tảng Observability tuyệt vời.
★ 1.068+4Thay đổi số sao trong 7 ngày qua - #79
ADAM là nền tảng phân tích bộ gen với các định dạng file chuyên biệt được xây dựng bằng Apache Avro, Apache Spark và Apache Parquet. Cấp phép theo Apache 2.
★ 1.059+2Thay đổi số sao trong 7 ngày qua - #80
Một nhánh (fork) của ClickHouse hỗ trợ tìm kiếm vector hiệu suất cao và tìm kiếm toàn văn bản.
★ 1.040+1Thay đổi số sao trong 7 ngày qua - #81
Apache Flink Kubernetes Operator
★ 1.031+3Thay đổi số sao trong 7 ngày qua - #82
Kho tài nguyên nghề nghiệp cho Khoa học Dữ liệu, Machine Learning, Big Data và Phân tích Kinh doanh
★ 1.022+1Thay đổi số sao trong 7 ngày qua - #83
Máy chủ cho dự án ListenBrainz, bao gồm mã giao diện người dùng (javascript/react) và tất cả các thành phần xử lý dữ liệu mà LB sử dụng.
★ 1.006+5Thay đổi số sao trong 7 ngày qua - #84
Plugin NVIDIA cuDF cho Apache Spark - tăng tốc Apache Spark bằng GPU
★ 998+1Thay đổi số sao trong 7 ngày qua - #85
Sparkling Water cung cấp tính năng của H2O bên trong cụm Spark
★ 980+0Thay đổi số sao trong 7 ngày qua - #86
Một giao thức mở để chia sẻ dữ liệu bảo mật
★ 957+0Thay đổi số sao trong 7 ngày qua - #87
Các thuật toán một lượt (single-pass) cho thống kê.
★ 897+0Thay đổi số sao trong 7 ngày qua - #88
Một kho lưu trữ khác chứa các khái niệm cơ bản, thử thách kỹ thuật và tài nguyên về kỹ thuật dữ liệu bằng tiếng Tây Ban Nha.
★ 896+0Thay đổi số sao trong 7 ngày qua - #89
Cấu trúc dữ liệu học máy tiên tiến cho phép tra cứu, tìm kiếm tiền nhiệm, tìm kiếm phạm vi và cập nhật nhanh chóng trong các mảng chứa hàng tỷ mục với dung lượng lưu trữ ít hơn nhiều so với các chỉ mục truyền thống
★ 873+1Thay đổi số sao trong 7 ngày qua - #90
Các dự án AI
★ 868+1Thay đổi số sao trong 7 ngày qua