big-data
标记 big-data 主题、收录中的开源项目,按星标数排序。
- #61★ 1,766+0近 7 天星标变化
- #62★ 1,694+0近 7 天星标变化
- #63
作为 IPython / Jupyter 笔记本的大数据分析与机器学习 Apache Spark & Python (pySpark) 教程
★ 1,660+0近 7 天星标变化 - #64★ 1,618+0近 7 天星标变化
- #65
:bar_chart: :clipboard: 使用 YAML 或 JSON 文件的仪表板
★ 1,582+0近 7 天星标变化 - #66
Dremio —— 现代数据中缺失的环节
★ 1,492+0近 7 天星标变化 - #67
高性能数据存储解决方案
★ 1,452+0近 7 天星标变化 - #68★ 1,384+0近 7 天星标变化
- #69
一个先进且成熟的开源 MPP (大规模并行处理) 数据库。Greenplum Database 的开源替代方案。
★ 1,382+0近 7 天星标变化 - #70
Scikit-learn 的扩展套件,是加速 Scikit-learn 应用程序的无缝方式
★ 1,356+0近 7 天星标变化 - #71
PySpark-Tutorial 提供使用 PySpark 的基础算法
★ 1,280+0近 7 天星标变化 - #72★ 1,270+0近 7 天星标变化
- #73
用于查看与查询 Apache Parquet 文件的简易 Windows 桌面应用程序
★ 1,231+0近 7 天星标变化 - #74
GraphFrames 是一个为 Apache Spark 提供基于 DataFrame 的图(Graph)包。
★ 1,202+0近 7 天星标变化 - #75★ 1,171+0近 7 天星标变化
- #76★ 1,165+0近 7 天星标变化
- #77
ClickBench:分析型数据库的基准测试工具
★ 1,102+7近 7 天星标变化 - #78
📙 超赞的数据目录与可观测性平台。
★ 1,069+3近 7 天星标变化 - #79
ADAM 是一个基因组分析平台,采用 Apache Avro、Apache Spark 和 Apache Parquet 建构特制档案格式。采用 Apache 2 授权。
★ 1,059+0近 7 天星标变化 - #80★ 1,042+2近 7 天星标变化
- #81
Apache Flink Kubernetes Operator
★ 1,032+2近 7 天星标变化 - #82
数据科学、机器学习、大数据与商业分析职业资源库
★ 1,022+1近 7 天星标变化 - #83
ListenBrainz 项目的服务器,包含其提供的前端 (javascript/react) 代码以及 LB 使用的所有数据处理组件。
★ 1,009+3近 7 天星标变化 - #84
适用于 Apache Spark 的 NVIDIA cuDF 插件 - 使用 GPU 加速 Apache Spark
★ 1,002+4近 7 天星标变化 - #85
Sparkling Water 在 Spark 集群中提供 H2O 功能
★ 980+1近 7 天星标变化 - #86
安全数据共享的开放协议
★ 958+0近 7 天星标变化 - #87
⚡ 用于统计的单遍算法
★ 897+0近 7 天星标变化 - #88
另一个包含西班牙语数据工程基础概念、技术挑战与资源的存储库 🧙✨
★ 896+0近 7 天星标变化 - #89★ 873+0近 7 天星标变化
- #90
AI 项目
★ 868+0近 7 天星标变化