spark
Erfasste Open-Source-Repos mit dem Tag spark, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit spark am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit spark getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Data Engineering Zoomcamp ist ein kostenloser 9-wöchiger Kurs zum Aufbau produktionsreifer Datenpipelines. Die nächste Kohorte beginnt im Januar 2026. Trete dem Kurs hier bei 👇🏼
★ 45.069+270Sterne-Änderung der letzten 7 Tage - #2★ 43.901+49Sterne-Änderung der letzten 7 Tage
- #3
Data Science Python-Notebooks: Deep Learning (TensorFlow, Theano, Caffe, Keras), scikit-learn, Kaggle, Big Data (Spark, Hadoop MapReduce, HDFS), matplotlib, pandas, NumPy, SciPy, Python-Grundlagen, AWS und diverse Befehlszeilen.
★ 29.334+27Sterne-Änderung der letzten 7 Tage - #4
Mache deine Unternehmensdaten datengetrieben. Verbinde dich mit jeder Datenquelle, visualisiere leicht, erstelle Dashboards und teile deine Daten.
★ 28.767+5Sterne-Änderung der letzten 7 Tage - #5
Neueste Docker-Container-Technologie, von realen Beispielen beste Praktiken lernen! | Docker & Container Technologien verstehen und mit echter DevOps-Praxis arbeiten.
★ 26.224+15Sterne-Änderung der letzten 7 Tage - #6
Einführungsleitfaden für Big Data :star:
★ 16.958+6Sterne-Änderung der letzten 7 Tage - #7
Liste von Data-Science-Spickzetteln, um die Welt zu erobern
★ 16.330+4Sterne-Änderung der letzten 7 Tage - #8
GUI für die ChatGPT-API und viele LLMs. Unterstützt Agents, dateibasierte QA, GPT-Finetuning und Abfragen mit Websuche. Alles mit einer übersichtlichen Benutzeroberfläche.
★ 15.276-4Sterne-Änderung der letzten 7 Tage - #9
Flink Learning Blog. http://www.54tianzhisheng.cn/ Enthält Flink-Einführungen, Konzepte, Prinzipien, Praxisfälle, Leistungsoptimierung, Quellcodeanalysen und mehr. Beinhaltet Lernbeispiele zu Flink Connector, Metrics, Library, DataStream API, Table API & SQL sowie große Projektbeispiele für den Praxiseinsatz von Flink (PVUV, Protokollspeicherung, Echtzeit-Deduplizierung von Milliarden Daten, Überwachung und Alarmierung). Willkommen zur Unterstützung meiner Kolumne „Big Data Real-Time Computing Engine Flink Practical Application and Performance Optimization“.
★ 15.095-3Sterne-Änderung der letzten 7 Tage - #10
Ein technischer Leitfaden für Java-Entwickler mit Interviewfragen, Systemarchitektur, Karriere-Tipps und gängigen Middleware-Komponenten, um sich weiterzuentwickeln.
★ 14.734+6Sterne-Änderung der letzten 7 Tage - #11
Sammlung von Tools zum Bereitstellen und Trainieren von Deep-Learning-Modellen mit der JVM. Zu den Highlights gehören der Modellimport für Keras, TensorFlow und ONNX/PyTorch, eine modulare und kompakte C++-Bibliothek zur Ausführung von mathematischem Code sowie eine Java-basierte Mathe-Bibliothek auf Basis der C++-Kernbibliothek. Enthält zudem SameDiff: eine PyTorch/TensorFlow-ähnliche Bibliothek zum Ausführen von Deep Learning...
★ 14.248+3Sterne-Änderung der letzten 7 Tage - #12★ 9.579+24Sterne-Änderung der letzten 7 Tage
- #13
Ein Open-Source-Speicherframework, das den Aufbau einer Lakehouse-Architektur mit Compute-Engines wie Spark, PrestoDB, Flink, Trino, Hive und APIs ermöglicht
★ 8.962+17Sterne-Änderung der letzten 7 Tage - #14
🧙 Datenpelines für die Integration und Transformation von Daten erstellen, ausführen und verwalten.
★ 8.814+5Sterne-Änderung der letzten 7 Tage - #15
H2O ist eine Open-Source-, verteilte, schnelle und skalierbare Plattform für maschinelles Lernen: Deep Learning, Gradient Boosting (GBM) & XGBoost, Random Forest, Generalized Linear Modeling (GLM mit Elastic Net), K-Means, PCA, Generalized Additive Models (GAM), RuleFit, Support Vector Machine (SVM), Stacked Ensembles, Automatic Machine Learning (AutoML) usw.
★ 7.496+1Sterne-Änderung der letzten 7 Tage - #16★ 7.231+1Sterne-Änderung der letzten 7 Tage
- #17
Ein flexibler und leistungsstarker Parameter-Server für maschinelles Lernen im großen Maßstab
★ 6.787+1Sterne-Änderung der letzten 7 Tage - #18
Webbasiertes Notizbuch für datengesteuerte, interaktive Datenanalyse und kollaborative Dokumente mit SQL, Scala und mehr.
★ 6.655+3Sterne-Änderung der letzten 7 Tage - #19
Einfache und verteilte Machine-Learning-Python-Bibliothek zur Portierung von ML-Algorithmen für Spark
★ 5.242+4Sterne-Änderung der letzten 7 Tage - #20
cube studio开源云原生一站式机器学习/深度学习/大模型AI平台,mlops算法链路全流程,算力租赁平台,notebook在线开发,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务VGPU虚拟化,边缘计算,标注平台自动化标注,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库,AI模型市场,支持国产cpu/gpu/npu 昇腾生态,支持RDMA,支持pytorch/tf/mxnet/deepspeed/paddle/colossalai/horovod/ray/volcano等分布式
★ 5.075-2Sterne-Änderung der letzten 7 Tage - #21★ 4.159+2Sterne-Änderung der letzten 7 Tage
- #22★ 3.931+1Sterne-Änderung der letzten 7 Tage
- #23
Ein besseres komprimiertes Bitset in Java: verwendet von Apache Spark, Netflix Atlas, Apache Pinot, Tablesaw und vielen anderen.
★ 3.919+3Sterne-Änderung der letzten 7 Tage - #24
Deequ ist eine auf Apache Spark basierende Bibliothek zum Definieren von „Unit-Tests für Daten“, die die Datenqualität in großen Datensätzen messen
★ 3.642-1Sterne-Änderung der letzten 7 Tage - #25
🔨 Generieren Sie strukturierte SQL-Anweisungen mit JSON, implementiert mit Vue3 + TypeScript + Vite + Ant Design + MonacoEditor. Ein einfaches Projekt (logiklastig, seitenleicht), ideal zum Üben~
★ 3.424-3Sterne-Änderung der letzten 7 Tage - #26
Apache Linkis baut eine Rechen-Middleware-Schicht auf, um die Verbindung, Governance und Orchestrierung zwischen den oberen Anwendungen und den zugrunde liegenden Daten-Engines zu erleichtern.
★ 3.407+2Sterne-Änderung der letzten 7 Tage - #27
Apache Paimon ist ein Lake-Format, das den Aufbau einer Realtime-Lakehouse-Architektur mit Flink und Spark sowohl für Streaming- als auch für Batch-Operationen ermöglicht.
★ 3.385+7Sterne-Änderung der letzten 7 Tage - #28★ 3.373+2Sterne-Änderung der letzten 7 Tage
- #29
Drop-in-Ersatz für Apache Spark, geschrieben in Rust, der Batch-Verarbeitung, Stream-Verarbeitung und rechenintensive KI-Workloads vereint.
★ 3.337+15Sterne-Änderung der letzten 7 Tage - #30
DataSphereStudio ist ein All-in-One-Portal für die Entwicklung und Verwaltung von Datenanwendungen, das Szenarien wie Datenaustausch, Maskierung/Bereinigung, Analyse/Mining, Qualitätsmessung, Visualisierung und Task-Scheduling abdeckt.
★ 3.263+2Sterne-Änderung der letzten 7 Tage