model-serving
Erfasste Open-Source-Repos mit dem Tag model-serving, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit model-serving am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit model-serving getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1★ 90.415+745Sterne-Änderung der letzten 7 Tage
- #2
Der einfachste Weg, KI-Apps und -Modelle bereitzustellen – Erstellen Sie Modell-Inferenz-APIs, Job-artige Warteschlangen, LLM-Apps, Multi-Modell-Pipelines und mehr!
★ 8.813+18Sterne-Änderung der letzten 7 Tage - #3★ 6.457+229Sterne-Änderung der letzten 7 Tage
- #4
Standardisierte, verteilte generative und prädiktive KI-Inferenzplattform für skalierbare Bereitstellungen mit mehreren Frameworks auf Kubernetes
★ 5.840+25Sterne-Änderung der letzten 7 Tage - #5★ 5.243+10Sterne-Änderung der letzten 7 Tage
- #6
In diesem Repository teile ich nützliche Notizen und Referenzen zur Bereitstellung von Modellen für Deep Learning in der Produktion.
★ 4.376+1Sterne-Änderung der letzten 7 Tage - #7
🚀 Awesome System for Machine Learning ⚡️ KI-System-Papers und Praxis in der Industrie. ⚡️ Systeme für Machine Learning, LLM (Large Language Model), GenAI (Generative AI). 🍻 OSDI, NSDI, SIGCOMM, SoCC, MLSys usw. 🗃️ Llama3, Mistral usw. 🧑💻 Video-Tutorials.
★ 4.318+27Sterne-Änderung der letzten 7 Tage - #8
LightLLM ist ein Python-basiertes LLM-Inferenz- und Bereitstellungsframework, das sich durch ein leichtgewichtigenes Design, einfache Skalierbarkeit und hohe Leistung auszeichnet.
★ 4.251+21Sterne-Änderung der letzten 7 Tage - #9
FEDML - Die vereinheitlichte und skalierbare ML-Bibliothek für verteiltes Training im großen Maßstab, Modellbereitstellung und föderiertes Lernen. FEDML Launch, ein Cloud-übergreifender Scheduler, ermöglicht zudem die Ausführung beliebiger KI-Jobs auf jeder GPU-Cloud oder jedem On-Premise-Cluster. Basierend auf dieser Bibliothek ist TensorOpera AI (https://TensorOpera.ai) Ihre generative KI-Plattform im großen Maßstab.
★ 4.061-1Sterne-Änderung der letzten 7 Tage - #10★ 3.826-2Sterne-Änderung der letzten 7 Tage
- #11
Hochleistungs-Inferenz-Framework für große Sprachmodelle, mit Fokus auf Effizienz, Flexibilität und Verfügbarkeit.
★ 2.998+5Sterne-Änderung der letzten 7 Tage - #12
Von der Community gepflegtes Hardware-Plugin für vLLM auf Ascend
★ 2.730+53Sterne-Änderung der letzten 7 Tage - #13
OpenLake ist eine hochleistungsfähige Speicherengine für effiziente LLM-Inferenz und GPU-Training
★ 2.346+9Sterne-Änderung der letzten 7 Tage - #14★ 2.227+3Sterne-Änderung der letzten 7 Tage
- #15★ 2.076+0Sterne-Änderung der letzten 7 Tage
- #16
MLRun ist eine Open-Source-MLOps-Plattform zum schnellen Erstellen und Verwalten kontinuierlicher ML-Anwendungen über ihren gesamten Lebenszyklus. MLRun lässt sich in Ihre Entwicklungs- und CI/CD-Umgebung integrieren und automatisiert die Bereitstellung von Produktionsdaten, ML-Pipelines und Online-Anwendungen.
★ 1.694+0Sterne-Änderung der letzten 7 Tage - #17
Ein Open-Source-DevOps-Tool der CNCF zum Paketieren und Versionieren von KI/ML-Modellen, Datensätzen, Code und Konfigurationen in ein OCI-Artefakt.
★ 1.409+5Sterne-Änderung der letzten 7 Tage - #18★ 1.320+6Sterne-Änderung der letzten 7 Tage
- #19★ 1.303+1Sterne-Änderung der letzten 7 Tage
- #20★ 1.196+1Sterne-Änderung der letzten 7 Tage
- #21
SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.
★ 978+70Sterne-Änderung der letzten 7 Tage - #22★ 974+0Sterne-Änderung der letzten 7 Tage
- #23
Skalierbarer Inferenz-Server für mit OpenVINO™ optimierte Modelle.
★ 921+3Sterne-Änderung der letzten 7 Tage - #24
Eine hochoptimierte LLM-Inferenz-Beschleunigungs-Engine für Llama und dessen Varianten.
★ 908+0Sterne-Änderung der letzten 7 Tage - #25
Ein Hochleistungs-Framework für die Bereitstellung von ML-Modellen mit dynamischem Batching und CPU/GPU-Pipelines zur vollständigen Ausnutzung Ihrer Rechenmaschine
★ 902+0Sterne-Änderung der letzten 7 Tage - #26
Serverloses LLM-Hosting für alle.
★ 711+6Sterne-Änderung der letzten 7 Tage - #27
Ollama für klassische ML-Modelle. Ein AOT-Compiler, der XGBoost-, LightGBM-, scikit-learn-, CatBoost- und ONNX-Modelle in nativen C99-Inferenzcode umwandelt. Ein Befehl zum Laden, ein Befehl zum Bereitstellen. 336x schneller als Python-Inferenz.
★ 687-1Sterne-Änderung der letzten 7 Tage - #28
Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2
★ 660+4Sterne-Änderung der letzten 7 Tage - #29
FastAPI-Grundgerüst für die produktionsreife Bereitstellung von Machine-Learning-Modellen.
★ 603-1Sterne-Änderung der letzten 7 Tage - #30
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 502—Sterne-Änderung der letzten 7 Tage