Zum Hauptinhalt springen
buildradar
Sign in
Thema · llm-serving

llm-serving

Erfasste Open-Source-Repos mit dem Tag llm-serving, sortiert nach Sternen.

Repos
25
Sterne gesamt
244.794
Sterne im Schnitt
9.792
Anteil
0,01%

Themen, die häufig gemeinsam mit llm-serving am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit llm-serving getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • vllm@vllm-project

    Ein hocheffizientes und speichereffizientes Inferenz- und Serving-Engine für LLMs

    90.817+402Sterne-Änderung der letzten 7 Tage
  • ray@ray-project

    Ray ist ein AI-Rechen-Engine. Ray besteht aus einem Core-Distributed-Runtime und einer Reihe von AI-Bibliotheken zur Beschleunigung von ML-Workloads.

    43.688+41Sterne-Änderung der letzten 7 Tage
  • llm-action@liguodongiot

    Dieses Projekt zielt darauf ab, Prinzipien und praktische Erfahrungen zu großen Modellen zu teilen (großmodellengineering, großmodell-Anwendungen)

    24.995+21Sterne-Änderung der letzten 7 Tage
  • TensorRT-LLM@NVIDIA

    TensorRT LLM bietet Benutzern eine benutzerfreundliche Python-API zum Definieren von Large Language Models (LLMs) und unterstützt modernste Optimierungen zur effizienten Inferenz auf NVIDIA-GPUs. TensorRT LLM enthält zudem Komponenten zum Erstellen von Python- und C++-Runtimes, die die Inferenzausführung performant steuern.

    14.536+38Sterne-Änderung der letzten 7 Tage
  • OpenLLM@bentoml

    Führen Sie beliebige Open-Source-LLMs wie DeepSeek und Llama als OpenAI-kompatiblen API-Endpunkt in der Cloud aus.

    12.524+1Sterne-Änderung der letzten 7 Tage
  • skypilot@skypilot-org

    Die KI-Compute-Plattform für führende Teams. SkyPilot verwandelt fragmentierte KI-Rechenleistung in einen einzigen KI-Supercomputer, sodass fortschrittliche KI-Teams benutzerdefinierte Intelligenz schneller entwickeln können.

    10.550+16Sterne-Änderung der letzten 7 Tage
  • BentoML@bentoml

    Der einfachste Weg, KI-Apps und -Modelle bereitzustellen – Erstellen Sie Modell-Inferenz-APIs, Job-artige Warteschlangen, LLM-Apps, Multi-Modell-Pipelines und mehr!

    8.817+4Sterne-Änderung der letzten 7 Tage
  • gpustack@gpustack

    Ein GPU-Cluster-Manager für hochleistungsfähiges KI-Modell-Serving (vLLM, SGLang) und bedarfsgesteuerte GPU-Instanzen mit SSH-Zugang.

    5.593+21Sterne-Änderung der letzten 7 Tage
  • superduper@superduper-io

    Superduper: End-to-End-Framework zum Erstellen benutzerdefinierter KI-Anwendungen und Agents.

    5.318+1Sterne-Änderung der letzten 7 Tage
  • lorax@predibase

    Multi-LoRA-Inferenzserver, der auf Tausende von feinabgestimmten LLMs skaliert

    3.827+1Sterne-Änderung der letzten 7 Tage
  • FastDeploy@PaddlePaddle

    Leistungsstarkes Inferenz- und Bereitstellungs-Toolkit für LLMs und VLMs auf Basis von PaddlePaddle

    3.714+3Sterne-Änderung der letzten 7 Tage
  • chitu@thu-pacman

    Hochleistungs-Inferenz-Framework für große Sprachmodelle, mit Fokus auf Effizienz, Flexibilität und Verfügbarkeit.

    2.997-1Sterne-Änderung der letzten 7 Tage
  • vllm-ascend@vllm-project

    Von der Community gepflegtes Hardware-Plugin für vLLM auf Ascend

    2.749+19Sterne-Änderung der letzten 7 Tage
  • MoBA@MoonshotAI

    MoBA: Mixture of Block Attention für LLMs mit langem Kontext

    2.174+1Sterne-Änderung der letzten 7 Tage
  • aici@microsoft

    AICI: Prompts als (Wasm)-Programme

    2.076+0Sterne-Änderung der letzten 7 Tage
  • InferenceX@SemiAnalysisAI

    Open-Source-Forschungsplattform für kontinuierliche Inferenz-Benchmarks — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & bald™ TPUv6e/v7/Trainium2/3

    1.613+33Sterne-Änderung der letzten 7 Tage
  • parallax@GradientHQ

    Parallax ist ein verteiltes Model-Serving-Framework, mit dem Sie überall Ihr eigenes KI-Cluster aufbauen können

    1.372+4Sterne-Änderung der letzten 7 Tage
  • rtp-llm@alibaba

    RTP-LLM: Alibabas leistungsstarke LLM-Inferenz-Engine für vielfältige Anwendungen.

    1.325+6Sterne-Änderung der letzten 7 Tage
  • kvcached@ovg-project

    Virtualisierter Elastic KV Cache für dynamisches GPU-Sharing und mehr

    1.275+130Sterne-Änderung der letzten 7 Tage
  • Nanoflow@efeslab

    Ein durchsatzorientiertes Hochleistungs-Serving-Framework für LLMs

    975+1Sterne-Änderung der letzten 7 Tage
  • ZhiLight@zhihu

    Eine hochoptimierte LLM-Inferenz-Beschleunigungs-Engine für Llama und dessen Varianten.

    908+0Sterne-Änderung der letzten 7 Tage
  • mosec@mosecorg

    Ein Hochleistungs-Framework für die Bereitstellung von ML-Modellen mit dynamischem Batching und CPU/GPU-Pipelines zur vollständigen Ausnutzung Ihrer Rechenmaschine

    902+0Sterne-Änderung der letzten 7 Tage
  • helix@helixml

    ♾️ Private Agenten-Flotte mit Spec Coding. Jeder Agent erhält seinen eigenen GPU-beschleunigten Desktop. Führen Sie Claude, Codex, Gemini und offene Modelle auf einem vollständigen privaten AI Stack aus ♾️

    804+1Sterne-Änderung der letzten 7 Tage
  • pegainfer@pegainfer-project

    Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2

    677+14Sterne-Änderung der letzten 7 Tage
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    LLM (Large Language Model) Fine-Tuning.

    579+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen