Zum Hauptinhalt springen
buildradar
Sign in
Thema · vllm

vllm

Erfasste Open-Source-Repos mit dem Tag vllm, sortiert nach Sternen.

Repos
51
Sterne gesamt
193.269
Sterne im Schnitt
3.790
Anteil
0,01%

Themen, die häufig gemeinsam mit vllm am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit vllm getaggt wurden.

  • UniRL@Tencent-Hunyuan

    UniRL ist ein Framework für das Reinforcement Learning multimodaler Einheitsmodelle

    921
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.

    808
  • FunASR@modelscope

    Open-Source-Spracherkennungs-Toolkit für Training, Inferenz, Streaming-ASR, VAD, Interpunktion, Sprecherdiarisierungs-Pipelines und OpenAI-kompatibles/MCP-Serving.

    20.072+108Sterne-Änderung der letzten 7 Tage
  • llama-cookbook@meta-llama

    Willkommen beim Llama Cookbook! Ihr Standard-Leitfaden für die Entwicklung mit Llama: Erste Schritte mit Inferenz, Fine-Tuning und RAG. Wir zeigen Ihnen auch, wie Sie End-to-End-Probleme mit der Llama-Modellfamilie lösen und diese bei verschiedenen Anbieterdiensten nutzen.

    18.559-2Sterne-Änderung der letzten 7 Tage
  • ✍🏻 Quellcode-Analysen, Systemdesign & Engineering-Blogs | Halfrost-Field: Notizen zu Quellcode-Analyse, Systemdesign und Engineering-Praxis

    13.220+3Sterne-Änderung der letzten 7 Tage
  • AI-Research-SKILLs@Orchestra-Research

    Umfangreiche Open-Source-Bibliothek für KI-Forschungs- und Ingenieurskompetenzen für jedes KI-Modell. Verpacken Sie die Fähigkeiten und Ihr claude code/codex/gemini Agent wird zu einem KI-Forschungsagenten mit voller Leistung. Gewartet von Orchestra Research.

    12.152+222Sterne-Änderung der letzten 7 Tage
  • LMCache@LMCache

    LMCache: Beschleunigen Sie Ihr LLM mit der schnellsten KV-Cache-Schicht

    11.562+256Sterne-Änderung der letzten 7 Tage
  • OpenRLHF@OpenRLHF

    Ein benutzerfreundliches, skalierbares und leistungsstarkes Agentic-RL-Framework basierend auf Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

    9.960+19Sterne-Änderung der letzten 7 Tage
  • inference@xorbitsai

    Ersetzen Sie GPT durch ein beliebiges LLM, indem Sie nur eine einzige Codezeile ändern. Mit Xinference können Sie Open-Source-, Sprach- und multimodale Modelle in der Cloud, on-premise oder auf Ihrem Laptop ausführen – alles über eine einheitliche, produktionsbereite Inferenz-API.

    9.528+21Sterne-Änderung der letzten 7 Tage
  • dynamo@ai-dynamo

    Ein verteiltes Inference-Serving-Framework auf Rechenzentrumsebene

    7.908+86Sterne-Änderung der letzten 7 Tage
  • Mooncake@kvcache-ai

    Mooncake ist die Serving-Plattform für Kimi, einen führenden LLM-Dienst von Moonshot AI.

    6.430+90Sterne-Änderung der letzten 7 Tage
  • kserve@kserve

    Standardisierte, verteilte generative und prädiktive KI-Inferenzplattform für skalierbare Bereitstellungen mit mehreren Frameworks auf Kubernetes

    5.840+25Sterne-Änderung der letzten 7 Tage
  • UltraRAG@OpenBMB

    Ein Low-Code-MCP-Framework zum Erstellen komplexer und innovativer RAG-Pipelines

    5.674+6Sterne-Änderung der letzten 7 Tage
  • gpustack@gpustack

    Ein GPU-Cluster-Manager für hochleistungsfähiges KI-Modell-Serving (vLLM, SGLang) und bedarfsgesteuerte GPU-Instanzen mit SSH-Zugang.

    5.572+37Sterne-Änderung der letzten 7 Tage
  • llama-swap@mostlygeek

    Zuverlässiger Modellwechsel für jeden lokalen, mit OpenAI/Anthropic kompatiblen Server – llama.cpp, vllm usw.

    5.513+77Sterne-Änderung der letzten 7 Tage
  • Awesome-LLM-Inference@xlite-dev

    📚 Eine kuratierte Liste fantastischer LLM/VLM-Inferenz-Papers mit Code: Flash-Attention, Paged-Attention, WINT8/4, Parallelismus usw. 🎉

    5.479+8Sterne-Änderung der letzten 7 Tage
  • semantic-router@vllm-project

    Ein programmierbarer Mixture-of-Models-Router für heterogene LLM-Inferenz

    5.405+190Sterne-Änderung der letzten 7 Tage
  • sparrow@katanaml

    Strukturierte Datenextraktion, Funktionsaufrufe und Agenten-Workflows mit ML, LLM und Vision-LLM

    5.207+9Sterne-Änderung der letzten 7 Tage
  • tiny-llm@skyzh

    LLM-Inferenzsystem auf Apple Silicon für Systemingenieure lernen: Ein winziges vLLM + Qwen entwickeln

    4.529+17Sterne-Änderung der letzten 7 Tage
  • cascadeflow@lemony-ai

    Kaskadierende Laufzeitumgebung für AI-Agenten. Optimiert Kosten, Latenz, Qualität und Richtlinienentscheidungen innerhalb der Agenten-Schleife.

    3.979-12Sterne-Änderung der letzten 7 Tage
  • FastDeploy@PaddlePaddle

    Leistungsstarkes Inferenz- und Bereitstellungs-Toolkit für LLMs und VLMs auf Basis von PaddlePaddle

    3.711+2Sterne-Änderung der letzten 7 Tage
  • ramalama@containers

    RamaLama ist ein Open-Source-Entwicklertool, das die lokale Bereitstellung von KI-Modellen aus beliebigen Quellen vereinfacht und ihre Nutzung für die Inferenz in der Produktion über die vertraute Sprache von Containern erleichtert.

    3.025+17Sterne-Änderung der letzten 7 Tage
  • vllm-ascend@vllm-project

    Von der Community gepflegtes Hardware-Plugin für vLLM auf Ascend

    2.730+53Sterne-Änderung der letzten 7 Tage
  • local-studio@sybil-solutions

    Steuerungs-Panel für VLLM, Sglang, llama.cpp, exllamav3

    1.745+10Sterne-Änderung der letzten 7 Tage
  • auto-round@intel

    Ein SOTA-Quantisierungsalgorithmus für hochpräzise Low-Bit-LLM-Inferenz, nahtlos optimiert für CPU/XPU/CUDA, mit Unterstützung für mehrere Datentypen und voller Kompatibilität mit vLLM, SGLang und Transformers.

    1.594+15Sterne-Änderung der letzten 7 Tage
  • InferenceX@SemiAnalysisAI

    Open-Source-Forschungsplattform für kontinuierliche Inferenz-Benchmarks — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & bald™ TPUv6e/v7/Trainium2/3

    1.585+159Sterne-Änderung der letzten 7 Tage
  • vllm-mlx@waybarrios

    Leistungsstarker, mit OpenAI und Anthropic kompatibler LLM-Inferenzserver für Apple Silicon. Nativer MLX, Continuous Batching, multimodale Modelle, MCP-Tool-Aufrufe und Claude-Code-Unterstützung.

    1.552+17Sterne-Änderung der letzten 7 Tage
  • kubeai@kubeai-project

    KI-Inferenz-Operator für Kubernetes. Der einfachste Weg, ML-Modelle in der Produktion bereitzustellen. Unterstützt VLMs, LLMs, Embeddings und Speech-to-Text.

    1.254+6Sterne-Änderung der letzten 7 Tage
  • GPTQModel@ModelCloud

    LLM-Modell-Quantisierungs- (Kompprimierungs-) Toolkit mit Hardware-Beschleunigungsunterstützung für Nvidia-, AMD-, Intel-GPUs und Intel/AMD/Apple-CPUs über HF, vLLM und SGLang.

    1.248+12Sterne-Änderung der letzten 7 Tage
  • BricksLLM@bricks-cloud

    🔒 API-Gateway auf Enterprise-Niveau, das bei der Überwachung und Durchsetzung von Kosten- oder Ratenlimits pro API-Key hilft. Bietet granulare Zugriffskontrolle und Überwachung pro Benutzer, Anwendung oder Umgebung. Unterstützt OpenAI, Azure OpenAI, Anthropic, vLLM und Open-Source-LLMs.

    1.229+4Sterne-Änderung der letzten 7 Tage
  • kvcached@ovg-project

    Virtualisierter Elastic KV Cache für dynamisches GPU-Sharing und mehr

    1.145+5Sterne-Änderung der letzten 7 Tage
  • prometheus-eval@prometheus-eval

    Bewerten Sie die Antworten Ihres LLM mit Prometheus und GPT4 💯

    1.107+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen