vllm
Erfasste Open-Source-Repos mit dem Tag vllm, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit vllm am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit vllm getaggt wurden.
- #1
UniRL ist ein Framework für das Reinforcement Learning multimodaler Einheitsmodelle
★ 921 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.
★ 808
- #1
Open-Source-Spracherkennungs-Toolkit für Training, Inferenz, Streaming-ASR, VAD, Interpunktion, Sprecherdiarisierungs-Pipelines und OpenAI-kompatibles/MCP-Serving.
★ 20.072+108Sterne-Änderung der letzten 7 Tage - #2
Willkommen beim Llama Cookbook! Ihr Standard-Leitfaden für die Entwicklung mit Llama: Erste Schritte mit Inferenz, Fine-Tuning und RAG. Wir zeigen Ihnen auch, wie Sie End-to-End-Probleme mit der Llama-Modellfamilie lösen und diese bei verschiedenen Anbieterdiensten nutzen.
★ 18.559-2Sterne-Änderung der letzten 7 Tage - #3
✍🏻 Quellcode-Analysen, Systemdesign & Engineering-Blogs | Halfrost-Field: Notizen zu Quellcode-Analyse, Systemdesign und Engineering-Praxis
★ 13.220+3Sterne-Änderung der letzten 7 Tage - #4
Umfangreiche Open-Source-Bibliothek für KI-Forschungs- und Ingenieurskompetenzen für jedes KI-Modell. Verpacken Sie die Fähigkeiten und Ihr claude code/codex/gemini Agent wird zu einem KI-Forschungsagenten mit voller Leistung. Gewartet von Orchestra Research.
★ 12.152+222Sterne-Änderung der letzten 7 Tage - #5★ 11.562+256Sterne-Änderung der letzten 7 Tage
- #6
Ein benutzerfreundliches, skalierbares und leistungsstarkes Agentic-RL-Framework basierend auf Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
★ 9.960+19Sterne-Änderung der letzten 7 Tage - #7
Ersetzen Sie GPT durch ein beliebiges LLM, indem Sie nur eine einzige Codezeile ändern. Mit Xinference können Sie Open-Source-, Sprach- und multimodale Modelle in der Cloud, on-premise oder auf Ihrem Laptop ausführen – alles über eine einheitliche, produktionsbereite Inferenz-API.
★ 9.528+21Sterne-Änderung der letzten 7 Tage - #8★ 7.908+86Sterne-Änderung der letzten 7 Tage
- #9
Mooncake ist die Serving-Plattform für Kimi, einen führenden LLM-Dienst von Moonshot AI.
★ 6.430+90Sterne-Änderung der letzten 7 Tage - #10
Standardisierte, verteilte generative und prädiktive KI-Inferenzplattform für skalierbare Bereitstellungen mit mehreren Frameworks auf Kubernetes
★ 5.840+25Sterne-Änderung der letzten 7 Tage - #11★ 5.674+6Sterne-Änderung der letzten 7 Tage
- #12
Ein GPU-Cluster-Manager für hochleistungsfähiges KI-Modell-Serving (vLLM, SGLang) und bedarfsgesteuerte GPU-Instanzen mit SSH-Zugang.
★ 5.572+37Sterne-Änderung der letzten 7 Tage - #13
Zuverlässiger Modellwechsel für jeden lokalen, mit OpenAI/Anthropic kompatiblen Server – llama.cpp, vllm usw.
★ 5.513+77Sterne-Änderung der letzten 7 Tage - #14
📚 Eine kuratierte Liste fantastischer LLM/VLM-Inferenz-Papers mit Code: Flash-Attention, Paged-Attention, WINT8/4, Parallelismus usw. 🎉
★ 5.479+8Sterne-Änderung der letzten 7 Tage - #15
Ein programmierbarer Mixture-of-Models-Router für heterogene LLM-Inferenz
★ 5.405+190Sterne-Änderung der letzten 7 Tage - #16
Strukturierte Datenextraktion, Funktionsaufrufe und Agenten-Workflows mit ML, LLM und Vision-LLM
★ 5.207+9Sterne-Änderung der letzten 7 Tage - #17
LLM-Inferenzsystem auf Apple Silicon für Systemingenieure lernen: Ein winziges vLLM + Qwen entwickeln
★ 4.529+17Sterne-Änderung der letzten 7 Tage - #18
Kaskadierende Laufzeitumgebung für AI-Agenten. Optimiert Kosten, Latenz, Qualität und Richtlinienentscheidungen innerhalb der Agenten-Schleife.
★ 3.979-12Sterne-Änderung der letzten 7 Tage - #19
Leistungsstarkes Inferenz- und Bereitstellungs-Toolkit für LLMs und VLMs auf Basis von PaddlePaddle
★ 3.711+2Sterne-Änderung der letzten 7 Tage - #20
RamaLama ist ein Open-Source-Entwicklertool, das die lokale Bereitstellung von KI-Modellen aus beliebigen Quellen vereinfacht und ihre Nutzung für die Inferenz in der Produktion über die vertraute Sprache von Containern erleichtert.
★ 3.025+17Sterne-Änderung der letzten 7 Tage - #21
Von der Community gepflegtes Hardware-Plugin für vLLM auf Ascend
★ 2.730+53Sterne-Änderung der letzten 7 Tage - #22
Steuerungs-Panel für VLLM, Sglang, llama.cpp, exllamav3
★ 1.745+10Sterne-Änderung der letzten 7 Tage - #23
Ein SOTA-Quantisierungsalgorithmus für hochpräzise Low-Bit-LLM-Inferenz, nahtlos optimiert für CPU/XPU/CUDA, mit Unterstützung für mehrere Datentypen und voller Kompatibilität mit vLLM, SGLang und Transformers.
★ 1.594+15Sterne-Änderung der letzten 7 Tage - #24
Open-Source-Forschungsplattform für kontinuierliche Inferenz-Benchmarks — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & bald™ TPUv6e/v7/Trainium2/3
★ 1.585+159Sterne-Änderung der letzten 7 Tage - #25
Leistungsstarker, mit OpenAI und Anthropic kompatibler LLM-Inferenzserver für Apple Silicon. Nativer MLX, Continuous Batching, multimodale Modelle, MCP-Tool-Aufrufe und Claude-Code-Unterstützung.
★ 1.552+17Sterne-Änderung der letzten 7 Tage - #26
KI-Inferenz-Operator für Kubernetes. Der einfachste Weg, ML-Modelle in der Produktion bereitzustellen. Unterstützt VLMs, LLMs, Embeddings und Speech-to-Text.
★ 1.254+6Sterne-Änderung der letzten 7 Tage - #27
LLM-Modell-Quantisierungs- (Kompprimierungs-) Toolkit mit Hardware-Beschleunigungsunterstützung für Nvidia-, AMD-, Intel-GPUs und Intel/AMD/Apple-CPUs über HF, vLLM und SGLang.
★ 1.248+12Sterne-Änderung der letzten 7 Tage - #28
🔒 API-Gateway auf Enterprise-Niveau, das bei der Überwachung und Durchsetzung von Kosten- oder Ratenlimits pro API-Key hilft. Bietet granulare Zugriffskontrolle und Überwachung pro Benutzer, Anwendung oder Umgebung. Unterstützt OpenAI, Azure OpenAI, Anthropic, vLLM und Open-Source-LLMs.
★ 1.229+4Sterne-Änderung der letzten 7 Tage - #29★ 1.145+5Sterne-Änderung der letzten 7 Tage
- #30
Bewerten Sie die Antworten Ihres LLM mit Prometheus und GPT4 💯
★ 1.107+0Sterne-Änderung der letzten 7 Tage