vllm
Dépôts open source suivis étiquetés vllm, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de vllm sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés vllm.
- #1
UniRL est un framework pour l'apprentissage par renforcement de modèles multimodaux unifiés.
★ 921 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
Feuille de route de 10 semaines, à raison de 30 minutes par jour, sur l'inférence et l'optimisation de LLM : vLLM, SGLang, quantification, décodage spéculatif et benchmarking.
★ 808
- #1
Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.
★ 20 072+108Évolution des étoiles sur les 7 derniers jours - #2
Bienvenue dans le Llama Cookbook ! Votre guide de référence pour construire avec Llama : démarrage avec l'inférence, le fine-tuning et le RAG. Nous montrons également comment résoudre des problèmes de bout en bout en utilisant la famille de modèles Llama sur divers services fournisseurs.
★ 18 559-2Évolution des étoiles sur les 7 derniers jours - #3
Analyses approfondies de code source, conception de systèmes et blogs d'ingénierie | Halfrost-Field : notes sur l'analyse de code source, la conception de systèmes et les pratiques d'ingénierie
★ 13 220+3Évolution des étoiles sur les 7 derniers jours - #4
Bibliothèque open source complète de compétences en recherche et ingénierie IA pour tout modèle d'IA. Emballez ces compétences et votre agent Claude/Codex/Gemini deviendra un agent de recherche IA pleinement opérationnel. Maintenu par Orchestra Research.
★ 12 152+222Évolution des étoiles sur les 7 derniers jours - #5★ 11 562+256Évolution des étoiles sur les 7 derniers jours
- #6
Un framework d'apprentissage par renforcement agentique simple, évolutif et performant basé sur Ray (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray et RL asynchrone)
★ 9 960+19Évolution des étoiles sur les 7 derniers jours - #7
Remplacez GPT par n'importe quel LLM en changeant une seule ligne de code. Xinference vous permet d'exécuter des modèles open source, vocaux et multimodaux sur le cloud, en local ou sur votre ordinateur portable, le tout via une API d'inférence unifiée et prête pour la production.
★ 9 528+21Évolution des étoiles sur les 7 derniers jours - #8★ 7 908+86Évolution des étoiles sur les 7 derniers jours
- #9
Mooncake est la plateforme de service pour Kimi, un service LLM de premier plan fourni par Moonshot AI.
★ 6 430+90Évolution des étoiles sur les 7 derniers jours - #10
Plateforme standardisée d'inférence IA générative et prédictive distribuée pour un déploiement multi-framework évolutif sur Kubernetes.
★ 5 840+25Évolution des étoiles sur les 7 derniers jours - #11
Un framework MCP low-code pour construire des pipelines RAG complexes et innovants.
★ 5 674+6Évolution des étoiles sur les 7 derniers jours - #12
Un gestionnaire de cluster GPU pour le service de modèles d'IA haute performance (vLLM, SGLang) et des instances GPU accessibles par SSH à la demande.
★ 5 572+37Évolution des étoiles sur les 7 derniers jours - #13
Échange de modèles fiable pour tout serveur local compatible OpenAI/Anthropic - llama.cpp, vllm, etc.
★ 5 513+77Évolution des étoiles sur les 7 derniers jours - #14
Liste organisée d'articles de recherche sur l'inférence LLM/VLM avec code : Flash-Attention, Paged-Attention, WINT8/4, parallélisme, etc.
★ 5 479+8Évolution des étoiles sur les 7 derniers jours - #15
Un routeur programmable de mélange de modèles pour l'inférence LLM hétérogène
★ 5 405+190Évolution des étoiles sur les 7 derniers jours - #16
Extraction de données structurées, appel d'instructions et flux de travail d'agents avec ML, LLM et Vision LLM
★ 5 207+9Évolution des étoiles sur les 7 derniers jours - #17
Apprendre le système d'inférence LLM sur Apple Silicon pour les ingénieurs système : construire un vLLM miniature + Qwen
★ 4 529+17Évolution des étoiles sur les 7 derniers jours - #18
Runtime en cascade pour agents IA, optimisant les coûts, la latence, la qualité et les politiques au sein de la boucle de l'agent
★ 3 979-12Évolution des étoiles sur les 7 derniers jours - #19
Boîte à outils d'inférence et de déploiement haute performance pour LLM et VLM basée sur PaddlePaddle
★ 3 711+2Évolution des étoiles sur les 7 derniers jours - #20
RamaLama est un outil open-source simplifiant l'hébergement local de modèles d'IA et facilitant leur utilisation pour l'inférence en production, via le langage familier des conteneurs.
★ 3 025+17Évolution des étoiles sur les 7 derniers jours - #21
Plugin Fzf pour Fish
★ 2 730+53Évolution des étoiles sur les 7 derniers jours - #22
Panneau de contrôle pour VLLM, Sglang, llama.cpp, exllamav3
★ 1 745+10Évolution des étoiles sur les 7 derniers jours - #23
Un algorithme de quantification SOTA pour l'inférence LLM basse précision haute précision, optimisé pour CPU/XPU/CUDA, avec support multi-type et compatibilité totale avec vLLM, SGLang et Transformers.
★ 1 594+15Évolution des étoiles sur les 7 derniers jours - #24
Plateforme de recherche de benchmark d'inférence continue open source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 et bientôt™ TPUv6e/v7/Trainium2/3
★ 1 585+159Évolution des étoiles sur les 7 derniers jours - #25
Serveur d'inférence LLM haute performance compatible OpenAI et Anthropic pour Apple Silicon. Support natif MLX, traitement par lots continu, modèles multimodaux, appel d'outils MCP et support de Claude Code.
★ 1 552+17Évolution des étoiles sur les 7 derniers jours - #26
Opérateur d'inférence IA pour Kubernetes. Le moyen le plus simple de servir des modèles ML en production. Prend en charge les VLM, LLM, embeddings et la conversion parole-texte.
★ 1 254+6Évolution des étoiles sur les 7 derniers jours - #27
Boîte à outils de quantification (compression) de modèles LLM avec accélération matérielle pour GPU Nvidia, AMD, Intel et CPU Intel/AMD/Apple via HF, vLLM et SGLang.
★ 1 248+12Évolution des étoiles sur les 7 derniers jours - #28
Passerelle API de niveau entreprise permettant de surveiller et d'imposer des limites de coût ou de débit par clé API. Offre un contrôle d'accès granulaire et un suivi par utilisateur, application ou environnement. Supporte OpenAI, Azure OpenAI, Anthropic, vLLM et les LLM open-source.
★ 1 229+4Évolution des étoiles sur les 7 derniers jours - #29★ 1 145+5Évolution des étoiles sur les 7 derniers jours
- #30
Évaluez les réponses de votre LLM avec Prometheus et GPT4.
★ 1 107+0Évolution des étoiles sur les 7 derniers jours