Aller au contenu principal
buildradar
Sign in
Sujet · vllm

vllm

Dépôts open source suivis étiquetés vllm, triés par étoiles.

Dépôts
51
Total d'étoiles
193 269
Étoiles en moyenne
3 790
Part
0,01%

Sujets qui apparaissent souvent aux côtés de vllm sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés vllm.

  • UniRL@Tencent-Hunyuan

    UniRL est un framework pour l'apprentissage par renforcement de modèles multimodaux unifiés.

    921
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • Feuille de route de 10 semaines, à raison de 30 minutes par jour, sur l'inférence et l'optimisation de LLM : vLLM, SGLang, quantification, décodage spéculatif et benchmarking.

    808
  • FunASR@modelscope

    Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.

    20 072+108Évolution des étoiles sur les 7 derniers jours
  • llama-cookbook@meta-llama

    Bienvenue dans le Llama Cookbook ! Votre guide de référence pour construire avec Llama : démarrage avec l'inférence, le fine-tuning et le RAG. Nous montrons également comment résoudre des problèmes de bout en bout en utilisant la famille de modèles Llama sur divers services fournisseurs.

    18 559-2Évolution des étoiles sur les 7 derniers jours
  • Analyses approfondies de code source, conception de systèmes et blogs d'ingénierie | Halfrost-Field : notes sur l'analyse de code source, la conception de systèmes et les pratiques d'ingénierie

    13 220+3Évolution des étoiles sur les 7 derniers jours
  • AI-Research-SKILLs@Orchestra-Research

    Bibliothèque open source complète de compétences en recherche et ingénierie IA pour tout modèle d'IA. Emballez ces compétences et votre agent Claude/Codex/Gemini deviendra un agent de recherche IA pleinement opérationnel. Maintenu par Orchestra Research.

    12 152+222Évolution des étoiles sur les 7 derniers jours
  • LMCache@LMCache

    LMCache : Boostez votre LLM avec la couche de cache KV la plus rapide

    11 562+256Évolution des étoiles sur les 7 derniers jours
  • OpenRLHF@OpenRLHF

    Un framework d'apprentissage par renforcement agentique simple, évolutif et performant basé sur Ray (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray et RL asynchrone)

    9 960+19Évolution des étoiles sur les 7 derniers jours
  • inference@xorbitsai

    Remplacez GPT par n'importe quel LLM en changeant une seule ligne de code. Xinference vous permet d'exécuter des modèles open source, vocaux et multimodaux sur le cloud, en local ou sur votre ordinateur portable, le tout via une API d'inférence unifiée et prête pour la production.

    9 528+21Évolution des étoiles sur les 7 derniers jours
  • dynamo@ai-dynamo

    Un framework de service d'inférence distribué à l'échelle du centre de données.

    7 908+86Évolution des étoiles sur les 7 derniers jours
  • Mooncake@kvcache-ai

    Mooncake est la plateforme de service pour Kimi, un service LLM de premier plan fourni par Moonshot AI.

    6 430+90Évolution des étoiles sur les 7 derniers jours
  • kserve@kserve

    Plateforme standardisée d'inférence IA générative et prédictive distribuée pour un déploiement multi-framework évolutif sur Kubernetes.

    5 840+25Évolution des étoiles sur les 7 derniers jours
  • UltraRAG@OpenBMB

    Un framework MCP low-code pour construire des pipelines RAG complexes et innovants.

    5 674+6Évolution des étoiles sur les 7 derniers jours
  • gpustack@gpustack

    Un gestionnaire de cluster GPU pour le service de modèles d'IA haute performance (vLLM, SGLang) et des instances GPU accessibles par SSH à la demande.

    5 572+37Évolution des étoiles sur les 7 derniers jours
  • llama-swap@mostlygeek

    Échange de modèles fiable pour tout serveur local compatible OpenAI/Anthropic - llama.cpp, vllm, etc.

    5 513+77Évolution des étoiles sur les 7 derniers jours
  • Awesome-LLM-Inference@xlite-dev

    Liste organisée d'articles de recherche sur l'inférence LLM/VLM avec code : Flash-Attention, Paged-Attention, WINT8/4, parallélisme, etc.

    5 479+8Évolution des étoiles sur les 7 derniers jours
  • semantic-router@vllm-project

    Un routeur programmable de mélange de modèles pour l'inférence LLM hétérogène

    5 405+190Évolution des étoiles sur les 7 derniers jours
  • sparrow@katanaml

    Extraction de données structurées, appel d'instructions et flux de travail d'agents avec ML, LLM et Vision LLM

    5 207+9Évolution des étoiles sur les 7 derniers jours
  • tiny-llm@skyzh

    Apprendre le système d'inférence LLM sur Apple Silicon pour les ingénieurs système : construire un vLLM miniature + Qwen

    4 529+17Évolution des étoiles sur les 7 derniers jours
  • cascadeflow@lemony-ai

    Runtime en cascade pour agents IA, optimisant les coûts, la latence, la qualité et les politiques au sein de la boucle de l'agent

    3 979-12Évolution des étoiles sur les 7 derniers jours
  • FastDeploy@PaddlePaddle

    Boîte à outils d'inférence et de déploiement haute performance pour LLM et VLM basée sur PaddlePaddle

    3 711+2Évolution des étoiles sur les 7 derniers jours
  • ramalama@containers

    RamaLama est un outil open-source simplifiant l'hébergement local de modèles d'IA et facilitant leur utilisation pour l'inférence en production, via le langage familier des conteneurs.

    3 025+17Évolution des étoiles sur les 7 derniers jours
  • vllm-ascend@vllm-project

    Plugin Fzf pour Fish

    2 730+53Évolution des étoiles sur les 7 derniers jours
  • local-studio@sybil-solutions

    Panneau de contrôle pour VLLM, Sglang, llama.cpp, exllamav3

    1 745+10Évolution des étoiles sur les 7 derniers jours
  • auto-round@intel

    Un algorithme de quantification SOTA pour l'inférence LLM basse précision haute précision, optimisé pour CPU/XPU/CUDA, avec support multi-type et compatibilité totale avec vLLM, SGLang et Transformers.

    1 594+15Évolution des étoiles sur les 7 derniers jours
  • InferenceX@SemiAnalysisAI

    Plateforme de recherche de benchmark d'inférence continue open source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 et bientôt™ TPUv6e/v7/Trainium2/3

    1 585+159Évolution des étoiles sur les 7 derniers jours
  • vllm-mlx@waybarrios

    Serveur d'inférence LLM haute performance compatible OpenAI et Anthropic pour Apple Silicon. Support natif MLX, traitement par lots continu, modèles multimodaux, appel d'outils MCP et support de Claude Code.

    1 552+17Évolution des étoiles sur les 7 derniers jours
  • kubeai@kubeai-project

    Opérateur d'inférence IA pour Kubernetes. Le moyen le plus simple de servir des modèles ML en production. Prend en charge les VLM, LLM, embeddings et la conversion parole-texte.

    1 254+6Évolution des étoiles sur les 7 derniers jours
  • GPTQModel@ModelCloud

    Boîte à outils de quantification (compression) de modèles LLM avec accélération matérielle pour GPU Nvidia, AMD, Intel et CPU Intel/AMD/Apple via HF, vLLM et SGLang.

    1 248+12Évolution des étoiles sur les 7 derniers jours
  • BricksLLM@bricks-cloud

    Passerelle API de niveau entreprise permettant de surveiller et d'imposer des limites de coût ou de débit par clé API. Offre un contrôle d'accès granulaire et un suivi par utilisateur, application ou environnement. Supporte OpenAI, Azure OpenAI, Anthropic, vLLM et les LLM open-source.

    1 229+4Évolution des étoiles sur les 7 derniers jours
  • kvcached@ovg-project

    Cache KV élastique virtualisé pour le partage dynamique de GPU et au-delà

    1 145+5Évolution des étoiles sur les 7 derniers jours
  • prometheus-eval@prometheus-eval

    Évaluez les réponses de votre LLM avec Prometheus et GPT4.

    1 107+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets