vllm
Dépôts open source suivis étiquetés vllm, triés par étoiles.
- #31
Évaluez les réponses de votre LLM avec Prometheus et GPT4.
★ 1 114+4Évolution des étoiles sur les 7 derniers jours - #32
Construisez votre propre moteur d'inférence LLM haute performance en C++ et CUDA - une version allégée de vLLM
★ 1 100+15Évolution des étoiles sur les 7 derniers jours - #33★ 983+73Évolution des étoiles sur les 7 derniers jours
- #34
UniRL est un framework pour l'apprentissage par renforcement de modèles multimodaux unifiés.
★ 939+18Évolution des étoiles sur les 7 derniers jours - #35
Notes sur les LLM, incluant l'inférence de modèles, la structure des modèles transformer et l'analyse du code des frameworks LLM.
★ 890+2Évolution des étoiles sur les 7 derniers jours - #36
Feuille de route de 10 semaines, à raison de 30 minutes par jour, sur l'inférence et l'optimisation de LLM : vLLM, SGLang, quantification, décodage spéculatif et benchmarking.
★ 887+78Évolution des étoiles sur les 7 derniers jours - #37
Un logiciel OCR local, hors ligne (après configuration initiale) et portable, capable de traiter des images et des fichiers PDF en utilisant l'IA DeepSeek-OCR-2 (exécutée directement sur votre machine).
★ 874+4Évolution des étoiles sur les 7 derniers jours - #38
Documentation complète pour configurer votre propre serveur LLM local et privé sur Debian, incluant chat, recherche web, RAG, gestion de modèles, serveurs MCP, génération d'images et synthèse vocale.
★ 833-2Évolution des étoiles sur les 7 derniers jours - #39
Transformez Discord en interface pour LLM - Compatible avec toute API conforme à OpenAI (OpenRouter, Ollama, etc.)
★ 830+5Évolution des étoiles sur les 7 derniers jours - #40
Bibliothèque Python basée sur des modèles de langage (LLM) pour la découverte et l'analyse conversationnelle de données.
★ 787+1Évolution des étoiles sur les 7 derniers jours - #41
[EMNLP 2024 & AAAI 2026] Une boîte à outils puissante pour la compression de grands modèles, incluant les LLM, les VLM et les modèles génératifs vidéo.
★ 747+4Évolution des étoiles sur les 7 derniers jours - #42
Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.
★ 678+17Évolution des étoiles sur les 7 derniers jours - #43
Simulateur précis, à grande échelle et extensible pour les systèmes d'inférence de LLM
★ 673+5Évolution des étoiles sur les 7 derniers jours - #44
EfficientSAM3 compresse SAM3 en modèles légers et adaptés aux bords via une distillation progressive de connaissances pour une segmentation et un suivi de concepts rapides et promptables.
★ 668+9Évolution des étoiles sur les 7 derniers jours - #45
Basé sur des modèles tels que SparkTTS et OrpheusTTS, ce service fournit une synthèse vocale en chinois de haute qualité et un clonage de voix.
★ 614+1Évolution des étoiles sur les 7 derniers jours - #46
[CVPR 2025] RoboBrain : Un modèle de cerveau unifié pour la manipulation robotique, de l'abstrait au concret. Dépôt officiel.
★ 563+0Évolution des étoiles sur les 7 derniers jours - #47★ 554+2Évolution des étoiles sur les 7 derniers jours
- #48
Interface web moderne pour gérer et interagir avec les serveurs vLLM (www.github.com/vllm-project/vllm). Prend en charge les modes GPU et CPU, avec des optimisations spécifiques pour Apple Silicon sur macOS et le déploiement en entreprise sur OpenShift/Kubernetes.
★ 531+9Évolution des étoiles sur les 7 derniers jours - #49
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 521+17Évolution des étoiles sur les 7 derniers jours - #50
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
★ 514—Évolution des étoiles sur les 7 derniers jours - #51
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—Évolution des étoiles sur les 7 derniers jours - #52★ 505-1Évolution des étoiles sur les 7 derniers jours