Aller au contenu principal
buildradar
Sign in
Sujet · llm-inference

llm-inference

Dépôts open source suivis étiquetés llm-inference, triés par étoiles.

83 dépôts
  • llama3.java@mukel

    Inférence Llama 3+ en Java pur

    816+0Évolution des étoiles sur les 7 derniers jours
  • lws@kubernetes-sigs

    LeaderWorkerSet : une API pour déployer un groupe de pods en tant qu'unité de réplication

    809+7Évolution des étoiles sur les 7 derniers jours
  • LLM-PowerHouse : Libérez le potentiel des LLM grâce à des tutoriels sélectionnés, des meilleures pratiques et du code prêt à l'emploi pour l'entraînement et l'inférence personnalisés.

    731+0Évolution des étoiles sur les 7 derniers jours
  • llmflows@stoyan-stoyanov

    LLMFlows - Applications LLM simples, explicites et transparentes

    707+0Évolution des étoiles sur les 7 derniers jours
  • long-context-attention@feifeibear

    USP : Parallélisme de séquence unifié (hybride, 2D) pour l'entraînement et l'inférence de modèles Transformers à long contexte

    691+3Évolution des étoiles sur les 7 derniers jours
  • atlas@Avarok-Cybersecurity

    Moteur d'inférence en Rust pur

    676+3Évolution des étoiles sur les 7 derniers jours
  • pegainfer@pegainfer-project

    Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.

    676+18Évolution des étoiles sur les 7 derniers jours
  • mlx-dspark@ARahim3

    Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.

    645+25Évolution des étoiles sur les 7 derniers jours
  • hipfire@warpfront

    Moteur d'inférence LLM natif RDNA en Rust.

    609+45Évolution des étoiles sur les 7 derniers jours
  • rkllama@NotPunchnox

    Alternative à Ollama pour le NPU Rockchip : Une solution efficace pour exécuter des modèles d'IA et de deep learning sur les appareils Rockchip avec un support NPU optimisé (rkllm)

    601+4Évolution des étoiles sur les 7 derniers jours
  • yalm@andrewkchan

    Yet Another Language Model : inférence LLM en C++/CUDA, sans aucune bibliothèque à l'exception des E/S.

    596-1Évolution des étoiles sur les 7 derniers jours
  • qvac@tetherto

    SDK d'IA locale open source - exécutez l'IA sur l'appareil sans cloud ni clés API. Supporte GGUF, RAG, génération d'images, de musique et de vidéo, synthèse vocale, inférence P2P, et plus encore. Multiplateforme : Linux, macOS, Windows, Android, iOS.

    591+33Évolution des étoiles sur les 7 derniers jours
  • MiniSearch@felladrin

    Plateforme de recherche web minimaliste avec un assistant IA qui s'exécute directement depuis votre navigateur. Démo : https://felladrin-minisearch.hf.space

    585+0Évolution des étoiles sur les 7 derniers jours
  • uzi@devflowinc

    CLI pour exécuter un grand nombre d'agents de codage en parallèle avec des worktrees git

    582+0Évolution des étoiles sur les 7 derniers jours
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    Fine-tuning de LLM (Large Language Model)

    579+1Évolution des étoiles sur les 7 derniers jours
  • LLM-Hub@timmyy123

    Assistant IA local

    578+8Évolution des étoiles sur les 7 derniers jours
  • KuiperLLama@zjhellofss

    Un excellent projet pour le recrutement universitaire, d'automne, de printemps et les stages, vous guidant pour implémenter à partir de zéro un framework d'inférence de grands modèles prenant en charge LLama2/3 et Qwen2.5.

    573+1Évolution des étoiles sur les 7 derniers jours
  • qwen600@yassa9

    Moteur de mini-inférence statique, suckless, mono-lot (single batch) et exclusivement CUDA pour qwen3-0.6B

    559+0Évolution des étoiles sur les 7 derniers jours
  • sarathi-serve@microsoft

    Un moteur de service à faible latence et haut débit pour les LLM.

    520+0Évolution des étoiles sur les 7 derniers jours
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    519+14Évolution des étoiles sur les 7 derniers jours
  • krasis@brontoguana

    Krasis est un runtime LLM hybride axé sur l'exécution efficace de grands modèles sur du matériel grand public à VRAM limitée.

    519+2Évolution des étoiles sur les 7 derniers jours
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    507Évolution des étoiles sur les 7 derniers jours
  • vllm-cli@Chen-zexi

    Un outil d'interface en ligne de commande pour servir des LLM en utilisant vLLM.

    505-1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets