inference-engine
Dépôts open source suivis étiquetés inference-engine, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de inference-engine sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés inference-engine.
- #1
Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.
★ 7 164 - #2
Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.
★ 640
- #1
Analyses approfondies de code source, conception de systèmes et blogs d'ingénierie | Halfrost-Field : notes sur l'analyse de code source, la conception de systèmes et les pratiques d'ingénierie
★ 13 226+6Évolution des étoiles sur les 7 derniers jours - #2
Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.
★ 7 164+442Évolution des étoiles sur les 7 derniers jours - #3
FEDML - La bibliothèque ML unifiée et évolutive pour l'entraînement distribué à grande échelle, le déploiement de modèles et l'apprentissage fédéré. FEDML Launch, un ordonnanceur multi-cloud, permet d'exécuter tout travail d'IA sur n'importe quel cloud GPU ou cluster sur site. Basée sur cette bibliothèque, TensorOpera AI (https://TensorOpera.ai) est votre plateforme d'IA générative à grande échelle.
★ 4 062+1Évolution des étoiles sur les 7 derniers jours - #4
Projet idéal pour le recrutement ! Implémentez étape par étape une bibliothèque d'inférence de deep learning haute performance, prenant en charge des modèles comme Llama2, Unet, Yolov5, Resnet, etc.
★ 3 499+2Évolution des étoiles sur les 7 derniers jours - #5
Implémentation d'un moteur de règles en Golang.
★ 2 524+2Évolution des étoiles sur les 7 derniers jours - #6
OneDiff : une bibliothèque d'accélération prête à l'emploi pour les modèles de diffusion.
★ 1 964+0Évolution des étoiles sur les 7 derniers jours - #7
Vitesse 3x plus rapide sur MLX | Qwen 3.8 27B | Décodage spéculatif MTP natif sur Apple Silicon sans drafter externe.
★ 1 944+173Évolution des étoiles sur les 7 derniers jours - #8★ 1 847+3Évolution des étoiles sur les 7 derniers jours
- #9
Un moteur d'inférence haute performance pour les modèles LLM, VLM, DiT et REC, optimisé pour divers accélérateurs IA. Hébergé par la fondation OpenAtom.
★ 1 552+11Évolution des étoiles sur les 7 derniers jours - #10★ 1 275+130Évolution des étoiles sur les 7 derniers jours
- #11
Qualcomm® AI Hub Models est notre collection de modèles d'apprentissage automatique de pointe, optimisés pour la performance (latence, mémoire, etc.) et prêts à être déployés sur les appareils Qualcomm®.
★ 1 195+1Évolution des étoiles sur les 7 derniers jours - #12
Paddle.js est un projet web pour Baidu PaddlePaddle, un framework open source de deep learning s'exécutant dans le navigateur. Paddle.js peut charger un modèle pré-entraîné ou convertir un modèle depuis paddle-hub via ses outils dédiés. Il fonctionne dans tout navigateur supportant WebGL/WebGPU/WebAssembly, ainsi que dans les mini-programmes Baidu et WeChat.
★ 1 104+1Évolution des étoiles sur les 7 derniers jours - #13
NobodyWho est un moteur d'inférence permettant d'exécuter des LLM localement et efficacement sur n'importe quel appareil.
★ 1 094+13Évolution des étoiles sur les 7 derniers jours - #14
MLX Studio - Accueil de JANG_Q - Génération/édition d'images + Chat/Code tout-en-un - + OpenClaw (API Anthropic).
★ 963+4Évolution des étoiles sur les 7 derniers jours - #15
Un moteur d'accélération d'inférence LLM hautement optimisé pour Llama et ses variantes.
★ 908+0Évolution des étoiles sur les 7 derniers jours - #16
Framework de vision par ordinateur et d'analyse vidéo en Python avec fonctionnalités intégrées
★ 853+4Évolution des étoiles sur les 7 derniers jours - #17
Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.
★ 677+14Évolution des étoiles sur les 7 derniers jours - #18
Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.
★ 640+22Évolution des étoiles sur les 7 derniers jours - #19
Yet Another Language Model : inférence LLM en C++/CUDA, sans aucune bibliothèque à l'exception des E/S.
★ 596-1Évolution des étoiles sur les 7 derniers jours - #20
Une représentation de base commune du code source Python pour pylint et d'autres projets
★ 582+0Évolution des étoiles sur les 7 derniers jours - #21
Un excellent projet pour le recrutement universitaire, d'automne, de printemps et les stages, vous guidant pour implémenter à partir de zéro un framework d'inférence de grands modèles prenant en charge LLama2/3 et Qwen2.5.
★ 573+1Évolution des étoiles sur les 7 derniers jours - #22
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+30Évolution des étoiles sur les 7 derniers jours - #23
Krasis est un runtime LLM hybride axé sur l'exécution efficace de grands modèles sur du matériel grand public à VRAM limitée.
★ 518+2Évolution des étoiles sur les 7 derniers jours - #24
Moteur d'inférence pour appareils Intel. Permet de servir des modèles LLM, VLM, Whisper, Kokoro-TTS, d'embedding et de reranking via des points de terminaison OpenAI.
★ 516+4Évolution des étoiles sur les 7 derniers jours