Aller au contenu principal
buildradar
Se connecter
Sujet · mixture-of-experts

mixture-of-experts

Dépôts open source suivis étiquetés mixture-of-experts, triés par étoiles.

Dépôts
18
Total d'étoiles
71 279
Étoiles en moyenne
3 960
Part
0,00%

Sujets qui apparaissent souvent aux côtés de mixture-of-experts sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés mixture-of-experts.

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.

    7 557
  • Swiftlet@leonickson1

    Swiftlet est un runtime Swift et Metal qui exécute localement de grands modèles Qwen Mixture-of-Experts sur les appareils Apple en diffusant les poids des experts depuis le stockage, permettant aux modèles 35B et 80B de fonctionner avec peu de RAM, y compris sur iPhone.

    634
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    552
  • slotstream@carloslfu

    Run Qwen3.8-Flash-Next (125B MoE, 104 GB at 4-bit) on Macs with a fraction of that RAM by streaming experts from SSD. MLX + Swift, Ollama-compatible API.

    287
  • DeepSpeed@deepspeedai

    DeepSpeed est une bibliothèque d'optimisation de deep learning qui rend l'entraînement et l'inférence distribués simples, efficaces et performants.

    43 058+0Évolution des étoiles sur les 7 derniers jours
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.

    7 557+490Évolution des étoiles sur les 7 derniers jours
  • optillm@algorithmicsuperintelligence

    Optimisation du proxy d'inférence pour les LLM.

    4 260+0Évolution des étoiles sur les 7 derniers jours
  • hivemind@learning-at-home

    Apprentissage profond décentralisé avec PyTorch, conçu pour entraîner des modèles sur des milliers de volontaires à travers le monde.

    2 515+0Évolution des étoiles sur les 7 derniers jours
  • mixtral-offloading@dvmazur

    Exécutez des modèles Mixtral-8x7B sur Colab ou des ordinateurs grand public.

    2 334+0Évolution des étoiles sur les 7 derniers jours
  • MoE-LLaVA@PKU-YuanGroup

    TMM 2025 : Mélange d'experts (Mixture-of-Experts) pour les grands modèles vision-langage.

    2 322+0Évolution des étoiles sur les 7 derniers jours
  • mixture-of-experts@davidmrau

    Réimplémentation PyTorch de « The Sparsely-Gated Mixture-of-Experts Layer » par Noam Shazeer et al. https://arxiv.org/abs/1701.06538

    1 253+0Évolution des étoiles sur les 7 derniers jours
  • Aria@rhymes-ai

    Base de code pour Aria, un modèle MoE multimodal natif open source

    1 088+1Évolution des étoiles sur les 7 derniers jours
  • Tutel@microsoft

    Tutel MoE : bibliothèque optimisée de Mixture-of-Experts, prenant en charge GptOss/DeepSeek/Kimi-K2/Qwen3 avec FP8/NVFP4/MXFP4.

    1 018+2Évolution des étoiles sur les 7 derniers jours
  • llama-moe@pjlab-sys4nlp

    ⛷️ LLaMA-MoE : Construction de Mixture-of-Experts à partir de LLaMA avec un pré-entraînement continu (EMNLP 2024).

    1 002+1Évolution des étoiles sur les 7 derniers jours
  • cudnn-frontend@NVIDIA

    cuDNN Frontend est le point d'entrée moderne et open-source de NVIDIA vers la bibliothèque cuDNN et une collection croissante de noyaux open-source haute performance.

    932+9Évolution des étoiles sur les 7 derniers jours
  • smt@SMTorg

    SMT : La boîte à outils de modélisation de substitution.

    912+0Évolution des étoiles sur les 7 derniers jours
  • makeMoE@AviSoori1x

    Implémentation from scratch d'un modèle de langage de type sparse mixture of experts, inspiré par makemore d'Andrej Karpathy.

    815+0Évolution des étoiles sur les 7 derniers jours
  • Swiftlet@leonickson1

    Swiftlet est un runtime Swift et Metal qui exécute localement de grands modèles Qwen Mixture-of-Experts sur les appareils Apple en diffusant les poids des experts depuis le stockage, permettant aux modèles 35B et 80B de fonctionner avec peu de RAM, y compris sur iPhone.

    634+51Évolution des étoiles sur les 7 derniers jours
  • Chinese-Mixtral@ymcui

    Grands modèles de mélange d'experts Mixtral en chinois (Chinese Mixtral MoE LLMs)

    612+0Évolution des étoiles sur les 7 derniers jours
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    552+19Évolution des étoiles sur les 7 derniers jours
  • krasis@brontoguana

    Krasis est un runtime LLM hybride axé sur l'exécution efficace de grands modèles sur du matériel grand public à VRAM limitée.

    519+3Évolution des étoiles sur les 7 derniers jours
  • mergoo@Leeroo-AI

    Une bibliothèque pour fusionner facilement plusieurs experts LLM et entraîner efficacement le modèle fusionné.

    516+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets