Saltar al contenido principal
buildradar
Iniciar sesión
Tema · mixture-of-experts

mixture-of-experts

Repositorios de código abierto monitorizados etiquetados con mixture-of-experts, ordenados por estrellas.

Repositorios
18
Estrellas totales
71.279
Estrellas de media
3960
Proporción
0,00%

Temas que aparecen con frecuencia junto a mixture-of-experts en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con mixture-of-experts.

  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    7528
  • Swiftlet@leonickson1

    Swiftlet es un entorno de ejecución de Swift y Metal que ejecuta modelos de mezcla de expertos Qwen de gran tamaño localmente en dispositivos Apple mediante la transmisión de pesos de expertos desde el almacenamiento, permitiendo ejecutar modelos de 35B y 80B con poca memoria RAM, incluso en iPhone.

    631
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    550
  • slotstream@carloslfu

    Run Qwen3.8-Flash-Next (125B MoE, 104 GB at 4-bit) on Macs with a fraction of that RAM by streaming experts from SSD. MLX + Swift, Ollama-compatible API.

    287
  • DeepSpeed@deepspeedai

    DeepSpeed es una biblioteca de optimización de aprendizaje profundo que hace que el entrenamiento y la inferencia distribuidos sean fáciles, eficientes y efectivos.

    43.058+0Variación de estrellas de los últimos 7 días
  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    7528+490Variación de estrellas de los últimos 7 días
  • optillm@algorithmicsuperintelligence

    Optimización del proxy de inferencia para LLMs

    4260+0Variación de estrellas de los últimos 7 días
  • hivemind@learning-at-home

    Deep learning descentralizado en PyTorch. Diseñado para entrenar modelos con miles de voluntarios en todo el mundo.

    2515+0Variación de estrellas de los últimos 7 días
  • mixtral-offloading@dvmazur

    Ejecuta modelos Mixtral-8x7B en Colab o en ordenadores de escritorio de consumo

    2334+0Variación de estrellas de los últimos 7 días
  • MoE-LLaVA@PKU-YuanGroup

    【TMM 2025🔥】 Mixture-of-Experts para grandes modelos de visión y lenguaje

    2322+0Variación de estrellas de los últimos 7 días
  • mixture-of-experts@davidmrau

    Reimplementación en PyTorch de "The Sparsely-Gated Mixture-of-Experts Layer" de Noam Shazeer et al. https://arxiv.org/abs/1701.06538

    1253+0Variación de estrellas de los últimos 7 días
  • Aria@rhymes-ai

    Base de código para Aria, un MoE nativo multimodal abierto.

    1088+1Variación de estrellas de los últimos 7 días
  • Tutel@microsoft

    Tutel MoE: Biblioteca optimizada de Mixture-of-Experts, compatible con GptOss/DeepSeek/Kimi-K2/Qwen3 usando FP8/NVFP4/MXFP4

    1018+2Variación de estrellas de los últimos 7 días
  • llama-moe@pjlab-sys4nlp

    ⛷️ LLaMA-MoE: Construcción de Mixture-of-Experts a partir de LLaMA con preentrenamiento continuo (EMNLP 2024)

    1002+1Variación de estrellas de los últimos 7 días
  • cudnn-frontend@NVIDIA

    cuDNN Frontend es el punto de entrada moderno y de código abierto de NVIDIA a la biblioteca cuDNN y a una creciente colección de kernels de alto rendimiento.

    932+9Variación de estrellas de los últimos 7 días
  • smt@SMTorg

    SMT: La caja de herramientas de modelado subrogado.

    912+0Variación de estrellas de los últimos 7 días
  • makeMoE@AviSoori1x

    Implementación desde cero de un modelo de lenguaje de mezcla dispersa de expertos inspirado en makemore de Andrej Karpathy.

    814+0Variación de estrellas de los últimos 7 días
  • Swiftlet@leonickson1

    Swiftlet es un entorno de ejecución de Swift y Metal que ejecuta modelos de mezcla de expertos Qwen de gran tamaño localmente en dispositivos Apple mediante la transmisión de pesos de expertos desde el almacenamiento, permitiendo ejecutar modelos de 35B y 80B con poca memoria RAM, incluso en iPhone.

    631+51Variación de estrellas de los últimos 7 días
  • Chinese-Mixtral@ymcui

    Modelos de lenguaje grandes (LLM) Mixtral MoE en chino.

    612+0Variación de estrellas de los últimos 7 días
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    550+19Variación de estrellas de los últimos 7 días
  • krasis@brontoguana

    Krasis es un entorno de ejecución de LLM híbrido que se centra en la ejecución eficiente de modelos grandes en hardware de consumo con VRAM limitada.

    519+3Variación de estrellas de los últimos 7 días
  • mergoo@Leeroo-AI

    Una biblioteca para fusionar fácilmente múltiples expertos LLM y entrenar eficientemente el modelo resultante.

    516+0Variación de estrellas de los últimos 7 días
← Volver a temas