跳到主要内容
buildradar
登录
主题 · mixture-of-experts

mixture-of-experts

标记 mixture-of-experts 主题、收录中的开源项目,按星标数排序。

项目数
18
总星标数
71,976
平均星标数
3,999
占比
0.00%

常跟 mixture-of-experts 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 mixture-of-experts 主题的项目。

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU

    7,728
  • Swiftlet@leonickson1

    Swiftlet 是一个 Swift 与 Metal 运行时,通过从存储空间串流专家权重,在 Apple 设备上本地执行大型 Qwen Mixture-of-Experts 模型,使 35B 与 80B 模型能在低内存下执行,包含 iPhone。

    634
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    554
  • slotstream@carloslfu

    Run Qwen3.8-Flash-Next (125B MoE, 104 GB at 4-bit) on Macs with a fraction of that RAM by streaming experts from SSD. MLX + Swift, Ollama-compatible API.

    287
  • DeepSpeed@deepspeedai

    DeepSpeed 是一个深度学习优化库,使分布式训练与推理变得简单、高效且有效

    43,096+38近 7 天星标变化
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU

    7,728+423近 7 天星标变化
  • optillm@algorithmicsuperintelligence

    为 LLM 优化推理代理

    4,264+4近 7 天星标变化
  • hivemind@learning-at-home

    基于 PyTorch 的去中心化深度学习。专为在世界各地数千名志愿者设备上训练模型而构建。

    2,521+6近 7 天星标变化
  • mixtral-offloading@dvmazur

    在 Colab 或消费级桌面上运行 Mixtral-8x7B 模型

    2,334+0近 7 天星标变化
  • MoE-LLaVA@PKU-YuanGroup

    【TMM 2025🔥】大型视觉语言模型的混合专家模型 (Mixture-of-Experts)

    2,323+1近 7 天星标变化
  • mixture-of-experts@davidmrau

    Noam Shazeer 等人所著“The Sparsely-Gated Mixture-of-Experts Layer”的 PyTorch 重新实现版。https://arxiv.org/abs/1701.06538

    1,253+0近 7 天星标变化
  • Aria@rhymes-ai

    Aria 的代码库 - 一个开源的多模态原生 MoE

    1,088+0近 7 天星标变化
  • Tutel@microsoft

    Tutel MoE:优化 Mixture-of-Experts 库,使用 FP8/NVFP4/MXFP4 支持 GptOss/DeepSeek/Kimi-K2/Qwen3

    1,018+1近 7 天星标变化
  • llama-moe@pjlab-sys4nlp

    ⛷️ LLaMA-MoE:通过持续预训练从 LLaMA 构建混合专家模型 (EMNLP 2024)

    1,002-1近 7 天星标变化
  • cudnn-frontend@NVIDIA

    cuDNN Frontend 是 NVIDIA 的现代化开源 cuDNN 库入口,并提供日益增加的高性能开源核心集合。

    933+3近 7 天星标变化
  • smt@SMTorg

    SMT:代理模型工具箱

    912+0近 7 天星标变化
  • makeMoE@AviSoori1x

    受到 Andrej Karpathy 的 makemore 启发,从头实现的稀疏专家混合(sparse mixture of experts)语言模型 :)

    815+1近 7 天星标变化
  • Swiftlet@leonickson1

    Swiftlet 是一个 Swift 与 Metal 运行时,通过从存储空间串流专家权重,在 Apple 设备上本地执行大型 Qwen Mixture-of-Experts 模型,使 35B 与 80B 模型能在低内存下执行,包含 iPhone。

    634+16近 7 天星标变化
  • Chinese-Mixtral@ymcui

    中文 Mixtral 混合专家大模型(Chinese Mixtral MoE LLMs)

    613+0近 7 天星标变化
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    554+12近 7 天星标变化
  • krasis@brontoguana

    Krasis 是一款混合型 LLM 运行时,专注于在消费级 VRAM 受限的硬件上高效执行大型模型。

    520+2近 7 天星标变化
  • mergoo@Leeroo-AI

    用于轻松合并多个 LLM 专家并高效训练合并后 LLM 的库

    516+0近 7 天星标变化
← 返回主题列表