Zum Hauptinhalt springen
buildradar
Sign in
Thema · moe

moe

Erfasste Open-Source-Repos mit dem Tag moe, sortiert nach Sternen.

Repos
24
Sterne gesamt
278.965
Sterne im Schnitt
11.624
Anteil
0,01%

Themen, die häufig gemeinsam mit moe am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit moe getaggt wurden.

  • FreeToken@FlashML-org

    FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.

    11.984
  • kimi-k3-in-c@FareedKhan-dev

    Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.

    7.179
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    543
  • vllm@vllm-project

    Ein hocheffizientes und speichereffizientes Inferenz- und Serving-Engine für LLMs

    90.817+402Sterne-Änderung der letzten 7 Tage
  • LlamaFactory@hiyouga

    Vereinheitlichte effiziente Feinabstimmung von 100+ LLMs & VLMs (ACL 2024)

    74.532+89Sterne-Änderung der letzten 7 Tage
  • sglang@sgl-project

    SGLang ist ein hochleistungsfähiges Serving‑Framework für große Sprach‑ und multimodale Modelle.

    33.538+791Sterne-Änderung der letzten 7 Tage
  • ms-swift@modelscope

    Verwenden Sie PEFT oder Vollparameter für CPT/SFT/DPO/GRPO von über 600 LLMs und über 300 MLLMs (AAAI 2025).

    15.488+88Sterne-Änderung der letzten 7 Tage
  • TensorRT-LLM@NVIDIA

    TensorRT LLM bietet Benutzern eine benutzerfreundliche Python-API zum Definieren von Large Language Models (LLMs) und unterstützt modernste Optimierungen zur effizienten Inferenz auf NVIDIA-GPUs. TensorRT LLM enthält zudem Komponenten zum Erstellen von Python- und C++-Runtimes, die die Inferenzausführung performant steuern.

    14.536+38Sterne-Änderung der letzten 7 Tage
  • FreeToken@FlashML-org

    FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.

    11.984+2.287Sterne-Änderung der letzten 7 Tage
  • kimi-k3-in-c@FareedKhan-dev

    Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.

    7.179+442Sterne-Änderung der letzten 7 Tage
  • flashinfer@flashinfer-ai

    FlashInfer: Kernel-Bibliothek für LLM-Serving

    6.321+38Sterne-Änderung der letzten 7 Tage
  • Bangumi@czy0729

    :electron: Ein inoffizieller, UI-fokussierter App-Client für https://bgm.tv für Android und iOS, entwickelt mit React Native.

    5.900+6Sterne-Änderung der letzten 7 Tage
  • GLM-4.5@zai-org

    GLM-4.5: Agentic, Reasoning und Coding (ARC) Foundation Models

    4.422+1Sterne-Änderung der letzten 7 Tage
  • MoE-LLaVA@PKU-YuanGroup

    【TMM 2025🔥】Mixture-of-Experts für Large Vision-Language Models

    2.322+0Sterne-Änderung der letzten 7 Tage
  • MoBA@MoonshotAI

    MoBA: Mixture of Block Attention für LLMs mit langem Kontext

    2.174+1Sterne-Änderung der letzten 7 Tage
  • uccl@uccl-project

    UCCL ist eine effiziente Kommunikationsbibliothek für GPUs, die Collectives, P2P (z. B. KV-Cache-Transfer, RL-Gewichtetransfer) und EP (z. B. GPU-gesteuert) abdeckt.

    1.502+3Sterne-Änderung der letzten 7 Tage
  • mixture-of-experts@davidmrau

    PyTorch-Neuimplementierung von „The Sparsely-Gated Mixture-of-Experts Layer“ von Noam Shazeer et al. https://arxiv.org/abs/1701.06538

    1.253+0Sterne-Änderung der letzten 7 Tage
  • Tutel@microsoft

    Tutel MoE: Optimierte Mixture-of-Experts-Bibliothek, unterstützt GptOss/DeepSeek/Kimi-K2/Qwen3 mit FP8/NVFP4/MXFP4

    1.017+3Sterne-Änderung der letzten 7 Tage
  • llama-moe@pjlab-sys4nlp

    ⛷️ LLaMA-MoE: Erstellung von Mixture-of-Experts aus LLaMA mit kontinuierlichem Vortraining (EMNLP 2024)

    1.003+2Sterne-Änderung der letzten 7 Tage
  • cudnn-frontend@NVIDIA

    Das cuDNN Frontend ist NVIDIAs moderner Open-Source-Einstiegspunkt in die cuDNN-Bibliothek und eine wachsende Sammlung von Hochleistungs-Open-Source-Kerneln.

    931+11Sterne-Änderung der letzten 7 Tage
  • Adan@sail-sg

    Adan: Adaptiver Nesterov-Momentum-Algorithmus für eine schnellere Optimierung von Deep-Modellen

    822+0Sterne-Änderung der letzten 7 Tage
  • DeepSeek-671B-SFT-Guide@ScienceOne-AI

    Eine Open-Source-Lösung für das vollständige Parameter-Fine-Tuning von DeepSeek-V3/R1 671B, einschließlich vollständigem Code und Skripten vom Training bis zur Inferenz sowie einigen praktischen Erfahrungen und Schlussfolgerungen.

    812+0Sterne-Änderung der letzten 7 Tage
  • SwiftLM@SharpAI

    ⚡ Nativer MLX Swift LLM Inferenzserver für Apple Silicon. OpenAI-kompatible API, SSD-Streaming für 100B+ MoE-Modelle, TurboQuant KV-Cache-Kompression, macOS + iOS iPhone-App.

    760+6Sterne-Änderung der letzten 7 Tage
  • YOLO-Master@Tencent

    [CVPR2026]🚀🚀🚀 Offizieller Code zum Papier „YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection.“ *(YOLO = You Only Look Once)* 🔥🔥🔥

    708+12Sterne-Änderung der letzten 7 Tage
  • pegainfer@pegainfer-project

    Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2

    677+14Sterne-Änderung der letzten 7 Tage
  • Chinese-Mixtral@ymcui

    Chinesisches Mixtral-MoE-Sprachmodell (Chinese Mixtral MoE LLMs).

    612+0Sterne-Änderung der letzten 7 Tage
  • BigMoeOnEdge@Helldez

    Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

    543Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen