moe
Erfasste Open-Source-Repos mit dem Tag moe, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit moe am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit moe getaggt wurden.
- #1
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.984 - #2
Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.
★ 7.179 - #3
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 543
- #1★ 90.817+402Sterne-Änderung der letzten 7 Tage
- #2
Vereinheitlichte effiziente Feinabstimmung von 100+ LLMs & VLMs (ACL 2024)
★ 74.532+89Sterne-Änderung der letzten 7 Tage - #3
SGLang ist ein hochleistungsfähiges Serving‑Framework für große Sprach‑ und multimodale Modelle.
★ 33.538+791Sterne-Änderung der letzten 7 Tage - #4
Verwenden Sie PEFT oder Vollparameter für CPT/SFT/DPO/GRPO von über 600 LLMs und über 300 MLLMs (AAAI 2025).
★ 15.488+88Sterne-Änderung der letzten 7 Tage - #5
TensorRT LLM bietet Benutzern eine benutzerfreundliche Python-API zum Definieren von Large Language Models (LLMs) und unterstützt modernste Optimierungen zur effizienten Inferenz auf NVIDIA-GPUs. TensorRT LLM enthält zudem Komponenten zum Erstellen von Python- und C++-Runtimes, die die Inferenzausführung performant steuern.
★ 14.536+38Sterne-Änderung der letzten 7 Tage - #6
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.984+2.287Sterne-Änderung der letzten 7 Tage - #7
Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.
★ 7.179+442Sterne-Änderung der letzten 7 Tage - #8
FlashInfer: Kernel-Bibliothek für LLM-Serving
★ 6.321+38Sterne-Änderung der letzten 7 Tage - #9
:electron: Ein inoffizieller, UI-fokussierter App-Client für https://bgm.tv für Android und iOS, entwickelt mit React Native.
★ 5.900+6Sterne-Änderung der letzten 7 Tage - #10★ 4.422+1Sterne-Änderung der letzten 7 Tage
- #11★ 2.322+0Sterne-Änderung der letzten 7 Tage
- #12★ 2.174+1Sterne-Änderung der letzten 7 Tage
- #13
UCCL ist eine effiziente Kommunikationsbibliothek für GPUs, die Collectives, P2P (z. B. KV-Cache-Transfer, RL-Gewichtetransfer) und EP (z. B. GPU-gesteuert) abdeckt.
★ 1.502+3Sterne-Änderung der letzten 7 Tage - #14
PyTorch-Neuimplementierung von „The Sparsely-Gated Mixture-of-Experts Layer“ von Noam Shazeer et al. https://arxiv.org/abs/1701.06538
★ 1.253+0Sterne-Änderung der letzten 7 Tage - #15
Tutel MoE: Optimierte Mixture-of-Experts-Bibliothek, unterstützt GptOss/DeepSeek/Kimi-K2/Qwen3 mit FP8/NVFP4/MXFP4
★ 1.017+3Sterne-Änderung der letzten 7 Tage - #16
⛷️ LLaMA-MoE: Erstellung von Mixture-of-Experts aus LLaMA mit kontinuierlichem Vortraining (EMNLP 2024)
★ 1.003+2Sterne-Änderung der letzten 7 Tage - #17
Das cuDNN Frontend ist NVIDIAs moderner Open-Source-Einstiegspunkt in die cuDNN-Bibliothek und eine wachsende Sammlung von Hochleistungs-Open-Source-Kerneln.
★ 931+11Sterne-Änderung der letzten 7 Tage - #18
Adan: Adaptiver Nesterov-Momentum-Algorithmus für eine schnellere Optimierung von Deep-Modellen
★ 822+0Sterne-Änderung der letzten 7 Tage - #19
Eine Open-Source-Lösung für das vollständige Parameter-Fine-Tuning von DeepSeek-V3/R1 671B, einschließlich vollständigem Code und Skripten vom Training bis zur Inferenz sowie einigen praktischen Erfahrungen und Schlussfolgerungen.
★ 812+0Sterne-Änderung der letzten 7 Tage - #20
⚡ Nativer MLX Swift LLM Inferenzserver für Apple Silicon. OpenAI-kompatible API, SSD-Streaming für 100B+ MoE-Modelle, TurboQuant KV-Cache-Kompression, macOS + iOS iPhone-App.
★ 760+6Sterne-Änderung der letzten 7 Tage - #21
[CVPR2026]🚀🚀🚀 Offizieller Code zum Papier „YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection.“ *(YOLO = You Only Look Once)* 🔥🔥🔥
★ 708+12Sterne-Änderung der letzten 7 Tage - #22
Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2
★ 677+14Sterne-Änderung der letzten 7 Tage - #23
Chinesisches Mixtral-MoE-Sprachmodell (Chinese Mixtral MoE LLMs).
★ 612+0Sterne-Änderung der letzten 7 Tage - #24
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 543—Sterne-Änderung der letzten 7 Tage