moe
Repositori open source terpantau bertanda moe, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan moe di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda moe.
- #1
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.984 - #2
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 7.179 - #3
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 543
- #1★ 90.817+402Perubahan bintang dalam 7 hari terakhir
- #2
Fine-Tuning Efisien Terpadu untuk 100+ LLM & VLM (ACL 2024)
★ 74.532+89Perubahan bintang dalam 7 hari terakhir - #3
SGLang adalah kerangka kerja penyajian berkinerja tinggi untuk model bahasa besar dan model multimodal.
★ 33.538+791Perubahan bintang dalam 7 hari terakhir - #4
Gunakan PEFT atau Full-parameter untuk CPT/SFT/DPO/GRPO 600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) dan 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Perubahan bintang dalam 7 hari terakhir - #5
TensorRT LLM menyediakan API Python yang mudah digunakan bagi pengguna untuk mendefinisikan Large Language Models (LLM) dan mendukung optimasi terkini untuk melakukan inferensi secara efisien pada GPU NVIDIA. TensorRT LLM juga berisi komponen untuk membuat runtime Python dan C++ yang mengatur eksekusi inferensi dengan performa tinggi.
★ 14.536+38Perubahan bintang dalam 7 hari terakhir - #6
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.984+2.287Perubahan bintang dalam 7 hari terakhir - #7
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 7.179+442Perubahan bintang dalam 7 hari terakhir - #8
FlashInfer: Pustaka Kernel untuk LLM Serving
★ 6.321+38Perubahan bintang dalam 7 hari terakhir - #9
:electron: Aplikasi klien tidak resmi untuk https://bgm.tv yang mengutamakan UI untuk Android dan iOS, dibangun dengan React Native. Aplikasi ini bebas iklan, didorong oleh hobi, tidak bertujuan mencari keuntungan, dan khusus untuk mencatat riwayat menonton anime/ACG seperti Douban. Didesain ulang untuk perangkat seluler, dilengkapi dengan banyak fitur canggih yang sulit diimplementasikan di versi web, serta menyediakan opsi kustomisasi yang luas. Saat ini telah diadaptasi untuk iOS / Android.
★ 5.900+6Perubahan bintang dalam 7 hari terakhir - #10★ 4.422+1Perubahan bintang dalam 7 hari terakhir
- #11★ 2.322+0Perubahan bintang dalam 7 hari terakhir
- #12★ 2.174+1Perubahan bintang dalam 7 hari terakhir
- #13
UCCL adalah pustaka komunikasi yang efisien untuk GPU, mencakup kolektif, P2P (misal, transfer cache KV, transfer bobot RL), dan EP (misal, yang digerakkan oleh GPU)
★ 1.502+3Perubahan bintang dalam 7 hari terakhir - #14
Implementasi Ulang PyTorch dari "The Sparsely-Gated Mixture-of-Experts Layer" oleh Noam Shazeer dkk. https://arxiv.org/abs/1701.06538
★ 1.253+0Perubahan bintang dalam 7 hari terakhir - #15
Tutel MoE: Pustaka Mixture-of-Experts yang dioptimalkan, mendukung GptOss/DeepSeek/Kimi-K2/Qwen3 menggunakan FP8/NVFP4/MXFP4
★ 1.017+3Perubahan bintang dalam 7 hari terakhir - #16
⛷️ LLaMA-MoE: Membangun Mixture-of-Experts dari LLaMA dengan Pra-pelatihan Berkelanjutan (EMNLP 2024)
★ 1.003+2Perubahan bintang dalam 7 hari terakhir - #17
Frontend cuDNN adalah titik masuk modern dan sumber terbuka milik NVIDIA ke perpustakaan cuDNN serta kumpulan kernel sumber terbuka performa tinggi yang terus berkembang.
★ 931+11Perubahan bintang dalam 7 hari terakhir - #18
Adan: Algoritma Adaptive Nesterov Momentum untuk optimasi model deep learning yang lebih cepat.
★ 822+0Perubahan bintang dalam 7 hari terakhir - #19
Solusi sumber terbuka untuk penyetelan halus parameter penuh DeepSeek-V3/R1 671B, termasuk kode dan skrip lengkap dari pelatihan hingga inferensi, serta beberapa pengalaman dan kesimpulan praktis.
★ 812+0Perubahan bintang dalam 7 hari terakhir - #20
⚡ Server inferensi LLM MLX Swift native untuk Apple Silicon. API yang kompatibel dengan OpenAI, streaming SSD untuk model MoE 100B+, kompresi cache KV TurboQuant, aplikasi MACOS + iOS iPhone.
★ 760+6Perubahan bintang dalam 7 hari terakhir - #21
[CVPR2026] Kode resmi untuk makalah "YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection."
★ 708+12Perubahan bintang dalam 7 hari terakhir - #22
Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2
★ 677+14Perubahan bintang dalam 7 hari terakhir - #23
Model Bahasa Besar Campuran Pakar Mixtral Bahasa Tionghoa (Chinese Mixtral MoE LLMs)
★ 612+0Perubahan bintang dalam 7 hari terakhir - #24
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 543—Perubahan bintang dalam 7 hari terakhir