moe
Repositórios de código aberto acompanhados marcados com moe, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de moe no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com moe.
- #1
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.217 - #2
Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.
★ 7.016 - #3
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 528
- #1
Um mecanismo de inferência e atendimento de alto rendimento e eficiente em memória para LLMs
★ 90.415+745Variação de estrelas nos últimos 7 dias - #2
Ajuste fino eficiente e unificado de mais de 100 LLMs e VLMs (ACL 2024)
★ 74.443+158Variação de estrelas nos últimos 7 dias - #3
SGLang é um framework de atendimento de alto desempenho para grandes modelos de linguagem e modelos multimodais.
★ 32.747+503Variação de estrelas nos últimos 7 dias - #4
Use PEFT ou Full-parameter para CPT/SFT/DPO/GRPO em mais de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) e mais de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.400+76Variação de estrelas nos últimos 7 dias - #5
O TensorRT LLM oferece aos usuários uma API Python fácil de usar para definir Large Language Models (LLMs) e suporta otimizações de ponta para realizar inferências de forma eficiente em GPUs NVIDIA. O TensorRT LLM também contém componentes para criar runtimes em Python e C++ que orquestram a execução da inferência de maneira performática.
★ 14.498+58Variação de estrelas nos últimos 7 dias - #6
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.217—Variação de estrelas nos últimos 7 dias - #7
Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.
★ 7.016+485Variação de estrelas nos últimos 7 dias - #8
FlashInfer: Biblioteca de kernel para servir LLMs.
★ 6.313+76Variação de estrelas nos últimos 7 dias - #9
Um cliente não oficial para o bgm.tv para Android e iOS, construído com React Native. Um aplicativo de registro de animes focado em ACG, sem anúncios e sem fins lucrativos. Redesenhado para dispositivos móveis, com recursos avançados e opções de personalização.
★ 5.899+37Variação de estrelas nos últimos 7 dias - #10★ 4.423+8Variação de estrelas nos últimos 7 dias
- #11★ 2.322+0Variação de estrelas nos últimos 7 dias
- #12★ 2.174+7Variação de estrelas nos últimos 7 dias
- #13
UCCL é uma biblioteca de comunicação eficiente para GPUs, abrangendo coletivos, P2P (ex: transferência de cache KV, transferência de pesos de RL) e EP (ex: orientado por GPU)
★ 1.501+7Variação de estrelas nos últimos 7 dias - #14
Reimplementação em PyTorch de "The Sparsely-Gated Mixture-of-Experts Layer" por Noam Shazeer et al. https://arxiv.org/abs/1701.06538
★ 1.253+2Variação de estrelas nos últimos 7 dias - #15
Tutel MoE: Biblioteca otimizada de Mixture-of-Experts, com suporte a GptOss/DeepSeek/Kimi-K2/Qwen3 usando FP8/NVFP4/MXFP4
★ 1.016+4Variação de estrelas nos últimos 7 dias - #16
LLaMA-MoE: Construindo Mixture-of-Experts a partir do LLaMA com pré-treinamento contínuo (EMNLP 2024).
★ 1.001+0Variação de estrelas nos últimos 7 dias - #17
O frontend do cuDNN é o ponto de entrada moderno e de código aberto da NVIDIA para a biblioteca cuDNN e uma coleção crescente de kernels de código aberto de alto desempenho.
★ 923+5Variação de estrelas nos últimos 7 dias - #18
Adan: Algoritmo de Momento Nesterov Adaptativo para otimização mais rápida de modelos profundos.
★ 822+0Variação de estrelas nos últimos 7 dias - #19
Uma solução de código aberto para o ajuste fino de parâmetros completos do DeepSeek-V3/R1 671B, incluindo código completo e scripts do treinamento à inferência, bem como algumas experiências práticas e conclusões.
★ 812+0Variação de estrelas nos últimos 7 dias - #20
⚡ Servidor de inferência LLM nativo em MLX Swift para Apple Silicon. API compatível com OpenAI, streaming SSD para modelos MoE 100B+, compressão de cache KV TurboQuant, aplicativo para macOS e iOS iPhone.
★ 754+8Variação de estrelas nos últimos 7 dias - #21
[CVPR2026]🚀🚀🚀Código oficial para o artigo "YOLO-Master: Acelerado por MOE com Transformers especializados para detecção em tempo real aprimorada." *(YOLO = You Only Look Once)* 🔥🔥🔥
★ 700+9Variação de estrelas nos últimos 7 dias - #22
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 669+4Variação de estrelas nos últimos 7 dias - #23
Modelos de Grandes Misturas de Especialistas (Mixtral MoE LLMs) em Chinês
★ 612+0Variação de estrelas nos últimos 7 dias - #24
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 528—Variação de estrelas nos últimos 7 dias