mit-han-lab
Repositórios de código aberto acompanhados de mit-han-lab, ordenados por estrelas.
- #1
[ICLR 2024] Modelos de linguagem de streaming eficientes com Attention Sinks.
★ 7.268+0Variação de estrelas nos últimos 7 dias - #2
[Prêmio de Melhor Artigo MLSys 2024] AWQ: Quantização de Peso com Consciência de Ativação para Compressão e Aceleração de LLM
★ 3.624+1Variação de estrelas nos últimos 7 dias - #3
Modelos fundamentais de visão eficientes para geração e percepção de alta resolução.
★ 3.356+1Variação de estrelas nos últimos 7 dias - #4
[ICCV 2019] TSM: Módulo de Deslocamento Temporal para compreensão eficiente de vídeo.
★ 2.222+1Variação de estrelas nos últimos 7 dias - #5
[ICML 2023] SmoothQuant: Quantização pós-treinamento precisa e eficiente para Large Language Models
★ 1.681+2Variação de estrelas nos últimos 7 dias - #6
Uma estrutura baseada em PyTorch para simulação quântica clássica, aprendizado de máquina quântico, redes neurais quânticas e circuitos quânticos parametrizados, com suporte para implantação fácil em computadores quânticos reais.
★ 1.663+0Variação de estrelas nos últimos 7 dias - #7
[MICRO'23, MLSys'22] TorchSparse: Framework eficiente de treinamento e inferência para convolução esparsa em GPUs.
★ 1.472+0Variação de estrelas nos últimos 7 dias - #8
[ICLR 2019] ProxylessNAS: Busca direta de arquitetura neural em tarefas e hardware de destino
★ 1.447+0Variação de estrelas nos últimos 7 dias - #9
[NeurIPS 2020] Aumento diferenciável para treinamento de GAN com eficiência de dados
★ 1.308+0Variação de estrelas nos últimos 7 dias - #10
[CVPR 2020] Compressão de GAN: Arquiteturas eficientes para GANs condicionais interativas
★ 1.115+0Variação de estrelas nos últimos 7 dias - #11
StreamingVLM: Compreensão em tempo real para fluxos de vídeo infinitos
★ 1.076+3Variação de estrelas nos últimos 7 dias - #12
TinyChatEngine: Biblioteca de inferência de LLM em dispositivos
★ 961+0Variação de estrelas nos últimos 7 dias - #13
[NeurIPS 2020] MCUNet: Tiny Deep Learning on IoT Devices; [NeurIPS 2021] MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning; [NeurIPS 2022] MCUNetV3: On-Device Training Under 256KB Memory
★ 957+3Variação de estrelas nos últimos 7 dias - #14★ 955+73Variação de estrelas nos últimos 7 dias
- #15
[MLSys'25] QServe: Quantização W4A8KV4 e Co-design de Sistema para Servir LLMs de Forma Eficiente; [MLSys'25] LServe: Servir LLMs de Sequência Longa de Forma Eficiente com Atenção Esparsa Unificada
★ 856+2Variação de estrelas nos últimos 7 dias - #16
[CVPR 2024 Highlight] DistriFusion: Inferência Paralela Distribuída para Modelos de Difusão de Alta Resolução
★ 728+0Variação de estrelas nos últimos 7 dias - #17
[IJCV] FastComposer: Geração de imagens de múltiplos sujeitos sem ajuste fino com atenção localizada
★ 714-1Variação de estrelas nos últimos 7 dias - #18
[NeurIPS 2020] MCUNet: Deep Learning compacto em dispositivos IoT; [NeurIPS 2021] MCUNetV2: Inferência baseada em patches com eficiência de memória para Deep Learning compacto
★ 713+2Variação de estrelas nos últimos 7 dias - #19★ 649+2Variação de estrelas nos últimos 7 dias
- #20
[NeurIPS 2025] Radial Attention: Atenção esparsa O(nlogn) com decaimento de energia para geração de vídeos longos
★ 607-1Variação de estrelas nos últimos 7 dias - #21
Um kernel de atenção esparsa que suporta padrões esparsos mistos
★ 549+1Variação de estrelas nos últimos 7 dias - #22
[ICLR 2025] DuoAttention: Inferência eficiente de LLM de contexto longo com Retrieval e Streaming Heads
★ 540+0Variação de estrelas nos últimos 7 dias - #23
Treinamento no dispositivo com menos de 256 KB de memória [NeurIPS'22]
★ 524+0Variação de estrelas nos últimos 7 dias