mit-han-lab
Repositorios de código abierto monitorizados de mit-han-lab, ordenados por estrellas.
- #1
[ICLR 2024] Modelos de lenguaje en streaming eficientes con Attention Sinks
★ 7268+0Variación de estrellas de los últimos 7 días - #2
[Premio al mejor artículo en MLSys 2024] AWQ: Cuantización de pesos basada en activaciones para compresión y aceleración de LLM
★ 3624+1Variación de estrellas de los últimos 7 días - #3
Modelos fundacionales de visión eficientes para generación y percepción de alta resolución.
★ 3356+1Variación de estrellas de los últimos 7 días - #4
[ICCV 2019] TSM: Módulo de cambio temporal para la comprensión eficiente de videos
★ 2222+1Variación de estrellas de los últimos 7 días - #5
[ICML 2023] SmoothQuant: Cuantización post-entrenamiento precisa y eficiente para modelos de lenguaje grandes.
★ 1681+2Variación de estrellas de los últimos 7 días - #6
Un framework basado en PyTorch para simulación cuántica clásica, aprendizaje automático cuántico, redes neuronales cuánticas y circuitos cuánticos parametrizados, con soporte para despliegue sencillo en computadoras cuánticas reales.
★ 1663+0Variación de estrellas de los últimos 7 días - #7
[MICRO'23, MLSys'22] TorchSparse: Framework eficiente de entrenamiento e inferencia para convolución dispersa en GPUs.
★ 1472+0Variación de estrellas de los últimos 7 días - #8
[ICLR 2019] ProxylessNAS: Búsqueda directa de arquitectura neuronal en tareas y hardware objetivo
★ 1447+0Variación de estrellas de los últimos 7 días - #9
[NeurIPS 2020] Aumento diferenciable para el entrenamiento eficiente de datos en GAN.
★ 1308+0Variación de estrellas de los últimos 7 días - #10
[CVPR 2020] Compresión de GAN: arquitecturas eficientes para GAN condicionales interactivas
★ 1115+0Variación de estrellas de los últimos 7 días - #11
StreamingVLM: Comprensión en tiempo real para flujos de video infinitos
★ 1076+3Variación de estrellas de los últimos 7 días - #12
TinyChatEngine: Biblioteca de inferencia de LLM en el dispositivo.
★ 961+0Variación de estrellas de los últimos 7 días - #13
[NeurIPS 2020] MCUNet: Aprendizaje profundo diminuto en dispositivos IoT; [NeurIPS 2021] MCUNetV2: Inferencia basada en parches eficiente en memoria para aprendizaje profundo diminuto; [NeurIPS 2022] MCUNetV3: Entrenamiento en dispositivo con menos de 256 KB de memoria.
★ 957+3Variación de estrellas de los últimos 7 días - #14★ 949+67Variación de estrellas de los últimos 7 días
- #15
[MLSys'25] QServe: Cuantización W4A8KV4 y codiseño de sistemas para un servicio eficiente de LLM; [MLSys'25] LServe: Servicio eficiente de LLM de secuencia larga con atención dispersa unificada
★ 856+2Variación de estrellas de los últimos 7 días - #16
[CVPR 2024 Highlight] DistriFusion: Inferencia paralela distribuida para modelos de difusión de alta resolución.
★ 728+0Variación de estrellas de los últimos 7 días - #17
[IJCV] FastComposer: Generación de imágenes de múltiples sujetos sin ajuste fino con atención localizada.
★ 714-1Variación de estrellas de los últimos 7 días - #18
[NeurIPS 2020] MCUNet: Aprendizaje profundo ligero en dispositivos IoT; [NeurIPS 2021] MCUNetV2: Inferencia basada en parches con uso eficiente de memoria para aprendizaje profundo ligero
★ 713+1Variación de estrellas de los últimos 7 días - #19★ 649+2Variación de estrellas de los últimos 7 días
- #20
[NeurIPS 2025] Radial Attention: Atención dispersa O(nlogn) con decaimiento de energía para la generación de videos largos.
★ 607-1Variación de estrellas de los últimos 7 días - #21
Un kernel de atención dispersa que admite patrones dispersos mixtos
★ 549+1Variación de estrellas de los últimos 7 días - #22
[ICLR 2025] DuoAttention: Inferencia eficiente de LLM de contexto largo con recuperación y cabezales de streaming.
★ 539+0Variación de estrellas de los últimos 7 días - #23
Entrenamiento en dispositivo con menos de 256 KB de memoria [NeurIPS'22]
★ 524+0Variación de estrellas de los últimos 7 días