mit-han-lab
Erfasste Open-Source-Repos von mit-han-lab, sortiert nach Sternen.
- #1
[ICLR 2024] Effiziente Streaming-Sprachmodelle mit Attention Sinks
★ 7.268+0Sterne-Änderung der letzten 7 Tage - #2
[MLSys 2024 Best Paper Award] AWQ: Aktivierungsbewusste Gewichtsquantisierung für LLM-Kompression und -Beschleunigung
★ 3.624+1Sterne-Änderung der letzten 7 Tage - #3
Effiziente Vision-Foundation-Modelle für hochauflösende Generierung und Wahrnehmung.
★ 3.356+1Sterne-Änderung der letzten 7 Tage - #4
[ICCV 2019] TSM: Temporal Shift Module für effizientes Video-Understanding
★ 2.222+1Sterne-Änderung der letzten 7 Tage - #5
[ICML 2023] SmoothQuant: Genaue und effiziente Post-Training-Quantisierung für Large Language Models
★ 1.681+2Sterne-Änderung der letzten 7 Tage - #6
Ein PyTorch-basiertes Framework für Quanten-Klassische Simulation, Quanten-Maschinelles Lernen, Quanten-Neuronale Netze und parametrisierte Quantenschaltkreise mit Unterstützung für die einfache Bereitstellung auf echten Quantencomputern.
★ 1.663+0Sterne-Änderung der letzten 7 Tage - #7
[MICRO'23, MLSys'22] TorchSparse: Effizientes Trainings- und Inferenz-Framework für sparsame Fokonvolutionen auf GPUs.
★ 1.472+0Sterne-Änderung der letzten 7 Tage - #8
[ICLR 2019] ProxylessNAS: Direkte neuronale Architektursuche für Zielaufgaben und -hardware
★ 1.447+0Sterne-Änderung der letzten 7 Tage - #9
[NeurIPS 2020] Differentiable Augmentation für das dateneffiziente GAN-Training
★ 1.308+0Sterne-Änderung der letzten 7 Tage - #10
[CVPR 2020] GAN Compression: Effiziente Architekturen für interaktive konditionale GANs.
★ 1.115+0Sterne-Änderung der letzten 7 Tage - #11
StreamingVLM: Echtzeit-Verständnis für unendliche Videostreams
★ 1.076+3Sterne-Änderung der letzten 7 Tage - #12
TinyChatEngine: LLM-Inferenzbibliothek für Endgeräte
★ 961+0Sterne-Änderung der letzten 7 Tage - #13
[NeurIPS 2020] MCUNet: Tiny Deep Learning auf IoT-Geräten; [NeurIPS 2021] MCUNetV2: Speicherffiziente, patch-basierte Inferenz für Tiny Deep Learning; [NeurIPS 2022] MCUNetV3: On-Device-Training unter 256 KB Speicher
★ 957+3Sterne-Änderung der letzten 7 Tage - #14★ 949+67Sterne-Änderung der letzten 7 Tage
- #15
[MLSys'25] QServe: W4A8KV4-Quantisierung und System-Codesign für effizientes LLM-Serving; [MLSys'25] LServe: Effizientes Long-Sequence-LLM-Serving mit einheitlicher Sparse-Attention
★ 856+2Sterne-Änderung der letzten 7 Tage - #16
[CVPR 2024 Highlight] DistriFusion: Verteilte parallele Inferenz für hochauflösende Diffusion Models
★ 728+0Sterne-Änderung der letzten 7 Tage - #17
[IJCV] FastComposer: Tuning-freie Multi-Subject-Bildgenerierung mit lokalisierter Attention
★ 714-1Sterne-Änderung der letzten 7 Tage - #18
[NeurIPS 2020] MCUNet: Tiny Deep Learning auf IoT-Geräten; [NeurIPS 2021] MCUNetV2: Speichereffiziente, patchbasierte Inferenz für Tiny Deep Learning
★ 713+1Sterne-Änderung der letzten 7 Tage - #19★ 649+2Sterne-Änderung der letzten 7 Tage
- #20
[NeurIPS 2025] Radial Attention: O(nlogn) Sparse Attention mit Energy Decay für die Generierung langer Videos
★ 607-1Sterne-Änderung der letzten 7 Tage - #21
Ein Sparse-Attention-Kernel mit Unterstützung für gemischte Sparse-Muster
★ 549+1Sterne-Änderung der letzten 7 Tage - #22
[ICLR 2025] DuoAttention: Effiziente Long-Context LLM-Inferenz mit Retrieval- und Streaming-Heads.
★ 539+0Sterne-Änderung der letzten 7 Tage - #23
On-Device-Training mit weniger als 256 KB Speicher [NeurIPS'22].
★ 524+0Sterne-Änderung der letzten 7 Tage