quantization
Repositorios de código abierto monitorizados etiquetados con quantization, ordenados por estrellas.
- #31★ 1579+0Variación de estrellas de los últimos 7 días
- #32
Un conjunto de herramientas para optimizar modelos de ML para su despliegue en Keras y TensorFlow, incluyendo cuantización y poda.
★ 1578+0Variación de estrellas de los últimos 7 días - #33★ 1568+1Variación de estrellas de los últimos 7 días
- #34
Calcula tokens/s y los requisitos de memoria GPU para cualquier LLM. Soporta cuantización llama.cpp/ggml/bnb/QLoRA.
★ 1406+0Variación de estrellas de los últimos 7 días - #35
Construya modelos de visión artificial en una fracción del tiempo y con menos datos.
★ 1325+5Variación de estrellas de los últimos 7 días - #36
Métodos de computación eficiente desarrollados por Huawei Noah's Ark Lab
★ 1307+0Variación de estrellas de los últimos 7 días - #37
Kit de herramientas de cuantización (compresión) de modelos LLM con soporte de aceleración por hardware para GPU Nvidia, AMD, Intel y CPU Intel/AMD/Apple a través de HF, vLLM y SGLang.
★ 1248+0Variación de estrellas de los últimos 7 días - #38
Marco de compresión de redes neuronales para una inferencia mejorada con OpenVINO™.
★ 1197+4Variación de estrellas de los últimos 7 días - #39
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1171+285Variación de estrellas de los últimos 7 días - #40
Kernel de inferencia LLM FP16xINT4 que logra aceleraciones casi ideales de ~4x en tamaños de lote medianos de 16-32 tokens.
★ 1138+2Variación de estrellas de los últimos 7 días - #41
Z80-μLM es un modelo de lenguaje cuantizado a 2 bits lo suficientemente pequeño como para ejecutarse en un procesador Z80 de 8 bits. Entrena modelos conversacionales en Python, expórtalos como binarios .COM de CP/M y chatea con tu computadora antigua.
★ 1119+2Variación de estrellas de los últimos 7 días - #42
Un backend de cuantización de PyTorch para optimum.
★ 1053-1Variación de estrellas de los últimos 7 días - #43★ 1049+4Variación de estrellas de los últimos 7 días
- #44
[ICML2025] SpargeAttention: una atención dispersa sin entrenamiento que acelera la inferencia de cualquier modelo.
★ 1043+1Variación de estrellas de los últimos 7 días - #45
Una herramienta para convertir archivos ONNX a LiteRT/TFLite/TensorFlow, código nativo de PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) y Dynamo ONNX. También admite la conversión directa de LiteRT a PyTorch.
★ 992+2Variación de estrellas de los últimos 7 días - #46
TinyChatEngine: Biblioteca de inferencia de LLM en el dispositivo.
★ 961+0Variación de estrellas de los últimos 7 días - #47★ 958+3Variación de estrellas de los últimos 7 días
- #48
[NeurIPS 2020] MCUNet: Aprendizaje profundo diminuto en dispositivos IoT; [NeurIPS 2021] MCUNetV2: Inferencia basada en parches eficiente en memoria para aprendizaje profundo diminuto; [NeurIPS 2022] MCUNetV3: Entrenamiento en dispositivo con menos de 256 KB de memoria.
★ 957+3Variación de estrellas de los últimos 7 días - #49
Biblioteca de cuantización de paletas que impulsa a pngquant y otros optimizadores de PNG.
★ 930+1Variación de estrellas de los últimos 7 días - #50
[ICLR2024 spotlight] OmniQuant es una técnica de cuantización simple y potente para LLM.
★ 918+8Variación de estrellas de los últimos 7 días - #51
Lista de artículos relacionados con la cuantización de redes neuronales en conferencias y revistas de IA recientes.
★ 851+6Variación de estrellas de los últimos 7 días - #52
[EMNLP 2024 & AAAI 2026] Un potente kit de herramientas para comprimir modelos grandes, incluyendo LLMs, VLMs y modelos generativos de video.
★ 747+4Variación de estrellas de los últimos 7 días - #53
[ICML 2024] SqueezeLLM: Cuantización densa y dispersa
★ 724+1Variación de estrellas de los últimos 7 días - #54
El Hailo Model Zoo incluye modelos preentrenados y un entorno completo de construcción y evaluación
★ 703+2Variación de estrellas de los últimos 7 días - #55
Repositorio oficial de SINQ: un método de cuantización novedoso, rápido y de alta calidad diseñado para reducir el tamaño de cualquier modelo de lenguaje grande preservando la precisión [ICML 2026]
★ 630+1Variación de estrellas de los últimos 7 días - #56★ 608+42Variación de estrellas de los últimos 7 días
- #57
Búsqueda semántica offline de texto a imagen e imagen a imagen en Android, impulsada por el modelo CLIP de visión-lenguaje cuantizado y el motor de inferencia ONNX Runtime
★ 599+1Variación de estrellas de los últimos 7 días - #58
QKeras: una biblioteca de aprendizaje profundo con cuantización para Tensorflow Keras.
★ 584+0Variación de estrellas de los últimos 7 días - #59
Herramienta para convertir onnx a keras o onnx a tflite. Espero que esta herramienta te sea de utilidad.
★ 579+0Variación de estrellas de los últimos 7 días - #60
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 566+30Variación de estrellas de los últimos 7 días