Saltar al contenido principal
buildradar
Sign in
Tema · quantization

quantization

Repositorios de código abierto monitorizados etiquetados con quantization, ordenados por estrellas.

62 repositorios
  • rwkv.cpp@RWKV

    Inferencia INT4/INT5/INT8 y FP16 en CPU para el modelo de lenguaje RWKV

    1579+0Variación de estrellas de los últimos 7 días
  • model-optimization@tensorflow

    Un conjunto de herramientas para optimizar modelos de ML para su despliegue en Keras y TensorFlow, incluyendo cuantización y poda.

    1578+0Variación de estrellas de los últimos 7 días
  • brevitas@Xilinx

    Brevitas: cuantización de redes neuronales en PyTorch

    1568+1Variación de estrellas de los últimos 7 días
  • gpu_poor@RahulSChand

    Calcula tokens/s y los requisitos de memoria GPU para cualquier LLM. Soporta cuantización llama.cpp/ggml/bnb/QLoRA.

    1406+0Variación de estrellas de los últimos 7 días
  • geti@open-edge-platform

    Construya modelos de visión artificial en una fracción del tiempo y con menos datos.

    1325+5Variación de estrellas de los últimos 7 días
  • Efficient-Computing@huawei-noah

    Métodos de computación eficiente desarrollados por Huawei Noah's Ark Lab

    1307+0Variación de estrellas de los últimos 7 días
  • GPTQModel@ModelCloud

    Kit de herramientas de cuantización (compresión) de modelos LLM con soporte de aceleración por hardware para GPU Nvidia, AMD, Intel y CPU Intel/AMD/Apple a través de HF, vLLM y SGLang.

    1248+0Variación de estrellas de los últimos 7 días
  • nncf@openvinotoolkit

    Marco de compresión de redes neuronales para una inferencia mejorada con OpenVINO™.

    1197+4Variación de estrellas de los últimos 7 días
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1171+285Variación de estrellas de los últimos 7 días
  • marlin@IST-DASLab

    Kernel de inferencia LLM FP16xINT4 que logra aceleraciones casi ideales de ~4x en tamaños de lote medianos de 16-32 tokens.

    1138+2Variación de estrellas de los últimos 7 días
  • z80ai@HarryR

    Z80-μLM es un modelo de lenguaje cuantizado a 2 bits lo suficientemente pequeño como para ejecutarse en un procesador Z80 de 8 bits. Entrena modelos conversacionales en Python, expórtalos como binarios .COM de CP/M y chatea con tu computadora antigua.

    1119+2Variación de estrellas de los últimos 7 días
  • optimum-quanto@huggingface

    Un backend de cuantización de PyTorch para optimum.

    1053-1Variación de estrellas de los últimos 7 días
  • finn@Xilinx

    Compilador de flujo de datos para inferencia QNN en FPGAs.

    1049+4Variación de estrellas de los últimos 7 días
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: una atención dispersa sin entrenamiento que acelera la inferencia de cualquier modelo.

    1043+1Variación de estrellas de los últimos 7 días
  • onnx2tf@PINTO0309

    Una herramienta para convertir archivos ONNX a LiteRT/TFLite/TensorFlow, código nativo de PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) y Dynamo ONNX. También admite la conversión directa de LiteRT a PyTorch.

    992+2Variación de estrellas de los últimos 7 días
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: Biblioteca de inferencia de LLM en el dispositivo.

    961+0Variación de estrellas de los últimos 7 días
  • hqq@dropbox

    Implementación oficial de Half-Quadratic Quantization (HQQ)

    958+3Variación de estrellas de los últimos 7 días
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: Aprendizaje profundo diminuto en dispositivos IoT; [NeurIPS 2021] MCUNetV2: Inferencia basada en parches eficiente en memoria para aprendizaje profundo diminuto; [NeurIPS 2022] MCUNetV3: Entrenamiento en dispositivo con menos de 256 KB de memoria.

    957+3Variación de estrellas de los últimos 7 días
  • libimagequant@ImageOptim

    Biblioteca de cuantización de paletas que impulsa a pngquant y otros optimizadores de PNG.

    930+1Variación de estrellas de los últimos 7 días
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant es una técnica de cuantización simple y potente para LLM.

    918+8Variación de estrellas de los últimos 7 días
  • Lista de artículos relacionados con la cuantización de redes neuronales en conferencias y revistas de IA recientes.

    851+6Variación de estrellas de los últimos 7 días
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Un potente kit de herramientas para comprimir modelos grandes, incluyendo LLMs, VLMs y modelos generativos de video.

    747+4Variación de estrellas de los últimos 7 días
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: Cuantización densa y dispersa

    724+1Variación de estrellas de los últimos 7 días
  • hailo_model_zoo@hailo-ai

    El Hailo Model Zoo incluye modelos preentrenados y un entorno completo de construcción y evaluación

    703+2Variación de estrellas de los últimos 7 días
  • SINQ@huawei-csl

    Repositorio oficial de SINQ: un método de cuantización novedoso, rápido y de alta calidad diseñado para reducir el tamaño de cualquier modelo de lenguaje grande preservando la precisión [ICML 2026]

    630+1Variación de estrellas de los últimos 7 días
  • hipfire@warpfront

    Motor de inferencia LLM nativo de RDNA en Rust.

    608+42Variación de estrellas de los últimos 7 días
  • tidy@slavabarkov

    Búsqueda semántica offline de texto a imagen e imagen a imagen en Android, impulsada por el modelo CLIP de visión-lenguaje cuantizado y el motor de inferencia ONNX Runtime

    599+1Variación de estrellas de los últimos 7 días
  • qkeras@google

    QKeras: una biblioteca de aprendizaje profundo con cuantización para Tensorflow Keras.

    584+0Variación de estrellas de los últimos 7 días
  • onnx2tflite@MPolaris

    Herramienta para convertir onnx a keras o onnx a tflite. Espero que esta herramienta te sea de utilidad.

    579+0Variación de estrellas de los últimos 7 días
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    566+30Variación de estrellas de los últimos 7 días
← Volver a temas