quantization
Repositorios de código abierto monitorizados etiquetados con quantization, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a quantization en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con quantization.
- #1
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 6918 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 969 - #3
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 559
- #1
Ajuste fino eficiente y unificado de más de 100 LLMs y VLMs (ACL 2024)
★ 74.443+158Variación de estrellas de los últimos 7 días - #2
Transcripción de Whisper más rápida con CTranslate2
★ 25.135+108Variación de estrellas de los últimos 7 días - #3
Modelos de lenguaje grande Chinese LLaMA y Alpaca + despliegue de entrenamiento local en CPU/GPU (Chinese LLaMA & Alpaca LLMs)
★ 18.934+2Variación de estrellas de los últimos 7 días - #4
[🔥actualizando ...] Robot de trading cuantitativo automático con IA (implementación totalmente local). Plataforma de investigación de inversión cuantitativa impulsada por IA. 📃 documentación en línea: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant
★ 18.418+46Variación de estrellas de los últimos 7 días - #5
Un índice vectorial construido sobre TurboQuant, escrito en Rust con enlaces para Python
★ 16.518+308Variación de estrellas de los últimos 7 días - #6
Modelos de lenguaje grandes accesibles mediante cuantización de k-bits para PyTorch.
★ 8446+16Variación de estrellas de los últimos 7 días - #7
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 6918+485Variación de estrellas de los últimos 7 días - #8
Compresor PNG con pérdida: comando pngquant basado en la biblioteca libimagequant.
★ 5744+4Variación de estrellas de los últimos 7 días - #9
Motor de inferencia rápido para modelos Transformer
★ 4651+23Variación de estrellas de los últimos 7 días - #10
[ICLR2025 Spotlight] SVDQuant: Absorción de valores atípicos mediante componentes de bajo rango para modelos de difusión de 4 bits
★ 3937+1Variación de estrellas de los últimos 7 días - #11
Librería compatible con Transformers para aplicar varios algoritmos de compresión a LLMs para un despliegue optimizado con vLLM
★ 3736+27Variación de estrellas de los últimos 7 días - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention logra una aceleración de 2 a 5 veces en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.
★ 3685+23Variación de estrellas de los últimos 7 días - #13
🚀 Acelera la inferencia y el entrenamiento de 🤗 Transformers, Diffusers, TIMM y Sentence Transformers con herramientas de optimización de hardware fáciles de usar
★ 3473+9Variación de estrellas de los últimos 7 días - #14
Modelo de lenguaje preentrenado y sus técnicas de optimización relacionadas desarrollado por Huawei Noah's Ark Lab.
★ 3166+1Variación de estrellas de los últimos 7 días - #15★ 2959+7Variación de estrellas de los últimos 7 días
- #16
Plugin de ComfyUI para Nunchaku
★ 2920+2Variación de estrellas de los últimos 7 días - #17
Tu hoja de trucos para la entrevista de ingeniería de IA: preguntas y respuestas.
★ 2888+112Variación de estrellas de los últimos 7 días - #18
Cuantización de LLM de pocos bits SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) y dispersión; técnicas líderes de compresión de modelos en PyTorch, TensorFlow y ONNX Runtime.
★ 2706+5Variación de estrellas de los últimos 7 días - #19
AIMET es una librería que proporciona técnicas avanzadas de cuantización y compresión para modelos de redes neuronales entrenados.
★ 2690+7Variación de estrellas de los últimos 7 días - #20
Construye, personaliza y controla tus propios LLM. Desde el preprocesamiento de datos hasta el ajuste fino (fine-tuning), xTuring proporciona una forma sencilla de personalizar LLM de código abierto. Únete a nuestra comunidad de Discord: https://discord.gg/TgHXuSJEk6
★ 2674+0Variación de estrellas de los últimos 7 días - #21
Una lista de artículos, documentación y código sobre cuantización de modelos. Este repositorio busca proveer información para la investigación en cuantización y mejoramos continuamente. ¡Bienvenidas las contribuciones de trabajos faltantes!
★ 2433+4Variación de estrellas de los últimos 7 días - #22
Domina la IA aplicada, un concepto a la vez
★ 2377-1Variación de estrellas de los últimos 7 días - #23
Ejecuta modelos Mixtral-8x7B en Colab o en ordenadores de escritorio de consumo
★ 2333+1Variación de estrellas de los últimos 7 días - #24
micronet, una biblioteca de compresión y despliegue de modelos. compresión: 1. cuantificación: entrenamiento consciente de la cuantificación (QAT), de bits altos (>2b) (DoReFa/Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference), de bits bajos (≤2b)/ternaria y binaria (TWN/BNN/XNOR-Net); cuantificación posterior al entrenamiento (PTQ), de 8 bits (tensorrt); 2. poda: poda de canales convolucionales normal, regular y por grupos; 3. gru
★ 2266+0Variación de estrellas de los últimos 7 días - #25
Ejecuta un LLM de 1 mil millones de parámetros en una placa de 10 dólares con 256 MB de RAM
★ 1923+6Variación de estrellas de los últimos 7 días - #26
PPL Quantization Tool (PPQ) es una potente herramienta de cuantización de redes neuronales offline
★ 1817+2Variación de estrellas de los últimos 7 días - #27★ 1682+0Variación de estrellas de los últimos 7 días
- #28
PaddleSlim es una biblioteca de código abierto para la compresión de modelos profundos y la búsqueda de arquitectura.
★ 1612+1Variación de estrellas de los últimos 7 días - #29
Un algoritmo de cuantización SOTA para inferencia de LLM de bajo bit y alta precisión, optimizado para CPU/XPU/CUDA, con soporte para múltiples tipos de datos y compatibilidad total con vLLM, SGLang y Transformers.
★ 1594+15Variación de estrellas de los últimos 7 días - #30★ 1579-1Variación de estrellas de los últimos 7 días