Saltar al contenido principal
buildradar
Sign in
Tema · quantization

quantization

Repositorios de código abierto monitorizados etiquetados con quantization, ordenados por estrellas.

Repositorios
62
Estrellas totales
264.169
Estrellas de media
4261
Proporción
0,01%

Temas que aparecen con frecuencia junto a quantization en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con quantization.

  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    6918
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    969
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    559
  • LlamaFactory@hiyouga

    Ajuste fino eficiente y unificado de más de 100 LLMs y VLMs (ACL 2024)

    74.443+158Variación de estrellas de los últimos 7 días
  • faster-whisper@SYSTRAN

    Transcripción de Whisper más rápida con CTranslate2

    25.135+108Variación de estrellas de los últimos 7 días
  • Modelos de lenguaje grande Chinese LLaMA y Alpaca + despliegue de entrenamiento local en CPU/GPU (Chinese LLaMA & Alpaca LLMs)

    18.934+2Variación de estrellas de los últimos 7 días
  • Qbot@UFund-Me

    [🔥actualizando ...] Robot de trading cuantitativo automático con IA (implementación totalmente local). Plataforma de investigación de inversión cuantitativa impulsada por IA. 📃 documentación en línea: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant

    18.418+46Variación de estrellas de los últimos 7 días
  • turbovec@RyanCodrai

    Un índice vectorial construido sobre TurboQuant, escrito en Rust con enlaces para Python

    16.518+308Variación de estrellas de los últimos 7 días
  • bitsandbytes@bitsandbytes-foundation

    Modelos de lenguaje grandes accesibles mediante cuantización de k-bits para PyTorch.

    8446+16Variación de estrellas de los últimos 7 días
  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    6918+485Variación de estrellas de los últimos 7 días
  • pngquant@kornelski

    Compresor PNG con pérdida: comando pngquant basado en la biblioteca libimagequant.

    5744+4Variación de estrellas de los últimos 7 días
  • CTranslate2@OpenNMT

    Motor de inferencia rápido para modelos Transformer

    4651+23Variación de estrellas de los últimos 7 días
  • nunchaku@nunchaku-ai

    [ICLR2025 Spotlight] SVDQuant: Absorción de valores atípicos mediante componentes de bajo rango para modelos de difusión de 4 bits

    3937+1Variación de estrellas de los últimos 7 días
  • llm-compressor@vllm-project

    Librería compatible con Transformers para aplicar varios algoritmos de compresión a LLMs para un despliegue optimizado con vLLM

    3736+27Variación de estrellas de los últimos 7 días
  • SageAttention@thu-ml

    [ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention logra una aceleración de 2 a 5 veces en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.

    3685+23Variación de estrellas de los últimos 7 días
  • optimum@huggingface

    🚀 Acelera la inferencia y el entrenamiento de 🤗 Transformers, Diffusers, TIMM y Sentence Transformers con herramientas de optimización de hardware fáciles de usar

    3473+9Variación de estrellas de los últimos 7 días
  • Modelo de lenguaje preentrenado y sus técnicas de optimización relacionadas desarrollado por Huawei Noah's Ark Lab.

    3166+1Variación de estrellas de los últimos 7 días
  • ao@pytorch

    Cuantización nativa de PyTorch para entrenamiento e inferencia

    2959+7Variación de estrellas de los últimos 7 días
  • ComfyUI-nunchaku@nunchaku-ai

    Plugin de ComfyUI para Nunchaku

    2920+2Variación de estrellas de los últimos 7 días
  • ai-engineering-interview-questions@amitshekhariitbhu

    Tu hoja de trucos para la entrevista de ingeniería de IA: preguntas y respuestas.

    2888+112Variación de estrellas de los últimos 7 días
  • Cuantización de LLM de pocos bits SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) y dispersión; técnicas líderes de compresión de modelos en PyTorch, TensorFlow y ONNX Runtime.

    2706+5Variación de estrellas de los últimos 7 días
  • aimet@qualcomm

    AIMET es una librería que proporciona técnicas avanzadas de cuantización y compresión para modelos de redes neuronales entrenados.

    2690+7Variación de estrellas de los últimos 7 días
  • xTuring@stochasticai

    Construye, personaliza y controla tus propios LLM. Desde el preprocesamiento de datos hasta el ajuste fino (fine-tuning), xTuring proporciona una forma sencilla de personalizar LLM de código abierto. Únete a nuestra comunidad de Discord: https://discord.gg/TgHXuSJEk6

    2674+0Variación de estrellas de los últimos 7 días
  • Una lista de artículos, documentación y código sobre cuantización de modelos. Este repositorio busca proveer información para la investigación en cuantización y mejoramos continuamente. ¡Bienvenidas las contribuciones de trabajos faltantes!

    2433+4Variación de estrellas de los últimos 7 días
  • AI-Engineering.academy@adithya-s-k

    Domina la IA aplicada, un concepto a la vez

    2377-1Variación de estrellas de los últimos 7 días
  • mixtral-offloading@dvmazur

    Ejecuta modelos Mixtral-8x7B en Colab o en ordenadores de escritorio de consumo

    2333+1Variación de estrellas de los últimos 7 días
  • micronet@666DZY666

    micronet, una biblioteca de compresión y despliegue de modelos. compresión: 1. cuantificación: entrenamiento consciente de la cuantificación (QAT), de bits altos (>2b) (DoReFa/Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference), de bits bajos (≤2b)/ternaria y binaria (TWN/BNN/XNOR-Net); cuantificación posterior al entrenamiento (PTQ), de 8 bits (tensorrt); 2. poda: poda de canales convolucionales normal, regular y por grupos; 3. gru

    2266+0Variación de estrellas de los últimos 7 días
  • picolm@RightNow-AI

    Ejecuta un LLM de 1 mil millones de parámetros en una placa de 10 dólares con 256 MB de RAM

    1923+6Variación de estrellas de los últimos 7 días
  • ppq@OpenPPL

    PPL Quantization Tool (PPQ) es una potente herramienta de cuantización de redes neuronales offline

    1817+2Variación de estrellas de los últimos 7 días
  • mmrazor@open-mmlab

    Caja de herramientas y benchmark de compresión de modelos de OpenMMLab.

    1682+0Variación de estrellas de los últimos 7 días
  • PaddleSlim@PaddlePaddle

    PaddleSlim es una biblioteca de código abierto para la compresión de modelos profundos y la búsqueda de arquitectura.

    1612+1Variación de estrellas de los últimos 7 días
  • auto-round@intel

    Un algoritmo de cuantización SOTA para inferencia de LLM de bajo bit y alta precisión, optimizado para CPU/XPU/CUDA, con soporte para múltiples tipos de datos y compatibilidad total con vLLM, SGLang y Transformers.

    1594+15Variación de estrellas de los últimos 7 días
  • rwkv.cpp@RWKV

    Inferencia INT4/INT5/INT8 y FP16 en CPU para el modelo de lenguaje RWKV

    1579-1Variación de estrellas de los últimos 7 días
← Volver a temas