cuda
Repositorios de código abierto monitorizados etiquetados con cuda, ordenados por estrellas.
- #91
Biblioteca de operadores TT-NN y modelo de programación de kernels de bajo nivel TT-Metalium.
★ 1655+0Variación de estrellas de los últimos 7 días - #92★ 1625+0Variación de estrellas de los últimos 7 días
- #93
ThunderSVM: una biblioteca de SVM rápida para GPU y CPU.
★ 1622+0Variación de estrellas de los últimos 7 días - #94
Proyecto de despliegue de LLM basado en MNN. Este proyecto ha sido integrado en MNN.
★ 1617+0Variación de estrellas de los últimos 7 días - #95
Plataforma de investigación de benchmarks de inferencia continua de código abierto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 y próximamente™ TPUv6e/v7/Trainium2/3
★ 1613+0Variación de estrellas de los últimos 7 días - #96
Implementación del efecto Ken Burns 3D a partir de una sola imagen usando PyTorch
★ 1569+0Variación de estrellas de los últimos 7 días - #97
Investigación automática para kernels de GPU. Proporciónale cualquier modelo de PyTorch, vete a dormir y despierta con kernels de Triton optimizados.
★ 1545+0Variación de estrellas de los últimos 7 días - #98
UCCL es una biblioteca de comunicación eficiente para GPUs, que cubre colectivos, P2P (por ejemplo, transferencia de caché KV, transferencia de pesos RL) y EP (por ejemplo, impulsado por GPU).
★ 1502+0Variación de estrellas de los últimos 7 días - #99★ 1492+0Variación de estrellas de los últimos 7 días
- #100
Implementación de TensorRT para YOLOv8, YOLOv8-Pose, YOLOv8-Seg, YOLOv8-Cls, YOLOv7, YOLOv6, YOLOv5 y YOLONAS, optimizada para CUDA.
★ 1460+0Variación de estrellas de los últimos 7 días - #101
Una biblioteca eficiente de computación numérica en GPU para C++20 con sintaxis similar a Python.
★ 1444+0Variación de estrellas de los últimos 7 días - #102
Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.
★ 1427+0Variación de estrellas de los últimos 7 días - #103★ 1426+0Variación de estrellas de los últimos 7 días
- #104
Una biblioteca de tensores rápida, ergonómica y portátil en Nim, enfocada en aprendizaje profundo para CPU, GPU y dispositivos embebidos mediante backends de OpenMP, Cuda y OpenCL.
★ 1407+0Variación de estrellas de los últimos 7 días - #105
Una biblioteca rápida de superposición de comunicación para paralelismo de tensores/expertos en GPUs.
★ 1358+0Variación de estrellas de los últimos 7 días - #106★ 1323+0Variación de estrellas de los últimos 7 días
- #107
https://wavespeed.ai/ El mejor framework de optimización del rendimiento de inferencia para HuggingFace Diffusers en GPUs NVIDIA.
★ 1304+0Variación de estrellas de los últimos 7 días - #108★ 1270+0Variación de estrellas de los últimos 7 días
- #109
GraphVite: un sistema de representación de grafos (graph embedding) general y de alto rendimiento
★ 1269+0Variación de estrellas de los últimos 7 días - #110
Script de compilación de FFmpeg que facilita la creación de una versión estática en OSX y Linux con códecs no libres incluidos.
★ 1215+0Variación de estrellas de los últimos 7 días - #111★ 1214+0Variación de estrellas de los últimos 7 días
- #112
Ejemplos para los Intel® oneAPI Toolkits
★ 1162+0Variación de estrellas de los últimos 7 días - #113★ 1150+0Variación de estrellas de los últimos 7 días
- #114★ 1131+0Variación de estrellas de los últimos 7 días
- #115
Biblioteca de matrices rápida para Clojure
★ 1128+0Variación de estrellas de los últimos 7 días - #116
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 1118+56Variación de estrellas de los últimos 7 días - #117
Construye tu propio motor de inferencia LLM de alto rendimiento en C++ y CUDA: una versión más pequeña de vLLM.
★ 1100+10Variación de estrellas de los últimos 7 días - #118★ 1096+0Variación de estrellas de los últimos 7 días
- #119★ 1064+1Variación de estrellas de los últimos 7 días
- #120
Framework de renderizado de alto rendimiento para arquitecturas de flujo
★ 1044+1Variación de estrellas de los últimos 7 días