cuda
Repositórios de código aberto acompanhados marcados com cuda, ordenados por estrelas.
- #91
Biblioteca de operadores TT-NN e modelo de programação de kernel de baixo nível TT-Metalium.
★ 1.655+0Variação de estrelas nos últimos 7 dias - #92★ 1.625+0Variação de estrelas nos últimos 7 dias
- #93
ThunderSVM: Uma Biblioteca SVM Rápida em GPUs e CPUs
★ 1.622+0Variação de estrelas nos últimos 7 dias - #94★ 1.617+0Variação de estrelas nos últimos 7 dias
- #95
Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3
★ 1.613+0Variação de estrelas nos últimos 7 dias - #96
Uma implementação do efeito Ken Burns 3D a partir de uma única imagem usando PyTorch.
★ 1.569+0Variação de estrelas nos últimos 7 dias - #97
Pesquisa automática para kernels de GPU. Forneça qualquer modelo PyTorch, vá dormir e acorde com kernels Triton otimizados.
★ 1.545+0Variação de estrelas nos últimos 7 dias - #98
UCCL é uma biblioteca de comunicação eficiente para GPUs, abrangendo coletivos, P2P (ex: transferência de cache KV, transferência de pesos de RL) e EP (ex: orientado por GPU)
★ 1.502+0Variação de estrelas nos últimos 7 dias - #99★ 1.492+0Variação de estrelas nos últimos 7 dias
- #100
TensorRT para YOLOv8, YOLOv8-Pose, YOLOv8-Seg, YOLOv8-Cls, YOLOv7, YOLOv6, YOLOv5, YOLONAS. CUDA é tudo o que você precisa.
★ 1.460+0Variação de estrelas nos últimos 7 dias - #101
Uma biblioteca eficiente de computação numérica em GPU C++20 com sintaxe semelhante a Python
★ 1.444+0Variação de estrelas nos últimos 7 dias - #102
Auto-hospede o poderoso modelo de TTS Chatterbox. Este servidor oferece uma interface web amigável, endpoints de API flexíveis (incluindo compatibilidade com OpenAI), vozes predefinidas, clonagem de voz e processamento de texto em escala de audiolivros. Executa com aceleração em NVIDIA (CUDA), AMD (ROCm) e CPU.
★ 1.427+0Variação de estrelas nos últimos 7 dias - #103★ 1.426+0Variação de estrelas nos últimos 7 dias
- #104
Uma biblioteca de tensores rápida, ergonômica e portátil em Nim com foco em aprendizado profundo para CPU, GPU e dispositivos embarcados via backends OpenMP, Cuda e OpenCL
★ 1.407+0Variação de estrelas nos últimos 7 dias - #105
Uma biblioteca rápida de sobreposição de comunicação para paralelismo de tensores/especialistas em GPUs.
★ 1.358+0Variação de estrelas nos últimos 7 dias - #106★ 1.323+0Variação de estrelas nos últimos 7 dias
- #107
https://wavespeed.ai/ O melhor framework de otimização de desempenho de inferência para HuggingFace Diffusers em GPUs NVIDIA.
★ 1.304+0Variação de estrelas nos últimos 7 dias - #108★ 1.270+0Variação de estrelas nos últimos 7 dias
- #109★ 1.269+0Variação de estrelas nos últimos 7 dias
- #110
O script de compilação do FFmpeg fornece uma maneira fácil de compilar um FFmpeg estático no OSX e Linux com codecs não livres incluídos.
★ 1.215+0Variação de estrelas nos últimos 7 dias - #111★ 1.214+0Variação de estrelas nos últimos 7 dias
- #112
Exemplos para Intel® oneAPI Toolkits
★ 1.162+0Variação de estrelas nos últimos 7 dias - #113★ 1.150+0Variação de estrelas nos últimos 7 dias
- #114★ 1.131+0Variação de estrelas nos últimos 7 dias
- #115
Biblioteca de matrizes rápida para Clojure
★ 1.128+0Variação de estrelas nos últimos 7 dias - #116
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.118+56Variação de estrelas nos últimos 7 dias - #117
Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão reduzida do vLLM.
★ 1.100+10Variação de estrelas nos últimos 7 dias - #118★ 1.096+0Variação de estrelas nos últimos 7 dias
- #119★ 1.064+1Variação de estrelas nos últimos 7 dias
- #120
Framework de renderização de alto desempenho em arquiteturas de streaming
★ 1.044+1Variação de estrelas nos últimos 7 dias