cuda
Repositórios de código aberto acompanhados marcados com cuda, ordenados por estrelas.
- #181
Melhores práticas e guias sobre como escrever código de treinamento distribuído em PyTorch
★ 631+2Variação de estrelas nos últimos 7 dias - #182★ 622+2Variação de estrelas nos últimos 7 dias
- #183
Renderizador de Monte Carlo multiplataforma de alto desempenho baseado em LuisaCompute
★ 618+1Variação de estrelas nos últimos 7 dias - #184★ 616+0Variação de estrelas nos últimos 7 dias
- #185
AutoDock para GPUs e outros aceleradores
★ 610+1Variação de estrelas nos últimos 7 dias - #186
Um subconjunto de módulos de redes neurais do PyTorch, escrito em Python usando o Triton da OpenAI.
★ 604+0Variação de estrelas nos últimos 7 dias - #187
Um aplicativo e guia para configurar facilmente Windows, Linux, MacOS, Google TV, Stremio, Home Assistant e mais (incluindo WSL2, drivers de GPU e ferramentas de desenvolvimento). Melhore sua UX e produtividade.
★ 602+0Variação de estrelas nos últimos 7 dias - #188
Vá com sua própria inteligência - Aplicativos Go que integram diretamente o llama.cpp para inferência local usando aceleração de hardware.
★ 599+17Variação de estrelas nos últimos 7 dias - #189
Yet Another Language Model: inferência de LLM em C++/CUDA, sem bibliotecas além de I/O.
★ 597+1Variação de estrelas nos últimos 7 dias - #190★ 594+1Variação de estrelas nos últimos 7 dias
- #191★ 592+0Variação de estrelas nos últimos 7 dias
- #192
O NVIDIA NVSHMEM é uma interface de programação paralela para GPUs NVIDIA baseada em OpenSHMEM. O NVSHMEM pode reduzir significativamente a comunicação entre múltiplos processos e os custos de coordenação, permitindo que os programadores realizem comunicação unilateral a partir de kernels CUDA e em streams CUDA.
★ 585+4Variação de estrelas nos últimos 7 dias - #193
Simulador de radar construído com Python e C++
★ 576+3Variação de estrelas nos últimos 7 dias - #194
Projeto para recrutamento e estágios, guiando você na implementação do zero de um framework de inferência de LLM com suporte a Llama2/3 e Qwen2.5.
★ 574+0Variação de estrelas nos últimos 7 dias - #195
Uma biblioteca C++ de cabeçalho único para simplificar o uso do CUDA Runtime Compilation (NVRTC).
★ 574+0Variação de estrelas nos últimos 7 dias - #196
Uma coleção aberta de metodologias para auxiliar no treinamento bem-sucedido de grandes modelos de linguagem.
★ 569+2Variação de estrelas nos últimos 7 dias - #197
Vários métodos de otimização de multiplicação de matrizes gerais de meia precisão (HGEMM) usando tensor core com a API WMMA e a instrução MMA PTX.
★ 568+0Variação de estrelas nos últimos 7 dias - #198
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+0Variação de estrelas nos últimos 7 dias - #199
FlashRT é um motor de inferência em tempo real de alto desempenho para cargas de trabalho de IA de lote pequeno e sensíveis à latência. A integração principal é o controle VLA de produção para Pi0, Pi0.5, GROOT N1.6 e Pi0-FAST. Também suporta LLM, por exemplo, qwen3.6-27B
★ 562+14Variação de estrelas nos últimos 7 dias - #200
Mini motor de inferência estático e suckless para qwen3-0.6B, lote único (single batch) e exclusivo para CUDA.
★ 560+1Variação de estrelas nos últimos 7 dias - #201
Laboratório de prática de algoritmos de LLM com teoria, soluções e casos de teste. Um tutorial prático de algoritmos para grandes modelos voltado do iniciante ao avançado, cobrindo explicações de princípios, resoluções, casos de teste e prática com CUDA/Triton.
★ 559+20Variação de estrelas nos últimos 7 dias - #202
Use a VRAM da sua GPU NVIDIA como espaço de swap no Linux. Desenvolvido para notebooks com memória soldada e sem opção de upgrade. Se você tem uma placa RTX com 8 GB de VRAM ociosa e seu sistema está fazendo swap no SSD, isso coloca essa VRAM para funcionar.
★ 555+4Variação de estrelas nos últimos 7 dias - #203★ 552+2Variação de estrelas nos últimos 7 dias
- #204
Um cluster Slurm usando docker-compose
★ 544+2Variação de estrelas nos últimos 7 dias - #205★ 532+0Variação de estrelas nos últimos 7 dias
- #206
Uma reimplementação de Holistically-Nested Edge Detection em PyTorch.
★ 525+0Variação de estrelas nos últimos 7 dias - #207★ 518+0Variação de estrelas nos últimos 7 dias
- #208★ 518-1Variação de estrelas nos últimos 7 dias
- #209
Imagem Docker para Ubuntu Desktop com suporte a aplicativos GUI acelerados por GPU de hardware. Você pode acessar o Container com ssh ou área de trabalho remota, exatamente como uma VM em Nuvem.
★ 515+0Variação de estrelas nos últimos 7 dias - #210
Servidor de inferência de linguagem de código aberto, local e auto-hospedado altamente otimizado com suporte a ASR/STT, TTS e LLM via WebRTC, REST e WS
★ 512+0Variação de estrelas nos últimos 7 dias