cuda
Repositorios de código abierto monitorizados etiquetados con cuda, ordenados por estrellas.
- #181
Mejores prácticas y guías sobre cómo escribir código de entrenamiento distribuido en PyTorch
★ 631+2Variación de estrellas de los últimos 7 días - #182★ 622+2Variación de estrellas de los últimos 7 días
- #183
Renderizador Monte Carlo multiplataforma de alto rendimiento basado en LuisaCompute
★ 618+1Variación de estrellas de los últimos 7 días - #184★ 616+0Variación de estrellas de los últimos 7 días
- #185
AutoDock para GPU y otros aceleradores
★ 610+1Variación de estrellas de los últimos 7 días - #186
Un subconjunto de módulos de redes neuronales de PyTorch, escrito en Python usando Triton de OpenAI.
★ 604+0Variación de estrellas de los últimos 7 días - #187
Una aplicación y guía para configurar fácilmente Windows, Linux, MacOS, Google TV, Stremio, Home Assistant y más (incluyendo WSL2, controladores de GPU y herramientas de desarrollo). Mejora tu experiencia de usuario y productividad.
★ 602+0Variación de estrellas de los últimos 7 días - #188
Go con inteligencia propia: aplicaciones en Go que integran directamente llama.cpp para inferencia local mediante aceleración por hardware.
★ 599+17Variación de estrellas de los últimos 7 días - #189
Yet Another Language Model: inferencia de LLM en C++/CUDA, sin bibliotecas excepto para E/S
★ 597+1Variación de estrellas de los últimos 7 días - #190★ 594+1Variación de estrellas de los últimos 7 días
- #191★ 592+0Variación de estrellas de los últimos 7 días
- #192
NVIDIA NVSHMEM es una interfaz de programación paralela para GPUs NVIDIA basada en OpenSHMEM. NVSHMEM puede reducir significativamente la sobrecarga de comunicación y coordinación entre procesos al permitir a los programadores realizar comunicaciones unilaterales desde kernels y streams de CUDA.
★ 585+4Variación de estrellas de los últimos 7 días - #193
Simulador de radar construido con Python y C++
★ 576+3Variación de estrellas de los últimos 7 días - #194
Proyecto ideal para contrataciones universitarias, de otoño, primavera y pasantías, que te guía en la implementación desde cero de un marco de inferencia de grandes modelos compatible con Llama2/3 y Qwen2.5.
★ 574+0Variación de estrellas de los últimos 7 días - #195
Una biblioteca C++ de cabecera única para simplificar el uso de CUDA Runtime Compilation (NVRTC).
★ 574+0Variación de estrellas de los últimos 7 días - #196
Una colección abierta de metodologías para ayudar en el entrenamiento exitoso de modelos de lenguaje grandes.
★ 569+2Variación de estrellas de los últimos 7 días - #197
Varios métodos de optimización para multiplicación de matrices generales de media precisión (HGEMM) utilizando Tensor Core con la API WMMA y la instrucción MMA PTX.
★ 568+0Variación de estrellas de los últimos 7 días - #198
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 566+0Variación de estrellas de los últimos 7 días - #199
FlashRT es un motor de inferencia en tiempo real de alto rendimiento para cargas de trabajo de IA de lotes pequeños y sensibles a la latencia. Su integración principal es el control VLA de producción para Pi0, Pi0.5, GROOT N1.6 y Pi0-FAST. También admite LLM como qwen3.6-27B.
★ 562+14Variación de estrellas de los últimos 7 días - #200★ 560+1Variación de estrellas de los últimos 7 días
- #201
LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程,覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。
★ 559+20Variación de estrellas de los últimos 7 días - #202
Utiliza la VRAM de tu GPU NVIDIA como espacio de intercambio (swap) en Linux. Diseñado para portátiles con memoria soldada sin posibilidad de actualización. Si tienes una tarjeta RTX con 8GB de VRAM y tu sistema usa el SSD como swap, esto aprovecha esa VRAM.
★ 555+4Variación de estrellas de los últimos 7 días - #203★ 552+2Variación de estrellas de los últimos 7 días
- #204
Un clúster de Slurm usando docker-compose.
★ 544+2Variación de estrellas de los últimos 7 días - #205★ 532+0Variación de estrellas de los últimos 7 días
- #206
Una reimplementación de Holistically-Nested Edge Detection en PyTorch.
★ 525+0Variación de estrellas de los últimos 7 días - #207
Visualización de datos y trazado de rayos en Python basado en el framework OptiX 9.1.
★ 518+0Variación de estrellas de los últimos 7 días - #208★ 518-1Variación de estrellas de los últimos 7 días
- #209
Imagen de Docker para Ubuntu Desktop que admite aplicaciones GUI con aceleración de GPU por hardware. Puede acceder al contenedor mediante ssh o escritorio remoto, tal como en una VM en la nube.
★ 515+0Variación de estrellas de los últimos 7 días - #210
Servidor de inferencia de lenguaje altamente optimizado, de código abierto, local y autohospedado, que admite ASR/STT, TTS y LLM a través de WebRTC, REST y WS.
★ 512+0Variación de estrellas de los últimos 7 días