cuda
Erfasste Open-Source-Repos mit dem Tag cuda, sortiert nach Sternen.
- #181
Best Practices und Leitfäden zum Schreiben von verteiltem PyTorch-Trainingscode
★ 631+2Sterne-Änderung der letzten 7 Tage - #182★ 622+2Sterne-Änderung der letzten 7 Tage
- #183
Hochleistungsfähiger, plattformübergreifender Monte-Carlo-Renderer basierend auf LuisaCompute
★ 618+1Sterne-Änderung der letzten 7 Tage - #184★ 616+0Sterne-Änderung der letzten 7 Tage
- #185
AutoDock für GPUs und andere Beschleuniger
★ 610+1Sterne-Änderung der letzten 7 Tage - #186
Eine Teilmenge der neuronalen Netzwerkmodule von PyTorch, geschrieben in Python mit OpenAI Triton.
★ 604+0Sterne-Änderung der letzten 7 Tage - #187
Eine App und Anleitung zur einfachen Konfiguration von Windows, Linux, MacOS, Google TV, Stremio, Home Assistant und mehr (einschließlich WSL2, GPU-Treiber und Entwicklungstools). Zur Verbesserung von UX und Produktivität.
★ 602+0Sterne-Änderung der letzten 7 Tage - #188
Go mit eigener Intelligenz – Go-Anwendungen, die llama.cpp direkt für lokale Inferenz mittels Hardwarebeschleunigung integrieren.
★ 599+17Sterne-Änderung der letzten 7 Tage - #189
Yet Another Language Model: LLM-Inferenz in C++/CUDA, ohne externe Bibliotheken außer für I/O.
★ 597+1Sterne-Änderung der letzten 7 Tage - #190★ 594+1Sterne-Änderung der letzten 7 Tage
- #191★ 592+0Sterne-Änderung der letzten 7 Tage
- #192
NVIDIA NVSHMEM ist eine parallele Programmierschnittstelle für NVIDIA-GPUs basierend auf OpenSHMEM. NVSHMEM reduziert den Kommunikations- und Koordinationsaufwand zwischen Prozessen erheblich, indem es einseitige Kommunikation direkt aus CUDA-Kernels und CUDA-Streams ermöglicht.
★ 585+4Sterne-Änderung der letzten 7 Tage - #193
Radarsimulator entwickelt mit Python und C++
★ 576+3Sterne-Änderung der letzten 7 Tage - #194
Eine Single-Header-C++-Bibliothek zur Vereinfachung der CUDA Runtime Compilation (NVRTC).
★ 574+0Sterne-Änderung der letzten 7 Tage - #195
Ein Projekt für Praktika und Berufseinstieg, das Sie Schritt für Schritt bei der Implementierung eines LLM-Inferenz-Frameworks mit Unterstützung für Llama2/3 und Qwen2.5 anleitet.
★ 574+0Sterne-Änderung der letzten 7 Tage - #196
Eine offene Sammlung von Methoden zur Unterstützung des erfolgreichen Trainings großer Sprachmodelle.
★ 569+2Sterne-Änderung der letzten 7 Tage - #197
Verschiedene Optimierungsmethoden für die allgemeine Matrixmultiplikation in halber Genauigkeit (HGEMM) unter Verwendung von Tensor Cores mit WMMA-API und MMA-PTX-Instruktionen.
★ 568+0Sterne-Änderung der letzten 7 Tage - #198
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 566+0Sterne-Änderung der letzten 7 Tage - #199
FlashRT ist eine leistungsstarke Echtzeit-Inferenz-Engine für KI-Workloads mit kleinen Batches und geringer Latenz. Die Hauptintegration umfasst die VLA-Steuerung für Pi0, Pi0.5, GROOT N1.6 und Pi0-FAST sowie Unterstützung für LLMs wie Qwen3.6-27B.
★ 562+14Sterne-Änderung der letzten 7 Tage - #200
Statische, minimalistische Single-Batch-Inferenz-Engine für qwen3-0.6B, ausschließlich für CUDA
★ 560+1Sterne-Änderung der letzten 7 Tage - #201
Praxislabor für LLM-Algorithmen mit Theorie, Lösungen und Testfällen. Ein Tutorial für Large Language Models von den Grundlagen bis zur fortgeschrittenen Praxis, inklusive Prinzipien, Analysen, Testfällen sowie CUDA/Triton-Anwendungen.
★ 559+20Sterne-Änderung der letzten 7 Tage - #202
Nutzung des VRAM der NVIDIA-GPU als Swap-Speicher unter Linux. Entwickelt für Laptops mit fest verlötetem Arbeitsspeicher ohne Upgrade-Option.
★ 555+4Sterne-Änderung der letzten 7 Tage - #203★ 552+2Sterne-Änderung der letzten 7 Tage
- #204
Ein Slurm-Cluster mittels docker-compose.
★ 544+2Sterne-Änderung der letzten 7 Tage - #205★ 532+0Sterne-Änderung der letzten 7 Tage
- #206
Eine Neuimplementierung von Holistically-Nested Edge Detection in PyTorch
★ 525+0Sterne-Änderung der letzten 7 Tage - #207★ 518-1Sterne-Änderung der letzten 7 Tage
- #208
Datenvisualisierung und Raytracing in Python basierend auf dem OptiX 9.1 Framework
★ 518+0Sterne-Änderung der letzten 7 Tage - #209
Docker-Image für Ubuntu Desktop mit Unterstützung für hardwarebeschleunigte GUI-Apps. Der Zugriff auf den Container erfolgt via SSH oder Remote Desktop, ähnlich wie bei einer Cloud-VM.
★ 515+0Sterne-Änderung der letzten 7 Tage - #210
🚀🚀🚀 Dieses Repository listet herausragende öffentliche Projekte zu CUDA, cuda-python, cuBLAS, cuDNN, CUTLASS, TensorRT, TensorRT-LLM, Triton, TVM, MLIR, PTX und High Performance Computing (HPC).
★ 512+0Sterne-Änderung der letzten 7 Tage