Zum Hauptinhalt springen
buildradar
Anmelden
Thema · cuda

cuda

Erfasste Open-Source-Repos mit dem Tag cuda, sortiert nach Sternen.

216 Repos
  • Best Practices und Leitfäden zum Schreiben von verteiltem PyTorch-Trainingscode

    631+2Sterne-Änderung der letzten 7 Tage
  • ginkgo@ginkgo-project

    Softwarepaket für numerische lineare Algebra

    622+2Sterne-Änderung der letzten 7 Tage
  • LuisaRender@LuisaGroup

    Hochleistungsfähiger, plattformübergreifender Monte-Carlo-Renderer basierend auf LuisaCompute

    618+1Sterne-Änderung der letzten 7 Tage
  • FastFold@hpcaitech

    Optimierung des AlphaFold-Trainings und der Inferenz auf GPU-Clustern

    616+0Sterne-Änderung der letzten 7 Tage
  • AutoDock-GPU@ccsb-scripps

    AutoDock für GPUs und andere Beschleuniger

    610+1Sterne-Änderung der letzten 7 Tage
  • attorch@BobMcDear

    Eine Teilmenge der neuronalen Netzwerkmodule von PyTorch, geschrieben in Python mit OpenAI Triton.

    604+0Sterne-Änderung der letzten 7 Tage
  • personal-os-setup@AmineDjeghri

    Eine App und Anleitung zur einfachen Konfiguration von Windows, Linux, MacOS, Google TV, Stremio, Home Assistant und mehr (einschließlich WSL2, GPU-Treiber und Entwicklungstools). Zur Verbesserung von UX und Produktivität.

    602+0Sterne-Änderung der letzten 7 Tage
  • yzma@hybridgroup

    Go mit eigener Intelligenz – Go-Anwendungen, die llama.cpp direkt für lokale Inferenz mittels Hardwarebeschleunigung integrieren.

    599+17Sterne-Änderung der letzten 7 Tage
  • yalm@andrewkchan

    Yet Another Language Model: LLM-Inferenz in C++/CUDA, ohne externe Bibliotheken außer für I/O.

    597+1Sterne-Änderung der letzten 7 Tage
  • pymde@cvxgrp

    Einbettung mit minimaler Verzerrung mittels PyTorch

    594+1Sterne-Änderung der letzten 7 Tage
  • dace@spcl

    DaCe – Datenzentrierte parallele Programmierung.

    592+0Sterne-Änderung der letzten 7 Tage
  • nvshmem@NVIDIA

    NVIDIA NVSHMEM ist eine parallele Programmierschnittstelle für NVIDIA-GPUs basierend auf OpenSHMEM. NVSHMEM reduziert den Kommunikations- und Koordinationsaufwand zwischen Prozessen erheblich, indem es einseitige Kommunikation direkt aus CUDA-Kernels und CUDA-Streams ermöglicht.

    585+4Sterne-Änderung der letzten 7 Tage
  • radarsimpy@radarsimx

    Radarsimulator entwickelt mit Python und C++

    576+3Sterne-Änderung der letzten 7 Tage
  • jitify@NVIDIA

    Eine Single-Header-C++-Bibliothek zur Vereinfachung der CUDA Runtime Compilation (NVRTC).

    574+0Sterne-Änderung der letzten 7 Tage
  • KuiperLLama@zjhellofss

    Ein Projekt für Praktika und Berufseinstieg, das Sie Schritt für Schritt bei der Implementierung eines LLM-Inferenz-Frameworks mit Unterstützung für Llama2/3 und Qwen2.5 anleitet.

    574+0Sterne-Änderung der letzten 7 Tage
  • llm_training_handbook@huggingface

    Eine offene Sammlung von Methoden zur Unterstützung des erfolgreichen Trainings großer Sprachmodelle.

    569+2Sterne-Änderung der letzten 7 Tage
  • cuda_hgemm@Bruce-Lee-LY

    Verschiedene Optimierungsmethoden für die allgemeine Matrixmultiplikation in halber Genauigkeit (HGEMM) unter Verwendung von Tensor Cores mit WMMA-API und MMA-PTX-Instruktionen.

    568+0Sterne-Änderung der letzten 7 Tage
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    566+0Sterne-Änderung der letzten 7 Tage
  • FlashRT@flashrt-project

    FlashRT ist eine leistungsstarke Echtzeit-Inferenz-Engine für KI-Workloads mit kleinen Batches und geringer Latenz. Die Hauptintegration umfasst die VLA-Steuerung für Pi0, Pi0.5, GROOT N1.6 und Pi0-FAST sowie Unterstützung für LLMs wie Qwen3.6-27B.

    562+14Sterne-Änderung der letzten 7 Tage
  • qwen600@yassa9

    Statische, minimalistische Single-Batch-Inferenz-Engine für qwen3-0.6B, ausschließlich für CUDA

    560+1Sterne-Änderung der letzten 7 Tage
  • llm-algo-leetcode@datawhalechina

    Praxislabor für LLM-Algorithmen mit Theorie, Lösungen und Testfällen. Ein Tutorial für Large Language Models von den Grundlagen bis zur fortgeschrittenen Praxis, inklusive Prinzipien, Analysen, Testfällen sowie CUDA/Triton-Anwendungen.

    559+20Sterne-Änderung der letzten 7 Tage
  • nbd-vram@c0deJedi

    Nutzung des VRAM der NVIDIA-GPU als Swap-Speicher unter Linux. Entwickelt für Laptops mit fest verlötetem Arbeitsspeicher ohne Upgrade-Option.

    555+4Sterne-Änderung der letzten 7 Tage
  • relion@3dem

    Bildverarbeitungssoftware für die Kryo-Elektronenmikroskopie.

    552+2Sterne-Änderung der letzten 7 Tage
  • slurm-docker-cluster@giovtorres

    Ein Slurm-Cluster mittels docker-compose.

    544+2Sterne-Änderung der letzten 7 Tage
  • cu@gorgonia

    Das Paket cu bietet eine idiomatische Schnittstelle zur CUDA Driver API.

    532+0Sterne-Änderung der letzten 7 Tage
  • pytorch-hed@sniklaus

    Eine Neuimplementierung von Holistically-Nested Edge Detection in PyTorch

    525+0Sterne-Änderung der letzten 7 Tage
  • INSTA@Zielon

    INSTA - Instant Volumetric Head Avatars [CVPR2023]

    518-1Sterne-Änderung der letzten 7 Tage
  • plotoptix@rnd-team-dev

    Datenvisualisierung und Raytracing in Python basierend auf dem OptiX 9.1 Framework

    518+0Sterne-Änderung der letzten 7 Tage
  • Docker-Image für Ubuntu Desktop mit Unterstützung für hardwarebeschleunigte GUI-Apps. Der Zugriff auf den Container erfolgt via SSH oder Remote Desktop, ähnlich wie bei einer Cloud-VM.

    515+0Sterne-Änderung der letzten 7 Tage
  • 🚀🚀🚀 Dieses Repository listet herausragende öffentliche Projekte zu CUDA, cuda-python, cuBLAS, cuDNN, CUTLASS, TensorRT, TensorRT-LLM, Triton, TVM, MLIR, PTX und High Performance Computing (HPC).

    512+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen