Zum Hauptinhalt springen
buildradar
Sign in
Thema · flash-attention

flash-attention

Erfasste Open-Source-Repos mit dem Tag flash-attention, sortiert nach Sternen.

Repos
10
Sterne gesamt
58.661
Sterne im Schnitt
5.866
Anteil
0,00%

Themen, die häufig gemeinsam mit flash-attention am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit flash-attention getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • Qwen@QwenLM

    Das offizielle Repository von Qwen (通义千问), einem von Alibaba Cloud vorgeschlagenen Chat- und vortrainierten Large Language Model.

    21.688+32Sterne-Änderung der letzten 7 Tage
  • LeetCUDA@xlite-dev

    Moderne CUDA-Lernnotizen mit PyTorch für Anfänger, 200+ CUDA-Kernel, Tensor Cores, HGEMM, FA-2 MMA.

    11.875+39Sterne-Änderung der letzten 7 Tage
  • InternLM@InternLM

    Offizielle Version der InternLM-Serie (InternLM, InternLM2, InternLM2.5, InternLM3).

    7.277+8Sterne-Änderung der letzten 7 Tage
  • Chinesisches LLaMA-2 & Alpaca-2 LLM Phase-2-Projekt + 64K-Langkontextmodell (Chinese LLaMA-2 & Alpaca-2 LLMs mit 64K-Langkontextmodellen)

    7.120+0Sterne-Änderung der letzten 7 Tage
  • Awesome-LLM-Inference@xlite-dev

    📚 Eine kuratierte Liste fantastischer LLM/VLM-Inferenz-Papers mit Code: Flash-Attention, Paged-Attention, WINT8/4, Parallelismus usw. 🎉

    5.482+4Sterne-Änderung der letzten 7 Tage
  • MoBA@MoonshotAI

    MoBA: Mixture of Block Attention für LLMs mit langem Kontext

    2.174+5Sterne-Änderung der letzten 7 Tage
  • cudnn-frontend@NVIDIA

    Das cuDNN Frontend ist NVIDIAs moderner Open-Source-Einstiegspunkt in die cuDNN-Bibliothek und eine wachsende Sammlung von Hochleistungs-Open-Source-Kerneln.

    929+7Sterne-Änderung der letzten 7 Tage
  • rcm@NVlabs

    rCM & Causal-rCM: Führende und einheitliche Algorithmen/Infrastrukturen für die bidirektionale/autoregressive Video-Diffusion-Destillation im großen Maßstab.

    800+6Sterne-Änderung der letzten 7 Tage
  • Trainierbare, schnelle und speichereffiziente spärliche Aufmerksamkeit

    761+9Sterne-Änderung der letzten 7 Tage
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    566+46Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen