Pular para o conteúdo principal
buildradar
Sign in
Tópico · flash-attention

flash-attention

Repositórios de código aberto acompanhados marcados com flash-attention, ordenados por estrelas.

Repositórios
10
Total de estrelas
58.661
Média de estrelas
5.866
Participação
0,00%

Tópicos que aparecem com frequência ao lado de flash-attention no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com flash-attention.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • Qwen@QwenLM

    O repositório oficial do Qwen (通义千问), modelo de linguagem grande de chat e pré-treinado proposto pela Alibaba Cloud.

    21.688+14Variação de estrelas nos últimos 7 dias
  • LeetCUDA@xlite-dev

    Notas de estudo modernas de CUDA com PyTorch para iniciantes, mais de 200 kernels CUDA, Tensor Cores, HGEMM, FA-2 MMA.

    11.875+25Variação de estrelas nos últimos 7 dias
  • InternLM@InternLM

    Lançamento oficial da série InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).

    7.277+4Variação de estrelas nos últimos 7 dias
  • Projeto fase 2 de LLMs Chinese LLaMA-2 & Alpaca-2 + modelos de contexto ultralongo de 64K (Chinese LLaMA-2 & Alpaca-2 LLMs com modelos de contexto longo de 64K)

    7.120+0Variação de estrelas nos últimos 7 dias
  • Awesome-LLM-Inference@xlite-dev

    📚 Uma lista curada de artigos incríveis sobre inferência de LLM/VLM com código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉

    5.482+3Variação de estrelas nos últimos 7 dias
  • MoBA@MoonshotAI

    MoBA: Mixture of Block Attention para LLMs de contexto longo

    2.174+1Variação de estrelas nos últimos 7 dias
  • cudnn-frontend@NVIDIA

    O frontend do cuDNN é o ponto de entrada moderno e de código aberto da NVIDIA para a biblioteca cuDNN e uma coleção crescente de kernels de código aberto de alto desempenho.

    929+11Variação de estrelas nos últimos 7 dias
  • rcm@NVlabs

    rCM & Causal-rCM: Algoritmos e infraestruturas líderes e unificados para destilação de difusão de vídeo bidirecional/autorregressiva em larga escala

    800+6Variação de estrelas nos últimos 7 dias
  • Atenção esparsa treinável, rápida e eficiente em termos de memória

    761+11Variação de estrelas nos últimos 7 dias
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    566+30Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos