flash-attention
Các kho mã nguồn mở đang theo dõi được gắn thẻ flash-attention, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng flash-attention trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ flash-attention.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Kho lưu trữ chính thức của mô hình ngôn ngữ lớn hội thoại & tiền huấn luyện Qwen (Thông Nghĩa Thiên Vấn) do Alibaba Cloud đề xuất.
★ 21.688+14Thay đổi số sao trong 7 ngày qua - #2
Ghi chú học tập CUDA hiện đại với PyTorch dành cho người mới bắt đầu, hơn 200 CUDA Kernel, Tensor Cores, HGEMM, FA-2 MMA.
★ 11.875+25Thay đổi số sao trong 7 ngày qua - #3
Bản phát hành chính thức của dòng InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).
★ 7.277+4Thay đổi số sao trong 7 ngày qua - #4
Dự án mô hình lớn Chinese LLaMA-2 & Alpaca-2 giai đoạn 2 + mô hình ngữ cảnh siêu dài 64K
★ 7.120+0Thay đổi số sao trong 7 ngày qua - #5
📚 Danh sách tổng hợp các bài báo nghiên cứu về suy luận LLM/VLM xuất sắc kèm mã nguồn: Flash-Attention, Paged-Attention, WINT8/4, Parallelism, v.v. 🎉
★ 5.482+3Thay đổi số sao trong 7 ngày qua - #6★ 2.174+1Thay đổi số sao trong 7 ngày qua
- #7
cuDNN Frontend là điểm truy cập hiện đại, mã nguồn mở của NVIDIA vào thư viện cuDNN và tập hợp ngày càng phát triển các kernel mã nguồn mở hiệu năng cao.
★ 932+13Thay đổi số sao trong 7 ngày qua - #8
rCM & Causal-rCM: Các thuật toán/cơ sở hạ tầng hàng đầu và thống nhất cho việc chưng cất khuếch tán video hai chiều/tự hồi quy ở quy mô lớn.
★ 800+6Thay đổi số sao trong 7 ngày qua - #9
Cơ chế sparse attention có thể huấn luyện, nhanh và tiết kiệm bộ nhớ
★ 761+10Thay đổi số sao trong 7 ngày qua - #10
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 566+30Thay đổi số sao trong 7 ngày qua