vllm
Các kho mã nguồn mở đang theo dõi được gắn thẻ vllm, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng vllm trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ vllm.
- #1
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 1.191 - #2
Lộ trình 10 tuần, mỗi ngày 30 phút về suy luận và tối ưu hóa LLM, bao gồm vLLM, SGLang, lượng tử hóa, giải mã suy đoán và đo điểm chuẩn.
★ 881 - #3
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 142
- #1
Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.
★ 20.136+64Thay đổi số sao trong 7 ngày qua - #2
Chào mừng bạn đến với Llama Cookbook! Đây là hướng dẫn toàn diện để xây dựng ứng dụng với Llama: Bắt đầu với suy luận, tinh chỉnh, RAG. Chúng tôi cũng chỉ cho bạn cách giải quyết các vấn đề từ đầu đến cuối bằng cách sử dụng dòng mô hình Llama và sử dụng chúng trên các dịch vụ nhà cung cấp khác nhau
★ 18.556-3Thay đổi số sao trong 7 ngày qua - #3
✍🏻 Phân tích mã nguồn sâu, Thiết kế hệ thống & Blog Kỹ thuật | Halfrost-Field: Ghi chú phân tích mã nguồn, thiết kế hệ thống và thực hành kỹ thuật
★ 13.226+6Thay đổi số sao trong 7 ngày qua - #4
Thư viện mã nguồn mở toàn diện gồm các kỹ năng nghiên cứu và kỹ thuật AI cho bất kỳ mô hình AI nào. Đóng gói các kỹ năng và tác nhân claude code/codex/gemini của bạn sẽ trở thành một tác nhân nghiên cứu AI với công suất tối đa. Được duy trì bởi Orchestra Research.
★ 12.256+104Thay đổi số sao trong 7 ngày qua - #5★ 11.622+60Thay đổi số sao trong 7 ngày qua
- #6
Một khung làm việc Agentic RL dễ sử dụng, có khả năng mở rộng và hiệu năng cao dựa trên Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
★ 9.969+9Thay đổi số sao trong 7 ngày qua - #7
Thay thế GPT bằng bất kỳ LLM nào chỉ với một dòng mã. Xinference cho phép bạn chạy các mô hình mã nguồn mở, giọng nói và đa phương thức trên đám mây, tại chỗ hoặc trên máy tính xách tay — tất cả thông qua một API suy luận thống nhất, sẵn sàng cho môi trường sản xuất.
★ 9.537+9Thay đổi số sao trong 7 ngày qua - #8★ 7.952+44Thay đổi số sao trong 7 ngày qua
- #9
Mooncake là nền tảng phục vụ cho Kimi, một dịch vụ LLM hàng đầu được cung cấp bởi Moonshot AI.
★ 6.470+40Thay đổi số sao trong 7 ngày qua - #10
Nền tảng suy luận AI tạo sinh và dự đoán phân tán tiêu chuẩn hóa để triển khai đa framework, có khả năng mở rộng trên Kubernetes.
★ 5.853+13Thay đổi số sao trong 7 ngày qua - #11★ 5.678+4Thay đổi số sao trong 7 ngày qua
- #12
Trình quản lý cụm GPU dành cho việc phục vụ mô hình AI hiệu năng cao (vLLM, SGLang) và các instance GPU có thể truy cập SSH theo yêu cầu.
★ 5.593+21Thay đổi số sao trong 7 ngày qua - #13
Hoán đổi mô hình đáng tin cậy cho bất kỳ máy chủ cục bộ nào tương thích với OpenAI/Anthropic - llama.cpp, vllm, v.v.
★ 5.562+49Thay đổi số sao trong 7 ngày qua - #14
Bộ định tuyến Mixture-of-Models có thể lập trình cho suy luận LLM dị thể
★ 5.506+101Thay đổi số sao trong 7 ngày qua - #15
📚 Danh sách tổng hợp các bài báo nghiên cứu về suy luận LLM/VLM xuất sắc kèm mã nguồn: Flash-Attention, Paged-Attention, WINT8/4, Parallelism, v.v. 🎉
★ 5.482+3Thay đổi số sao trong 7 ngày qua - #16
Trích xuất dữ liệu có cấu trúc, gọi lệnh hướng dẫn và quy trình làm việc tự trị (agentic) với ML, LLM và Vision LLM
★ 5.214+7Thay đổi số sao trong 7 ngày qua - #17
Học về hệ thống suy luận LLM trên Apple Silicon dành cho kỹ sư hệ thống: xây dựng một vLLM + Qwen siêu nhỏ
★ 4.537+8Thay đổi số sao trong 7 ngày qua - #18
Runtime phân tầng cho AI agent. Tối ưu hóa chi phí, độ trễ, chất lượng và các quyết định chính sách bên trong vòng lặp agent.
★ 3.970-9Thay đổi số sao trong 7 ngày qua - #19
Bộ công cụ suy luận và triển khai hiệu năng cao cho LLM và VLM dựa trên PaddlePaddle
★ 3.714+3Thay đổi số sao trong 7 ngày qua - #20
RamaLama là công cụ dành cho nhà phát triển mã nguồn mở giúp đơn giản hóa việc triển khai cục bộ các mô hình AI từ mọi nguồn và hỗ trợ sử dụng chúng để suy luận trong môi trường production, tất cả thông qua cú pháp quen thuộc của container.
★ 3.031+6Thay đổi số sao trong 7 ngày qua - #21
Plugin phần cứng do cộng đồng duy trì cho vLLM trên Ascend
★ 2.749+19Thay đổi số sao trong 7 ngày qua - #22
Bảng điều khiển cho VLLM, Sglang, llama.cpp, exllamav3
★ 1.749+7Thay đổi số sao trong 7 ngày qua - #23
Nền tảng nghiên cứu benchmark suy luận liên tục mã nguồn mở — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & sắp ra mắt™ TPUv6e/v7/Trainium2/3 | Nền tảng nghiên cứu benchmark suy luận liên tục mã nguồn mở — Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72, sắp ra mắt™ TPUv6e/v7/Trainium2/3
★ 1.613+33Thay đổi số sao trong 7 ngày qua - #24
Thuật toán lượng tử hóa SOTA cho suy luận LLM low-bit độ chính xác cao, được tối ưu hóa liền mạch cho CPU/XPU/CUDA, hỗ trợ đa kiểu dữ liệu và tương thích hoàn toàn với vLLM, SGLang và Transformers.
★ 1.599+8Thay đổi số sao trong 7 ngày qua - #25
Máy chủ suy luận LLM hiệu năng cao tương thích với OpenAI và Anthropic dành cho Apple Silicon. Hỗ trợ MLX native, continuous batching, các mô hình đa phương thức, gọi công cụ MCP và Claude Code.
★ 1.557+6Thay đổi số sao trong 7 ngày qua - #26★ 1.275+130Thay đổi số sao trong 7 ngày qua
- #27
AI Inference Operator cho Kubernetes. Cách dễ nhất để phục vụ mô hình ML trong môi trường sản xuất. Hỗ trợ VLM, LLM, embedding và chuyển đổi giọng nói thành văn bản.
★ 1.256+2Thay đổi số sao trong 7 ngày qua - #28
Bộ công cụ lượng tử hóa (nén) mô hình LLM hỗ trợ tăng tốc phần cứng cho GPU Nvidia, AMD, Intel và CPU Intel/AMD/Apple thông qua HF, vLLM và SGLang.
★ 1.248+0Thay đổi số sao trong 7 ngày qua - #29
🔒 API gateway cấp độ doanh nghiệp giúp bạn giám sát và áp dụng giới hạn chi phí hoặc tốc độ cho mỗi API key. Cung cấp khả năng kiểm soát truy cập và giám sát chi tiết theo người dùng, ứng dụng hoặc môi trường. Hỗ trợ OpenAI, Azure OpenAI, Anthropic, vLLM và các LLM mã nguồn mở.
★ 1.228-1Thay đổi số sao trong 7 ngày qua - #30
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 1.191+285Thay đổi số sao trong 7 ngày qua