vllm
Repositori open source terpantau bertanda vllm, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan vllm di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda vllm.
- #1
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 1.171 - #2
Roadmap 10 minggu, 30 menit per hari untuk inferensi dan pengoptimalan penyajian LLM. vLLM, SGLang, kuantisasi, decoding spekulatif, benchmarking.
★ 880
- #1
Toolkit pengenalan suara open source untuk pelatihan, inferensi, streaming ASR, VAD, tanda baca, pipeline diarization pembicara, dan penyajian yang kompatibel dengan OpenAI/MCP.
★ 20.136+64Perubahan bintang dalam 7 hari terakhir - #2
Selamat datang di Llama Cookbook! Ini adalah panduan utama Anda untuk Membangun dengan Llama: Memulai dengan Inference, Fine-Tuning, RAG. Kami juga menunjukkan cara menyelesaikan masalah end-to-end menggunakan keluarga model Llama dan menggunakannya di berbagai layanan penyedia
★ 18.556-3Perubahan bintang dalam 7 hari terakhir - #3
Analisis kode sumber, desain sistem, dan catatan praktik rekayasa perangkat lunak
★ 13.226+6Perubahan bintang dalam 7 hari terakhir - #4
Pustaka sumber terbuka komprehensif berisi keterampilan riset dan rekayasa AI untuk model AI apa pun. Kemas keterampilan tersebut dan agen claude code/codex/gemini Anda akan menjadi agen riset AI dengan performa penuh. Dikelola oleh Orchestra Research.
★ 12.256+104Perubahan bintang dalam 7 hari terakhir - #5★ 11.622+60Perubahan bintang dalam 7 hari terakhir
- #6
Kerangka kerja Agentic RL yang mudah digunakan, skalabel, dan berkinerja tinggi berbasis Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
★ 9.969+9Perubahan bintang dalam 7 hari terakhir - #7
Ganti GPT dengan LLM apa pun hanya dengan mengubah satu baris kode. Xinference memungkinkan Anda menjalankan model open-source, ucapan, dan multimodal di cloud, on-premise, atau laptop Anda — semuanya melalui satu API inferensi terpadu yang siap untuk produksi.
★ 9.537+9Perubahan bintang dalam 7 hari terakhir - #8★ 7.952+44Perubahan bintang dalam 7 hari terakhir
- #9
Mooncake adalah platform layanan untuk Kimi, layanan LLM terkemuka yang disediakan oleh Moonshot AI.
★ 6.470+40Perubahan bintang dalam 7 hari terakhir - #10
Platform inferensi AI generatif dan prediktif terdistribusi yang terstandarisasi untuk penerapan multi-framework yang skalabel di Kubernetes.
★ 5.853+13Perubahan bintang dalam 7 hari terakhir - #11
Kerangka kerja MCP Low-Code untuk membangun pipeline RAG yang kompleks dan inovatif.
★ 5.678+4Perubahan bintang dalam 7 hari terakhir - #12
Manajer klaster GPU untuk penyajian model AI berkinerja tinggi (vLLM, SGLang) dan instans GPU yang dapat diakses via SSH sesuai permintaan.
★ 5.593+21Perubahan bintang dalam 7 hari terakhir - #13
Pertukaran model yang andal untuk server lokal yang kompatibel dengan OpenAI/Anthropic - llama.cpp, vllm, dll
★ 5.562+49Perubahan bintang dalam 7 hari terakhir - #14
Router Mixture-of-Models yang dapat diprogram untuk inferensi LLM heterogen.
★ 5.506+101Perubahan bintang dalam 7 hari terakhir - #15
Daftar pilihan makalah inferensi LLM/VLM dengan kode: Flash-Attention, Paged-Attention, WINT8/4, Paralelisme, dll.
★ 5.482+3Perubahan bintang dalam 7 hari terakhir - #16
Ekstraksi data terstruktur, pemanggilan instruksi, dan alur kerja agen dengan ML, LLM, dan Vision LLM
★ 5.214+7Perubahan bintang dalam 7 hari terakhir - #17
Mempelajari sistem inferensi LLM pada Apple Silicon untuk insinyur sistem: membangun vLLM + Qwen sederhana
★ 4.537+8Perubahan bintang dalam 7 hari terakhir - #18
Runtime bertingkat untuk agen AI. Optimalkan biaya, latensi, kualitas, dan keputusan kebijakan di dalam loop agen.
★ 3.970-9Perubahan bintang dalam 7 hari terakhir - #19
Toolkit Inferensi dan Penerapan Berkinerja Tinggi untuk LLM dan VLM yang berbasis pada PaddlePaddle
★ 3.714+3Perubahan bintang dalam 7 hari terakhir - #20
RamaLama adalah alat pengembang open-source yang menyederhanakan penyajian lokal model AI dari sumber apa pun dan memfasilitasi penggunaannya untuk inferensi dalam produksi, semuanya melalui bahasa kontainer yang sudah dikenal.
★ 3.031+6Perubahan bintang dalam 7 hari terakhir - #21
Plugin perangkat keras yang dikelola komunitas untuk vLLM di Ascend
★ 2.749+19Perubahan bintang dalam 7 hari terakhir - #22
Panel kontrol untuk VLLM, Sglang, llama.cpp, exllamav3
★ 1.749+7Perubahan bintang dalam 7 hari terakhir - #23
Platform Riset Benchmark Inferensi Berkelanjutan Open Source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & segera hadir™ TPUv6e/v7/Trainium2/3 | Platform riset benchmark inferensi berkelanjutan open-source — Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72, segera hadir™ TPUv6e/v7/Trainium2/3
★ 1.613+33Perubahan bintang dalam 7 hari terakhir - #24
Algoritma kuantisasi SOTA untuk inferensi LLM bit-rendah dengan akurasi tinggi, dioptimalkan secara mulus untuk CPU/XPU/CUDA, dengan dukungan berbagai tipe data dan kompatibilitas penuh dengan vLLM, SGLang, dan Transformers.
★ 1.599+8Perubahan bintang dalam 7 hari terakhir - #25
Server inferensi LLM yang kompatibel dengan OpenAI dan Anthropic berkinerja tinggi untuk Apple Silicon. Dilengkapi MLX asli, continuous batching, model multimodal, pemanggilan alat MCP, dan dukungan Claude Code.
★ 1.557+6Perubahan bintang dalam 7 hari terakhir - #26★ 1.275+130Perubahan bintang dalam 7 hari terakhir
- #27
Operator Inferensi AI untuk Kubernetes. Cara termudah untuk menjalankan model ML di lingkungan produksi. Mendukung VLM, LLM, embedding, dan text-to-speech.
★ 1.256+2Perubahan bintang dalam 7 hari terakhir - #28
Toolkit kuantisasi (kompresi) model LLM dengan dukungan akselerasi HW untuk GPU Nvidia, AMD, Intel, dan CPU Intel/AMD/Apple melalui HF, vLLM, dan SGLang.
★ 1.248+0Perubahan bintang dalam 7 hari terakhir - #29
🔒 API gateway tingkat enterprise yang membantu Anda memantau dan menerapkan batasan biaya atau laju per kunci API. Dapatkan kontrol akses dan pemantauan yang mendetail per pengguna, aplikasi, atau lingkungan. Mendukung OpenAI, Azure OpenAI, Anthropic, vLLM, dan LLM open-source.
★ 1.228-1Perubahan bintang dalam 7 hari terakhir - #30
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 1.171+285Perubahan bintang dalam 7 hari terakhir