Lompat ke konten utama
buildradar
Sign in
Topik · vllm

vllm

Repositori open source terpantau bertanda vllm, diurutkan berdasarkan bintang.

Repositori
52
Total bintang
195.358
Rata-rata bintang
3.757
Porsi
0,01%

Topik yang sering muncul berdampingan dengan vllm di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda vllm.

  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    1.171
  • Roadmap 10 minggu, 30 menit per hari untuk inferensi dan pengoptimalan penyajian LLM. vLLM, SGLang, kuantisasi, decoding spekulatif, benchmarking.

    880
  • FunASR@modelscope

    Toolkit pengenalan suara open source untuk pelatihan, inferensi, streaming ASR, VAD, tanda baca, pipeline diarization pembicara, dan penyajian yang kompatibel dengan OpenAI/MCP.

    20.136+64Perubahan bintang dalam 7 hari terakhir
  • llama-cookbook@meta-llama

    Selamat datang di Llama Cookbook! Ini adalah panduan utama Anda untuk Membangun dengan Llama: Memulai dengan Inference, Fine-Tuning, RAG. Kami juga menunjukkan cara menyelesaikan masalah end-to-end menggunakan keluarga model Llama dan menggunakannya di berbagai layanan penyedia

    18.556-3Perubahan bintang dalam 7 hari terakhir
  • Analisis kode sumber, desain sistem, dan catatan praktik rekayasa perangkat lunak

    13.226+6Perubahan bintang dalam 7 hari terakhir
  • AI-Research-SKILLs@Orchestra-Research

    Pustaka sumber terbuka komprehensif berisi keterampilan riset dan rekayasa AI untuk model AI apa pun. Kemas keterampilan tersebut dan agen claude code/codex/gemini Anda akan menjadi agen riset AI dengan performa penuh. Dikelola oleh Orchestra Research.

    12.256+104Perubahan bintang dalam 7 hari terakhir
  • LMCache@LMCache

    LMCache: Tingkatkan LLM Anda dengan lapisan KV Cache tercepat

    11.622+60Perubahan bintang dalam 7 hari terakhir
  • OpenRLHF@OpenRLHF

    Kerangka kerja Agentic RL yang mudah digunakan, skalabel, dan berkinerja tinggi berbasis Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

    9.969+9Perubahan bintang dalam 7 hari terakhir
  • inference@xorbitsai

    Ganti GPT dengan LLM apa pun hanya dengan mengubah satu baris kode. Xinference memungkinkan Anda menjalankan model open-source, ucapan, dan multimodal di cloud, on-premise, atau laptop Anda — semuanya melalui satu API inferensi terpadu yang siap untuk produksi.

    9.537+9Perubahan bintang dalam 7 hari terakhir
  • dynamo@ai-dynamo

    Kerangka Kerja Layanan Inferensi Terdistribusi Skala Pusat Data

    7.952+44Perubahan bintang dalam 7 hari terakhir
  • Mooncake@kvcache-ai

    Mooncake adalah platform layanan untuk Kimi, layanan LLM terkemuka yang disediakan oleh Moonshot AI.

    6.470+40Perubahan bintang dalam 7 hari terakhir
  • kserve@kserve

    Platform inferensi AI generatif dan prediktif terdistribusi yang terstandarisasi untuk penerapan multi-framework yang skalabel di Kubernetes.

    5.853+13Perubahan bintang dalam 7 hari terakhir
  • UltraRAG@OpenBMB

    Kerangka kerja MCP Low-Code untuk membangun pipeline RAG yang kompleks dan inovatif.

    5.678+4Perubahan bintang dalam 7 hari terakhir
  • gpustack@gpustack

    Manajer klaster GPU untuk penyajian model AI berkinerja tinggi (vLLM, SGLang) dan instans GPU yang dapat diakses via SSH sesuai permintaan.

    5.593+21Perubahan bintang dalam 7 hari terakhir
  • llama-swap@mostlygeek

    Pertukaran model yang andal untuk server lokal yang kompatibel dengan OpenAI/Anthropic - llama.cpp, vllm, dll

    5.562+49Perubahan bintang dalam 7 hari terakhir
  • semantic-router@vllm-project

    Router Mixture-of-Models yang dapat diprogram untuk inferensi LLM heterogen.

    5.506+101Perubahan bintang dalam 7 hari terakhir
  • Awesome-LLM-Inference@xlite-dev

    Daftar pilihan makalah inferensi LLM/VLM dengan kode: Flash-Attention, Paged-Attention, WINT8/4, Paralelisme, dll.

    5.482+3Perubahan bintang dalam 7 hari terakhir
  • sparrow@katanaml

    Ekstraksi data terstruktur, pemanggilan instruksi, dan alur kerja agen dengan ML, LLM, dan Vision LLM

    5.214+7Perubahan bintang dalam 7 hari terakhir
  • tiny-llm@skyzh

    Mempelajari sistem inferensi LLM pada Apple Silicon untuk insinyur sistem: membangun vLLM + Qwen sederhana

    4.537+8Perubahan bintang dalam 7 hari terakhir
  • cascadeflow@lemony-ai

    Runtime bertingkat untuk agen AI. Optimalkan biaya, latensi, kualitas, dan keputusan kebijakan di dalam loop agen.

    3.970-9Perubahan bintang dalam 7 hari terakhir
  • FastDeploy@PaddlePaddle

    Toolkit Inferensi dan Penerapan Berkinerja Tinggi untuk LLM dan VLM yang berbasis pada PaddlePaddle

    3.714+3Perubahan bintang dalam 7 hari terakhir
  • ramalama@containers

    RamaLama adalah alat pengembang open-source yang menyederhanakan penyajian lokal model AI dari sumber apa pun dan memfasilitasi penggunaannya untuk inferensi dalam produksi, semuanya melalui bahasa kontainer yang sudah dikenal.

    3.031+6Perubahan bintang dalam 7 hari terakhir
  • vllm-ascend@vllm-project

    Plugin perangkat keras yang dikelola komunitas untuk vLLM di Ascend

    2.749+19Perubahan bintang dalam 7 hari terakhir
  • local-studio@sybil-solutions

    Panel kontrol untuk VLLM, Sglang, llama.cpp, exllamav3

    1.749+7Perubahan bintang dalam 7 hari terakhir
  • InferenceX@SemiAnalysisAI

    Platform Riset Benchmark Inferensi Berkelanjutan Open Source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & segera hadir™ TPUv6e/v7/Trainium2/3 | Platform riset benchmark inferensi berkelanjutan open-source — Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72, segera hadir™ TPUv6e/v7/Trainium2/3

    1.613+33Perubahan bintang dalam 7 hari terakhir
  • auto-round@intel

    Algoritma kuantisasi SOTA untuk inferensi LLM bit-rendah dengan akurasi tinggi, dioptimalkan secara mulus untuk CPU/XPU/CUDA, dengan dukungan berbagai tipe data dan kompatibilitas penuh dengan vLLM, SGLang, dan Transformers.

    1.599+8Perubahan bintang dalam 7 hari terakhir
  • vllm-mlx@waybarrios

    Server inferensi LLM yang kompatibel dengan OpenAI dan Anthropic berkinerja tinggi untuk Apple Silicon. Dilengkapi MLX asli, continuous batching, model multimodal, pemanggilan alat MCP, dan dukungan Claude Code.

    1.557+6Perubahan bintang dalam 7 hari terakhir
  • kvcached@ovg-project

    KV Cache Elastis Tervirtualisasi untuk Berbagi GPU Dinamis dan Lebih Jauh Lagi

    1.275+130Perubahan bintang dalam 7 hari terakhir
  • kubeai@kubeai-project

    Operator Inferensi AI untuk Kubernetes. Cara termudah untuk menjalankan model ML di lingkungan produksi. Mendukung VLM, LLM, embedding, dan text-to-speech.

    1.256+2Perubahan bintang dalam 7 hari terakhir
  • GPTQModel@ModelCloud

    Toolkit kuantisasi (kompresi) model LLM dengan dukungan akselerasi HW untuk GPU Nvidia, AMD, Intel, dan CPU Intel/AMD/Apple melalui HF, vLLM, dan SGLang.

    1.248+0Perubahan bintang dalam 7 hari terakhir
  • BricksLLM@bricks-cloud

    🔒 API gateway tingkat enterprise yang membantu Anda memantau dan menerapkan batasan biaya atau laju per kunci API. Dapatkan kontrol akses dan pemantauan yang mendetail per pengguna, aplikasi, atau lingkungan. Mendukung OpenAI, Azure OpenAI, Anthropic, vLLM, dan LLM open-source.

    1.228-1Perubahan bintang dalam 7 hari terakhir
  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    1.171+285Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik