llm-serving
Repositori open source terpantau bertanda llm-serving, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan llm-serving di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda llm-serving.
- #1
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 146
- #1★ 90.817+402Perubahan bintang dalam 7 hari terakhir
- #2
Ray adalah mesin komputasi AI. Ray terdiri dari runtime terdistribusi inti dan serangkaian pustaka AI untuk mempercepat beban kerja ML.
★ 43.688+41Perubahan bintang dalam 7 hari terakhir - #3
Proyek ini bertujuan untuk berbagi prinsip teknis dan pengalaman praktis terkait model bahasa besar (rekayasa LLM dan implementasi aplikasi LLM).
★ 24.995+21Perubahan bintang dalam 7 hari terakhir - #4
TensorRT LLM menyediakan API Python yang mudah digunakan bagi pengguna untuk mendefinisikan Large Language Models (LLM) dan mendukung optimasi terkini untuk melakukan inferensi secara efisien pada GPU NVIDIA. TensorRT LLM juga berisi komponen untuk membuat runtime Python dan C++ yang mengatur eksekusi inferensi dengan performa tinggi.
★ 14.536+38Perubahan bintang dalam 7 hari terakhir - #5
Jalankan LLM open-source apa pun, seperti DeepSeek dan Llama, sebagai endpoint API yang kompatibel dengan OpenAI di cloud.
★ 12.524+1Perubahan bintang dalam 7 hari terakhir - #6
Platform komputasi AI untuk tim terdepan. SkyPilot mengubah komputasi AI yang terfragmentasi menjadi satu superkomputer AI, sehingga tim AI dapat membangun kecerdasan kustom dengan lebih cepat.
★ 10.550+16Perubahan bintang dalam 7 hari terakhir - #7
Cara termudah untuk melayani aplikasi dan model AI - Membangun API inferensi model, antrean tugas, aplikasi LLM, pipeline multi-model, dan banyak lagi.
★ 8.817+4Perubahan bintang dalam 7 hari terakhir - #8
Manajer klaster GPU untuk penyajian model AI berkinerja tinggi (vLLM, SGLang) dan instans GPU yang dapat diakses via SSH sesuai permintaan.
★ 5.593+21Perubahan bintang dalam 7 hari terakhir - #9
Superduper: Kerangka kerja end-to-end untuk membangun aplikasi dan agen AI kustom.
★ 5.318+1Perubahan bintang dalam 7 hari terakhir - #10
Server inferensi Multi-LoRA yang dapat diskalakan hingga ribuan LLM yang telah di-fine-tune.
★ 3.827+1Perubahan bintang dalam 7 hari terakhir - #11
Toolkit Inferensi dan Penerapan Berkinerja Tinggi untuk LLM dan VLM yang berbasis pada PaddlePaddle
★ 3.714+3Perubahan bintang dalam 7 hari terakhir - #12
Kerangka kerja inferensi berkinerja tinggi untuk model bahasa besar, yang berfokus pada efisiensi, fleksibilitas, dan ketersediaan.
★ 2.997-1Perubahan bintang dalam 7 hari terakhir - #13
Plugin perangkat keras yang dikelola komunitas untuk vLLM di Ascend
★ 2.749+19Perubahan bintang dalam 7 hari terakhir - #14★ 2.174+1Perubahan bintang dalam 7 hari terakhir
- #15★ 2.076+0Perubahan bintang dalam 7 hari terakhir
- #16
Platform Riset Benchmark Inferensi Berkelanjutan Open Source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & segera hadir™ TPUv6e/v7/Trainium2/3 | Platform riset benchmark inferensi berkelanjutan open-source — Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72, segera hadir™ TPUv6e/v7/Trainium2/3
★ 1.613+33Perubahan bintang dalam 7 hari terakhir - #17
Parallax adalah kerangka kerja penyajian model terdistribusi yang memungkinkan Anda membangun kluster AI sendiri di mana saja
★ 1.372+4Perubahan bintang dalam 7 hari terakhir - #18★ 1.325+6Perubahan bintang dalam 7 hari terakhir
- #19★ 1.275+130Perubahan bintang dalam 7 hari terakhir
- #20
Kerangka kerja penayangan berkinerja tinggi yang berorientasi pada throughput untuk LLM
★ 975+1Perubahan bintang dalam 7 hari terakhir - #21★ 908+0Perubahan bintang dalam 7 hari terakhir
- #22
Framework penyajian model ML performa tinggi, menawarkan batching dinamis dan pipeline CPU/GPU untuk memaksimalkan mesin komputasi Anda
★ 902+0Perubahan bintang dalam 7 hari terakhir - #23
Armada Agen Pribadi dengan Pemrograman Spesifikasi. Setiap agen mendapatkan desktop berakselerasi GPU mereka sendiri. Jalankan Claude, Codex, Gemini, dan model terbuka pada AI Stack pribadi penuh
★ 805+2Perubahan bintang dalam 7 hari terakhir - #24
Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2
★ 677+18Perubahan bintang dalam 7 hari terakhir - #25
FineTuning LLM (Large Language Model)
★ 579+1Perubahan bintang dalam 7 hari terakhir