Lompat ke konten utama
buildradar
Sign in
Topik · llm-serving

llm-serving

Repositori open source terpantau bertanda llm-serving, diurutkan berdasarkan bintang.

Repositori
25
Total bintang
244.794
Rata-rata bintang
9.792
Porsi
0,01%

Topik yang sering muncul berdampingan dengan llm-serving di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda llm-serving.

  • kaggle-tpu-lab@ARahim3

    Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.

    146
  • vllm@vllm-project

    Mesin inferensi dan serving ber-throughput tinggi serta hemat memori untuk LLM

    90.817+402Perubahan bintang dalam 7 hari terakhir
  • ray@ray-project

    Ray adalah mesin komputasi AI. Ray terdiri dari runtime terdistribusi inti dan serangkaian pustaka AI untuk mempercepat beban kerja ML.

    43.688+41Perubahan bintang dalam 7 hari terakhir
  • llm-action@liguodongiot

    Proyek ini bertujuan untuk berbagi prinsip teknis dan pengalaman praktis terkait model bahasa besar (rekayasa LLM dan implementasi aplikasi LLM).

    24.995+21Perubahan bintang dalam 7 hari terakhir
  • TensorRT-LLM@NVIDIA

    TensorRT LLM menyediakan API Python yang mudah digunakan bagi pengguna untuk mendefinisikan Large Language Models (LLM) dan mendukung optimasi terkini untuk melakukan inferensi secara efisien pada GPU NVIDIA. TensorRT LLM juga berisi komponen untuk membuat runtime Python dan C++ yang mengatur eksekusi inferensi dengan performa tinggi.

    14.536+38Perubahan bintang dalam 7 hari terakhir
  • OpenLLM@bentoml

    Jalankan LLM open-source apa pun, seperti DeepSeek dan Llama, sebagai endpoint API yang kompatibel dengan OpenAI di cloud.

    12.524+1Perubahan bintang dalam 7 hari terakhir
  • skypilot@skypilot-org

    Platform komputasi AI untuk tim terdepan. SkyPilot mengubah komputasi AI yang terfragmentasi menjadi satu superkomputer AI, sehingga tim AI dapat membangun kecerdasan kustom dengan lebih cepat.

    10.550+16Perubahan bintang dalam 7 hari terakhir
  • BentoML@bentoml

    Cara termudah untuk melayani aplikasi dan model AI - Membangun API inferensi model, antrean tugas, aplikasi LLM, pipeline multi-model, dan banyak lagi.

    8.817+4Perubahan bintang dalam 7 hari terakhir
  • gpustack@gpustack

    Manajer klaster GPU untuk penyajian model AI berkinerja tinggi (vLLM, SGLang) dan instans GPU yang dapat diakses via SSH sesuai permintaan.

    5.593+21Perubahan bintang dalam 7 hari terakhir
  • superduper@superduper-io

    Superduper: Kerangka kerja end-to-end untuk membangun aplikasi dan agen AI kustom.

    5.318+1Perubahan bintang dalam 7 hari terakhir
  • lorax@predibase

    Server inferensi Multi-LoRA yang dapat diskalakan hingga ribuan LLM yang telah di-fine-tune.

    3.827+1Perubahan bintang dalam 7 hari terakhir
  • FastDeploy@PaddlePaddle

    Toolkit Inferensi dan Penerapan Berkinerja Tinggi untuk LLM dan VLM yang berbasis pada PaddlePaddle

    3.714+3Perubahan bintang dalam 7 hari terakhir
  • chitu@thu-pacman

    Kerangka kerja inferensi berkinerja tinggi untuk model bahasa besar, yang berfokus pada efisiensi, fleksibilitas, dan ketersediaan.

    2.997-1Perubahan bintang dalam 7 hari terakhir
  • vllm-ascend@vllm-project

    Plugin perangkat keras yang dikelola komunitas untuk vLLM di Ascend

    2.749+19Perubahan bintang dalam 7 hari terakhir
  • MoBA@MoonshotAI

    MoBA: Mixture of Block Attention untuk LLM Konteks Panjang

    2.174+1Perubahan bintang dalam 7 hari terakhir
  • aici@microsoft

    AICI: Prompt sebagai program (Wasm)

    2.076+0Perubahan bintang dalam 7 hari terakhir
  • InferenceX@SemiAnalysisAI

    Platform Riset Benchmark Inferensi Berkelanjutan Open Source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & segera hadir™ TPUv6e/v7/Trainium2/3 | Platform riset benchmark inferensi berkelanjutan open-source — Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72, segera hadir™ TPUv6e/v7/Trainium2/3

    1.613+33Perubahan bintang dalam 7 hari terakhir
  • parallax@GradientHQ

    Parallax adalah kerangka kerja penyajian model terdistribusi yang memungkinkan Anda membangun kluster AI sendiri di mana saja

    1.372+4Perubahan bintang dalam 7 hari terakhir
  • rtp-llm@alibaba

    RTP-LLM: Mesin inferensi LLM performa tinggi Alibaba untuk berbagai aplikasi.

    1.325+6Perubahan bintang dalam 7 hari terakhir
  • kvcached@ovg-project

    KV Cache Elastis Tervirtualisasi untuk Berbagi GPU Dinamis dan Lebih Jauh Lagi

    1.275+130Perubahan bintang dalam 7 hari terakhir
  • Nanoflow@efeslab

    Kerangka kerja penayangan berkinerja tinggi yang berorientasi pada throughput untuk LLM

    975+1Perubahan bintang dalam 7 hari terakhir
  • ZhiLight@zhihu

    Mesin akselerasi inferensi LLM yang sangat dioptimalkan untuk Llama dan variannya.

    908+0Perubahan bintang dalam 7 hari terakhir
  • mosec@mosecorg

    Framework penyajian model ML performa tinggi, menawarkan batching dinamis dan pipeline CPU/GPU untuk memaksimalkan mesin komputasi Anda

    902+0Perubahan bintang dalam 7 hari terakhir
  • helix@helixml

    Armada Agen Pribadi dengan Pemrograman Spesifikasi. Setiap agen mendapatkan desktop berakselerasi GPU mereka sendiri. Jalankan Claude, Codex, Gemini, dan model terbuka pada AI Stack pribadi penuh

    805+2Perubahan bintang dalam 7 hari terakhir
  • pegainfer@pegainfer-project

    Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2

    677+18Perubahan bintang dalam 7 hari terakhir
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    FineTuning LLM (Large Language Model)

    579+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik