Lompat ke konten utama
buildradar
Sign in
Topik · llm-inference

llm-inference

Repositori open source terpantau bertanda llm-inference, diurutkan berdasarkan bintang.

Repositori
83
Total bintang
408.416
Rata-rata bintang
4.921
Porsi
0,02%

Topik yang sering muncul berdampingan dengan llm-inference di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda llm-inference.

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.

    7.187
  • turbo-fieldfare@drumih

    Inferensi Gemma 4 26B-A4B dalam ~2 GB RAM pada MacBook seri M apa pun.

    6.664
  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    1.200
  • Roadmap 10 minggu, 30 menit per hari untuk inferensi dan pengoptimalan penyajian LLM. vLLM, SGLang, kuantisasi, decoding spekulatif, benchmarking.

    881
  • mlx-dspark@ARahim3

    Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

    640
  • gpt4all@nomic-ai

    GPT4All: Jalankan LLM Lokal di Perangkat Apa Pun. Sumber terbuka dan tersedia untuk penggunaan komersial.

    77.387-9Perubahan bintang dalam 7 hari terakhir
  • ray@ray-project

    Ray adalah mesin komputasi AI. Ray terdiri dari runtime terdistribusi inti dan serangkaian pustaka AI untuk mempercepat beban kerja ML.

    43.688+41Perubahan bintang dalam 7 hari terakhir
  • gitleaks@gitleaks

    Temukan rahasia dengan Gitleaks 🔑

    29.078+70Perubahan bintang dalam 7 hari terakhir
  • llm-action@liguodongiot

    Proyek ini bertujuan untuk berbagi prinsip teknis dan pengalaman praktis terkait model bahasa besar (rekayasa LLM dan implementasi aplikasi LLM).

    24.995+21Perubahan bintang dalam 7 hari terakhir
  • litgpt@Lightning-AI

    20+ LLM berkinerja tinggi dengan resep untuk pra-pelatihan, penyetelan halus, dan penerapan dalam skala besar.

    13.645+9Perubahan bintang dalam 7 hari terakhir
  • OpenLLM@bentoml

    Jalankan LLM open-source apa pun, seperti DeepSeek dan Llama, sebagai endpoint API yang kompatibel dengan OpenAI di cloud.

    12.524+1Perubahan bintang dalam 7 hari terakhir
  • openvino@openvinotoolkit

    OpenVINO™ adalah toolkit open source untuk mengoptimalkan dan menerapkan inferensi AI.

    10.793+30Perubahan bintang dalam 7 hari terakhir
  • PowerInfer@Tiiny-AI

    Penyajian Large Language Model berkecepatan tinggi untuk penyebaran lokal

    9.765+7Perubahan bintang dalam 7 hari terakhir
  • BentoML@bentoml

    Cara termudah untuk melayani aplikasi dan model AI - Membangun API inferensi model, antrean tugas, aplikasi LLM, pipeline multi-model, dan banyak lagi.

    8.817+4Perubahan bintang dalam 7 hari terakhir
  • lmdeploy@InternLM

    LMDeploy adalah toolkit untuk mengompresi, mendistribusikan, dan melayani LLM.

    8.041+8Perubahan bintang dalam 7 hari terakhir
  • dynamo@ai-dynamo

    Kerangka Kerja Layanan Inferensi Terdistribusi Skala Pusat Data

    7.952+44Perubahan bintang dalam 7 hari terakhir
  • openevolve@algorithmicsuperintelligence

    Implementasi sumber terbuka dari AlphaEvolve

    7.307+22Perubahan bintang dalam 7 hari terakhir
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.

    7.187+468Perubahan bintang dalam 7 hari terakhir
  • plano@katanemo

    Plano adalah server proxy dan data plane berbasis AI untuk aplikasi agen. Perutean LLM cerdas, observabilitas, orkestrasi agen, dan guardrail agar Anda tetap fokus pada logika inti agen Anda.

    7.033+11Perubahan bintang dalam 7 hari terakhir
  • turbo-fieldfare@drumih

    Inferensi Gemma 4 26B-A4B dalam ~2 GB RAM pada MacBook seri M apa pun.

    6.664+178Perubahan bintang dalam 7 hari terakhir
  • flashinfer@flashinfer-ai

    FlashInfer: Pustaka Kernel untuk LLM Serving

    6.321+38Perubahan bintang dalam 7 hari terakhir
  • cactus@cactus-compute

    Kuantisasi, kernel, runtime, dan mesin inferensi untuk perangkat seluler, perangkat yang dapat dikenakan, rumah pintar, dan robot.

    5.975+20Perubahan bintang dalam 7 hari terakhir
  • kserve@kserve

    Platform inferensi AI generatif dan prediktif terdistribusi yang terstandarisasi untuk penerapan multi-framework yang skalabel di Kubernetes.

    5.853+13Perubahan bintang dalam 7 hari terakhir
  • shimmy@Michael-A-Kuykendall

    ⚡ Mesin inferensi WebGPU berbasis Pure-Rust — Kompatibel dengan OpenAI-API, mendukung GGUF secara native, berjalan di GPU apa pun. Tanpa Python. Tanpa llama.cpp. Berupa biner tunggal.

    5.816+6Perubahan bintang dalam 7 hari terakhir
  • gpustack@gpustack

    Manajer klaster GPU untuk penyajian model AI berkinerja tinggi (vLLM, SGLang) dan instans GPU yang dapat diakses via SSH sesuai permintaan.

    5.593+21Perubahan bintang dalam 7 hari terakhir
  • lemonade@lemonade-sdk

    Lemonade membantu pengguna menemukan dan menjalankan aplikasi AI lokal dengan menyajikan LLM yang dioptimalkan langsung dari GPU dan NPU mereka sendiri. Bergabunglah dengan Discord kami: https://discord.gg/5xXzkMu8Zk

    5.585+55Perubahan bintang dalam 7 hari terakhir
  • Awesome-LLM-Inference@xlite-dev

    Daftar pilihan makalah inferensi LLM/VLM dengan kode: Flash-Attention, Paged-Attention, WINT8/4, Paralelisme, dll.

    5.482+3Perubahan bintang dalam 7 hari terakhir
  • superduper@superduper-io

    Superduper: Kerangka kerja end-to-end untuk membangun aplikasi dan agen AI kustom.

    5.318+1Perubahan bintang dalam 7 hari terakhir
  • eko@FellouAI

    Eko (Eko Keeps Operating) - Membangun Alur Kerja Agen siap produksi dengan Bahasa Alami - eko.fellou.ai

    4.954+2Perubahan bintang dalam 7 hari terakhir
  • RuVector@ruvnet

    RuVector adalah AI berkinerja tinggi, waktu nyata, pembelajaran mandiri, Vector GNN, Database Memori yang dibuat di Rust.

    4.473+6Perubahan bintang dalam 7 hari terakhir
  • optillm@algorithmicsuperintelligence

    Optimasi proxy inferensi untuk LLM.

    4.260+3Perubahan bintang dalam 7 hari terakhir
  • GenerativeAIExamples@NVIDIA

    Alur kerja referensi Generative AI yang dioptimalkan untuk infrastruktur terakselerasi dan arsitektur layanan mikro.

    4.169+4Perubahan bintang dalam 7 hari terakhir
  • lorax@predibase

    Server inferensi Multi-LoRA yang dapat diskalakan hingga ribuan LLM yang telah di-fine-tune.

    3.827+1Perubahan bintang dalam 7 hari terakhir
  • AI-Engineer-Headquarters@hemansnation

    Kumpulan metode ilmiah, proses, algoritma, dan sistem untuk membangun cerita dan model.

    3.676+2Perubahan bintang dalam 7 hari terakhir
  • spiceai@spiceai

    Tambahkan node analitik real-time ke database operasional Anda. Spice adalah mesin kueri SQL, pencarian, dan inferensi LLM portabel yang dipercepat, ditulis dalam Rust untuk aplikasi dan agen AI berbasis data.

    3.075+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik