llm-inference
Repositori open source terpantau bertanda llm-inference, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan llm-inference di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda llm-inference.
- #1
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 7.187 - #2
Inferensi Gemma 4 26B-A4B dalam ~2 GB RAM pada MacBook seri M apa pun.
★ 6.664 - #3
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 1.200 - #4
Roadmap 10 minggu, 30 menit per hari untuk inferensi dan pengoptimalan penyajian LLM. vLLM, SGLang, kuantisasi, decoding spekulatif, benchmarking.
★ 881 - #5
Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 640
- #1
GPT4All: Jalankan LLM Lokal di Perangkat Apa Pun. Sumber terbuka dan tersedia untuk penggunaan komersial.
★ 77.387-9Perubahan bintang dalam 7 hari terakhir - #2
Ray adalah mesin komputasi AI. Ray terdiri dari runtime terdistribusi inti dan serangkaian pustaka AI untuk mempercepat beban kerja ML.
★ 43.688+41Perubahan bintang dalam 7 hari terakhir - #3★ 29.078+70Perubahan bintang dalam 7 hari terakhir
- #4
Proyek ini bertujuan untuk berbagi prinsip teknis dan pengalaman praktis terkait model bahasa besar (rekayasa LLM dan implementasi aplikasi LLM).
★ 24.995+21Perubahan bintang dalam 7 hari terakhir - #5
20+ LLM berkinerja tinggi dengan resep untuk pra-pelatihan, penyetelan halus, dan penerapan dalam skala besar.
★ 13.645+9Perubahan bintang dalam 7 hari terakhir - #6
Jalankan LLM open-source apa pun, seperti DeepSeek dan Llama, sebagai endpoint API yang kompatibel dengan OpenAI di cloud.
★ 12.524+1Perubahan bintang dalam 7 hari terakhir - #7
OpenVINO™ adalah toolkit open source untuk mengoptimalkan dan menerapkan inferensi AI.
★ 10.793+30Perubahan bintang dalam 7 hari terakhir - #8
Penyajian Large Language Model berkecepatan tinggi untuk penyebaran lokal
★ 9.765+7Perubahan bintang dalam 7 hari terakhir - #9
Cara termudah untuk melayani aplikasi dan model AI - Membangun API inferensi model, antrean tugas, aplikasi LLM, pipeline multi-model, dan banyak lagi.
★ 8.817+4Perubahan bintang dalam 7 hari terakhir - #10★ 8.041+8Perubahan bintang dalam 7 hari terakhir
- #11★ 7.952+44Perubahan bintang dalam 7 hari terakhir
- #12
Implementasi sumber terbuka dari AlphaEvolve
★ 7.307+22Perubahan bintang dalam 7 hari terakhir - #13
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 7.187+468Perubahan bintang dalam 7 hari terakhir - #14
Plano adalah server proxy dan data plane berbasis AI untuk aplikasi agen. Perutean LLM cerdas, observabilitas, orkestrasi agen, dan guardrail agar Anda tetap fokus pada logika inti agen Anda.
★ 7.033+11Perubahan bintang dalam 7 hari terakhir - #15
Inferensi Gemma 4 26B-A4B dalam ~2 GB RAM pada MacBook seri M apa pun.
★ 6.664+178Perubahan bintang dalam 7 hari terakhir - #16
FlashInfer: Pustaka Kernel untuk LLM Serving
★ 6.321+38Perubahan bintang dalam 7 hari terakhir - #17
Kuantisasi, kernel, runtime, dan mesin inferensi untuk perangkat seluler, perangkat yang dapat dikenakan, rumah pintar, dan robot.
★ 5.975+20Perubahan bintang dalam 7 hari terakhir - #18
Platform inferensi AI generatif dan prediktif terdistribusi yang terstandarisasi untuk penerapan multi-framework yang skalabel di Kubernetes.
★ 5.853+13Perubahan bintang dalam 7 hari terakhir - #19
⚡ Mesin inferensi WebGPU berbasis Pure-Rust — Kompatibel dengan OpenAI-API, mendukung GGUF secara native, berjalan di GPU apa pun. Tanpa Python. Tanpa llama.cpp. Berupa biner tunggal.
★ 5.816+6Perubahan bintang dalam 7 hari terakhir - #20
Manajer klaster GPU untuk penyajian model AI berkinerja tinggi (vLLM, SGLang) dan instans GPU yang dapat diakses via SSH sesuai permintaan.
★ 5.593+21Perubahan bintang dalam 7 hari terakhir - #21
Lemonade membantu pengguna menemukan dan menjalankan aplikasi AI lokal dengan menyajikan LLM yang dioptimalkan langsung dari GPU dan NPU mereka sendiri. Bergabunglah dengan Discord kami: https://discord.gg/5xXzkMu8Zk
★ 5.585+55Perubahan bintang dalam 7 hari terakhir - #22
Daftar pilihan makalah inferensi LLM/VLM dengan kode: Flash-Attention, Paged-Attention, WINT8/4, Paralelisme, dll.
★ 5.482+3Perubahan bintang dalam 7 hari terakhir - #23
Superduper: Kerangka kerja end-to-end untuk membangun aplikasi dan agen AI kustom.
★ 5.318+1Perubahan bintang dalam 7 hari terakhir - #24
Eko (Eko Keeps Operating) - Membangun Alur Kerja Agen siap produksi dengan Bahasa Alami - eko.fellou.ai
★ 4.954+2Perubahan bintang dalam 7 hari terakhir - #25
RuVector adalah AI berkinerja tinggi, waktu nyata, pembelajaran mandiri, Vector GNN, Database Memori yang dibuat di Rust.
★ 4.473+6Perubahan bintang dalam 7 hari terakhir - #26★ 4.260+3Perubahan bintang dalam 7 hari terakhir
- #27
Alur kerja referensi Generative AI yang dioptimalkan untuk infrastruktur terakselerasi dan arsitektur layanan mikro.
★ 4.169+4Perubahan bintang dalam 7 hari terakhir - #28
Server inferensi Multi-LoRA yang dapat diskalakan hingga ribuan LLM yang telah di-fine-tune.
★ 3.827+1Perubahan bintang dalam 7 hari terakhir - #29
Kumpulan metode ilmiah, proses, algoritma, dan sistem untuk membangun cerita dan model.
★ 3.676+2Perubahan bintang dalam 7 hari terakhir - #30
Tambahkan node analitik real-time ke database operasional Anda. Spice adalah mesin kueri SQL, pencarian, dan inferensi LLM portabel yang dipercepat, ditulis dalam Rust untuk aplikasi dan agen AI berbasis data.
★ 3.075+1Perubahan bintang dalam 7 hari terakhir