llm-inference
Repositori open source terpantau bertanda llm-inference, diurutkan berdasarkan bintang.
- #61
Inferensi Llama 3+ dalam Java murni.
★ 816+0Perubahan bintang dalam 7 hari terakhir - #62
LeaderWorkerSet: Sebuah API untuk mendeploy sekelompok pod sebagai unit replikasi
★ 810+8Perubahan bintang dalam 7 hari terakhir - #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: Maksimalkan potensi LLM melalui tutorial terkurasi, praktik terbaik, dan kode siap pakai untuk pelatihan serta inferensi kustom.
★ 731+0Perubahan bintang dalam 7 hari terakhir - #64★ 707+0Perubahan bintang dalam 7 hari terakhir
- #65
USP: Unified (alias Hybrid, 2D) Sequence Parallel Attention untuk Pelatihan dan Inferensi Model Transformers Konteks Panjang
★ 692+3Perubahan bintang dalam 7 hari terakhir - #66
Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2
★ 678+17Perubahan bintang dalam 7 hari terakhir - #67★ 677+4Perubahan bintang dalam 7 hari terakhir
- #68
Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 645+30Perubahan bintang dalam 7 hari terakhir - #69
Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。
★ 621—Perubahan bintang dalam 7 hari terakhir - #70★ 613+46Perubahan bintang dalam 7 hari terakhir
- #71
Alternatif Ollama untuk Rockchip NPU: Solusi efisien untuk menjalankan model AI dan Deep learning pada perangkat Rockchip dengan dukungan NPU yang dioptimalkan (rkllm)
★ 602+5Perubahan bintang dalam 7 hari terakhir - #72
Yet Another Language Model: Inferensi LLM dalam C++/CUDA, tanpa pustaka kecuali untuk I/O
★ 596-1Perubahan bintang dalam 7 hari terakhir - #73
SDK AI lokal open-source - jalankan AI di perangkat tanpa cloud, tanpa kunci API. Mendukung GGUF, RAG, generasi gambar, musik, dan video, speech-to-text, inferensi P2P, dan lainnya. Lintas platform: Linux, macOS, Windows, Android, iOS.
★ 594+35Perubahan bintang dalam 7 hari terakhir - #74
Platform pencarian web minimalis dengan asisten AI yang berjalan langsung dari browser Anda. Demo: https://felladrin-minisearch.hf.space
★ 585+0Perubahan bintang dalam 7 hari terakhir - #75
CLI untuk menjalankan sejumlah besar agen pengodean secara paralel dengan git worktrees
★ 582+0Perubahan bintang dalam 7 hari terakhir - #76★ 580+9Perubahan bintang dalam 7 hari terakhir
- #77
FineTuning LLM (Large Language Model)
★ 579+1Perubahan bintang dalam 7 hari terakhir - #78
Proyek bagus untuk rekrutmen kampus, rekrutmen musim gugur, musim semi, dan magang, membimbing Anda membangun kerangka kerja inferensi model besar dari awal yang mendukung LLama2/3 dan Qwen2.5.
★ 573+1Perubahan bintang dalam 7 hari terakhir - #79★ 559+0Perubahan bintang dalam 7 hari terakhir
- #80
Mesin penayangan latensi rendah & throughput tinggi untuk LLM
★ 521+0Perubahan bintang dalam 7 hari terakhir - #81
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 521+17Perubahan bintang dalam 7 hari terakhir - #82
Krasis adalah runtime Hybrid LLM yang berfokus pada efisiensi menjalankan model yang lebih besar pada perangkat keras tingkat konsumen dengan VRAM terbatas
★ 519+3Perubahan bintang dalam 7 hari terakhir - #83
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—Perubahan bintang dalam 7 hari terakhir - #84★ 505-1Perubahan bintang dalam 7 hari terakhir