inference-engine
Repositori open source terpantau bertanda inference-engine, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan inference-engine di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda inference-engine.
- #1
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 6.897 - #2
Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624 - #3
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 552
- #1
Analisis kode sumber, desain sistem, dan catatan praktik rekayasa perangkat lunak
★ 13.220+3Perubahan bintang dalam 7 hari terakhir - #2
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 6.897+485Perubahan bintang dalam 7 hari terakhir - #3
FEDML - Pustaka ML yang terpadu dan dapat diskalakan untuk pelatihan terdistribusi skala besar, penyajian model, dan federated learning. FEDML Launch, penjadwal lintas cloud, memungkinkan eksekusi pekerjaan AI apa pun di cloud GPU atau klaster on-premise mana pun. Dibangun di atas pustaka ini, TensorOpera AI (https://TensorOpera.ai) adalah platform AI generatif Anda dalam skala besar.
★ 4.061-1Perubahan bintang dalam 7 hari terakhir - #4
Proyek untuk rekrutmen kampus. Implementasi pustaka inferensi deep learning berkinerja tinggi dari nol, mendukung model seperti Llama2, Unet, Yolov5, dan Resnet.
★ 3.497+1Perubahan bintang dalam 7 hari terakhir - #5
Implementasi mesin aturan dalam Golang
★ 2.522+0Perubahan bintang dalam 7 hari terakhir - #6★ 1.964+1Perubahan bintang dalam 7 hari terakhir
- #7★ 1.844+2Perubahan bintang dalam 7 hari terakhir
- #8
Kecepatan 3x lebih cepat pada MLX | Qwen 3.8 27B | Native MTP Speculative Decoding pada Apple Silicon tanpa Drafter eksternal.
★ 1.805+235Perubahan bintang dalam 7 hari terakhir - #9
Mesin inferensi performa tinggi untuk model LLM, VLM, DiT, dan REC, yang dioptimalkan untuk berbagai akselerator AI. Dihosting di OpenAtom Foundation.
★ 1.541+12Perubahan bintang dalam 7 hari terakhir - #10
Qualcomm® AI Hub Models adalah koleksi model machine learning canggih yang dioptimalkan untuk performa (latensi, memori, dll.) dan siap diterapkan di perangkat Qualcomm®.
★ 1.194+3Perubahan bintang dalam 7 hari terakhir - #11★ 1.145+5Perubahan bintang dalam 7 hari terakhir
- #12
Paddle.js adalah proyek web untuk Baidu PaddlePaddle, yang merupakan kerangka kerja pembelajaran mendalam sumber terbuka yang berjalan di browser. Paddle.js dapat memuat model yang telah dilatih sebelumnya, atau mengubah model dari paddle-hub dengan alat pengubah model yang disediakan oleh Paddle.js. Ini dapat berjalan di setiap browser yang mendukung WebGL/WebGPU/WebAssembly. Ini juga dapat berjalan di Baidu Smartprogram dan WX miniprogram.
★ 1.103+0Perubahan bintang dalam 7 hari terakhir - #13
NobodyWho adalah mesin inferensi yang memungkinkan Anda menjalankan LLM secara lokal dan efisien di perangkat apa pun.
★ 1.081+11Perubahan bintang dalam 7 hari terakhir - #14
MLX Studio - Rumah JANG_Q - Pembuatan/Pengeditan Gambar + Obrolan/Kode Semua dalam satu - + OpenClaw (Anthropic API)
★ 960+11Perubahan bintang dalam 7 hari terakhir - #15★ 908+0Perubahan bintang dalam 7 hari terakhir
- #16
Framework Computer Vision & Analisis Video Python yang Lengkap dan Siap Pakai
★ 849+1Perubahan bintang dalam 7 hari terakhir - #17
Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2
★ 660+4Perubahan bintang dalam 7 hari terakhir - #18
Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624+98Perubahan bintang dalam 7 hari terakhir - #19
Yet Another Language Model: Inferensi LLM dalam C++/CUDA, tanpa pustaka kecuali untuk I/O
★ 597+1Perubahan bintang dalam 7 hari terakhir - #20★ 582+1Perubahan bintang dalam 7 hari terakhir
- #21
Proyek bagus untuk rekrutmen kampus, rekrutmen musim gugur, musim semi, dan magang, membimbing Anda membangun kerangka kerja inferensi model besar dari awal yang mendukung LLama2/3 dan Qwen2.5.
★ 572+9Perubahan bintang dalam 7 hari terakhir - #22
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 552+35Perubahan bintang dalam 7 hari terakhir - #23
Krasis adalah runtime Hybrid LLM yang berfokus pada efisiensi menjalankan model yang lebih besar pada perangkat keras tingkat konsumen dengan VRAM terbatas
★ 516+3Perubahan bintang dalam 7 hari terakhir - #24
Mesin inferensi untuk perangkat Intel. Menjalankan LLM, VLM, Whisper, Kokoro-TTS, model Embedding dan Rerank melalui endpoint OpenAI.
★ 513+4Perubahan bintang dalam 7 hari terakhir