Lompat ke konten utama
buildradar
Sign in
Topik · llm-inference

llm-inference

Repositori open source terpantau bertanda llm-inference, diurutkan berdasarkan bintang.

84 repositori
  • llama3.java@mukel

    Inferensi Llama 3+ dalam Java murni.

    816+0Perubahan bintang dalam 7 hari terakhir
  • lws@kubernetes-sigs

    LeaderWorkerSet: Sebuah API untuk mendeploy sekelompok pod sebagai unit replikasi

    810+8Perubahan bintang dalam 7 hari terakhir
  • LLM-PowerHouse: Maksimalkan potensi LLM melalui tutorial terkurasi, praktik terbaik, dan kode siap pakai untuk pelatihan serta inferensi kustom.

    731+0Perubahan bintang dalam 7 hari terakhir
  • llmflows@stoyan-stoyanov

    LLMFlows - Aplikasi LLM yang sederhana, eksplisit, dan transparan.

    707+0Perubahan bintang dalam 7 hari terakhir
  • long-context-attention@feifeibear

    USP: Unified (alias Hybrid, 2D) Sequence Parallel Attention untuk Pelatihan dan Inferensi Model Transformers Konteks Panjang

    692+3Perubahan bintang dalam 7 hari terakhir
  • pegainfer@pegainfer-project

    Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2

    678+17Perubahan bintang dalam 7 hari terakhir
  • atlas@Avarok-Cybersecurity

    Mesin Inferensi Pure Rust

    677+4Perubahan bintang dalam 7 hari terakhir
  • mlx-dspark@ARahim3

    Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

    645+30Perubahan bintang dalam 7 hari terakhir
  • zero-to-sglang@datawhalechina

    Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。

    621Perubahan bintang dalam 7 hari terakhir
  • hipfire@warpfront

    Mesin inferensi LLM asli RDNA dalam Rust.

    613+46Perubahan bintang dalam 7 hari terakhir
  • rkllama@NotPunchnox

    Alternatif Ollama untuk Rockchip NPU: Solusi efisien untuk menjalankan model AI dan Deep learning pada perangkat Rockchip dengan dukungan NPU yang dioptimalkan (rkllm)

    602+5Perubahan bintang dalam 7 hari terakhir
  • yalm@andrewkchan

    Yet Another Language Model: Inferensi LLM dalam C++/CUDA, tanpa pustaka kecuali untuk I/O

    596-1Perubahan bintang dalam 7 hari terakhir
  • qvac@tetherto

    SDK AI lokal open-source - jalankan AI di perangkat tanpa cloud, tanpa kunci API. Mendukung GGUF, RAG, generasi gambar, musik, dan video, speech-to-text, inferensi P2P, dan lainnya. Lintas platform: Linux, macOS, Windows, Android, iOS.

    594+35Perubahan bintang dalam 7 hari terakhir
  • MiniSearch@felladrin

    Platform pencarian web minimalis dengan asisten AI yang berjalan langsung dari browser Anda. Demo: https://felladrin-minisearch.hf.space

    585+0Perubahan bintang dalam 7 hari terakhir
  • uzi@devflowinc

    CLI untuk menjalankan sejumlah besar agen pengodean secara paralel dengan git worktrees

    582+0Perubahan bintang dalam 7 hari terakhir
  • LLM-Hub@timmyy123

    Asisten AI Lokal

    580+9Perubahan bintang dalam 7 hari terakhir
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    FineTuning LLM (Large Language Model)

    579+1Perubahan bintang dalam 7 hari terakhir
  • KuiperLLama@zjhellofss

    Proyek bagus untuk rekrutmen kampus, rekrutmen musim gugur, musim semi, dan magang, membimbing Anda membangun kerangka kerja inferensi model besar dari awal yang mendukung LLama2/3 dan Qwen2.5.

    573+1Perubahan bintang dalam 7 hari terakhir
  • qwen600@yassa9

    Mesin inferensi mini qwen3-0.6B khusus CUDA batch tunggal statis yang suckless

    559+0Perubahan bintang dalam 7 hari terakhir
  • sarathi-serve@microsoft

    Mesin penayangan latensi rendah & throughput tinggi untuk LLM

    521+0Perubahan bintang dalam 7 hari terakhir
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    521+17Perubahan bintang dalam 7 hari terakhir
  • krasis@brontoguana

    Krasis adalah runtime Hybrid LLM yang berfokus pada efisiensi menjalankan model yang lebih besar pada perangkat keras tingkat konsumen dengan VRAM terbatas

    519+3Perubahan bintang dalam 7 hari terakhir
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    507Perubahan bintang dalam 7 hari terakhir
  • vllm-cli@Chen-zexi

    Alat antarmuka baris perintah (CLI) untuk menyajikan LLM menggunakan vLLM.

    505-1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik