跳到主要內容
buildradar
登入
主題 · llm-inference

llm-inference

標記 llm-inference 主題、收錄中的開源專案,依星數排序。

共 84 個專案
  • llama3.java@mukel

    以純 Java 實現的 Llama 3+ 推理

    816+0近 7 天星數變化
  • lws@kubernetes-sigs

    LeaderWorkerSet:用於將一組 Pod 作為複製單元部署的 API

    810+5近 7 天星數變化
  • LLM-PowerHouse:透過精選教學、最佳實踐以及可用於自訂訓練與推論的即用程式碼,釋放 LLM 的潛力。

    731+0近 7 天星數變化
  • llmflows@stoyan-stoyanov

    LLMFlows - 簡單、明確且透明的 LLM 應用程式

    707+0近 7 天星數變化
  • long-context-attention@feifeibear

    USP:用於長文本 Transformers 模型訓練與推論的統一(亦稱混合、2D)序列平行注意力機制

    692+2近 7 天星數變化
  • zero-to-sglang@datawhalechina

    Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。

    686近 7 天星數變化
  • pegainfer@pegainfer-project

    純 Rust + CUDA LLM 推論引擎 — 無需 PyTorch,相容 OpenAI,支援 Qwen3 至 Kimi-K2 服務

    680+11近 7 天星數變化
  • atlas@Avarok-Cybersecurity

    純 Rust 推論引擎

    678+3近 7 天星數變化
  • mlx-dspark@ARahim3

    在 Apple Silicon 上實現高達 4 倍更快的 LLM 解碼,無損。原生 MLX 移植 DeepSeek 的 DSpark 與 z-lab 的 DFlash 推測解碼 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三進制 Bonsai-27B。

    647+17近 7 天星數變化
  • hipfire@warpfront

    使用 Rust 編寫的 RDNA 原生 LLM 推論引擎

    616+23近 7 天星數變化
  • rkllama@NotPunchnox

    Rockchip NPU 的 Ollama 替代方案:在 Rockchip 裝置上執行 AI 與深度學習模型的高效解決方案(rkllm),並提供優化的 NPU 支援

    602+6近 7 天星數變化
  • yalm@andrewkchan

    又一個語言模型:以 C++/CUDA 實作的 LLM 推論,除了 I/O 外不依賴任何函式庫

    597+1近 7 天星數變化
  • qvac@tetherto

    開源本地 AI SDK - 在裝置端執行 AI,無需雲端、無需 API 金鑰。支援 GGUF、RAG、影像、音樂與影片生成、語音轉文字、P2P 推理等。跨平台:Linux、macOS、Windows、Android、iOS。

    596+17近 7 天星數變化
  • MiniSearch@felladrin

    極簡主義網頁搜尋平台,內建可直接在瀏覽器中執行的 AI 助理。演示:https://felladrin-minisearch.hf.space

    585-1近 7 天星數變化
  • uzi@devflowinc

    用於透過 git worktrees 並行執行大量程式碼代理的 CLI 工具

    582+0近 7 天星數變化
  • LLM-Hub@timmyy123

    本地 AI 助理。

    581+6近 7 天星數變化
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    LLM (大型語言模型) 微調

    578+0近 7 天星數變化
  • KuiperLLama@zjhellofss

    校招、秋招、春招與實習專案,帶您從零實作支援 LLama2/3 與 Qwen2.5 的大模型推理框架。

    574+0近 7 天星數變化
  • qwen600@yassa9

    靜態 suckless 單批次僅限 CUDA 的 qwen3-0.6B 小型推論引擎。

    560+1近 7 天星數變化
  • sarathi-serve@microsoft

    用於 LLM 的低延遲與高吞吐量服務引擎

    522+1近 7 天星數變化
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    522+14近 7 天星數變化
  • krasis@brontoguana

    Krasis 是一款混合型 LLM 執行時期,專注於在消費級 VRAM 受限的硬體上高效執行大型模型。

    519+3近 7 天星數變化
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    508+4近 7 天星數變化
  • vllm-cli@Chen-zexi

    使用 vLLM 部署 LLM 的命令列介面工具

    505-1近 7 天星數變化
← 返回主題列表