跳到主要內容
buildradar
Sign in
主題 · llm-inference

llm-inference

標記 llm-inference 主題、收錄中的開源專案,依星數排序。

專案數
84
總星數
408,416
平均星數
4,862
佔比
0.02%

常跟 llm-inference 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 llm-inference 主題的專案。

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆參數模型,單 CPU 推理 8.24 GB RAM,C99 可攜式:無 BLAS、無框架、無 GPU

    7,226
  • turbo-fieldfare@drumih

    Gemma 4 26B-A4B 推理在任何 M 系列 MacBook 上約 2 GB RAM

    6,682
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,225
  • 為期 10 週、每天 30 分鐘的 LLM 推論服務與最佳化學習藍圖。包含 vLLM、SGLang、量化、推測解碼、效能評測。

    887
  • mlx-dspark@ARahim3

    在 Apple Silicon 上實現高達 4 倍更快的 LLM 解碼,無損。原生 MLX 移植 DeepSeek 的 DSpark 與 z-lab 的 DFlash 推測解碼 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三進制 Bonsai-27B。

    645
  • gpt4all@nomic-ai

    GPT4All:在任何裝置上本地執行 LLM。開源且可商業使用

    77,387-9近 7 天星數變化
  • ray@ray-project

    Ray 是一個 AI 計算引擎,包含核心分散式執行環境與加速機器學習工作負載的 AI 函式庫套件

    43,688+41近 7 天星數變化
  • gitleaks@gitleaks

    使用 Gitleaks 尋找機密資訊 🔑

    29,078+70近 7 天星數變化
  • llm-action@liguodongiot

    本項目旨在分享大模型相關技術原理以及實戰經驗(大模型工程化、大模型應用落地)

    24,995+21近 7 天星數變化
  • litgpt@Lightning-AI

    20+ 高效 LLM,附預訓練、微調與大規模部署範例

    13,645+9近 7 天星數變化
  • OpenLLM@bentoml

    在雲端將任何開源 LLM(如 DeepSeek、Llama)作為兼容 OpenAI 的 API 端點運行。

    12,524+1近 7 天星數變化
  • openvino@openvinotoolkit

    OpenVINO™:用於優化與部署 AI 推論的開源工具套件

    10,793+30近 7 天星數變化
  • PowerInfer@Tiiny-AI

    高速大型語言模型本地部署服務

    9,765+7近 7 天星數變化
  • BentoML@bentoml

    最簡便的 AI 應用與模型服務方式 ─ 建立模型推論 API、工作佇列、LLM 應用、多模型流水線等

    8,817+4近 7 天星數變化
  • lmdeploy@InternLM

    LMDeploy 是一套用於壓縮、部署與服務 LLM 的工具組。

    8,041+8近 7 天星數變化
  • dynamo@ai-dynamo

    資料中心規模的分布式推論服務框架

    7,952+44近 7 天星數變化
  • openevolve@algorithmicsuperintelligence

    AlphaEvolve 的開源實作

    7,307+22近 7 天星數變化
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆參數模型,單 CPU 推理 8.24 GB RAM,C99 可攜式:無 BLAS、無框架、無 GPU

    7,226+498近 7 天星數變化
  • plano@katanemo

    Plano 是一個 AI 原生代理伺服器與資料平面,為代理應用提供智能 LLM 路由、可觀測性、代理編排與安全防護,讓你專注於核心邏輯

    7,033+11近 7 天星數變化
  • turbo-fieldfare@drumih

    Gemma 4 26B-A4B 推理在任何 M 系列 MacBook 上約 2 GB RAM

    6,682+187近 7 天星數變化
  • flashinfer@flashinfer-ai

    FlashInfer:大型語言模型服務的核心函式庫

    6,321+38近 7 天星數變化
  • cactus@cactus-compute

    量化、核心、執行時與推論引擎,適用於行動裝置、穿戴裝置、智慧家庭與機器人。

    5,975+20近 7 天星數變化
  • kserve@kserve

    標準化的分散式生成式與預測式 AI 推論平台,支援在 Kubernetes 上以多框架擴展部署

    5,853+13近 7 天星數變化
  • shimmy@Michael-A-Kuykendall

    ⚡ 純 Rust WebGPU 推理引擎 — OpenAI-API 兼容,GGUF 原生,支援任何 GPU。無 Python,無 llama.cpp,單一二進位檔。

    5,816+6近 7 天星數變化
  • gpustack@gpustack

    一個 GPU 叢集管理器,用於高效能 AI 模型服務(vLLM、SGLang)以及按需可 SSH 存取的 GPU 實例。

    5,593+21近 7 天星數變化
  • lemonade@lemonade-sdk

    Lemonade 幫助用戶發現並運行本地 AI 應用,直接在自己的 GPU 和 NPU 上提供優化 LLM,加入我們的 Discord:https://discord.gg/5xXzkMu8Zk

    5,585+55近 7 天星數變化
  • Awesome-LLM-Inference@xlite-dev

    📚 精選Awesome LLM/VLM推理論文與程式碼清單:Flash-Attention、Paged-Attention、WINT8/4、Parallelism等。🎉

    5,482+3近 7 天星數變化
  • superduper@superduper-io

    Superduper:端到端框架,用於構建自訂 AI 應用與代理

    5,318+1近 7 天星數變化
  • eko@FellouAI

    Eko (Eko Keeps Operating) - 用自然語言構建可生產使用的代理工作流 - eko.fellou.ai

    4,954+2近 7 天星數變化
  • RuVector@ruvnet

    RuVector 是一個高性能、實時、自學 AI 向量 GNN,內建 Rust 記憶體資料庫

    4,473+6近 7 天星數變化
  • optillm@algorithmicsuperintelligence

    為 LLM 優化推理代理

    4,260+3近 7 天星數變化
  • GenerativeAIExamples@NVIDIA

    為加速基礎設施與微服務架構優化的生成式 AI 參考工作流程

    4,169+4近 7 天星數變化
  • lorax@predibase

    可擴展至數千個微調LLM的Multi-LoRA推理伺服器

    3,827+1近 7 天星數變化
  • AI-Engineer-Headquarters@hemansnation

    一套科學方法、流程、演算法與系統,用於構建故事與模型

    3,676+2近 7 天星數變化
  • spiceai@spiceai

    為您的運營資料庫添加即時分析節點。Spice 是一個可攜帶、加速的 SQL 查詢、搜尋與 LLM 推理引擎,使用 Rust 開發,適用於資料驅動的 AI 應用與代理。

    3,075+1近 7 天星數變化
← 返回主題列表