跳到主要内容
buildradar
登录
主题 · llm-inference

llm-inference

标记 llm-inference 主题、收录中的开源项目,按星标数排序。

项目数
84
总星标数
408,416
平均星标数
4,862
占比
0.02%

常跟 llm-inference 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 llm-inference 主题的项目。

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU

    7,435
  • turbo-fieldfare@drumih

    Gemma 4 26B-A4B 推理在任何 M 系列 MacBook 上约 2 GB RAM

    6,688
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,251
  • 为期 10 周、每天 30 分钟的 LLM 推理服务与优化学习蓝图。包含 vLLM、SGLang、量化、推测解码、性能评测。

    887
  • zero-to-sglang@datawhalechina

    Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。

    647
  • gpt4all@nomic-ai

    GPT4All:在任何设备上本地运行 LLM。开源且可商业使用

    77,387+0近 7 天星标变化
  • ray@ray-project

    Ray 是一个 AI 计算引擎,包含核心分布式运行时和加速机器学习工作负载的 AI 库套件

    43,688+0近 7 天星标变化
  • gitleaks@gitleaks

    使用 Gitleaks 查找机密信息 🔑

    29,078+0近 7 天星标变化
  • llm-action@liguodongiot

    本项目旨在分享大模型相关技术原理以及实战经验(大模型工程化、大模型应用落地)

    24,995+0近 7 天星标变化
  • litgpt@Lightning-AI

    20+ 高效 LLM,附预训练、微调与大规模部署示例

    13,645+0近 7 天星标变化
  • OpenLLM@bentoml

    在云端将任何开源 LLM(如 DeepSeek、Llama)作为兼容 OpenAI 的 API 端点运行。

    12,524+0近 7 天星标变化
  • openvino@openvinotoolkit

    OpenVINO™:用于优化与部署 AI 推理的开源工具套件

    10,793+0近 7 天星标变化
  • PowerInfer@Tiiny-AI

    高速大型语言模型本地部署服务

    9,765+0近 7 天星标变化
  • BentoML@bentoml

    最简便的 AI 应用与模型服务方式 ─ 构建模型推理 API、作业队列、LLM 应用、多模型流水线等

    8,817+0近 7 天星标变化
  • lmdeploy@InternLM

    LMDeploy 是一套用于压缩、部署与服务 LLM 的工具套件。

    8,041+0近 7 天星标变化
  • dynamo@ai-dynamo

    数据中心规模的分布式推理服务框架

    7,952+0近 7 天星标变化
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU

    7,435+300近 7 天星标变化
  • openevolve@algorithmicsuperintelligence

    AlphaEvolve 的开源实现

    7,307+0近 7 天星标变化
  • plano@katanemo

    Plano 是一个 AI 原生代理服务器与数据平面,为代理应用提供智能 LLM 路由、可观测性、代理编排与安全防护,让你专注于核心逻辑

    7,033+0近 7 天星标变化
  • turbo-fieldfare@drumih

    Gemma 4 26B-A4B 推理在任何 M 系列 MacBook 上约 2 GB RAM

    6,688+101近 7 天星标变化
  • flashinfer@flashinfer-ai

    FlashInfer:大型语言模型服务的内核库

    6,321+0近 7 天星标变化
  • cactus@cactus-compute

    量化、核心、运行时与推理引擎,适用于移动设备、可穿戴设备、智能家居和机器人。

    5,975+0近 7 天星标变化
  • kserve@kserve

    标准化的分布式生成式与预测式 AI 推理平台,支持在 Kubernetes 上进行多框架可扩展部署

    5,853+0近 7 天星标变化
  • shimmy@Michael-A-Kuykendall

    ⚡ 纯 Rust WebGPU 推理引擎 — OpenAI-API 兼容,GGUF 原生,支持任何 GPU。无 Python,無 llama.cpp,单一二进位文件。

    5,816+0近 7 天星标变化
  • gpustack@gpustack

    一个 GPU 集群管理器,用于高效能 AI 模型服务(vLLM、SGLang)以及按需可 SSH 访问的 GPU 实例。

    5,593+0近 7 天星标变化
  • lemonade@lemonade-sdk

    Lemonade 帮助用户发现并运行本地 AI 应用,直接在自己的 GPU 和 NPU 上提供优化 LLM,加入我们的 Discord:https://discord.gg/5xXzkMu8Zk

    5,585+0近 7 天星标变化
  • Awesome-LLM-Inference@xlite-dev

    📚 精选Awesome LLM/VLM推理论文与代码清单:Flash-Attention、Paged-Attention、WINT8/4、Parallelism等。🎉

    5,482+0近 7 天星标变化
  • superduper@superduper-io

    Superduper:端到端框架,用于构建自定义 AI 应用与代理

    5,318+0近 7 天星标变化
  • eko@FellouAI

    Eko (Eko Keeps Operating) - 用自然语言构建可生产使用的代理工作流 - eko.fellou.ai

    4,954+0近 7 天星标变化
  • RuVector@ruvnet

    RuVector 是一个高性能、实时、自学 AI 向量 GNN,内建 Rust 记忆体数据库

    4,473+0近 7 天星标变化
  • optillm@algorithmicsuperintelligence

    为 LLM 优化推理代理

    4,260+0近 7 天星标变化
  • GenerativeAIExamples@NVIDIA

    为加速基础设施与微服务架构优化的生成式 AI 参考工作流程

    4,169+0近 7 天星标变化
  • lorax@predibase

    可扩展至数千个微调LLM的Multi-LoRA推理服务器

    3,827+0近 7 天星标变化
  • AI-Engineer-Headquarters@hemansnation

    一套科学方法、流程、算法与系统,用于构建故事与模型

    3,676+0近 7 天星标变化
  • spiceai@spiceai

    为您的运营数据库添加实时分析节点。Spice 是一个可携带、加速的 SQL 查询、搜索与 LLM 推理引擎,使用 Rust 开发,适用于数据驱动的 AI 应用与代理。

    3,075+0近 7 天星标变化
← 返回主题列表