跳到主要内容
buildradar
Sign in
主题 · inference-engine

inference-engine

标记 inference-engine 主题、收录中的开源项目,按星标数排序。

项目数
24
总星标数
49,667
平均星标数
2,069
占比
0.00%

常跟 inference-engine 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 inference-engine 主题的项目。

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU

    7,183
  • mlx-dspark@ARahim3

    在 Apple Silicon 上实现高达 4 倍更快的 LLM 解码,无损。原生 MLX 移植 DeepSeek 的 DSpark 与 z-lab 的 DFlash 推测解码 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三进制 Bonsai-27B。

    640
  • zero-to-sglang@datawhalechina

    面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用

    377
  • ✍🏻 源代码深度解析、系统设计与工程博客 | Halfrost-Field 冰霜之地:源码解析、系统设计与工程实践笔记

    13,226+6近 7 天星标变化
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU

    7,183+442近 7 天星标变化
  • FedML@FedML-AI

    FEDML - 用于大规模分布式训练、模型部署与联邦学习的统一且具扩展性的机器学习库。跨云调度器 FEDML Launch 进一步支持在任何 GPU 云或本地集群上运行任何 AI 任务。基于此库构建的 TensorOpera AI (https://TensorOpera.ai) 是您的大规模生成式 AI 平台。

    4,062+1近 7 天星标变化
  • KuiperInfer@zjhellofss

    校招、秋招、春招、实习好项目!带你从零实现一个高性能的深度学习推理库,支持大模型 llama2、Unet、Yolov5、Resnet 等模型的推理。一步步实现高性能深度学习推理库。

    3,499+2近 7 天星标变化
  • grule-rule-engine@hyperjumptech

    使用 Golang 实现的规则引擎

    2,524+2近 7 天星标变化
  • onediff@siliconflow

    OneDiff:一个用于扩散模型的开箱即用加速库。

    1,964+0近 7 天星标变化
  • MTPLX@youssofal

    在 Apple Silicon 上通过 MLX 实现快 3 倍的速度 | Qwen 3.8 27B | 原生 MTP 推测解码,无需外部草稿模型。

    1,944+173近 7 天星标变化
  • sonar@dphnAI

    大规模 LLM 推理引擎

    1,847+3近 7 天星标变化
  • xllm@xLLM-AI

    针对 LLM、VLM、DiT 与 REC 模型的高性能推理引擎,针对各种 AI 加速器进行了优化。托管于 OpenAtom Foundation。

    1,552+11近 7 天星标变化
  • kvcached@ovg-project

    用于动态 GPU 共享及更高应用的虚拟化弹性 KV 缓存

    1,275+130近 7 天星标变化
  • ai-hub-models@qualcomm

    Qualcomm® AI Hub Models 是我们针对性能(延迟、内存等)优化并可随时部署至 Qualcomm® 设备的最先进机器学习模型集合。

    1,195+1近 7 天星标变化
  • Paddle.js@PaddlePaddle

    Paddle.js 是一个百度 PaddlePaddle 的网页项目,这是一个在浏览器中运行的开源深度学习框架。Paddle.js 可以加载预先训练好的模型,或通过 Paddle.js 提供的模型转换工具将 paddle-hub 的模型进行转换。它可以在任何支持 WebGL/WebGPU/WebAssembly 的浏览器中运行,也可以在百度智能小程序与微信小程序中运行。

    1,104+1近 7 天星标变化
  • nobodywho@nobodywho-ooo

    NobodyWho 是一款推理引擎,让你能在任何设备上高效地在本地运行 LLM。

    1,094+13近 7 天星标变化
  • mlxstudio@jjang-ai

    MLX Studio - JANG_Q 的家 - 图像生成/编辑 + 聊天/代码 一体化 - + OpenClaw (Anthropic API)

    965+4近 7 天星标变化
  • ZhiLight@zhihu

    针对 Llama 及其变体的高度最佳化 LLM 推理加速引擎。

    908+0近 7 天星标变化
  • Savant@insight-platform

    内置完整功能的 Python 电脑视觉与视频分析框架

    853+4近 7 天星标变化
  • pegainfer@pegainfer-project

    纯 Rust + CUDA LLM 推理引擎 — 无需 PyTorch,兼容 OpenAI,支持 Qwen3 至 Kimi-K2 服务

    677+14近 7 天星标变化
  • mlx-dspark@ARahim3

    在 Apple Silicon 上实现高达 4 倍更快的 LLM 解码,无损。原生 MLX 移植 DeepSeek 的 DSpark 与 z-lab 的 DFlash 推测解码 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三进制 Bonsai-27B。

    640+22近 7 天星标变化
  • yalm@andrewkchan

    又一个语言模型:使用 C++/CUDA 实现的 LLM 推理,除 I/O 外不依赖任何库

    596-1近 7 天星标变化
  • astroid@pylint-dev

    适用于 pylint 与其他项目的 Python 源代码通用基础表示法

    582+0近 7 天星标变化
  • KuiperLLama@zjhellofss

    校招、秋招、春招与实习项目,带您从零实现支持 LLama2/3 与 Qwen2.5 的大模型推理框架。

    573+1近 7 天星标变化
  • tessera@zengxiao-he

    从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。

    566+30近 7 天星标变化
  • krasis@brontoguana

    Krasis 是一款混合型 LLM 运行时,专注于在消费级 VRAM 受限的硬件上高效执行大型模型。

    518+2近 7 天星标变化
  • OpenArc@SearchSavior

    Intel 设备的推理引擎。通过 OpenAI 端点提供 LLM、VLM、Whisper、Kokoro-TTS、Embedding 与 Rerank 模型服务。

    516+4近 7 天星标变化
← 返回主题列表