跳到主要内容
buildradar
登录
主题 · llm-inference

llm-inference

标记 llm-inference 主题、收录中的开源项目,按星标数排序。

共 84 个项目
  • llama3.java@mukel

    以纯 Java 实现的 Llama 3+ 推理

    816+0近 7 天星标变化
  • lws@kubernetes-sigs

    LeaderWorkerSet:用于将一组 Pod 作为复制单元部署的 API

    811+5近 7 天星标变化
  • LLM-PowerHouse:透过精选教学、最佳实践以及可用于自定义训练与推理的即用代码,释放 LLM 的潜力。

    731+0近 7 天星标变化
  • zero-to-sglang@datawhalechina

    Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。

    728近 7 天星标变化
  • llmflows@stoyan-stoyanov

    LLMFlows - 简单、明确且透明的 LLM 应用程序

    707+0近 7 天星标变化
  • long-context-attention@feifeibear

    USP:用于长文本 Transformers 模型训练与推理的统一(亦称混合、2D)序列并行注意力机制

    692+2近 7 天星标变化
  • pegainfer@pegainfer-project

    纯 Rust + CUDA LLM 推理引擎 — 无需 PyTorch,兼容 OpenAI,支持 Qwen3 至 Kimi-K2 服务

    682+11近 7 天星标变化
  • atlas@Avarok-Cybersecurity

    纯 Rust 推理引擎

    678+3近 7 天星标变化
  • mlx-dspark@ARahim3

    在 Apple Silicon 上实现高达 4 倍更快的 LLM 解码,无损。原生 MLX 移植 DeepSeek 的 DSpark 与 z-lab 的 DFlash 推测解码 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三进制 Bonsai-27B。

    651+17近 7 天星标变化
  • hipfire@warpfront

    使用 Rust 编写的 RDNA 原生 LLM 推理引擎

    620+23近 7 天星标变化
  • rkllama@NotPunchnox

    Rockchip NPU 的 Ollama 替代方案:在 Rockchip 设备上运行 AI 与深度学习模型的高效解决方案(rkllm),并提供优化的 NPU 支持

    602+6近 7 天星标变化
  • qvac@tetherto

    开源本地 AI SDK - 在设备端运行 AI,无需云端、无需 API 密钥。支持 GGUF、RAG、图像、音乐与视频生成、语音转文字、P2P 推理等。跨平台:Linux、macOS、Windows、Android、iOS。

    598+17近 7 天星标变化
  • yalm@andrewkchan

    又一个语言模型:使用 C++/CUDA 实现的 LLM 推理,除 I/O 外不依赖任何库

    597+1近 7 天星标变化
  • MiniSearch@felladrin

    极简主义网页搜索平台,内置可直接在浏览器中执行的 AI 助理。演示:https://felladrin-minisearch.hf.space

    585-1近 7 天星标变化
  • uzi@devflowinc

    用于通过 git worktrees 并行执行大量代码代理的 CLI 工具

    582+0近 7 天星标变化
  • LLM-Hub@timmyy123

    本地 AI 助理。

    581+6近 7 天星标变化
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    LLM (大型语言模型) 微调

    578+0近 7 天星标变化
  • KuiperLLama@zjhellofss

    校招、秋招、春招与实习项目,带您从零实现支持 LLama2/3 与 Qwen2.5 的大模型推理框架。

    574+0近 7 天星标变化
  • qwen600@yassa9

    静态 suckless 单批次仅限 CUDA 的 qwen3-0.6B 小型推理引擎。

    560+1近 7 天星标变化
  • sarathi-serve@microsoft

    用于 LLM 的低延迟与高吞吐量服务引擎

    522+1近 7 天星标变化
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    522+14近 7 天星标变化
  • krasis@brontoguana

    Krasis 是一款混合型 LLM 运行时,专注于在消费级 VRAM 受限的硬件上高效执行大型模型。

    519+3近 7 天星标变化
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    508+4近 7 天星标变化
  • vllm-cli@Chen-zexi

    使用 vLLM 部署 LLM 的命令行界面工具

    505-1近 7 天星标变化
← 返回主题列表