跳到主要内容
buildradar
Sign in
主题 · vllm

vllm

标记 vllm 主题、收录中的开源项目,按星标数排序。

项目数
52
总星标数
195,358
平均星标数
3,757
占比
0.01%

常跟 vllm 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 vllm 主题的项目。

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,218
  • 为期 10 周、每天 30 分钟的 LLM 推理服务与优化学习蓝图。包含 vLLM、SGLang、量化、推测解码、性能评测。

    882
  • kaggle-tpu-lab@ARahim3

    Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.

    146
  • FunASR@modelscope

    开源语音识别工具包,支持训练、推理、流式 ASR、VAD、标点、说话人分离流水线,并提供兼容 OpenAI / MCP 的服务接口

    20,136+64近 7 天星标变化
  • llama-cookbook@meta-llama

    欢迎使用 Llama Cookbook!这是您使用 Llama 的完整指南:从推理、微调、RAG 入门,我们也示范如何使用 Llama 系列模型解决端到端问题,并在各种服务提供商上部署。

    18,556-3近 7 天星标变化
  • ✍🏻 源代码深度解析、系统设计与工程博客 | Halfrost-Field 冰霜之地:源码解析、系统设计与工程实践笔记

    13,226+6近 7 天星标变化
  • AI-Research-SKILLs@Orchestra-Research

    全面开源的 AI 研究与工程技能库,适用于任何 AI 模型。将技能与您的 Claude / Codex / Gemini 代理打包,即可成为具备完整算力的 AI 研究代理。由 Orchestra Research 维护。

    12,256+104近 7 天星标变化
  • LMCache@LMCache

    LMCache:以最快的 KV 缓存层为 LLM 提供加速

    11,622+60近 7 天星标变化
  • OpenRLHF@OpenRLHF

    一个易于使用、可扩展且高效能的 Agentic RL 框架,基于 Ray(PPO、DAPO、REINFORCE++、VLM、TIS、vLLM、Ray、Async RL)

    9,969+9近 7 天星标变化
  • inference@xorbitsai

    只需更改一行代码,即可将 GPT 替换为任意 LLM。Xinference 让你在云端、本地或笔记本上运行开源、语音和多模态模型,统一的生产级推理 API

    9,537+9近 7 天星标变化
  • dynamo@ai-dynamo

    数据中心规模的分布式推理服务框架

    7,952+44近 7 天星标变化
  • Mooncake@kvcache-ai

    Mooncake 是 Moonshot AI 提供的领先 LLM 服务 Kimi 的服务平台

    6,470+40近 7 天星标变化
  • kserve@kserve

    标准化的分布式生成式与预测式 AI 推理平台,支持在 Kubernetes 上进行多框架可扩展部署

    5,853+13近 7 天星标变化
  • UltraRAG@OpenBMB

    低代码 MCP 框架,用于构建复杂且创新的 RAG 流水线

    5,678+4近 7 天星标变化
  • gpustack@gpustack

    一个 GPU 集群管理器,用于高效能 AI 模型服务(vLLM、SGLang)以及按需可 SSH 访问的 GPU 实例。

    5,593+21近 7 天星标变化
  • llama-swap@mostlygeek

    可靠的模型切换,适用于任何本地 OpenAI/Anthropic 兼容服务器 - llama.cpp、vllm 等

    5,562+49近 7 天星标变化
  • semantic-router@vllm-project

    一个可编程的混合模型路由器,用于异质 LLM 推理。

    5,506+101近 7 天星标变化
  • Awesome-LLM-Inference@xlite-dev

    📚 精选Awesome LLM/VLM推理论文与代码清单:Flash-Attention、Paged-Attention、WINT8/4、Parallelism等。🎉

    5,482+3近 7 天星标变化
  • sparrow@katanaml

    使用 ML、LLM 和 Vision LLM 的结构化数据提取、指令调用和代理工作流

    5,214+7近 7 天星标变化
  • tiny-llm@skyzh

    在 Apple Silicon 上学习 LLM 推理系统,为系统工程师打造小型 vLLM + Qwen

    4,537+8近 7 天星标变化
  • cascadeflow@lemony-ai

    AI 代理的级联执行环境,优化成本、延迟、质量与政策决策于代理循环内

    3,970-9近 7 天星标变化
  • FastDeploy@PaddlePaddle

    基于 PaddlePaddle 的高效 LLM 与 VLM 推理与部署工具包

    3,714+3近 7 天星标变化
  • ramalama@containers

    RamaLama 是一款开源开发者工具,通过大家熟悉的容器语言,简化了从任何来源在本地提供 AI 模型的流程,并促进其在生产环境中的推理应用。

    3,031+6近 7 天星标变化
  • vllm-ascend@vllm-project

    社区维护的 vLLM on Ascend 硬件插件

    2,749+19近 7 天星标变化
  • local-studio@sybil-solutions

    VLLM、Sglang、llama.cpp、exllamav3 的控制面板

    1,749+7近 7 天星标变化
  • InferenceX@SemiAnalysisAI

    开源持续推理基准研究平台 — Kimi K3 2.8T、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & 即将推出™ TPUv6e/v7/Trainium2/3

    1,613+33近 7 天星标变化
  • auto-round@intel

    用于高精度低比特 LLM 推理的 SOTA 量化算法,针对 CPU/XPU/CUDA 进行无缝优化,支持多种数据类型,并与 vLLM、SGLang 和 Transformers 完全兼容。

    1,599+8近 7 天星标变化
  • vllm-mlx@waybarrios

    针对 Apple Silicon 的高性能 OpenAI 与 Anthropic 兼容 LLM 推理服务器。原生支持 MLX、连续批处理、多模态模型、MCP 工具调用以及 Claude Code。

    1,557+6近 7 天星标变化
  • kvcached@ovg-project

    用于动态 GPU 共享及更高应用的虚拟化弹性 KV 缓存

    1,275+130近 7 天星标变化
  • kubeai@kubeai-project

    适用于 Kubernetes 的 AI 推理运算符。在生产环境中提供 ML 模型服务的最简单方式,支持 VLM、LLM、嵌入与语音转文字。

    1,256+2近 7 天星标变化
  • GPTQModel@ModelCloud

    支持硬件加速的 LLM 模型量化(压缩)工具包,可通过 HF、vLLM 及 SGLang 为 Nvidia、AMD、Intel GPU 以及 Intel/AMD/Apple CPU 提供加速支持。

    1,248+0近 7 天星标变化
  • BricksLLM@bricks-cloud

    🔒 企业级 API 网关,可帮助您监视并强制执行每个 API 密钥的成本或速率限制。针对每个用户、应用程序或环境提供精细的访问控制与监视。支持 OpenAI、Azure OpenAI、Anthropic、vLLM 以及开源 LLM。

    1,228-1近 7 天星标变化
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,218+334近 7 天星标变化
← 返回主题列表