vllm
标记 vllm 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 vllm 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 vllm 主题的项目。
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,218 - #2
为期 10 周、每天 30 分钟的 LLM 推理服务与优化学习蓝图。包含 vLLM、SGLang、量化、推测解码、性能评测。
★ 882 - #3
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 146
- #1★ 20,136+64近 7 天星标变化
- #2
欢迎使用 Llama Cookbook!这是您使用 Llama 的完整指南:从推理、微调、RAG 入门,我们也示范如何使用 Llama 系列模型解决端到端问题,并在各种服务提供商上部署。
★ 18,556-3近 7 天星标变化 - #3
✍🏻 源代码深度解析、系统设计与工程博客 | Halfrost-Field 冰霜之地:源码解析、系统设计与工程实践笔记
★ 13,226+6近 7 天星标变化 - #4
全面开源的 AI 研究与工程技能库,适用于任何 AI 模型。将技能与您的 Claude / Codex / Gemini 代理打包,即可成为具备完整算力的 AI 研究代理。由 Orchestra Research 维护。
★ 12,256+104近 7 天星标变化 - #5★ 11,622+60近 7 天星标变化
- #6
一个易于使用、可扩展且高效能的 Agentic RL 框架,基于 Ray(PPO、DAPO、REINFORCE++、VLM、TIS、vLLM、Ray、Async RL)
★ 9,969+9近 7 天星标变化 - #7★ 9,537+9近 7 天星标变化
- #8★ 7,952+44近 7 天星标变化
- #9★ 6,470+40近 7 天星标变化
- #10★ 5,853+13近 7 天星标变化
- #11★ 5,678+4近 7 天星标变化
- #12★ 5,593+21近 7 天星标变化
- #13
可靠的模型切换,适用于任何本地 OpenAI/Anthropic 兼容服务器 - llama.cpp、vllm 等
★ 5,562+49近 7 天星标变化 - #14
一个可编程的混合模型路由器,用于异质 LLM 推理。
★ 5,506+101近 7 天星标变化 - #15
📚 精选Awesome LLM/VLM推理论文与代码清单:Flash-Attention、Paged-Attention、WINT8/4、Parallelism等。🎉
★ 5,482+3近 7 天星标变化 - #16★ 5,214+7近 7 天星标变化
- #17★ 4,537+8近 7 天星标变化
- #18
AI 代理的级联执行环境,优化成本、延迟、质量与政策决策于代理循环内
★ 3,970-9近 7 天星标变化 - #19
基于 PaddlePaddle 的高效 LLM 与 VLM 推理与部署工具包
★ 3,714+3近 7 天星标变化 - #20★ 3,031+6近 7 天星标变化
- #21
社区维护的 vLLM on Ascend 硬件插件
★ 2,749+19近 7 天星标变化 - #22
VLLM、Sglang、llama.cpp、exllamav3 的控制面板
★ 1,749+7近 7 天星标变化 - #23
开源持续推理基准研究平台 — Kimi K3 2.8T、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & 即将推出™ TPUv6e/v7/Trainium2/3
★ 1,613+33近 7 天星标变化 - #24
用于高精度低比特 LLM 推理的 SOTA 量化算法,针对 CPU/XPU/CUDA 进行无缝优化,支持多种数据类型,并与 vLLM、SGLang 和 Transformers 完全兼容。
★ 1,599+8近 7 天星标变化 - #25
针对 Apple Silicon 的高性能 OpenAI 与 Anthropic 兼容 LLM 推理服务器。原生支持 MLX、连续批处理、多模态模型、MCP 工具调用以及 Claude Code。
★ 1,557+6近 7 天星标变化 - #26★ 1,275+130近 7 天星标变化
- #27★ 1,256+2近 7 天星标变化
- #28
支持硬件加速的 LLM 模型量化(压缩)工具包,可通过 HF、vLLM 及 SGLang 为 Nvidia、AMD、Intel GPU 以及 Intel/AMD/Apple CPU 提供加速支持。
★ 1,248+0近 7 天星标变化 - #29
🔒 企业级 API 网关,可帮助您监视并强制执行每个 API 密钥的成本或速率限制。针对每个用户、应用程序或环境提供精细的访问控制与监视。支持 OpenAI、Azure OpenAI、Anthropic、vLLM 以及开源 LLM。
★ 1,228-1近 7 天星标变化 - #30
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,218+334近 7 天星标变化