vllm
標記 vllm 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 vllm 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 vllm 主題的專案。
- #1★ 921
- #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
為期 10 週、每天 30 分鐘的 LLM 推論服務與最佳化學習藍圖。包含 vLLM、SGLang、量化、推測解碼、效能評測。
★ 808
- #1★ 20,072+108近 7 天星數變化
- #2
歡迎使用 Llama Cookbook!這是您使用 Llama 的完整指南:從推論、微調、RAG 入門,我們也示範如何使用 Llama 系列模型解決端到端問題,並在各種服務提供商上部署。
★ 18,559-2近 7 天星數變化 - #3
✍🏻 原始碼深度解析、系統設計與工程部落格 | Halfrost-Field 冰霜之地:源码解析、系统设计与工程实践笔记
★ 13,220+3近 7 天星數變化 - #4
全面開源的 AI 研究與工程技能庫,適用於任何 AI 模型。將技能與你的 Claude / Codex / Gemini 代理打包,即可成為具備完整算力的 AI 研究代理。由 Orchestra Research 維護。
★ 12,152+222近 7 天星數變化 - #5★ 11,562+256近 7 天星數變化
- #6
一個易於使用、可擴展且高效能的 Agentic RL 框架,基於 Ray(PPO、DAPO、REINFORCE++、VLM、TIS、vLLM、Ray、Async RL)
★ 9,960+19近 7 天星數變化 - #7
只需更改一行程式碼,即可將 GPT 替換為任意 LLM。Xinference 讓你在雲端、本地或筆記型電腦上運行開源、語音與多模態模型,統一的生產級推論 API
★ 9,528+21近 7 天星數變化 - #8★ 7,908+86近 7 天星數變化
- #9★ 6,430+90近 7 天星數變化
- #10★ 5,840+25近 7 天星數變化
- #11★ 5,674+6近 7 天星數變化
- #12★ 5,572+37近 7 天星數變化
- #13
可靠的模型切換,適用於任何本地 OpenAI/Anthropic 兼容伺服器 - llama.cpp、vllm 等
★ 5,513+77近 7 天星數變化 - #14
📚 精選Awesome LLM/VLM推理論文與程式碼清單:Flash-Attention、Paged-Attention、WINT8/4、Parallelism等。🎉
★ 5,479+8近 7 天星數變化 - #15
一個可編程的混合模型路由器,用於異質 LLM 推理。
★ 5,405+190近 7 天星數變化 - #16★ 5,207+9近 7 天星數變化
- #17★ 4,529+17近 7 天星數變化
- #18
AI 代理的級聯執行環境,優化成本、延遲、品質與政策決策於代理迴圈內
★ 3,979-12近 7 天星數變化 - #19
基於 PaddlePaddle 的高效 LLM 與 VLM 推理與部署工具包
★ 3,711+2近 7 天星數變化 - #20★ 3,025+17近 7 天星數變化
- #21
社群維護的 vLLM on Ascend 硬體外掛程式
★ 2,730+53近 7 天星數變化 - #22
VLLM、Sglang、llama.cpp、exllamav3 的控制面板
★ 1,745+10近 7 天星數變化 - #23
用於高精度低位元 LLM 推論的 SOTA 量化演算法,針對 CPU/XPU/CUDA 進行無縫最佳化,支援多種資料型態,並與 vLLM、SGLang 和 Transformers 完全相容。
★ 1,594+15近 7 天星數變化 - #24
開源持續推論基準研究平台 — Kimi K3 2.8T、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & 即將推出™ TPUv6e/v7/Trainium2/3
★ 1,585+159近 7 天星數變化 - #25
針對 Apple Silicon 的高效能 OpenAI 與 Anthropic 相容 LLM 推論伺服器。原生支援 MLX、連續批次處理、多模態模型、MCP 工具呼叫以及 Claude Code。
★ 1,552+17近 7 天星數變化 - #26★ 1,254+6近 7 天星數變化
- #27
支援硬體加速的 LLM 模型量化(壓縮)工具包,可透過 HF、vLLM 及 SGLang 為 Nvidia、AMD、Intel GPU 以及 Intel/AMD/Apple CPU 提供加速支援。
★ 1,248+12近 7 天星數變化 - #28
🔒 企業級 API 閘道器,可協助您監視並強制執行每個 API 金鑰的成本或速率限制。針對每個使用者、應用程式或環境提供精細的存取控制與監視。支援 OpenAI、Azure OpenAI、Anthropic、vLLM 以及開源 LLM。
★ 1,229+4近 7 天星數變化 - #29★ 1,145+5近 7 天星數變化
- #30
使用 Prometheus 與 GPT4 評估你的 LLM 回應 💯
★ 1,107+0近 7 天星數變化